MarkTechPost수정일

GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: 어떤 프론티어 모델이 어떤 작업에 적합할까

Astra는 컴퓨터 사용 분야에서 선두를 차지하고, Argon은 법률 및 금융 업무에서 선두이며, Sol은 코딩 에이전트의 가격에서 승리합니다. GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: Which Frontier Model Fits Which Job 글은 MarkTechPost 에서 처음 게시되었습니다.

Anthropic, OpenAI와 Google DeepMind가 30일 안에 4개의 프런티어급 모델을 출시했습니다. Claude Fable 5.1 9월 1일에 도착했습니다. GPT-6 Astra 9월 3일에 이어졌다. GPT-6.1 Sol 그리고 Gemini 4 Argon 9월 마지막 며칠에 도착했습니다.

우리는 각 출시를 개별적으로 다뤘습니다. 이 글은 이를 나란히 비교합니다. 벤치마크 점수는 출시 발표가 시사하는 것보다 더 많이 겹칩니다. 반면 가격, 접근 규칙, 작업당 비용은 그렇지 않습니다.

한 가지 변화가 라인업을 규정합니다. OpenAI 취소된 GPT-6.1 Astra 내부 범위 및 인가 테스트에 실패한 후 9월 28일에 보류되었다. GPT-6 Astra는 당분간 OpenAI의 최상위 모델로 남아 있다.

사양, 가격 및 접근성

Astra와 Fable 5.1은 동일한 입력 10달러, 출력 50달러의 정가를 공유합니다. Sol과 Argon은 그 5분의 1 수준의 가격으로 책정되어 있습니다. Argon의 가격은 도입 가격이며 나중에 두 배가 됩니다.

기능GPT-6 AstraGPT-6.1 SolGemini 4 ArgonClaude Fable 5.1
개발자OpenAIOpenAI구글 딥마인드(Google DeepMind)Anthropic
출시됨2026년 9월 3일2026년 9월 29일2026년 9월 30일 발표2026년 9월 1일
접근성OpenAI API, ChatGPT, CodexOpenAI API, ChatGPT Work, CodexFairwind 프로그램 전용Claude API, Bedrock, Google Cloud, Microsoft Foundry
입력 / 출력 (1M당)$10 / $50$2 / $10초기 도입가 $2 / $10, 이후 $4 / $20$10 / $50
캐시된 입력 (1M당)$1.00$0.10초기 도입가 $0.10$0.25
롱 프롬프트 요금272K 초과: $20 / $75272K 초과: 입력 2배, 출력 1.5배공개되지 않음1M까지 균일 요금
컨텍스트 윈도우1.05M1.05M공개되지 않음1M
응답당 최대 출력128K128K1M128K
추론 제어낮음부터 최대까지 5단계 effort낮음부터 최대까지 5단계 effort공개되지 않음낮음, 중간, 높음 등을 포함하는 effort 단계
오픈 웨이트아니요아니요아니요아니요

출처: OpenAI GPT-6.1 Sol 관련 보도, Gemini 4 Argon 관련 보도, GPT-6 Astra 롱 컨텍스트 요금 관련 보도, Claude Fable 5.1 사양. 표준 1차 판매사 정가, 짧은 컨텍스트 등급 기준.

캐시 입력 항목이 에이전트에 가장 중요합니다. 에이전트는 매 단계마다 시스템 프롬프트, 도구 스키마 및 기록을 다시 전송합니다. Astra의 $1.00 캐시 읽기 요금은 Fable 5.1의 4배, Sol의 10배입니다.

Argon의 1M 출력 상한은 구조적으로 유일한 예외입니다. 나머지 3개 모델은 응답당 128K 토큰에서 제한됩니다.

벤치마크: 각 모델이 선두를 차지하는 분야

모든 분야를 석권하는 모델은 없습니다. Argon은 지식 노동과 장기 코딩 항목에서 선두입니다. Astra는 프론티어 소프트웨어 엔지니어링과 컴퓨터 사용에서 선두입니다. 이 라인업에는 없는 Opus 5.5가 Terminal-Bench 4.0에서 선두입니다.

벤치마크테스트 항목Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1
DeepSWE v1.1장기(long-horizon) 소프트웨어 엔지니어링77.9%74.1%67.4%
Vals Index금융, 코딩, 법률 및 세무 업무68.9%63.1%65.8%
FrontierSWE v2프론티어 소프트웨어 엔지니어링55.0%65.5%56.3%
Terminal-Bench 4.0터미널에서의 에이전트 작업57.4%58.2%57.9%
CWE-bench v1취약점 해결68% (동률)68% (동률)58%
OSWorld-2.0컴퓨터 사용69.2%72.6%Google의 표에 없음

출처: Google DeepMind가 공개한 비교, 당사의 보도 내용에 따르면 Gemini 4 Argon 관련 기사. 벤더가 보고한 수치임.

GPT-6.1 Sol은 Google의 표에 없습니다. OpenAI 자체 수치는 이 모델을 Astra에 근접한 것으로 보여줍니다:

  • DeepSWE v1.1: Sol은 Astra와 대등한 성능을 약 5분의 1의 비용으로 달성합니다.
  • OSWorld 2.0 오프라인 세트: Sol은 태스크당 약 7분의 1의 비용으로 Astra와 2.1점 이내의 차이를 보입니다.
  • AutomationBench 1.0.6: Sol은 medium effort 설정에서 Claude Opus 5.5보다 2.2점 높은 점수를 기록했습니다.
  • Terminal-Bench Science 0.1: Astra는 여전히 68.1%로 선두입니다. OpenAI는 가장 어려운 연구에 대해 Astra를 추천합니다.

독립적인 신호들은 순수 지능에 대해서는 정반대를 가리킵니다. 다음은 Artificial Analysis Intelligence Index에서 Astra는 61점을 기록합니다. Fable 5.1은 5점 더 높습니다. 코딩 에이전트 지수에서는 Claude Code의 Fable 5.1이 Astra의 67점에 맞서 70점을 기록합니다. Artificial Analysis는 또한 Argon이 Intelligence Index에서 Astra와 동급이라고 보고합니다.

ARC-AGI-2에서는 Astra가 95%, Fable 5.1이 90%를 기록합니다.

작업당 비용: 동일한 정가, 다른 청구액

Artificial Analysis는 Claude Fable 5.1을 작업당 $9.18로, GPT-6 Astra는 $4.72로 평가합니다. 이는 동일한 정가 기준 약 1.9배입니다.

격차는 요금이 아닌 토큰 사용량에서 비롯됩니다. 작업당 비용은 가격에 사용된 토큰 수를 곱한 것입니다. 요금이 같다면 이 격차는 해당 실행에서 Fable 5.1이 작업당 더 많은 토큰을 사용했음을 의미합니다. Anthropic은 또한 자사의 새 토크나이저가 동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성한다고 언급합니다.

두 저렴한 모델은 상황을 더욱 바꿉니다:

  • Gemini 4 Argon: Artificial Analysis는 도입 가격 기준으로 Argon이 Astra의 작업당 비용의 60%로 Astra와 Intelligence Index에서 동급이라고 보고합니다.
  • GPT-6.1 Sol: Terminal-Bench Science에서 OpenAI는 Sol을 작업당 $5.47로, Astra를 $23.80으로 보고합니다.

캐싱은 에이전트의 순위를 뒤집을 수 있습니다. 위의 작업별 수치는 대규모 캐시 재사용을 반영하지 않습니다. 장시간 실행되는 에이전트는 매 단계마다 동일한 컨텍스트를 다시 읽습니다. 200K 토큰 캐시 컨텍스트에 대한 산술 계산입니다(출력 토큰 제외):

모델캐시된 요금(1M당)단계당100단계당
GPT-6 Astra$1.00$0.20$20.00
Claude Fable 5.1$0.25$0.05$5.00
GPT-6.1 Sol$0.10$0.02$2.00
Gemini 4 Argon (출시가)$0.10$0.02$2.00

목록 캐시 요금 기반의 예시 계산입니다. Astra의 200K 컨텍스트는 272K 긴 프롬프트 임계값 이하에 머뭅니다.

캐시 의존도가 높은 루프에서는 Fable 5.1이 Astra 요금의 4분의 1 수준으로 컨텍스트를 읽습니다. 작업별 헤드라인만 보고 선택하기 전에 자체 트레이스에서 두 모델을 모두 측정하세요.

어떤 작업에 어떤 모델인가

리더보드 순위가 아니라 워크로드를 기준으로 선택하세요. GPT-6.1 Sol은 대부분의 팀에게 기본 선택입니다. 나머지 3개 모델은 더 좁은 작업에서 그 가격 값을 합니다.

작업선택이유차선책
대량 코딩 에이전트, CI 봇, PR 리뷰GPT-6.1 Sol$2 / $10 및 $0.10 캐시 요금으로 DeepSWE v1.1에서 Astra와 동급공개되면 Gemini 4 Argon
가장 어려운 개방형 엔지니어링GPT-6 AstraFrontierSWE v2에서 65.5%로 선두Claude Fable 5.1
컴퓨터 사용 및 브라우저 에이전트GPT-6 AstraOSWorld-2.0에서 72.6%로 선두GPT-6.1 Sol, 2.1포인트 차이
하네스 안에서의 긴 코딩 세션Claude Fable 5.1Claude Code에서 Artificial Analysis 코딩 에이전트 최고 점수(70) 기록; 캐시 읽기 $0.25GPT-6 Astra (67)
하드 사이언스 및 연구GPT-6 Astra68.1%로 Terminal-Bench Science 선두작업당 $5.47의 GPT-6.1 Sol
법률, 금융 및 비즈니스 자동화Gemini 4 ArgonVals Index(68.9%), AutomationBench(51.3%), Harvey Legal(19.6%) 선두GPT-6.1 Sol; Claude Fable 5.1
매우 긴 단일 출력: 대규모 리팩토링, 전체 보고서Gemini 4 Argon응답당 1M 출력 토큰을 제공하는 유일한 모델나머지 3개 중 아무 모델이나, 여러 턴에 걸쳐 분할
취약점 발견 및 패칭Gemini 4 Argon 또는 GPT-6 AstraCWE-bench v1에서 68%로 동률Claude Fable 5.1 (58%)
프론티어 품질에서 가장 낮은 예산GPT-6.1 Sol가장 낮은 공개 가격; Argon은 Fairwind 내부에서만 이에 대응Gemini 4 Argon

접근성이 이 표의 2개 행을 결정합니다. Argon은 현재 Fairwind 사이버 방어자에게만 제공됩니다. Astra의 전체 공격 보안 기능은 OpenAI의 Daybreak 프로그램 뒤에 있으며, 공개 릴리스는 고급 공격 사이버 작업을 거부합니다. Anthropic은 무제한 쌍둥이 모델인 Claude Mythos 5.1을 신뢰 접근 프로그램 뒤에 두고 있습니다.

전환하기 전에 확인할 사항

여기의 대부분 수치는 벤더가 보고한 것이며, 벤더 간에 세부 수치에서 이견이 있습니다. OpenAI는 Astra를 Terminal-Bench 4.0에서 57.9%로 보고합니다. Google의 비교 표는 58.2%로 표기합니다.

  • 세이프가드가 Fable 5.1 점수에 영향: Anthropic은 프로덕션 세이프가드를 켠 상태로 벤치마크를 실행했습니다. 플래그된 사이버 및 생물학 작업은 다른 Claude 모델로 라우팅되며, 이로 인해 OSWorld 및 AutomationBench 결과가 낮아졌을 가능성이 있습니다.
  • Argon의 가격은 임시적입니다: $2 / $10은 도입 가격입니다. 이후 발표된 종료일 없이 $4 / $20으로 조정됩니다.
  • Argon의 컨텍스트 윈도우는 미공개: Google은 1M 출력 상한을 공개했지만 입력 한도는 공개하지 않았습니다.
  • 작업당 비용은 특정 시점의 스냅샷입니다: 9.18달러와 4.72달러 수치는 Artificial Analysis의 9월 초 Astra 실행 결과에서 나온 것입니다. Effort 설정에 따라 이 수치는 크게 달라집니다.
  • Anthropic에는 더 저렴한 선택지가 있습니다: Argon 관련 보도에서는 Claude Opus 5.5가 더 낮은 API 가격으로 주요 에이전틱 벤치마크에서 Fable 5.1을 능가한다는 내용을 인용하고 있습니다. 또한 Terminal-Bench 4.0에서 66.4%로 선두입니다.

핵심 요약

  • GPT-6.1 Sol는 5분의 1 가격으로 DeepSWE v1.1에서 Astra와 동등한 성능을 보입니다.
  • GPT-6 Astra는 FrontierSWE v2(65.5%)와 OSWorld-2.0(72.6%)에서 선두입니다.
  • Gemini 4 Argon은 DeepSWE, Vals Index, AutomationBench에서 선두를 차지하지만, 오직 Fairwind 내부에서만 그렇습니다.
  • Fable 5.1은 작업당 $9.18의 비용이 들며, 동일한 정가 기준으로 Astra는 $4.72입니다.
  • 캐시 집약적 에이전트의 경우, Fable 5.1의 $0.25 캐시 읽기 비용이 Astra의 $1.00보다 4배 저렴합니다.

FAQ

  • 가장 저렴한 것은 무엇인가요? GPT-6.1 Sol은 입력 $2, 출력 $10, 캐시 $0.10의 가격으로 1M 토큰당 책정됩니다. Argon은 오직 도입 가격에서, 그리고 Fairwind 내부에서만 이에 필적합니다.
  • 코딩에는 무엇이 가장 좋나요? 대량 처리에는 Sol, 가장 어려운 작업에는 Astra입니다. Fable 5.1은 Claude Code에서 Artificial Analysis의 코딩 에이전트 지수에서 정상을 차지했습니다.
  • 오늘 Gemini 4 Argon을 사용할 수 있나요? 사이버 방어자를 위한 Google의 Fairwind 프로그램을 통해서만 가능합니다.

이 글 GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: 어떤 프론티어 모델이 어떤 작업에 적합한가 는 최초 발행된 곳은 MarkTechPost.

원문 출처

MarkTechPost

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요