Anthropic, OpenAI와 Google DeepMind가 30일 안에 4개의 프런티어급 모델을 출시했습니다. Claude Fable 5.1 9월 1일에 도착했습니다. GPT-6 Astra 9월 3일에 이어졌다. GPT-6.1 Sol 그리고 Gemini 4 Argon 9월 마지막 며칠에 도착했습니다.
우리는 각 출시를 개별적으로 다뤘습니다. 이 글은 이를 나란히 비교합니다. 벤치마크 점수는 출시 발표가 시사하는 것보다 더 많이 겹칩니다. 반면 가격, 접근 규칙, 작업당 비용은 그렇지 않습니다.
한 가지 변화가 라인업을 규정합니다. OpenAI 취소된 GPT-6.1 Astra 내부 범위 및 인가 테스트에 실패한 후 9월 28일에 보류되었다. GPT-6 Astra는 당분간 OpenAI의 최상위 모델로 남아 있다.
사양, 가격 및 접근성
Astra와 Fable 5.1은 동일한 입력 10달러, 출력 50달러의 정가를 공유합니다. Sol과 Argon은 그 5분의 1 수준의 가격으로 책정되어 있습니다. Argon의 가격은 도입 가격이며 나중에 두 배가 됩니다.
| 기능 | GPT-6 Astra | GPT-6.1 Sol | Gemini 4 Argon | Claude Fable 5.1 |
|---|---|---|---|---|
| 개발자 | OpenAI | OpenAI | 구글 딥마인드(Google DeepMind) | Anthropic |
| 출시됨 | 2026년 9월 3일 | 2026년 9월 29일 | 2026년 9월 30일 발표 | 2026년 9월 1일 |
| 접근성 | OpenAI API, ChatGPT, Codex | OpenAI API, ChatGPT Work, Codex | Fairwind 프로그램 전용 | Claude API, Bedrock, Google Cloud, Microsoft Foundry |
| 입력 / 출력 (1M당) | $10 / $50 | $2 / $10 | 초기 도입가 $2 / $10, 이후 $4 / $20 | $10 / $50 |
| 캐시된 입력 (1M당) | $1.00 | $0.10 | 초기 도입가 $0.10 | $0.25 |
| 롱 프롬프트 요금 | 272K 초과: $20 / $75 | 272K 초과: 입력 2배, 출력 1.5배 | 공개되지 않음 | 1M까지 균일 요금 |
| 컨텍스트 윈도우 | 1.05M | 1.05M | 공개되지 않음 | 1M |
| 응답당 최대 출력 | 128K | 128K | 1M | 128K |
| 추론 제어 | 낮음부터 최대까지 5단계 effort | 낮음부터 최대까지 5단계 effort | 공개되지 않음 | 낮음, 중간, 높음 등을 포함하는 effort 단계 |
| 오픈 웨이트 | 아니요 | 아니요 | 아니요 | 아니요 |
출처: OpenAI GPT-6.1 Sol 관련 보도, Gemini 4 Argon 관련 보도, GPT-6 Astra 롱 컨텍스트 요금 관련 보도, Claude Fable 5.1 사양. 표준 1차 판매사 정가, 짧은 컨텍스트 등급 기준.
캐시 입력 항목이 에이전트에 가장 중요합니다. 에이전트는 매 단계마다 시스템 프롬프트, 도구 스키마 및 기록을 다시 전송합니다. Astra의 $1.00 캐시 읽기 요금은 Fable 5.1의 4배, Sol의 10배입니다.
Argon의 1M 출력 상한은 구조적으로 유일한 예외입니다. 나머지 3개 모델은 응답당 128K 토큰에서 제한됩니다.
벤치마크: 각 모델이 선두를 차지하는 분야
모든 분야를 석권하는 모델은 없습니다. Argon은 지식 노동과 장기 코딩 항목에서 선두입니다. Astra는 프론티어 소프트웨어 엔지니어링과 컴퓨터 사용에서 선두입니다. 이 라인업에는 없는 Opus 5.5가 Terminal-Bench 4.0에서 선두입니다.
| 벤치마크 | 테스트 항목 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|---|
| DeepSWE v1.1 | 장기(long-horizon) 소프트웨어 엔지니어링 | 77.9% | 74.1% | 67.4% |
| Vals Index | 금융, 코딩, 법률 및 세무 업무 | 68.9% | 63.1% | 65.8% |
| FrontierSWE v2 | 프론티어 소프트웨어 엔지니어링 | 55.0% | 65.5% | 56.3% |
| Terminal-Bench 4.0 | 터미널에서의 에이전트 작업 | 57.4% | 58.2% | 57.9% |
| CWE-bench v1 | 취약점 해결 | 68% (동률) | 68% (동률) | 58% |
| OSWorld-2.0 | 컴퓨터 사용 | 69.2% | 72.6% | Google의 표에 없음 |
출처: Google DeepMind가 공개한 비교, 당사의 보도 내용에 따르면 Gemini 4 Argon 관련 기사. 벤더가 보고한 수치임.
GPT-6.1 Sol은 Google의 표에 없습니다. OpenAI 자체 수치는 이 모델을 Astra에 근접한 것으로 보여줍니다:
- DeepSWE v1.1: Sol은 Astra와 대등한 성능을 약 5분의 1의 비용으로 달성합니다.
- OSWorld 2.0 오프라인 세트: Sol은 태스크당 약 7분의 1의 비용으로 Astra와 2.1점 이내의 차이를 보입니다.
- AutomationBench 1.0.6: Sol은 medium effort 설정에서 Claude Opus 5.5보다 2.2점 높은 점수를 기록했습니다.
- Terminal-Bench Science 0.1: Astra는 여전히 68.1%로 선두입니다. OpenAI는 가장 어려운 연구에 대해 Astra를 추천합니다.
독립적인 신호들은 순수 지능에 대해서는 정반대를 가리킵니다. 다음은 Artificial Analysis Intelligence Index에서 Astra는 61점을 기록합니다. Fable 5.1은 5점 더 높습니다. 코딩 에이전트 지수에서는 Claude Code의 Fable 5.1이 Astra의 67점에 맞서 70점을 기록합니다. Artificial Analysis는 또한 Argon이 Intelligence Index에서 Astra와 동급이라고 보고합니다.
ARC-AGI-2에서는 Astra가 95%, Fable 5.1이 90%를 기록합니다.
작업당 비용: 동일한 정가, 다른 청구액
Artificial Analysis는 Claude Fable 5.1을 작업당 $9.18로, GPT-6 Astra는 $4.72로 평가합니다. 이는 동일한 정가 기준 약 1.9배입니다.
격차는 요금이 아닌 토큰 사용량에서 비롯됩니다. 작업당 비용은 가격에 사용된 토큰 수를 곱한 것입니다. 요금이 같다면 이 격차는 해당 실행에서 Fable 5.1이 작업당 더 많은 토큰을 사용했음을 의미합니다. Anthropic은 또한 자사의 새 토크나이저가 동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성한다고 언급합니다.
두 저렴한 모델은 상황을 더욱 바꿉니다:
- Gemini 4 Argon: Artificial Analysis는 도입 가격 기준으로 Argon이 Astra의 작업당 비용의 60%로 Astra와 Intelligence Index에서 동급이라고 보고합니다.
- GPT-6.1 Sol: Terminal-Bench Science에서 OpenAI는 Sol을 작업당 $5.47로, Astra를 $23.80으로 보고합니다.
캐싱은 에이전트의 순위를 뒤집을 수 있습니다. 위의 작업별 수치는 대규모 캐시 재사용을 반영하지 않습니다. 장시간 실행되는 에이전트는 매 단계마다 동일한 컨텍스트를 다시 읽습니다. 200K 토큰 캐시 컨텍스트에 대한 산술 계산입니다(출력 토큰 제외):
| 모델 | 캐시된 요금(1M당) | 단계당 | 100단계당 |
|---|---|---|---|
| GPT-6 Astra | $1.00 | $0.20 | $20.00 |
| Claude Fable 5.1 | $0.25 | $0.05 | $5.00 |
| GPT-6.1 Sol | $0.10 | $0.02 | $2.00 |
| Gemini 4 Argon (출시가) | $0.10 | $0.02 | $2.00 |
목록 캐시 요금 기반의 예시 계산입니다. Astra의 200K 컨텍스트는 272K 긴 프롬프트 임계값 이하에 머뭅니다.
캐시 의존도가 높은 루프에서는 Fable 5.1이 Astra 요금의 4분의 1 수준으로 컨텍스트를 읽습니다. 작업별 헤드라인만 보고 선택하기 전에 자체 트레이스에서 두 모델을 모두 측정하세요.
어떤 작업에 어떤 모델인가
리더보드 순위가 아니라 워크로드를 기준으로 선택하세요. GPT-6.1 Sol은 대부분의 팀에게 기본 선택입니다. 나머지 3개 모델은 더 좁은 작업에서 그 가격 값을 합니다.
| 작업 | 선택 | 이유 | 차선책 |
|---|---|---|---|
| 대량 코딩 에이전트, CI 봇, PR 리뷰 | GPT-6.1 Sol | $2 / $10 및 $0.10 캐시 요금으로 DeepSWE v1.1에서 Astra와 동급 | 공개되면 Gemini 4 Argon |
| 가장 어려운 개방형 엔지니어링 | GPT-6 Astra | FrontierSWE v2에서 65.5%로 선두 | Claude Fable 5.1 |
| 컴퓨터 사용 및 브라우저 에이전트 | GPT-6 Astra | OSWorld-2.0에서 72.6%로 선두 | GPT-6.1 Sol, 2.1포인트 차이 |
| 하네스 안에서의 긴 코딩 세션 | Claude Fable 5.1 | Claude Code에서 Artificial Analysis 코딩 에이전트 최고 점수(70) 기록; 캐시 읽기 $0.25 | GPT-6 Astra (67) |
| 하드 사이언스 및 연구 | GPT-6 Astra | 68.1%로 Terminal-Bench Science 선두 | 작업당 $5.47의 GPT-6.1 Sol |
| 법률, 금융 및 비즈니스 자동화 | Gemini 4 Argon | Vals Index(68.9%), AutomationBench(51.3%), Harvey Legal(19.6%) 선두 | GPT-6.1 Sol; Claude Fable 5.1 |
| 매우 긴 단일 출력: 대규모 리팩토링, 전체 보고서 | Gemini 4 Argon | 응답당 1M 출력 토큰을 제공하는 유일한 모델 | 나머지 3개 중 아무 모델이나, 여러 턴에 걸쳐 분할 |
| 취약점 발견 및 패칭 | Gemini 4 Argon 또는 GPT-6 Astra | CWE-bench v1에서 68%로 동률 | Claude Fable 5.1 (58%) |
| 프론티어 품질에서 가장 낮은 예산 | GPT-6.1 Sol | 가장 낮은 공개 가격; Argon은 Fairwind 내부에서만 이에 대응 | Gemini 4 Argon |
접근성이 이 표의 2개 행을 결정합니다. Argon은 현재 Fairwind 사이버 방어자에게만 제공됩니다. Astra의 전체 공격 보안 기능은 OpenAI의 Daybreak 프로그램 뒤에 있으며, 공개 릴리스는 고급 공격 사이버 작업을 거부합니다. Anthropic은 무제한 쌍둥이 모델인 Claude Mythos 5.1을 신뢰 접근 프로그램 뒤에 두고 있습니다.
전환하기 전에 확인할 사항
여기의 대부분 수치는 벤더가 보고한 것이며, 벤더 간에 세부 수치에서 이견이 있습니다. OpenAI는 Astra를 Terminal-Bench 4.0에서 57.9%로 보고합니다. Google의 비교 표는 58.2%로 표기합니다.
- 세이프가드가 Fable 5.1 점수에 영향: Anthropic은 프로덕션 세이프가드를 켠 상태로 벤치마크를 실행했습니다. 플래그된 사이버 및 생물학 작업은 다른 Claude 모델로 라우팅되며, 이로 인해 OSWorld 및 AutomationBench 결과가 낮아졌을 가능성이 있습니다.
- Argon의 가격은 임시적입니다: $2 / $10은 도입 가격입니다. 이후 발표된 종료일 없이 $4 / $20으로 조정됩니다.
- Argon의 컨텍스트 윈도우는 미공개: Google은 1M 출력 상한을 공개했지만 입력 한도는 공개하지 않았습니다.
- 작업당 비용은 특정 시점의 스냅샷입니다: 9.18달러와 4.72달러 수치는 Artificial Analysis의 9월 초 Astra 실행 결과에서 나온 것입니다. Effort 설정에 따라 이 수치는 크게 달라집니다.
- Anthropic에는 더 저렴한 선택지가 있습니다: Argon 관련 보도에서는 Claude Opus 5.5가 더 낮은 API 가격으로 주요 에이전틱 벤치마크에서 Fable 5.1을 능가한다는 내용을 인용하고 있습니다. 또한 Terminal-Bench 4.0에서 66.4%로 선두입니다.
핵심 요약
- GPT-6.1 Sol는 5분의 1 가격으로 DeepSWE v1.1에서 Astra와 동등한 성능을 보입니다.
- GPT-6 Astra는 FrontierSWE v2(65.5%)와 OSWorld-2.0(72.6%)에서 선두입니다.
- Gemini 4 Argon은 DeepSWE, Vals Index, AutomationBench에서 선두를 차지하지만, 오직 Fairwind 내부에서만 그렇습니다.
- Fable 5.1은 작업당 $9.18의 비용이 들며, 동일한 정가 기준으로 Astra는 $4.72입니다.
- 캐시 집약적 에이전트의 경우, Fable 5.1의 $0.25 캐시 읽기 비용이 Astra의 $1.00보다 4배 저렴합니다.
FAQ
- 가장 저렴한 것은 무엇인가요? GPT-6.1 Sol은 입력 $2, 출력 $10, 캐시 $0.10의 가격으로 1M 토큰당 책정됩니다. Argon은 오직 도입 가격에서, 그리고 Fairwind 내부에서만 이에 필적합니다.
- 코딩에는 무엇이 가장 좋나요? 대량 처리에는 Sol, 가장 어려운 작업에는 Astra입니다. Fable 5.1은 Claude Code에서 Artificial Analysis의 코딩 에이전트 지수에서 정상을 차지했습니다.
- 오늘 Gemini 4 Argon을 사용할 수 있나요? 사이버 방어자를 위한 Google의 Fairwind 프로그램을 통해서만 가능합니다.
이 글 GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: 어떤 프론티어 모델이 어떤 작업에 적합한가 는 최초 발행된 곳은 MarkTechPost.