MarkTechPost

GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: qué modelo frontera encaja en cada trabajo

Astra lidera el uso de ordenadores, Argon lidera el trabajo legal y financiero, y Sol gana en precio para agentes de programación. La entrada GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: qué modelo…

Anthropic, OpenAI y Google DeepMind lanzaron 4 modelos de clase frontera en 30 días. Claude Fable 5.1 llegó el 1 de septiembre. GPT-6 Astra siguió el 3 de septiembre. GPT-6.1 Sol y Gemini 4 Argon aterrizaron en los últimos días de septiembre.

Cubrimos cada lanzamiento por separado. Este artículo los pone lado a lado. Las puntuaciones de los benchmarks se solapan más de lo que sugieren las notas de lanzamiento. Los precios, las reglas de acceso y el costo por tarea no.

Un cambio enmarca la alineación. OpenAI canceló GPT-6.1 Astra el 28 de septiembre tras fallar pruebas internas de alcance y autorización. GPT-6 Astra sigue siendo por ahora el modelo principal de OpenAI.

Especificaciones, precios y acceso

Astra y Fable 5.1 comparten el mismo precio de lista de $10 de entrada y $50 de salida. Sol y Argon se listan a un quinto de eso. El precio de Argon es introductorio y se duplica más adelante.

CaracterísticaGPT-6 AstraGPT-6.1 SolGemini 4 ArgonClaude Fable 5.1
DesarrolladorOpenAIOpenAIGoogle DeepMindAnthropic
Lanzado3 de sep de 202629 de sep de 2026Anunciado el 30 de sep de 20261 de septiembre de 2026
AccesoAPI de OpenAI, ChatGPT, CodexAPI de OpenAI, ChatGPT Work, CodexSolo Programa FairwindAPI de Claude, Bedrock, Google Cloud, Microsoft Foundry
Entrada / salida (por 1M)$10 / $50$2 / $10$2 / $10 introductorio, luego $4 / $20$10 / $50
Entrada en caché (por 1M)$1.00$0.10$0.10 introductorio$0.25
Precios para prompts largosPor encima de 272K: $20 / $75Por encima de 272K: 2x entrada, 1.5x salidaNo divulgadoFijo hasta 1M
Ventana de contexto1.05M1.05MNo divulgado1M
Salida máxima por respuesta128K128K1M128K
Control de razonamiento5 niveles de esfuerzo, de bajo a máximo5 niveles de esfuerzo, de bajo a máximoNo divulgadoNiveles de esfuerzo incl. bajo, medio, alto
Pesos abiertosNoNoNoNo

Fuentes: Cobertura de OpenAI GPT-6.1 Sol, Cobertura de Gemini 4 Argon, Precios de contexto largo de GPT-6 Astra, Especificaciones de Claude Fable 5.1. Precios de lista estándar de primera parte, nivel de contexto corto.

La fila de entrada en caché es la más importante para los agentes. Los agentes reenvían los prompts del sistema, los esquemas de herramientas y el historial en cada paso. La lectura de caché de $1.00 de Astra es 4x la de Fable 5.1 y 10x la de Sol.

El límite de salida de 1M de Argon es la única anomalía estructural. Los otros 3 se detienen en 128K tokens por respuesta.

Benchmarks: dónde lidera cada modelo

Ningún modelo se lleva todo el tablero. Argon lidera las filas de trabajo del conocimiento y de codificación a largo plazo. Astra lidera la ingeniería de software de frontera y el uso de computadoras. Opus 5.5, que no está en esta lista, lidera Terminal-Bench 4.0.

BenchmarkQué evalúaGemini 4 ArgonGPT-6 AstraClaude Fable 5.1
DeepSWE v1.1Ingeniería de software de largo horizonte77.9%74.1%67.4%
Vals IndexTrabajo de finanzas, programación, derecho e impuestos68.9%63.1%65.8%
FrontierSWE v2Ingeniería de software de frontera55.0%65.5%56.3%
Terminal-Bench 4.0Trabajo agéntico en una terminal57.4%58.2%57.9%
CWE-bench v1Remediación de vulnerabilidades68% (empate)68% (empate)58%
OSWorld-2.0Uso de la computadora69.2%72.6%No está en la tabla de Google

Fuente: la comparación publicada por Google DeepMind, según lo reportado en nuestra cobertura de Gemini 4 Argon. Datos reportados por el proveedor.

GPT-6.1 Sol no está en la tabla de Google. Las cifras propias de OpenAI lo sitúan cerca de Astra:

  • DeepSWE v1.1: Sol iguala a Astra a aproximadamente un quinto del costo.
  • Conjunto sin conexión de OSWorld 2.0: Sol queda a menos de 2.1 puntos de Astra a aproximadamente un séptimo del costo por tarea.
  • AutomationBench 1.0.6: Sol puntúa 2.2 puntos por encima de Claude Opus 5.5 con esfuerzo medio.
  • Terminal-Bench Science 0.1: Astra sigue liderando con un 68.1%. OpenAI recomienda Astra para la investigación más difícil.

Las señales independientes apuntan en dirección contraria en cuanto a inteligencia pura. En el Artificial Analysis Intelligence Index, Astra obtiene 61. Fable 5.1 obtiene 5 puntos más. En su índice de agentes de programación, Fable 5.1 en Claude Code obtiene 70 frente al 67 de Astra. Artificial Analysis también informa que Argon iguala a Astra en el Intelligence Index.

En ARC-AGI-2, Astra obtiene 95% y Fable 5.1 obtiene 90%.

Costo por tarea: mismo precio de lista, factura diferente

Artificial Analysis sitúa a Claude Fable 5.1 en $9.18 por tarea, frente a $4.72 para GPT-6 Astra. Eso es aproximadamente 1.9x, con precios de lista idénticos.

La brecha proviene del volumen de tokens, no de las tarifas. El costo por tarea multiplica el precio por los tokens gastados. Con tarifas iguales, la brecha implica que Fable 5.1 gastó más tokens por tarea en esa ejecución. Anthropic también señala que su nuevo tokenizador produce aproximadamente 30% más tokens para el mismo texto.

Los dos modelos más baratos cambian aún más el panorama:

  • Gemini 4 Argon: Artificial Analysis informa que Argon iguala el Intelligence Index de Astra al 60% del costo por tarea de Astra, usando precios de introducción.
  • GPT-6.1 Sol: En Terminal-Bench Science, OpenAI informa $5.47 por tarea para Sol frente a $23.80 para Astra.

El almacenamiento en caché puede invertir el ranking para los agentes. Las cifras por tarea anteriores no modelan un reutilización intensa de la caché. Un agente de larga duración relee el mismo contexto en cada paso. Aquí está la aritmética para un contexto en caché de 200K tokens, antes de los tokens de salida:

ModeloTarifa en caché (por 1M)Por pasoPor 100 pasos
GPT-6 Astra$1.00$0.20$20.00
Claude Fable 5.1$0.25$0.05$5.00
GPT-6.1 Sol$0.10$0.02$2.00
Gemini 4 Argon (intro)$0.10$0.02$2.00

Matemáticas ilustrativas a partir de las tarifas de caché de lista. El contexto de 200K de Astra se mantiene por debajo de su umbral de prompt largo de 272K.

En bucles con uso intensivo de caché, Fable 5.1 lee el contexto a un cuarto de la tarifa de Astra. Mide ambos en tus propios trazados antes de decidirte por los titulares por tarea.

Qué modelo para qué trabajo

Elige según la carga de trabajo, no por el puesto en el ranking. GPT-6.1 Sol es el valor predeterminado para la mayoría de los equipos. Los otros 3 justifican su precio en trabajos más específicos.

TrabajoElecciónPor quéSegundo lugar
Agentes de programación de alto volumen, bots de CI, revisión de PRGPT-6.1 SolIguala a Astra en DeepSWE v1.1 a $2 / $10 y $0.10 en cachéGemini 4 Argon, cuando sea público
Ingeniería abierta más difícilGPT-6 AstraLidera FrontierSWE v2 con 65.5%Claude Fable 5.1
Uso de computadora y agentes de navegadorGPT-6 AstraLidera OSWorld-2.0 con 72.6%GPT-6.1 Sol, a menos de 2.1 puntos
Sesiones largas de programación dentro de un harnessClaude Fable 5.1Puntuación máxima de Artificial Analysis para agentes de codificación (70) en Claude Code; $0.25 en lecturas de cachéGPT-6 Astra (67)
Ciencia e investigación rigurosaGPT-6 AstraLidera Terminal-Bench Science con 68.1%GPT-6.1 Sol a $5.47 por tarea
Automatización legal, financiera y empresarialGemini 4 ArgonLidera Vals Index (68.9%), AutomationBench (51.3%) y Harvey Legal (19.6%)GPT-6.1 Sol; Claude Fable 5.1
Salidas únicas muy largas: refactorizaciones grandes, informes completosGemini 4 ArgonÚnico modelo con 1M de tokens de salida por respuestaCualquiera de los otros 3, repartido en varios turnos
Detección y parcheo de vulnerabilidadesGemini 4 Argon o GPT-6 AstraEmpatados en 68% en CWE-bench v1Claude Fable 5.1 (58%)
El presupuesto más ajustado con calidad de fronteraGPT-6.1 SolEl precio público más bajo; Argon solo lo iguala dentro de FairwindGemini 4 Argon

El acceso decide 2 de estas filas. Argon solo está disponible hoy para defensores cibernéticos de Fairwind. La capacidad completa de seguridad ofensiva de Astra está detrás del programa Daybreak de OpenAI; la versión pública rechaza tareas ofensivas cibernéticas avanzadas. Anthropic restringe su gemelo sin restricciones, Claude Mythos 5.1, detrás de programas de acceso de confianza.

Qué revisar antes de cambiar

La mayoría de los números aquí son reportados por los proveedores, y los proveedores discrepan en los márgenes. OpenAI reporta a Astra con 57.9% en Terminal-Bench 4.0. La tabla comparativa de Google indica 58.2%.

  • Las salvaguardas afectan las puntuaciones de Fable 5.1: Anthropic ejecutó sus benchmarks con las salvaguardas de producción activadas. Las tareas de ciberseguridad y biología marcadas se redirigen a otros modelos Claude, lo que probablemente redujo los resultados de OSWorld y AutomationBench.
  • El precio de Argon es temporal: $2 / $10 es introductorio. Pasará a $4 / $20 más adelante, sin fecha de finalización anunciada.
  • La ventana de contexto de Argon no está divulgada: Google publicó el límite de salida de 1M pero no el límite de entrada.
  • Los costos por tarea son una instantánea: Las cifras de $9.18 y $4.72 provienen de la ejecución temprana de septiembre de Astra de Artificial Analysis. Los ajustes de esfuerzo las modifican mucho.
  • Anthropic tiene una opción más barata: Nuestra cobertura de Argon cita informes de que Claude Opus 5.5 supera a Fable 5.1 en benchmarks agénticos clave a un precio de API más bajo. También lidera Terminal-Bench 4.0 con un 66.4%.

Conclusiones clave

  • GPT-6.1 Sol iguala a Astra en DeepSWE v1.1 a una quinta parte del precio.
  • GPT-6 Astra lidera FrontierSWE v2 (65.5%) y OSWorld-2.0 (72.6%).
  • Gemini 4 Argon lidera DeepSWE, Vals Index y AutomationBench, pero solo dentro de Fairwind.
  • Fable 5.1 cuesta $9.18 por tarea frente a $4.72 para Astra, a precios de lista iguales.
  • Para agentes con mucha caché, la lectura de caché de $0.25 de Fable 5.1 supera a la de $1.00 de Astra por 4x.

FAQ

  • ¿Cuál es el más barato? GPT-6.1 Sol, con $2 de entrada, $10 de salida y $0.10 en caché por 1M de tokens. Argon iguala eso solo con precios de introducción, dentro de Fairwind.
  • ¿Cuál es el mejor para programación? Sol para volumen. Astra para las tareas más difíciles. Fable 5.1 encabeza el índice de agentes de programación de Artificial Analysis en Claude Code.
  • ¿Puedo usar Gemini 4 Argon hoy? Solo a través del Fairwind Program de Google para defensores cibernéticos.

La entrada GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: Which Frontier Model Fits Which Job apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original