量子位Actualizado el

¡Nuevo modelo Claude lanzado! Aplasta a GPT-6 Luna en los benchmarks, con precio incluso más barato que el de Liang Wengu, y OpenAI solo…

El nuevo guardián de los modelos pequeños

Por Mengchen, desde Feisikong
Quantum Bit | Cuenta oficial QbitAI

¡Lanzamiento de Claude Haiku 5.5, la gran remontada de los modelos pequeños!

Solo en benchmarks, supera directamente a los dos anteriores "umbrales de eliminación", DeepSeek V4.1Flash y GLM-5.3-Flash, convirtiéndose en el nuevo guardián de los modelos pequeños.

Al ver los benchmarks oficiales, vaya, esto está claramente dirigido a GPT-6 Luna, ganándole en cada categoría.

Como la prueba del pelícano en bicicleta ya está prácticamente saturada, la última en llegar al campo de batalla es la prueba de la cebra corriendo.

Haiku 5.5 incluso iguala completamente el precio de GPT-6 Luna.

La generación anterior, Haiku 4.5, salió justo hace un año, con un precio 10 veces mayor que el de la 5.5.

Sin embargo, el precio de Haiku 5.5 tiene condiciones: para solicitudes con prompts de menos de 10万 tokens (el 90% del volumen de solicitudes de Haiku 4.5), los precios de entrada y salida se reducen directamente un 90%; para la parte que supera los 10万 tokens, la reducción es solo del 50%.

De este modo, excepto en la entrada con aciertos de caché, el precio de Haiku 5.5 también es más barato que el de DeepSeek-V4.1 Flash.

Así, Opus 5.5 se encarga del razonamiento complejo, Sonnet 5.5 de la ejecución general y Haiku 5.5 del volumen y la velocidad; reunidos todos los talentos, solo falta Fable.

Solo se puede decir que si OpenAI no se esfuerza más, Claude tampoco tiene necesidad de exprimir el gran tubo de pasta de dientes que es Fable 5.5.

Es como volver a los días en que Intel y AMD competían en CPUs.

Nuevo tokenizer, consume más tokens

Haiku 5.5 es el primer modelo Haiku que admite el ajuste de effort, heredando las cinco configuraciones de la serie, de low a max.

La generación anterior, Haiku 4.5, prácticamente suspendía en operación de computadoras y programación; esta generación evoluciona directamente.

Véase OSWorld 2.1 (mide a agentes operando computadoras reales para completar tareas de varios pasos): nivel Low, 42.0% de precisión y un costo único de $0.07; nivel Max, 72.4% y $0.61. Haiku 4.5 solo tenía en el nivel Max un 15.7% y $1.45,

Es decir, el nivel Low de la 5.5 es más preciso que el nivel Max de la 4.5, y además la mitad de barato.

GDPval-AA v2.1 (mide trabajo profesional real en 44 ocupaciones) muestra una curva similar: nivel Low, Elo 1125 y $0.01; nivel Max, 1620 y $0.87. El nivel Max de la 4.5 solo alcanzaba 735 y $0.24.

Sin embargo, Haiku 5.5 cambió de tokenizer (el mismo que Sonnet 5.5 y Opus 5.5), por lo que la misma tarea consume más tokens, y el dinero realmente ahorrado es un poco menos que el descuento indicado.

Especialmente en código, tablas ycontenido no en inglésla inflación puede ser aún mayor.

En la evaluación AA, aunque el precio de API de Haiku 5.5 es más barato, el "costo promedio por tarea completada" no llegó a la gama ideal.

No puede reemplazar a Sonnet

Mucha gente esperaba que Haiku 5.5 pudiera reemplazar a Sonnet 5.5 en algunas tareas, reduciendo aún más los costos.

Pero esta vez no se produjo ningún milagro: el tamaño pequeño sigue siendo tamaño pequeño.

En Terminal-Bench 4.0, Haiku 5.5 obtiene un 39.2%, mientras que Sonnet 5.5 obtiene un 70.6%. La diferencia es muy clara en programación compleja de varios pasos, refactorización entre archivos y planificación autónoma a largo plazo.

El propio Anthropic también lo recomienda: para programación agent compleja, usar preferiblemente Sonnet 5.5 u Opus 5.5.

El valor de Haiku 5.5 está en la capa de ejecución. Tareas ya desglosadas, con criterios de aceptación claros y que pueden ejecutarse en paralelo.

Por ejemplo, el Devin de Cognition usa Opus 5.5 como modelo principal y Haiku 5.5 como subagente; la combinación FrontierCode alcanzó un 66.2%, más que cada modelo por separado.

Si tu negocio anterior usaba Haiku 4.5, esta vez no basta con cambiar el nombre del modelo para ponerlo en producción.

La configuración manual de budget_tokens lanza un error directamente; hay que cambiar al pensamiento adaptativo con el parámetro effort.

temperature, top_p y top_k quedan bloqueados en sus valores por defecto; las aplicaciones que dependen de parámetros de muestreo para control creativo o generación diversificada deben modificar su lógica.

El prellenado de mensajes del asistente fue eliminado; la técnica anterior de usar el prellenado para forzar el inicio de un JSON debe reemplazarse por llamadas a herramientas o interfaces de salida estructurada.

La versión de la herramienta de operación de computadora también se actualizó: de computer_20250124 a computer_toolset_20260801; el formato de la interfaz y la estructura de retorno pueden ser diferentes.

Además, el pensamiento adaptativo está activado por defecto; el primer bloque de contenido de la respuesta puede ser un bloque de pensamiento en lugar del texto principal, por lo que la lógica de análisis debe filtrar según el campo type.

Cinco cambios, y cada uno puede hacer que una solicitud falle directamente o devuelva una estructura inesperada.

Anthropic ofrece una guía de migración; se recomienda revisarla punto por punto antes de hacer el cambio.

Además, dos beneficios

La lectura de caché de Sonnet 5.5 baja de $0.20/M a $0.10/M, y Anthropic afirma que la mayoría de las tareas de agentes reducen su costo en torno al 20% gracias a esto.

Los usuarios de suscripciones Max y Team pueden reclamar crédito de API a partir de esta semana: Max 5x recibe $100 al mes, Max 20x $200 al mes, y Team hasta $500 al mes compartidos dentro del equipo.

Este crédito puede usarse para experimentar con la API y construir herramientas, aplicaciones y agentes, y funciona con todos los modelos.

¿Cómo? ¿Dices que la empresa A me devuelve el dinero de mi Coding Plan y además puedo usarlo de nuevo en la API?

¿Y entonces qué está haciendo OpenAI? OpenAI regaló otra tarjeta de reinicio.

Enlaces de referencia:
[1]https://www.anthropic.com/claude-haiku-5-5
[2]https://x.com/AI_Screening/status/2107906044915749274?s=20

Fuente original

量子位

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original