雷峰网 AI

Detrás de la reducción de costos de Claude Haiku 5.5: las capacidades operativas se disparan, pero ¿por qué la programación compleja sigue…

El modelo comienza a asignar razonamiento dinámicamente según la tarea; al superar los 100.000 tokens, los precios unitarios de entrada y salida aumentan 5 veces. Autora丨 Zheng Jiamei Editor丨 Cen Feng Acaba de ocurrir…

El modelo comienza a asignar la inferencia dinámicamente según la tarea; tras superar los 10 万 tokens, tanto el precio unitario de entrada como el de salida aumentan 5 veces.

    Autor: Zheng Jiamei

Editor: Cen Feng

                                                                                                       

Recién ahora, Anthropic ha lanzado Claude Haiku 5.5. Esta actualización es de gran magnitud, especialmente en el ámbito de la operación de computadoras: la puntuación en la evaluación OSWorld 2.1 pasó del 15.7% de la generación anterior al 72.4%. Las capacidades de trabajo del conocimiento y de razonamiento complejo también muestran mejoras notables, y según los datos publicados por Anthropic, el costo promedio de funcionamiento del nuevo modelo disminuyó además en aproximadamente un 75%. Además, Haiku 5.5 incorpora un mecanismo de razonamiento adaptativo y es compatible con contextos de 1 millón de tokens. En el pasado, Haiku se utilizaba principalmente para tareas de alta frecuencia como resúmenes, clasificación y extracción de información, y su ventaja siempre fue la velocidad y el bajo costo. Tras esta actualización, puede manejar trabajos considerablemente más complejos, y en algunas evaluaciones su puntuación incluso se acerca a la de Sonnet 5.5. Sin embargo, en tareas de programación complejas, la brecha entre ambos sigue siendo evidente. Al examinar el mecanismo de razonamiento y las reglas de precios de esta actualización, el rendimiento de Haiku 5.5 en diferentes tareas y su costo real de uso todavía tienen bastantes detalles que analizar por separado.

01


Todavía existe una brecha en la programación compleja

El aumento de rendimiento de Haiku 5.5 se manifiesta principalmente en varias direcciones: operación de computadoras, trabajo del conocimiento y razonamiento multidisciplinario, siendo la operación de computadoras especialmente notable. Leifeng (cuenta pública: Leifeng) informa que en el subconjunto sin conexión de OSWorld 2.1, Haiku 5.5 logró un 72.4%, la generación anterior solo un 15.7%, y Sonnet 5.5 alcanzó un 83.9%. OSWorld evalúa la capacidad del modelo para completar tareas de cadena larga a través de la interfaz de la computadora, lo que implica comprensión de la interfaz, ejecución de operaciones y continuar completando la tarea según la retroalimentación del entorno. En comparación con las preguntas y respuestas de texto ordinarias, la operación de computadoras presenta más dependencias de estado. Después de que el modelo realiza un clic o una entrada, la página puede cambiar, y las acciones posteriores deben decidirse según el nuevo estado de la interfaz. Si una operación falla, el modelo además debe juzgar si el entorno actual todavía cumple con los requisitos de la tarea. El aumento de Haiku 5.5 en esta evaluación indica que su capacidad para manejar tareas de operaciones continuas ha mejorado notablemente respecto a la generación anterior. Sin embargo, el 72.4% corresponde a la tasa de finalización en un conjunto de pruebas específico y no puede representar directamente la tasa de éxito real en todas las tareas de navegador o escritorio. Las páginas dinámicas, las restricciones de permisos y los estados anómalos en los negocios reales todavía deben probarse por separado en los entornos correspondientes. En cuanto al trabajo del conocimiento, Haiku 5.5 obtuvo 1620 puntos en GDPval-AA v2.1, Haiku 4.5 obtuvo 735 puntos y Sonnet 5.5 obtuvo 1840 puntos. Esta evaluación abarca tareas laborales reales de 44 categorías profesionales, e implica análisis de materiales, integración de información y generación de resultados de trabajo. En otra evaluación, AA-Briefcase v1.1, Haiku 5.5 aumentó de 614 puntos de la generación anterior a 1578 puntos. En la prueba de razonamiento multidisciplinario Humanity's Last Exam, el resultado sin herramientas alcanzó 45.9%, y con herramientas integradas fue de 57.4%, también claramente superior al de la generación anterior. Las tareas que implican estas evaluaciones son más complejas que la extracción de información ordinaria. El modelo necesita comprender las relaciones entre múltiples fuentes de información, manejar las condiciones restrictivas de los materiales y formar resultados basándose en el contenido existente. La incorporación de herramientas añade además los pasos de obtención de información e integración de resultados. No obstante, las evaluaciones de programación muestran una situación diferente. En la prueba principal de FrontierCode 1.1, Haiku 5.5 obtuvo 46.4%, con una brecha pequeña respecto al 52.1% de Sonnet 5.5. Pero en Terminal-Bench 4.0, Haiku 5.5 obtuvo 39.2%, mientras que Sonnet 5.5 alcanzó 70.6%. Terminal-Bench implica tareas complejas de múltiples pasos en entornos de línea de comandos; el modelo generalmente necesita leer archivos, ejecutar comandos, manejar errores y ajustar sus operaciones según la retroalimentación de las pruebas. Exige un alto nivel de planificación continua y mantenimiento del estado de ejecución. Anthropic también señaló explícitamente en sus materiales de lanzamiento que Sonnet 5.5 y Opus 5.5 siguen siendo más adecuados para tareas complejas de programación con agentes, mientras que Haiku 5.5 está orientado principalmente a trabajos como subtareas de alcance definido, resúmenes y compresión de contexto. Las pruebas tempranas de empresas proporcionan más datos concretos. Asana informó que, en las pruebas relacionadas con AI Teammates, la latencia de finalización de tareas de Haiku 5.5 disminuyó más de un 30% en comparación con su modelo actual, y la velocidad de razonamiento de una sola ronda aumentó hasta 2.5 veces. HubSpot, en un entorno de CRM simulado, midió un resultado promedio de 92.8% en tres ejecuciones, mientras que AlphaSense, en 400 pruebas de preguntas y respuestas sobre documentos, midió que Haiku 5.5 obtuvo una puntuación de 0.84, frente a 0.76 de la generación anterior. Estos resultados provienen de pruebas internas de distintas empresas, cada una con diferentes tareas y criterios de evaluación; son adecuados para conocer el rendimiento en escenarios de negocio específicos y no pueden usarse directamente como una clasificación unificada de capacidades de los modelos.

02


Razonamiento adaptativo llega a Haiku

Además de los cambios de rendimiento, Haiku 5.5 también se convirtió en el primer modelo Haiku compatible con niveles de razonamiento ajustables. Anteriormente, en Haiku 4.5, cuando se usaba la función de pensamiento extendido, los desarrolladores debían configurar de antemano un presupuesto fijo de razonamiento interno. Tanto si la tarea era una simple búsqueda de información como un análisis complejo que involucraba múltiples condiciones, el espacio de razonamiento disponible para el modelo estaba limitado por el valor preestablecido. Haiku 5.5 cambia a Adaptive Thinking. El modelo puede decidir según el contenido de la tarea si usar razonamiento interno y cuánta computación invertir, mientras que los desarrolladores ajustan la intensidad general del razonamiento mediante la configuración de Effort. Por ejemplo, extraer una fecha de un documento normalmente no requiere un análisis prolongado, mientras que comparar las diferencias de cláusulas entre varias versiones de un contrato exige procesar al mismo tiempo más condiciones e información interrelacionada. El razonamiento adaptativo permite al modelo adoptar diferentes niveles de inversión computacional en estos dos tipos de tareas. Este mecanismo también involucra la asignación de recursos de cómputo en el momento de la inferencia. Para tareas complejas, aumentar el razonamiento interno permite al modelo procesar más pasos intermedios, pero un proceso de razonamiento más largo también aumenta el consumo de tokens y el tiempo de respuesta. Para tareas simples, reducir el razonamiento interno puede disminuir costos computacionales innecesarios. Anthropic mostró en su página de lanzamiento la relación entre costo y rendimiento de Haiku 5.5 en OSWorld, GDPval-AA y Humanity's Last Exam bajo diferentes intensidades de razonamiento. Sin embargo, distintas tareas no reaccionan de manera uniforme a la computación adicional de razonamiento, por lo que no se puede equiparar directamente subir el nivel de razonamiento con una mejora de rendimiento de magnitud fija. A nivel de API también hay varios cambios que deben atenderse. Primero, Haiku 5.5 ya no utiliza el método de la generación anterior de especificar manualmente una cantidad fija de tokens de pensamiento, por lo que las configuraciones de razonamiento antiguas deben ajustarse. Segundo, el razonamiento interno consume el presupuesto de tokens de salida del modelo. Si el programa original solo establecía un límite de salida según la longitud de la respuesta final, tras la actualización puede ocurrir que el razonamiento interno ocupe demasiado espacio y que el texto principal no pueda generarse por completo. Además, al activar el razonamiento adaptativo, la respuesta del modelo puede contener bloques de datos de pensamiento independientes. La aplicación debe distinguir correctamente entre el contenido del razonamiento interno y la salida final, y no puede seguir asumiendo que el inicio del contenido devuelto es necesariamente la respuesta. Para los agentes que usan herramientas de forma continua, también existe un requisito de consistencia entre los datos de razonamiento y el historial de conversación. Si un desarrollador modifica mensajes existentes del historial en solicitudes posteriores, puede afectar la validez del estado de razonamiento original. Haiku 5.5 también añadió restricciones a algunos parámetros de muestreo; las aplicaciones que dependían de estos parámetros para ajustar el comportamiento de salida deben verificar la compatibilidad de la interfaz. Estos cambios afectan principalmente a los proyectos que ya utilizaban la función de pensamiento extendido de Haiku 4.5. Al migrar, además de reemplazar la versión del modelo, también es necesario revisar nuevamente los presupuestos de razonamiento, el análisis de las respuestas y el manejo de mensajes multirronda.

03


El contexto de un millón no tiene un precio bajo unificado

Haiku 5.5 admite un contexto de 1 millón de tokens y una salida de 128.000 tokens, capaz de procesar documentos largos, grandes bloques de código y registros de herramientas en ejecución continua. Sin embargo, Anthropic no estableció un precio bajo unificado para toda la ventana de contexto. Para prompts de hasta 100.000 tokens, cobra 0,10 USD por millón de tokens de entrada y 0,50 USD por millón de tokens de salida. Cuando el prompt supera los 100.000 tokens, el precio de entrada sube a 0,50 USD y el de salida a 2,50 USD. Los costes de caché también采用 un esquema por niveles. El precio de lectura de caché por millón de tokens es de 0,01 USD para prompts más cortos y de 0,05 USD para prompts más largos. En lugar de volver a enviar el contenido completo repetidamente, la caché es adecuada para reutilizar instrucciones del sistema, definiciones de herramientas y perfiles comunes. Anthropic afirma que aproximadamente el 90% de las solicitudes de Haiku 4.5 tienen una longitud de menos de 100.000 tokens. Este grupo de solicitudes obtiene una reducción de precio considerable con la nueva tarifa, pero el coste real también se ve afectado por las variaciones en el uso de tokens. Haiku 5.5 actualizó el tokenizador, por lo que el número de tokens correspondiente al mismo contenido puede diferir del de la generación anterior. Por lo tanto, incluso si el texto de entrada no cambia, la cantidad facturada real tras la actualización puede variar y es necesario volver a medirla. Para agentes de larga duración, la gestión del contexto afecta aún más al coste. Por ejemplo, una tarea de programación puede generar de forma continua resultados de búsqueda de archivos, registros de análisis de código y logs de pruebas. Si cada llamada incluye el historial completo, la longitud de entrada aumenta progresivamente a medida que avanza la tarea. Prompt Caching puede reducir los costes de lectura de contenido repetido, mientras que Compaction puede organizar las operaciones ya completadas en un estado de tarea más corto, reduciendo la información del historial que deben procesar las llamadas posteriores. Anthropic enumeró la compresión de contexto como uno de los principales casos de uso de Haiku 5.5 en sus materiales de lanzamiento. En cuanto a la implementación concreta, Rogo reportó un caso de uso de subagentes Haiku para extraer datos de ingresos de archivos 10-K corporativos, con un modelo más grande encargado de la elaboración posterior de presentaciones. Cognition, por su parte, utiliza Haiku 5.5 como modelo auxiliar de Devin Fusion; en una configuración liderada por Opus 5.5, alcanzó una puntuación FrontierCode del 66,2% y reportó una disminución de costes y latencia. Estos casos adoptan el enfoque de usar distintos modelos para distintas tareas, pero los materiales de lanzamiento no proporcionan el número completo de llamadas, la distribución de tokens ni el desglose de costes, por lo que no es posible calcular a partir de ellos cuánto ahorraría un negocio general que adoptara la misma arquitectura. En esta ocasión, Anthropic también redujo un 50% el precio de lectura de caché de Sonnet 5.5, de 0,20 USD por millón de tokens a 0,10 USD. Según las estadísticas de Anthropic, esto reduce alrededor del 20% el coste de ejecución de Sonnet 5.5 en la mayoría de las tareas de agentes. Este ajuste solo afecta a los costes de lectura de caché; los precios estándar de los tokens de entrada y salida no disminuyeron en la misma proporción.

04


La migración aun así requiere verificar el rendimiento en las tareas reales

Claude Haiku 5.5 ya está disponible a través de plataformas como la API de Claude, AWS, Google Cloud y Microsoft Azure, y Anthropic al mismo tiempo comenzó a actualizar los SDK de Python y TypeScript, añadiendo soporte en versión beta para el uso de computadora y del navegador. Según los datos publicados hasta ahora, Haiku 5.5 obtiene resultados claramente superiores a los de la generación anterior en las evaluaciones de uso de computadora, trabajo del conocimiento y razonamiento multidisciplinario, pero en programación compleja en terminal todavía existe una brecha considerable respecto a Sonnet 5.5. En cuanto al precio, los prompts más cortos obtienen una ventaja de costos más evidente, mientras que después de 10 万 Tokens se aplica otra escala de tarifas. Para las aplicaciones existentes con Haiku 4.5, la migración implica modificaciones concretas como la configuración de inferencia, el cálculo de Tokens y el análisis de las respuestas. Si originalmente se usaba Sonnet para algunas tareas de alta frecuencia, también se puede comparar la tasa de finalización, el tiempo de respuesta y el costo de llamadas de Haiku 5.5 usando el mismo conjunto de pruebas. Anthropic ya ha proporcionado información sobre las capacidades del modelo, los cambios en la interfaz y los precios, pero la mejora real de costos en el negocio todavía necesita validarse con las cargas de trabajo correspondientes. Especialmente en escenarios de llamadas a herramientas en múltiples turnos, el precio por solicitud del modelo, el número de reintentos tras un fallo de la tarea y el crecimiento del contexto deben evaluarse dentro de una misma tarea completa.

Súbete y te llevamos a ver lo mejor de las principales cumbres mundiales de IA

Acceso exclusivo a:

Presentaciones PPT de expertos

Textos completos de los informes de las conferencias

Análisis de artículos populares

Entrevistas con nuevas estrellas académicas

Escanea el código QR de arriba

o haz clic en «Leer el original» para seguir la sección.

Artículo original de Leiphone, prohibida su reproducción sin autorización. Para más detalles, consulta lasNormas de reproducción。

Fuente original

雷峰网 AI

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original