雷峰网 AI

Hinter der Kostensenkung von Claude Haiku 5.5: Die Agenten-Fähigkeiten legen stark zu, doch warum hinkt es bei komplexer Programmierung…

Das Modell beginnt, Inferenz dynamisch nach Aufgabe zuzuweisen; nach über 100.000 Token steigen sowohl die Input- als auch die Output-Preise um das 5-Fache. Autorin丨 Zheng Jiamei Redaktion丨 Cen Feng Soeben hat Anthropic…

Das Modell beginnt, Inferenz dynamisch nach Aufgabe zuzuweisen; nach über 100.000 Token steigen sowohl die Input- als auch die Output-Preise um das 5-Fache.

    Autorin丨 Zheng Jiamei

Redaktion丨 Cen Feng

                                                                                                       

Soeben hat Anthropic Claude Haiku 5.5 veröffentlicht. Das Upgrade ist erheblich, insbesondere beim Computer-Bedienen: Die Bewertung in OSWorld 2.1 stieg von 15,7 % der Vorgängergeneration auf 72,4 %. Auch Wissensarbeit und komplexe Schlussfolgerungsfähigkeit haben sich deutlich verbessert, und laut den von Anthropic veröffentlichten Daten sanken die durchschnittlichen Betriebskosten des neuen Modells um etwa 75 %. Darüber hinaus hat Haiku 5.5 einen adaptiven Inferenzmechanismus erhalten und unterstützt einen Kontext von 1 Million Token. Früher wurde Haiku hauptsächlich für hochfrequente Aufgaben wie Zusammenfassung, Klassifizierung und Informationsextraktion eingesetzt; seine Vorteile waren stets Geschwindigkeit und niedrige Kosten. Nach diesem Update kann es deutlich komplexere Arbeiten bewältigen, und einige Bewertungsergebnisse liegen bereits nahe an Sonnet 5.5. Bei komplexen Programmieraufgaben bleibt der Abstand zwischen beiden jedoch beträchtlich. Betrachtet man den neuen Inferenzmechanismus und die Preisregeln dieses Updates, gibt es bei der Leistung von Haiku 5.5 bei verschiedenen Aufgaben und den tatsächlichen Nutzungskosten noch viele Details, die genau untersucht werden müssen.

01


Bei komplexer Programmierung besteht weiterhin Abstand

Der Leistungszuwachs von Haiku 5.5 zeigt sich hauptsächlich in den Bereichen Computer-Bedienen, Wissensarbeit und fächerübergreifendes Schlussfolgern, wobei die Veränderung beim Computer-Bedienen besonders auffällig ist. Leihefengwang (WeChat-Öffentlicher Account: 雷峰网) Im Offline-Teilsatz von OSWorld 2.1 erreichte Haiku 5.5 72,4 %, die Vorgängergeneration nur 15,7 %, während Sonnet 5.5 83,9 % erzielte. OSWorld testet die Fähigkeit eines Modells, Aufgaben mit langen Handlungsketten über eine Computeroberfläche zu erledigen, einschließlich Oberflächenverständnis, Ausführung von Operationen und Fortsetzung der Aufgabe anhand von Umgebungsrückmeldungen. Verglichen mit gewöhnlichen Textfragen-Antworten besteht beim Computer-Bedienen eine stärkere Zustandsabhängigkeit. Nachdem das Modell einen Klick oder eine Eingabe ausgeführt hat, kann sich die Seite ändern, und weitere Aktionen müssen anhand des neuen Oberflächenzustands entschieden werden. Schlägt eine Operation fehl, muss das Modell zudem beurteilen, ob die aktuelle Umgebung weiterhin den Aufgabenanforderungen entspricht. Der Zuwachs von Haiku 5.5 in dieser Bewertung zeigt, dass seine Fähigkeit zur Bearbeitung aufeinanderfolgender Operationsaufgaben gegenüber der Vorgängergeneration deutlich verbessert ist. Doch die 72,4 % entsprechen der Abschlussquote in einem bestimmten Testsatz und können nicht direkt als tatsächliche Erfolgsquote für alle Browser- oder Desktop-Aufgaben gelten. Dynamische Seiten, Berechtigungsbeschränkungen und Ausnahmezustände im realen Geschäftsbetrieb müssen weiterhin separat in der jeweiligen Umgebung getestet werden. Im Bereich Wissensarbeit erzielte Haiku 5.5 in GDPval-AA v2.1 1620 Punkte, Haiku 4.5 erreichte 735 Punkte und Sonnet 5.5 1840 Punkte. Diese Bewertung umfasst tatsächliche Arbeitsaufgaben aus 44 Berufsgruppen, darunter Materialanalyse, Informationszusammenführung und die Erstellung von Arbeitsergebnissen. In einer weiteren Bewertung, AA-Briefcase v1.1, verbesserte sich Haiku 5.5 von 614 Punkten der Vorgängergeneration auf 1578 Punkte. Beim fächerübergreifenden Schlussfolgern erreichte der Test Humanity's Last Exam ohne Werkzeuge 45,9 %, mit Werkzeugen 57,4 %, ebenfalls deutlich über der Vorgängergeneration. Die Aufgaben in diesen Bewertungen sind komplexer als gewöhnliche Informationsextraktion. Das Modell muss die Beziehungen zwischen mehreren Informationsquellen verstehen, Einschränkungen im Material verarbeiten und aus den vorhandenen Inhalten Ergebnisse bilden. Der Einsatz von Werkzeugen fügt zudem Schritte der Informationsbeschaffung und Ergebnisintegration hinzu. Allerdings zeigt die Programmierbewertung ein anderes Bild. Im Haupttest von FrontierCode 1.1 erreichte Haiku 5.5 46,4 %, mit geringem Abstand zu den 52,1 % von Sonnet 5.5. In Terminal-Bench 4.0 erreichte Haiku 5.5 jedoch 39,2 %, während Sonnet 5.5 auf 70,6 % kam. Terminal-Bench umfasst komplexe mehrstufige Aufgaben in einer Kommandozeilenumgebung, bei denen das Modell in der Regel Dateien lesen, Befehle ausführen, Fehler verarbeiten und sein Vorgehen anhand von Testrückmeldungen anpassen muss. Die Anforderungen an kontinuierliche Planung und die Wahrung des Ausführungszustands sind hoch. Auch Anthropic weist in den Veröffentlichungsunterlagen ausdrücklich darauf hin, dass Sonnet 5.5 und Opus 5.5 weiterhin besser für komplexe agentische Programmieraufgaben geeignet sind, während sich Haiku 5.5 hauptsächlich an klar umrissene Teilaufgaben, Zusammenfassungen und Kontextkomprimierung richtet. Frühe Unternehmens-tests liefern konkretere Daten. Asana berichtete, in Tests zu AI Teammates habe Haiku 5.5 die Latenz beim Aufgabenabschluss im Vergleich zum derzeit eingesetzten Modell um mehr als 30 % gesenkt und die Inferenzgeschwindigkeit pro Runde um bis zu das 2,5-Fache erhöht. HubSpot maß in einer simulierten CRM-Umgebung über drei Durchläufe im Durchschnitt 92,8 %, und AlphaSense erreichte in 400 Dokument-Frage-Antwort-Tests mit Haiku 5.5 eine Punktzahl von 0,84, gegenüber 0,76 bei der Vorgängergeneration. Diese Ergebnisse stammen aus internen Tests verschiedener Unternehmen, die jeweils unterschiedliche Aufgaben und Bewertungsmaßstäbe verwendeten; sie eignen sich dazu, die Leistung in bestimmten Geschäftsszenarien zu verstehen, können jedoch nicht direkt als einheitliches Modellfähigkeits-Ranking dienen.

02


Adaptive Inferenz hält Einzug in Haiku

Neben den Leistungsveränderungen ist Haiku 5.5 auch das erste Haiku-Modell, das eine einstellbare Inferenzstärke unterstützt. Leihefengwang Bisher mussten Entwickler bei Haiku 4.5 mit der Funktion Extended Thinking vorab ein festes Budget für die interne Inferenz festlegen. Ob die Aufgabe eine einfache Informationssuche oder eine komplexe Analyse mit mehreren Bedingungen war – der dem Modell zur Verfügung stehende Inferenzraum war durch den voreingestellten Wert begrenzt. Haiku 5.5 verwendet stattdessen Adaptive Thinking. Das Modell kann anhand des Aufgabeninhalts entscheiden, ob es interne Inferenz einsetzt und wie viel Rechenleistung es investiert; die Entwickler steuern die gesamte Inferenzstärke über die Effort-Einstellung. Zum Beispiel erfordert das Extrahieren eines Datums aus einem Dokument normalerweise keine lange Analyse, während der Vergleich von Klauselunterschieden zwischen mehreren Vertragsversionen die gleichzeitige Verarbeitung von mehr Bedingungen und miteinander verknüpften Informationen erfordert. Adaptive Inferenz erlaubt es dem Modell, bei diesen beiden Aufgabentypen unterschiedliche Recheninvestitionen vorzunehmen. Dieser Mechanismus betrifft auch die Zuteilung von Rechenressourcen zur Inferenzzeit. Bei komplexen Aufgaben kann mehr interne Inferenz dem Modell helfen, mehr Zwischenschritte zu verarbeiten, doch ein längerer Inferenzprozess erhöht auch den Token-Verbrauch und die Antwortzeit. Bei einfachen Aufgaben kann reduzierte interne Inferenz unnötigen Rechenaufwand senken. Anthropic zeigt auf der Veröffentlichungsseite das Verhältnis von Kosten und Leistung von Haiku 5.5 bei OSWorld, GDPval-AA und Humanity's Last Exam unter verschiedenen Inferenzstärken. Allerdings reagieren unterschiedliche Aufgaben nicht einheitlich auf zusätzliche Inferenzrechenleistung; man darf eine höhere Inferenzstufe nicht direkt mit einer festen Leistungssteigerung gleichsetzen. Auch auf API-Ebene gibt es einige zu beachtende Änderungen. Erstens verwendet Haiku 5.5 nicht mehr die Methode der Vorgängergeneration, manuell eine feste Anzahl an Thinking-Token anzugeben; bestehende Inferenzkonfigurationen müssen angepasst werden. Zweitens beansprucht die interne Inferenz das Output-Token-Budget des Modells. Wenn ein bestehendes Programm das Output-Limit nur anhand der Länge der Endantwort festlegt, kann es nach dem Upgrade vorkommen, dass die interne Inferenz zu viel Raum beansprucht und der Haupttext nicht vollständig generiert werden kann. Zudem können Modellantworten bei aktivierter adaptiver Inferenz eigenständige Thinking-Blöcke enthalten. Anwendungen müssen interne Inferenzinhalte korrekt von der Endausgabe unterscheiden und dürfen nicht weiterhin annehmen, dass der Anfang des zurückgegebenen Inhalts die Antwort ist. Bei Agenten, die fortlaufend Werkzeuge nutzen, bestehen außerdem Konsistenzanforderungen zwischen Inferenzdaten und Konversationsverlauf. Wenn Entwickler in nachfolgenden Anfragen bereits vorhandene Verlaufsnachrichten ändern, kann dies die Gültigkeit des ursprünglichen Inferenzzustands beeinträchtigen. Haiku 5.5 hat auch Einschränkungen bei einigen Sampling-Parametern eingeführt; Anwendungen, die zuvor über diese Parameter das Ausgabeverhalten steuerten, müssen die Schnittstellenkompatibilität prüfen. Diese Änderungen betreffen vor allem Projekte, die bereits die Extended-Thinking-Funktion von Haiku 4.5 nutzen. Bei der Migration muss man neben dem Austausch der Modellversion auch das Inferenzbudget, das Antwort-Parsing und die Verarbeitung mehrstufiger Nachrichten neu überprüfen.

03


Kein einheitlicher Niedrigpreis für den Million-Kontext

Haiku 5.5 unterstützt einen Kontext von 100 万 Token und eine Ausgabe von 12.8 万 Token und kann längere Dokumente, große Codebestände sowie fortlaufende Werkzeugprotokolle verarbeiten. Allerdings hat Anthropic für das gesamte Kontextfenster keinen einheitlichen Niedrigpreis festgelegt. Für Eingaben mit nicht mehr als 10 万 Token kostet die Million Input-Token 0.10 US-Dollar, die Million Output-Token 0.50 US-Dollar. Übersteigt die Eingabe 10 万 Token, steigt der Input-Preis auf 0.50 US-Dollar und der Output-Preis auf 2.50 US-Dollar. Auch die Cache-Gebühren sind gestaffelt. Bei kürzeren Eingaben beträgt der Cache-Lesepreis pro Million Token 0.01 US-Dollar, bei längeren Eingaben 0.05 US-Dollar. Im Vergleich zum wiederholten Übergeben des vollständigen Inhalts eignet sich der Cache zum Wiederverwenden von Systemanweisungen, Werkzeugdefinitionen und gemeinsamen Materialien. Laut Anthropic liegen bei Haiku 4.5 etwa 90 % der Anfragen innerhalb von 10 万 Token. Diese Anfragen erhalten unter der neuen Preisgestaltung eine beträchtliche Preissenkung, doch die tatsächlichen Kosten hängen auch von Veränderungen des Token-Verbrauchs ab. Haiku 5.5 verwendet einen aktualisierten Tokenizer; die Tokenanzahl für denselben Inhalt kann sich von der Vorgängergeneration unterscheiden. Selbst wenn sich der Eingabetext nicht ändert, kann sich daher die nach dem Upgrade tatsächlich abrechnungspflichtige Menge verändern und muss neu gemessen werden. Bei lang laufenden Agenten beeinflusst das Kontextmanagement die Kosten zusätzlich. So können bei einer Programmieraufgabe fortlaufend Dateisuchergebnisse, Codeanalyseprotokolle und Testprotokolle anfallen. Wenn jeder Aufruf den vollständigen Verlauf enthält, steigt die Eingabelänge mit dem Fortgang der Aufgabe stetig an. Prompt Caching kann die Lesekosten für wiederholte Inhalte senken, während Compaction bereits abgeschlossene Vorgänge zu einem kürzeren Aufgabenzustand zusammenfassen und so die in nachfolgenden Aufrufen zu verarbeitenden Verlaufsinformationen reduzieren kann. Anthropic führt die Kontextkomprimierung in den Veröffentlichungsunterlagen als einen der Haupteinsatzbereiche von Haiku 5.5 an. Zur konkreten Bereitstellung berichtete Rogo über einen Fall, in dem Haiku-Subagenten Einnahmedaten aus den 10-K-Dateien von Unternehmen extrahierten, während ein größeres Modell die anschließende Präsentationserstellung übernahm. Cognition setzte Haiku 5.5 als Hilfsmodell für Devin Fusion ein; in einer von Opus 5.5 dominierten Konfiguration erreichte FrontierCode eine Punktzahl von 66.2 %, und es wurden sinkende Kosten und Latenz gemeldet. Diese Fälle verwendeten unterschiedliche Modelle für unterschiedliche Aufgaben, doch die Veröffentlichungsunterlagen liefern keine vollständigen Aufrufzahlen, Token-Verteilungen und Kostenaufstellungen, sodass sich daraus nicht berechnen lässt, um wie viel ein allgemeines Geschäft mit derselben Architektur sparen würde. Zudem senkte Anthropic den Cache-Lesepreis von Sonnet 5.5 um 50 %, von 0.20 US-Dollar auf 0.10 US-Dollar pro Million Token. Nach Angaben von Anthropic sinken dadurch die Betriebskosten von Sonnet 5.5 bei den meisten agentischen Aufgaben um etwa 20 %. Diese Anpassung betrifft nur die Cache-Lesegebühren; die Standardpreise für Input- und Output-Token wurden nicht im gleichen Verhältnis gesenkt.

04


Bei der Migration weiterhin die tatsächliche Aufgabenleistung prüfen

Claude Haiku 5.5 ist bereits über Plattformen wie die Claude API, AWS, Google Cloud und Microsoft Azure verfügbar; gleichzeitig hat Anthropic damit begonnen, die Python- und TypeScript-SDKs zu aktualisieren, um Beta-Unterstützung für Computerbedienung und Browserbedienung hinzuzufügen. Nach den bisher veröffentlichten Daten schneidet Haiku 5.5 in Benchmarks zu Computerbedienung, Wissensarbeit und multidisziplinärem Schlussfolgern deutlich besser ab als die Vorgängergeneration, bei komplexer Terminalprogrammierung besteht jedoch weiterhin ein erheblicher Abstand zu Sonnet 5.5. Beim Preis bieten kürzere Prompts einen deutlicheren Kostenvorteil; ab über 100,000 Token (10 万) gilt eine andere Preisstufe. Für bestehende Haiku 4.5-Anwendungen umfasst die Migration konkrete Anpassungen wie Inferenzkonfiguration, Token-Berechnung und Antwort-Parsing. Wenn zuvor Sonnet für einige häufig genutzte Aufgaben eingesetzt wurde, lässt sich anhand desselben Testsatzes auch die Abschlussquote, die Antwortzeit und der Aufrufpreis von Haiku 5.5 vergleichen. Anthropic hat Informationen zu den Modellfähigkeiten, den Schnittstellenänderungen und der Preisgestaltung bereitgestellt, doch die tatsächliche Kostenverbesserung im Geschäftsbetrieb muss durch die entsprechenden Workloads verifiziert werden. Insbesondere in Szenarien mit mehrstufigen Tool-Aufrufen müssen der Preis einer einzelnen Modellanfrage, die Anzahl der Wiederholungsversuche nach fehlgeschlagenen Aufgaben sowie das Kontextwachstum innerhalb derselben vollständigen Aufgabe verrechnet werden.

Steigen Sie ein und erleben Sie die Highlights der weltweit wichtigsten AI-Konferenzen

Exklusiv zugänglich:

Präsentationsfolien von Experten

Volltexte der Konferenzberichte

Erklärungen populärer Paper

Interviews mit aufstrebenden Wissenschaftstalenten

Scannen Sie den QR-Code oben

oder klicken Sie auf „Originalartikel lesen“, um dem Themenkanal zu folgen.

Dies ist ein Originalartikel von Leiphone und darf ohne Genehmigung nicht nachgedruckt werden. Details sieheHinweise zum Nachdruck。

Originalquelle

雷峰网 AI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten