Von Meng Chen aus Aofeisi
QbitAI | Öffentlicher WeChat-Account QbitAI
Claude Haiku 5.5 veröffentlicht – große Comeback-Story eines kleinen Modells!
Allein bei den Benchmarks übertrifft es direkt die beiden bisherigen „Schlachtlinien“ DeepSeek V4.1Flash und GLM-5.3-Flash und wird zum neuen Türsteher der kleinen Modelle.
Ein Blick auf die offiziellen Benchmarks zeigt: Dieses Modell ist klar auf GPT-6 Luna ausgerichtet und schlägt Luna in jedem Einzelpunkt.
Da der Test „Pelikan fährt Fahrrad“ praktisch gesättigt ist, kam als neuester Schlachtfeld-Test der „rennendes Zebra“-Test zum Einsatz.
Auch beim Preis orientiert sich Haiku 5.5 komplett an GPT-6 Luna.
Das Vorgängermodell Haiku 4.5 erschien vor genau einem Jahr und war 10-mal so teuer wie 5.5.
Der Preis von Haiku 5.5 ist allerdings noch an Bedingungen geknüpft: Bei Anfragen mit Prompts von bis zu 100.000 Token (90 % des Anfragevolumens von Haiku 4.5) werden die Preise für Ein- und Ausgabe direkt um 90 % gesenkt; bei dem Teil über 100.000 Token sinken sie nur um 50 %.
Damit ist Haiku 5.5 – abgesehen vom Posten der Cache-Treffer bei der Eingabe – auch günstiger als DeepSeek-V4.1 Flash.
Somit kümmert sich Opus 5.5 um komplexe Logik, Sonnet 5.5 um allgemeine Ausführung und Haiku 5.5 um Volumen und Geschwindigkeit – alle Größen sind versammelt, es fehlt nur noch Fable.
Man kann nur sagen: Wenn OpenAI nebenan sich nicht mehr anstrengt, muss Claude auch die große Zahnpastatube Fable 5.5 nicht mehr ausdrücken.
Es ist, als wären wir zurück in den Tagen, als Intel und AMD um die CPUs wetteiferten.
Neuer Tokenizer, höherer Tokenverbrauch
Haiku 5.5 ist das erste Haiku-Modell, das die Effort-Einstellung unterstützt, und übernimmt die fünf Stufen der Serie von low bis max.
Das Vorgängermodell Haiku 4.5 lieferte bei Computerbedienung und Codierung praktisch ein leeres Blatt ab, diese Generation hat sich direkt weiterentwickelt.
Blick auf OSWorld 2.1 (testet Agenten bei der Bedienung echter Computer für mehrstufige Aufgaben): Low-Stufe 42.0 % Genauigkeit bei Kosten von $0.07 pro Durchlauf; Max-Stufe 72.4 % bei $0.61. Haiku 4.5 erreichte in der Max-Stufe nur 15.7 % bei $1.45,
Das heißt, die Low-Stufe von 5.5 ist genauer als die Max-Stufe von 4.5 und zudem halb so teuer.
Bei GDPval-AA v2.1 (testet echte fachliche Arbeit in 44 Berufen) zeigt sich ein ähnlicher Verlauf: Low-Stufe Elo 1125 bei $0.01; Max-Stufe 1620 bei $0.87. Die Max-Stufe von 4.5 erreichte nur 735 bei $0.24.
Allerdings hat Haiku 5.5 den Tokenizer gewechselt (derselbe wie bei Sonnet 5.5 und Opus 5.5), sodass dieselben Aufgaben mehr Token verbrauchen – die tatsächliche Ersparnis liegt also ein kleines bisschen unter dem Rabatt des Listenpreises.
Besonders bei Code, Tabellen undnicht-englischen Inhaltenkann die Aufblähung noch höher ausfallen.
Im AA-Benchmark ist der Preis von Haiku 5.5 per API zwar gesunken, doch die „durchschnittlichen Kosten pro abgeschlossener Aufgabe“ liegen noch nicht im idealen Bereich.
Kann Sonnet nicht ersetzen
Viele erhoffen sich von Haiku 5.5, dass es Sonnet 5.5 bei manchen Aufgaben ersetzen und die Kosten weiter drücken kann.
Doch diesmal gab es kein Wunder: Der kleine Becher bleibt der kleine Becher.
Bei Terminal-Bench 4.0 erreicht Haiku 5.5 39.2 %, Sonnet 5.5 70.6 %. Bei komplexer mehrstufiger Codierung, dateiübergreifendem Refactoring und langfristiger autonomer Planung ist der Abstand sehr deutlich.
Auch Anthropic selbst empfiehlt, für komplexe Agenten-Codierung vorrangig Sonnet 5.5 oder Opus 5.5 zu verwenden.
Der Wert von Haiku 5.5 liegt auf der Ausführungsebene. Aufgaben, die bereits zerlegt sind, klare Abnahmekriterien haben und parallel ausgeführt werden können.
Zum Beispiel nutzt Cognitions Devin Opus 5.5 als Hauptmodell und Haiku 5.5 als Sub-Agenten; die FrontierCode-Kombination erreichte damit 66,2 %, höher als jedes der beiden Modelle allein.
Wenn Ihr bisheriges Geschäft Haiku 4.5 verwendet, reicht es diesmal nicht aus, einfach den Modellnamen auszutauschen, um live zu gehen.
budget_tokens führt bei manueller Denk-Konfiguration direkt zu einem Fehler; es muss auf adaptives Denken plus effort-Parameter umgestellt werden.
temperature, top_p und top_k sind alle auf die Standardwerte festgelegt; Anwendungen, die für Kreativitätssteuerung oder diversifizierte Generierung von Sampling-Parametern abhängen, müssen ihre Logik anpassen.
Das Prefilling von Assistant-Nachrichten wurde abgeschafft; bisherige Schreibweisen, die per Prefilling einen JSON-Anfang erzwingen, müssen auf Tool-Aufrufe oder strukturierte Ausgabeschnittstellen umsteigen.
Auch die Version des Computer-Bedienungswerkzeugs wurde aktualisiert, von computer_20250124 auf computer_toolset_20260801; Schnittstellenformat und Rückgabestruktur können sich beide unterscheiden.
Außerdem ist adaptives Denken standardmäßig aktiviert; der erste Inhaltsblock der Antwort kann ein Denkblock statt des Haupttextes sein, die Parse-Logik muss nach dem type-Feld filtern.
Fünf Änderungen, und jede einzelne kann dazu führen, dass Anfragen direkt fehlschlagen oder eine unerwartete Struktur zurückliefern.
Anthropic stellt einen Migrationsleitfaden bereit; man sollte ihn vor der Umstellung einmal komplett durchgehen.
Nebenbei zwei Bonusangebote:
Der Cache-Lese-Preis von Sonnet 5.5 ist von $0.20/M auf $0.10/M gesunken; laut Anthropic sinken die Kosten der meisten Agent-Aufgaben dadurch um etwa 20%.
Max- und Team-Abonnenten können ab dieser Woche API-Guthaben abrufen: Max 5x erhält monatlich $100, Max 20x monatlich $200, und Team erhält bis zu $500/Monat, das innerhalb des Teams geteilt werden kann.
Dieses Guthaben kann zum Experimentieren und für API-Aufrufe beim Bau von Tools, Anwendungen und Agenten genutzt werden und gilt für alle Modelle.
Wie bitte? Du sagst, Anthropic gibt mir mein Geld für den Coding Plan zurück und lässt es mich noch einmal über die API nutzen?
Was macht OpenAI derweil? OpenAI hat wieder eine Reset-Karte verschickt.
Referenzlinks:
[1]https://www.anthropic.com/claude-haiku-5-5
[2]https://x.com/AI_Screening/status/2107906044915749274?s=20