夢晨 凹非寺より
量子位 | 公式アカウント QbitAI
Claude Haiku 5.5が登場、小モデルの大逆襲!
ベンチスコアだけを見れば、かつての2大「斬殺ライン」だったDeepSeek V4.1FlashとGLM-5.3-Flashを直接追い抜き、小モデルの新たな守門員となった。
公式のベンチスコアを見てみると、これはまさにGPT-6 Lunaを狙ったもので、項目ごとにLunaを上回っている。
ペリカン自転車テストがほぼ飽和状態になったため、新たに戦場に投入されたのは走るシマウマテストだ。
Haiku 5.5は価格まで完全にGPT-6 Lunaと対標している。
前世代のHaiku 4.5はちょうど1年前に登場し、価格は5.5の10倍だった。
ただしHaiku 5.5の価格には条件があり、プロンプトが10万token以内のリクエスト(Haiku 4.5のリクエスト量の90%を占める)は入出力価格が90%引き、10万tokenを超える部分は50%引きとなる。
これにより、キャッシュヒット入力の項目を除き、Haiku 5.5の価格はDeepSeek-V4.1 Flashより安くなった。
これでOpus 5.5が複雑な推論を担当、Sonnet 5.5が汎用実行を担当、Haiku 5.5が処理量と速度を担当と、賢者ぞろいで、あとはFableを残すのみとなった。
隣のOpenAIがもっと頑張らない限り、ClaudeがFable 5.5という大トューブの牙膏を絞り出す必要もなかっただろう。
まるでIntelとAMDがCPUを競い合っていた日々に戻ったかのようだ。
tokenizerを変更、token消費が増加
Haiku 5.5はeffort調整をサポートする初のHaikuモデルで、lowからmaxまでの5段階構成をシリーズから引き継いでいる。
前世代のHaiku 4.5はコンピュータ操作とコーディングでほぼ白紙を提出していたが、今世代は直接進化した。
OSWorld 2.1(agentが実際のコンピュータを操作し複数ステップのタスクを完了するテスト)を見ると:Low段階の正答率42.0%、1回あたりコスト$0.07;Max段階は72.4%、$0.61。Haiku 4.5はMax段階でわずか15.7%、$1.45だった。
つまり、5.5のLow段階は4.5のMax段階より正確で、しかも半額だ。
GDPval-AA v2.1(44の職業の実際の専門業務をテスト)でも同様のカーブを示す:Low段階Elo 1125、$0.01;Max段階1620、$0.87。4.5のMax段階は735、$0.24にとどまる。
ただしHaiku 5.5はtokenizerを変更した(Sonnet 5.5、Opus 5.5と同型)ため、同じタスクでもより多くのtokenを消費するので、実際に節約できる金額は表示価格の割引より少しいくらか少なくなる。
特にコード、表、非英語コンテンツの膨張率はさらに高い可能性がある。
AAテストでは、Haiku 5.5はAPI価格が安くなったものの、「タスク完了の平均コスト」は理想の範囲には達しなかった。
Sonnetの代わりにはならない
多くの人がHaiku 5.5に期待していたのは、一部のタスクでSonnet 5.5を代替でき、さらなるコスト削減につながることだった。
しかし今回は奇跡は起きず、小杯はやはり小杯だった。
Terminal-Bench 4.0ではHaiku 5.5は39.2%、Sonnet 5.5は70.6%を獲得。複雑な多ステップコーディング、ファイル横断のリファクタリング、長周期の自律計画の面で差は非常に明白だ。
Anthropic自身も、複雑なagentコーディングにはSonnet 5.5またはOpus 5.5を優先的に使うよう推奨している。
Haiku 5.5の価値は実行レイヤーにある。タスクがすでに分解され、受け入れ基準が明確で、並列で実行できるタスクだ。
たとえばCognitionのDevinはOpus 5.5をメインモデル、Haiku 5.5をサブエージェントとして使い、FrontierCodeの組み合わせで66.2%に達した。これは両モデル単独の実行よりも高い数値だ。
以前の業務でHaiku 4.5を使っていた場合、今回モデル名を変えるだけでそのまま本番投入できるわけではない。
budget_tokensによる手動の思考設定は直接エラーになるため、適応的思考とeffortパラメータに変更する必要があります。
temperature、top_p、top_kはすべてデフォルト値にロックされており、サンプリングパラメータで創造性の制御や多様な生成を行っていたアプリケーションはロジックを変更する必要があります。
assistantメッセージのプレフィル(prefill)が廃止されました。以前はプレフィルでJSONの先頭を強制していた書き方は、ツール呼び出しまたは構造化出力インターフェースに切り替える必要があります。
コンピュータ操作ツールのバージョンも更新され、computer_20250124からcomputer_toolset_20260801に変わりました。インターフェース形式と返却構造が異なる可能性があります。
さらに、適応的思考はデフォルトで有効になっており、レスポンスの最初のコンテンツブロックは本文ではなく思考ブロックである可能性があるため、解析ロジックはtypeフィールドでフィルタリングする必要があります。
5か所の変更があり、そのどれもがリクエストを直接エラーにしたり、想定外の構造を返させたりする可能性があります。
Anthropicは移行ガイドを提供しているので、切り替える前に一通り目を通すことをお勧めします。
おまけで2つの特典
Sonnet 5.5のキャッシュ読み取りは$0.20/Mから$0.10/Mに引き下げられ、Anthropicによると、ほとんどのagentタスクのコストがこれにより約20%削減されるそうです。
MaxおよびTeamサブスクリプションのユーザーは今週からAPIクレジットを受け取れます。Max 5xは毎月$100、Max 20xは毎月$200、Teamは最大$500/月をチーム内で共有できます。
これらのクレジットは、APIを使った実験やツール、アプリケーション、agentの構築に利用でき、すべてのモデルで共通です。
え?A社は私がCoding Planに支払ったお金を返金し、さらにAPIでもう一度使わせてくれるって?
では、OpenAIは何をしているのかというと、OpenAIはまたリセットカードを1枚送ってきました。
参考リンク:
[1]「https://www.anthropic.com/claude-haiku-5-5」
[2]https://x.com/AI_Screening/status/2107906044915749274?s=20