Artificial Analysis Articles更新日

AnthropicがClaude Haiku 5.5をリリース

AnthropicがClaude Haiku 5.5をリリースし、Artificial Analysis Intelligence Indexで43を記録。前回のHaikuリリースから1年で26ポイント上昇 モデルページを見る Haiku 5.5は、Anthropicのeffort設定とアダプティブ思考を備えた初のHaikuモデルであり、Anthropicは段階的料金を導入しました。 Haiku

画像の出典 · Artificial Analysis Articles

AnthropicがClaude Haiku 5.5をリリースし、Artificial Analysis Intelligence Indexで43を記録。前回のHaikuリリースから1年で26ポイント上昇

モデルページを見る

Haiku 5.5は、Anthropicのeffort設定とアダプティブ思考を備えた初のHaikuモデルであり、Anthropicは段階的料金を導入しました。

Haiku 5.5は前世代よりも安価です。100kトークンまでのプロンプトに対し、1M入力/出力トークンあたり$0.10/$0.50です(GPT-6 Lunaと同等で、前のHaikuモデルの10%)。ただし、この料金は100kを超えると5倍の$0.50/$2.50に上昇します。サイトにはまだ段階的料金が反映されていないため、Haiku 5.5の暫定的なコスト数値にはこの段階的コスト上昇は含まれていません。サポートに取り組んでおり、近くCost per Taskのcoverageで追ってお知らせします。

主なポイント:

➤ 小型モデルクラスで首位のパフォーマンス: 最大effort時、Haiku 5.5はGLM-5.3 Flash(42)、Gemini 3.8 Flash(41)、GPT-6 Luna(38)などのモデルをわずかに上回ります。そのスコアは2.8TパラメータのオープンウェイトモデルであるKimi K3(44)に匹敵し、Claude Sonnet 5.5(max、56)には13ポイント及ばません

➤ GPT-6 Lunaと比較した多いトークン使用量: Haiku 5.5(max)はIntelligence Indexのタスクあたり約162kの出力トークンを使用し、GPT-6 Luna(max、約50k)の約3倍です。xhighからmaxに移行すると、トークンが約1.8倍増えて2ポイント追加されます。類似の知能レベルでもGPT-6 Lunaより多くのトークンを使用します: Haiku 5.5(high)はタスクあたり約55kトークンで38を記録し、Luna(max)は約50kトークンで38であり、低いeffort設定ではその差はさらに広がります

➤ エージェント的なナレッジワークに高い能力: 現実的なナレッジワークタスク向けの非公開評価であるAA-Briefcaseで、Haiku 5.5(max)は1578 Eloに達し、Kimi K3やGLM-5.3などのモデルを上回り、Muse Spark 1.3(max)に匹敵します

➤ ターミナル利用の改善: Terminal-Bench 4.0では33%を記録し、Haiku 4.5の0%から向上しました。これはGLM-5.3 Flashと同等で、Gemini 3.8 Flash(20%)とGPT-6 Luna(13%)を上回ります

➤ 事実知識は低いが、ハルシネーションは比較的少ない: 小型モデルクラスとして予想される通り、Haiku 5.5は同系列モデルより事実知識が低くなっています。AA-Omniscienceの精度は36%で、Gemini 3.8 Flashの55%やGPT-6 Lunaの44%に対して低いものの、これは一部、知らないことを認める意欲が高いためです。ハルシネーション率は40%と、55%や77%より低くなっています

➤ AutomationBench-AAの結果は過小評価の可能性: Haiku 5.5は35%を記録し、GPT-6 Luna、Gemini 3.8 Flash、GLM-5.3 Flashの53〜60%に対して低くなっています。リリース前テスト中に、安全性の拒否に関する問題によりモデルが過剰に拒否していました。Anthropicはこの問題の解決に取り組んでおり、修正後にこの評価を再実行し、スコアの上昇を見込んでいます

その他のモデル詳細:

➤ コンテキストウィンドウ: 100万トークンで、Claude 4.5 Haikuの200kから増加

➤ 料金: 100kトークンまで1M入力/出力トークンあたり$0.10/$0.50、100k超は$0.50/$2.50。キャッシュ読み取りは$0.01(100k超は$0.05)、5分間のキャッシュ書き込みは$0.125(100k超は$0.625)

➤ マルチモダリティ: テキストおよび画像入力、テキスト出力

Claude Haiku 5.5(max)はIntelligence Indexのタスクあたり約162kの出力トークンを使用し、Opus 5.5(max)より多く、GPT-6 Luna(max)の約3倍です。すべてのeffort設定において、Haiku 5.5はGPT-6 Lunaよりも多くの出力トークンを使用して類似のIntelligence Indexスコアに達します

Claude Haiku 5.5(max)は、非公開のフロンティアナレッジワーク評価であるAA-Briefcaseで1578 Eloに達し、GPT-6 Astra(max)およびClaude Fable 5.1(high)の信頼区間内にあります

Claude Haiku 5.5の各effort設定におけるArtificial Analysis Intelligence Indexの個別評価の詳細内訳

原文の出典

Artificial Analysis Articles

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください