Anthropic更新日

Claude Haiku 5.5 を紹介します

これまでで最速・最安・最高性能の小型モデルです。大量処理かつコスト重視のワークロード向けに設計されています。

画像の出典 · Anthropic

Claude Haiku 5.5 を紹介します。これまでにリリースした中で最も安く、最も速く、最も高性能な小型モデルです。

Claude Haiku 5.5 は、大量処理かつコスト重視のタスク向けに設計されています。要約、圧縮、データベースクエリ、分類リクエストなど、素早く繰り返し行うワークロードを確実に処理します。コーディング作業では、Opus 5.5 や Sonnet 5.5 とサブエージェントとして組み合わせるのに適しています。さらに、これまでで最速のモデルであるため、ライブカスタマーサポートやブラウザ操作など、速度が重要なタスクに特に適しています。¹

Haiku 5.5 は Haiku 4.5 よりもはるかに低い価格で利用できます。平均して、実行コストは約 75% 低くなりました。²

この発表に合わせて、モデルラインナップのコストパフォーマンス向上も行います。Claude Sonnet 5.5 のキャッシュ読み取り価格を半額にします。これにより、Sonnet 5.5 はほとんどのエージェント型ワークロードで約 20% 安く実行できるようになります。また、Claude Max および Team の契約者向けに、新しい月次 API クレジットを導入します。これは、Claude Platform 上で動作する新しいエージェントやアプリケーションの構築を支援するためのものです。

パフォーマンス

Claude Haiku 5.5 の各種ベンチマークでのパフォーマンスは以下の通りです:

Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5参考値
知識労働GDPval-AA v2.1162073514371840
知識労働AA-Briefcase v1.1157861413361824
コンピュータ操作OSWorld 2.172.4%オフラインサブセット15.7%オフラインサブセット48.9%オフラインサブセット83.9%オフラインサブセット
多分野推論Humanity's Last Exam45.9%ツールなし10.2%ツールなし—56.9%ツールなし
57.4%ツールあり18.7%ツールあり—64.5%ツールあり
エージェント型コーディングTerminal-Bench 4.039.2%0.0%16.4%70.6%
エージェント型コーディングFrontierCode 1.1 (Main)46.4%—42.4%52.1%Xhigh
視覚的推論Chartography46.4%ツールなし6.4%(ツールなし)29.1%(ツールなし)61.6%(ツールなし)

評価の実施方法の詳細については、以下をご覧ください: Haiku 5.5 システムカード.

Haiku 5.5 は、調整可能な effort 設定を備えた初の Haiku クラスモデルです。つまり、他のモデルと同様に、ユーザーはコストと知性のどちらを優先するかを選択できます。以下のチャートは、各 effort 設定における Haiku 5.5 の 3 つのベンチマークでのパフォーマンスを示しています:

OSWorld 2.1(オフラインサブセット)精度とコスト

OSWorld 2.1 は、エージェントが実際のコンピュータを操作して長く複数ステップのタスクを完了できるかを測定します。

GDPval-AA v2.1 精度とコスト

Artificial Analysis の GDPval-AA v2.1 は、44 の職種にわたる実世界の専門業務についてエージェントを評価します。

Humanity’s Last Exam(ツールなし)精度とコスト

Humanity’s Last Exam(HLE)は、専門家レベルの学術知識と推論能力を試すテストです。

初期テストにおいて、当社の顧客は上記のパフォーマンスとコストの改善と一致する結果を報告しました。新モデルについての彼らの声は以下の通りです:

引用

「Claude Haiku 5.5 には、特にその速度に大変感銘を受けました。当社の AI エージェント製品である AI Teammates 向けの評価スイートで、バグの優先順位付け、プロジェクトのセットアップ、大規模ポートフォリオから高リスクまたは遅延している作業の検出といったユースケースを対象にテストを実施しました。現在使用しているモデルと比較して、タスク完了のレイテンシが 30% 以上削減され、エージェントの 1 ターンあたりの推論が最大 2.5 倍高速になりました。明らかにキビキビとした体験です。」

企業 Asana / 著者 Aaron Vinh、Staff Software Engineer

料金

以下の表は、Claude Haiku 5.5 の料金が他のモデルとどう比較されるかを示しています。Haiku 5.5 は、最大 100,000 トークンのプロンプトを含むタスクで使用する場合に特に優れたコストパフォーマンスを発揮します。こうしたタスクは、前世代の Haiku モデルへのリクエストの約 90% を占めています。

100 万トークンあたりの価格Haiku 5.5
最大 100k のプロンプト / 100k 超のプロンプト
Haiku 4.5Sonnet 5.5
キャッシュ読み取り$0.01 / $0.05$0.10$0.10
キャッシュ書き込み$0.125 / $0.625$1.25$2.50
入力トークン$0.10 / $0.50$1.00$2.00
出力トークン$0.50 / $2.50$5.00$10.00

安全性

アラインメント。 Claude Haiku 5.5 は、Haiku 4.5 と比較して、当社のほぼすべてのアラインメント評価において大幅な改善を示しています。特に、ミスアラインメントした行動の事例がはるかに少なく、悪用への協力意向も低くなっています。同モデルの システムカード には、当社の評価プロセスと結果がより詳しく記載されています。

安全対策。 その能力に見合って、Haiku 5.5 のサイバーセキュリティ安全対策は Haiku 4.5 のものよりも制限が厳しく、しかし最近の他のモデルに適用したものよりはやや制限が緩くなっています。サイバーセキュリティにおいて、これらは Sonnet 5.5 向けの安全対策よりも幅広い防御タスクを許可しますが、それでもペネトレーションテストや、攻撃者に使われる可能性がより高いその他の手法はブロックします。

Haiku 5.5 の生物学安全対策は、Sonnet 5、Sonnet 5.5、Opus 5 と同じです。これらは研究上の生物学に関する質問を許可しますが、害を引き起こす可能性が高いと判断されるリクエストへのアクセスは制限します。より幅広い生物学およびサイバー活動に取り組む組織は、当社の Life Sciences Verification Program および Cyber Verification Program.

提供状況

Claude Haiku 5.5 は、Amazon Web Services、Google Cloud、Microsoft Azure を含むすべてのプラットフォームで現在利用可能です。Claude Platform では、開発者は以下から始められます。 claude-haiku-5-5.

詳細については、当社の マイグレーションガイド をご覧ください。

さらなるアップデート

Claude Haiku 5.5の新料金に合わせて、モデルおよび製品の価値をさらに高める改良を行います。

まず、本日より、 Claude Sonnet 5.5のキャッシュ読み取りの価格を引き下げます. キャッシュ読み取りのコストが50%低下しました。ミリオントークンあたり$0.20ではなく$0.10になります。キャッシュ読み取りはモデルのトークン消費の大きな割合を占めるため、これによりほとんどのエージェント系タスクにおけるSonnet 5.5のコストが約20%削減されます。

たとえば、この価格引き下げがTerminal-Bench 4.0におけるSonnet 5.5のコスト対パフォーマンスにどう影響するかは以下の通りです:

Terminal-Bench 4.0 正確性とコスト

Terminal-Bench 4.0は、コマンドラインインターフェース内で複雑な複数ステップの専門的タスクをモデルがどれだけ well 完了できるかを測定します。

このチャートは、Haiku 5.5と私たちの大型モデルとの重要な違いを示しています。Terminal-Bench 4.0で測定されるような複雑なエージェント型コーディングタスクには、Sonnet 5.5とOpus 5.5が引き続きより良い選択肢です。一方、Haiku 5.5は、従来のClaudeではコスト的に実現が難しかった、より範囲の狭いタスク——コンパクション、要約、サブエージェント作業など——に最も適しています。

第二に、今週中に、 Claude Platformで使用できる新しい月次APIクレジットを、すべてのMaxおよびTeam契約者に提供します。Max 5xユーザーは毎月100ドル分のクレジットを、Max 20xユーザーは200ドルを、Team契約者はユーザー間で共有される最大500ドルを受け取ります。これらのクレジットは、ユーザーが当社のAPIを呼び出すツール、アプリ、エージェントの構築を試験できるように設計されています。当社のどのモデルでも使用できます。詳細については、 ヘルプセンターの記事をご覧ください.

開発者の皆さま向けに、 Claude Python SDKおよびTypeScript SDKを更新し、ベータ版としてcomputer useとbrowser useのサポートを追加します 。Haiku 5.5は、速度、能力、価格の組み合わせにより、これらのタスクに特に適しています。詳細については Claude Platformのドキュメントをご覧ください.

脚注

1 Claude Haiku 5.5は、各モデルの標準速度において、これまでで最も速いモデルですが、Fast Modeで動作するOpusモデルよりは低速です。

2 Claude Haiku 5.5は、100,000トークンまでのリクエストにおいてClaude Haiku 4.5より90%低価格、100,000トークンを超えるリクエストでは50%低価格です。Haiku 4.5では、リクエストの90%が前者のカテゴリに該当していました。この計算には、Haiku 4.5とHaiku 5.5の間で、特定の作業を完了するのに使用されるトークン数の変化も考慮されています。Haiku 5.5は更新されたトークナイザー(Sonnet 5.5およびOpus 5.5と同様のもの)を搭載しており、タスクあたりでやや多くのトークンを使用します。

原文の出典

Anthropic

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください