新モデルの追加
EmbeddingGemma2
EmbeddingGemma 2は、Gemma 4アーキテクチャを基盤とするGoogleのマルチモーダル埋め込みモデルです。テキスト、画像、音声、動画を、単独または1つの入力に組み合わせた形で、クロスモーダル検索、意味的類似度、クラスタリング、分類に対応した共有の768次元ベクトル空間へエンコードします。Matryoshka Representation Learningを使用しており、埋め込みは512、256、128次元に切り詰めることができます。また、視覚および動画のトークン予算を設定可能で、未使用のビジョンまたはオーディオタワーはロード時に無効化してメモリを節約できます。
リンク: ドキュメント * 何か何か (#49364) by @vasqu in #49364
破壊的変更
ルーターがロジットを計算するすべてのMoEモデルは、現在それを返すように output_router_logits=True、Qwen3-MoE のパターンに従い(a router_logits ベースモデルのレコーダーに、 MoeModelOutputWithPast バックボーンからのMoE因果LM出力、およびヘッドからのMoE因果LM出力)を返すようになったため、以前の出力やその有無に依存していたコードは、これらの出力クラスからルーターのロジットを読み取るようにしてください。
* 🚨 ルーターのロジットを計算するすべてのMoEモデルからルーターのロジットを返す(#48920)by @qgallouedec
Owlv2ForObjectDetection.embed_image_query 最も高い objectness スコアを持つクエリボックスを選択するようになり、元の OWLv2 ノートブックと同様に、OWL-ViT のヒューリスティックではなくなったため、画像ガイドのクエリ埋め込みおよび検出結果は以前のリリースと異なる場合があります。
* 🚨 Select the OWLv2 image query by objectness (#49200) by @qgallouedec
The "paged|" SDPAおよびflash attention実装向けのプレフィックスは非推奨となったため、ユーザーは通常のattention実装(例: sdpa または flash_attention_2)を連続バッチング(continuous batching)に使用するのではなく paged|sdpa または paged|flash_attention_2。
* 🚨 注意 🚨 SDPAとflash向けの"paged|"プレフィックスを非推奨化 (#49112) by @remi-or
通常の flash および SDPA アテンション関数(flash_attention.py, sdpa_attention.py「) は現在、連続バッチングを直接サポートしており、」 "paged|..." これらの実装はそちらにリダイレクトされますが、eagerでは依然として "paged|eager" prefix.\n* 🚨 注意 🚨 Make regular attention support CB (#49101) by @remi-or
コンティニュアスバッチングにおいて、インデックスベースおよびブロックテーブルの各パスに対するキャッシュ更新が単一の呼び出しに統合されました。これにより、キャッシュ更新関数の動作がわずかに変化し、個別の更新パスを呼び出しているカスタムコードに影響が及びます。 * 🚨 [CB] 🚨 インデックスとブロックテーブルパスの更新を統合 (#49088) by @remi-or
削除に備えて連続バッチングの内部実装が変更されました "paged": `max
* 🚨 [CB] 🚨 "paged"を削除する前の小さな修正 (#49069) by @remi-or
並列化
エキスパート並列性にトークンディスパッチ実装が追加され、新しく導入された ep_dispatch_experts プランルールであり、現在はQwen3 MoEとMellumのデフォルトとなっており、EPサイズがTPサイズと一致するという要件を撤廃しました。この Trainer expert parallelism でも動作するように適応され、ドキュメントには PEFT アダプタが tensor parallelism をサポートすることが追記されました。pipeline-parallel な chart2table 推論に関する CI 関連の修正も含まれています。
- [
distributed]: TrainerをExpert Parallelに対応させるよう改修 (#48873) 投稿者 @3outeille、[#48873] - [
distributed] expert-parallelのトークンディスパッチを追加、Qwen3 MoEでデフォルト化 (#48865) 投稿者 @3outeille、[#48865] - pp chart2table推論を修正 (#49225) 投稿者 @zucchini-nlp、[#49225]
- [docs] PEFTアダプター向けTP (#49060) 投稿者 @stevhliu、[#49060]
キャッシュ
このリリースでは量子化キャッシュの処理を修正しています: generate がユーザーの cache_configを変更しなくなり、 QuantizedLayer.reorder_cache が修復されました。さらにレイヤーごとのキャッシュ設定が追加され、 DynamicCache と StaticCache がそれぞれの設定(スライディングウィンドウ、attentionチャンクサイズ、conv状態、attentionヘッド数)から各レイヤーを初期化できるようになり、異種混合モデルへの対応が向上しました。また別件として、マスクとキャッシュに関する非推奨サイクルを
- 量子化キャッシュを修正 (#48700) 投稿者 @jiqing-feng、[#48700]
- [CI] check_bad_commit: EFSキャッシュを使用してXet FUSEのOOM(exit 137)を回避 (#49273) 投稿者 @ydshieh、[#49273]
- レイヤーごとのキャッシュ設定をサポート (#48178) 投稿者 @eladsegal、[#48178]
- マスクとキャッシュの非推奨サイクルを削除 (#49231) 投稿者 @Cyrilvallez、[#49231]
バグ修正と改善
- "[CI] Temporarily disable AMD scheduled CI trigger" (#49271) をRevert (#49362) 投稿者 @ydshieh、[#49362]
- ALM テストを修正中... (#49355) by @zucchini-nlp in [#49355]
- DataCollatorForLanguageModeling が seed=0 を無視する問題を修正 (#49349) by @akanyaani in [#49349]
- 評価モデル向けの明示的なカーネル化モードを修正 (#49339) by @DimensionSTP in [#49339]
- fix(cohere_compass): input_modalities に video を追加 (#49320) (#49323) by @destopianpirate in [#49323]
- GPT-OSS: クランプされた SwiGLU の alpha と limit を config から読み込む (#49346) by @IlyasMoutawwakil in [#49346]
- [
distributed] デフォルトの MoEep_plansトークンディスパッチ (#49160) by @3outeille in [#49160] - CI を Python 3.11 に移行、バージョンは
.python-versionで設定 (#49311) by @tarekziade in [#49311] - doc-builder main docs ワークフローのピンを更新 (#49350) by @paulinebm in [#49350]
- [
distributed] tp_plan と ep_plan を分離 (#48859) by @3outeille in [#48859] - [
distributed] dense と expert のデバイスメッシュを追加 (#48857) by @3outeille in [#48857] - doc-builder ワークフローのピンを更新 (#49342) by @paulinebm in [#49342]
- 新しい処理バックエンドの登録を許可 (#48984) by @zucchini-nlp in [#48984]
- WatermarkDetector の繰り返し n-gram カウントを修正 (#49315) by @LE0-Lin in [#49315]
- minicpm 4.6V の動画バッチ処理と CI を修正 (#49259) by @zucchini-nlp in [#49259]
- DeepseekV4 の lm_head から colwise_gather_output を削除 (#49314) by @3outeille in [#49314]
- CLIPSegForImageSegmentation の
labelsdocstring を修正 (#49001) by @qgallouedec in [#49001] - [CI] AMD の定期 CI トリガーを一時的に無効化 (#49271) by @ydshieh in [#49271]
- setup.py の依存関係から未使用の pandas エントリを削除 (#49329) by @tarekziade in [#49329]
- pandas>=3 で run_glue.py のラベル ID が文字列になる問題を修正 (#49326) by @tarekziade in [#49326]
- [Fix] 古い 2 つのテストを含む旧テストファイルを削除 (#49280) by @remi-or in [#49280]
- マルチ軸 position id (Qwen3-VL) でのチャンクドプリフィルを修正 (#49319) by @dacorvo in [#49319]
- 上書きするよりも
Mixinで修正すべき (#49105) by @zucchini-nlp in [#49105] - RoPE を matmul ではなく mul で実行 (#49265) by @Rocketknight1 in [#49265]
- 非推奨のパイプラインはリダイレクトされ、削除されたパイプラインはエラーを発生させるべき (#49308) by @LysandreJik in [#49308]
- 今後の
torch_tpuバックエンドでのモデルテストを有効化 (#49207) by @tengomucho in [#49207] - バッチ拡張後のエンコーダの繰り返しペナルティのソース行を修正 (#49262) by @gitedmond in [#49262]
- 指数減衰長ペナルティでマスクされた EOS スコアを保持 (#49260) by @gitedmond in [#49260]
- [CI] 特定のものだけが必要な場合にすべてのアーティファクトを取得しないように修正 (#49282)、作成者 @ydshieh、[#49282]
- 「[CI] ssh-runner: バケットとEFSランナーを切り替えるためのオプションのcache_type入力を追加 (#49159)」をRevert (#49270)、作成者 @ydshieh、[#49270]
- compute_lossがすでにgradient accumulationに対してスケーリング済みかどうかを宣言するためのTrainer.loss_is_scaled_for_gaを追加 (#49240)、作成者 @qgallouedec、[#49240]
- precomputed flash kwargsの競合を修正 (#47928)、作成者 @IlyasMoutawwakil、[#47928]
- modular examplesを再適用 (#49230)、作成者 @Cyrilvallez、[#49230]
- 存在しないものを削除 (#49232) by @Cyrilvallez in [#49232]
- ロータリーの非推奨サイクルを削除 (#49228) by @Cyrilvallez in [#49228]
- [
GTE] メモリミックスインを追加 (#49234) by @vasqu in [#49234] - [CB] CBをよりデバイス非依存にし、XPUのサポートを追加 (#49156) by @remi-or in [#49156]
- チェックポイントからの再開による最終メトリクスを修正 (#49208) by @SunMarc in [#49208]
- [ESM/Persimmon/NllbMoe/ESMFold] safetensorsリポジトリを使用してbucket CIランナー上のXet FUSEのSIGBUS/IOErrorを修正 (#49194) by @ydshieh in [#49194]
- 開発者アップデート (#49212) by @vasqu in [#49212]
重要なコミュニティの貢献
以下の貢献者は、前回のリリース以降、ライブラリに重要な変更を加えました:
- @vasqu
- Smthn smthn (#49364)
- [
GTE] メモリミックスインを追加 (#49234) - 開発者アップデート (#49212)
- @remi-or
- [Fix] 古いテストを2つ含む古いテストファイルを削除 (#49280)
- [CB] CBをよりデバイス非依存にし、XPUのサポートを追加 (#49156)
- 🚨 注意 🚨 SDPAとflashの "paged|" プレフィックスを非推奨化 (#49112)
- 🚨 注意 🚨 通常のattentionでCBをサポート (#49101)
- 🚨 [CB] 🚨 インデックスとブロックテーブルパスのFuseアップデート (#49088)
- [Refactor] flash-attentionのユーティリティの一部を読みやすく変更 (#49071)
- 🚨 [CB] 🚨 "paged" の削除前の軽微な修正 (#49069)