Artificial Analysis · X更新日

同一の成果物について、20タスクと8モデルの固定サブセットから、6つのハルシネーションチェッカーを比較しました。2段階チェックを実行し…

我々は、20タスクと8モデルの固定サブセットから得た同じ成果物について、6つのハルシネーション検証ツールを比較しました。2段階の検証は、GPT-6 Sol (high)、GPT-6 Luna (high)、Grok 4.7 (high)、Claude Opus 5.5 (high)、Claude Sonnet 5.5 (high)、Gemini 3.8 Flash (high) を用いて実施し、本番利用には GPT-6 Sol…

画像の出典 · Artificial Analysis · X

私たちは、20のタスクと8つのモデルの固定サブセットから得られた同一の成果物について、6つのハルシネーションチェッカーを比較しました。2段階チェックは GPT-6 Sol (high)、GPT-6 Luna (high)、Grok 4.7 (high)、Claude Opus 5.5 (high)、Claude Sonnet 5.5 (high)、Gemini 3.8 Flash (high) を使って実行し、本番運用には GPT-6 Sol (high) を選定しました。

この20タスクのサブセット全体で、GPT-6 SolとGPT-6 Lunaは概してより多くの重大なハルシネーションを特定した一方、Claude Sonnet 5.5とGemini 3.8 Flashははるかに少数しか特定しなかった。Claude Opus 5.5はすべてのモデル行において、Grok 4.7とClaude Sonnet 5.5の中間に位置した。合計で、Opusは99件の重大なハルシネーションを支持したのに対し、Grokは219件、Sonnetは57件、GPT-6 Solは470件であった。GPT-6 Solは、ソース文書に含まれない一般的な法律知識を除外するという、このチェックの誤り検出に関する保守的なアプローチにもかかわらず、より多くの重大なハルシネーションを特定した。

6人のチェッカー全員がGPT-6 Astraの出力に実質的なハルシネーションを見出さなかった一方、GPT-6 Solはタスクごとに0から0.20の範囲でした。両者は、すべてのチェッカーの下で実質的ハルシネーションが最も少ないモデル群に含まれていました。この比較はチェッカーの挙動の違いを示すものであり、カウントだけでは精度を証明したり自己選好を排除したりすることはできません。

原文の出典

Artificial Analysis · X

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください