Arena · X

我们还研究了“错误归因”现象,即智能体将陈述、请求、选择、批准或事实归咎于用户,但……

Arena调查了智能体的“虚假归因”现象,即智能体把陈述、请求、选择或事实归于用户,但与用户提供的证据相矛盾。结果显示不同模型模式各异:GPT-6 Luna与Astra很少错误引用用户(15.6%和28.6%)却常错误归因(53.1%和48.2%),同系GPT-6 Sol错误陈述用户历史的比例最高(23.5%)。数据来自模型对比评测,属可靠性层面的发现,未涉及更深的安全机制分析。

配图来源 · Arena · X

我们还研究了“错误归因”现象,即智能体将某句话、请求、选择、批准或事实归因于用户,但用户提供的证据却与这一归因相矛盾。

有趣的是,有些模型错误引用了用户的要求,而另一些模型则将用户的请求归功于其他人。

不同模型中存在不同的模式:GPT-6 Luna和Astra的误引用率很少(分别为15.6%和28.6%),但误归因率较高(分别为53.1%和48.2%)。有趣的是,其兄弟模型GPT-6 Sol的误记录用户历史记录的比例最高,为23.5%。

原始出处

Arena · X

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准