Arena · X

我们在 Agent Arena 上评测了 @typesafeai 的 Jev Router。

我们在 Agent Arena 上评测了 @typesafeai 的 Jev Router。我们涵盖超过 4,700 个真实智能体会话的测试显示:1. Jev Router 在当前帕累托前沿上没有改进。在性能与 DeepSeek V4.1 Flash (Max) 相近的情况下,该方案的成本高出 38%,且其中位模型请求延迟高出 1.7 倍。2. 不过,它确实大多路由到帕累托高效的模型。它选择最多的 LLM 是 DeepSeek V4.1…

配图来源 · Arena · X

我们在 Agent Arena 上评测了 @typesafeai 的 Jev Router。

我们涵盖超过 4,700 个真实智能体会话的测试显示:

1. Jev Router 在当前帕累托前沿上没有改进。在性能与 DeepSeek V4.1 Flash (Max) 相近的情况下,该方案的成本高出 38%,且其中位模型请求延迟高出 1.7 倍。

2. 不过,它确实大多路由到帕累托高效的模型。它选择最多的 LLM 是 DeepSeek V4.1 Flash,GPT-6.1 Sol 和 GPT-6 Luna 也是常见选择。

3. Jev Router 的关键优势是可引导性。其 +10% 的得分几乎与 Claude Opus 5.5 (High)(+10.48)持平。这凸显了 Jev 根据用户反馈有效路由到更强 LLM 的好处。

更多洞见请见下方帖子串。

原始出处

Arena · X

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准