AIbase更新于 原文 · 中文

Cloudflare 发布开放权重决策模型 Clef-omni,新增支持音视频多模态输入

Cloudflare于10月9日发布开放权重决策模型Clef-omni。它在原有文本、图像处理基础上,新增音频和完整视频支持,可通过单次API调用同时处理多模态内容。相比传统Clef仅处理文本、图像及按时间间隔抽取的静态连续画面,Clef-omni原生支持wav、mp3等音频格式,并涉及多模态升级与架构解析。

Cloudflare 于 10 月 9 日正式发布公告,推出了全新的开放权重决策模型 Clef-omni。该模型在原有的文本与图像处理能力基础上,进一步扩展了对音频和完整视频格式的支持,能够通过单次 API 调用同时处理多模态内容。

多模态升级与架构解析

在多模态支持方面,传统的 Clef 模型主要处理文本、图像以及通过按时间间隔抽取的静态连续画面。而新推出的 Clef-omni 则原生支持 wav、mp3、mp4 和 webm 等音视频格式。这一改进省去了开发者以往需要额外部署语音转写及音视频拆分流程的繁琐步骤,可以用单一模型高效处理多样化的输入需求。

根据官方公布的技术细节,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,并保留了其核心理解能力。该模型主要面向结构化决策任务,不生成常规的文本输出。在性能表现上,纯文本请求的中位响应时间约为 130 毫秒,图像约为 150 毫秒;处理一段包含声音的 21 秒视频大约仅需 1.5 秒即可完成评分。

价格下调与系列模型对比

伴随新模型的发布,Cloudflare 同步下调了 Clef-flash 的使用价格,每百万输入 Token 的费用从 0.09 美元大幅下调至 0.038 美元,降幅约为 58%,其托管版的上下文窗口也从 64k 调整至 24k。整体而言,当前该系列模型的阶梯定价满足了不同开发者的成本与性能需求。


原始出处

AIbase

内容说明

原始发布及相关权利归来源方。