【大屏时代】首页 > 3D快报内容详情

Cloudflare 发布开放权重决策模型 Clef-omni,新增支持音视频多模态输入

58分钟前 8 大屏时代

Cloudflare 于 10 月 9 日正式发布公告,推出了全新的开放权重决策模型 Clef-omni。该模型在原有的文本与图像处理能力基础上,进一步扩展了对音频和完整视频格式的支持,能够通过单次 API 调用同时处理多模态内容。

多模态升级与架构解析

在多模态支持方面,传统的 Clef 模型主要处理文本、图像以及通过按时间间隔抽取的静态连续画面。而新推出的 Clef-omni 则原生支持 wav、mp3、mp4 和 webm 等音视频格式。这一改进省去了开发者以往需要额外部署语音转写及音视频拆分流程的繁琐步骤,可以用单一模型高效处理多样化的输入需求。

根据官方公布的技术细节,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,并保留了其核心理解能力。该模型主要面向结构化决策任务,不生成常规的文本输出。在性能表现上,纯文本请求的中位响应时间约为 130 毫秒,图像约为 150 毫秒;处理一段包含声音的 21 秒视频大约仅需 1.5 秒即可完成评分。

价格下调与系列模型对比

伴随新模型的发布,Cloudflare 同步下调了 Clef-flash 的使用价格,每百万输入 Token 的费用从 0.09 美元大幅下调至 0.038 美元,降幅约为 58%,其托管版的上下文窗口也从 64k 调整至 24k。整体而言,当前该系列模型的阶梯定价满足了不同开发者的成本与性能需求。



相关文章

相关标签: Cloudflare 发布开放权重决策模型 Clef-omni,新增支持音视频多模态输入