ChengRang
EN

Qwen3.8-Omni-Flash 新增

AI 开发平台 免费试用
本页为 通义千问 的版本 / 子产品详情。查看 通义千问 总览 →

阿里通义千问 2026/9/17 发布的原生全模态模型,文本、图像、音频、视频四路输入配 1M token 上下文;官方称 29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%、音视频输入下降超过 93%,主打音视频智能体任务交付

全模态 音视频 智能体 Qwen 1M 上下文
访问 Qwen3.8-Omni-Flash 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

Qwen3.8-Omni-Flash 是阿里通义千问团队于 2026 年 9 月 17 日发布的原生全模态模型,官方定位是让音视频类智能体任务真正跑得起来。它一次接受文本、图像、音频、视频四种输入,上下文窗口扩展到 1M token,可以放进整段会议录像或长视频做理解,不必先转写成文字再处理。

官方给出的对比数据是:29 项评测平均分相比上一代 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时的调用价格下降超过 98%,音视频输入下降超过 93%。价格这一项的幅度比分数更值得注意,因为全模态模型此前真正的瓶颈往往不是能力而是音视频输入的调用成本,成本不下来,长视频理解、实时语音智能体这类场景就没法进入生产环境。

在 Qwen 家族的版图里,Omni 系列负责多模态输入这一支,与以文本推理为主的 Qwen3.8-Max、Qwen3.8-Flash-Next 分工不同。官方把它描述为面向智能体交付的模型,也就是不仅理解音视频,还要在理解之后接着调用工具、完成任务。对需要处理会议记录、客服录音、监控视频、教学内容这类素材的团队,这是通义千问家族里目前最直接对口的一档。

核心功能

适合谁用

以下类型的用户会特别受益于 Qwen3.8-Omni-Flash:

优点亮点

价格与方案

通过阿里云百炼平台调用,按输入输出模态与用量计费。官方称音频输入每小时价格较上一代下降超过 98%,音视频输入下降超过 93%,具体价格以百炼平台公示为准。

总结与建议

Qwen3.8-Omni-Flash 是通义千问在 2026 年 9 月 17 日推出的原生全模态模型,把文本、图像、音频、视频四路输入收进同一个模型,并配 1M token 上下文。官方数据显示 29 项评测平均分较上一代提升超过 25%,音频与音视频输入的每小时价格降幅分别超过 98% 和 93%。对需要处理长音频、长视频并希望模型理解之后继续调用工具完成任务的团队,它是通义家族里最对口的一档。

分类
AI 开发平台
价格
免费试用
标签
全模态 · 音视频 · 智能体
官网