产品简介
Qwen3.8-Omni-Flash 是阿里通义千问团队于 2026 年 9 月 17 日发布的原生全模态模型,官方定位是让音视频类智能体任务真正跑得起来。它一次接受文本、图像、音频、视频四种输入,上下文窗口扩展到 1M token,可以放进整段会议录像或长视频做理解,不必先转写成文字再处理。
官方给出的对比数据是:29 项评测平均分相比上一代 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时的调用价格下降超过 98%,音视频输入下降超过 93%。价格这一项的幅度比分数更值得注意,因为全模态模型此前真正的瓶颈往往不是能力而是音视频输入的调用成本,成本不下来,长视频理解、实时语音智能体这类场景就没法进入生产环境。
在 Qwen 家族的版图里,Omni 系列负责多模态输入这一支,与以文本推理为主的 Qwen3.8-Max、Qwen3.8-Flash-Next 分工不同。官方把它描述为面向智能体交付的模型,也就是不仅理解音视频,还要在理解之后接着调用工具、完成任务。对需要处理会议记录、客服录音、监控视频、教学内容这类素材的团队,这是通义千问家族里目前最直接对口的一档。
核心功能
- 原生全模态输入:文本、图像、音频、视频在同一次调用里统一处理,不需要为每种模态各接一套管线,减少工程拼装。
- 1M token 上下文:可容纳整段长视频或长时间会议录音,做跨段落的整体理解与全局摘要,而不是切片之后各自为政。
- 音视频智能体交付:官方定位为理解之后继续调用工具完成任务,面向需要边看边听边动作的智能体场景。
- 音视频调用成本大幅下探:官方称音频输入每小时价格下降超过 98%,音视频输入下降超过 93%,长素材场景的预算更容易估算。
- 多模态评测表现:官方数据显示 29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%。
- 通义家族同代际协同:与 Qwen3.8-Max、Qwen3.8-Flash-Next 等文本主力模型同属 Qwen3.8 代际,混用与切换的适配成本低。
适合谁用
以下类型的用户会特别受益于 Qwen3.8-Omni-Flash:
- 会议与访谈录音的结构化整理:直接输入音频,产出纪要、待办与决策项
- 长视频内容理解:放进 1M 上下文做整体摘要、章节切分与要点提取
- 实时语音与视频智能体:客服、陪练、导览这类需要边听边看边动作的场景
- 教学内容处理:把课程录屏转成可检索的知识条目
- 多模态素材质检:对音视频做批量审核与标注辅助
优点亮点
- 原生全模态,一次接入覆盖四种输入模态
- 1M 上下文适合长音视频素材,不必先切分再拼接
- 音视频输入成本大幅下降,长素材场景的调用预算更容易估算
- 与通义千问家族其他成员同代际,迁移与混用成本低
- 官方评测显示多模态能力较上一代有明显提升
价格与方案
通过阿里云百炼平台调用,按输入输出模态与用量计费。官方称音频输入每小时价格较上一代下降超过 98%,音视频输入下降超过 93%,具体价格以百炼平台公示为准。
总结与建议
Qwen3.8-Omni-Flash 是通义千问在 2026 年 9 月 17 日推出的原生全模态模型,把文本、图像、音频、视频四路输入收进同一个模型,并配 1M token 上下文。官方数据显示 29 项评测平均分较上一代提升超过 25%,音频与音视频输入的每小时价格降幅分别超过 98% 和 93%。对需要处理长音频、长视频并希望模型理解之后继续调用工具完成任务的团队,它是通义家族里最对口的一档。