ChengRang
EN

StepAudio 3 热门 新增

AI 音频音乐 免费试用
本页为 阶跃 AI 的版本 / 子产品详情。查看 阶跃 AI 总览 →

阶跃星辰 2026/9/15 发布的语音大模型系列,含 Realtime / ASR / TTS / Gen / Music 五款并同步上线开放平台:Realtime 原生全双工,Conversational Dynamics 综合得分 98.9% 全球第一、语音推理准确率 99.7% 第一;ASR 非流式词错率 1.7% 并列全球第一;TTS 还原笑声/迟疑/结巴等副语言;Gen 一条指令生成人声+音效+环境音+BGM,Music 支持 ABC 记谱法多轮创作

阶跃星辰 语音模型 全双工 ASR TTS 音乐生成
访问 StepAudio 3 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

StepAudio 3 是阶跃星辰于 2026 年 9 月 15 日发布的新一代语音大模型系列,包含五款模型:StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 与 StepAudio 3 Music,分别对应实时语音交互、复杂场景语音理解、真人级语音生成、完整音频内容生成与音乐创作。五款模型均已上线阶跃星辰开放平台。

Realtime 是这一系列里最能说明方向的一款。它支持原生全双工实时对话,可以同时理解语义、语气、情绪、副语言特征与环境声音,据此判断什么时候该接话、什么时候该等待,也能处理用户打断与连续反馈。复杂问题上它支持推理与语音生成并行,Tool Call 与长任务可以异步执行而不阻塞当前会话。在 Artificial Analysis Conversational Dynamics 榜单上,它以 98.9% 的综合得分位列全球第一;Speech Reasoning 榜单上以 99.7% 的语音推理准确率同样位列第一。

另外四款围绕音频生产的不同环节展开。ASR 把高精度语音识别与大模型的上下文理解能力结合,覆盖中文、英文、方言、中英混说、长音频,以及医疗、法律、金融、汽车、编程等专业场景,也能处理低音量、快语速、吐字不清、唱歌、带背景音乐等复杂输入,非流式语音识别的词错率(WER)为 1.7%,并列全球第一。TTS 面向实时交互场景,在音色、语调层次、节奏与停顿上贴近自然口语,能还原笑声、迟疑、结巴、重复、改口等副语言表现,也可以根据语义内容自主调整情绪语气,采用流式生成架构边生成边播放。

Gen 与 Music 面向内容生产。Gen 把传统音频制作里录制、剪辑、混音的链条压缩成一步,用自然语言描述加参考音频即可统一生成角色人声、音效、环境音与背景音乐,并支持指定对白、音效与背景音乐出现的时间与顺序。Music 支持零样本生成与基于 ABC 记谱法的多轮交互创作,输入可以是歌词、清唱、参考歌曲或乐谱,用自然语言控制曲风、人声、旋律、节奏、乐器与情绪;在清唱配乐场景下,一段清唱即可自动补出和声、节奏、乐器与完整编曲。

核心功能

适合谁用

以下类型的用户会特别受益于 StepAudio 3:

优点亮点

价格与方案

五款模型均已上线阶跃星辰开放平台(platform.stepfun.com),按模型分接口调用,ASR 与 TTS 接入门槛较低,Realtime 需要处理双向音频流与会话状态。具体价格与免费额度以阶跃星辰开放平台公告为准。

总结与建议

StepAudio 3 把语音模型从单一识别或生成扩展成完整的音频内容生产与实时交互能力,五款模型各管一段:Realtime 管实时对话,ASR 管听得准,TTS 管说得像,Gen 管一条指令生成整套声音,Music 管把清唱补成编曲。三个全球第一都落在 Artificial Analysis 的榜单上,Realtime 的 98.9% 对话动态得分与 99.7% 语音推理准确率是这一代最硬的指标。做语音助手、客服、有声内容或音乐创作的产品,可以按需求先接 ASR 或 TTS,把实时对话放到下一步;需要评估实时语音体验时,这份系列值得与 Gemini 3.8 Live 放在一起对比测试。

版本演进

分类
AI 音频音乐
价格
免费试用
标签
阶跃星辰 · 语音模型 · 全双工