阿里千问音频 3.1 五款模型齐发:语音识别最高降价 95%,AI 多语内容成本跳水
语音识别直接打 95 折、实时交互降 85%、语音合成降 70%——阿里千问 9 月 23 日一口气发布 Qwen-Audio-3.1 系列五款语音模型,同时把全线音频服务价格砍到地板。AI 音频从「 premium 能力」正在变成「白菜基建」。
据新浪科技及财联社消息,9 月 23 日下午,千问正式推出 Qwen-Audio-3.1 系列语音大模型,对语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大核心模型全面升级,同时新增基于下一代架构的音频理解模型 ASR-Next 与音频创作模型 TTS-Next,五款模型组成覆盖「理解—生成—交互—创作」的完整音频能力栈。
价格调整随新模型同步落地:据官方口径,文本转语音类服务降价约 70%,实时交互类降价约 85%,语音识别类最高降幅达 95%。系列模型 API 已上架千问 AI 平台(ASR-Next 的 API 稍后上线),详细参数在千问官方博客同步公开。值得一提的是,9 月 22 日开幕的 2026 云栖大会上阿里已预告了这批模型,此番属于「预告即兑现」。
一、五款模型分工
拆开看这次的五款模型。基础款语音识别模型 Qwen-Audio-3.1-ASR 优化了多语言及方言识别精度,还新增原生转写润色能力——可自动去除「嗯」「啊」这类填充词与重复表述并重组语义,转写出来的文字直接可用,省掉后期清洗。
同系列的 ASR-Next 则往「听懂」走得更远:据上海证券报报道,它能理解人物情绪、环境声与机械声,新增带时间戳的多说话人识别,支持声音描述、事件定位、音频问答与推理——「这段录音里的人情绪怎么样」这类问题,现在模型能直接回答。
TTS 侧同样分两档。基础款文本转语音模型支持多语言合成与自然的跨语言音色迁移,用户用简单文本指令就能调整情绪、语速与表达风格;TTS-Next 把语言模型与扩散生成方案结合,可单次完成语音、音效、背景音的同步生成,官方将其定位为通用音频生成系统,瞄准有声书、播客、广告等专业创作场景。
实时交互模型支持边听边说、即时响应打断,检测到用户情绪低落时会自动放缓回应节奏,还能主动调用 Agent 工具完成任务。阿里同时开源了面向实时语音 Agent 的 Qwen-Audio-Agent 框架,方便开发者快速搭建场景化语音应用。
二、价格打到了多少
具体价卡已经公开。据智东西整理:Qwen-Audio-3.1-ASR-Flash 输入 0.8 元、输出 2.7 元每百万 tokens;TTS-Flash 输入 1.5 元、输出 12 元;TTS-Next 输入 6 元、输出 12 元;Realtime-Plus 按档位不同输入 5 至 40 元、输出 40 至 150 元。
效果端也有硬指标。官方在公开方言测试集 KeSpeech 和 WSYue 上的测试显示,Qwen-Audio-3.1-ASR 在 11 个子集中的 6 个优于豆包 ASR 和腾讯 Hy-ASR-3.0-preview 两款模型,平均字错误率(CER)仅 4.55%;模型支持 30 种语言与 16 种中文方言,首字响应约 160 毫秒。
降价逻辑不难理解:语音识别和合成正在从「加分项」变成基础设施。识别侧 95% 的降幅意味着,以前按百万 tokens 算钱、贵到不敢大规模跑的转写工作流——客服录音全量质检、多语言配音、实时字幕——现在账能算得过来了。
对标海外,OpenAI 和 Google 的音频 API 定价仍在高位。千问这一轮降价有明显的抢开发者意味:先用价格把语音产品团队拉到自家云上,再靠生态锁定。

三、出海卖家的红利
对出海卖家,最直接的利好是多语种内容成本骤降。商品讲解音频、直播同传字幕、客服语音机器人这几类高频刚需,过去受限于成本只能覆盖英语和小语种主力市场;识别降 95% 后,长尾小语种市场的语音内容生产也能批量铺开。
TTS-Next 的跨语言音色迁移值得单独一提:用同一个人的音色产出多语种版本,品牌主播的声音可以低成本复刻到泰语、越南语、西语市场。带情绪、语速控制的指令式合成,让非专业团队也能做出像样的广告音频。
ASR-Next 的多说话人识别与情绪捕捉,在评论分析和客服质检上是用武之地——自动区分客服和买家谁在说话、识别买家情绪波动点,舆情预警可以直接接进现有工作流。带时间戳的输出也让素材回溯定位更方便。
实时交互模型则指向直播和智能客服:低延迟打断、共情回应、可调用工具,做 7×24 小时多语种接待的技术底座已经具备。
四、价格战的另一面
热闹之下要留两个心眼。其一,降价是否长期维持。有海外分析指出,这种量级的降幅可能是抢夺开发者的「圈地」动作,等 OpenAI、Google 跟进反制后,价格体系未必不回调;API 用量上去之后的实际账单,还要按档位细算。
其二,宣称的能力在真实场景里成色如何。「自动清除填充词」在干净录音里容易,嘈杂、口音重的真实音频上表现如何,要自己拿业务数据实测——尤其是东南亚市场的方言与混说场景,跑分和落地之间往往有距离。
竞争端同样在提速。就在千问发布的同一天,科大讯飞发布了新一代语音识别大模型 Spark-ASR-2.0,推理成本较上代仅增 10%,词错误率明显下降,后续将落地讯飞输入法与智能办公本。国内语音赛道的价格与技术双线竞争,已经贴身肉搏。
对依赖单一云厂商的开发者,这轮降价是重新谈价的好时机;对还没上车的团队,倒是可以借势把语音能力先小成本试起来。

五、接下来看什么
千问这套「理解—生成—交互—创作」的能力栈,配合同期发布的 QwenNote A2 录音硬件与桌面机器人 Eva,勾勒出的图景是:语音 Agent 从云端 API 走向随身设备。Realtime 模型将逐步接入这些硬件,端侧入口之争已经预热。
对行业观察者,两个信号值得跟踪:一是同声传译模型 Qwen3.8-LiveTranslate 在云栖大会首发但未列入本次发布列表,翻译赛道的后续动作还有悬念;二是 ASR-Next 这类下一代架构模型的 API 尚未全面开放,能力兑现节奏有待观察。
价格战打到 95% 降幅,说明音频 AI 的商品化拐点已经到了。剩下的问题是谁能在地板价之上把质量差距拉开——你觉得多语种语音内容,会先在哪类跨境生意里规模化跑起来?

参考资料
- 新浪科技:《全线降价!阿里密集发布 5 款语音大模型,最高降幅达 95%》
- 财联社:《千问大模型发布 Qwen-Audio-3.1 下调 Qwen-Audio 全线语音模型价格》
- 智东西(36氪转载):《阿里一口气上新 5 款千问模型,价格最高降 95%》
- 上海证券报·中国证券网:《从生成迈向创作 阿里发布语音模型系列 Qwen-Audio-3.1》
- 亿邦动力:《阿里发布千问音频 3.1 模型 AI 音频服务最高降价 95%》
- 千问官方博客:Qwen-Audio-3.1 系列模型发布说明