刚刚,中国语音AI连拿多项全球第一!

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
刚刚,中国语音AI连拿多项全球第一!
7654点击    2026-09-16 10:09

地铁急刹,金属尖叫,广播响起「请乘客注意扶稳」,人群骚动、孩子哭声、对讲机杂音一层层涌上来···


你甚至能感觉到车厢在晃。


刚刚,中国语音AI连拿多项全球第一!


这不是电影原声带。整段声音是用一句 prompt,AI 一次性生成的。


再来听一首歌。先是一段清唱,没有伴奏,就是一个人对着麦克风干唱:


刚刚,中国语音AI连拿多项全球第一!


然后,AI 接手了。一句提示词——


一首温暖柔和的 City Pop 男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫


模型直接在这段清唱的基础上,补齐了编曲、和声、节奏和完整制作:


刚刚,中国语音AI连拿多项全球第一!


从一段干巴巴的清唱,到一首有呼吸感的完整歌曲。你能听出来这是 AI 做的吗?


说实话,我第一次听的时候也没分出来。


音频大模型,开始比「体系」了


过去两年,语音 AI 赛道非常热闹。


Suno 两天前刚发布了 v6 系列,OpenAI 的 GPT-Realtime-2 今年把实时语音推理能力拉到了 GPT-5 级别,Google 在 I/O 上把 Gemini Live 推到 70+ 语言的流式翻译。


但有一个现象值得注意:几乎所有玩家,都在比单项。


做语音合成的比谁说话更像真人,做语音识别的比谁听写更准,做音乐的比谁生成的歌更好听,做实时对话的比谁反应更快。


然而现实世界里的语音需求,从来不是一个孤立的点。


一条短视频的声音制作,需要角色配音、环境音效、背景音乐,可能还需要先把素材里的人声转成文字做理解。


Voice Agent 要跑起来,语音识别、语音生成、实时交互、推理、工具调用得同时在线。一个音乐创作者做一首歌,可能先有一段清唱,需要 AI 补上编曲、和声和制作。


这些场景对应的不是一个模型,而是「一组能力」。


这正是行业正在发生的一个结构性变化:当单点能力逐渐拉平,决定竞争力上限的,变成了谁能把理解、生成、交互和创作连成一套完整的体系。


9 月 15 日,阶跃星辰一口气放出了 StepAudio 3 系列五款模型:StepAudio 3 TTS(语音生成)、StepAudio 3 Gen(完整音频生成)、StepAudio 3 Realtime(实时语音交互)、StepAudio 3 ASR(语音识别)和 StepAudio 3 Music(音乐创作)。


五条产品线,覆盖「听、说、理解、交互、创作」全链路。这在国内音频大模型领域,是第一家以完整矩阵形态同时推出的。


它反映出阶跃对语音 AI 竞争走向的一个判断:单项能力竞赛的窗口期正在关闭,全栈体系化能力开始成为真正的壁垒。


不过话说回来,全栈的前提是每一条腿都得站得住。


这一点,第三方榜单先给了答案——三个全球第一


Artificial Analysis Conversational Dynamics 榜单,StepAudio 3 Realtime 以 98.9% 的综合得分,全球第一。


这个榜单测的是「对话节奏感」:什么时候该接话,什么时候该等你说完,用户突然插一句是想打断还是只在附和。这恰恰是实时语音里最像人也最难的部分——不是听懂和回答,而是知道该不该现在开口。


刚刚,中国语音AI连拿多项全球第一!


Artificial Analysis Speech Reasoning 榜单,StepAudio 3 Realtime 以 99.7% 的语音推理准确率,位列全球第一。


这张榜考的是模型能不能直接「听」懂音频并完成复杂推理任务,而不是先老老实实转成文字再去想。它是业内评估原生语音模型最权威的第三方基准之一。


刚刚,中国语音AI连拿多项全球第一!


Artificial Analysis 非流式语音识别准确性榜单,StepAudio 3 ASR 的 WER(词错误率)仅 1.7%,并列全球第一。


WER 这个指标很朴素:每转写 100 个词错几个。1.7% 意味着差不多 60 个词才错一个,已经接近专业速记员的水准。


刚刚,中国语音AI连拿多项全球第一!


榜单说完了。接下来的部分,我们不看分数,只看这些模型在真实场景里到底是什么表现。


像人一样交流


语音模型的基础能力正在快速成熟。


但「识别准确」「声音自然」「响应够快」这些单点指标,已经不足以构成完整体验。


真正拉开差距的,是模型能否接近真实人类交流的状态:听懂语境、自然表达,并在持续对话中完成理解、回应和行动。


StepAudio 3 TTS:从「声音自然」到「表达自然」


市面上大多数 TTS 模型已经能把声音做得很「像真人」了。


但仔细听会发现,它们像的是「播音员」。字正腔圆,完美得不像在说话,更像在「朗读」。


真实的人类交流不是这样的。是「呃」、是「就是那个」、是说到一半改口、是突然笑出来又赶紧收住。


来听一段 StepAudio 3 TTS 生成的语音:


「我最近就特别纠结,就是要不要换工作这个事。呃,现在这家吧,钱少,但是离家近嘛,走路十分钟。新的那个 offer 呢,给得多,多个,多个四千吧大概,但通勤单程要一个半小时。我妈说钱重要,我朋友说命重要,我就,唉,怎么说呢,天天睡前想这事,越想越睡不着。」


刚刚,中国语音AI连拿多项全球第一!


注意那些细节:「就特别纠结」里带着微妙的叹气,「多个,多个四千」的口语化重复完全自然,说到「命重要」时语气微微上扬,紧接着的「唉」里满是无奈。


这些不是预设的情绪标签,而是模型根据语义自主判断出来的表达方式。


再来一段:


「你不老说通勤无聊吗,我给你安利个播客,就,讲那种,呃,讲历史八卦的。主播俩人特逗,一集大概,嗯,一个小时吧,正好我来回路上听。我这两个月,就,就靠它撑着了。你搜那个名字我回头发你,反正免费的。」


刚刚,中国语音AI连拿多项全球第一!


这段语音里的「就,就靠它撑着了」,两个「就」之间有一个几乎无意识的停顿,完全是人在组织语言时的自然节奏。


目前行业里大部分 TTS 模型处理这类口语化表达时,要么直接忽略重复词,要么机械地念两遍,很难做到这种「不完美但真实」的语感还原。


从技术层面看,StepAudio 3 TTS 在音色基底、语调层次、节奏律动和气口停顿上全面贴合自然口语模式,并能还原笑声、迟疑、结巴、改口等副语言特征。


前代 StepAudio 2.5 TTS 已经在全球权威的 Artificial Analysis Speech Arena 拿下国产第一、全球前三。


StepAudio 3 TTS 在这个基底上再往前推了一步,把「音色像不像」转移到了「说话方式像不像」。


StepAudio 3 ASR:从「听清」到「听懂」


语音识别看起来已经很成熟了。但 AI「听清」和「听懂」之间,隔着一条鸿沟。


你说「骁龙8至尊版」,它给你转成「小龙八至尊版」。你说「张靓颖」,它给你写成「张亮影」。


问题的根源在于,传统 ASR 只依赖声学信息——它在意「听到了什么音」,而不是「说的是什么意思」。


StepAudio 3 ASR 的思路是把高精度声学建模和大语言模型的语境理解结合在一起。


识别语音时,模型不只做「音-字」对应,还会调用语言模型的知识和推理能力辅助判断:根据上下文,这个音更可能是哪个词?


这个方向并非阶跃独创,业内多家都在探索 ASR 与 LLM 的融合。


但 StepAudio 3 ASR 的覆盖面值得关注:方言、口音、中英混说、低声耳语、快语速连读、甚至唱歌和有背景音乐的场景都能处理。长音频支持也不是简单的「切片-转写-拼接」,而是端到端的完整理解,避免上下文断裂。


这直接关系到会议纪要、视频字幕、智能客服、车载交互、医疗记录等一系列场景的实际可用性。


比如,我们先用 StepAudio 3 Gen 出一段机场的背景音。


再拿去让 StepAudio 3 ASR  去听。这其实是拿 StepAudio 3 自己考自己。


Gen 这边,广播腔拿捏得很准:有那种通过航站楼喇叭传出来的压缩感和轻微失真,不是干干净净的棚里录音。


刚刚,中国语音AI连拿多项全球第一!


ASR 这边更见功夫,全程 40 秒的音频里,「MU 5127」「C17」「C31」「18 点 45 分」这些字母数字混排的信息一个没错。


机场广播的登机口和航班号恰恰是最容易听错的部分,C17 和 C31 又是在同一句话里对照出现,转错一个字乘客就跑错门了。


刚刚,中国语音AI连拿多项全球第一!


AI 生成的声音能被 AI 准确听回来,这本身就说明两端的质量都立得住。


当 ASR 从「转写工具」进化为「语音理解基础设施」,它的产业价值就完全不同了。


StepAudio 3 Realtime:从「能打断」到「边聊边想边做」


全双工、打断、低延迟——2026 年,这些已经是实时语音的桌面赌注。


真正拉开差距的,是另一个问题:模型在一场持续对话中,能不能同时处理理解、回应、推理和行动?


举个例子。


你跟一个 Voice Agent 说:「帮我查一下明天北京飞上海的航班,要下午的,最好是东航。」


一个只做了全双工和打断的模型,可能先转文字再调 API,中间一段尴尬的沉默。更糟的情况是,你开始追问时它还没查完,系统直接卡住。


StepAudio 3 Realtime 的做法是推理与语音生成并行,工具调用和长任务异步执行。不阻塞当前对话,任务完成后自然接回上下文。同时它能感知语气、情绪、副语言和环境声音,不只是听你「说了什么」,还在理解你「怎么说的」。


我们来个实测。


一分钟里,连着改了四次口——坐飞机、别太晚到、时间从周五晚放宽到周六上午、直达。


每一次都是掐在 AI 刚开口的当口打断的。


刚刚,中国语音AI连拿多项全球第一!


先说打断本身。从人出声到 AI 闭嘴,几乎是即时的,没有那种「再念完半句话」的尴尬尾巴。


更难得的是它停下来之后不重启话头,只确认变化的那一条,该跳过的废话跳过了。


过程中,我把直达说成了「直飞」,它依然能知道是「直达的高铁」,直接理解你的意思。


还有个细节:整段下来它一次都没有擅自去「预订」,规则守得很稳。


能打断不稀奇,被打断四次还没被说懵,这才是实时语音该有的样子。


今年被广泛认为是 Voice Agent 商业化元年,从客服到金融再到车载,语音智能体正在密集落地。


在这个节点上,「演示可用」和「商业可用」之间的距离,往往就差在实时场景下能不能真正做到「听、说、想、做」同时在线。


从「出片段」到交付「作品」:Gen + Music


说完「交流」,再来看「创作」。


StepAudio 3 系列的另外两款模型——Gen 和 Music,瞄准的是一个正在发生的产业转向:音频生成的目标,正在从「输出素材」变成「交付作品」。


StepAudio 3 Gen:一次性搭建完整声音场景


回到开头那段「地铁突发事件」的音频。


传统做法是什么?配音演员录广播、音效库翻地铁刹车声和人群嘈杂声,然后在 DAW 里一轨一轨铺好、对齐时间线、调混响、做混音。


一个有经验的声音设计师,少说几个小时。


StepAudio 3 Gen 把这些原本分散的环节统一到了一个模型里:用自然语言描述场景和剧情,一次生成人声、音效、环境音和背景音乐,并自动完成时序编排。


但在行业视角下,这款模型更值得关注的是「控制粒度」。


它支持对多个角色分别设定音色、说话方式、语气、情绪、方言口音,乃至笑声、喘息、停顿等副语言细节,还可以指定各声音元素出现的时间和顺序。


这意味着模型不只在「生成声音」,而是开始参与「声音设计」——有意图、有结构的声音编排。


看这个实测。


一段废弃 KTV 的复仇戏,最狠的不是那些音效,而是女人声音里的情绪弧线。


从一开始那种冷到骨头里的平静,到「我女儿在里头」时嗓子里不易察觉的一丝颤,再到最后隔着门说「囡囡,你能睡了」时终于卸下来的那口气。这条情绪线是连贯的、有层次的,不是在几个情绪标签之间硬跳。


男人那边也值得注意:他从油滑到慌张到尖叫的崩溃过程,声场位置一直在远处带混响,和女人的近场贴麦形成了清晰的空间对位。


一段音频里同时做到情绪递进和空间叙事,这已经不是「生成音效」的水平了。


刚刚,中国语音AI连拿多项全球第一!


这也说明了一件事: StepAudio 3 Gen 不只是能「生成声音」,它开始能「讲故事」了。


影视、动画、游戏、广播剧、有声书创作者来说,这类能力一旦成熟,意味着声音制作的门槛和周期可能发生量级变化。


StepAudio 3 Music:从「替你写歌」到「帮你做歌」


AI 音乐生成正处于一个有意思的拐点。


「一句话生成一首歌」这件事,行业已经做得越来越好了。


但一个现实问题是:真正的音乐创作,很少是从零开始的一次性抽卡。


创作者手里可能已经有一段歌词、一段清唱或一个粗糙的 Demo,需要的是 AI 接着往下走——帮我配个编曲、换个风格试试、把副歌的情绪再推上去一点。


StepAudio 3 Music 覆盖了歌词成歌、纯音乐生成和干声智能配乐三条路径,支持歌词、干声、哼唱、参考音频等多种已有素材输入,让模型在创作者的基础上继续生成和完善。


回到开头那首 City Pop 歌曲。它的 prompt 附带了从 Intro 到 Outro 的完整歌词结构,模型在这个框架下完成了旋律、编曲和人声生成,保持了跨段落的能量变化和表达连贯性。


再来听另一首中文现场感流行抒情歌:


刚刚,中国语音AI连拿多项全球第一!


这首歌的 prompt 极其细致:


G 小调,74 BPM,四四拍。模拟真实乐队单遍演奏,配器只有钢琴、木吉他、真实贝斯、毛刷鼓和小编制弦乐。不要前奏,直接从第一句歌词开始。主歌保持低声克制,复句第二次加入弦乐。女声必须像真实录音,使用自然动态、真实呼吸、自然颤音。


注意这个 prompt 的颗粒度。它不只是在描述「我想要什么风格的歌」,而是在做音乐制作层面的精细控制——


调式、BPM、配器编排、段落动态、人声质感、录音美学,全部通过自然语言直接指定。


能够响应这种级别的指令并输出结构完整的作品,这在当前的 AI 音乐生成领域可是一个不低的门槛。


更硬核的是「清唱配乐」:提供一段清唱,模型理解其中的旋律、节奏和情绪,自动补充和声、乐器和完整编曲,把一段 a cappella 变成一首完整的成品。


全栈体系意味着什么


Gen 和 Music 放在一起看,体现的是音频生成赛道的一个重要转向:竞争焦点正在从「生成质量」向「作品完整度 + 创作控制力」迁移。


而把全部五款模型放在一起看,一个更大的图景浮现出来。


TTS 让 AI 开口像真人,ASR 让 AI 听懂人话,Realtime 让两者在实时对话中协同运转,Gen 生成完整声音场景,Music 参与完整音乐创作。


五条能力线拼在一起,形成了一套覆盖「理解→生成→交互→创作」的完整音频能力栈。


对开发者和产业客户来说,这意味着不用再在多家之间拼接 TTS、ASR、实时语音和音乐生成,然后花大量精力做对接和兜底。


一套体系内的模型在能力边界和接口设计上天然更容易协同。


从行业竞争格局来看,阶跃这次五款模型同时推出,发出的信号是明确的:语音大模型的竞争正在从「单项冠军赛」进入「全栈体系赛」。


这不是说单项能力不重要了。恰恰相反,全栈体系的前提是每一个单项都要过硬。


但当单点能力逐渐拉平,能否形成体系化的覆盖和协同,将越来越决定谁能成为产业客户的长期选择。


音频大模型的战事远没有结束。但至少在这个九月,当 AI 生成的地铁场景已经有了电影级的声音层次,当 AI 作曲已经能响应「毛刷鼓、小编制弦乐、自然颤音」这种级别的制作指令——


声音这件事,AI 确实开始「玩真的」了。 


文章来自于"新智元",作者 "所罗门"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

4
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales