谷歌连发两款实时语音模型:Gemini 3.8 Live 要攻克语音 Agent 的沉默时刻
谷歌连发两款实时语音模型:Gemini 3.8 Live 要攻克语音 Agent 的沉默时刻谷歌发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,后者支持后台异步推理与工具调用以解决语音 Agent 在任务执行中的沉默问题,两款模型已在 Gemini API 和 Google AI Studio 向开发者开放。
搜索
谷歌发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,后者支持后台异步推理与工具调用以解决语音 Agent 在任务执行中的沉默问题,两款模型已在 Gemini API 和 Google AI Studio 向开发者开放。
我是真没想到网易除了UU远程, 又在AI赛道整了一个新活,这次是语音输入,把我电脑里的typless干出幸福者退让原则了。
AI语音创企公司ElevenLabs已聘请前Adyen首席财务官Ethan Tandowsky出任CFO,为2028年可能进行的IPO做准备,其ARR有望达6亿美元且已实现盈利。
2025年,杨斌体验了一款海外语音交互产品Sesame。一两轮对话后,他因暂时想不到问题陷入沉默。几秒后,对面突然主动开口:“你现在是不是思维卡壳了?”随后补了一句话,把中断的话题接了起来。
语音成为了AI交互的新方式。
8 月 7 日,阿里巴巴推出国内首个 AI 语音生产力平台 CosyVoice Studio,整合开放语音识别、语音合成、实时语音交互三类核心能力,覆盖「听、创、聊」全链路。
8 月 4 日,腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview。基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语音识别与深度语义理解能力,在通用识别、上下文感知、多场景鲁棒性以及方言覆盖等核心维度实现全面提升,
本周,Fish Audio宣布完成5200万美元种子轮融资,由Coreline Ventures和Capital Today领投。
今日,马斯克旗下SpaceXAI宣布推出新一代语音模型Grok Voice Think Fast 2.0,这是该公司迄今能力最强的语音到语音(speech-to-speech)模型。马斯克连发两条推文,第一条宣布“Grok Voice现在在智能体性能方面排名第一”,第二条则直接喊话网友“试试新的Grok Voice”。
Encore AI是一家专门研究企业客户互动数据、以此训练和部署AI语音Agent的初创公司,其Agent既可与客服和销售团队协同工作,也可独立自主运行。该公司近日完成由Team8领投的3000万美元A轮融资。