Qwen-Audio-Agent 开源:构建用户与后台智能体的实时语音交互层;AmphionASR 发布:行业热词、指定说话人、强噪与耳语识别四合一丨日报

 

8e6c16ea2f31766418d4da3d0fda1173

 

 

本期编辑:@三水、@鲍勃

01 有话题的技术

1、QwenAudio 开源 Qwen-Audio-Agent:将实时语音交互层部署在用户与后台智能体之间

 

QwenAudio 开源 Qwen-Audio-Agent,将实时语音交互层部署在用户与后台智能体之间,负责连续对话、任务委派、上下文衔接和结果播报。系统可即时处理简单问题,并将搜索、推理、代码修改和工具操作等复杂任务转交 OpenCode、OpenClaw、Qoder、Hermes、CodeBuddy 或 Codex 执行。

 

  • 全双工语音支持连续补充与任务打断:用户可在智能体执行过程中继续说话,追加约束、修改目标或取消当前任务,无需等待上一轮任务完全结束后重新发起请求。

  • 前台语音模型与后台智能体分层运行:实时语音组件负责自然对话和即时响应;复杂请求连同当前上下文被委派至 Agent Runtime,执行结果再返回原有语音会话,避免让实时模型直接承担全部搜索、推理与工具调用。

  • 首批接入 6 类代码与通用智能体:项目已适配 OpenCode、OpenClaw、Qoder、Hermes、CodeBuddy 和 Codex,支持项目 Session、任务委派、进度查询、取消任务及权限控制等能力。

  • 通过 ACP stdio 扩展更多智能体:除内置适配器外,其他兼容 ACP stdio 协议的智能体可通过通用入口接入,使语音前台与后台模型、工具和项目上下文解耦。

  • 提供 TUI、WebUI 与 macOS 桌面端:项目可通过 npm 全局安装,配置 DashScope API Key 和智能体协议后启动终端或网页界面;源码版本还提供常驻桌面的语音悬浮球。

 

https://github.com/QwenAudio/qwen-audio-agent

 

(@QwenAudio)

 

2、安菲翁科技发布个性化语音识别系统 AmphionASR:集成 LLM 与检索增强,支持万级热词与指定说话人识别

 

e439a80ef5edb18e7b16cda94baf9895

 

 

安菲翁科技发布基于 LLM 的个性化语音识别系统 AmphionASR,将行业热词、指定说话人、强噪声下语音识别和耳语识别四类能力融合至统一框架。该系统通过检索增强与三阶段训练策略,实现了复杂声学场景下的高精度转录。

 

  • 架构设计:采用音频编码器、LLM 内核及检索增强模块,音频特征与文本指令拼接后由 LLM 以自回归方式生成转录结果。

  • 垂直领域热词增强识别:支持从约一万个候选词中自动筛选前 50 个相关热词作为上下文偏置,中文关键实体词错误率相对下降 55%,英文相对下降 37%。

  • 目标说话人语音识别:提供 3 至 5 秒参考声音即可在重叠语音中锁定目标对象,词错误率为 13.02%。在目标说话人没有出现、输入内容完全静音的测试条件下,AmphionASR 有 93.9% 的样本能够正确保持静默,没有强行生成不存在的转录内容。

  • 强噪声下语音识别与耳语识别:在覆盖噪声、远场、混响等复杂音频条件的 16 个测试子集中拿下 8 个最优;中英文耳语识别错误率分别为 0.58% 和 6.11%。

 

42ce91616adb5d77496bb2f6b9a771e9

 

 

API 即将发布,论文与技术细节已开源上线。

 

信息来源(@Amphion Team)

 

AmphionASR:「懂」场景支持大规模热词的个性化语音识别

 

(@Amphion)

 

3、Audio8 开源 0.6B 多语言 TTS 模型:支持 11 种语言与零样本声音克隆,输出 44.1kHz 音频

 

ade16d93db90ada6ff49d253caad7ab7

 

 

Audio8 发布 Audio8-TTS-Preview-0.6b,一款采用 DualAR 架构的多语言 TTS 模型,主模型参数量为 601M,支持零样本声音克隆和无参考音频生成。项目同步开放完整模型权重、44.1kHz 神经音频编解码器、分词器及 Transformers 推理代码,并采用 Apache 2.0 许可证。

 

  • 601M 参数 DualAR 架构:模型包含 24 层 Slow AR 与 4 层 Fast AR;Slow AR 为每个音频帧预测语义 token,Fast AR 根据隐藏状态和已生成码本继续预测当前帧的声学 token。

  • 44.1kHz 编解码器与 10 层声学码本:内置编解码器采用 10 个码本,每个码本包含 4096 个条目,每个模型帧对应 2048 个音频采样点,处理频率约为每秒 21.5 帧,无需额外下载独立编解码器权重。

  • 支持 11 种语言与零样本声音克隆:当前 Preview 版本覆盖普通话、粤语、英语、日语、韩语、法语、德语、西班牙语、意大利语、荷兰语和波兰语;声音克隆需同时输入参考音频及与其准确对应的转录文本。

  • Seed-TTS 英文 WER 为 1.506:官方评测中,Audio8 在 Seed-TTS 英文测试上的 WER 为 1.506、说话人相似度为 63.2%;中文 CER 为 0.950、相似度为 73.1%,但困难中文测试 CER 为 11.510。官方同时指出,不同项目使用的文本规范化和评测器不同,跨模型结果仅供参考。

  • 完整权重开源,但暂未接入托管推理服务:模型可通过 Transformers 和 trust_remote_code=True 在本地加载,推荐使用 Python 3.10 以上环境及支持 CUDA 的 GPU;Hugging Face 当前尚无推理服务商直接托管该模型。

 

demo:

 

https://audio8-ai.github.io/Audio8_TTS/

 

(@Audio8)

 

4、Google 发布音乐生成模型 Lyria 3.5:最长生成 3 分钟,增强歌词结构、演唱表现与节奏控制

 

Google DeepMind 发布 Lyria 3.5,并率先接入 Google Flow Music。新版本重点提升旋律结构、歌词指令遵循、歌声自然度和发音准确性,同时支持按提示词控制歌曲节奏与时长,可生成最长 3 分钟的完整音乐。

 

  • 最长生成 3 分钟,可指定目标时长:Lyria 3.5 支持生成 60 秒短片段、半长度曲目或最长 3 分钟的完整歌曲,并根据用户指定的时长保持整体音乐连贯性。

  • 增强旋律复杂度与段落连贯性:模型可生成更复杂的旋律结构,并改善音符、节奏与编曲在整首歌曲中的自然衔接,减少长曲目中常见的重复和结构断裂。

  • 歌词支持更强指令遵循与结构理解:Lyria 3.5 提升歌词生成质量,可更准确地遵循主题与内容要求,并理解主歌、副歌等歌曲结构,而非仅生成连续文本。

  • 歌声提升情感表达、真实感与发音准确性:新版本增强演唱中的情绪和细节表现,支持更自然的多语言人声,同时改善歌词发音;用户还可通过提示词指定声线、演唱方式、BPM、调性和乐器配置。

  • 率先接入 Flow Music,生成音频嵌入 SynthID:Lyria 3.5 已在 Google Flow Music 上线,用户可免费注册并使用基础额度,更多生成次数需订阅 Flow Music 或 Google AI 会员;所有生成和编辑的曲目均嵌入 SynthID 水印。

 

https://blog.google/innovation-and-ai/models-and-research/google-labs/lyria-3-5/

 

https://flowmusic.google

 

(@Google DeepMind@Google Labs)

02 有亮点的产品

1、企业级对话智能体平台 Encore AI 完成 3000 万美元 A 轮融资:从客户通话提炼销售方法,训练语音与文本智能体

 

de06560ddbbf07860e516e45a26b1453

 

 

Encore AI 宣布完成 3000 万美元 A 轮融资,由 Team8 领投,并将原 Insait IO 品牌更名为 Encore AI。其平台通过分析企业积累的通话、邮件、聊天和 CRM 数据,识别高绩效员工在销售、催收和客户服务中的有效行为,再将其转化为可自主对客或辅助人工坐席的智能体。

 

  • Interaction Mining 从历史对话提炼可执行方法:平台将客户交互拆分为多个阶段,分析哪些表达、案例、应对策略和操作推动了业务进程,哪些环节导致失败,再将有效行为组合为智能体使用的多个工作手册。

  • 统一处理通话、聊天、邮件与 CRM 数据:Encore AI 不只使用转录文本,还将语音和文字交互与 CRM 中的客户状态、业务结果及结构化数据关联,用于判断具体行为是否带来转化、回款或服务结果。

  • 支持自主智能体与实时坐席辅助两种模式:训练后的智能体可通过语音或文本直接与客户沟通,也可作为实时助手,在人工坐席对话期间推荐回复、策略和下一步动作。

  • 覆盖销售、催收、客服与交叉销售流程:平台面向金融、保险和医疗等受监管行业,可将智能体部署在语音、聊天、IVR 和在线表单等渠道,用于线索转化、申请推进、余额催收、追加销售和交叉销售。

  • 已服务 40 余家企业客户,ARR 18 个月增长超 5 倍:TechCrunch 披露其全球客户超过 40 家,多数为金融机构;公司 ARR 自上一轮种子融资以来增长超过 5 倍。本轮资金将用于扩大美国销售团队和大型金融机构部署。

 

https://techcrunch.com/2026/07/29/encore-ai-raises-30m-to-build-ai-agents-that-learn-from-customer-calls/

 

(@Encore AI@TechCrunch)

 

2、telli 完成 1500 万美元种子轮融资:语音、聊天与 WhatsApp 智能体统一处理客户运营

 

d01b680392b0bbd84ba468ded6b06b8c

 

 

柏林初创公司 telli 完成 1500 万美元种子轮融资,由 redalpine 领投,Mutschler、Cherry Ventures、Y Combinator 及多位天使投资人参投,累计融资超过 1850 万美元。其平台面向 B2C 企业,将语音、聊天、SMS、WhatsApp 和邮件中的客户交互统一交由智能体处理,并通过 AI 协作者 Charlie 帮助运营团队构建、分析和持续优化这些智能体。

 

  • 五类渠道统一接入客户运营流程:telli 智能体可跨语音、聊天、SMS、WhatsApp 和邮件运行,处理客户咨询、线索筛选、预约安排和服务请求,减少不同渠道之间独立配置工作流和上下文割裂的问题。

  • Charlie AI 协作者负责智能体构建与持续优化:Charlie 可连接企业内部系统、分析历史客户对话、识别运营问题,并协助团队调整智能体的沟通方式与执行流程,不仅承担对客交互,也参与后台运营管理。

  • 支持从单次对话扩展至端到端业务动作:平台可让智能体执行线索资格判断、预约写入、客户跟进和服务请求处理,并将客户会话、业务状态与后续工作流关联,而非只生成问答回复。

  • 已处理数百万次客户对话:telli 表示,其智能体已服务从中小企业到大型企业的客户,每年处理数百万次客户交互;官方产品页还支持从单路扩展至数千路并行通话,并覆盖 30 多种语言。

  • 融资用于扩充工程、商业团队与多渠道能力:本轮资金将用于扩大工程和市场团队,继续开发 Charlie、语音及多渠道智能体平台,并推动其在更多 B2C 客户运营场景中的部署。

 

https://tech.eu/2026/07/23/telli-secures-15m-seed-to-automate-customer-facing-operations/

 

(@telli)

 

3、Intelligent Internet 开源 Genii 个人智能体:消息入口交互,支持长期记忆与本地部署

 

Intelligent Internet 开源个人智能体 Genii,将 AI 助手入口从独立聊天窗口迁移至日常消息场景。项目支持通过消息与智能体持续交互,并通过长期记忆保存用户上下文,使智能体能够跨会话延续任务和个人偏好。

 

  • 消息即入口的个人智能体架构:Genii 将用户交互层设计为消息接口,用户无需进入专用 AI 应用即可向智能体发送请求;系统围绕个人助手场景设计,而非单次问答机器人。

  • 长期记忆模块支持跨会话上下文保持:项目引入持久化记忆机制,用于保存用户历史交互中的关键信息,使智能体能够在新的对话中调用此前上下文,减少重复输入。

  • 开源个人智能体运行框架:Genii 提供完整代码仓库,开发者可自行部署和修改智能体逻辑;项目定位为个人 AI 基础设施,而非单一模型能力展示。

  • 面向主动式个人助手场景设计:相比传统聊天机器人依赖用户主动发起每次请求,Genii 的核心方向是结合个人记忆和持续上下文,让智能体更适合作为长期协作对象。

  • 开放源码与 Web 体验入口:项目同步提供 GitHub 开源仓库和在线体验入口,开发者可查看实现细节并直接体验 Genii 的个人智能体能力。

 

https://github.com/Intelligent-Internet/genii

 

https://x.com/ii_posts/status/2082474832877269208

 

(@Intelligent Internet)

03 有态度的观点

1、OpenAI 总裁 Greg Brockman:未来计算入口将从键盘转向语音

 

fc297923696a1ab2835cfcb452f0c6d5

 

 

OpenAI 总裁 Greg Brockman 在接受《华尔街日报》记者 Joanna Stern 采访时表示,语音将成为未来人与 AI 交互的主要方式,下一代计算设备不再只是围绕屏幕和键盘设计,而是围绕人与 AI 的自然交流展开。

 

Brockman 认为,当前 ChatGPT 桌面应用仍存在一些体验问题,但 OpenAI 正持续改进。同时,他透露 OpenAI 正在探索新的 AI 设备形态,希望重新定义人与计算机之间的连接方式。

 

过去几十年,人类逐渐适应计算机的交互方式:点击鼠标、敲击键盘、操作触摸屏。而 AI 时代的变化可能恰恰相反——计算机需要开始理解人的表达方式。语气、停顿、上下文和情绪,都将成为新的交互信号。

 

这一趋势也解释了为什么语音成为当前 AI 产品竞争的重要方向。从 ChatGPT Voice、Realtime API 到各种 AI Agent,实时语音正在从「辅助功能」变成 AI 服务的核心入口。

 

Brockman 认为,未来人们不会再像今天一样「使用电脑」,而是直接与智能系统交流。计算机的下一次革命,可能不是更强的屏幕,而是更懂人的对话。

 

https://x.com/JoannaStern/status/2082485630513156597

 

(@JoannaStern@X)

 

image

 

75425b04893c604025742af01aeea481

 

 

 

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

 

写在最后:

 

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

 

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

 

41b411bdd91e9fa221716bc142c37f9c

 

 

作者提示: 个人观点,仅供参考