
本期编辑:@三水、@鲍勃
01 有话题的技术
1、QwenAudio 开源 Qwen-Audio-Agent:将实时语音交互层部署在用户与后台智能体之间
QwenAudio 开源 Qwen-Audio-Agent,将实时语音交互层部署在用户与后台智能体之间,负责连续对话、任务委派、上下文衔接和结果播报。系统可即时处理简单问题,并将搜索、推理、代码修改和工具操作等复杂任务转交 OpenCode、OpenClaw、Qoder、Hermes、CodeBuddy 或 Codex 执行。
-
全双工语音支持连续补充与任务打断:用户可在智能体执行过程中继续说话,追加约束、修改目标或取消当前任务,无需等待上一轮任务完全结束后重新发起请求。
-
前台语音模型与后台智能体分层运行:实时语音组件负责自然对话和即时响应;复杂请求连同当前上下文被委派至 Agent Runtime,执行结果再返回原有语音会话,避免让实时模型直接承担全部搜索、推理与工具调用。
-
首批接入 6 类代码与通用智能体:项目已适配 OpenCode、OpenClaw、Qoder、Hermes、CodeBuddy 和 Codex,支持项目 Session、任务委派、进度查询、取消任务及权限控制等能力。
-
通过 ACP stdio 扩展更多智能体:除内置适配器外,其他兼容 ACP stdio 协议的智能体可通过通用入口接入,使语音前台与后台模型、工具和项目上下文解耦。
-
提供 TUI、WebUI 与 macOS 桌面端:项目可通过 npm 全局安装,配置 DashScope API Key 和智能体协议后启动终端或网页界面;源码版本还提供常驻桌面的语音悬浮球。
https://github.com/QwenAudio/qwen-audio-agent
(@QwenAudio)
2、安菲翁科技发布个性化语音识别系统 AmphionASR:集成 LLM 与检索增强,支持万级热词与指定说话人识别

安菲翁科技发布基于 LLM 的个性化语音识别系统 AmphionASR,将行业热词、指定说话人、强噪声下语音识别和耳语识别四类能力融合至统一框架。该系统通过检索增强与三阶段训练策略,实现了复杂声学场景下的高精度转录。
-
架构设计:采用音频编码器、LLM 内核及检索增强模块,音频特征与文本指令拼接后由 LLM 以自回归方式生成转录结果。
-
垂直领域热词增强识别:支持从约一万个候选词中自动筛选前 50 个相关热词作为上下文偏置,中文关键实体词错误率相对下降 55%,英文相对下降 37%。
-
目标说话人语音识别:提供 3 至 5 秒参考声音即可在重叠语音中锁定目标对象,词错误率为 13.02%。在目标说话人没有出现、输入内容完全静音的测试条件下,AmphionASR 有 93.9% 的样本能够正确保持静默,没有强行生成不存在的转录内容。
-
强噪声下语音识别与耳语识别:在覆盖噪声、远场、混响等复杂音频条件的 16 个测试子集中拿下 8 个最优;中英文耳语识别错误率分别为 0.58% 和 6.11%。

API 即将发布,论文与技术细节已开源上线。
信息来源(@Amphion Team)
AmphionASR:「懂」场景支持大规模热词的个性化语音识别
(@Amphion)
3、Audio8 开源 0.6B 多语言 TTS 模型:支持 11 种语言与零样本声音克隆,输出 44.1kHz 音频

Audio8 发布 Audio8-TTS-Preview-0.6b,一款采用 DualAR 架构的多语言 TTS 模型,主模型参数量为 601M,支持零样本声音克隆和无参考音频生成。项目同步开放完整模型权重、44.1kHz 神经音频编解码器、分词器及 Transformers 推理代码,并采用 Apache 2.0 许可证。
-
601M 参数 DualAR 架构:模型包含 24 层 Slow AR 与 4 层 Fast AR;Slow AR 为每个音频帧预测语义 token,Fast AR 根据隐藏状态和已生成码本继续预测当前帧的声学 token。
-
44.1kHz 编解码器与 10 层声学码本:内置编解码器采用 10 个码本,每个码本包含 4096 个条目,每个模型帧对应 2048 个音频采样点,处理频率约为每秒 21.5 帧,无需额外下载独立编解码器权重。
-
支持 11 种语言与零样本声音克隆:当前 Preview 版本覆盖普通话、粤语、英语、日语、韩语、法语、德语、西班牙语、意大利语、荷兰语和波兰语;声音克隆需同时输入参考音频及与其准确对应的转录文本。
-
Seed-TTS 英文 WER 为 1.506:官方评测中,Audio8 在 Seed-TTS 英文测试上的 WER 为 1.506、说话人相似度为 63.2%;中文 CER 为 0.950、相似度为 73.1%,但困难中文测试 CER 为 11.510。官方同时指出,不同项目使用的文本规范化和评测器不同,跨模型结果仅供参考。
-
完整权重开源,但暂未接入托管推理服务:模型可通过 Transformers 和
trust_remote_code=True在本地加载,推荐使用 Python 3.10 以上环境及支持 CUDA 的 GPU;Hugging Face 当前尚无推理服务商直接托管该模型。
demo:
https://audio8-ai.github.io/Audio8_TTS/
(@Audio8)
4、Google 发布音乐生成模型 Lyria 3.5:最长生成 3 分钟,增强歌词结构、演唱表现与节奏控制
Google DeepMind 发布 Lyria 3.5,并率先接入 Google Flow Music。新版本重点提升旋律结构、歌词指令遵循、歌声自然度和发音准确性,同时支持按提示词控制歌曲节奏与时长,可生成最长 3 分钟的完整音乐。
-
最长生成 3 分钟,可指定目标时长:Lyria 3.5 支持生成 60 秒短片段、半长度曲目或最长 3 分钟的完整歌曲,并根据用户指定的时长保持整体音乐连贯性。
-
增强旋律复杂度与段落连贯性:模型可生成更复杂的旋律结构,并改善音符、节奏与编曲在整首歌曲中的自然衔接,减少长曲目中常见的重复和结构断裂。
-
歌词支持更强指令遵循与结构理解:Lyria 3.5 提升歌词生成质量,可更准确地遵循主题与内容要求,并理解主歌、副歌等歌曲结构,而非仅生成连续文本。
-
歌声提升情感表达、真实感与发音准确性:新版本增强演唱中的情绪和细节表现,支持更自然的多语言人声,同时改善歌词发音;用户还可通过提示词指定声线、演唱方式、BPM、调性和乐器配置。
-
率先接入 Flow Music,生成音频嵌入 SynthID:Lyria 3.5 已在 Google Flow Music 上线,用户可免费注册并使用基础额度,更多生成次数需订阅 Flow Music 或 Google AI 会员;所有生成和编辑的曲目均嵌入 SynthID 水印。
https://blog.google/innovation-and-ai/models-and-research/google-labs/lyria-3-5/
https://flowmusic.google
(@Google DeepMind@Google Labs)
02 有亮点的产品
1、企业级对话智能体平台 Encore AI 完成 3000 万美元 A 轮融资:从客户通话提炼销售方法,训练语音与文本智能体

Encore AI 宣布完成 3000 万美元 A 轮融资,由 Team8 领投,并将原 Insait IO 品牌更名为 Encore AI。其平台通过分析企业积累的通话、邮件、聊天和 CRM 数据,识别高绩效员工在销售、催收和客户服务中的有效行为,再将其转化为可自主对客或辅助人工坐席的智能体。
-
Interaction Mining 从历史对话提炼可执行方法:平台将客户交互拆分为多个阶段,分析哪些表达、案例、应对策略和操作推动了业务进程,哪些环节导致失败,再将有效行为组合为智能体使用的多个工作手册。
-
统一处理通话、聊天、邮件与 CRM 数据:Encore AI 不只使用转录文本,还将语音和文字交互与 CRM 中的客户状态、业务结果及结构化数据关联,用于判断具体行为是否带来转化、回款或服务结果。
-
支持自主智能体与实时坐席辅助两种模式:训练后的智能体可通过语音或文本直接与客户沟通,也可作为实时助手,在人工坐席对话期间推荐回复、策略和下一步动作。
-
覆盖销售、催收、客服与交叉销售流程:平台面向金融、保险和医疗等受监管行业,可将智能体部署在语音、聊天、IVR 和在线表单等渠道,用于线索转化、申请推进、余额催收、追加销售和交叉销售。
-
已服务 40 余家企业客户,ARR 18 个月增长超 5 倍:TechCrunch 披露其全球客户超过 40 家,多数为金融机构;公司 ARR 自上一轮种子融资以来增长超过 5 倍。本轮资金将用于扩大美国销售团队和大型金融机构部署。
https://techcrunch.com/2026/07/29/encore-ai-raises-30m-to-build-ai-agents-that-learn-from-customer-calls/
(@Encore AI@TechCrunch)
2、telli 完成 1500 万美元种子轮融资:语音、聊天与 WhatsApp 智能体统一处理客户运营

柏林初创公司 telli 完成 1500 万美元种子轮融资,由 redalpine 领投,Mutschler、Cherry Ventures、Y Combinator 及多位天使投资人参投,累计融资超过 1850 万美元。其平台面向 B2C 企业,将语音、聊天、SMS、WhatsApp 和邮件中的客户交互统一交由智能体处理,并通过 AI 协作者 Charlie 帮助运营团队构建、分析和持续优化这些智能体。
-
五类渠道统一接入客户运营流程:telli 智能体可跨语音、聊天、SMS、WhatsApp 和邮件运行,处理客户咨询、线索筛选、预约安排和服务请求,减少不同渠道之间独立配置工作流和上下文割裂的问题。
-
Charlie AI 协作者负责智能体构建与持续优化:Charlie 可连接企业内部系统、分析历史客户对话、识别运营问题,并协助团队调整智能体的沟通方式与执行流程,不仅承担对客交互,也参与后台运营管理。
-
支持从单次对话扩展至端到端业务动作:平台可让智能体执行线索资格判断、预约写入、客户跟进和服务请求处理,并将客户会话、业务状态与后续工作流关联,而非只生成问答回复。
-
已处理数百万次客户对话:telli 表示,其智能体已服务从中小企业到大型企业的客户,每年处理数百万次客户交互;官方产品页还支持从单路扩展至数千路并行通话,并覆盖 30 多种语言。
-
融资用于扩充工程、商业团队与多渠道能力:本轮资金将用于扩大工程和市场团队,继续开发 Charlie、语音及多渠道智能体平台,并推动其在更多 B2C 客户运营场景中的部署。
https://tech.eu/2026/07/23/telli-secures-15m-seed-to-automate-customer-facing-operations/
(@telli)
3、Intelligent Internet 开源 Genii 个人智能体:消息入口交互,支持长期记忆与本地部署
Intelligent Internet 开源个人智能体 Genii,将 AI 助手入口从独立聊天窗口迁移至日常消息场景。项目支持通过消息与智能体持续交互,并通过长期记忆保存用户上下文,使智能体能够跨会话延续任务和个人偏好。
-
消息即入口的个人智能体架构:Genii 将用户交互层设计为消息接口,用户无需进入专用 AI 应用即可向智能体发送请求;系统围绕个人助手场景设计,而非单次问答机器人。
-
长期记忆模块支持跨会话上下文保持:项目引入持久化记忆机制,用于保存用户历史交互中的关键信息,使智能体能够在新的对话中调用此前上下文,减少重复输入。
-
开源个人智能体运行框架:Genii 提供完整代码仓库,开发者可自行部署和修改智能体逻辑;项目定位为个人 AI 基础设施,而非单一模型能力展示。
-
面向主动式个人助手场景设计:相比传统聊天机器人依赖用户主动发起每次请求,Genii 的核心方向是结合个人记忆和持续上下文,让智能体更适合作为长期协作对象。
-
开放源码与 Web 体验入口:项目同步提供 GitHub 开源仓库和在线体验入口,开发者可查看实现细节并直接体验 Genii 的个人智能体能力。
https://github.com/Intelligent-Internet/genii
https://x.com/ii_posts/status/2082474832877269208
(@Intelligent Internet)
03 有态度的观点
1、OpenAI 总裁 Greg Brockman:未来计算入口将从键盘转向语音

OpenAI 总裁 Greg Brockman 在接受《华尔街日报》记者 Joanna Stern 采访时表示,语音将成为未来人与 AI 交互的主要方式,下一代计算设备不再只是围绕屏幕和键盘设计,而是围绕人与 AI 的自然交流展开。
Brockman 认为,当前 ChatGPT 桌面应用仍存在一些体验问题,但 OpenAI 正持续改进。同时,他透露 OpenAI 正在探索新的 AI 设备形态,希望重新定义人与计算机之间的连接方式。
过去几十年,人类逐渐适应计算机的交互方式:点击鼠标、敲击键盘、操作触摸屏。而 AI 时代的变化可能恰恰相反——计算机需要开始理解人的表达方式。语气、停顿、上下文和情绪,都将成为新的交互信号。
这一趋势也解释了为什么语音成为当前 AI 产品竞争的重要方向。从 ChatGPT Voice、Realtime API 到各种 AI Agent,实时语音正在从「辅助功能」变成 AI 服务的核心入口。
Brockman 认为,未来人们不会再像今天一样「使用电脑」,而是直接与智能系统交流。计算机的下一次革命,可能不是更强的屏幕,而是更懂人的对话。
https://x.com/JoannaStern/status/2082485630513156597
(@JoannaStern@X)


阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考