本文整理自 QCon北京 2026 李云鑫《从Copilot到Director多模态智能体如何接管AIGC流程》技术分享通过AI音视频转录总结工具Ai好记转录整理以下为视频转文字后的会议笔记内容。AIGC工具遍地开花但为什么还是用起来费劲现在的 AIGC 工具已经多到数不过来。文生图、图生视频、视频剪辑、语音合成每一个细分赛道都有好几个产品。按理说工具越丰富创作应该越方便。但实际情况恰恰相反工具泛滥反而带来了精力消耗。问题出在哪李云鑫在分享中指出当前 AIGC 工具有三大核心痛点规划无逻辑复杂任务比如生成一段短视频涉及多个步骤但现有工具在长程推理和步骤规划上远远不够。工具调用缺乏统筹要做一条完整的视频往往需要在多个工具之间来回切——完图用A工具配音用B工具剪辑用C工具。人成了那个胶水层。评估标准缺失扩散模型天然有随机性同一段 prompt 生成5条结果可能只有1条能用。谁来帮你挑这三个痛点叠加导致一个荒诞的现实工具在提效人在当调度。最终大部分时间不是花在创作上而是花在串联工具上。解题思路以语言智能为大脑李云鑫团队的核心思路很简单但很有效用大语言模型的强规划和抽象能力来接管整个AIGC工作流的调度。具体来说就是构建一个以语言智能为核心的智能体框架基座是全模态大模型能理解文字、图像、音频、视频上层是多模态智能体框架具备复杂任务规划和长程交互推理能力外挂各类 AIGC 工具把生成任务藏到工具调用里这个架构有个很有意思的设计原则不追求一个模型搞定所有事。团队选择的是大语言模型 外挂模块把具体的生成任务比如画图、配音视为工具调用由语言模型指挥合适的工具去执行。全模态基座模型的构建路径要撑起这个智能体框架基座模型必须同时具备理解和生成两种能力。李云鑫团队走了一条务实的技术路线多专家混合架构MoE 渐进式三阶段训练第一阶段让模型学会理解外部信息图像、音频、视频第二阶段预热各专家模块第三阶段任务级调优他们训练的Uni-MoE-20-Omni模型在仅用75B tokens的训练规模下效果已经超越了千万参数的 Omni 模型。这在当时是相当亮眼的成绩。不过更重要的是团队发现外挂式结构才是构建综合型多模态大模型最方便的路径。原因很简单——生成模型迭代太快今天用的文生图模型下周可能就有更强的替身。外挂式的架构允许你随时换发动机。复杂任务推理用强化学习教模型思考有了基座模型还不够要让智能体真正能干复杂活还得教它怎么推理。李云鑫团队在这块用了迭代式强化学习方案冷启动先用已有数据让模型具备基础能力生成采样让模型在真实场景中生成数据强模型筛选用更大的模型来批改作业只保留有效的推理路径DPO对齐用正负样本对加速对齐效果非常明显。在 AIGC 场景中没有推理过程的模型只能生成粗粒度结果而带了推理过程的模型能显著提升生成质量。更有意思的是他们在 UI 操控场景做的多目标强化学习实验。传统的 RPO 训练只有一个监督目标但在复杂的 UI 工作流中单一目标根本不够。团队的做法是在关键中间节点也施加奖励让模型保持路径多样性。结果是一个 7B 的小模型在 UI 调试场景中达到了 96% 的幻觉通过率超越了 GPT-4o 和 Claude 在未见场景上的表现。从 Copilot 到 ComfyAgent 的实践理论讲完来看实际落地的产品。李云鑫团队做了三个递进式的智能体项目ComfyUI-Copilot给 ComfyUI 配了一个AI副驾驶。用户输入需求中控 Agent 从知识库检索相关技能自动生成工作流然后调试修复最后验证交付。这个项目在 GitHub 上拿了 1500 星标还被官方集成了在阿里国际业务也有落地。Anim-Director四智能体协作框架——导演智能体管剧本和分镜摄影智能体调用视频生成模型评估智能体管质量打分14个维度包括美学、一致性、动作质量等后期智能体管配音和后期处理。配合蒙特卡罗搜索做路径优化生成了《小王子》片段。AIGC智能体员工整合前期所有工作迭代实现了全流程自动化。一句话输入比如被老板PUA了系统自动完成从剧本创作到成片输出的全流程。甚至支持多集续写通过飞书/微信就能交互。这个员工后来被美国电影制片人关注并转发带来了25万关注量。AIGC智能体的未来构想李云鑫在分享的最后给出了AIGC智能体发展的三个支柱工具智能维护好 Skill 与工具包组合保持灵活替换的能力叙事能力大模型在剧本创作上有天然优势这会是智能体的核心差异点智能体自进化通过闭环优化知识蒸馏、记忆库沉淀让智能体越用越好用他提到目前 Agentic RL 还处于起步阶段但像 Kimi 2.5 在并行智能体 RL 上的创新已经让人看到了方向。最终的目标是让内容创作不再被技术流程束缚每个人都能把自己的想法直接变成专业内容。对技术团队的三点启发听完整场分享我觉得有几点特别值得技术团队思考外挂式比大一统更实用。别试图做一个什么都能干的超级模型把生成当作工具调用反而更灵活。推理能力是关键分歧点。同样的模型、同样的工具有没有推理过程输出质量差了一个量级。强化学习是教会模型思考的有效路径。智能体自进化能力决定天花板。能沉淀经验、自我迭代的智能体才会越用越好。FAQQAIGC 智能体框架的开源方案有哪些可以参考AComfyUI-Copilot 是一个不错的起点GitHub 上可以找到相关代码。此外MCP 协议和 GEP 协议也值得关注。Q小模型在智能体场景下真的够用吗A不一定非要大模型。李云鑫团队的实验显示7B 模型在配合强化学习后在特定场景如 UI 调试上的表现可以超越 GPT-4o。关键是训练策略和场景聚焦。Q智能体自进化的具体实现思路是什么A核心是经验沉淀 闭环验证。把每次执行中的有效路径和失败案例都结构化存储定期回训练模型形成正反馈循环。以上内容由Ai好记视频转笔记整理。Ai好记是一款音视频转图文笔记的AI音视频转录总结助手支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件视频转文字后自动截取PPT关键帧生成精华速览、思维导图和结构化笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。
智能写作工具如何提升学术研究效率与质量 1. 为什么专业研究者都在转向智能写作工具?去年帮导师审阅研究生论文时,一个现象让我震惊:近30%的参考文献存在格式错误,而正文中的学术表达问题更是普遍。这促使我开始系统研究当前学术写作的痛点,最终发现了千笔这类…
深入解析TI bq20z40-R1 BMS芯片:二级PF保护与Impedance Track电量计量 1. 项目概述与核心价值在锂离子电池的应用世界里,安全与精准是两条不可逾越的生命线。无论是你手中的笔记本电脑、电动工具,还是路上飞驰的电动汽车,其内部电池组的“大脑”——电池管理系统(BMS)——都在无声地执行着…
AI短剧全流程自动化系统:从剧本到视频的革命性工具 1. 项目概述:AI短剧全流程自动化系统这个系统最吸引我的地方在于它打通了从文字到视频的完整创作链路。作为一名经历过传统影视制作全流程的从业者,我深知剧本创作、分镜设计、拍摄制作这三个环节的割裂会消耗多少沟通成本。现在通过这个开源系统&#x…
苏州账务通财税咨询有限公司——苏州代理记账、工商注册、税务筹划、股权设计服务 - 海棠依旧大 苏州账务通财税咨询有限公司是苏州本地正规持证财税服务机构,坐落于苏州市姑苏区,公司注册资本200万元,持有财政局颁发的《代理记账许可证》,具备合法合规的工商代办、账务处理、税务咨询、财税筹划服务资质。公司…
终极淘宝数据采集解决方案:TSDK爬虫SDK全面解析 终极淘宝数据采集解决方案:TSDK爬虫SDK全面解析 【免费下载链接】TSDK 淘宝爬虫SDK,用于淘宝开放平台或淘宝、天猫、阿里巴巴登录爬取 项目地址: https://gitcode.com/gh_mirrors/ts/TSDK TSDK是一款功能强大的淘宝爬虫SDK,专为淘宝开…
ABAQUS岩石压裂仿真:Drucker-Prager模型与圆柱试样建模指南 1. 项目概述:岩石压裂仿真与ABAQUS实操指南在岩土工程和地质力学领域,数值仿真是研究岩石力学行为的黄金标准。ABAQUS作为行业标杆级的有限元分析软件,其强大的非线性计算能力和灵活的材料模型定义功能,使其成为岩石力学仿真不可替…
FireRedTTS-1S:高效流式中文语音合成技术解析 1. 项目概述:FireRedTTS-1S的定位与核心优势FireRedTTS-1S是一款面向中文场景优化的新一代语音合成系统,其最大特点是实现了高效可流式的语音生成能力。在实际测试中,该系统在普通消费级GPU上能达到每秒生成超过20个中文字符的速率࿰…
上传图片生成动态视频哪个好?5款图生视频深度对比 上传图片生成动态视频,为什么大家总在纠结「像不像」做短视频矩阵、小说推文、产品种草时,最常见的需求就是:手里有一张产品图 / 角色设定图 / 场景参考图,想直接让它「动起来」。但一上手就会发现,AI 生成的视频要么主…
Java instanceof操作符:类型检查与模式匹配实战 1. 为什么instanceof是Java程序员必须掌握的基础操作符 第一次接触Java的instanceof操作符时,我完全不明白这个看似简单的关键字为什么会被面试官反复追问。直到在实际项目中处理类型转换异常时,才真正体会到它的价值。instanceof不仅仅是语法糖…
告别臃肿!3步让你的暗影精灵笔记本重获新生 告别臃肿!3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%! 做 RAG 的人应该都踩过这个致命的坑:把几百页的财报、法规、技术手册扔给向量库,问一个具体问题,搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了,要么藏在几十条结果的最下面。语义相似≠真正相关,这个…
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽 2026年做短视频运营,从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候,每天刷半小时抖音,手动把爆款视频的口播敲进备忘录,一条2分钟的视频得花十来分钟,碰到语速快的还要反复回听。后来试了一圈工具&am…
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集 Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…
智慧飞行 大疆无人机一站式智能管控平台/支持大疆机场/私有化部署 从航线规划、自动飞行、AI识别到数据管理,一个平台全搞定 智慧飞行-大疆无人机一站式智能管控平台/支持大疆机场/私有化部署 企业级全域智能无人机一体化管控平台源码! 专为电力巡检、安防监控、应急救援、测绘勘察等行业打造,让您的无人机舰队实现 “无人化、自动化、智能化” 管理! 🎯 …
揭秘ChatGPT+Mathematica协同教学:为什么92%的初学者在72小时内建立函数直觉? 更多请点击: https://codechina.net 第一章:AI帮助理解数学概念 人工智能正以前所未有的方式重塑数学学习的路径。通过自然语言处理与符号计算的深度融合,AI不仅能解析抽象定义,还能将定理、证明和几何直觉转化为可交互、可验证的…
[C++]内存管理:串顺序存储的内存回收 在串(字符串)的顺序存储中,内存回收的方式取决于字符串的存储方式以及所使用的编程语言和相关库。以下以 C 为例进行说明,因为 C 对内存管理有较为直接的控制。 1. 基于 char 数组的串顺序存储 如果使用普通的 char 数组来存储字…
移动端游戏功耗测试实战:电流、功率、亮度和场景对比 移动端游戏功耗测试:先控制变量,再比较优化是否真的省电 摘要:功耗测试最容易犯的错误,是拿两次不同温度、不同亮度、不同场景的平均功率直接比较。本文给出一套可复现的游戏功耗测试方法,覆盖引擎特性验证、版本回归和黑盒体验测试,并说明如何把功耗与帧率、温控、CPU/G…
足球口袋教练 HarmonyOS 离线应用实战(03/20):ArkUI 首页仪表盘搭建 本文是“足球口袋教练 HarmonyOS 离线应用实战”系列第 3 篇。示例项目是一个 HarmonyOS / ArkTS / ArkUI 编写的离线足球训练助手,围绕真实页面、真实截图和可复现操作展开。 本篇要解决的问题 训练 App 的首页不能只展示欢迎语,它要解决“我现在该点哪…