本文整理自 QCon北京 2026 李云鑫《从Copilot到Director:多模态智能体如何接管AIGC流程》技术分享,通过AI音视频转录总结工具Ai好记转录整理,以下为视频转文字后的会议笔记内容。
AIGC工具遍地开花,但为什么还是用起来费劲?
现在的 AIGC 工具已经多到数不过来。
文生图、图生视频、视频剪辑、语音合成,每一个细分赛道都有好几个产品。按理说工具越丰富,创作应该越方便。但实际情况恰恰相反:工具泛滥反而带来了精力消耗。
问题出在哪?
李云鑫在分享中指出,当前 AIGC 工具有三大核心痛点:
- 规划无逻辑:复杂任务(比如生成一段短视频)涉及多个步骤,但现有工具在长程推理和步骤规划上远远不够。
- 工具调用缺乏统筹:要做一条完整的视频,往往需要在多个工具之间来回切——完图用A工具,配音用B工具,剪辑用C工具。人成了那个"胶水层"。
- 评估标准缺失:扩散模型天然有随机性,同一段 prompt 生成5条结果,可能只有1条能用。谁来帮你挑?
这三个痛点叠加,导致一个荒诞的现实:工具在提效,人在当调度。最终大部分时间不是花在创作上,而是花在串联工具上。
解题思路:以语言智能为大脑
李云鑫团队的核心思路很简单但很有效:用大语言模型的强规划和抽象能力,来接管整个AIGC工作流的调度。
具体来说,就是构建一个以语言智能为核心的智能体框架:
- 基座是全模态大模型(能理解文字、图像、音频、视频)
- 上层是多模态智能体框架,具备复杂任务规划和长程交互推理能力
- 外挂各类 AIGC 工具,把生成任务"藏"到工具调用里
这个架构有个很有意思的设计原则:不追求一个模型搞定所有事。团队选择的是"大语言模型 + 外挂模块",把具体的生成任务(比如画图、配音)视为工具调用,由语言模型"指挥"合适的工具去执行。
全模态基座模型的构建路径
要撑起这个智能体框架,基座模型必须同时具备理解和生成两种能力。李云鑫团队走了一条务实的技术路线:
多专家混合架构(MoE)+ 渐进式三阶段训练:
- 第一阶段:让模型学会理解外部信息(图像、音频、视频)
- 第二阶段:预热各专家模块
- 第三阶段:任务级调优
他们训练的Uni-MoE-20-Omni模型,在仅用75B tokens的训练规模下,效果已经超越了千万参数的 Omni 模型。这在当时是相当亮眼的成绩。
不过更重要的是,团队发现:外挂式结构才是构建综合型多模态大模型最方便的路径。
原因很简单——生成模型迭代太快,今天用的文生图模型,下周可能就有更强的替身。外挂式的架构允许你随时换"发动机"。
复杂任务推理:用强化学习"教"模型思考
有了基座模型还不够,要让智能体真正能干复杂活,还得教它怎么推理。
李云鑫团队在这块用了"迭代式强化学习"方案:
- 冷启动:先用已有数据让模型具备基础能力
- 生成采样:让模型在真实场景中生成数据
- 强模型筛选:用更大的模型来"批改作业",只保留有效的推理路径
- DPO对齐:用正负样本对加速对齐
效果非常明显。在 AIGC 场景中,没有推理过程的模型只能生成粗粒度结果,而带了推理过程的模型能显著提升生成质量。
更有意思的是他们在 UI 操控场景做的多目标强化学习实验。传统的 RPO 训练只有一个监督目标,但在复杂的 UI 工作流中,单一目标根本不够。
团队的做法是:在关键中间节点也施加奖励,让模型保持路径多样性。结果是一个 7B 的小模型,在 UI 调试场景中达到了 96% 的幻觉通过率,超越了 GPT-4o 和 Claude 在未见场景上的表现。
从 Copilot 到 ComfyAgent 的实践
理论讲完,来看实际落地的产品。李云鑫团队做了三个递进式的智能体项目:
ComfyUI-Copilot:给 ComfyUI 配了一个"AI副驾驶"。用户输入需求,中控 Agent 从知识库检索相关技能,自动生成工作流,然后调试修复,最后验证交付。
这个项目在 GitHub 上拿了 1500 星标,还被官方集成了,在阿里国际业务也有落地。
Anim-Director:四智能体协作框架——导演智能体管剧本和分镜,摄影智能体调用视频生成模型,评估智能体管质量打分(14个维度,包括美学、一致性、动作质量等),后期智能体管配音和后期处理。配合蒙特卡罗搜索做路径优化,生成了《小王子》片段。
AIGC智能体"员工":整合前期所有工作迭代,实现了全流程自动化。一句话输入(比如"被老板PUA了"),系统自动完成从剧本创作到成片输出的全流程。甚至支持多集续写,通过飞书/微信就能交互。
这个"员工"后来被美国电影制片人关注并转发,带来了25万关注量。
AIGC智能体的未来构想
李云鑫在分享的最后给出了AIGC智能体发展的三个支柱:
- 工具智能:维护好 Skill 与工具包组合,保持灵活替换的能力
- 叙事能力:大模型在剧本创作上有天然优势,这会是智能体的核心差异点
- 智能体自进化:通过闭环优化(知识蒸馏、记忆库沉淀)让智能体越用越好用
他提到目前 Agentic RL 还处于起步阶段,但像 Kimi 2.5 在并行智能体 RL 上的创新,已经让人看到了方向。最终的目标是:让内容创作不再被技术流程束缚,每个人都能把自己的想法直接变成专业内容。
对技术团队的三点启发
听完整场分享,我觉得有几点特别值得技术团队思考:
- "外挂式"比"大一统"更实用。别试图做一个什么都能干的超级模型,把生成当作工具调用,反而更灵活。
- 推理能力是关键分歧点。同样的模型、同样的工具,有没有推理过程,输出质量差了一个量级。强化学习是"教会模型思考"的有效路径。
- 智能体"自进化"能力决定天花板。能沉淀经验、自我迭代的智能体,才会越用越好。
FAQ
Q:AIGC 智能体框架的开源方案有哪些可以参考?
A:ComfyUI-Copilot 是一个不错的起点,GitHub 上可以找到相关代码。此外,MCP 协议和 GEP 协议也值得关注。
Q:小模型在智能体场景下真的够用吗?
A:不一定非要大模型。李云鑫团队的实验显示,7B 模型在配合强化学习后,在特定场景(如 UI 调试)上的表现可以超越 GPT-4o。关键是训练策略和场景聚焦。
Q:智能体自进化的具体实现思路是什么?
A:核心是"经验沉淀 + 闭环验证"。把每次执行中的有效路径和失败案例都结构化存储,定期回训练模型,形成正反馈循环。
以上内容由Ai好记视频转笔记整理。
Ai好记是一款音视频转图文笔记的AI音视频转录总结助手,支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件,视频转文字后自动截取PPT关键帧,生成精华速览、思维导图和结构化笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。