超越试错法:面向图生视频一致性的智能体优化框架
2026/8/13 21:30:20 网站建设 项目流程

超越试错法:面向图生视频一致性的智能体优化框架

arXiv:2608.12290v1,发布时间:2026年8月12日
开源协议:CC BY 4.0

摘要

现有黑盒图生视频(I2V)模型生成能力强大,但精细可控性差,在专业内容制作管线中落地困难。生成模型具有强随机性,文本提示词、超参数微小改动都会造成成片巨大差异,从业者只能依靠暴力反复试错,计算开销高、效率低下。
针对该痛点,本文提出智能体自优化框架(Agentic Self-Improvement),将视频生成重构为闭环目标导向优化流程,采用两段式方案系统性遍历生成参数空间:

  1. 提示词优化阶段:多模态大模型(mLLM)驱动迭代提示词精炼;设计两套自动化评测体系:戴维森场景图(DSG)查询校验语义匹配度、通用缺陷问题(CMQ)检测生成瑕疵;
  2. 超参数优化阶段:基于贝叶斯搜索协同优化随机种子、分类自由引导(CFG)尺度,整套搜索由全新视频-文本对齐分数(VTA)等多维度质量指标引导。
    人工偏好实验证明,本文框架生成视频相较基线优势显著,最高优选率达69%。本文提供一套通用、可扩展方案,大幅提升SOTA视频生成模型的可控性与输出稳定性,将视频生成从随机试错升级为工业化可靠创作工具。

目录

1 引言
2 相关工作
2.1 文生/图生视频模型发展
2.2 视频生成可控性研究
2.3 自动化提示工程
2.4 超参数优化与智能体AI
3 方法体系
3.1 基于结构化评测的提示词优化
3.1.1 语义锚定问题生成(DSG)
3.1.2 迭代提示词精炼闭环
3.1.3 mLLM视觉问答可靠性验证
3.2 基于贝叶斯搜索的超参数优化
3.2.1 自动化评测指标套件
4 实验
4.1 提示词优化消融实验
4.2 贝叶斯搜索完整对比实验
5 讨论
6 结论
参考文献
7 附录
7.1 自动化指标完整定量结果
8 问题生成配套提示词
8.1 DSG场景图生成提示词
8.2 CMQ通用缺陷生成提示词

1 引言

大规模黑盒文生/图生视频模型极大释放了自动化内容创作潜力,但生成效果与专业影视制作需求之间存在巨大鸿沟。专业创作核心诉求是成片严格贴合创作文案与参考输入图,而现有模型存在固有随机性:随机种子、CFG尺度等超参数轻微变动,成片画面、人物、运动逻辑会发生剧烈不可控变化。
从业者只能暴力生成大量视频,随机筛选符合预期结果,该流程算力成本极高、创作效率极低。亟需一套系统化框架,智能遍历参数空间,摆脱盲目试错模式。
本文提出智能体自优化闭环框架,将开放式随机生成改造为目标导向优化流程,分两大阶段解决两大变量来源:文本提示词、模型生成超参数。

  1. 提示词迭代优化:多模态大模型自动生成DSG语义校验问题、CMQ缺陷检测问题,基于VQA打分循环重写提示词,消除语义歧义;
  2. 贝叶斯协同超参数搜索:联合优化随机种子与CFG引导值,以VTA对齐分数、感知质量、时序一致性多目标为优化方向。
    整套框架输出视频在画面、叙事、人物运动层面高度贴合用户创作意图。

本文四大核心贡献

  1. 提出面向黑盒图生视频的智能体自优化闭环框架,系统化实现目标导向可控生成;
  2. 设计基于DSG/CMQ结构化评测的迭代提示词优化方案,依靠多模态大模型自动校验语义完整性;
  3. 采用高斯过程贝叶斯搜索协同优化随机种子与CFG尺度,大幅减少试错次数;
  4. 提出VTA视频-文本对齐指标,基于DSG/CMQ问答结果量化成片与文案匹配程度,作为优化统一反馈信号。

2 相关工作

2.1 文生/图生视频模型发展

视频生成技术从GAN、VAE逐步过渡到扩散模型,早期方案存在时序断裂、分辨率低问题;以Veo为代表的大规模DiT扩散模型依托海量数据集,实现高保真、时序连贯视频生成。近期自回归多模态统一模型可原生处理图文交替序列,但黑盒特性、数据集不可控带来可控性、可复现性难题。

2.2 视频生成可控性研究

仅依靠文本提示词无法满足专业精细创作需求,现有可控方案分为两类:

  1. 附加条件输入:参考图、深度图、人体姿态图等约束画面结构与人物运动;
  2. 解耦生成控制:分离内容、运动、风格维度,但同时精准控制多要素仍是难点。
    本文不改动底层生成模型,通过上层智能体优化提示词与超参数,兼容任意主流I2V模型。

2.3 自动化提示工程

提示词优化分为三类路线:

  1. 梯度优化:将提示词嵌入作为连续向量,最大化区分性奖励;
  2. 强化学习:训练策略网络根据生成图像反馈改写提示;
  3. LLM自动迭代:黑盒场景下依靠大模型根据生成结果循环改写提示。
    本文在LLM自动提示优化基础上引入DSG结构化语义校验,针对视频时序缺陷新增CMQ缺陷检测问题,提升图文、时序双重对齐能力。

2.4 超参数优化与智能体AI

扩散模型生成质量高度依赖CFG、随机种子等超参数;传统网格搜索算力消耗巨大,贝叶斯优化通过概率模型拟合目标函数,以更少评估次数找到最优参数。
智能体AI核心是自主规划、推理、执行闭环:大模型拆解高层目标、调用生成工具、评估结果迭代方案。本文框架完全符合智能体定义:自主生成评测标准、推理缺陷根源、分别在文本(提示词)、数值(超参数)空间执行优化动作。

3 方法体系

图1 智能体自优化框架整体架构
上层:提示词优化闭环;下层:贝叶斯超参数搜索闭环。
图2 DSG场景图与CMQ缺陷问题生成示例
输入提示词:一群女性坐在建筑台阶上
上半部分DSG:逐层拆解实体、动作、位置的是/否校验问题;
下半部分CMQ:针对人物肢体变形、面部闪烁、物体消失等视频典型瑕疵设计校验问题。

整套框架为闭环目标导向系统,分两大独立协同模块:提示词优化器、超参数优化器,分步消除提示歧义、随机生成波动,稳定输出匹配用户创意的视频。

3.1 基于结构化评测的提示词优化

视频生成核心痛点是用户自然提示词与模型训练数据分布存在语义鸿沟。本文采用多轮迭代方案,自动精炼模糊提示词,输出无歧义精准生成指令。

3.1.1 语义锚定问题生成(DSG+CMQ)

输入图文后调用mLLM生成两类可机器核验的结构化是/否问题:

  1. 戴维森场景图(DSG)问题
    基于戴维森场景图理论拆解画面核心实体、动作、位置、从属关系,逐层校验基础语义是否完整。示例:是否存在女性群体、人物是否坐于台阶、台阶是否属于建筑。
    作用:确保文案全部核心视觉要素在视频中完整呈现。
  2. 通用缺陷问题(CMQ)
    专门针对视频生成固有瑕疵设计校验问题,覆盖物体恒存、人体解剖畸变、画面闪烁、无逻辑跳变、重复卡顿等动态缺陷。示例:人物五官是否无扭曲闪烁、肢体结构是否正常。
3.1.2 迭代提示词精炼闭环

完整迭代流程:

  1. 使用当前提示词调用I2V模型生成视频;
  2. mLLM执行VQA,对全部DSG/CMQ问题输出是/否答案,正确回答占比作为对齐分数;
  3. 针对回答为“否”的缺陷问题,引导大模型改写提示词,补充约束条件;
  4. 固定迭代轮次循环优化;
  5. 保存对齐分数最高的提示词,送入下一阶段超参数搜索。
3.1.3 mLLM视觉问答可靠性验证

整套优化闭环依赖mLLM打分可信度,本文开展人工标注对照实验:
随机抽取100组视频-问答样本(50条DSG、50条CMQ),两名标注人工给出真值,对比Gemini 2.5 Pro模型输出结果。

问题类型模型准确率
DSG语义问题92%
CMQ缺陷问题82%
整体平均87%
结论:DSG客观实体识别精度极高;CMQ时序运动类问题存在少量主观偏差,但整体与人工标注高度匹配,可作为自动化评测可靠代理。

3.2 基于贝叶斯搜索的超参数优化

获取最优提示词后,采用Vizier高斯过程贝叶斯算法协同优化CFG尺度(搜索区间1~15)、随机种子。随机种子属于无序分类变量,传统网格/随机搜索效率极低;贝叶斯UCB探索策略优先评估高潜力参数组合,快速淘汰劣质种子,节省算力。
优化目标为多目标奖励函数,由三套自动化指标共同构成。

3.2.1 自动化评测指标套件

完整评测体系覆盖三大维度:画面感知质量、时序连贯性、图文语义对齐。

  1. 感知质量指标
    • RAHF:多模态Transformer模拟人类画质打分,均匀采样10帧取最低分代表视频整体画质;
    • UVQ:CNN通用视频质量指标,综合失真、压缩维度输出MOS分;
  2. 时序连贯性指标
    • 光流突变检测:量化无逻辑镜头跳转;
    • 循环卡顿检测:惩罚2秒静态画面、无意义循环片段;
  3. VTA视频-文本对齐指标(本文核心创新指标)
    复用DSG、CMQ问答树打分,分层加权计算全局匹配分数:
    VTA(V)=1∑wi∑wi⋅Si\text{VTA}(V)=\frac{1}{\sum w_i}\sum w_i \cdot S_iVTA(V)=wi1wiSi
    其中Si=I(mLLM判定正确)⋅Sp(i)S_i = \mathbb{I}(\text{mLLM判定正确}) \cdot S_{p(i)}Si=I(mLLM判定正确)Sp(i),子节点分数被父节点结果掩码:若上层实体不存在,下层动作/细节直接归零;统一权重wi=1w_i=1wi=1
    优势:基础叙事要素缺失会连锁拉低整体分数,精准量化文案完整还原度。

4 实验

实验基础配置

  1. 底层图生视频模型:Veo 2.0,统一生成4秒96帧视频;
  2. 评测数据集:VBench图生图文样本集,共100组独立图文对;
  3. 基线方案:固定提示词随机生成、全随机超参数搜索、最优随机样本筛选;
  4. 评估方式:双人专家盲对比人工偏好测试,统计二项检验95%威尔逊置信区间,所有结果p值小于1e-6,具备统计显著性。

4.1 提示词优化消融实验

实验控制所有超参数不变,仅对比原始VBench提示词、本文迭代优化提示词生成视频。
人工对比结果:优化后视频优选占比27%,基线仅5%,剩余68%无明显差异;证明提示词迭代优化可显著提升成片匹配度。

4.2 贝叶斯搜索完整对比实验

设置两种算力预算:10轮搜索、100轮搜索;
对比基线1:同预算完全随机超参数采样;
对比基线2:100轮随机后筛选最优样本(强基线)。
打分筛选策略:RAHF、VTA、UV、四项平均分,人工偏好统计结果如下:

表1 人工偏好对比(数值=本方案优选占比,剩余为平局)
| 筛选指标 | 10轮 vs 随机基线 | 100轮 vs 随机基线 | 100轮 vs 最优随机基线 |
| ---- | ---- | ---- |
| RAHF | 47% | 69% | 42% |
| VTA | 45% | 63% | 39% |
| UVQ | 42% | 60% | 38% |
| 四项均值 | 45% | 66% | 28% |

实验结论:

  1. 算力越多,贝叶斯搜索优势越明显,100轮下RAHF筛选方案优选率达69%;
  2. 即便对比“随机后筛选最优”强基线,本文贝叶斯优化仍显著领先,证明搜索过程主动挖掘优质参数,而非仅靠后期筛选;
  3. RAHF人类感知对齐度最高,是最优单维度筛选指标。

5 讨论

  1. 核心价值:将提示词、超参数两大波动源统一纳入闭环优化,摆脱随机试错;mLLM作为自动化评测器,无需人工介入即可迭代生成方案;
  2. 框架扩展性:底层I2V模型无绑定,可无缝适配任意扩散式图生/文生视频;后续可拓展多轮叙事、情感风格等高阶评测维度;
  3. 现存局限:多轮迭代带来额外推理算力开销;当前提示词、超参数分两阶段串行优化,未实现联合搜索;
  4. 未来方向:轻量化小模型替代大评测mLLM降低成本;提示词+超参数联合贝叶斯协同优化;增加3D空间、物理逻辑校验问题提升视频真实性。

6 结论

针对黑盒图生视频可控性差、只能暴力试错的行业痛点,本文提出两段式智能体自优化框架。第一阶段依托DSG/CMQ结构化问答迭代精炼提示词,消除语义歧义;第二阶段贝叶斯协同搜索CFG与随机种子,以多目标指标引导生成参数优化。大规模人工偏好实验验证,同等算力下本文方案生成视频显著优于随机基线,最高优选率69%。整套框架通用可拓展,为工业化可控视频生成提供完整闭环优化方案。

参考文献

详见原文arxiv完整引用列表:https://arxiv.org/html/2608.12290v1

7 附录

7.1 自动化指标完整定量结果

基于VBench官方自动化评测套件测算,不同优化方案各项量化指标差异极小,现有数值指标对细微画面、时序瑕疵敏感度不足,这也是本文以人工偏好作为核心评估标准的原因。完整分项指标见下表:

表2 VBench自动化量化结果(均值±标准差)
| 配置 | 画面美感 | 背景一致性 | 动态程度 | 成像质量 | 运动平滑度 | 主体一致性 |
| ---- | ---- | ---- | ---- | ---- | ---- |
| 100轮-RAHF筛选 | 0.616±0.08 | 0.961±0.028 | 42.9% | 69.35±8.46 | 0.991±0.011 | 0.948±0.064 |
| 100轮-VTA筛选 | 0.616±0.079 | 0.961±0.022 | 44.9% | 70.13±7.94 | 0.991±0.008 | 0.957±0.040 |
| 10轮均值筛选 | 0.618±0.079 | 0.965±0.021 | 32.3% | 70.35±7.61 | 0.992±0.011 | 0.964±0.039 |
| 原始基线 | 0.615±0.081 | 0.968±0.025 | 23.0% | 68.90±8.88 | 0.994±0.004 | 0.967±0.042 |

8 问题生成配套完整提示词

8.1 DSG戴维森场景图生成提示词

分析用户文本提示词与可选首尾参考图,按照戴维森场景图理论生成树形分层是/否问题。 识别画面核心主体、动作、地点、属性,每条问题仅校验单一视觉要素。 输出JSON格式,顶层key为scene_graph,每条节点包含: id:唯一标识;element_type:主体/动作/物体/地点/属性;description:要素简述;question:是/否校验问题;children:子节点列表(空则[]) 限制总问题不超过20条,输出纯合法JSON,无多余文字。 示例节点: { "id":"agent_red_bird_1", "element_type":"agent", "description":"红色小鸟", "question":"画面中存在红色小鸟吗?", "children":[{"id":"action_bird_flying_1","element_type":"action","description":"小鸟飞行","question":"红色小鸟正在飞行吗?","children":[]}] } 输入提示词:[用户原始提示词]

8.2 CMQ通用缺陷生成提示词

分析图文输入,生成树形校验问题,专门检测图生视频高频瑕疵,覆盖: 不自然镜头跳转、人体肢体畸变、物体凭空消失/出现、镜头内无逻辑变化、静态物体无合理运动、多余人物物体、无台词人物开口、纹理细节不一致。 输出JSON顶层key为common_mistakes,每条节点字段同DSG; 所有问题设计逻辑:回答“是”代表无瑕疵,“否”代表存在生成缺陷; 总问题不超过20条,输出完整合法JSON,禁止额外说明文字。 示例节点: { "id":"mistake_transition_1", "element_type":"缺陷大类", "description":"镜头过渡不自然", "question":"所有镜头切换流畅无突兀跳切吗?", "children":[] } 输入提示词:[用户原始提示词]

资源链接

论文原文网页:https://arxiv.org/html/2608.12290v1
开源协议:CC BY 4.0
完整评测提示词、贝叶斯搜索超参配置、实验复现代码、VBench数据集使用规范存放于arxiv论文附录;
底层生成模型Veo 2.0官方接口:https://developers.googleblog.com/en/veo-2-video-generation-now-generally-available/
Vizier贝叶斯优化工具:https://arxiv.org/abs/2408.11527
Gemini 2.5 Pro评测模型官方文档可作为VQA推理基座。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询