公司动态

论文阅读笔记 | The Script is All You Need: 对话到电影级视频生成的 Agentic 框架

📅 2026/8/1 2:58:41
论文阅读笔记 | The Script is All You Need: 对话到电影级视频生成的 Agentic 框架
The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation1. Motivation当前的视频生成模型如 Sora2-Pro、Veo3.1、Wan2.5虽然已经能够根据文本 prompt 合成高质量的短视频但在面对更复杂的创作任务时暴露出根本性的局限从高层叙事概念如一段对话到电影级视频之间存在巨大的语义鸿沟semantic gap。具体来说给定一段粗粒度的角色对话现有模型无法自主完成以下三件事细粒度上下文理解从稀疏对话中消解歧义补全隐含信息电影制作领域知识生成合理的镜头类型、运镜方式等专业规格创意推理将说了什么桥接到应该展示什么。论文的核心论点引用了希区柯克的名言——“拍一部好电影需要三样东西剧本、剧本、还是剧本”认为自动化电影制作中缺失的关键环节正是**剧本Script**本身。因此论文提出在 T2V 生成之前先自动生成一份细粒度、可执行的电影级分镜脚本作为下游视频模型的指导。2. Related Work论文的相关工作主要覆盖三个方向视频生成当前主流方法依赖扩散模型Sora、Wan2.5 等和语言模型CogVideo 等但在长时叙事连贯性方面仍有显著不足特别是受限于固定时长通常 8-12 秒的生成窗口。LLM 用于电影制作Anim-Director、MovieAgent 等系统利用 LLM 进行场景生成和角色规划但普遍依赖人工输入来完成叙事和镜头规划自动化程度有限。故事可视化从早期的 StoryGAN 到近期的 StoryDiffusion、Magic-Me虽然在时序一致性上有所改善但仍缺乏对镜头语言、场景结构和角色交互的自动化高层规划能力。本文的差异化在于提出了一个端到端的多 agent 框架从对话出发自动生成完整的分镜脚本再驱动视频生成减少了人工干预。3. Method整体框架由三个 Agent 组成ScripterAgent剧本生成、DirectorAgent视频执行、CriticAgent质量评测。3.1 ScriptBench 数据集首先构建了 ScriptBench一个大规模的电影级分镜脚本基准数据集包含 1,750 个标注实例1700 训练 50 测试平均视频时长约 15.4 秒。数据来源于高质量电影过场动画具备丰富的对话、专业镜头语言和高视觉一致性。标注流程分三个阶段使用 Gemini-2.5-Pro 作为标注引擎但全程由专家定义的模板和约束规则严格控制上下文重建与对话融合联合分析文本和音频推断角色关系、场景设定、情感倾向等将隐式因果关系显式化镜头级语义规划在镜头完整性、时长适配≤10秒、语义连贯性、技术可行性四个约束下进行分镜规划多轮自适应纠错通过对话完整性、角色外观一致性、场景连贯性、位置与物理合理性四个验证模块进行迭代修正。自动通过率达 94%但专家审核发现了角色瞬移、对话-动作冲突等细微错误这些反馈被融入了后续的约束优化中。3.2 ScripterAgent两阶段训练ScripterAgent 基于Qwen-Omni-7B微调目标是将粗粒度对话转化为结构化的 JSON 格式分镜脚本。阶段一SFT结构能力将任务形式化为 seq2seq 任务输入为多轮对话输出为结构化脚本。使用标准的条件对数似然损失训练 20 个 epoch学习率 1e-5最大序列长度 8192 tokens。此阶段使模型掌握脚本的格式和基本叙事结构。阶段二GRPO电影美学对齐SFT 保证了结构正确性但无法捕捉镜头组合、节奏感、情感冲击力等主观审美。因此引入 Group Relative Policy Optimization (GRPO) 进行偏好对齐。核心是一个混合奖励函数R total ( y ) α ⋅ R structure ( y ) ( 1 − α ) ⋅ R human ( y ) , α 0.4 R_{\text{total}}(y) \alpha \cdot R_{\text{structure}}(y) (1-\alpha) \cdot R_{\text{human}}(y), \quad \alpha0.4Rtotal​(y)α⋅Rstructure​(y)(1−α)⋅Rhuman​(y),α0.4R structure R_{\text{structure}}Rstructure​规则奖励包含格式合规、对话完整性、场景角色一致性、物理合理性四个自动化检查R human R_{\text{human}}Rhuman​人类偏好奖励由 3 位资深美术总监对 500 个 SFT 输出样本打分1-5 分覆盖分镜合理性、角色表演、视觉美学、导演意图四个维度训练了一个 BERT 回归模型作为人类偏好的可扩展代理。GRPO 优化时对每个输入生成 K8 个候选脚本计算组内归一化优势函数并加 KL 散度惩罚β0.04防止偏离 SFT 初始化太远。训练 5000 步学习率 1e-6。3.3 DirectorAgent跨场景连续生成DirectorAgent 负责将脚本转化为连贯的长视频核心是跨场景连续生成策略包含两个关键机制智能分镜分割按照 ScripterAgent 定义的自然镜头边界将脚本切分为多个生成任务而非任意时间切割遵循镜头完整性、时长适配含 10% 安全缓冲、语义连贯性、技术可行性四个原则。帧锚定连续性Frame-Anchoring提取上一个场景的最后一帧作为下一个场景的视觉锚点conditioning image配合文本提示Continuing from the previous scene形成视觉接力显著减少身份漂移和场景突变。本质上是将长时序生成问题转化为一系列局部可解的、保持连续性的子问题。已知局限唇形同步和细粒度动作对齐仍有残差误差。3.4 CriticAgent评测框架CriticAgent 基于 Gemini-2.5-Pro分别对脚本生成和视频生成进行多维度自动评分0-5 分并结合人类专家评分和自动化指标CLIP Score、VBench、VSA构成综合评测体系。其中Visual-Script Alignment (VSA)是论文提出的新指标衡量视频内容是否在脚本指定的时间区间内出现评估时序-语义对齐能力VSA 1 ∑ k 1 K ∣ T k ∣ ∑ k 1 K ∑ t ∈ T k Sim ( E vis ( v t ) , E txt ( I k ) ) \text{VSA} \frac{1}{\sum_{k1}^{K}|T_k|} \sum_{k1}^{K} \sum_{t \in T_k} \text{Sim}(\mathcal{E}_{\text{vis}}(v_t), \mathcal{E}_{\text{txt}}(I_k))VSA∑k1K​∣Tk​∣1​k1∑K​t∈Tk​∑​Sim(Evis​(vt​),Etxt​(Ik​))4. Experiments4.1 脚本生成实验在 ScriptBench 测试集上ScripterAgentFull即 SFTRL在所有 AI 评分和人类评分指标上均显著优于基线方法CHAE、MoPS、SEED-Story方法格式合规分镜合理内容完整叙事连贯角色一致戏剧张力视觉想象SEED-Story3.63.53.73.83.63.73.8ScripterAgent (SFT)3.93.63.83.93.73.63.8ScripterAgent (Full)4.03.94.14.24.04.14.3关键发现SFT 阶段已能学到基本结构但 RL 阶段对主观艺术维度提升显著戏剧张力 3.6→4.1视觉想象 3.8→4.3验证了 GRPO 混合奖励对创意任务的有效性。4.2 视频生成实验对 7 个 SOTA 视频生成模型Vidu2、Seedance1.5-Pro、Kling2.6、Wan2.6、HYVideo1.5、Sora2-Pro、Veo3.1进行了有/无 ScripterAgent 的对比加入 ScripterAgent 后所有模型在所有维度上均有提升平均 AI 评分从 4.2→4.5平均人类评分从 3.7→4.2脚本忠实度Script Faithfulness提升最为显著如 Wan2.6 从 3.2→4.0VSA 指标普遍提升验证了时序-语义对齐的改善发现了一个重要 trade-offSora2-Pro 在视觉效果Visual Appeal 4.8和物理真实性4.5上最强但 HYVideo1.5 在脚本忠实度4.6和叙事连贯性4.3上领先说明当前模型在视觉奇观和脚本遵从之间存在取舍。4.3 消融实验在 Wan2.6 和 HYVideo1.5 上的四阶段消融Baseline → Script → Segment → Full Agent表明ScripterAgent 主要提升视觉描述忠实度和肢体动作表现DirectorAgent分割 帧锚定主要提升叙事节奏和镜头表达维度两者的贡献功能性解耦且三个不同的 LLM 评估器结果高度一致。5. Conclusion论文提出了首个端到端的对话驱动电影级视频生成框架核心思路是先生成专业分镜脚本再驱动视频生成。通过 ScriptBench 数据集和两阶段训练的 ScripterAgent成功弥合了高层叙事与底层视频合成之间的语义鸿沟。实验验证了该方法对所有测试的 SOTA 视频模型均有普适性提升并发现了视觉效果与脚本遵从之间的关键 trade-off。未来方向包括精确唇形同步、自适应生成多样化电影风格的内容。6. 个人思考核心贡献的判断这篇工作的主要贡献其实就是ScripterAgent——训练了一个能将粗粒度对话转化为细粒度分镜脚本的模型。论文的实验设计本质上是在对比不同的 T2V 模型有无 ScripterAgent 辅助时的表现差异以证明脚本规划的价值。关于三个 Agent的包装如果去掉包装来看ScripterAgent 一个经过 SFTGRPO 微调的 7B 模型本质是一个 plannerDirectorAgent 一个基于规则的分割策略 帧锚定的工程 trick并不涉及模型训练CriticAgent 直接调用 Gemini-2.5-Pro 做评测是评估工具而非系统组件。所以整体框架可以简化理解为在 T2V 生成前加了一个 planner脚本生成器用三个 agent 的叙事做了包装。关于流程设计整个 pipeline 是单次前向的——ScripterAgent 生成脚本后直接交给 DirectorAgent 生成视频CriticAgent 只在最终评测时介入不存在生成-评测-修改的反馈循环。如果 CriticAgent 的评估结果能反馈给 ScripterAgent 或 DirectorAgent 进行迭代修正系统的效果可能会更好。这也许是一个值得探索的方向。值得肯定的点Frame-Anchoring 机制虽然不涉及模型训练但它用一个简洁的工程方案上一场景末帧作为下一场景的 conditioning image解决了跨场景视觉一致性这个实际痛点。消融实验也验证了它对叙事节奏和镜头连贯性的独立贡献是一个实用且可迁移的 trick。视觉奇观 vs 指令遵从的 trade-off 发现是本文最有启发性的 insight 。Sora2-Pro 优化方向偏向视觉效果Visual Appeal 4.8, Physical Law 4.5而 HYVideo1.5 优化方向偏向 instruction followingScript Faithfulness 4.6, Character Consistency 4.4。这说明当前的 T2V 模型在训练目标上存在内在分歧——有的追求看起来好看有的追求按指令办事二者尚未统一。这个发现对于实际选型高视觉品质场景 vs 高可控性场景和未来模型设计都有参考价值。VSA 指标关注了内容是否在正确的时间出现这一被忽视的维度有一定新颖性。Related Work 中对前人工作的描述值得商榷论文在 Related Work 中称 MovieAgent 等方法依赖人工输入进行叙事和镜头规划reliance on manual input但 MovieAgent 的全称就是Automated movie generation via multi-agent CoT planning本身就是用多 agent 做自动规划的。论文自己也承认 MovieAgent 使用了 multi-agent 协作紧接着又说它依赖人工输入存在自相矛盾。实际上两者的核心差异不在于人工 vs 自动而在于脚本输出的粒度和专业度——MovieAgent 的输出是较粗的 plot summary 简单运镜描述如 Figure 4 所示而 ScripterAgent 输出的是带精确时间戳、镜头参数、角色外观、空间位置等细粒度信息的可执行分镜脚本。这种在 Related Work 中为突出自身贡献而对前人工作描述稍显不公。不足之处测试集仅 50 个样本规模偏小结果的统计显著性存疑数据来源于游戏过场动画cinematic cutscenes与真实电影场景的多样性和复杂度有差距帧锚定机制虽然有效但比较简单仅用最后一帧做 conditioning在复杂场景变换如跨场景大幅度转场时效果可能有限“Agentic” 的说法有些过度包装整个系统中并没有真正的 agent 间协作或自主决策闭环。