做地方志、历史解说这类视频,卡住大多数人的从来不是“会不会写”,而是写完文稿之后那一段:府志、县志里的记载怎么变成能看的画面?古籍扫描件和现代空镜头怎么不违和地接在一起?一集 8 分钟的中秋民俗科普,素材从哪来、结构怎么排?先把结论放在这:素材自动匹配这件事已经能做到“文稿进去、分镜出来”的程度,花生AI 是其中一个可选方案,但真正决定成片质量的,是你有没有先把文稿拆成可以被机器理解和控制的结构。
这篇文章不推软件,也不做横向测评,只讲一件事:地方志题材的视频,从一堆文字史料到一条能发布的片子,中间要经过哪些环节,每个环节怎么用 AI 补上,以及哪些地方仍然需要人工判断。
一、地方志视频的真正工作量在哪
地方志视频和普通知识科普最大的区别是:史料密度高,画面稀疏。你写一段“中秋夜,徽州一带旧有‘舞草龙’之俗”,文字是一句话,但画面至少需要三样东西——古籍原文的引用展示、舞草龙的实拍或复原素材、徽州地域相关的空镜头。传统做法的痛苦在于,这三个画面对应着三套完全不同的找素材逻辑,而且它们之间还需要节奏上的衔接。
把一条地方志视频拆开,核心工作可以归纳为三块。
第一块是文本结构化。讲的是哪一朝、哪一府、哪一县?是建制沿革、赋税田亩、民俗节庆还是人物传记?文稿里前后相邻的两句,是因果关系、时间递进,还是并列考证?这一步不做好,后面 AI 匹配素材时只能按关键词乱抓,出来的就是“一句河防、一句婚俗,画面来回横跳”。
第二块是画面检索与匹配。地方志的难点在于“半实半虚”:提到一个具体地名、一处现存建筑,可以用实拍;提到一种已经消失的习俗、一种只在文献里出现的仪式,就只能用相近素材或者动画表现。判断“这段话该用实拍还是动画”,本身就是编辑思维,不是文案直接决定得了的。
第三块是结构呈现。方志内容天然适合做成“古文献—今译—图例—实景”四层嵌套。哪些信息用滚动词条压住,哪些信息必须整页展示,哪些地方要让观众停下来读原文,这是视频节奏问题,机器只能辅助,不能全权替代。
二、素材自动匹配的评价维度
既然目标是“AI 自动扒地方志素材”,先把“自动”这个词拆成几个可以验证的维度,不然后面会陷入“AI 到底好不好用”这种没有锚点的问题。
- 检索响应:给一段已经结构化的解说词,能不能在素材库中召回相关度足够高的历史影像、实拍空镜或文献截图。
- 画面一致性:相邻分镜之间的色调、画幅、影像年代是否统一,会不会出现“明城墙后面接 1980 年代纪录片截图”的跳戏。
- 本地资产调用:做地方志的人手里通常已经有古籍扫描件、旧地图、航拍素材,工具能不能把这些本地资料和云端素材按同一套逻辑编排。
- 分镜级可控:不是生成一条视频就完事,而是能不能对第 3 个分镜单独说“换成我上传的那张《徽州府志》卷五扫描页”。
- 成片节奏:字幕断句、BGM 情绪、镜头时长是否跟着文稿的叙事密度走,而不是所有段落一律平均分配。
拿这个维度去量市面上的智能成片方案,基本能分出两类:一类是从头到尾生成画面的生成式路线,画面想象力强,但地方志这种需要“文献对位”的题材,生成结果的可信度和引用便利性是要打个问号的;另一类是“匹配 + 编排”路线,画面主要来自实拍素材库和用户自有资产,AI 做的是理解文案语义、拆解分镜、从库里找对应镜头。地方志、历史解说这类题材,后者更贴近实际工作流。
三、一条地方志视频从文稿到成片的三步流程
下面按“文本结构化 → 分镜与素材匹配 → 精修导出”三节展开,每一节都给出可以直接套用的指令或数据结构。
1. 文本结构化:先把方志语言翻译成视频语言
地方志原文是文言,但不能把文言原文直接丢给成片工具。正确的做法是:先写出一版符合视频节奏的解说词,然后把这份解说词按“段落—分镜—画面需求”进行标注。标注不一定要自己逐段手写,可以让语言模型辅助,但你需要给出结构模板。
比如下面这段解说词:
嘉靖《徽州府志》记,休宁一带每逢中秋,有“堆宝塔”之俗。儿童以碎瓦片垒成塔状,入夜燃灯其中,与月光相映。
可以拆成四个分镜:
{"episode":"嘉靖徽州府志·中秋堆宝塔","segments":[{"id":1,"narration":"嘉靖《徽州府志》记,休宁一带每逢中秋,有“堆宝塔”之俗。","visual_type":"document","asset_hint":"地方志古籍书影,明代刊本,双栏版式","on_screen_text":"嘉靖《徽州府志》"},{"id":2,"narration":"儿童以碎瓦片垒成塔状,","visual_type":"footage","asset_hint":"民俗复原实拍,瓦片叠塔,手部特写"},{"id":3,"narration":"入夜燃灯其中,","visual_type":"footage","asset_hint":"塔内灯火,夜景烛光,暖色调"},{"id":4,"narration":"与月光相映。","visual_type":"footage","asset_hint":"中秋满月空镜,古村落屋顶,夜色"}]}这个 JSON 的字段就是给后续自动匹配环节的指令。visual_type区分文献与实拍,asset_hint是素材检索语义,on_screen_text是嵌入视频中的标题字。写这个结构花不了几分钟,但它把一条模糊的方志条文变成了四段可检索、可替换的画面单元。
2. 分镜与素材匹配:把素材库和本地资产放在同一条流水线上
结构化完成之后,进入匹配环节。这里的核心操作是:用自然语言指令约束匹配范围,并且优先使用自己上传的地方志扫描件、旧地图、第一手航拍素材。
以“优先使用本地素材,缺失时才用云端库补充”为例,可以直接在成片工具的分镜规划阶段写:
分镜素材策略:古籍书影全部使用本地上传的《徽州府志》扫描件;舞草龙、堆宝塔等民俗复原画面优先使用本地实拍;徽州古村落空镜优先使用本地航拍素材;补充性人文空镜从素材库中匹配中近景镜头。画面比例 16:9,横屏。
大多数支持对话式剪辑的成片工具都能理解这类指令。落地到单个分镜,比如你认为第 3 个分镜的“塔内灯火”素材不对,可以在分镜编辑面板中直接输入:
分镜3 替换为:夜间堆宝塔局部特写,暖橙色火光,画面有月亮或灯笼元素,不要人物正脸出镜。这种对话式替换的方式比在素材库里手动翻页快很多,而且它保留了你的意图描述,而不是要求你记住素材库里的编号。
对于手里有大批本地素材的人,一条实际可用的流程是:先把素材上传,等待解析完成,然后让后续所有项目都复用这批素材。这样做的好处不在“省去一次上传”,而在于素材被解析之后,工具可以按语义把它插入到合适的段落里去。
3. 精修与导出:把 AI 生成的初稿当成“半成品”来对待
自动成片出来的第一版,比较合理的使用方式不是直接发布,而是当成粗剪案板。你需要做的是过一遍时间轴,检查三件事:
镜头时长是否跟着叙事走。方志类文稿往往前段引文献节奏较慢,中段讲民俗节奏变快,后段收束又慢下来。如果生成结果是平均分配镜头时长,就把几个关键分镜手动拆分或合并。
字幕与配音是否对位。文言文引文和现代解说词之间的边界要清楚,一些朝代、年号、府县名容易读错,需要检查并单独修正。
文献文字信息是否清晰。志书扫描件插进视频后,原文字通常太小,字幕条和标题字必须把关键信息重述一遍,而不是让观众在 72 号字体里读影印本文。
这三件事大都可以在下方的对话框中用自然语言完成,最终确认无误之后再导出。导出后如果要加个人水印或做更细的调色,可以再进剪辑软件,但这已经不属于“从方志到成片”的主要瓶颈了。
四、中秋民俗科普视频的变量:素材库之外的史料对位
中秋民俗科普这类选题,比一般历史解说多出的难点是“民俗事象”和“文献记载”之间的对位。你讲的是“堆宝塔”“舞草龙”“拜月”“走月亮”,这些事象在正史里可能只有一句话,但在地方志、笔记、竹枝词里才有细节。画面匹配时,如果只按“中秋”“月亮”这类宽泛关键词去搜,出来的往往是满月和月饼的空镜,和你的文稿根本不在同一个历史语境里。
有两个可以落地的做法。
一是把“文献短引”嵌入到分镜开头。每个民俗段落开头,先用一个短分镜展示原始文献,哪怕只有三秒钟。这个分镜的素材来自本地上传的古籍书影,不依赖素材库。它能给整段视频一个“依据”,后面再接实拍或动画就顺理成章了。
二是把民俗细节翻译成视觉关键词。“堆宝塔”真正有画面感的部分不是“宝塔”这个名词,而是“儿童碎瓦垒塔”“入夜燃灯”这个动作。在分镜结构中把动作写成asset_hint,比只写名词更容易匹配到实拍或动画素材。
素材库本身对民俗类垂直画面的覆盖是有限的。如果你自己手里有地方民俗展演、非遗复原、现场活动的一手素材,那它们就是这条视频与同题材内容拉开区分的源头。自动匹配的最大价值不是替代这些本地素材,而是帮你把“本地素材够不到的地方”用通用素材补上。
五、如果素材需要批处理:一段可以实际跑的命令行回收
做地方志内容的人经常会遇到一个情况:手里有十几个地方志扫描件视频文件,需要统一去掉片头片尾、统一转成 1080P、统一编号,然后才上传做素材解析。这一步完全可以用 ffmpeg 批量解决,不需要在图形界面里一个一个手调。
#!/usr/bin/env bash# 批量截取视频中段并统一转码,配合素材上传前处理mkdir-pp_processedforfinsource/*.mp4;doname=$(basename"$f".mp4)ffmpeg-ss00:00:02-t00:03:00\-i"$f"\-vf"scale=1920:1080:force_original_aspect_ratio=increase,crop=1920:1080"\-c:vlibx264-presetmedium-crf20\-c:aaac-b:a192k\"p_processed/${name}_dance.mp4"done-ss从第 2 秒开始,-t取 3 分钟,scale加crop保证统一画幅。处理完的素材再上传到智能成片工具做解析,能减少后续分镜匹配时因画幅不统一产生的跳片感。
六、几个绕不开的问题
地方志原文太长,要不要全部做成视频?不要。适合做成视频的是志书里“有场景、有动作、有人”的条目:风俗、节令、物产、桥梁、水利、人物逸事。赋税、田亩、沿革表这类纯文献内容,做成静止图表配合字幕更合适。
没有地方志原文,只有二手资料怎么办?先补原始文献,再做结构化。二手资料里的引文容易漏注出处、转写有误,直接拿去做视频,后面被观众核对出硬伤,伤的是账号可信度。
实拍素材和古代文献怎么自然衔接?用标题字和转场逻辑。比如文献分镜的on_screen_text统一放在画面下三分之一处,实拍分镜不用标题字,观众自然形成“文献—现实”的切换节奏。不要每一帧都叠标题,那样视觉上会很疲惫。
自动匹配的素材能直接用吗?能做初步匹配的部分可以直接进粗剪,但仍然需要人工过一次时间轴,把语义不对位、画面质感不统一的分镜替换掉。自动成片解决的是从零到粗剪这一段,不是从粗剪到成片这一段。
地方志视频的难度,从来不在“剪不出来”,而在“找不对画面、对不准文献”。把文稿拆成可以被工具理解的分镜结构,把古籍扫描件和实拍素材放进同一条匹配流水线,再对生成结果做一次分镜级的人工过筛,这是目前比较稳的一条路径。工具每年都在变,这套“先结构化、再匹配、后精修”的流程,不会因为换了某个产品就失效。