· 作者 三四八方 · 更新于
Codex 自动剪辑:开源爆火涨粉 100w 的人生副本视频(系列一)
这份实操笔记拆解“人生副本”长视频从选题评分、第二人称剧本、角色与场景设计,到批量生图、火山引擎配音、FFmpeg 渲染和发布验收的完整 AI 流水线,并保留关键参数、提示词与质量检查规则。

“人生副本”是一类第二人称人生体验视频:用电影感插画、低沉旁白和缓慢镜头,在约 8 分钟内讲完一段人生,例如“在县城躺平的一生”或“30 岁被裁员的第 100 天”。
这类内容的主要特点是节奏舒缓、画面统一、故事强调现实共鸣。资料中提到过“单条视频涨粉 100w”和“相关账号涨粉 50w+”两个案例数据,但未提供后台数据或进一步验证材料,可将它们视为选题热度案例,不应直接当作普遍收益预期。
一次实际制作包含 102 张图片,资料中分别出现了“约 6 小时”和“约 8 小时”两种耗时记录。核心经验不是单纯依靠 AI 生图,而是用 Codex 或类似 Agent 环境组织剧本、分镜、生图、配音与渲染任务,并尽可能并行执行。
成片应该具备的五个特征
- 第二人称叙事:观众就是主角,由“你”体验一段人生,这是代入感的主要来源。
- 一句旁白对应一张图:每句话配一幅插画,画面缓慢推近,搭配低沉、平缓的人声。
- 固定栏目片头:轮播外卖员、代驾、货车司机、白领、老板、医生、教师、工人等暗色人生画面,最后定格主题大字。
- 横屏长视频:采用 4:3 画幅,成片约 8~10 分钟,整体接近微型纪录片。
- 固定画风:正常头身与自然五官的二维电影化插画,避免明显的 AI 网红脸和过度写真实感。
开工前的准备
1. 支持多 Agent 的 AI 工作环境
需要能够并行处理多个生产分支,并可调用生图、语音合成和渲染工具。生产环节至少包括:
- 剧本与质检
- 分镜与视觉设计
- 批量生图
- 语音合成
- 视频渲染
重点不在于让 AI 画出一张图,而在于把整条内容生产链组织成可重复执行的流水线。
2. 火山引擎语音合成
用于生成平缓、低沉的克隆音色旁白。资料给出的配置是:
- 服务:火山引擎大模型语音合成
- 资源:克隆音色
seed-icl-2.0 - 音色号:资料中以
xxx代替,未提供真实编号 - 采样率:24k
- 语速:默认,不额外加速
- 免费额度:资料称有 20000 字免费额度,实际额度与计费应以使用时的官方页面为准
3. FFmpeg 与剪映
- FFmpeg:把静态图片渲染成平滑推近的镜头,并按时间轴拼接成片。
- 剪映:生成或打开可编辑草稿,用于发布前调整字幕、音乐和节奏。
4. 固定栏目素材包
建议提前准备并反复复用:
- 片头人生职业轮播图
- 齿轮机械音效
- 主题卡入场重鼓音效
- 固定字体、颜色和主题卡版式
为什么必须采用并行流水线
以 102 句旁白、102 张正文图的 8 分钟视频为例:
- 每张图生成和质检若平均需要 90 秒,串行完成约需 153 分钟。
- 每句 TTS 若需 5 秒,串行等待约需 8.5 分钟。
- 每个镜头若渲染 15 秒,串行渲染还需约 25 分钟。
仅这三项就超过 3 小时,还没有计算剧本写作、视觉设计、失败重试和最终质检。批量生产时,应把互不依赖的任务并发执行,并让单张图片或单段音频的失败只影响自己的队列。
前期只保留两个必须由人确认的决策点:
- 确认主题。
- 确认剧本。
剧本锁定后,再按任务依赖关系同时启动视觉设计、配音、生图和渲染准备,不必让所有工作排成一条串行队列。

图中的箭头表示任务依赖关系,并不意味着全部任务都要依次等待。
第一步:生成 6 个候选选题并评分
不要直接凭感觉定题。先让主控大模型生成 6 个候选人生方向,然后从七个维度评分:
- 代入感:普通人是否容易产生共鸣,例如裁员、相亲失败通常比登月更贴近日常经验。
- 冲突感:故事是否具有足够张力。
- 延展性:主题能否支撑 8~10 分钟内容。
- 画面可生成性:场景和动作是否容易转化成稳定、清晰的画面。
- 事实风险:健康、法律、金钱和职业相关数字是否有可靠来源。
- 平台风险:题材和表达是否可能触碰平台规则。
- 原创风险:是否与既有热门内容高度重复。
可使用 Claude、GPT 等对话模型完成候选生成与打分。选择总分最高的方向;分数并列时,优先选择原创风险更低的主题。

选题必须在开头 15 秒内兑现。标题如果是“体验在县城躺平的一生”,第一句就直接说:
今天你要体验的人生副本是,在县城躺平的一生。
随后立刻进入具体人生体验,不添加教程式预告或冗长铺垫。
第二步:写成一句一图的第二人称剧本

剧本需要遵守以下硬性结构。
固定开场
首句使用“今天你要体验的人生副本是……”并接上本期主题。第二句直接进入事件,不解释接下来会讲什么。
先列剧情节拍,再扩写全文
先规划 8~10 个剧情大节点,例如:
- 童年
- 高考
- 第一份工作
- 关系建立或破裂
- 失业
- 中年困境
- 晚年与结局
剧情节拍是故事阶段,不是句子数量。确认节拍后,再扩写成完整旁白。
每 30~60 秒必须发生变化
变化可以是:
- 新事件发生
- 人物关系改变
- 场景切换
- 主角认知改变
这条规则用来避免长视频中段变平。
至少选择一种故事机制
- 欲望兑现:围绕一个属性或愿望,例如“有钱”,分别在日常、浪漫、喜剧和危机中展现它的不同价值,结尾再回到一个具体的感官锚点。
- 关系升温:按照注意、记住、照顾、接触、确认逐级推进。每一级都要有可见的行动证据,不能只依靠台词宣告关系变化。
- 社会痛感:从一个小问题开始,例如讨好型人格,让它逐步损害身体、社交和亲密关系,并在结尾保留无法追回的代价。
一句旁白对应一张图
以句号、问号和感叹号拆句,每句话对应一张图。旁白中的抽象感受必须改写成可见的动作、人物状态和环境结果。
不合格写法:
你的安全感在这一刻彻底崩塌。
可视化写法:
女生独自坐在玄关地面,手机停留在未接来电页面,门外母亲持续敲门,她双手抱膝、脸色发白。

这一步适合使用推理能力较强的主控模型,例如 Claude Opus 档或 GPT。先让模型列出剧情阶段,再扩写全文。剧本完成后必须进行第二次人工确认;一旦进入生图和配音,修改剧本会导致大量下游产物重做。
第三步:在生产前完成四项内容质检
剧本确认后,不要立即生图。先让主控模型逐项检查:
- 事实准确性:核查健康、法律、金钱和职业数据。无法核实的数字直接删除,不编造看似真实的数据。
- 原创性:可以参考热门内容的结构,但不复用其事件组合、金句、人物关系顺序和分镜顺序。
- 第二人称与口语可读性:检查是否始终以“你”为叙事主体,并实际朗读确认句子是否顺口。
- 平台风险:检查可能违规或不适合发布的内容。
质检应输出明确的问题清单。发现问题时只修改剧本,并在剧本再次锁定后生成其他素材。越晚修改剧本,返工成本越高。
第四步:建立角色身份证、场景表和视觉圣经
AI 连续生图最常见的问题是角色外貌漂移。可以用三层约束控制一致性。

1. 角色身份证
为每个长期角色固定以下字段:
- 角色编号
- 性别
- 年龄阶段
- 脸型
- 眉、眼、鼻、嘴的比例
- 发型
- 体型
- 一个稳定识别点
- 按场景编号登记的服装
性别属于跨全片硬锁定字段,从婴儿到老年都不能改变。
2. 场景表与视觉圣经
统一记录:
- 场景结构
- 时间
- 光线
- 服装
- 道具
- 画风与色彩规则
3. 连续性状态
同一场景的连续镜头需要继承:
- 时间与光线
- 服装和发型
- 人物左右位置
- 房间布局
- 道具数量和位置
只有剧本明确发生变化时才允许修改。
同时把“一句一图”的剧本单元扩展成完整分镜,为每个镜头确定景别、机位、情绪、动效和转场。动效以缓慢推近为主;转场默认硬切,只有情绪连续的镜头使用 0.12 秒短叠化。
角色身份证、场景表、视觉圣经和分镜可以由主控模型生成,再用格式校验脚本检查镜头是否遗漏、旁白句子是否被意外修改。
第五步:逐句生成配音和字幕时间轴
配音与视觉设计没有直接依赖,可以同时执行。将剧本拆成单句,用火山引擎克隆音色并行生成音频,再按原始剧本顺序拼接。

需要特别注意:
- 保持慢速、平稳,不要为了缩短成片而偷偷加速。
- 必须读取每句音频的真实时长,再建立镜头时间轴和字幕。
- 不要根据字数估算语音时长,否则字幕和声音容易错位。
- 字幕使用白色粗体、黑色描边,底部居中。
- 一句旁白对应一个字幕段。
- 遇到逗号时换行,但不显示逗号本身,任何一行都不保留逗号。
第六步:先做锚点,再用三条队列并行生图
生图遵循“先锚点、后正文”的顺序。
先生成角色和场景锚点
- 生成角色母图和场景基准图。
- 检查并确认锚点。
- 后续正文图引用相应母图,尽量保持同一张脸和一致的场景结构。
- 某个镜头所需的角色与场景锚点通过后,就可以立即释放该镜头,不必等待全部母图完成。
正文图分三条队列
每张图独立生成,但根据风险类型并行处理:
- 高风险队列:包含手部、手机、工具接触、多人肢体重叠和身份关键画面。必须用全分辨率检查手指、手腕、前臂、手机屏幕方向以及物体接触关系。筷子、烟卷等不能穿掌;画坏后直接重画。
- 角色队列:普通人物镜头,重点检查脸型、年龄、发型、服装和人物左右位置。
- 环境队列:空镜、道路、建筑和房间,重点检查场景结构、时间与光线。
每张图失败最多重试三次,失败任务不得阻塞其他队列。全部完成后,校验每个镜头是否恰好对应一张图片,存在漏图时不能进入交片。

每张正文图都应作为独立调用生成,不使用九宫格拆图。可选模型包括 GPT 系列生图模型或火山引擎 Seedream;关键要求是能够逐张调用,并支持传入角色母图以保持人物一致性。
统一正向画风提示词
正常人头与自然人脸比例、真实发型、二维插画感不写真摄影、环境细节丰富的电影化生活插画、人物与场景光影统一、干净细腻线稿、柔和赛璐璐上色、画面内无任何文字水印。
负面提示词
真人摄影、3D 渲染、塑料皮肤、Q 版大头、多余手指、手部畸形、肢体融合、乱码文字水印。
第七步:用 FFmpeg 完成片头和正文渲染
当图片、音频和时间轴全部就绪后,进入视频渲染。
固定片头参数
- 使用 6 张暗色人生素材。
- 按非等距节奏切换。
- 用齿轮机械声推动节奏。
- 在主题卡切入前
87 毫秒加入一记重鼓。 - 主题卡定格在画面下三分之一处。
- 使用超大红白斜体主题字。
固定片头应作为栏目包装重复使用,不必每期重新设计。
正文镜头参数
- 所有镜头保持中心锁定,图片中心不移动。
- 默认从
1.00平滑放大到1.04。 - 近景可放大到
1.06。 - 使用平滑曲线匀速推进。
- 禁止左右横移。
- 禁止缩小。
- 禁止随机抖动。
- 禁止呼吸式回弹。
- 禁止出现黑边。
克制的中心推近是画面安静感的主要技术来源。
并行渲染和拼接
启动多个渲染进程分别处理单镜头,完成后必须按照剧本顺序无损拼接,不能按任务完成先后排列。FFmpeg 根据时间轴完成缩放、推近和拼接,最终导出 H.264 成片。
同时按照同一时间轴生成一份可编辑的剪映草稿,方便在发布前替换背景音乐、微调字幕或剪辑节奏。
第八步:交付前验收并发布
成片必须逐项验收:
- 剧本内容完整,没有漏句。
- 每张图片都有对应的配音时间段。
- 片头能够覆盖首句。
- 正文无黑边、无随机抖动。
- 音频、字幕和镜头总时长一致。
- 没有异常的超长静音。
- 所有镜头均有且仅有一张对应图片。
可以让主控模型核对成片参数,并通过抽帧检查画面。资料建议将同一条成品同步发布到抖音、B 站、小红书和视频号;实际发布仍需分别检查各平台当时的尺寸、时长、版权和内容规范。
流水线的核心
这类视频的可复制能力主要来自以下标准动作:
- 用评分制选择主题。
- 使用第二人称人生体验叙事。
- 坚持一句旁白对应一张图。
- 用角色身份证和视觉圣经控制连续性。
- 将配音、生图和渲染任务并行处理。
- 使用固定片头建立栏目辨识度。
- 在正式生产前完成剧本质检。
资料给出的目标是把流程稳定到“一天产出一条约 8 分钟成片”。这是一项生产设计目标,不代表所有设备、模型和团队都能达到相同速度;真实产能会受到模型调用速度、失败率、人工质检和渲染资源影响。
资料末尾另附有 AI 自媒体、AI 编程与 AI 办公课程推荐图,未提供更具体的课程链接或可验证信息:

参考:X 长文/动态