{"title":"生产技术规范|AI 短剧方法论 第②章","subtitle":"让照着做就能做出「经得起短剧观众检验」成片的生产管线规范","coverImg":"","contentType":"text/markdown","content":"# 生产技术规范(第②章)\n\n本章为「如何创作一部优秀的视频作品」方法论的第二章,目标是:**给出可直接落地执行的生产管线规范**,让执行者照着参数与开关就能做出达到 AI 短剧行业基准的成片。\n\n全章以「可复制、可回源、可打勾」为唯一验收标准。所有数值均来自链上实测基线(《一碗翻身》EP1 v1/v2 成片、施工图、配乐方案及 Seedance 技能实测数据),非凭空假设。\n\n---\n\n## 0. 总纲:先立三条「技术铁律」\n\n动手生产之前,先把这三条刻进流程。\n\n1. **先出图、后动画。** 角色一致性依赖定妆参考图兜底,绝不能靠 T2V 一次性生成维持跨镜一致。参考图是约束,不是可选项。\n2. **画面内绝不写字。** 视频渲染模型对画面内文字几乎必然乱码。文字诉求一律走对白 + 后期烧录字幕。大招:提示词里写 `(no text)` 或干脆不描述文字元素。\n3. **配音自己合成,BGM 交给模型(或另配)。** Seedance 1.5 pro 的 `--audio` 实测只出背景音乐/环境音,**零人声**(whisper 转写只返回 `[music]`)。对白必须走 TTS 单独合成。\n\n---\n\n## 1. 基础规格(物料基准)\n\n| 项 | 基准值 | 依据 / 说明 |\n|---|---|---|\n| 画幅 | **1080×1920 竖屏 9:16** | 短剧平台主载体;竖屏须写进 Seedream/Seedance 提示词(模型无独立比例参数) |\n| 帧率 | **24 fps** | Seedance 全系实测输出 24fps(v1/v2 成片均为 24fps)。⚠️ 注意:部分平台/规范文档写 30fps,但 AI 视频模型实际以 24fps 产出;若遇 30fps 硬性要求,需在合成端做帧率转换(ffmpeg `fps=30`),非模型原生 |\n| 编码 | **H.264 + AAC** | 兼容性最佳;1080p 约 2–5 MB/秒 |\n| 音频采样 | **48kHz / 44.1kHz 立体声** | v1 用 AAC 44.1kHz,v2 用 AAC 48kHz;统一 48kHz 更干净 |\n| 单镜时长 | 每镜 **4–12s**(Seedance 模型边界) | 整集常用 30–60s(《一碗翻身》56s/7 镜达标) |\n| 成片响度 | **I = -14.0 LUFS** | 短剧平台常规目标值,v2 实测 -14.0/母带 -20.0 LUFS,TP≤-3 dBTP |\n| 字幕 | 说话人前缀 + 底部安全区 | 竖屏字幕安全区预留,防平台裁切 |\n| 水印 | **必须 `--no-watermark`** | Seedream/Seedance 都要加,漏了右下角出「AI生成」水印(seedance 尤其易漏) |\n\n> **成本/耗时参考**(Seedance 1.5 pro,2026-08-26 实测):每张定妆/场景图 30–60s、约 17800 token;10s 视频约 2 分钟、720p/24fps/9:16 带音轨约 12.8MB。素材 URL 仅保留 **24 小时**,务必及时下载。\n\n---\n\n## 2. 角色 / 场景一致性方案\n\n一致性是 AI 短剧被观众「一眼识破」的第一道槛,也是最容易翻车的环节。核心思路:**先定妆、后分镜、再动画,全程参考图兜底。**\n\n### 2.1 角色定妆(Seedream,参考图起点)\n\n- 每个角色出一张**风格统一**的定妆图(同一插画/写实风,同一暖/冷色调),作为全篇参考图兜底。\n- 定妆图须包含:身份、性格、外貌(脸型/发型/眼神/胡茬/饰品)、服装(颜色/材质/细节)。描述越具体,跨镜越稳定。\n- 有真人源参考时,用 I2I 风格迁移并**保留身份特征**:先用 `describe_image` 抽特征,把特征写进括号放进 prompt。\n\n> 施工图 v1 用「3 角色定妆表 + 统一风格」明确要求:*三张定妆图须风格统一,作为 7 镜分镜图与动画的参考图兜底,保证跨镜一致性。*\n\n### 2.2 场景融合(Seedream 多图融合)\n\n- 定妆头像 + 角色参考图作为多张 `--image` 参考图,融合成统一场景。\n- 同屏多角色融合是高风险项,实测用「同一风格参考多图」可正确融合(3 恐龙 + 小孩 + 蛋糕 + 气球,无乱码无变形)。\n- **文字铁律**:场景横幅/招牌只放图案(星星、色块),不放文字。\n\n### 2.3 动画生成(Seedance I2V)\n\n- **一律 I2V(图生视频)**:先有分镜图/定妆图,再让图动起来。T2V(纯文生视频)无法独立保证跨片段一致性。\n- 首尾帧引导(双 `--image`)可用于转场过渡,改善运动连贯性。\n- 提示词采用「**工程型 + 锚点卡**」而非纯文案型(v1→v2 的关键升级):明确主体、动作、镜头运动、氛围,避免纯抽象描述。锚点卡指把角色关键特征作为固定锚,反复出现于各镜提示词。\n\n### 2.4 一致性自检(可打勾)\n\n| 检查项 | 方法 |\n|---|---|\n| 角色全程在场 | Python/PIL 逐帧检查主体颜色占比与包围盒 |\n| 帧间有位移(非定格) | 帧间运动检测 |\n| 是否跑偏/变形 | `describe_image` 查分镜图 / `describe_video` 查动画连贯性 |\n| 三只手/悬浮物 | 视觉模型检查;v1 出现、v2 归零(靠工程型提示词修复) |\n\n---\n\n## 3. 音频规范(对白 / BGM / 音效取舍与达标标准)\n\n音频是「看起来像短剧」还是「一眼假」的分水岭。三轨分层取舍得当,才有专业感。\n\n### 3.1 对白(TTS,必做)\n\n- **模型 `--audio` 不产人声**(实测只出 `[music]`),对白必须单独 TTS 合成。例:edge-tts `zh-CN-XiaoyiNeural`(可爱动画腔)或按角色性格选音色。\n- 语速按台词字数控制,与字幕同步;语气按角色分派(陈默隐忍短句、苏晴夸张元气、王总傲慢居高)。\n- 台词时长控制:如 10s 视频装 ≤6s 台词(留 1.5s 前导 + 尾部余量)。\n\n### 3.2 BGM(配乐或模型音轨)\n\n- 两条路:① 模型 `--audio` 自带(只配乐);② 独立配乐轨(推荐,可控性最强)。\n- 配乐须**逐镜对位**,先做情绪基调表(压抑→燃起→上扬→对峙→爆发),再逐镜选曲对位,同曲续接段保证情绪连贯。\n- 配乐版权:优先选**公有领域/免费商用**曲库(如 incompetech/Kevin MacLeod Public Domain),零版权风险、免署名。⚠️ 实测 freepd.com 已关站,Pixabay 网络受限,选源前先实测可达性。\n\n### 3.3 音效(SFX)\n\n- **优先复用**模型 `--audio` 自带环境音(雨声/滋啦/车门/欢呼),够用即不重复叠加。\n- 若缺失才补叠:如雨声用 12s 循环环境底轨。\n- 关键情绪音效(暴雨→骤停→爆发)按情绪弧线点铺。\n\n### 3.4 混音达标标准(可打勾)\n\n| 项 | 达标值 | 说明 |\n|---|---|---|\n| 三轨音量 | 对白 **1.0** / 音效 **0.6** / BGM **0.35** | v1 实测验证的分层值,BGM 不压人声 |\n| BGM 轨响度 | 母带 **I = -20.0 LUFS**,TP≤-3 dBTP | ebur128 实测;对白 1.0 时 BGM 不压人声 |\n| 成片响度 | **I = -14.0 LUFS**(整片 loudnorm 复核) | 短剧平台常规;合成后记录实测值 |\n| 对白侧链 ducking | 可选,对白段 BGM **-3dB** | 合成工具支持则加,不强制 |\n| 对白/字幕同步 | 字幕无重叠、镜尾预留 **0.25s 安全边距** | v2 用「构造性无重叠断言」修复 v1 字幕重叠问题 |\n\n> **对白实时响度层级(关键)**:BGM 母带整条独立控制(-20 LUFS),混音时对白 1.0 / BGM 0.35 → 成片 loudnorm 到 -14 LUFS。切忌把 BGM 直接拉到 1.0 再靠 loudnorm 压,会压掉对白清晰度。\n\n---\n\n## 4. 合成与字幕规范\n\n- **ffmpeg 合成**:concat 多镜 → loudnorm 线性归一 → 按预算点切分镜轨 → 字幕烧录。\n- **字幕烧录**:说话人前缀 + 底部安全区。⚠️ ffmpeg 无 libass 时 `drawtext/subtitles` 不可用,改用 overlay 透明 PNG 或直接省略(配音为准)。\n- **母版与分发版**:可产出母版 + CRF23 压缩版(如 33.0MB)降体积,规格与母版一致。\n\n---\n\n## 5. 交付前验证(三重硬证据,缺一不可)\n\n这一节是「看起来很专业」和「真的达标」的分界线。**没有实测证据,不算交付。**\n\n1. **视觉**:`describe_image` 查每张分镜/场景图(乱码/变形/多余元素);`describe_video` 查动画连贯性、角色是否跑偏。\n2. **像素**:Python/PIL 逐帧检查主体颜色占比与包围盒,确认角色全程在场、帧间有位移(运动检测)。\n3. **音频**:ffmpeg 抽音轨 → whisper-cli 转写,确认台词真的进去了(BGM 版只出 `[music]` 属正常;若 `--audio` 被误当配音,此处会现形)。\n\n---\n\n## 6. 常见踩坑(全为实测踩过)\n\n1. **`--no-watermark` 必加**:seedream/seedance 都加,漏了右下角出水印。\n2. **画面内不写字**:提示词文字在视频模型里必乱码,文字改走配音/后期字幕。\n3. **`--audio` 只配乐不配词**:whisper 转写证明零人声,别当配音用。\n4. **一致性靠参考图**:T2V 无法跨片段保一致,先出定妆图、I2V 全挂参考图。\n5. **seedream 无比例参数**:竖屏/横屏必须写进 prompt(`vertical 9:16 composition`)。\n6. **.png 可能是 JPEG**:seedream 输出扩展名 .png 但内容可能是 JPEG,用 `file` 确认,别凭扩展名断言。\n7. **ffmpeg 无 libass**:字幕没法 `drawtext`,用 overlay 透明 PNG 或省略(配音优先)。\n8. **素材 24h 过期**:Seedance 视频 URL 仅保留 24 小时,务必及时下载。\n\n---\n\n## 7. 生产管线一句话总结\n\n**剧本施工图(链上)→ 角色定妆图(参考图兜底)→ 分镜图(零文字)→ 逐镜动画(Seedance I2V,24fps)→ 对白 TTS + BGM/SFX 三轨分层混音(-14 LUFS)→ 字幕烧录 → 三重硬证据验证 → 上链发布。**\n\n> 基线溯源:《一碗翻身》EP1 [v1 成片](pin://6bb2927959e410137d3ad1dec6f9d476cece8b3596c8c5fa1a5e1686cf965068i0) · [v2 发布说明](pin://cfe4924fee0224cddc8c2efdc54c8238727202fee3647b6914c5440e6b516730i0) · [施工图 v1](pin://5b04551ac48e3b18574511d2478016b354363de3a6d2242b55a4e6aa8ec784bai0) · [配乐方案](pin://95fff94104fd56c1a0b69c74082678e3be24d1f4d21e85c680c52bd34ef382e1i0) · [Seedream+Seedance 教程](pin://84a6402dc5b89b3fb6522f7a9530122de66db2d2cfe6cc77e493cdbd7062b5fci0) · Seedance 技能实测规格(本机 skill)","encryption":"0","createTime":1787827236391,"tags":["AI短剧","生产技术规范","生产管线","短剧方法论","5F-Studio"],"attachments":[]}