先看手里有什么,再决定从哪一步开始
四项工作共用同一部短剧的资料
1. 字幕提取:先判断源字幕来自画面还是声音
源字幕可能来自画面里的硬字幕,也可能来自声音里的对白。硬字幕写在画面里,OCR 是主要恢复方式;净版没有字幕文件时,ASR 才从对白恢复台词和时间轴。提取结果还要校对错字、漏字、断句、重叠、时间偏差和说话人。
| 输入状态 | 优先路线 | 主要失败 |
|---|---|---|
| 硬字幕原片 | 限定字幕区的 OCR | 特效字、低清、遮挡、画面文字误识别 |
| 净版、有清晰对白 | ASR + 时间轴校对 | 口音、背景声、多人重叠、专名 |
| 已有源字幕 | 导入并与视频校验 | 剪辑版本不一致、集序错配、时间漂移 |
2. 字幕擦除:没有净版时,先去掉画面里的原字幕
字幕擦除是根据周围画面和相邻帧重建被硬字幕遮挡的区域,不是找回已经丢失的真实原始像素。GhostCut 的基础、Lite 和 Pro 路线服务不同质量与成本目标;短剧默认应使用多个小区域框,而不是全屏。
为什么多框优先于全屏
复杂运动背景的具体处理方法与字幕擦除替代方案都使用本节定义的质量标准。
3. 翻译:这一句要接得上前面的短剧剧情
逐句翻译很容易忘记人物关系、前面发生过什么,以及同一个名字之前怎样翻。整部短剧翻译要同时参考角色和设定、前后对白、固定译法和目标语言习惯,还要保留每句字幕的编号、时间和说话人。
翻译完成后要检查完整性、意义、一致性、自然度、字幕阅读速度和配音时长。语言正确不等于可以直接进入声音生成;目标字幕未冻结就配音,会把文本修改放大成重配和合成成本。
4. AI 配音:让角色声音、情绪和画面时间对得上
AI 配音不只是把译文读出来。角色用什么声音、情绪是否合适、台词能不能放进原来的时长,以及原人声、音乐和效果音怎样处理,都要一起检查。经典、超真实和高情感克隆适合不同预算与质量要求;配音质量不够时,成片可能还不如保留原声的字幕版。
| 路线 | 更适合 | 重点检查 |
|---|---|---|
| 经典配音 | 样片、低价值语种、IAA/社媒长尾 | 机械感、角色区分和目标语种覆盖 |
| 超真实配音 | App、重点账号、多角色中高质量交付 | 角色适配、发音、口音与跨集稳定 |
| 高情感克隆 | 反转密集短剧、主要角色和高价值短剧 | 源声质量、授权、情绪与跨语言发音 |
| 真人配音 | 表演和文化适配上限优先 | 演员、导演、重录、人工后期和周期 |
台词过长时,优先改译文和停顿,再调整语速,最后才评估画面速度。把语音放进字幕时间窗只完成时长适配,不等于自动口型重建。
四步都做完,还要检查这四件事
- 先用代表集数验证字幕、画面、角色、术语和声音路线,再扩大整部短剧批量。
- 每个结果都要记录上游输入、能力档、语言、版本和审核状态。
- 出现问题时回到最小资产和时间范围重做,并检查受影响下游。
- 不能用“功能存在”替代成片质量,也不能把单次成功扩大为所有短剧素材承诺。