字幕生成技术

先交出能进翻译和配音的字幕,而不是一段转写草稿

错提、漏句、断句怪、时间轴飘,后面翻译和配音都会一起跟着返工。鬼手剪辑会先看素材:画面上有清晰硬字幕就走视频 OCR,只有声音就走字幕型 ASR;再合并重复帧、去掉招牌等场景字,断句打轴后给出可编辑 SRT。每天约 30 万+集短剧译制任务,都在这条链路上跑。

98.25%OCR 字符准确率
98.92%严格字幕条精确召回
30 万+日处理短剧集数
实时画面分析 视频 OCR/SRT
对话/保持 免责声明/排除 人物卡/排除
可编辑输出SRT
字幕条

你能原谅爸爸吗?

对话字幕保留
场景叠加排除

一帧画面可能同时包含多类可读文字,只有对白应该进入字幕时间轴。

真实短剧公开演示片段,用于说明对白字幕与场景文字的分类问题。原始内容版权归内容权利方所有。

本地化质量

源字幕质量决定翻译与配音的上限

很多看似发生在翻译或配音环节的问题,其实源头是字幕识别:错词、漏句、不合理的字幕条边界或说话人切换错误,都会继续传递到下游。可靠的源字幕时间轴,才能支撑 基于剧集上下文的字幕翻译 ,并进一步支持 角色化 AI 配音与声画同步.

同一部短剧实测

准确率最终要落到字幕条和时间轴

鬼手剪辑以人工审核字幕作为参考答案,在同一部短剧、同一时间轴口径下,对硬字幕 OCR 与纯音频 ASR 基线进行了对照评测。

评测口径这是同源短剧、同一参考字幕下的生产流程对比,不是开源平均值或通用 ASR WER 排名。音频基线使用分离人声与 ElevenLabs Scribe v2。

选择更强的来源

两种对白来源,用哪个识别更准确?

画面已有可靠硬字幕时,使用视频 OCR; 只有音频对白、没有可用硬字幕时,使用 ASR。

短剧里的 BGM、音效、口音、哭喊、耳语、多人重叠对白和高度口语化台词,都会干扰语音识别。如果画面中已有准确的内嵌字幕,它通常比混合音轨更清楚地表达原始台词。

光学字符识别/01

读取画面中已经编辑好的对白字幕

适用于画面中已经内嵌硬字幕或其他明确对白文字的视频。真正的难点,是把跨帧重复出现的文字合并成稳定字幕条,同时排除招牌、手机界面等场景文字。

  • 自动定位字幕区域和出现时间
  • 跨帧识别与字幕条合并
  • 场景文字过滤与谨慎纠错
语音识别 / 02

把语音转成可直接使用的字幕,而不是大段文本

当对白只存在于音轨中时,应使用 ASR。识别出文字只是第一步;合理断句、时间边界、单条长度和说话人切换,才决定结果能否直接用于字幕渲染。

  • 带词级时间戳的语音识别
  • 结合语义与停顿进行字幕断句
  • 按需识别说话人

视频OCR

单帧 OCR 只看一张画面,视频字幕系统还要理解时间

30 fps 的一分钟视频包含 1,800 帧。若逐帧独立运行通用 OCR,不仅计算重复,还会得到大量重复文字框。视频字幕系统必须把这些帧级结果合并成有起止时间的字幕条。

跨采样帧的一个字幕00.50秒→00.95秒
短剧第 15 帧,0.50 秒,显示相同的对话字幕第 15 帧00.50秒
短剧第 20 帧,0.65 秒,显示相同的对话字幕第 20 帧00.65秒
短剧第 24 帧 0.80 秒,显示相同的对话字幕第 24 帧00.80秒
短剧第 29 帧,0.95 秒,显示相同的对话字幕第 29 帧00.95秒
合并决策合并为 1 条字幕,而不是 4 次重复识别
00:00:00,420 --> 00:00:02,260
你能原谅爸爸吗?
相邻帧中的重复识别结果需要合并为一条稳定字幕,才能确定准确的字幕内容和起止时间。
01

检测字幕候选区域

在字幕区域或全画面中,查找可能属于对白字幕的文字。

02

跨时间聚合

结合文字内容、位置和持续时间,将相邻帧的重复结果合并成稳定字幕条。

03

过滤并修正

过滤无关场景文字,并在不臆造台词的前提下修正明显识别噪声。

04

生成字幕时间轴

合并重复片段,确定字幕条的开始与结束时间,并导出可编辑 SRT。

误检对照

识别出所有文字,不等于生成了可用字幕

画面里可能同时出现招牌、手机界面、商品标签、Logo、名片、提示语和营销贴片。字幕文件应只保留对白,不能把画面中所有可读文字都写进时间轴。

区域优先识别字幕区域。
时间只处理字幕实际出现的时间段。
语言按语种选择合适的识别模型。
审校让运营快速定位低置信度字幕条。
包含对话字幕、免责声明和人物卡的短剧画面
保留为字幕对话字幕

台词属于定时字幕轨道。

排除:免责声明安全免责声明

长期固定的声明或制作信息不是对白。

排除:角色卡人物姓名与角色卡

人物介绍等身份文字不应进入对白时间轴。

带有相机界面和装饰文字的短剧画面,这些文字不应进入字幕时间轴
排除:相机 UI技术界面文本

参数、比例和设备界面文字仍属于画面内容。

可读并不意味着对话。

视频 OCR 必须先判断文字类型,才能生成干净、可用的字幕文件。

真实短剧公开演示画面,用于说明对白字幕与场景文字的分类问题。原始内容版权归内容权利方所有。

字幕型 ASR

正确的转写文本,仍可能不是可用字幕

传统 ASR 的目标是把语音转成文字;字幕型 ASR 还要完成打轴与断句,把连续词流切分成简洁、可读的字幕条,并综合语义、停顿、说话人切换和屏幕承载能力。

开源只是起点

开源模型只是起点,交付质量才是结果

开源技术为字幕识别提供了良好起点。PP-OCRv5 在本页所列多语种公开数据集中的最高识别准确率为 94.20%;鬼手剪辑在自有短剧字幕验证集上的 OCR 字符准确率达到 98.25%。二者数据集与任务定义不同,不能直接视为端到端视频字幕准确率对比;在各自口径下数值相差约 4.05 个百分点。真正决定交付质量的,仍是在同一批视频、同一参考字幕和同一字幕条口径下,持续减少错提、漏句与时间轴偏差。

OCR 公开数据示例 · PP-OCRv5准确率:80.27%-94.2%

这是特定多语言文字数据集上的识别准确率,用来说明语种和文字体系会显著影响结果。它不是视频跨帧检测、字幕合并、场景文字过滤和时间轴生成的端到端准确率。

阅读 PaddleOCR 评测说明
ASR 公开数据示例 · Whisper large-v2平均错误率:12.8%

Whisper large-v2 是 OpenAI 发布的语音识别模型。论文中,WER 从 LibriSpeech 干净语音的 2.7% 变化到 CHiME-6 噪声语音的 25.5% 和 AMI 远场语音的 36.4%,说明收音环境会显著改变 ASR 结果。这不是短剧场景的平均 WER。

阅读 Whisper 论文
公开基准只能解释变量,不能替代生产对比。 判断 OCR 与 ASR 对某类短剧的实际价值,必须在同一批视频、同一参考字幕和同一条级时间轴口径下评测。生产上应优先使用最干净的源信号:当硬字幕可靠而混合音轨包含 BGM、音效、口音、哭喊或重叠对白时,视频 OCR 往往能提供更稳定的源字幕;没有可用硬字幕时,则使用字幕型 ASR。

返工成本

几个百分点的差距,可能意味着数周返工

面对上百集短剧,低错误率意味着运营只需抽检和处理少量异常;错误一旦密集,团队就不得不逐条复核,字幕校正很快会成为整个译制流程的瓶颈。

每修正一处错误,都要定位字幕条、回放上下文、确认原话、修改并再次检查。当错误过多时,运营会失去对结果的信任,最终退化为全量逐条审校。

低错误密度现场评审可管理的校正队列
高错误密度逐行审查生产瓶颈
系列规模校正工作量

生产交付

从单集验证到批量生产

识别准确只是起点。规模化生产还需要批次管理、任务状态、可编辑结果、回调机制,以及向翻译和 AI 配音环节的顺畅流转。

译制出海工作台

组织项目和批次

批量上传剧集,按素材情况选择 OCR 或 ASR,并在同一工作区中沉淀可复用的系列项目。

了解译制出海工作流程
作品

跟踪状态并收集输出

查看任务状态、打开已完成的结果、下载可编辑的 SRT,然后继续进行翻译或配音。

阅读生成指南
API

自动化异步作业

提交 OCR 或 ASR 任务并保留项目与任务 ID,再通过轮询或回调接入企业自己的媒体生产流程。

阅读 API 参考

字幕生成常见问题

什么是字幕生成?

把画面里的字,或音频里的对白,整理成一条条带时间轴的字幕。可用的结果通常包括文本、起止时间、合理断句和语种信息,并导出成 SRT 这类可编辑格式。

用一句话怎么理解鬼手剪辑的字幕生成?

先判断走 OCR 还是 ASR,再合并重复帧、过滤场景字、断句打轴,输出能直接进翻译和配音的 SRT——而不是只有一段转写稿。

有哪些公开数据和交付结果可以参考?

约 80% 的头部出海 AI 短剧客户和服务商在用鬼手剪辑。团队每天处理近 30 万+集短剧译制(大约 3,000+ 部)。在不少客户项目里,译制成本大约降 80%,收入规模也有约 10 倍增长——具体仍看题材、语种和发行节奏。在自有短剧数据集上,OCR 字符准确率 98.25%,严格字幕条精确召回率 98.92%。交付是可编辑 SRT;硬字幕清楚时优先 OCR,只有音频对白时走 ASR,默认不会混成一路糊弄过去。

什么场景适合用?

烧录字幕还算清楚的短剧或漫剧;手里没有字幕文件、只能从音频出轴;以及后面还要翻译、配音、人工审校的生产前置。

什么场景不太适合?

画面糊成一团、压缩伪影很重又没法补刀的素材;或者你要的是逐帧艺术字、特效字幕创意设计,而不是生产用对白轴。

生产中常见哪些翻车点?

把角标、人物卡、免责声明一并提进对白轴;用普通转写结果当字幕条,不管断句和阅读速度;OCR 和 ASR 混用后,关键对白没再人工对一下。

OCR 可以从视频中提取硬字幕吗?

可以。视频 OCR 能识别烧录在画面中的文字,跨帧合并重复结果,估算字幕条的起止时间,过滤无关场景文字,并导出带时间轴的字幕。

为什么在短剧中优先用 OCR 而不是 ASR?

当画面中的硬字幕可靠时,OCR 直接读取已经编辑好的文字,不容易受到 BGM、音效、口音、哭喊、耳语和重叠对白干扰。

为什么正确的转写文本仍可能不是可用字幕?

转写结果可能是一整段文字,也可能断句和阅读速度不适合上屏。字幕型 ASR 必须输出简洁的定时字幕条,并正确处理语义边界和说话人切换。

鬼手剪辑会自动把 OCR 和 ASR 混成一路吗?

不会默认把两者混合。OCR 与 ASR 是两条独立的字幕生成路径,团队可根据素材情况选择,并在审校时对照结果。

先建立可靠的源字幕时间轴

生成能直接进入短剧译制流程的可靠字幕。

有可靠硬字幕时选择视频 OCR,只有音频对白时选择字幕型 ASR。审校 SRT 后,再继续翻译、AI 配音和成片导出。

从 鬼手剪辑开始

AI 短剧 · 短剧出海

从单项技术进入完整的视频本地化生产

继续了解鬼手剪辑如何把字幕生成、模型评测、翻译、画面修复、AI 配音和系列化生产连接起来,并将验证过的流程扩展到更多剧集与目标语言。