结论先说:选工具前先分清楚「离线批处理」和「实时流」
AI 字幕和转写不是一件事:离线批处理追求准确率与时间轴质量,实时流追求延迟。 Whisper 这类编码器-解码器模型把音频切成 30 秒块做整段推理,天然适合批处理;而新一类的流式语音转写(如 GPT-Realtime-Whisper)是边说边出字,适合会议记录和直播字幕。混着选,两头都不讨好。
大部分人的误区是拿一个「转写准不准」的单一维度去选,实际决定体验的是三个维度:要不要时间戳、要不要实时、数据能不能出境。
三条技术路线对比
| 路线 | 典型形态 | 强项 | 短板 | 典型场景 |
|---|---|---|---|---|
| 开源离线模型 | Whisper 系列本地/自部署 | 数据不出内网、无按量费用、可批量跑 | 要自备算力,长音频要自己切片拼接 | 内部会议、涉密录音、批量历史音频 |
| 云端批处理 API | 托管转写接口 | 开箱即用、多语言、带词级时间戳 | 音频要上传,按分钟计费 | 常规视频字幕、播客转写 |
| 实时流式转写 | Realtime 类流式语音模型 | 边说边出字,延迟极低 | 准确率受网络与说话节奏影响,成本高 | 直播字幕、实时会议纪要、语音助手 |
Whisper 的训练数据是 68 万小时的多语言、多任务监督音频,其中约三分之一是非英语。这带来两个直接结果:对口音、背景噪声、专业术语的鲁棒性明显更好,同时又原生支持「原语言转写」和「翻译成英文」两种任务。选工具时如果主要做中文,务必用中文样本实测,不要看英文评测。
四步选型
- 先定数据边界:录音能不能上传到外部服务?不能就只剩自部署一条路,后面的准确率讨论都无关紧要。
- 再定实时性:需要边说边出字(直播、实时纪要)就走流式模型;可以等(成片字幕、归档)就走批处理,准确率更高、成本更低。
- 确认时间戳粒度:只做纯文字稿不需要时间戳;做字幕必须有句级时间戳,做卡拉 OK 式高亮或精确剪辑必须有词级时间戳。这一项很多工具不支持,选型前先验证。
- 用自己的音频做盲测:准备 3 段真实音频(安静独白、带背景噪声、多人对话),各转写一次,人工统计错字率。厂商给的准确率数字对你的场景没有参考价值。
准确率陷阱:四个最容易翻车的地方
1. 专有名词
模型没见过的人名、产品名、缩写几乎必错。可行的补救是提供提示词或热词表(如果工具支持),或转写后做一次基于词表的批量替换。
2. 长音频的边界效应
整段音频被切成 30 秒块分别推理,切点附近的半句话容易丢失或重复。解决方法是做重叠切片,后处理时去重。
3. 标点与断句
转写模型输出的标点服务于「可读性」,不服务于字幕规范。做字幕时要按字符数和语意重新断句,直接拿原始输出当字幕一定会出现超长行。
4. 多说话人
没有说话人分离能力的转写结果是一整段无标识文本,会议场景基本不可用。需要区分谁说了什么,就一定要选带说话人分离的方案。
验收清单:上线前必查
- 错字率:用你自己的 3 段真实音频统计,安静环境建议控制在 3% 以内。
- 时间戳对齐:随机抽 10 句,检查字幕出现时间与语音是否对齐。
- 单行长度:中文单行通常不超过 15-18 字,超出要重新断句。
- 专有名词:建立词表,检查全文是否一致。
- 敏感信息:确认转写服务是否留存音频,留存周期多久。
成本怎么估
三个变量:音频总时长、是否需要词级时间戳、是否实时。批量转写历史音频时,先抽样 30 分钟跑一遍测出真实单价,再乘以总量——厂商的标价往往不含时间戳附加项。实时转写按会话时长计费,成本高一个量级,只应在真的需要低延迟时使用。
Whisper 类模型能直接输出字幕文件吗?
输出的是带时间戳的文本,需要你再转成 SRT/ASS 等字幕格式。多数工具链都提供现成转换脚本,但断句规则通常要自己调。
实时转写能替代离线转写吗?
不建议。实时转写为了压低延迟,牺牲了一定的上下文窗口,准确率通常低于批处理。成片字幕用批处理更划算。
中文转写效果如何评估?
不要看英文榜单。用你的真实中文音频做盲测,重点测方言口音、中英混说、专业术语三类情况。
涉密录音怎么处理?
只能走自部署。把开源模型部署在内网,音频不出边界。这时要评估的是算力成本,而不是 API 价格。










评论 (0)