做播客要把 AI 用出性价比,顺序应该是 转录 → 剪辑 → 配音 → 分发。先做转录的原因很实际:一份高质量转录稿能同时长出字幕、 show notes 、章节时间戳、博客文章和站内搜索索引,是这条链上唯一一份”投入一次、复用五处”的资产。
第一环:转录,别只把它当字幕用
现在的语音转写接口已经不只是返回一段文本了,选型时重点看三件事:
- 说话人分离:多人访谈节目必须有。 OpenAI 的转写模型里,带 diarize 能力的型号需要用
diarized_json输出格式才能拿到说话人标注,只请求json是拿不到的。 - 输出格式:常见支持
json、text、srt、vtt、verbose_json、diarized_json。做字幕用 srt/vtt,做内容复用用 json(带时间戳),注意部分新模型只支持 json 一种。 - 长音频限制:老版语音模型单次请求上限是 25 MiB,新一代模型改成了按音频时长或 token 校验。超过限制要先切片,切片时按静音点切,别硬按固定秒数切,否则容易把词切断。
一个容易被忽略的提效点:给模型一份专有名词表。嘉宾名、产品名、行业黑话,提前写进提示词或后处理词典,错字率能降一大截,后期校对时间直接砍半。
第二环:用文本驱动剪辑
拿到带时间戳的转录稿之后,剪辑就从”在时间轴上找”变成了”在文档里删”。
- 在转录稿里标记要删的段落(口误、跑题、长时间沉默),批量导出时间区间,让工具一次性切掉。
- 填充词(嗯、那个、就是说)可以用规则批量识别,但建议只做标记不自动删——机械删干净会让语流听起来很怪。
- 静音检测配合阈值压缩口播节奏,比手拖时间轴快一个数量级。
第三环:配音与补录
需要补录一句、或者把节目转成多语言版本时,TTS 才登场。 OpenAI 当前的文本转语音模型支持通过提示词控制口音、情绪范围、语调、语速甚至耳语效果,内置音色有十余种,官方推荐优先试 marin 与 cedar 两个质量最好的;旧版 tts-1 / tts-1-hd 可用的音色集合要小一些。
这里有一条硬约束:主流平台的 usage policy 都要求向终端用户明确声明他们听到的声音是 AI 生成的。片头加一句口播说明,或者节目简介里写清楚,别省这一步。
第四环:一份转录稿能长出多少东西
- 章节时间戳(直接喂给播放器)
- Show notes 与核心观点摘要
- 官网博客文章(顺带做了 SEO)
- Newsletter 内容
- 站内搜索与问答索引
这一环才是 AI 播客工具链真正的杠杆:录制一小时,产出五种可分发资产。
选型对比
| 环节 | 关键能力 | 开源/自托管 | 托管 API | 怎么选 |
|---|---|---|---|---|
| 转录 | 说话人分离、时间戳、术语纠正 | Whisper 系开源模型(Hugging Face 上有大量社区微调版) | 托管转写接口 | 涉密内容自托管,常规节目用托管 |
| 剪辑 | 文本驱动剪辑、静音检测 | 脚本 + 时间轴编辑 | 在线剪辑工具 | 看是否要保留多轨 |
| 配音 | 音色、语气控制、多语言 | 开源 TTS 模型 | 托管 TTS | 先看授权条款再看音质 |
| 分发 | 章节、字幕、多平台同步 | 自建脚本 | 托管平台 | 优先选能导出标准格式的 |
成本与隐私的两个提醒
- 音频按分钟计费:转录和配音都是按输入时长算钱,一小时的节目跑完整条链,费用主要来自转录而不是配音。先算清单集成本再决定要不要全量 AI 化。
- 上传前确认数据策略:托管 API 会接收你的音频,涉密内容要么自托管,要么先确认服务商的数据保留期限和是否用于训练。这一条应该在选型阶段就定,别等上线后补。
一个最小可用的一小时音频处理脚本骨架
1. 用 ffmpeg 按静音点切成 <25MiB 的片段
2. 逐段调用转写接口,请求 diarized_json + 时间戳
3. 合并分段结果,用专有名词词典做一次批量替换
4. 从 json 里提取静音段与填充词区间,生成剪辑列表
5. 用剪辑列表驱动 ffmpeg 输出成片
6. 把最终稿交给摘要提示词,产出 show notes 与章节
相关阅读
播客转录一定要用带说话人分离的型号吗?
单人节目不需要。多人访谈、圆桌、嘉宾连线则必须用,否则后期要靠人工猜哪句是谁说的,工作量比省下的 API 费用高得多。
音频文件太大传不上去怎么办?
先切片。注意别按固定秒数硬切,用 ffmpeg 的静音检测在自然停顿处切,能避免把一个词切到两段里导致识别错误。
AI 配音能不能直接当主播用?
技术上可以,但有两件事要先定:一是按平台政策做 AI 语音披露,二是确认音色授权是否允许商业分发。这两条没落实前,AI 配音更适合做补录和多语言版本。
涉密或内部会议录音能直接调托管 API 吗?
不建议。优先走自托管开源模型,或确认服务商的数据保留与训练使用策略后再决定。这是选型时的第一道门槛,不是上线后才补的合规项。










评论 (0)