播客转录工具 — 如何使用 Fish Audio 转录您的播客
Fish Audio 的播客转录工具可以将音频转换为文本,并带有自动情感标签、说话人标签和时间戳 — 然后可以导出为 SRT、VTT 或 JSON 格式。提供免费额度,无需代码即可使用。
2026 年 3 月 | Fish Audio STT 现已上线,访问地址:fish.audio/app/speech-to-text
每一集没有转录文本就发布的播客都在错失潜在的流量。转录文本可以让您的节目在 Google 上被搜索到,只需点击一下即可生成节目摘要(Show Notes),并让您能为 YouTube、您的网站或任何其他分发平台自动生成字幕。对于听力障碍受众,它还能提升内容的可访问性。播客编辑、媒体团队和 YouTube 创作者依靠转录文本来生成 SEO 内容、可搜索的存档以及具有无障碍体验的节目页面。大多数播客转录工具只提供一大堆纯文本,然后就此结束。Fish Audio 的播客转录工具更进一步:每一份转录文本都带有自动的情感和副语言标签、说话人标签、时间戳以及三种导出格式。本指南将带您在约三分钟内完成从上传到导出的完整工作流程。
什么是优秀的播客转录工具?
在选择任何转录工具之前,了解评估标准会很有帮助。一个好的播客转录工具应该具备以下四点:
-
针对不同口音、音频质量和录制环境的高转录准确率
-
说话人识别功能,以便您在转录文本中区分主持人与嘉宾
-
多种导出格式 — 至少包括用于视频字幕的 SRT,理想情况下还应支持 VTT 和 JSON
-
透明且实惠的价格,并提供真正可用于完整节目的免费额度
Fish Audio 的播客转录工具支持 100 多种语言,接受 24 种音视频格式,并能自动在行内标记情感和副语言事件 — 无需任何人工标注。该语音转文本模型针对对话式音频和多说话人录音(如播客、访谈和现场讨论)进行了优化。以下是它在实际操作中的表现。
如何使用 Fish Audio 转录您的播客 — 步骤指南
所需时间: ~3 分钟 所需工具: 音频文件(MP3、MP4、WAV、M4A 等) 输出: 带标签的转录文本 + 可导出的字幕文件
第 1 步 — 打开 Fish Audio STT
访问 fish.audio/app/speech-to-text。您将看到您的任务历史记录 — 列出了所有之前的转录任务,包括文件名、日期、状态、所用积分和说话人数量。点击 创建任务 (Create task) 开始新的转录。
第 2 步 — 上传您的节目并设置说话人
在“创建转录任务”窗口中,上传您的音频或视频文件。Fish Audio 支持所有主流格式 — MP3、MP4、WAV、FLAC、M4A、OGG、MOV、AVI、WEBM 等。
在说话人数量 (number of speakers) 下方,如果您不确定录音中有多少人,请保留为“自动 (Auto)”。Fish Audio 将自动检测说话人。如果您知道确切的人数 — 例如标准的主持人加嘉宾模式为两人 — 您可以手动设置,以获得更准确的说话人标签。
在确认之前,界面会显示此任务的预计时长、计费分钟数和预估积分。在点击 创建任务 (Create task) 之前,不会扣除您的积分。
第 3 步 — 检查您的转录文本
任务完成后,点击 打开查看器 (Open viewer)。转录文本分为三列显示:SPK/TAGS(说话人标签)、TIME(时间戳范围)和 TEXT(带有行内标签的文本)。
每个片段的时间戳精确到秒。情感和副语言事件作为紫色的行内标签直接出现在文本中 — 您会在录音中发生这些事件的确切位置看到诸如 [pause](停顿)、[sigh](叹气)、[emphasis](重音)和 [breath](呼吸)等标签。
点击任何片段即可直接在浏览器中播放音频的相应部分。这使得验证准确性或抽查特定瞬间变得非常容易,无需反复拖动进度条。
右侧的控制器 (Controller) 面板显示了摘要:总时长、检测到的说话人数量、片段数量,并确认“语音分离”和“标记音频事件”均已开启。
第 4 步 — 导出为您需要的格式
点击控制器面板右下角的 导出 (Export)。在下载前选择您的格式并配置导出选项。
准备好转录您的第一集节目了吗?开始免费转录任务 →
自动标签 — Fish Audio 捕捉到了其他工具遗漏的细节
这是 Fish Audio 的播客转录工具与其他备选方案最明显的区别所在。
当有人在回答问题前叹气、在句中笑出声、为了强调而停顿或发出明显的呼吸声时 — 标准的转录工具会忽略所有这些。你得到的只有文字,剥离了其他一切信息。
Fish Audio 将这些事件作为行内标签嵌入到转录文本中发生的确切位置。这些标签是自动生成的 — 无需人工标注,也无需后期处理步骤。控制器面板默认显示 标记音频事件:开启 (Tag audio events: On)。
标记的内容
副语言 (Paralanguage) — 伴随演讲发生的非语言声音。
情感 (Emotion) — 表达的情感基调,从上下文和韵律中捕捉。
为什么这对播客制作人很重要
对于大多数播客工作流程,标签有三个实际用途。首先,它们使您的转录文本作为节目摘要(Show Notes)素材时更有用 — 捕获了 [laugh] 和 [pause] 的转录文本能为您的编辑提供比纯文本更丰富的素材。其次,它们让导航长篇录音变得更快 — 您可以扫描 [sigh] 或 [emphasis] 时刻,快速找到节目中具有情感意义的部分,而无需重新听完整段音频。第三,也是最独特的一点,这些标签与 Fish Audio 的 TTS 模型兼容 — 这意味着转录文本可以直接反馈到语音制作工作流程中,无需任何格式重排。
想看看这些标签的效果吗?上传您的第一个音频文件 →
导出格式详解 — 您需要哪一种?
Fish Audio STT 支持三种导出格式。使用哪一种取决于您下一步要对转录文本做什么。
SRT 是大多数分发视频内容的播客制作人的正确选择。它是应用最广泛的字幕格式 — 兼容 YouTube、Premiere Pro、Final Cut Pro 以及大多数视频平台。
VTT (WebVTT) 是网页原生格式 — 当您在自己的网站上嵌入视频并需要行内单词计时时,请使用此格式。
JSON 提供原始的 STT 输出,不进行字幕转换。如果您要将转录文本输入到另一个工具中或进行自定义开发,请使用此格式。
导出选项
导出 SRT 或 VTT 时,您有四个额外设置:
-
包含标签 (Include tags) — 在字幕文件中保留括号内的事件,如
[pause]和[sigh]。如果需要干净的字幕,请关闭此项;如果您想保留表达性的元数据,请保持开启。 -
包含说话人 (Include speaker) — 为每个字幕条添加检测到的说话人标签前缀(SPK_0, SPK_1)。适用于多说话人节目。
-
标点符号 (Punctuation) — 在导出的文本中保留标点。如果您要进行进一步处理,可以关闭此项以获得更干净的词元流。
-
分割模式 (Split mode) — 在“片段 (Segment)”(保留现有的 STT 边界)或“最大单词数 (Max words)”(按单词数、标点符号和说话人变化重新分组)之间进行选择。将每条字幕限制在 7 个单词以内的“最大单词数”模式通常会为语速较快的语音生成更易读的字幕。
说话人检测 — 区分主持人与嘉宾
对于播客采访和小组讨论,说话人检测是播客转录工具能提供的最有用功能之一。Fish Audio 会自动分离多说话人录音中的声音。转录查看器中的每个片段都被标记为 SPK_0、SPK_1 等 — 对应于音频中检测到的不同声音。
创建任务时,您可以将说话人数量保留为“自动”,也可以手动设置。手动设置准确的人数往往能产生更清晰的说话人边界,尤其是在一个说话人声音明显小于另一个说话人的录音中。
导出时,启用包含说话人会将说话人标签作为前缀添加到每个字幕条中。这使得按说话人搜索、编辑或重新格式化转录文本变得简单直接 — 当您为节目摘要提取引用或将转录文本编辑为关键对话时非常有用。
注意:说话人检测和带说话人标签的转录文本在 Fish Audio Web 界面中可用。启用“包含说话人”后,说话人标签将随 SRT、VTT 和 JSON 格式一起导出。
转录播客需要多少钱?
Fish Audio STT 按处理的音频分钟计费,费率为 每分钟 300 积分。
免费账户每月可获得 8,000 积分 — 足以处理约 26 分钟的音频。这可以覆盖一集短节目或几个采访片段。
Web 界面会在您确认任务之前显示确切的预估积分,因此不会有意外扣费。
对于团队或高产量制作,付费计划包含更大的积分池。请在 fish.audio/plan/ 查看完整的价格详情。
在几分钟内转录您的下一集播客。开始免费转录 →
Fish Audio 与其他播客转录工具的对比
许多在寻找最佳播客转录工具的播客制作人发现,正确的选择取决于他们需要的是纯文本转录,还是带有情感标签和多格式导出的丰富元数据。以下是 Fish Audio 与其他流行选项的对比:
| 功能 | Fish Audio | Otter.ai | Happy Scribe | Adobe Podcast |
|---|---|---|---|---|
| 自动情感标签 | ✅ | ❌ | ❌ | ❌ |
| 副语言标签 | ✅ | ❌ | ❌ | ❌ |
| 说话人检测 | ✅ | ✅ | ✅ | ✅ |
| SRT 导出 | ✅ | ✅ | ✅ | ❌ |
| VTT 导出 | ✅ | ❌ | ✅ | ❌ |
| JSON 导出 | ✅ | ❌ | ❌ | ❌ |
| TTS / Studio 集成 | ✅ | ❌ | ❌ | ❌ |
| 语言数量 | 100+ | 多语言 | 120+ | 有限 |
| 免费额度 | ✅ 8,000 积分/月 | ✅ 300 分钟/月 | ✅ 有限 | ✅ |
数据源自 Otter.ai、 Happy Scribe 和 Adobe Podcast ,截至 2026 年 3 月。
大多数播客转录工具专注于提供纯文本输出。Fish Audio 是少数能直接在转录文本中嵌入情感和副语言标签的工具之一,也是少数能通过 Studio 集成将转录与语音制作工作流程连接起来的工具之一。
如果您只需要纯文本来制作节目摘要或 SEO 内容,以上任何工具都可以。如果您需要带标签的转录、多格式导出,或从转录通往语音制作的路径,Fish Audio 是最完备的选择。
播客制作人的另一个有用选择是 Podsqueeze,这是一个 AI 平台,可帮助将播客节目转换为节目摘要、时间戳、摘要、社交媒体帖子、时事通讯以及其他二次创作内容。对于希望在录制后节省时间并将每集节目转化为多个内容资产的创作者来说,它特别有帮助。
下一步 — 从转录到 Studio
带有标签的转录文本不仅仅是一份文档。它是一份已经知道该如何发声的剧本。
Fish Audio 在您的播客转录文本中嵌入的标签 — [calm, reflective]、[breath]、[determined]、[pause] — 使用与 Fish Audio S2 TTS 模型相同的格式。这意味着转录文本可以直接馈送到语音生成流水线中,无需任何格式重排。
Fish Audio Studio 将这一点进一步推进。在 Studio 中,带标签的剧本变成了完全可编辑的语音项目:您可以按章节编辑、更换语音模型、在单词层面调整表达方式,并制作多轨音频 — 所有这些都保留了原始录音中的表现力元数据。
STT 到 Studio 的直接导入功能即将推出。 转录格式已经兼容 — 您 STT 输出中的标签与 Studio 读取的标签相同。一旦该功能发布,导入将只需一个步骤。
开始免费转录您的播客 → — 或者如果您已准备好开始制作,请 探索 Fish Audio Studio。
相关内容:
常见问题解答
什么是最好的免费播客转录工具?
Fish Audio 的播客转录工具准确率如何?
Fish Audio 能转录多个说话人吗?
Fish Audio 支持哪些导出格式?
转录需要多长时间?
没有账户可以使用 Fish Audio STT 吗?
Fish Audio 支持哪些语言?
Fish Audio 接受哪些音频格式?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
阅读Sabrina Shu的更多内容