2026年3月27日指南

播客转录工具 — 如何使用 Fish Audio 转录您的播客

播客转录工具 — 如何使用 Fish Audio 转录您的播客

Fish Audio 的播客转录工具可以将音频转换为文本,并带有自动情感标签、说话人标签和时间戳 — 然后可以导出为 SRT、VTT 或 JSON 格式。提供免费额度,无需代码即可使用。

2026 年 3 月 | Fish Audio STT 现已上线,访问地址:fish.audio/app/speech-to-text

每一集没有转录文本就发布的播客都在错失潜在的流量。转录文本可以让您的节目在 Google 上被搜索到,只需点击一下即可生成节目摘要(Show Notes),并让您能为 YouTube、您的网站或任何其他分发平台自动生成字幕。对于听力障碍受众,它还能提升内容的可访问性。播客编辑、媒体团队和 YouTube 创作者依靠转录文本来生成 SEO 内容、可搜索的存档以及具有无障碍体验的节目页面。大多数播客转录工具只提供一大堆纯文本,然后就此结束。Fish Audio 的播客转录工具更进一步:每一份转录文本都带有自动的情感和副语言标签、说话人标签、时间戳以及三种导出格式。本指南将带您在约三分钟内完成从上传到导出的完整工作流程。

开始免费转录您的播客 →

什么是优秀的播客转录工具?

在选择任何转录工具之前,了解评估标准会很有帮助。一个好的播客转录工具应该具备以下四点:

  1. 针对不同口音、音频质量和录制环境的高转录准确率

  2. 说话人识别功能,以便您在转录文本中区分主持人与嘉宾

  3. 多种导出格式 — 至少包括用于视频字幕的 SRT,理想情况下还应支持 VTT 和 JSON

  4. 透明且实惠的价格,并提供真正可用于完整节目的免费额度

Fish Audio 的播客转录工具支持 100 多种语言,接受 24 种音视频格式,并能自动在行内标记情感和副语言事件 — 无需任何人工标注。该语音转文本模型针对对话式音频和多说话人录音(如播客、访谈和现场讨论)进行了优化。以下是它在实际操作中的表现。

如何使用 Fish Audio 转录您的播客 — 步骤指南

所需时间: ~3 分钟 所需工具: 音频文件(MP3、MP4、WAV、M4A 等) 输出: 带标签的转录文本 + 可导出的字幕文件

第 1 步 — 打开 Fish Audio STT

访问 fish.audio/app/speech-to-text。您将看到您的任务历史记录 — 列出了所有之前的转录任务,包括文件名、日期、状态、所用积分和说话人数量。点击 创建任务 (Create task) 开始新的转录。

Fish Audio STT 任务列表,显示已完成的转录任务、所用积分和说话人数量

第 2 步 — 上传您的节目并设置说话人

在“创建转录任务”窗口中,上传您的音频或视频文件。Fish Audio 支持所有主流格式 — MP3、MP4、WAV、FLAC、M4A、OGG、MOV、AVI、WEBM 等。

说话人数量 (number of speakers) 下方,如果您不确定录音中有多少人,请保留为“自动 (Auto)”。Fish Audio 将自动检测说话人。如果您知道确切的人数 — 例如标准的主持人加嘉宾模式为两人 — 您可以手动设置,以获得更准确的说话人标签。

在确认之前,界面会显示此任务的预计时长、计费分钟数和预估积分。在点击 创建任务 (Create task) 之前,不会扣除您的积分。

Fish Audio 创建转录任务对话框,显示文件上传、说话人数量设置和预估积分

第 3 步 — 检查您的转录文本

任务完成后,点击 打开查看器 (Open viewer)。转录文本分为三列显示:SPK/TAGS(说话人标签)、TIME(时间戳范围)和 TEXT(带有行内标签的文本)。

每个片段的时间戳精确到秒。情感和副语言事件作为紫色的行内标签直接出现在文本中 — 您会在录音中发生这些事件的确切位置看到诸如 [pause](停顿)、[sigh](叹气)、[emphasis](重音)和 [breath](呼吸)等标签。

点击任何片段即可直接在浏览器中播放音频的相应部分。这使得验证准确性或抽查特定瞬间变得非常容易,无需反复拖动进度条。

右侧的控制器 (Controller) 面板显示了摘要:总时长、检测到的说话人数量、片段数量,并确认“语音分离”和“标记音频事件”均已开启。

Fish Audio 转录查看器显示说话人标签、时间戳以及停顿、叹气等行内情感标签

第 4 步 — 导出为您需要的格式

点击控制器面板右下角的 导出 (Export)。在下载前选择您的格式并配置导出选项。

Fish Audio 导出选项面板,显示格式选择

Fish Audio 导出转录对话框,显示 SRT、VTT、JSON 格式选项及常规导出设置

准备好转录您的第一集节目了吗?开始免费转录任务 →

自动标签 — Fish Audio 捕捉到了其他工具遗漏的细节

这是 Fish Audio 的播客转录工具与其他备选方案最明显的区别所在。

当有人在回答问题前叹气、在句中笑出声、为了强调而停顿或发出明显的呼吸声时 — 标准的转录工具会忽略所有这些。你得到的只有文字,剥离了其他一切信息。

Fish Audio 将这些事件作为行内标签嵌入到转录文本中发生的确切位置。这些标签是自动生成的 — 无需人工标注,也无需后期处理步骤。控制器面板默认显示 标记音频事件:开启 (Tag audio events: On)

标记的内容

副语言 (Paralanguage) — 伴随演讲发生的非语言声音。

情感 (Emotion) — 表达的情感基调,从上下文和韵律中捕捉。

为什么这对播客制作人很重要

对于大多数播客工作流程,标签有三个实际用途。首先,它们使您的转录文本作为节目摘要(Show Notes)素材时更有用 — 捕获了 [laugh][pause] 的转录文本能为您的编辑提供比纯文本更丰富的素材。其次,它们让导航长篇录音变得更快 — 您可以扫描 [sigh][emphasis] 时刻,快速找到节目中具有情感意义的部分,而无需重新听完整段音频。第三,也是最独特的一点,这些标签与 Fish Audio 的 TTS 模型兼容 — 这意味着转录文本可以直接反馈到语音制作工作流程中,无需任何格式重排。

想看看这些标签的效果吗?上传您的第一个音频文件 →

导出格式详解 — 您需要哪一种?

Fish Audio STT 支持三种导出格式。使用哪一种取决于您下一步要对转录文本做什么。

SRT 是大多数分发视频内容的播客制作人的正确选择。它是应用最广泛的字幕格式 — 兼容 YouTube、Premiere Pro、Final Cut Pro 以及大多数视频平台。

VTT (WebVTT) 是网页原生格式 — 当您在自己的网站上嵌入视频并需要行内单词计时时,请使用此格式。

JSON 提供原始的 STT 输出,不进行字幕转换。如果您要将转录文本输入到另一个工具中或进行自定义开发,请使用此格式。

导出选项

导出 SRT 或 VTT 时,您有四个额外设置:

  • 包含标签 (Include tags) — 在字幕文件中保留括号内的事件,如 [pause][sigh]。如果需要干净的字幕,请关闭此项;如果您想保留表达性的元数据,请保持开启。

  • 包含说话人 (Include speaker) — 为每个字幕条添加检测到的说话人标签前缀(SPK_0, SPK_1)。适用于多说话人节目。

  • 标点符号 (Punctuation) — 在导出的文本中保留标点。如果您要进行进一步处理,可以关闭此项以获得更干净的词元流。

  • 分割模式 (Split mode) — 在“片段 (Segment)”(保留现有的 STT 边界)或“最大单词数 (Max words)”(按单词数、标点符号和说话人变化重新分组)之间进行选择。将每条字幕限制在 7 个单词以内的“最大单词数”模式通常会为语速较快的语音生成更易读的字幕。

说话人检测 — 区分主持人与嘉宾

对于播客采访和小组讨论,说话人检测是播客转录工具能提供的最有用功能之一。Fish Audio 会自动分离多说话人录音中的声音。转录查看器中的每个片段都被标记为 SPK_0、SPK_1 等 — 对应于音频中检测到的不同声音。

创建任务时,您可以将说话人数量保留为“自动”,也可以手动设置。手动设置准确的人数往往能产生更清晰的说话人边界,尤其是在一个说话人声音明显小于另一个说话人的录音中。

导出时,启用包含说话人会将说话人标签作为前缀添加到每个字幕条中。这使得按说话人搜索、编辑或重新格式化转录文本变得简单直接 — 当您为节目摘要提取引用或将转录文本编辑为关键对话时非常有用。

注意:说话人检测和带说话人标签的转录文本在 Fish Audio Web 界面中可用。启用“包含说话人”后,说话人标签将随 SRT、VTT 和 JSON 格式一起导出。

转录播客需要多少钱?

Fish Audio STT 按处理的音频分钟计费,费率为 每分钟 300 积分

免费账户每月可获得 8,000 积分 — 足以处理约 26 分钟的音频。这可以覆盖一集短节目或几个采访片段。

Web 界面会在您确认任务之前显示确切的预估积分,因此不会有意外扣费。

对于团队或高产量制作,付费计划包含更大的积分池。请在 fish.audio/plan/ 查看完整的价格详情

在几分钟内转录您的下一集播客。开始免费转录 →

Fish Audio 与其他播客转录工具的对比

许多在寻找最佳播客转录工具的播客制作人发现,正确的选择取决于他们需要的是纯文本转录,还是带有情感标签和多格式导出的丰富元数据。以下是 Fish Audio 与其他流行选项的对比:

功能Fish AudioOtter.aiHappy ScribeAdobe Podcast
自动情感标签
副语言标签
说话人检测
SRT 导出
VTT 导出
JSON 导出
TTS / Studio 集成
语言数量100+多语言120+有限
免费额度✅ 8,000 积分/月✅ 300 分钟/月✅ 有限

数据源自 Otter.ai Happy Scribe Adobe Podcast ,截至 2026 年 3 月。

大多数播客转录工具专注于提供纯文本输出。Fish Audio 是少数能直接在转录文本中嵌入情感和副语言标签的工具之一,也是少数能通过 Studio 集成将转录与语音制作工作流程连接起来的工具之一。

如果您只需要纯文本来制作节目摘要或 SEO 内容,以上任何工具都可以。如果您需要带标签的转录、多格式导出,或从转录通往语音制作的路径,Fish Audio 是最完备的选择。

播客制作人的另一个有用选择是 Podsqueeze,这是一个 AI 平台,可帮助将播客节目转换为节目摘要、时间戳、摘要、社交媒体帖子、时事通讯以及其他二次创作内容。对于希望在录制后节省时间并将每集节目转化为多个内容资产的创作者来说,它特别有帮助。

下一步 — 从转录到 Studio

带有标签的转录文本不仅仅是一份文档。它是一份已经知道该如何发声的剧本。

Fish Audio 在您的播客转录文本中嵌入的标签 — [calm, reflective][breath][determined][pause] — 使用与 Fish Audio S2 TTS 模型相同的格式。这意味着转录文本可以直接馈送到语音生成流水线中,无需任何格式重排。

Fish Audio Studio 将这一点进一步推进。在 Studio 中,带标签的剧本变成了完全可编辑的语音项目:您可以按章节编辑、更换语音模型、在单词层面调整表达方式,并制作多轨音频 — 所有这些都保留了原始录音中的表现力元数据。

Fish Audio Story Studio 显示带有情感标签和多轨音频时间轴的标记转录文本

STT 到 Studio 的直接导入功能即将推出。 转录格式已经兼容 — 您 STT 输出中的标签与 Studio 读取的标签相同。一旦该功能发布,导入将只需一个步骤。

开始免费转录您的播客 → — 或者如果您已准备好开始制作,请 探索 Fish Audio Studio


相关内容:

常见问题解答

什么是最好的免费播客转录工具?
对于需要不仅仅是纯文本的播客制作人,Fish Audio STT 提供每月 8,000 积分的免费额度(足以处理约 26 分钟的音频),并包含自动情感标签、说话人检测以及 SRT/VTT/JSON 导出功能。
Fish Audio 的播客转录工具准确率如何?
准确率取决于音频质量、背景噪音和说话人的清晰度。Fish Audio STT 针对对话式音频和多说话人对话进行了优化。对于背景噪音较大的录音,在转录前先通过 SAM Audio 进行人声分离可以提高效果。
Fish Audio 能转录多个说话人吗?
是的。Fish Audio 会自动检测并将说话人标记为 SPK_0、SPK_1 等。您可以在创建任务时手动设置预期的说话人数量,或保留为“自动”。说话人标签可以包含在 SRT、VTT 和 JSON 导出中。
Fish Audio 支持哪些导出格式?
Fish Audio STT 支持导出为 SRT(标准视频字幕)、VTT(用于网页嵌入的 WebVTT)和 JSON(原始转录数据)。每种格式都有关于标签、说话人标签、标点符号和字幕分割模式的可配置选项。
转录需要多长时间?
Fish Audio STT 作为后台任务处理音频。大多数文件的完成时间远低于音频自身的时长 — 45 分钟的节目通常在几分钟内即可完成转录。您可以离开页面后再回来;已完成的任务将保留在您的任务历史记录中。
没有账户可以使用 Fish Audio STT 吗?
使用 Fish Audio STT 需要账户。您可以在 fish.audio 注册免费账户,每月包含 8,000 积分。
Fish Audio 支持哪些语言?
Fish Audio STT 支持 100 多种语言和方言,对英语、中文普通话、粤语、日语和韩语的支持尤为出色。多语言和中外文混读音频也可以被自动处理。
Fish Audio 接受哪些音频格式?
Fish Audio STT 接受所有主流音视频格式:MP3, MP4, WAV, FLAC, M4A, OGG, MOV, AVI, WEBM, AIFF, WMA, OPUS, MPEG, MPG, WMV, M4V 等。
Sabrina Shu

Sabrina Shu

Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.

阅读Sabrina Shu的更多内容

创造真实感的声音

立即开始生成最高质量的音频。

已有账号? 登录