Outil de transcription de podcast — Comment transcrire votre podcast avec Fish Audio
L'outil de transcription de podcast de Fish Audio convertit l'audio en texte avec des balises d'émotion automatiques, des étiquettes de locuteur et des horodatages — puis exporte en SRT, VTT ou JSON. Niveau gratuit disponible. Aucun code requis.
Mars 2026 | Fish Audio STT est désormais disponible sur fish.audio/app/speech-to-text
Chaque épisode de podcast que vous publiez sans transcription est une occasion manquée en termes de trafic. Une transcription rend votre épisode consultable sur Google, vous donne des notes d'émission en un clic et vous permet de générer des sous-titres automatiquement — pour YouTube, votre site web ou n'importe quel autre canal de distribution. Pour les publics malentendants, cela rend également votre contenu accessible. Les monteurs de podcasts, les équipes média et les créateurs YouTube s'appuient sur les transcriptions pour générer du contenu SEO, des archives consultables et des pages d'épisodes accessibles. La plupart des outils de transcription de podcast vous donnent un bloc de texte brut et s'arrêtent là. L'outil de transcription de podcast de Fish Audio va plus loin : chaque transcription est accompagnée de balises automatiques d'émotion et de paralangage, d'étiquettes de locuteur, d'horodatages et de trois formats d'exportation. Ce guide vous accompagne à travers l'ensemble du flux de travail, de l'importation à l'exportation, en environ trois minutes.
Qu'est-ce qui fait un bon outil de transcription de podcast ?
Avant de choisir un outil de transcription, il est utile de savoir ce que vous évaluez réellement. Un bon outil de transcription de podcast doit offrir quatre choses :
-
Une grande précision de transcription sur différents accents, qualités audio et environnements d'enregistrement
-
L'identification des locuteurs pour que vous puissiez distinguer l'hôte de l'invité dans la transcription
-
Plusieurs formats d'exportation — au minimum le SRT pour les sous-titres vidéo, et idéalement le VTT et le JSON également
-
Une tarification transparente et abordable avec un niveau gratuit réellement utilisable pour un épisode réel
L'outil de transcription de podcast de Fish Audio prend en charge plus de 100 langues, accepte 24 formats audio et vidéo et balise automatiquement les émotions et les événements de paralangage en ligne — sans aucune annotation manuelle. Le modèle speech-to-text est optimisé pour l'audio conversationnel et les enregistrements multi-locuteurs tels que les podcasts, les interviews et les discussions en direct. Voici comment cela fonctionne en pratique.
Comment transcrire votre podcast avec Fish Audio — Étape par étape
Temps requis : ~3 minutes Outils nécessaires : Fichier audio (MP3, MP4, WAV, M4A, etc.) Résultat : Transcription balisée + fichier de sous-titres prêt pour l'exportation
Étape 1 — Ouvrir Fish Audio STT
Allez sur fish.audio/app/speech-to-text. Vous verrez l'historique de vos tâches — toutes les transcriptions précédentes répertoriées avec le nom du fichier, la date, le statut, les crédits utilisés et le nombre de locuteurs. Cliquez sur Create task pour lancer une nouvelle transcription.
Étape 2 — Importez votre épisode et définissez les locuteurs
Dans la fenêtre Create transcription task, importez votre fichier audio ou vidéo. Fish Audio accepte tous les formats majeurs — MP3, MP4, WAV, FLAC, M4A, OGG, MOV, AVI, WEBM, etc.
Sous number of speakers, laissez sur Auto si vous n'êtes pas sûr du nombre de personnes dans l'enregistrement. Fish Audio détectera les locuteurs automatiquement. Si vous connaissez le nombre exact — par exemple, deux pour un format standard hôte et invité — vous pouvez le définir manuellement pour des étiquettes de locuteur plus précises.
Avant de confirmer, l'interface vous indique la durée estimée, les minutes facturables et les crédits estimés pour cette tâche. Vous n'êtes pas facturé tant que vous ne cliquez pas sur Create task.
Étape 3 — Examinez votre transcription
Une fois la tâche terminée, cliquez sur Open viewer. La transcription s'affiche en trois colonnes : SPK/TAGS (étiquette du locuteur), TIME (plage horaire) et TEXT (la transcription avec les balises en ligne).
Chaque segment est horodaté à la seconde près. Les événements d'émotion et de paralangage apparaissent sous forme de balises violettes directement dans le texte — vous verrez des mentions comme [pause], [sigh], [emphasis] et [breath] au moment exact de l'enregistrement où ils se sont produits.
Cliquez sur n'importe quel segment pour lire cette partie de l'audio directement dans le navigateur. Cela facilite la vérification de la précision ou le contrôle ponctuel de moments spécifiques sans avoir à parcourir tout le fichier.
Le panneau Controller à droite affiche un résumé : durée totale, nombre de locuteurs détectés, nombre de segments, et confirmation que la séparation des voix et les balises d'événements audio sont activées.
Étape 4 — Exportez dans votre format
Cliquez sur Export en bas à droite du panneau Controller. Choisissez votre format et configurez les options d'exportation avant de télécharger.
Prêt à transcrire votre premier épisode ? Lancez une tâche de transcription gratuite →
Balises automatiques — Ce que Fish Audio capture et que les autres outils manquent
C'est ici que l'outil de transcription de podcast de Fish Audio se distingue le plus nettement des alternatives.
Quand quelqu'un soupire avant de répondre à une question, rit au milieu d'une phrase, fait une pause pour souligner un point ou prend une inspiration audible — les outils de transcription standard ignorent tout cela. Vous obtenez les mots, dépouillés de tout le reste.
Fish Audio intègre ces événements sous forme de balises en ligne au point exact où ils se produisent dans la transcription. Ces balises sont générées automatiquement — sans annotation manuelle, sans étape de post-traitement. Le panneau Controller affiche Tag audio events: On par défaut.
Ce qui est balisé
Paralangage — sons non verbaux qui accompagnent la parole.
Émotion — ton affectif de la livraison, capturé à partir du contexte et de la prosodie.
Pourquoi cela est important pour les podcasteurs
Pour la plupart des flux de travail de podcast, les balises servent trois objectifs pratiques. Premièrement, elles rendent votre transcription plus utile comme source pour les notes d'émission — une transcription qui capture [laugh] et [pause] donne à votre monteur un matériel plus riche qu'un simple fichier texte. Deuxièmement, elles permettent de naviguer plus rapidement dans de longs enregistrements — vous pouvez rechercher les moments de [sigh] ou [emphasis] pour trouver les parties émotionnellement significatives de l'épisode sans tout réécouter. Troisièmement, et c'est le point le plus distinctif, ces balises sont compatibles avec le modèle TTS de Fish Audio — ce qui signifie qu'une transcription peut être réinjectée directement dans un flux de production vocale sans aucun reformatage.
Vous voulez voir les balises en action ? Importez votre premier fichier audio →
Explication des formats d'exportation — Duquel avez-vous besoin ?
Fish Audio STT prend en charge trois formats d'exportation. Lequel utiliser dépend de ce que vous ferez ensuite de la transcription.
Le SRT est le bon choix pour la plupart des podcasteurs diffusant du contenu vidéo. C'est le format de sous-titres le plus largement pris en charge — compatible avec YouTube, Premiere Pro, Final Cut Pro et la plupart des plateformes vidéo.
Le VTT (WebVTT) est le format natif du web — utilisez-le lorsque vous intégrez une vidéo sur votre propre site et que vous avez besoin d'un minutage précis par mot.
Le JSON vous donne la sortie STT brute sans transformations de sous-titres. Utilisez-le si vous injectez la transcription dans un autre outil ou si vous construisez quelque chose de personnalisé.
Options d'exportation
Lors de l'exportation en SRT ou VTT, vous disposez de quatre paramètres supplémentaires :
-
Inclure les balises — conserve les événements entre crochets comme
[pause]et[sigh]dans le fichier de sous-titres. Désactivez cette option pour des sous-titres propres ; laissez-la activée si vous souhaitez préserver les métadonnées expressives. -
Inclure le locuteur — préfixe chaque segment de sous-titre avec l'étiquette de locuteur détectée (SPK_0, SPK_1). Utile pour les épisodes multi-locuteurs.
-
Ponctuation — conserve la ponctuation dans le texte exporté. Désactivez pour un flux de jetons plus propre si vous effectuez un traitement ultérieur.
-
Mode de division — choisissez entre Segment (conserve les limites STT existantes) ou Max words (regroupe les segments par nombre de mots, ponctuation et changements de locuteur). Le mode Max words avec une limite de 7 mots par segment a tendance à produire des sous-titres plus lisibles pour un débit de parole rapide.
Détection des locuteurs — Distinguer votre hôte de votre invité
Pour les interviews de podcast et les tables rondes, la détection des locuteurs est l'une des fonctionnalités les plus utiles qu'un outil de transcription de podcast puisse offrir. Fish Audio sépare automatiquement les locuteurs dans les enregistrements impliquant plusieurs personnes. Chaque segment dans le visualiseur de transcription est étiqueté SPK_0, SPK_1, et ainsi de suite — correspondant aux voix distinctes détectées dans l'audio.
Lors de la création d'une tâche, vous pouvez soit laisser le number of speakers sur Auto, soit le définir manuellement. Définir le nombre exact a tendance à produire des limites de locuteurs plus nettes, en particulier dans les enregistrements où un locuteur est nettement plus discret que l'autre.
Lors de l'exportation, l'activation de Include speaker ajoute l'étiquette du locuteur en préfixe à chaque segment de sous-titre. Cela facilite la recherche, l'édition ou le reformatage des transcriptions par locuteur — pratique si vous extrayez des citations pour les notes d'émission ou si vous réduisez une transcription aux échanges clés.
Note : La détection des locuteurs et les transcriptions étiquetées par locuteur sont disponibles dans l'interface web de Fish Audio. Les étiquettes de locuteur sont incluses dans l'exportation aux formats SRT, VTT et JSON lorsque l'option Include speaker est activée.
Combien coûte la transcription d'un podcast ?
Fish Audio STT est facturé à la minute d'audio traitée à hauteur de 300 crédits par minute.
Les comptes gratuits reçoivent 8 000 crédits par mois — ce qui est suffisant pour environ 26 minutes d'audio. Cela couvre un épisode de format court ou quelques segments d'interview.
L'interface web vous indique le nombre exact de crédits estimés avant de confirmer une tâche, il n'y a donc pas de surprise.
Pour les équipes ou les productions à gros volume, les forfaits payants incluent des pools de crédits plus importants. Consultez le détail complet des tarifs sur fish.audio/plan/.
Transcrivez votre prochain épisode de podcast en quelques minutes. Commencez à transcrire gratuitement →
Fish Audio vs autres outils de transcription de podcast
De nombreux podcasteurs à la recherche du meilleur outil de transcription de podcast constatent que le bon choix dépend de s'ils ont besoin de transcriptions en texte brut ou de métadonnées plus riches comme les balises d'émotion et l'exportation multi-format. Voici comment Fish Audio se compare à d'autres options populaires :
| Fonctionnalité | Fish Audio | Otter.ai | Happy Scribe | Adobe Podcast |
|---|---|---|---|---|
| Balises d'émotion automatiques | ✅ | ❌ | ❌ | ❌ |
| Balises de paralangage | ✅ | ❌ | ❌ | ❌ |
| Détection des locuteurs | ✅ | ✅ | ✅ | ✅ |
| Exportation SRT | ✅ | ✅ | ✅ | ❌ |
| Exportation VTT | ✅ | ❌ | ✅ | ❌ |
| Exportation JSON | ✅ | ❌ | ❌ | ❌ |
| Intégration TTS / Studio | ✅ | ❌ | ❌ | ❌ |
| Langues | 100+ | Multilingue | 120+ | Limité |
| Niveau gratuit | ✅ 8 000 crédits/mois | ✅ 300 min/mois | ✅ limité | ✅ |
Données provenant de Otter.ai, Happy Scribe, et Adobe Podcast en date de mars 2026.
La plupart des outils de transcription de podcast se concentrent sur la fourniture d'une sortie en texte brut. Fish Audio est l'un des rares à intégrer des balises d'émotion et de paralangage directement dans la transcription — et l'un des rares outils qui connecte la transcription à un flux de production vocale via l'intégration Studio.
Si vous avez besoin d'un texte brut propre pour des notes d'émission ou du contenu SEO, n'importe lequel de ces outils fera l'affaire. Si vous avez besoin de transcriptions balisées, d'une exportation multi-format ou d'une passerelle entre la transcription et la production vocale, Fish Audio est l'option la plus complète.
Une autre option utile pour les podcasteurs est Podsqueeze, une plateforme d'IA qui aide à transformer les épisodes de podcast en notes d'émission, horodatages, résumés, publications sociales, newsletters et autres contenus réutilisés. C'est particulièrement utile pour les créateurs qui souhaitent gagner du temps après l'enregistrement et transformer chaque épisode en multiples ressources de contenu pour leur public.
Et ensuite — De la transcription au Studio
Une transcription balisée est plus qu'un document. C'est un script qui sait déjà comment il doit sonner.
Les balises que Fish Audio intègre dans votre transcription de podcast — [calm, reflective], [breath], [determined], [pause] — utilisent le même format que le modèle S2 TTS de Fish Audio. Cela signifie qu'une transcription peut alimenter directement un pipeline de génération de voix sans aucun reformatage.
Fish Audio Studio va encore plus loin. Dans Studio, les scripts balisés deviennent des projets vocaux entièrement éditables : vous pouvez éditer par chapitre, changer de modèle de voix, ajuster la livraison au niveau du mot et produire de l'audio multi-pistes — tout en conservant les métadonnées expressives de votre enregistrement original.
L'importation directe de STT vers Studio est une fonctionnalité à venir. Le format de transcription est déjà compatible — les balises de votre sortie STT sont les mêmes que celles lues par Studio. L'importation se fera en une seule étape une fois la fonctionnalité disponible.
Commencez à transcrire votre podcast gratuitement → — ou Explorez Fish Audio Studio si vous êtes prêt à produire.
Articles connexes :
Questions Fréquemment Posées
Quel est le meilleur outil gratuit de transcription de podcast ?
Quelle est la précision de l'outil de transcription de podcast de Fish Audio ?
Fish Audio peut-il transcrire plusieurs locuteurs ?
Quels formats d'exportation Fish Audio prend-il en charge ?
Combien de temps prend la transcription ?
Puis-je utiliser Fish Audio STT sans compte ?
Quelles langues Fish Audio prend-il en charge ?
Quels formats audio Fish Audio accepte-t-il ?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
Lire plus de Sabrina Shu