Fish Audio S2.1 Pro : API de synthèse vocale gratuite pour les développeurs
Résumé rapide :
S2.1 Pro, le modèle vocal le plus avancé de Fish Audio, est désormais disponible via une API de synthèse vocale gratuite
83 langues, utilisation illimitée selon la politique d'utilisation équitable (Fair Use Policy)
Chaîne de modèle : s2.1-pro-free — insérez-la simplement dans vos appels API Fish existants
Essayez S2.1 Pro gratuitement — premier audio en 5 minutes →
Juin 2026 | Le modèle S2.1 Pro de Fish Audio est désormais disponible sous forme d'API de synthèse vocale gratuite avec un accès illimité dans le cadre d'une utilisation équitable.
Pourquoi l'IA vocale de haute qualité a toujours été coûteuse
Si vous avez passé du temps à évaluer les API de synthèse vocale, vous connaissez déjà le schéma : les modèles qui sonnent vraiment bien coûtent cher.
Le niveau gratuit d'ElevenLabs vous offre 10 000 crédits par mois (environ 6 à 10 minutes) avant que le mur de paiement ne s'active. L'API TTS d'OpenAI est payante à l'utilisation sans aucun niveau gratuit. Les derniers modèles Gemini TTS de Google — leurs plus avancés — n'offrent aucune utilisation gratuite : vous payez dès le premier token. Le schéma est constant dans toute l'industrie : la qualité vocale de pointe a toujours été une fonctionnalité payante.
Cela crée un réel problème pour les développeurs. Le marché des générateurs de voix par IA croît de près de 20 % par an — mais les outils pour créer des produits vocaux sont restés derrière un mur de paiement. Vous ne pouvez pas évaluer correctement un modèle avec 10 000 crédits. Vous ne pouvez pas prototyper un agent vocal, tester un pipeline de livres audio ou expérimenter le clonage de voix sans engager un budget au préalable ou passer des semaines à lutter avec des alternatives open-source nécessitant votre propre infrastructure GPU.
Fish Audio change cela aujourd'hui.
Qu'est-ce que S2.1 Pro ?
S2.1 Pro est le modèle vocal actuel de Fish Audio à la pointe de la technologie — le meilleur modèle que nous ayons, désormais disponible gratuitement pour chaque développeur via API. Il s'agit d'un modèle de synthèse vocale neuronale conçu pour la génération de voix par IA de qualité production, avec des points forts particuliers pour le streaming à faible latence, le TTS multilingue et le clonage de voix. Il s'appuie sur les bases de S2, que nous avons publié en open-weights plus tôt cette année.
Performance
- 61 % de taux de victoire contre la génération précédente S2 Pro dans les évaluations d'écoute comparatives — voir notre comparaison aveugle des fournisseurs TTS pour plus de contexte
- ~70ms de Délai avant le premier audio (TTFA) pour une requête unique — contre ~100ms pour la génération précédente
- Amélioration du débit de plus de 2x sous une charge de simultanéité élevée
Pour le contexte technique complet, consultez notre article : Ici
Couverture linguistique
S2.1 Pro prend en charge 83 langues, dont l'anglais, le japonais, le chinois, le coréen, l'espagnol, l'arabe, le français, l'allemand, le portugais, le russe et des dizaines d'autres. Le même modèle gère toutes les langues — pas de points de terminaison séparés, pas de tarification par langue.
Latence
S2.1-Pro offre un TTFA (Time to First Audio) d'environ 90ms sur l'API standard, ce qui le rend viable pour les agents vocaux en direct et les systèmes de dialogue interactifs. Si vous avez besoin d'un contrôle précis de la prosodie et du débit, consultez également les capacités de contrôle vocal au niveau du mot de S2.
Pourquoi Fish Audio peut proposer cela gratuitement aujourd'hui
La version courte : nous avons reconstruit la pile d'inférence de zéro, et le coût par requête a suffisamment baissé pour que nous puissions l'absorber.
Kernels GPU personnalisés
Nous avons développé fish-scales-ops, une bibliothèque FP8 GEMM et FlashAttention de qualité production ciblant les architectures NVIDIA Hopper (H100/H200) et Blackwell (RTX 6000 PRO). Sur les formes de décodage cruciales pour le service de l'IA vocale, notre chemin MXFP8 surpasse la référence cuBLAS fusionnée par torch.compile de 2,1 à 4,3 fois. Vous n'avez pas besoin de comprendre tout cela pour utiliser l'API — mais c'est la raison pour laquelle le niveau gratuit est viable.
Débit plus élevé
Sur un seul H200 avec quantification FP8, le système maintient un débit de sortie de plus de 8 000 tokens/seconde avec 64 requêtes simultanées. Un débit plus élevé par GPU signifie plus de requêtes servies par dollar investi, ce qui rend l'accès gratuit illimité économiquement viable.
Ce que « gratuit » signifie réellement
Nous préférons être transparents sur les contraintes plutôt que de les cacher.
Ce que vous obtenez :
- Chaîne de modèle :
s2.1-pro-free - Accès à haut volume sans limite stricte de caractères (soumis à la Politique d'utilisation équitable)
- Même point de terminaison API que les forfaits payants — pas d'intégration séparée
Limitations actuelles :
- Durée :
L'accès gratuit est disponible jusqu'au 24 juillet 2026 L'accès gratuit est disponible jusqu'à la fin de juillet 2026 L'accès gratuit est disponible jusqu'au 31 août 2026L'accès gratuit est disponible jusqu'au 30 novembre 2026 — nous communiquerons tout changement avec un préavis.- Mise à jour (juin 2026) : Nous prolongeons la fenêtre gratuite pour couvrir tout le mois de juillet. Nous voulons que les développeurs aient un mois complet et ininterrompu pour construire, évaluer et déployer — sans avoir à compter les jours.
- Mise à jour (juillet 2026) : Nous prolongeons l'accès gratuit une fois de plus, jusqu'au 31 août 2026. Voir ce que nos développeurs Fish ont construit avec S2.1 Pro a été véritablement encourageant, et nous voulons donner encore plus d'espace à cet élan.
- Pas de SLA : Aucune garantie de disponibilité ou de TTFA ; conçu pour l'expérimentation et le prototypage
- Pas de garantie de latence : Au mieux, non contractuel
- Rétention des données : Les requêtes peuvent être utilisées pour améliorer la qualité du modèle — voir notre Politique de confidentialité
- Utilisation commerciale : Certains scénarios commerciaux peuvent comporter des restrictions. Les produits générant plus de 1 million de dollars de revenus annuels récurrents (ARR) doivent nous contacter avant d'utiliser S2.1 Pro Free. Voir Tarifs et limites de débit pour plus de détails
Si vous avez besoin d'un SLA de production et de garanties de latence, des forfaits payants sont disponibles. Ce niveau gratuit est l'endroit idéal pour construire, évaluer et décider.
Comment utiliser l'API de synthèse vocale gratuite : Guide de démarrage rapide S2.1 Pro
Obtenez votre clé API sur fish.audio/app/api-keys, puis effectuez votre premier appel. L'API Fish accepte les requêtes encodées en msgpack et renvoie l'audio dans le format de votre choix. Référence complète dans la documentation de l'API.
JavaScript
import { writeFile } from "fs/promises";
const body = {
text: "Hello, world!",
reference_id: "your_model_id",
format: "mp3",
};
const res = await fetch("https://api.fish.audio/v1/tts", {
method: "POST",
headers: {
Authorization: "Bearer <YOUR_API_KEY>",
"Content-Type": "application/json",
model: "s2.1-pro-free",
},
body: JSON.stringify(body),
});
if (!res.ok) {
throw new Error(`TTS request failed: ${res.status} ${await res.text()}`);
}
const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);
Python
import httpx
body = {
"text": "Hello, world!",
"reference_id": "your_model_id",
"format": "mp3",
}
with httpx.Client() as client:
res = client.post(
"https://api.fish.audio/v1/tts",
headers={
"Authorization": "Bearer <YOUR_API_KEY>",
"Content-Type": "application/json",
"model": "s2.1-pro-free",
},
json=body,
)
res.raise_for_status()
with open("output.mp3", "wb") as f:
f.write(res.content)
Le seul changement par rapport à tout autre appel API Fish Audio : définissez model: "s2.1-pro-free" dans les en-têtes. C'est tout.
Obtenez votre clé API gratuite →
S2.1 Pro vs ElevenLabs et les meilleures API TTS en 2026
Les informations sur les concurrents ci-dessous sont basées sur la documentation publique et les pages de tarifs disponibles en juin 2026. Les prix et les fonctionnalités peuvent changer — vérifiez directement auprès de chaque fournisseur avant de prendre une décision de production.
Pour une analyse indépendante plus approfondie, consultez notre comparaison aveugle des fournisseurs TTS.
L'essentiel : Parmi les principaux fournisseurs d'API TTS que nous avons évalués, Fish Audio propose actuellement l'un des modèles d'accès gratuit les plus généreux — le seul où le niveau gratuit utilise le même modèle de pointe que le niveau payant, sans limite d'utilisation stricte. Le niveau gratuit d'ElevenLabs est en réalité un essai limité à 10 000 crédits. La version la plus avancée de Google (Gemini TTS) n'a pas de niveau gratuit du tout.
Vous cherchez une alternative gratuite à ElevenLabs qui ne fait pas de compromis sur la qualité du modèle ? S2.1 Pro est disponible dès maintenant sans limite d'utilisation.
Vous cherchez une alternative gratuite à OpenAI TTS ? L'offre TTS d'OpenAI n'a pas de niveau gratuit — S2.1 Pro est une option convaincante à évaluer en priorité.
Consultez la doc API complète et commencez à construire →
Ce que vous pouvez construire avec
Le niveau gratuit est intentionnellement sans restriction sur les cas d'utilisation. Voici les scénarios où la combinaison de génération de voix par IA à faible latence, de support multilingue et de clonage de voix de S2.1 Pro a tendance à faire la plus grande différence.
Agents vocaux
L'IA conversationnelle en temps réel dépend entièrement de la latence. Avec environ 90ms de TTFA pour les appels standard, S2.1 Pro est assez rapide pour un dialogue interactif naturel. Associez-le à une couche de reconnaissance vocale (STT) et à un LLM pour un pipeline vocal complet sans facturation au caractère. Vous pouvez également intégrer S2.1 Pro dans les flux de travail d'agents via notre support MCP et compétences d'agent.
Livres audio et narration longue durée
La prise en charge de 83 langues et une prosodie naturelle rendent S2.1 Pro parfaitement adapté à la production de livres audio et à la synthèse vocale longue durée. L'utilisation illimitée signifie que vous pouvez traiter des manuscrits entiers sans surveiller un compteur de caractères ou pré-acheter des crédits.
Clonage de voix
S2.1 Pro prend en charge le clonage de voix à partir d'un audio de référence via API — passez un échantillon audio de référence et le modèle synthétise la parole avec cette voix. Créez des applications vocales personnalisées, localisez du contenu en conservant l'identité du locuteur ou générez des voix de personnages pour les jeux et l'animation. Le clonage de voix est disponible dans le niveau gratuit, sous réserve de la même politique d'utilisation équitable.
Applications multilingues
Si votre application dessert des utilisateurs dans plusieurs langues, une couverture de 83 langues avec une seule API vocale IA cohérente est une simplification significative par rapport aux alternatives qui nécessitent des points de terminaison de modèle séparés par langue ou facturent des tarifs premium pour la synthèse vocale non anglaise.
Dialogue de PNJ de jeu
Les pipelines audio de jeux bénéficient d'un débit élevé et d'un coût par requête prévisible. L'utilisation gratuite illimitée permet de générer de grandes bibliothèques de dialogues et d'itérer librement pendant le développement avant de s'engager sur un budget de production.
Disponible via notre écosystème de partenaires
S2.1 Pro est également disponible via un nombre croissant de plateformes partenaires, notamment Runware, Retell, Sierra, et d'autres.
Si vous construisez déjà sur l'une de ces plateformes, S2.1 Pro est accessible sans intégration ou configuration supplémentaire — utilisez simplement ce que vous avez déjà.
Nous élargissons activement notre réseau de partenaires. Si vous êtes un fournisseur de plateforme ou d'infrastructure intéressé par l'intégration de S2.1 Pro, contactez notre équipe pour explorer les possibilités.
Utilisation équitable et étapes suivantes
Le niveau gratuit fonctionne selon une politique d'utilisation équitable (Fair Use Policy). Nous nous réservons le droit de brider ou de limiter l'accès pour les modèles d'utilisation qui ressemblent à de l'abus plutôt qu'à du développement — l'objectif est de protéger l'accès pour toute la communauté des développeurs, et non de créer des limites arbitraires pour les cas d'utilisation légitimes. Voir Tarifs et limites de débit pour plus de détails.
À quoi s'attendre :
- L'accès gratuit est disponible dès maintenant pour une période initiale. Nous donnerons un préavis avant tout changement.
- Des forfaits payants avec garanties de SLA, engagements de latence et licences commerciales sont disponibles pour les charges de travail de production.
- L'investissement dans l'infrastructure est continu — le travail d'ingénierie qui a rendu ce niveau gratuit possible n'est pas un événement ponctuel.
- Infrastructure open-source : Nous prévoyons d'ouvrir les composants d'infrastructure derrière S2.1 Pro — la même pile qui rend le niveau gratuit durable.
Si vous évaluez Fish Audio pour un déploiement en production, le niveau gratuit est le bon endroit pour commencer. Construisez quelque chose de réel, mesurez ce qui compte pour votre application et contactez-nous lorsque vous serez prêt à discuter des exigences de production.
Pas de carte de crédit. Pas de liste d'attente. Aucune limite sur ce que vous pouvez essayer.
