Synthèse vocale avec Speech 2.6 Turbo
Synthèse vocale multilingue à faible latence avec plus de 300 voix et des émotions expressives, grâce à MiniMax Speech 2.6 Turbo sur Replicate.

Aucune configuration requise · Entièrement personnalisable dans AI-Flow
Ce que fait cette application
MiniMax Speech 2.6 Turbo offre une synthèse vocale rapide et naturelle, optimisée pour les applications temps réel et interactives. Choisissez parmi plus de 300 voix sélectionnées (ou votre propre voix clonée), changez d’émotion à la volée et générez un audio réaliste dans plus de 40 langues — le tout avec une tarification prévisible, à l’usage.
Principales capacités
Synthèse à faible latence, idéale pour les agents conversationnels, les bots vocaux et les retours d’interface
Plus de 300 voix, avec prise en charge du clonage vocal via minimax/voice-cloning
Émotion en mode auto ou définie explicitement (joyeuse, calme, surprise, neutre, etc.)
Plus de 40 langues, avec un renforcement linguistique optionnel pour une meilleure prononciation
Contrôles audio souples — vitesse, hauteur, volume, fréquence d’échantillonnage, débit, mono/stéréo
Export en mp3, wav, flac ou pcm ; sous-titres au niveau de la phrase en option (hors streaming)
Les entrées en un coup d’œil
text (requis) — jusqu’à 10 000 caractères. Insérez des pauses avec des marqueurs du type <#0.5#>
voice_id — n’importe quelle voix système MiniMax ou l’identifiant d’une voix clonée
emotion — auto ou une émotion précise
audio_format — mp3, wav, flac ou pcm
sample_rate — 8000 à 44100 Hz ; options de débit pour le mp3
channel — mono ou stéréo
speed, pitch, volume — ajustez le débit de parole, la transposition en demi-tons (−12 à +12) et le niveau sonore
language_boost — automatique ou une langue précise
english_normalization — améliore la lecture des nombres et des dates en anglais (ajoute une légère latence)
subtitle_enable — renvoie les horodatages des phrases en mode non streaming
Résultat : - L’URL d’un fichier audio hébergé (mp3/wav/flac/pcm), accompagné de métadonnées MiniMax comme le nombre de caractères et, en option, les sous-titres.
Tarification
0,06 $ pour 1 000 tokens en entrée (environ un token pour un caractère)
L’audio produit n’est pas facturé — seul le texte en entrée est compté
Turbo ou HD, comment choisir
Utilisez Speech 2.6 Turbo pour les expériences interactives à faible latence
Préférez Speech 2.6 HD pour une fidélité maximale sur des contenus longs comme les livres audio et les voix off haut de gamme
Comment utiliser l’application
Voici ce que vous obtenez en ouvrant l’application : un formulaire court, un bouton d’exécution et vos résultats, sans nœuds ni configuration.
Speech 2.6 Turbo
Aperçu de l’applicationRemplissez le formulaire
Text
RequisSaisissez text…
Audio Format
mp3
Bitrate
128000
Channel
mono
Emotion
auto
+8 options supplémentaires dans l’application
Récupérez votre résultat
Vos résultats apparaîtront ici
Sous le capot
Vous souhaitez plus de contrôle ?
Cette application repose sur un workflow AI-Flow entièrement modifiable. Changez le modèle, les prompts, la disposition ou la résolution, ou connectez-le à d’autres étapes.
Voice
Wise_Woman
Text
Once upon a quiet evening, in a small town that most people passed without noticing, something unexpected was about to happen.
Speech 2.6 Turbo
Comment utiliser ce template
Étape 1 : Saisissez votre texte dans le nœud « Texte »
Dans le nœud « Texte », saisissez vos instructions.
Once upon a quiet evening, in a small town that most people passed without noticing, something unexpected was about to happen.
Étape 2 : Configurez le nœud « Voice »
Configurez le nœud « Voice » selon vos besoins.
Wise_Woman
Étape 3 : Exécutez le workflow
Cliquez sur le bouton « Exécuter » pour lancer le workflow et obtenir le résultat final.
Personnalisez le workflow sous-jacent
Ouvrez le workflow complet dans l’éditeur AI-Flow pour changer de modèle, réécrire les prompts ou le connecter à d’autres étapes.
À qui s’adresse ce template ?
Idéal pour les professionnels et les créateurs qui souhaitent simplifier leur workflow
Développeurs d’expériences vocales en temps réel
Créez des agents conversationnels, des assistants vocaux en direct et des applications interactives nécessitant une parole naturelle et à faible latence dans de nombreuses langues.
Équipes produit et designers UX
Ajoutez des messages audio dynamiques, des confirmations et des voix de marque à vos parcours produit, avec une qualité constante et une réponse rapide.
Équipes support, SVI et opérations
Alimentez des menus SVI multilingues, des transferts vers le support, des notifications de statut et des communications client automatisées.
Créateurs de contenu et marketeurs
Générez rapidement des voix off pour des démos, des explainers et des contenus sociaux ; clonez des voix pour une identité sonore cohérente.
Enseignants et équipes de formation
Produisez des tutoriels interactifs et des cours localisés dans plus de 40 langues, avec contrôle des émotions et sous-titres horodatés.
Prêt à créer ?
Commencez à utiliser cette application
Aucune configuration requise — ouvrez l’application et commencez à créer en quelques minutes
Vous aimerez peut-être aussi
Explorez d’autres templates puissants pour enrichir votre workflow IA

Génération musicale avec Music 1.5
Générez des chansons IA complètes, jusqu’à 4 minutes, avec des voix naturelles et une instrumentation riche à partir de vos paroles et d’un court prompt de style.

Synthèse vocale avec Speech 2.6 HD
MiniMax Speech 2.6 HD fournit une synthèse vocale multilingue de qualité studio, avec une prosodie nuancée, l’export de sous-titres, plus de 300 voix premium et le clonage vocal.

MiniMax H3 - Références vers vidéo
Générez des vidéos 2K à partir de références multimodales avec MiniMax H3. Guidez le sujet, le style, le mouvement et l’audio avec jusqu’à 9 images, 3 clips vidéo et 3 clips audio, cités par leur ordre dans votre prompt.

MiniMax H3 - De la première à la dernière image
Animez une première image en une vidéo 2K cohérente (5 à 15 s) avec MiniMax H3 : image de fin facultative, mouvement dirigé par le prompt et audio stéréo natif.

Générateur d’assets de jeu vidéo — du concept art au modèle 3D
Transformez une description en concept art optimisé pour la reconstruction et en asset 3D prêt pour le jeu (GLB + PBR) avec Rodin 2.5, en une seule exécution fluide.

Image vers 3D Rapide
Convertissez une simple photo de produit ou d’objet en modèle 3D léger et prêt pour le jeu, en quelques minutes, avec Rodin 2.5 Image to 3D (Fast).
Questions fréquentes
Qu’est-ce qui distingue Speech 2.6 Turbo de la variante HD ?
Turbo est réglé pour la faible latence et les interactions en temps réel, comme les bots vocaux ou les retours en direct dans une application. HD privilégie une fidélité maximale pour la narration longue et de qualité production, comme les livres audio et les voix off premium.
Combien de langues et de voix sont prises en charge ?
MiniMax prend en charge plus de 40 langues et dialectes, avec un renforcement linguistique optionnel. Vous pouvez choisir parmi plus de 300 voix sélectionnées ou utiliser un voice_id issu du modèle minimax/voice-cloning.
Comment contrôler le style et les émotions ?
Réglez l’émotion sur auto pour un ton déduit automatiquement, ou choisissez une émotion précise (joyeuse, calme, surprise, neutre, etc.). Vous pouvez ensuite ajuster la vitesse, la hauteur (−12 à +12 demi-tons) et le volume pour affiner l’interprétation.
Quels formats et réglages audio sont disponibles ?
Exportez l’audio en mp3, wav, flac ou pcm. Configurez sample_rate (8000 à 44100 Hz), channel (mono ou stéréo) et, pour le mp3, le débit (32k, 64k, 128k, 256k).
Puis-je insérer des pauses dans la parole ?
Oui. Utilisez des marqueurs en ligne du type <#0.5#> dans votre texte pour marquer une pause du nombre de secondes indiqué.
Les sous-titres ou horodatages sont-ils pris en charge ?
Activez subtitle_enable pour obtenir des horodatages au niveau de la phrase ainsi que des métadonnées de sous-titres (disponible en mode non streaming).
Quelle est la limite de caractères du texte en entrée ?
Vous pouvez transmettre jusqu’à 10 000 caractères en une seule requête.
Faut-il activer english_normalization ?
Activez-le si votre contenu anglais comporte des nombres, des dates ou du texte structuré qui gagnent à être normalisés. Cela peut ajouter une légère latence.
Qu’est-ce qu’AI-FLOW et comment peut-il m’aider ?
AI-FLOW est une plateforme d’IA tout-en-un qui vous permet de créer, d’intégrer et d’automatiser des workflows alimentés par l’IA grâce à une interface intuitive en glisser-déposer. Débutant ou expert, vous pouvez combiner plusieurs modèles d’IA pour créer des solutions innovantes sans écrire de code.
Un essai gratuit est-il disponible ?
Oui, AI-FLOW propose un essai gratuit pour commencer. Vous pouvez ensuite acheter des crédits selon vos besoins, sans abonnement ni engagement à long terme.
Puis-je intégrer mes clés API OpenAI, Replicate et d’autres fournisseurs dans la version Cloud d’AI-FLOW ?
Oui, vous pouvez facilement intégrer vos propres clés API à AI-FLOW. Les nœuds associés utiliseront alors votre clé, ce qui réduit considérablement votre consommation de crédits sur la plateforme.