ElevenLabs
ElevenLabs s’adresse aux organisations qui produisent ou reçoivent de l’audio en volume : réunions à transcrire, messages à enregistrer, accueil téléphonique à faire évoluer sans repasser au studio.
Les modèles disponibles
| Modèle | Identifiant d'API | Contexte | Ce qu'il fait |
|---|---|---|---|
| Eleven v3 | eleven_v3 | 5 000 caractères | Synthèse expressive en plus de 70 langues. Le choix par défaut pour un contenu enregistré. |
| Eleven v3 Conversational | eleven_v3_conversational | non publié | Version temps réel, environ 280 ms de latence, pour le dialogue. |
| Flash v2.5 | eleven_flash_v2_5 | 40 000 caractères | Environ 75 ms de latence et moitié prix, en 32 langues. Pour le volume et le direct. |
| Multilingual v2 | eleven_multilingual_v2 | 10 000 caractères | La génération stable, 29 langues, quand la régularité prime. |
| Scribe v2 | scribe_v2 | non publié | Transcription en plus de 90 langues, avec horodatage précis. |
| Scribe v2 Realtime | scribe_v2_realtime | non publié | Transcription en direct, environ 150 ms, avec séparation jusqu'à 32 locuteurs. |
| Eleven Music v2 | music_v2 | non publié | Génération musicale. |
| Text to Sound v2 | eleven_text_to_sound_v2 | non publié | Effets sonores à partir d'une description. |
Liste vérifiée le 7 septembre 2026 dans la documentation de l'éditeur. Les catalogues de modèles changent vite : reportez-vous à elle avant de vous engager.
Services et endpoints
Text to Speech
Synthèse à partir d'un texte et d'une voix choisie. Le service principal.
Speech to Text
Transcription de fichiers, avec repérage des entités citées.
Text to Dialogue
Dialogues à plusieurs personnages dans un seul appel, au lieu d'assembler des pistes à la main.
WebSocket
Diffusion audio au fil de la génération, pour ne pas attendre la fin de la phrase.
Changement de voix
Rejouer un enregistrement existant avec une autre voix, en gardant l'intonation d'origine.
L'avis de Bienfait
ElevenLabs est la seule fiche de ce catalogue qui ne produit pas de texte. Elle y figure parce que la voix arrive dans les projets par une porte qu'on n'attendait pas : le compte rendu.
Transcrire d'abord, c'est là que ça sert
Nos clients accumulent des heures de réunions et d'entretiens enregistrés. Scribe les transcrit avec la séparation des locuteurs, un modèle de texte en tire les décisions et les actions, puis la base range le tout. Personne ne relit l'enregistrement ; on lit six lignes structurées.
La séparation des locuteurs est ce qui rend le résultat utilisable : « qui a dit quoi » est justement l'information qu'un compte rendu doit porter, celle qu'une transcription à plat détruit.
La synthèse, en second
Elle sert moins souvent et sur des cas précis : un message d'accueil téléphonique qui change chaque semaine, la version audio d'un article, un serveur vocal qui lit une information tirée de la base. Le modèle rapide suffit presque toujours : sur un message de dix secondes, la différence de finesse ne s'entend pas et le prix est divisé par deux.
La règle que nous posons systématiquement
Une voix synthétique s'annonce. Nous refusons les montages où un client fait passer une voix générée pour un collaborateur au téléphone. Cette position se discute au cadrage, pas après la mise en ligne. Le clonage de voix, en particulier, ne se fait qu'avec l'accord écrit de la personne dont la voix est reprise.
C'est une limite que nous nous imposons, pas une contrainte technique de l'outil.
Rencontrez notre équipe d'experts.
Discutez de votre projet ElevenLabs avec nos experts, sans engagement.