Aller au contenu

ElevenLabs

Voix Transcription Automatisation
Réserver un appel → Site Documentation API
Description

ElevenLabs s’adresse aux organisations qui produisent ou reçoivent de l’audio en volume : réunions à transcrire, messages à enregistrer, accueil téléphonique à faire évoluer sans repasser au studio.

Les modèles disponibles

Modèle Identifiant d'API Contexte Ce qu'il fait
Eleven v3 eleven_v3 5 000 caractères Synthèse expressive en plus de 70 langues. Le choix par défaut pour un contenu enregistré.
Eleven v3 Conversational eleven_v3_conversational non publié Version temps réel, environ 280 ms de latence, pour le dialogue.
Flash v2.5 eleven_flash_v2_5 40 000 caractères Environ 75 ms de latence et moitié prix, en 32 langues. Pour le volume et le direct.
Multilingual v2 eleven_multilingual_v2 10 000 caractères La génération stable, 29 langues, quand la régularité prime.
Scribe v2 scribe_v2 non publié Transcription en plus de 90 langues, avec horodatage précis.
Scribe v2 Realtime scribe_v2_realtime non publié Transcription en direct, environ 150 ms, avec séparation jusqu'à 32 locuteurs.
Eleven Music v2 music_v2 non publié Génération musicale.
Text to Sound v2 eleven_text_to_sound_v2 non publié Effets sonores à partir d'une description.

Liste vérifiée le 7 septembre 2026 dans la documentation de l'éditeur. Les catalogues de modèles changent vite : reportez-vous à elle avant de vous engager.

Services et endpoints

Text to Speech

Synthèse à partir d'un texte et d'une voix choisie. Le service principal.

Speech to Text

Transcription de fichiers, avec repérage des entités citées.

Text to Dialogue

Dialogues à plusieurs personnages dans un seul appel, au lieu d'assembler des pistes à la main.

WebSocket

Diffusion audio au fil de la génération, pour ne pas attendre la fin de la phrase.

Changement de voix

Rejouer un enregistrement existant avec une autre voix, en gardant l'intonation d'origine.

L'avis de Bienfait

ElevenLabs est la seule fiche de ce catalogue qui ne produit pas de texte. Elle y figure parce que la voix arrive dans les projets par une porte qu'on n'attendait pas : le compte rendu.

Transcrire d'abord, c'est là que ça sert

Nos clients accumulent des heures de réunions et d'entretiens enregistrés. Scribe les transcrit avec la séparation des locuteurs, un modèle de texte en tire les décisions et les actions, puis la base range le tout. Personne ne relit l'enregistrement ; on lit six lignes structurées.

La séparation des locuteurs est ce qui rend le résultat utilisable : « qui a dit quoi » est justement l'information qu'un compte rendu doit porter, celle qu'une transcription à plat détruit.

La synthèse, en second

Elle sert moins souvent et sur des cas précis : un message d'accueil téléphonique qui change chaque semaine, la version audio d'un article, un serveur vocal qui lit une information tirée de la base. Le modèle rapide suffit presque toujours : sur un message de dix secondes, la différence de finesse ne s'entend pas et le prix est divisé par deux.

La règle que nous posons systématiquement

Une voix synthétique s'annonce. Nous refusons les montages où un client fait passer une voix générée pour un collaborateur au téléphone. Cette position se discute au cadrage, pas après la mise en ligne. Le clonage de voix, en particulier, ne se fait qu'avec l'accord écrit de la personne dont la voix est reprise.

C'est une limite que nous nous imposons, pas une contrainte technique de l'outil.

Passons à l'action

Rencontrez notre équipe d'experts.

Discutez de votre projet ElevenLabs avec nos experts, sans engagement.

Réserver un appel → Voir tous les modèles d'IA
Newsletter
BienVu, notre newsletter

Un cas concret de donnée ou d'automatisation, deux fois par mois.

Deux envois par mois, pas un de plus. Désinscription en un clic.

Intégrations Modèles d'IA Outils Nous rejoindre
Réserver un appel Accéder au Salon

Nantes · Marseille · Paris. Réponse sous 24 h ouvrées.