La transcription automatique (speech-to-text) et la synthèse vocale (text-to-speech) open source sont aujourd'hui assez matures pour sous-titrer des cours, produire des supports accessibles et transcrire des entretiens — le tout en local et sans abonnement.
Longtemps réservées à des services cloud payants, la transcription de la parole et la génération de voix de synthèse se font désormais très bien avec des outils open source, gratuits et exécutables sur sa propre machine. Pour un formateur, c'est un gain de temps concret : sous-titrer une session enregistrée, fournir un verbatim, créer une voix off de module e-learning ou rendre un support accessible.
Points clés
- Transcription (STT) : Whisper et ses variantes rapides (faster-whisper, whisper.cpp) couvrent l'essentiel, en multilingue.
- Synthèse vocale (TTS) : Piper et Coqui TTS produisent des voix françaises naturelles, en local.
- Local et gratuit : pas d'abonnement, données qui ne quittent pas la machine (utile côté RGPD).
- Relecture indispensable : noms propres, chiffres et jargon technique doivent toujours être vérifiés.
À quoi ça sert en formation
Les cas d'usage sont nombreux : sous-titrer une captation de cours pour l'accessibilité (et le référencement des replays), produire un verbatim d'un entretien ou d'un atelier, générer une voix off pour un module e-learning, ou encore convertir un support écrit en audio pour de la révision. La transcription facilite aussi la prise de notes et la création de résumés à partir d'un enregistrement.
Transcrire la parole (speech-to-text)
La référence open source est Whisper (publié par OpenAI sous licence libre) : multilingue, robuste au bruit et au français, il transcrit très correctement la plupart des enregistrements. Pour de meilleures performances, on utilise plutôt ses réimplémentations : faster-whisper (basé sur CTranslate2, bien plus rapide et économe en mémoire) et whisper.cpp (optimisé pour tourner sur CPU, même sur une machine modeste).
Pour aller plus loin, WhisperX ajoute l'alignement temporel précis et la « diarisation » (qui parle quand), pratique pour des tables rondes. Côté ultra-léger et hors-ligne, Vosk fonctionne sur des appareils contraints (y compris mobiles) avec de petits modèles ; et NVIDIA NeMo vise les usages plus avancés sur GPU.
Donner de la voix (text-to-speech)
Pour transformer un texte en voix, Piper est devenu un incontournable : rapide, léger, exécutable en local, avec des voix françaises de bonne qualité — idéal pour une voix off de module. Coqui TTS (héritier de Mozilla TTS) offre un éventail de modèles et le clonage de voix pour des besoins plus poussés. Bark produit une parole très expressive (intonations, rires), au prix de plus de ressources, tandis qu'eSpeak NG reste une option minimaliste quand seule l'intelligibilité compte.
En pratique : sous-titrer un cours
Scénario. Vous avez enregistré une session de 2 h et voulez des sous-titres. Installez faster-whisper, lancez la transcription avec un modèle « medium » (CPU suffisant, plus rapide avec un GPU) en sortie .srt. Comptez quelques minutes de traitement, puis 20 à 30 minutes de relecture pour corriger les noms propres, sigles et termes techniques. Pour une voix off de rappel de cours, passez le script dans Piper avec une voix française : vous obtenez un fichier audio prêt à intégrer.
Les erreurs fréquentes
Quelques écueils reviennent souvent et coûtent du temps ou de la crédibilité :
- Diffuser une transcription sans relecture : les chiffres, noms propres et acronymes sont les plus souvent fautifs.
- Choisir un modèle trop lourd « par sécurité » alors qu'un modèle moyen suffit et va bien plus vite.
- Oublier le RGPD quand l'audio contient des données personnelles : préférez le traitement local et informez les personnes.
- Juger la qualité sur une seule langue : les performances varient selon la langue et la qualité du micro.
Pour aller plus loin
Pour approfondir, ces ressources complètent utilement cet article : Découvrir la transcription audio · Outils open source pour l'IA · Initier aux LLM sans budget cloud. Vous pouvez aussi parcourir l'annuaire d'outils pour les fiches détaillées.
Questions fréquentes
Whisper est-il vraiment gratuit ?
Oui : Whisper est publié en open source par OpenAI et s'exécute en local, sans coût d'API. Ses variantes faster-whisper et whisper.cpp sont elles aussi libres et gratuites ; vous ne payez que votre propre matériel.
Faut-il un GPU pour transcrire ?
Non pour débuter : whisper.cpp et faster-whisper tournent sur CPU, surtout avec des modèles petits ou moyens. Un GPU accélère nettement le traitement sur de longs enregistrements ou de gros modèles, mais n'est pas indispensable.
Quel outil pour une voix française naturelle ?
Piper offre un excellent rapport qualité/rapidité avec des voix françaises, en local. Pour des besoins plus expressifs ou du clonage de voix, regardez Coqui TTS ; pour une parole très expressive, Bark, plus gourmand.
Besoin d'un formateur expert ou envie de transmettre ?
tonformateur connecte les écoles et organismes de formation avec des intervenants experts du terrain.
Voir les cours à pourvoir Explorer l'annuaire d'outils →