tonformateur
Outils & veille

Outils de transcription et de voix

📅 Publié le 20/06/2026·tonformateur
← Toutes les ressources

La transcription automatique (speech-to-text) et la synthèse vocale (text-to-speech) open source sont aujourd'hui assez matures pour sous-titrer des cours, produire des supports accessibles et transcrire des entretiens — le tout en local et sans abonnement.

Longtemps réservées à des services cloud payants, la transcription de la parole et la génération de voix de synthèse se font désormais très bien avec des outils open source, gratuits et exécutables sur sa propre machine. Pour un formateur, c'est un gain de temps concret : sous-titrer une session enregistrée, fournir un verbatim, créer une voix off de module e-learning ou rendre un support accessible.

Points clés

Sommaire
  1. À quoi ça sert en formation
  2. Transcrire la parole (speech-to-text)
  3. Donner de la voix (text-to-speech)
  4. En pratique : sous-titrer un cours
  5. Les erreurs fréquentes
  6. Pour aller plus loin

À quoi ça sert en formation

Les cas d'usage sont nombreux : sous-titrer une captation de cours pour l'accessibilité (et le référencement des replays), produire un verbatim d'un entretien ou d'un atelier, générer une voix off pour un module e-learning, ou encore convertir un support écrit en audio pour de la révision. La transcription facilite aussi la prise de notes et la création de résumés à partir d'un enregistrement.

Transcrire la parole (speech-to-text)

La référence open source est Whisper (publié par OpenAI sous licence libre) : multilingue, robuste au bruit et au français, il transcrit très correctement la plupart des enregistrements. Pour de meilleures performances, on utilise plutôt ses réimplémentations : faster-whisper (basé sur CTranslate2, bien plus rapide et économe en mémoire) et whisper.cpp (optimisé pour tourner sur CPU, même sur une machine modeste).

Pour aller plus loin, WhisperX ajoute l'alignement temporel précis et la « diarisation » (qui parle quand), pratique pour des tables rondes. Côté ultra-léger et hors-ligne, Vosk fonctionne sur des appareils contraints (y compris mobiles) avec de petits modèles ; et NVIDIA NeMo vise les usages plus avancés sur GPU.

Donner de la voix (text-to-speech)

Pour transformer un texte en voix, Piper est devenu un incontournable : rapide, léger, exécutable en local, avec des voix françaises de bonne qualité — idéal pour une voix off de module. Coqui TTS (héritier de Mozilla TTS) offre un éventail de modèles et le clonage de voix pour des besoins plus poussés. Bark produit une parole très expressive (intonations, rires), au prix de plus de ressources, tandis qu'eSpeak NG reste une option minimaliste quand seule l'intelligibilité compte.

En pratique : sous-titrer un cours

Scénario. Vous avez enregistré une session de 2 h et voulez des sous-titres. Installez faster-whisper, lancez la transcription avec un modèle « medium » (CPU suffisant, plus rapide avec un GPU) en sortie .srt. Comptez quelques minutes de traitement, puis 20 à 30 minutes de relecture pour corriger les noms propres, sigles et termes techniques. Pour une voix off de rappel de cours, passez le script dans Piper avec une voix française : vous obtenez un fichier audio prêt à intégrer.

Les erreurs fréquentes

Quelques écueils reviennent souvent et coûtent du temps ou de la crédibilité :

Pour aller plus loin

Pour approfondir, ces ressources complètent utilement cet article : Découvrir la transcription audio · Outils open source pour l'IA · Initier aux LLM sans budget cloud. Vous pouvez aussi parcourir l'annuaire d'outils pour les fiches détaillées.

Tags#IA#Open source#Accessibilité

Questions fréquentes

Whisper est-il vraiment gratuit ?

Oui : Whisper est publié en open source par OpenAI et s'exécute en local, sans coût d'API. Ses variantes faster-whisper et whisper.cpp sont elles aussi libres et gratuites ; vous ne payez que votre propre matériel.

Faut-il un GPU pour transcrire ?

Non pour débuter : whisper.cpp et faster-whisper tournent sur CPU, surtout avec des modèles petits ou moyens. Un GPU accélère nettement le traitement sur de longs enregistrements ou de gros modèles, mais n'est pas indispensable.

Quel outil pour une voix française naturelle ?

Piper offre un excellent rapport qualité/rapidité avec des voix françaises, en local. Pour des besoins plus expressifs ou du clonage de voix, regardez Coqui TTS ; pour une parole très expressive, Bark, plus gourmand.

Besoin d'un formateur expert ou envie de transmettre ?

tonformateur connecte les écoles et organismes de formation avec des intervenants experts du terrain.

Voir les cours à pourvoir Explorer l'annuaire d'outils →