Transcrire une heure d’entretien à la main, c’est trois heures de travail. L’IA a rendu cette corvée obsolète — et la vraie question n’est plus « est-ce que ça marche », mais « faut-il payer pour ça ». Réponse courte : souvent non. Voici où passe la frontière.
D’abord, la solution gratuite : Whisper
Whisper, le modèle qui a tout changé
Publié en libre accès par OpenAI, Whisper transcrit le français avec une qualité qui rivalise avec les services payants. Il tourne sur votre propre ordinateur, gratuitement et hors ligne — donc rien ne part sur un serveur, ce qui règle la question de la confidentialité pour un entretien sensible. Nos mesures sur une machine de bureau récente : environ 37 minutes de calcul pour une heure d’audio dans la meilleure qualité, et bien plus vite avec une carte graphique. Le prix à payer est ailleurs : il faut l’installer, et vous ressortez avec du texte brut, sans horodatage exploitable ni outil de correction.
Quand un service payant devient le bon choix
HappyScribe — transcription, sous-titres et traduction
Ce que vous achetez ici, ce n’est pas la reconnaissance vocale : c’est tout ce qu’il y a autour. Un éditeur où le texte défile en même temps que l’audio, ce qui rend la correction rapide au lieu de pénible. Des sous-titres calés sur l’image, exportables aux formats attendus par YouTube ou un logiciel de montage. La traduction, et surtout l’option de relecture par des linguistes quand l’exactitude engage votre responsabilité — un procès-verbal, un sous-titrage diffusé. L’entreprise est basée à Barcelone depuis 2017 et affiche 4,7 sur 5 sur près de 1 400 avis Trustpilot, ce qui en fait l’une des mieux notées de sa catégorie. Comptez quelques euros par heure d’audio pour l’IA seule, davantage avec relecture humaine.
Comment choisir en trente secondes
Posez-vous une seule question : qu’allez-vous faire du texte ? Si c’est pour retrouver une info, nourrir vos notes ou garder une trace, Whisper en local suffit et ne vous coûtera rien. Si le résultat doit être publié — sous-titres d’une vidéo, compte rendu diffusé, contenu traduit — le temps que vous passeriez à recaler et corriger dépasse vite le prix d’un service qui le fait pour vous. Et pour un enregistrement confidentiel, la question ne se pose même pas : gardez-le sur votre machine.
Questions fréquentes
La transcription automatique est-elle fiable en français ?
Oui, nettement plus qu’il y a deux ans. Sur un audio net et un seul locuteur, le texte est exploitable presque tel quel. Les erreurs se concentrent sur les noms propres, les sigles et la ponctuation — d’où l’intérêt d’un éditeur pour corriger vite, ou d’une relecture humaine quand l’exactitude compte.
Faut-il un ordinateur puissant pour Whisper ?
Pas forcément. Il fonctionne sur un processeur récent sans carte graphique dédiée : dans nos essais, une heure d’audio demande environ 37 minutes de calcul en qualité maximale. Avec une carte graphique, ce temps s’effondre. C’est donc surtout une question de patience, pas de matériel hors de prix.
Quelle solution pour des enregistrements confidentiels ?
Une transcription locale, sans hésiter. Un entretien médical, juridique ou couvert par un accord de confidentialité ne devrait transiter par aucun serveur tiers, quelle que soit la réputation du prestataire. Whisper existe précisément pour ces cas-là.
Peut-on obtenir des sous-titres automatiquement ?
Oui, mais c’est là que les services en ligne prennent l’avantage. Un moteur brut vous donne du texte ; un service dédié produit des sous-titres découpés et calés sur l’image, exportables en SRT ou VTT, avec un éditeur pour ajuster les décalages.



