Transcrire un audio en texte

Podcast, note vocale, interview : déposez le fichier audio, la parole est transcrite en texte dans votre navigateur, avec horodatage si besoin.

Traitement 100 % local, rien n'est envoyé

Comment ça marche ?

Déposez votre fichier audio (MP3, WAV ou M4A, jusqu’à 500 Mo et 30 minutes) ou une vidéo. La reconnaissance vocale Whisper s’exécute dans votre navigateur : l’enregistrement ne quitte jamais votre appareil, ce qui convient aux notes vocales, entretiens et réunions confidentiels.

Les silences et la musique sont écartés avant la transcription, ce qui l’accélère et évite que du texte soit inventé pendant les blancs. Pendant la relecture, le son est lu en même temps que le texte : cliquez sur une phrase pour la réécouter et la corriger.

Téléchargez le résultat en texte brut, en texte horodaté, ou en sous-titres SRT si vous comptez l’associer à une vidéo.

Exemples

Un épisode de podcast de 30 minutes

Un épisode de 30 min (la limite de l’outil), dont 28 min de parole, représente environ 4 200 mots. Le texte brut sert de base à un article de blog ou à la description de l’épisode.

Une note vocale de 2 minutes

Une note vocale de 2 min est transcrite en quelques dizaines de secondes avec WebGPU, une fois le modèle téléchargé. Le résultat, environ 280 mots, se copie en un clic.

Questions fréquentes

La transcription est-elle fiable ?
Elle repose sur Whisper, le modèle de reconnaissance vocale d’OpenAI, qui fonctionne bien en français avec une voix claire. Trois niveaux sont proposés : Rapide (un brouillon à relire attentivement), Équilibré et Précis (le plus fiable, qui demande WebGPU). Les noms propres, le jargon et les passages bruyants restent les principales sources d’erreurs : la transcription est automatique, relisez-la avant de la publier. La fonction « Rechercher et remplacer » corrige un nom mal transcrit partout d’un coup.
Combien de temps prend la transcription ?
Cela dépend de votre appareil et du niveau choisi ; la durée estimée est affichée avant de lancer. Avec WebGPU (Chrome ou Edge récents sur ordinateur), une minute de parole demande de quelques secondes à environ une minute. Sans WebGPU, seul le processeur travaille : c’est plus lent, mais cela fonctionne. Le modèle est téléchargé une seule fois (de 80 à 600 Mo selon le niveau), puis gardé par votre navigateur.
Quels formats audio sont acceptés ?
Les fichiers MP3, WAV et M4A (AAC), ainsi que le son des vidéos MP4, WebM et MOV. Les notes vocales de l’iPhone (M4A) et la plupart des enregistreurs fonctionnent directement. Pour un autre format, convertissez-le d’abord en MP3.
Y a-t-il une limite de durée ?
La transcription accepte des fichiers de 30 minutes au plus : au-delà, découpez la vidéo en parties. La vidéo avec sous-titres incrustés peut durer jusqu’à 10 minutes, car le fichier MP4 est créé dans la mémoire du navigateur. Les fichiers SRT, VTT et texte n’ont pas de limite.
Ma vidéo ou mon texte sont-ils envoyés sur un serveur ?
Non. La transcription est faite par votre navigateur, sur votre appareil : votre vidéo, son son et le texte obtenu ne sont envoyés nulle part, contrairement à la plupart des outils de sous-titrage en ligne. Seul le modèle de reconnaissance vocale (Whisper) est téléchargé une fois, depuis Hugging Face, avec son moteur depuis jsDelivr, puis gardé en cache. Votre travail (texte et horaires, jamais la vidéo) est enregistré sur votre appareil pour pouvoir le reprendre.