Transcrire une vidéo en texte

Obtenez le texte de ce qui est dit dans une vidéo : réunion, cours, interview. La reconnaissance vocale tourne sur votre appareil, sans serveur.

Traitement 100 % local, rien n'est envoyé

Comment ça marche ?

Déposez la vidéo : la piste son est extraite et analysée sur votre appareil. Une détection de la parole ne garde que les passages parlés, puis le modèle Whisper les transcrit. Aucun fichier, aucun texte n’est envoyé sur un serveur : vous pouvez transcrire une réunion ou un entretien confidentiel.

Le texte s’affiche phrase par phrase, synchronisé avec la vidéo : cliquez sur une phrase pour réécouter le passage, corrigez-la directement, et utilisez « Rechercher et remplacer » pour les noms propres mal reconnus.

Exportez en texte brut (phrases à la suite, un paragraphe à chaque longue pause), en texte horodaté (une ligne par phrase, précédée de son heure), ou copiez le texte dans le presse-papiers.

Exemples

Un cours enregistré de 20 minutes

Un cours de 20 min, dont 17 min de parole, donne un texte d’environ 2 500 mots, soit 5 pages. Au niveau Précis sur un ordinateur récent avec WebGPU, comptez de 5 à 20 minutes de traitement ; au niveau Équilibré, de 3 à 15 minutes.

Retrouver une citation dans une interview

Dans une interview vidéo de 45 min, l’export horodaté indique « [00:31:12] … » devant la phrase recherchée : il suffit d’aller à 31 min 12 s dans la vidéo pour la réentendre.

Questions fréquentes

La transcription est-elle fiable ?
Elle repose sur Whisper, le modèle de reconnaissance vocale d’OpenAI, qui fonctionne bien en français avec une voix claire. Trois niveaux sont proposés : Rapide (un brouillon à relire attentivement), Équilibré et Précis (le plus fiable, qui demande WebGPU). Les noms propres, le jargon et les passages bruyants restent les principales sources d’erreurs : la transcription est automatique, relisez-la avant de la publier. La fonction « Rechercher et remplacer » corrige un nom mal transcrit partout d’un coup.
Combien de temps prend la transcription ?
Cela dépend de votre appareil et du niveau choisi ; la durée estimée est affichée avant de lancer. Avec WebGPU (Chrome ou Edge récents sur ordinateur), une minute de parole demande de quelques secondes à environ une minute. Sans WebGPU, seul le processeur travaille : c’est plus lent, mais cela fonctionne. Le modèle est téléchargé une seule fois (de 80 à 600 Mo selon le niveau), puis gardé par votre navigateur.
Puis-je transcrire une vidéo en anglais ou dans une autre langue ?
Oui. Le français est choisi par défaut, mais vous pouvez sélectionner l’anglais, l’espagnol, l’allemand, l’italien et une dizaine d’autres langues, ou laisser l’outil détecter la langue automatiquement. Le texte est transcrit dans la langue parlée (pas de traduction).
Y a-t-il une limite de durée ?
La transcription accepte des fichiers de 30 minutes au plus : au-delà, découpez la vidéo en parties. La vidéo avec sous-titres incrustés peut durer jusqu’à 10 minutes, car le fichier MP4 est créé dans la mémoire du navigateur. Les fichiers SRT, VTT et texte n’ont pas de limite.
Ma vidéo ou mon texte sont-ils envoyés sur un serveur ?
Non. La transcription est faite par votre navigateur, sur votre appareil : votre vidéo, son son et le texte obtenu ne sont envoyés nulle part, contrairement à la plupart des outils de sous-titrage en ligne. Seul le modèle de reconnaissance vocale (Whisper) est téléchargé une fois, depuis Hugging Face, avec son moteur depuis jsDelivr, puis gardé en cache. Votre travail (texte et horaires, jamais la vidéo) est enregistré sur votre appareil pour pouvoir le reprendre.