Ajouter des sous-titres à une vidéo

Déposez votre vidéo : les sous-titres sont générés dans votre navigateur, synchronisés à la parole. Corrigez-les, puis exportez en SRT ou incrustez-les.

Traitement 100 % local, rien n'est envoyé

Comment ça marche ?

Déposez votre vidéo (MP4, WebM ou MOV). Choisissez le niveau de transcription : la durée estimée et la taille du modèle à télécharger sont affichées avant de lancer. La parole est reconnue dans votre navigateur : contrairement aux outils en ligne habituels, votre vidéo n’est envoyée à aucun serveur.

Les sous-titres apparaissent à droite, synchronisés avec la vidéo : le sous-titre en cours est surligné, et un clic sur un sous-titre place la lecture à ce moment. Corrigez le texte, ajustez le début et la fin, scindez ou fusionnez.

Deux façons d’ajouter les sous-titres : exporter un fichier SRT à téléverser avec la vidéo (YouTube, Facebook, LinkedIn, Vimeo), ou exporter une vidéo MP4 aux sous-titres incrustés, visibles partout, y compris sur Instagram et TikTok.

Exemples

Une vidéo YouTube de 5 minutes

5 min de présentation face caméra donnent environ 80 sous-titres. Le fichier SRT (environ 7 Ko) est ajouté dans YouTube Studio › Sous-titres : les spectateurs peuvent les activer ou non, et le texte est indexé par YouTube.

Une vidéo LinkedIn regardée sans le son

Une vidéo de 90 s, sous-titres incrustés en style Encadré, exportée en 1080p : le fichier MP4 pèse environ 93 Mo (8 Mbit/s). Les sous-titres restent visibles même en lecture automatique sans le son.

Questions fréquentes

La transcription est-elle fiable ?
Elle repose sur Whisper, le modèle de reconnaissance vocale d’OpenAI, qui fonctionne bien en français avec une voix claire. Trois niveaux sont proposés : Rapide (un brouillon à relire attentivement), Équilibré et Précis (le plus fiable, qui demande WebGPU). Les noms propres, le jargon et les passages bruyants restent les principales sources d’erreurs : la transcription est automatique, relisez-la avant de la publier. La fonction « Rechercher et remplacer » corrige un nom mal transcrit partout d’un coup.
Combien de temps prend la transcription ?
Cela dépend de votre appareil et du niveau choisi ; la durée estimée est affichée avant de lancer. Avec WebGPU (Chrome ou Edge récents sur ordinateur), une minute de parole demande de quelques secondes à environ une minute. Sans WebGPU, seul le processeur travaille : c’est plus lent, mais cela fonctionne. Le modèle est téléchargé une seule fois (de 80 à 600 Mo selon le niveau), puis gardé par votre navigateur.
Quelle différence entre SRT et VTT ?
Les deux contiennent les mêmes informations : un numéro ou un identifiant, l’heure de début et de fin, puis le texte. Le SRT (SubRip) est le plus répandu : YouTube, Facebook, VLC, Premiere Pro, DaVinci Resolve. Le WebVTT (.vtt) est le format des sites web (balise <track>) et de Vimeo ; il utilise un point avant les millisecondes au lieu d’une virgule, et commence par la ligne « WEBVTT ».
Y a-t-il une limite de durée ?
La transcription accepte des fichiers de 30 minutes au plus : au-delà, découpez la vidéo en parties. La vidéo avec sous-titres incrustés peut durer jusqu’à 10 minutes, car le fichier MP4 est créé dans la mémoire du navigateur. Les fichiers SRT, VTT et texte n’ont pas de limite.
Ma vidéo ou mon texte sont-ils envoyés sur un serveur ?
Non. La transcription est faite par votre navigateur, sur votre appareil : votre vidéo, son son et le texte obtenu ne sont envoyés nulle part, contrairement à la plupart des outils de sous-titrage en ligne. Seul le modèle de reconnaissance vocale (Whisper) est téléchargé une fois, depuis Hugging Face, avec son moteur depuis jsDelivr, puis gardé en cache. Votre travail (texte et horaires, jamais la vidéo) est enregistré sur votre appareil pour pouvoir le reprendre.