Incruster des sous-titres dans une vidéo

Les sous-titres sont dessinés dans l'image, visibles partout, même sans lecteur compatible. Partez de la transcription automatique ou de votre fichier SRT.

Traitement 100 % local, rien n'est envoyé

Comment ça marche ?

Déposez votre vidéo, avec son fichier SRT ou VTT si vous l’avez déjà ; sinon, les sous-titres sont créés par transcription automatique, sans rien envoyer sur un serveur. Vérifiez et corrigez le texte dans la liste synchronisée.

Choisissez le style : Classique (texte blanc cerné de noir), Encadré (fond semi-transparent) ou Réseaux sociaux (gros mots au centre, mot prononcé surligné). Réglez police, taille, couleurs, contour et position : l’aperçu sur la vidéo est immédiat, identique au résultat.

Exportez en MP4 (H.264 et AAC), en 720p ou 1080p, au format d’origine ou en 9:16, 1:1 ou 4:5 : les sous-titres font partie de l’image, visibles sur toutes les plateformes et tous les lecteurs.

Exemples

Une vidéo de 3 minutes et son fichier SRT

Vidéo de 3 min et sous-titres existants : aucune transcription n’est nécessaire. L’export en 1080p produit un MP4 d’environ 185 Mo (8 Mbit/s), en 720p d’environ 115 Mo.

Passer d’un format paysage à un format vertical

Une vidéo 16:9 exportée en 9:16 avec « Image entière » garde toute l’image, avec des bandes noires en haut et en bas où les sous-titres restent lisibles ; avec « Remplir le cadre », l’image occupe tout l’écran, bords rognés.

Questions fréquentes

Incruster ou fournir un fichier SRT : que choisir ?
Le fichier SRT laisse le spectateur activer ou non les sous-titres, et leur texte est lu par les moteurs de recherche ; il faut une plateforme qui l’accepte. L’incrustation les rend visibles partout, y compris sur Instagram, TikTok et dans les messageries, mais ils ne peuvent plus être désactivés ni modifiés.
La transcription est-elle fiable ?
Elle repose sur Whisper, le modèle de reconnaissance vocale d’OpenAI, qui fonctionne bien en français avec une voix claire. Trois niveaux sont proposés : Rapide (un brouillon à relire attentivement), Équilibré et Précis (le plus fiable, qui demande WebGPU). Les noms propres, le jargon et les passages bruyants restent les principales sources d’erreurs : la transcription est automatique, relisez-la avant de la publier. La fonction « Rechercher et remplacer » corrige un nom mal transcrit partout d’un coup.
Y a-t-il une limite de durée ?
La transcription accepte des fichiers de 30 minutes au plus : au-delà, découpez la vidéo en parties. La vidéo avec sous-titres incrustés peut durer jusqu’à 10 minutes, car le fichier MP4 est créé dans la mémoire du navigateur. Les fichiers SRT, VTT et texte n’ont pas de limite.
Quels navigateurs permettent d’exporter la vidéo ?
L’export MP4 utilise la technologie WebCodecs, disponible dans les versions récentes de Chrome et Edge, de Firefox (130 ou plus) et de Safari (16.4 ou plus). L’encodage utilise l’accélération matérielle de votre ordinateur quand elle est disponible.
Ma vidéo ou mon texte sont-ils envoyés sur un serveur ?
Non. La transcription est faite par votre navigateur, sur votre appareil : votre vidéo, son son et le texte obtenu ne sont envoyés nulle part, contrairement à la plupart des outils de sous-titrage en ligne. Seul le modèle de reconnaissance vocale (Whisper) est téléchargé une fois, depuis Hugging Face, avec son moteur depuis jsDelivr, puis gardé en cache. Votre travail (texte et horaires, jamais la vidéo) est enregistré sur votre appareil pour pouvoir le reprendre.