Générer un fichier SRT à partir d'une vidéo

Déposez votre vidéo : un fichier de sous-titres SRT, synchronisé à la parole et découpé selon les règles de lisibilité, est créé sur votre appareil.

Traitement 100 % local, rien n'est envoyé

Comment ça marche ?

Déposez votre vidéo : la parole est transcrite localement, mot par mot, puis découpée en sous-titres selon les règles professionnelles : 42 caractères par ligne, deux lignes au plus, de 1 à 7 secondes d’affichage, coupures de préférence après une ponctuation et jamais après un article.

Chaque sous-titre dont la vitesse de lecture dépasse 17 caractères par seconde est signalé : raccourcissez-le ou allongez son affichage. Les règles se modifient, et le bouton « Redécouper » les applique à tout le fichier.

Téléchargez enfin le fichier .srt (UTF-8), prêt pour YouTube, Facebook, VLC, Premiere Pro ou DaVinci Resolve, ou sa version WebVTT.

Exemples

Un tutoriel de 8 minutes

8 min de parole continue donnent environ 130 sous-titres et un fichier SRT d’une douzaine de Ko. Nommez-le comme la vidéo (tutoriel.srt à côté de tutoriel.mp4) : VLC l’affiche alors automatiquement.

Corriger la vitesse de lecture

Un sous-titre de 60 caractères affiché 3 s se lit à 20 caractères par seconde : il est signalé. En supprimant 9 caractères superflus, il passe à 17 car./s, la limite recommandée.

Questions fréquentes

La transcription est-elle fiable ?
Elle repose sur Whisper, le modèle de reconnaissance vocale d’OpenAI, qui fonctionne bien en français avec une voix claire. Trois niveaux sont proposés : Rapide (un brouillon à relire attentivement), Équilibré et Précis (le plus fiable, qui demande WebGPU). Les noms propres, le jargon et les passages bruyants restent les principales sources d’erreurs : la transcription est automatique, relisez-la avant de la publier. La fonction « Rechercher et remplacer » corrige un nom mal transcrit partout d’un coup.
Quelle différence entre SRT et VTT ?
Les deux contiennent les mêmes informations : un numéro ou un identifiant, l’heure de début et de fin, puis le texte. Le SRT (SubRip) est le plus répandu : YouTube, Facebook, VLC, Premiere Pro, DaVinci Resolve. Le WebVTT (.vtt) est le format des sites web (balise <track>) et de Vimeo ; il utilise un point avant les millisecondes au lieu d’une virgule, et commence par la ligne « WEBVTT ».
Combien de temps prend la transcription ?
Cela dépend de votre appareil et du niveau choisi ; la durée estimée est affichée avant de lancer. Avec WebGPU (Chrome ou Edge récents sur ordinateur), une minute de parole demande de quelques secondes à environ une minute. Sans WebGPU, seul le processeur travaille : c’est plus lent, mais cela fonctionne. Le modèle est téléchargé une seule fois (de 80 à 600 Mo selon le niveau), puis gardé par votre navigateur.
Ma vidéo ou mon texte sont-ils envoyés sur un serveur ?
Non. La transcription est faite par votre navigateur, sur votre appareil : votre vidéo, son son et le texte obtenu ne sont envoyés nulle part, contrairement à la plupart des outils de sous-titrage en ligne. Seul le modèle de reconnaissance vocale (Whisper) est téléchargé une fois, depuis Hugging Face, avec son moteur depuis jsDelivr, puis gardé en cache. Votre travail (texte et horaires, jamais la vidéo) est enregistré sur votre appareil pour pouvoir le reprendre.