Sous-titres style TikTok automatiques

Le style des vidéos virales : quelques mots à la fois, au centre de l'image, le mot prononcé surligné dans la couleur de votre choix. Export MP4 en 9:16.

Traitement 100 % local, rien n'est envoyé

Comment ça marche ?

Déposez votre vidéo : elle est transcrite dans votre navigateur, chaque mot avec son horodatage. Le style « Réseaux sociaux » affiche 1 à 3 mots à la fois, en gros caractères au centre de l’image, et surligne le mot prononcé dans la couleur de votre choix, au rythme de la voix.

Le format 9:16 (1080 × 1920) est appliqué, image recadrée pour remplir l’écran ; vous pouvez revenir au format d’origine. Choisissez la police (Anton par défaut), la taille, les couleurs, le contour et la hauteur du texte, avec un aperçu immédiat.

Corrigez les mots mal reconnus avant l’export : la surbrillance suit automatiquement le texte corrigé. Exportez en MP4, prêt pour TikTok, Instagram Reels et YouTube Shorts.

Exemples

Un Reel de 45 secondes

45 s de parole, soit environ 110 mots, affichés deux par deux : environ 55 groupes à l’écran, chacun avec son mot surligné. L’export 1080p pèse environ 46 Mo.

Un mot par mot pour un rythme rapide

Avec « 1 mot à la fois » et une taille de 120 px, chaque mot s’affiche seul au centre de l’écran : l’effet le plus dynamique, adapté aux vidéos de moins de 30 secondes.

Questions fréquentes

Comment le mot prononcé est-il synchronisé ?
La transcription horodate chaque mot (et non chaque phrase) grâce à l’alignement de Whisper. Si vous corrigez un mot, il garde l’horaire du mot remplacé ; les mots ajoutés se répartissent entre leurs voisins. La précision est de l’ordre du dixième de seconde.
La transcription est-elle fiable ?
Elle repose sur Whisper, le modèle de reconnaissance vocale d’OpenAI, qui fonctionne bien en français avec une voix claire. Trois niveaux sont proposés : Rapide (un brouillon à relire attentivement), Équilibré et Précis (le plus fiable, qui demande WebGPU). Les noms propres, le jargon et les passages bruyants restent les principales sources d’erreurs : la transcription est automatique, relisez-la avant de la publier. La fonction « Rechercher et remplacer » corrige un nom mal transcrit partout d’un coup.
Combien de temps prend la transcription ?
Cela dépend de votre appareil et du niveau choisi ; la durée estimée est affichée avant de lancer. Avec WebGPU (Chrome ou Edge récents sur ordinateur), une minute de parole demande de quelques secondes à environ une minute. Sans WebGPU, seul le processeur travaille : c’est plus lent, mais cela fonctionne. Le modèle est téléchargé une seule fois (de 80 à 600 Mo selon le niveau), puis gardé par votre navigateur.
Y a-t-il une limite de durée ?
La transcription accepte des fichiers de 30 minutes au plus : au-delà, découpez la vidéo en parties. La vidéo avec sous-titres incrustés peut durer jusqu’à 10 minutes, car le fichier MP4 est créé dans la mémoire du navigateur. Les fichiers SRT, VTT et texte n’ont pas de limite.
Ma vidéo ou mon texte sont-ils envoyés sur un serveur ?
Non. La transcription est faite par votre navigateur, sur votre appareil : votre vidéo, son son et le texte obtenu ne sont envoyés nulle part, contrairement à la plupart des outils de sous-titrage en ligne. Seul le modèle de reconnaissance vocale (Whisper) est téléchargé une fois, depuis Hugging Face, avec son moteur depuis jsDelivr, puis gardé en cache. Votre travail (texte et horaires, jamais la vidéo) est enregistré sur votre appareil pour pouvoir le reprendre.