Sous-titres automatiques gratuits

Déposez une vidéo : la parole est transcrite dans votre navigateur, découpée en sous-titres lisibles, puis vous corrigez et exportez. Aucun serveur.

Traitement 100 % local, rien n'est envoyé

Comment ça marche ?

Déposez votre vidéo ou votre fichier audio, choisissez un niveau de transcription et la langue (français par défaut), puis lancez. La reconnaissance vocale Whisper s’exécute dans votre navigateur : seuls les passages parlés sont transcrits, grâce à une détection de la parole qui ignore silences et musique, et chaque mot est horodaté.

Le texte est ensuite découpé en sous-titres lisibles : 42 caractères par ligne, deux lignes au plus, durée d’affichage de 1 à 7 secondes. Une alerte signale les sous-titres trop rapides à lire (plus de 17 caractères par seconde). Ces règles sont modifiables.

Corrigez dans la liste à droite, synchronisée avec la lecture : texte, début et fin, scinder, fusionner, rechercher et remplacer. Exportez enfin en SRT, WebVTT, en texte, ou en vidéo MP4 avec sous-titres incrustés.

Exemples

Une interview de 3 minutes

Une interview de 3 min, dont 2 min 40 s de parole, donne environ 50 sous-titres. Au niveau Équilibré, le modèle (environ 320 Mo) est téléchargé une fois ; la transcription prend ensuite de 30 secondes à 3 minutes selon l’ordinateur. Le fichier SRT pèse moins de 5 Ko.

Un tutoriel de 12 minutes avec musique

Un tutoriel de 12 min, dont 2 min de musique d’introduction et de fin : seules les 10 minutes de parole sont transcrites. Le nom du logiciel, mal reconnu à 14 reprises, est corrigé en une fois avec « Rechercher et remplacer ».

Questions fréquentes

La transcription est-elle fiable ?
Elle repose sur Whisper, le modèle de reconnaissance vocale d’OpenAI, qui fonctionne bien en français avec une voix claire. Trois niveaux sont proposés : Rapide (un brouillon à relire attentivement), Équilibré et Précis (le plus fiable, qui demande WebGPU). Les noms propres, le jargon et les passages bruyants restent les principales sources d’erreurs : la transcription est automatique, relisez-la avant de la publier. La fonction « Rechercher et remplacer » corrige un nom mal transcrit partout d’un coup.
Combien de temps prend la transcription ?
Cela dépend de votre appareil et du niveau choisi ; la durée estimée est affichée avant de lancer. Avec WebGPU (Chrome ou Edge récents sur ordinateur), une minute de parole demande de quelques secondes à environ une minute. Sans WebGPU, seul le processeur travaille : c’est plus lent, mais cela fonctionne. Le modèle est téléchargé une seule fois (de 80 à 600 Mo selon le niveau), puis gardé par votre navigateur.
Y a-t-il une limite de durée ?
La transcription accepte des fichiers de 30 minutes au plus : au-delà, découpez la vidéo en parties. La vidéo avec sous-titres incrustés peut durer jusqu’à 10 minutes, car le fichier MP4 est créé dans la mémoire du navigateur. Les fichiers SRT, VTT et texte n’ont pas de limite.
Ma vidéo ou mon texte sont-ils envoyés sur un serveur ?
Non. La transcription est faite par votre navigateur, sur votre appareil : votre vidéo, son son et le texte obtenu ne sont envoyés nulle part, contrairement à la plupart des outils de sous-titrage en ligne. Seul le modèle de reconnaissance vocale (Whisper) est téléchargé une fois, depuis Hugging Face, avec son moteur depuis jsDelivr, puis gardé en cache. Votre travail (texte et horaires, jamais la vidéo) est enregistré sur votre appareil pour pouvoir le reprendre.