Transcrire une vidéo MP4 en texte.Audio extrait automatiquement.

Déposez le fichier MP4 tel quel — nous extrayons la piste audio côté serveur, retournons une transcription horodatée et livrons un SRT qui s'intègre directement dans YouTube, Vimeo ou votre NLE.

Déposez votre audio ou vidéo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Enregistrez directement depuis votre navigateur

L'inscription prend 30 secondes — l'enregistrement s'ouvre juste après, dans le tableau de bord.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTFichiers supprimés automatiquement sous 24h

↓ Regardez ce qui en sort

MP4 en entrée. Transcription + SRT en sortie.

MP4 est un conteneur — nous lisons le flux audio directement, sans jamais réencoder la vidéo. Les horodatages restent précis à l'image par rapport à votre chronologie d'origine, donc le SRT s'aligne dès la première importation.

training-module-04.mp4REC 1080p · 22:14 · 412 MB
détecté automatiquement en-USAAC 48 kHz stéréo · 192 kbps
~90s
Transcription · streaming95% de précision
S1

D'accord, dans ce module nous parcourons le flux de remboursement de bout en bout.

S2

Question rapide avant de commencer — cela s'applique-t-il aussi aux remboursements partiels ?

S1

Bonne remarque. Les partiels utilisent le même écran mais un code de raison différent.

S2

Compris. Et le seuil d'approbation est toujours de deux cents dollars ?

95% sur le dialogue propreSRT · VTT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Trois vraies options · comparaison honnête

Débrouilles-toi avec ffmpeg. Un éditeur vidéo. Ou nous.

Vous pouvez extraire l'audio vous-même et lancer Whisper. Vous pouvez glisser le MP4 dans Descript ou VEED et rester dans leur éditeur. Ou vous pouvez déposer le fichier ici et récupérer la transcription + SRT, sans dépendre d'un éditeur.

Option 01

ffmpeg + Whisper

Gratuit, local, mais peu commode. Vous possédez le pipeline et tous les bugs qu'il contient.

NécessiteCLI + modèle de 10 Go + GPU
Diarisation des locuteursOutil séparé (pyannote)
Sortie SRTOui, drapeau manuel
Temps sur un MP4 d'1 heure20–90 min sur CPU
Audio multi-pisteVous choisissez le flux
Coût$0 + votre matériel
Best forLes ingénieurs qui exécutent déjà Whisper localement et ne craignent pas d'ajouter la diarisation par-dessus.
Option 02

Transcription.Solutions

Déposez le MP4. Extraction audio, diarisation, SRT, résumé — une seule passe.

NécessiteUn navigateur, c'est tout
Diarisation des locuteursIntégrée, à chaque travail
Sortie SRTAligned frame-accurate à la source
Temps sur un MP4 d'1 heure~4 min, streamé
Audio multi-pisteNous listons tous les flux
Coût · par minute$0.03
Best forQuiconque ayant un MP4 souhaite le texte et le SRT sans apprendre un éditeur vidéo ou une CLI.
Option 03

Descript / VEED

Chargez le MP4 dans l'éditeur. La transcription apparaît comme faisant partie de l'interface de la chronologie.

NécessiteCompte + courbe d'apprentissage de l'éditeur
Diarisation des locuteursOui, réglée pour EN
Sortie SRTExport contrôlé par le forfait
Plafond de téléchargement5 Go (Descript gratuit)
Audio multi-pistePremière piste uniquement
Coût$12–24/utilisateur/mois
Best forLes éditeurs qui souhaitent découper la vidéo et la transcription dans le même outil.

Les tarifs et les limites de fonctionnalités sont approximatifs en 2026. Les noms de forfait Descript et VEED changent fréquemment — consultez leur site pour les limites actuelles.

Spécifique à MP4

Trois problèmes avec les outils de transcription généralistes.

MP4 est un conteneur, pas un codec — et la plupart des outils de transcription le traitent comme un gros blob audio. C'est là que les erreurs viennent.

Ce qui ne va pas

  1. 1MP4 multi-piste avec boom + cravate. Les outils génériques prennent la piste 1 et ignorent le reste, donc vous perdez le micro plus propre. Courant dans les exports FCP et Premiere.
  2. 2La musique de fond dans les vlogs et les annonces déclenche des mots fantômes. Le reconnaisseur essaie de transcrire les vocals sur le lit musical.
  3. 3Les horodatages SRT dérivent quand l'outil réencode la vidéo lors de l'importation. À la 40e minute, les sous-titres sont décalés d'une seconde.

Ce qu'il faut faire ici

  1. 1Téléchargez — nous sondons chaque flux audio et vous laissons choisir lequel transcrire. Le défaut est la piste la plus élevée en débit.
  2. 2Activez la suppression de musique sur le formulaire de travail. Nous fermons le reconnaisseur sur la VAD de parole pour que les sections instrumentales restent vides.
  3. 3Nous ne réencodons jamais la vidéo. L'audio est extrait à la fréquence d'échantillonnage native, les horodatages font référence à la liste d'édition du conteneur — SRT s'aligne précisément à l'image.

Paramètres de travail recommandés pour MP4

Déposez un MP4 et ceux-ci s'activent par défaut. Remplacez-les au besoin dans le formulaire.

Extraction audio
Fréquence d'échantillonnage native, sans réencodage
Sélection de flux
Flux le plus élevé en débit
Diarisation
Acoustique · 1–6 locuteurs
Suppression de musique
Activée pour les présets vlog/annonce
Format SRT
≤42 caractères/ligne, 2 lignes max
Export
SRT · VTT · DOCX · TXT horodaté

Accuracy · real-world numbers

95% en prise propre. Des chiffres honnêtes quand l'audio se rebelle.

La précision MP4 est fixée par le micro, pas par le codec. Un microphone cravate sur un plateau calme surpasse une caméra 4K avec audio embarqué à chaque fois. Les chiffres ci-dessous proviennent de véritables MP4 clients, triés par ce qui captait l'audio.

96%+
Prise studio, micro cravate ou canon

Cravate ou perche vers un enregistreur, AAC 48 kHz à 192+ kbps, pièce traitée. Le meilleur cas. Les étiquettes de locuteur fonctionnent bien en prise à deux personnes.

93%
DSLR avec canon sur caméra

Micro sur la caméra à 2–4 pieds du locuteur. Un peu de bruit ambiant mais la parole est intelligible. La plupart des contenus de créateurs YouTube aboutissent ici.

89%
Enregistrement d'écran avec micro USB

Exports OBS, Loom, Camtasia. Le micro est proche mais la pièce est non traitée, souvent avec fuite d'audio système. Très convenable pour les transcriptions de tutoriel.

84%
Vlog tourné au téléphone, micro interne

Micro de téléphone intégré, bruit de vent ou de manipulation, distance variable plan à plan. Mots utilisables, attendez-vous à 1–2 corrections par minute sur les noms propres.

Questions fréquentes

8 choses que les gens demandent sur la transcription MP4.

01Réencodez-vous ma vidéo ?+
Non. Nous ne lisons que le flux audio du conteneur MP4. Le flux vidéo n'est jamais touché, jamais réencodé et jamais stocké après la fin du travail — vous conservez votre fichier original inchangé.
02Quels codecs à l'intérieur du MP4 sont supportés ?+
H.264 + AAC standard est le cas facile. Nous gérons également HEVC/H.265, ProRes-in-MP4, et audio en MP3, Opus, ALAC ou PCM. Si ffmpeg peut le sonder, nous pouvons le transcrire.
03Quelle est la limite de taille de fichier ?+
10 Go par téléchargement sur le téléchargeur web, 50 Go via l'API avec segments reprenables. Un MP4 1080p typique d'1 heure fait 1–3 Go, donc la plupart des fichiers s'adaptent au chemin web sans réfléchir.
04Le SRT s'alignera-t-il avec ma vidéo d'origine ?+
Oui — les horodatages font référence à la liste d'édition du MP4 et à la fréquence d'échantillonnage native. Nous ne réencodons pas, donc il n'y a pas de dérive. Déposez le SRT à côté du MP4 dans n'importe quel lecteur ou NLE et les sous-titres se synchronisent dès le chargement.
05Puis-je incruster les sous-titres dans la vidéo ?+
Pas de notre côté — nous produisons le SRT et laissons l'incrustation à votre éditeur. ffmpeg one-liner, HandBrake, Premiere, DaVinci, Kapwing acceptent tous le SRT que nous produisons. Nous ne voulons pas être l'outil d'encodage aussi.
06Qu'en est-il de MOV, MKV, M4V, WebM ?+
Tous supportés via le même pipeline. MOV surtout — même famille MPEG-4, chemin d'extraction identique. MKV avec plusieurs pistes audio obtient la même interface de sélection de flux qu'un MP4 multi-piste.
07Puis-je simplement envoyer une URL YouTube ou Vimeo ?+
Oui pour YouTube — collez une URL publique sur l'écran de téléchargement et nous récupérons l'audio directement, aucun téléchargement MP4 nécessaire. Vimeo nécessite un fichier direct ou un lien de téléchargement signé car leur lecteur contrôle le flux.
08Et s'il n'y a pas de dialogue parlé, juste de la musique ou du B-roll ?+
La VAD détecte les sections silencieuses et sans musique et les ignore, donc vous ne payez pas pour le contenu ambiant. La transcription marque ces plages comme `[music]` ou `[no speech]` au lieu d'inventer des mots.

Déposez votre MP4. Récupérez la transcription et le SRT.

30 minutes gratuites chaque mois. Pas de carte. Audio extrait côté serveur, étiquettes de locuteur, SRT précis à l'image — tout compris.

Commencer gratuitement