Transcriu vídeo MP4 a text.Àudio extret automàticament.

Deixa l'arxiu MP4 tal qual — extraiem la pista d'àudio al servidor, retornem una transcripció amb marques de temps, i enviem un SRT que importa directament a YouTube, Vimeo o al teu NLE.

Deixa-hi l'àudio o el vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Grava directament des del navegador

El registre triga 30 segons — la gravació s'obre just després, al dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTEls fitxers s'esborren en 24 h

↓ Mira el resultat

MP4 dins. Transcripció + SRT enfora.

MP4 és un contenidor — llegim el flux d'àudio directament, mai no recodifiquem el vídeo. Els marcs de temps es mantenen precisos al teu cronograma original, així que l'SRT s'alinea en la primera importació.

training-module-04.mp4REC 1080p · 22:14 · 412 MB
auto-detected en-USAAC 48 kHz stereo · 192 kbps
~90s
Transcripció · streaming95% de precisió
S1

Bé, en aquest mòdul repassem el flux de reemborsos de principi a fi.

S2

Una ràpida pregunta abans de començar — això també s'aplica als reemborsos parcials?

S1

Bona observació. Els parcials usen la mateixa pantalla però un codi de raó diferent.

S2

D'acord. I el llindar d'aprovació segueix sent dos-cents dòlars?

95% en diàleg netSRT · VTT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tres opcions reals · comparació honesta

Fes-ho tu amb ffmpeg. Un editor de vídeo. O nosaltres.

Pots extraure l'àudio tu mateix i executar Whisper. Pots arrossegar l'MP4 a Descript o VEED i viure dins del seu editor. O pots deixar l'arxiu aquí i obtenir la transcripció + SRT, sense quedar tancat en un editor.

Option 01

ffmpeg + Whisper

Gratuït, local, complicat. Tu duenyos del pipeline i de cada bug que té.

RequereixCLI + model de 10 GB + GPU
Diarització d'oradorEina separada (pyannote)
Sortida SRTSí, senyalador manual
Temps en un MP4 d'1 hora20–90 min en CPU
Àudio multi-pistaTu trieu el flux
Cost$0 + el teu maquinari
Best forEnginyers que ja executen Whisper localment i no els importa afegir diarització.
Option 02

Transcription.Solutions

Deixa l'MP4. Extracció d'àudio, diarització, SRT, resum — una sola passada.

RequereixNavegador, això és tot
Diarització d'oradorIntegrada, cada feina
Sortida SRTAlineada fotograma per fotograma amb la font
Temps en un MP4 d'1 hora~4 min, en directe
Àudio multi-pistaLlistem tots els fluxos
Cost · per min$0.03
Best forQualsevol que tingui un MP4 i vulgui el text i SRT sense aprendre un editor de vídeo o un CLI.
Option 03

Descript / VEED

Carrega l'MP4 a l'editor. La transcripció apareix com a part de la UI de cronograma.

RequereixCompte + corba d'aprenentatge de l'editor
Diarització d'oradorSí, acoratjat per EN
Sortida SRTEsportació limitada pel pla
Límit de càrrega5 GB (Descript gratuït)
Àudio multi-pistaNomés la primera pista
Cost$12–24/usuari/mes
Best forEditors que volen tallar el vídeo i la transcripció en la mateixa eina.

Els preus i els límits de funcions són aproximats a data de 2026. Els noms de nivells de Descript i VEED canvien freqüentment — consulta el seu lloc per als límits actuals.

Específic de l'MP4

Tres coses que causen problemes amb les eines de transcripció genèriques.

MP4 és un contenidor, no un còdec — i la majoria d'eines de transcripció el tracten com un gran blob d'àudio. Aquí és on sorgeixen els errors.

On cau l'error

  1. 1MP4 multi-pista amb boom + solapa. Les eines genèriques agafen la pista 1 i ignoren la resta, així que perds el micròfon més net. Comú en exportacions FCP i Premiere.
  2. 2La música de fons en vlogs i anuncis provoca paraules fantasmagòriques. El reconeixedor intenta transcriure les vocals sobre la música de fons.
  3. 3Els marcs de temps SRT es desvien quan l'eina recodifica el vídeo en l'entrada. Al minut 40, els subtítols són un segon fora.

Què canviar aquí

  1. 1Puja — sondem cada flux d'àudio i et deixem triar quin transcriure. Per defecte és la pista de bitrate més alt.
  2. 2Activa Music suppression en el formulari de feina. Controlam el reconeixedor en VAD de parla perquè les seccions instrumentals es mantinguin buides.
  3. 3Mai no recodifiquem vídeo. L'àudio s'extreu a la freqüència de mostreig nativa, els marcs de temps fan referència a la llista d'edició del contenidor — l'SRT s'alinea fotograma per fotograma de manera precisa.

Configuració de feina recomanada per a MP4

Deixa un MP4 i aquests s'activen per defecte. Substitueix per feina des del formulari.

Extracció d'àudio
Freqüència de mostreig nativa, sense recodificació
Selecció de pista
Flux de bitrate més alt
Diarització
Acústica · 1-6 oradors
Supressió de música
Activada per a presets vlog/anunci
Format SRT
≤42 caràcters/línia, màx 2 línies
Exportació
SRT · VTT · DOCX · TXT amb marques de temps

Accuracy · real-world numbers

95% en una gravació neta. Nombres honestos quan l'àudio s'oposa.

La precisió de l'MP4 es defineix pel micròfon, no pel còdec. Un micròfon de solapa en un plató tranquil supera una càmera 4K amb àudio integrat quasi sempre. Els números de sota provenen de MP4s reals de clients, ordenats per qui estava capturant l'àudio.

96%+
Gravació d'estudi, micròfon de solapa o escopeta

Solapa o boom a una gravadora, AAC 48 kHz a 192+ kbps, sala tractada. El cas idealí. Les etiquetes d'orador funcionen perfectament en una gravació de dues persones.

93%
DSLR amb escopeta a la càmera

Micròfon a la part superior de la càmera 2-4 peus de l'orador. Una mica de so ambiental però la parla és intel·ligible. La majoria de gravacions de creadors de YouTube acaben aquí.

89%
Gravaci�� de pantalles amb micròfon USB

Exportacions OBS, Loom, Camtasia. Micròfon a prop però sala sense tractar, sovint amb fuita d'àudio del sistema. Prou bé per a transcripcions de tutorials.

84%
Vídeo de telèfon, micròfon integrat

Micròfon integrat del telèfon, soroll de vent o manipulació, la distància varia de fotograma a fotograma. Paraules usables, espera 1-2 correccions per minut en noms propis.

Preguntes comunes

8 coses que la gent pregunta sobre la transcripció d'MP4.

01Recodificació del vídeo?+
No. Només llegim el flux d'àudio fora del contenidor MP4. El flux de vídeo mai es toca, mai es recodifica i mai s'emmagatzema després que acabi la feina — tu guardas l'arxiu original sense canvis.
02Quins còdecs dins de l'MP4 són compatibles?+
H.264 + AAC estàndard és el cas fàcil. Tambémanegem HEVC/H.265, ProRes-in-MP4 i àudio en MP3, Opus, ALAC o PCM. Si ffmpeg pot sondejar-lo, podem transcriure'l.
03Quin és el límit de mida de l'arxiu?+
10 GB per pujada en el pujador web, 50 GB via l'API amb blocs reanudables. Un MP4 típic d'1 hora 1080p és 1-3 GB, així que la majoria d'arxius caben a la ruta web sense pensar-hi.
04L'SRT s'alinearà amb el meu vídeo original?+
Sí — els marcs de temps fan referència a la llista d'edició i la freqüència de mostreig nativa de l'MP4. No recodifiquem, així que no hi ha desfase. Deixa l'SRT al costat de l'MP4 a qualsevol reproductor o NLE i els subtítols se sincronitzen en la primera càrrega.
05Puc gravar els subtítols amb el vídeo?+
No per part nostra — extraiem l'SRT i deixem la gravació al teu editor. ffmpeg one-liner, HandBrake, Premiere, DaVinci, Kapwing accepten tots els SRT que produïm. No volem ser l'eina de codificació tampoc.
06Sobre MOV, MKV, M4V, WebM?+
Tots compatibles a través del mateix pipeline. MOV especialment — mateixa família MPEG-4, ruta d'extracció idèntica. MKV amb múltiples pistes d'àudio obté la mateixa UI de selecció de flux que un MP4 multi-pista.
07Puc enviar una URL de YouTube o Vimeo?+
Sí per a YouTube — enganxa una URL pública a la pantalla de pujada i extraiem l'àudio directament, sense necessitat de descarregar MP4. Vimeo requereix un arxiu directe o un enllaç de descàrrega signat perquè el seu reproductor controla el flux.
08Que passa si no hi ha diàleg parlat, només música o B-roll?+
VAD detecta seccions silencioses i només música i les salta, així que no pagues per a metratge ambiental. La transcripció marca aquests rangs com a `[music]` o `[no speech]` en lloc d'inventar paraules.

Deixa l'MP4. Obté la transcripció i l'SRT.

30 minuts gratuïts cada mes. Sense targeta. Àudio extret al servidor, etiquetes d'orador, SRT precís fotograma per fotograma — tot inclòs.

Comença gratuït