Transcribe vídeo MP4 a texto.Audio extraído automáticamente.

Suelta el archivo MP4 tal cual — extraemos la pista de audio en el servidor, devolvemos una transcripción con marca de tiempo, y generamos un SRT que se importa directamente en YouTube, Vimeo o tu NLE.

Suelta tu audio o vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Graba directamente desde tu navegador

Registrarse lleva 30 segundos — la grabación se abre justo después, en el panel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTLos archivos se eliminan automáticamente en 24 h

↓ Mira lo que sale

MP4 entra. Transcripción + SRT sale.

MP4 es un contenedor — leemos el flujo de audio directamente, nunca re-codificamos el vídeo. Las marcas de tiempo se mantienen precisas a fotograma en tu línea de tiempo original, para que el SRT se alinee en la primera importación.

training-module-04.mp4REC 1080p · 22:14 · 412 MB
en-US detectado automáticamenteAAC 48 kHz stereo · 192 kbps
~90s
Transcripción · transmisión95% de precisión
S1

Bien, en este módulo vamos a recorrer el flujo de reembolsos de principio a fin.

S2

Pregunta rápida antes de empezar — ¿esto también aplica a reembolsos parciales?

S1

Buena observación. Los parciales usan la misma pantalla pero con otro código de razón.

S2

Entendido. ¿Y el umbral de aprobación sigue siendo doscientos dólares?

95% en diálogos limpiosSRT · VTT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tres opciones reales · comparación honesta

Hazlo tú mismo con ffmpeg. Un editor de vídeo. U nosotros.

Puedes extraer el audio tú mismo y ejecutar Whisper. Puedes arrastrar el MP4 a Descript o VEED y trabajar dentro de su editor. O puedes soltar el archivo aquí y obtener la transcripción + SRT de vuelta, sin estar atado a ningún editor.

Option 01

ffmpeg + Whisper

Gratis, local, complicado. Tú posees el pipeline y cada bug que tenga.

RequiereCLI + modelo de 10 GB + GPU
Diarización de hablantesHerramienta separada (pyannote)
Salida SRTSí, bandera manual
Tiempo en un MP4 de 1 hora20–90 min en CPU
Audio multi-pistaTú eliges el flujo
Coste$0 + tu hardware
Best forIngenieros que ya ejecutan Whisper localmente y no les importa añadir diarización.
Option 02

Transcription.Solutions

Suelta el MP4. Extracción de audio, diarización, SRT, resumen — todo en un paso.

RequiereNavegador, eso es todo
Diarización de hablantesIncluida, en cada trabajo
Salida SRTAlineada a fotograma con la fuente
Tiempo en un MP4 de 1 hora~4 min, transmitido
Audio multi-pistaListamos todos los flujos
Coste · por minuto$0.03
Best forCualquiera con un MP4 que quiera el texto y SRT sin aprender un editor de vídeo o una CLI.
Option 03

Descript / VEED

Carga el MP4 en el editor. La transcripción aparece como parte de la UI de la línea de tiempo.

RequiereCuenta + curva de aprendizaje del editor
Diarización de hablantesSí, optimizado para EN
Salida SRTLimitada por plan de exportación
Límite de carga5 GB (Descript gratis)
Audio multi-pistaSolo la primera pista
Coste$12–24/usuario/mes
Best forEditores que quieren editar el vídeo y la transcripción en la misma herramienta.

Precios y límites de características aproximados a partir de 2026. Los nombres de los planes de Descript y VEED cambian frecuentemente — consulta su sitio para los límites actuales.

Específico de MP4

Tres cosas que afectan a la gente con herramientas genéricas de transcripción.

MP4 es un contenedor, no un códec — y la mayoría de herramientas de transcripción lo tratan como un gran blob de audio. De ahí vienen los fallos.

Qué sale mal

  1. 1MP4 multi-pista con boom + solapa. Las herramientas genéricas agarran la pista 1 e ignoran el resto, así pierdes el micrófono más limpio. Común en exportaciones de FCP y Premiere.
  2. 2Música de fondo en vlogs y anuncios dispara palabras fantasma. El reconocedor intenta transcribir las voces en la cama de música.
  3. 3Las marcas de tiempo SRT se desvían cuando la herramienta re-codifica el vídeo en la entrada. Al minuto 40 los subtítulos están un segundo desfasados.

Qué cambiar aquí

  1. 1Sube — examinamos cada flujo de audio y te dejamos elegir cuál se transcribe. El predeterminado es la pista de mayor velocidad de bits.
  2. 2Activa Supresión de música en el formulario del trabajo. Limitamos el reconocedor en VAD de voz para que las secciones instrumentales queden vacías.
  3. 3Nunca re-codificamos vídeo. El audio se extrae a la velocidad de muestreo nativa, las marcas de tiempo hacen referencia a la lista de edición del contenedor — el SRT se alinea con precisión a fotograma.

Configuración recomendada de trabajo para MP4

Suelta un MP4 y estos se activan por defecto. Anula según sea necesario por trabajo desde el formulario.

Extracción de audio
Velocidad de muestreo nativa, sin re-codificación
Selección de pista
Flujo de mayor velocidad de bits
Diarización
Acústica · 1-6 hablantes
Supresión de música
Activada para preajustes de vlog/anuncio
Formato SRT
≤42 caracteres/línea, máximo 2 líneas
Exportaci��n
SRT · VTT · DOCX · TXT con marca de tiempo

Accuracy · real-world numbers

95% en una grabación limpia. Números honestos cuando el audio se resiste.

La precisión de MP4 se establece por el micrófono, no el códec. Un micrófono de solapa en un set tranquilo supera a una cámara 4K con audio integrado cada vez. Los números a continuación provienen de MP4s reales de clientes, ordenados por cuál captura el audio.

96%+
Grabación de estudio, micrófono de solapa o de boom

Micrófono de solapa o boom en una grabadora, 48 kHz AAC a 192+ kbps, sala tratada. El caso ideal. Las etiquetas de hablante se alinean perfectamente en una grabación de dos personas.

93%
DSLR con micrófono de boom en cámara

Micrófono en la cámara a 2-4 pies del hablante. Hay algo de sonido ambiente pero el habla es inteligible. La mayoría de contenido de creadores de YouTube cae aquí.

89%
Grabación de pantalla con micrófono USB

Exportaciones de OBS, Loom, Camtasia. El micrófono está cerca pero la sala no es tratada, a menudo con filtración de audio del sistema. Lo suficientemente bueno para transcripciones de tutoriales.

84%
Vlog grabado en teléfono, micrófono interno

Micrófono interno del teléfono, ruido de viento o manipulación, la distancia varía de plano en plano. Las palabras son utilizables, espera 1-2 correcciones por minuto en nombres propios.

Preguntas frecuentes

8 cosas que la gente pregunta sobre transcripción de MP4.

01¿Re-codificas mi vídeo?+
No. Solo leemos el flujo de audio del contenedor MP4. El flujo de vídeo nunca se toca, nunca se re-codifica, y nunca se almacena después de que finaliza el trabajo — conservas tu archivo original sin cambios.
02¿Qué códecs dentro del MP4 son compatibles?+
H.264 estándar + AAC es el caso fácil. También manejamos HEVC/H.265, ProRes-en-MP4, y audio en MP3, Opus, ALAC, o PCM. Si ffmpeg puede detectarlo, podemos transcribirlo.
03¿Cuál es el límite de tamaño de archivo?+
10 GB por carga en el cargador web, 50 GB vía la API con fragmentos reanudables. Un MP4 típico de 1 hora y 1080p es de 1-3 GB así que la mayoría de archivos caben en la ruta web sin pensarlo.
04¿Se alineará el SRT con mi vídeo original?+
Sí — las marcas de tiempo hacen referencia a la lista de edición del MP4 y a la velocidad de muestreo nativa. No re-codificamos, así no hay desvío. Suelta el SRT al lado del MP4 en cualquier reproductor o NLE y los subtítulos se sincronizan en la primera carga.
05¿Puedo quemar los subtítulos en el vídeo?+
No de nuestro lado — sacamos el SRT y dejamos el quemado a tu editor. Una línea de ffmpeg, HandBrake, Premiere, DaVinci, Kapwing todos aceptan el SRT que producimos. No queremos ser la herramienta de codificación también.
06¿Qué hay de MOV, MKV, M4V, WebM?+
Todo compatible a través del mismo pipeline. MOV especialmente — misma familia MPEG-4, ruta de extracción idéntica. MKV con múltiples pistas de audio obtiene la misma UI de selector de flujo que un MP4 multi-pista.
07¿Puedo simplemente enviar una URL de YouTube o Vimeo?+
Sí para YouTube — pega una URL pública en la pantalla de carga y obtenemos el audio directamente, sin necesidad de descargar MP4. Vimeo requiere un archivo directo o un enlace de descarga firmado porque su reproductor cierra el flujo.
08¿Qué si no hay diálogo hablado, solo música o metraje de cobertura?+
VAD detecta secciones silenciosas y solo música y las omite, así no pagas por metraje ambiente. La transcripción marca esos rangos como `[music]` o `[no speech]` en lugar de inventar palabras.

Suelta tu MP4. Obtén la transcripción y el SRT de vuelta.

30 minutos gratis cada mes. Sin tarjeta. Audio extraído en el servidor, identificación de hablantes, SRT con precisión de fotograma — todo incluido.

Comenzar gratis