ffmpeg + Whisper
Gratis, local, complicado. Tú posees el pipeline y cada bug que tenga.
Suelta el archivo MP4 tal cual — extraemos la pista de audio en el servidor, devolvemos una transcripción con marca de tiempo, y generamos un SRT que se importa directamente en YouTube, Vimeo o tu NLE.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Mira lo que sale
MP4 es un contenedor — leemos el flujo de audio directamente, nunca re-codificamos el vídeo. Las marcas de tiempo se mantienen precisas a fotograma en tu línea de tiempo original, para que el SRT se alinee en la primera importación.
Bien, en este módulo vamos a recorrer el flujo de reembolsos de principio a fin.
Pregunta rápida antes de empezar — ¿esto también aplica a reembolsos parciales?
Buena observación. Los parciales usan la misma pantalla pero con otro código de razón.
Entendido. ¿Y el umbral de aprobación sigue siendo doscientos dólares?
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Tres opciones reales · comparación honesta
Puedes extraer el audio tú mismo y ejecutar Whisper. Puedes arrastrar el MP4 a Descript o VEED y trabajar dentro de su editor. O puedes soltar el archivo aquí y obtener la transcripción + SRT de vuelta, sin estar atado a ningún editor.
Gratis, local, complicado. Tú posees el pipeline y cada bug que tenga.
Suelta el MP4. Extracción de audio, diarización, SRT, resumen — todo en un paso.
Carga el MP4 en el editor. La transcripción aparece como parte de la UI de la línea de tiempo.
Precios y límites de características aproximados a partir de 2026. Los nombres de los planes de Descript y VEED cambian frecuentemente — consulta su sitio para los límites actuales.
Específico de MP4
MP4 es un contenedor, no un códec — y la mayoría de herramientas de transcripción lo tratan como un gran blob de audio. De ahí vienen los fallos.
Suelta un MP4 y estos se activan por defecto. Anula según sea necesario por trabajo desde el formulario.
Accuracy · real-world numbers
La precisión de MP4 se establece por el micrófono, no el códec. Un micrófono de solapa en un set tranquilo supera a una cámara 4K con audio integrado cada vez. Los números a continuación provienen de MP4s reales de clientes, ordenados por cuál captura el audio.
Micrófono de solapa o boom en una grabadora, 48 kHz AAC a 192+ kbps, sala tratada. El caso ideal. Las etiquetas de hablante se alinean perfectamente en una grabación de dos personas.
Micrófono en la cámara a 2-4 pies del hablante. Hay algo de sonido ambiente pero el habla es inteligible. La mayoría de contenido de creadores de YouTube cae aquí.
Exportaciones de OBS, Loom, Camtasia. El micrófono está cerca pero la sala no es tratada, a menudo con filtración de audio del sistema. Lo suficientemente bueno para transcripciones de tutoriales.
Micrófono interno del teléfono, ruido de viento o manipulación, la distancia varía de plano en plano. Las palabras son utilizables, espera 1-2 correcciones por minuto en nombres propios.
Preguntas frecuentes
30 minutos gratis cada mes. Sin tarjeta. Audio extraído en el servidor, identificación de hablantes, SRT con precisión de fotograma — todo incluido.
Comenzar gratis