ffmpeg + Whisper
Gratis, local, complicado. Ti és o dono do pipeline e de cada erro nel.
Bota o ficheiro MP4 tal cal — extraemos a pista de audio no servidor, devolvemos un transcrito con marcas de tempo e enviamos un SRT que vai directamente a YouTube, Vimeo ou o teu NLE.
↓ Mira que sae
MP4 é un contedor — lemos o fluxo de audio directamente, nunca recodificamos o vídeo. As marcas de tempo manténense precisas respecto á túa liña de tempo orixinal, polo que o SRT se aliña na primeira importación.
Ben, neste módulo vamos percorrer o fluxo de devolucións de principio a fin.
Pregunta rápida antes de comezar — isto aplica tamén ás devolucións parciais?
Boa observación. As parciais usan a mesma pantalla pero un código de razón diferente.
Entendido. E o limiar de aprobación segue sendo douscentos dólares?
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Tres opcións reais · comparación honesta
Podes extraer o audio ti mesmo e executar Whisper. Podes arrastar o MP4 a Descript ou VEED e vivir dentro do seu editor. Ou podes largar o ficheiro aquí e obter o transcrito + SRT, sen bloqueo de editor.
Gratis, local, complicado. Ti és o dono do pipeline e de cada erro nel.
Bota o MP4. Extracción de audio, diarización, SRT, resumo — só unha pasada.
Carga o MP4 no editor. O transcrito aparece como parte da UI da liña de tempo.
Prezos e límites característicos aproximados a partir de 2026. Os nomes das capas de Descript e VEED cambian frecuentemente — consulta o seu sitio para os límites actuais.
Específico para MP4
MP4 é un contedor, non un códec — e a maioría das ferramentas de transcrición trátano como un grande blob de audio. De aí veñen os fallos.
Bota un MP4 e estes acenden por defecto. Anula por traballo desde o formulario.
Accuracy · real-world numbers
A precisión de MP4 está establecida polo micrófono, non polo códec. Un micrófono de solapa nun conxunto silencioso bate a unha cámara 4K con audio a bordo sempre. Os números de abaixo proceden de MP4s reais de clientes, ordenados pola forma en que se capturaba o audio.
Micrófono de solapa ou pluma nun gravador, 48 kHz AAC a 192+ kbps, sala tratada. O caso límite. As etiquetas de falante acértnao nunha toma de dúas persoas.
Micrófono na parte superior da cámara a 2-4 pés do falante. Algo de ton de sala pero a fala é intelixible. A maioría do contido de creadores de YouTube cae aquí.
Exportacións de OBS, Loom, Camtasia. O micrófono está preto pero a sala non está tratada, a miúdo con fugas de audio do sistema. Moi bó para transcritos de titoriais.
Micrófono de teléfono incorporado, ruído de vento ou manexo, a distancia varía de toma a toma. Palabras utilizables, espera 1-2 arranxos por minuto nos nomes propios.
Preguntas comúns
30 minutos gratis cada mes. Sen tarxeta. Audio extraído no servidor, etiquetas de falante, SRT preciso de fotograma — todo incluído.
Comeza gratis