Transcreva vídeo MP4 para texto.Áudio extraído automaticamente.

Envie o arquivo MP4 como está — extraímos a faixa de áudio no servidor, retornamos uma transcrição com timestamp e entregamos um SRT que volta direto para YouTube, Vimeo ou sua NLE.

Solte seu áudio ou vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Grave diretamente do seu navegador

O cadastro leva 30 segundos — a gravação abre logo após, no painel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTArquivos são excluídos automaticamente em 24h

↓ Veja o resultado

MP4 entra. Transcrição + SRT sai.

MP4 é um container — lemos o fluxo de áudio diretamente, nunca recodificamos o vídeo. Timestamps permanecem precisos em quadros da sua timeline original, então o SRT se alinha na primeira importação.

training-module-04.mp4REC 1080p · 22:14 · 412 MB
auto-detectado en-USAAC 48 kHz estéreo · 192 kbps
~90s
Transcrição · streaming95% de precisão
S1

Tudo bem, neste módulo vamos percorrer o fluxo de reembolso do início ao fim.

S2

Pergunta rápida antes de começar — isso se aplica também a reembolsos parciais?

S1

Boa observação. Reembolsos parciais usam a mesma tela mas um código de motivo diferente.

S2

Entendi. E o limite de aprovação ainda é de duzentos dólares?

95% em diálogo limpoSRT · VTT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Três opções reais · comparação honesta

DIY com ffmpeg. Um editor de vídeo. Ou nós.

Você pode extrair o áudio você mesmo e usar Whisper. Você pode arrastar o MP4 para Descript ou VEED e trabalhar dentro do editor deles. Ou pode enviar o arquivo aqui e obter a transcrição + SRT de volta, sem bloquear em um editor.

Option 01

ffmpeg + Whisper

Gratuito, local, delicado. Você é dono do pipeline e de cada bug nele.

RequerCLI + modelo 10 GB + GPU
Diarização de locutorFerramenta separada (pyannote)
Saída SRTSim, flag manual
Tempo em um MP4 de 1 hora20–90 min em CPU
Áudio multifaixaVocê escolhe o fluxo
Custo$0 + seu hardware
Best forEngenheiros que já rodam Whisper localmente e não se importam de adicionar diarização.
Option 02

Transcription.Solutions

Envie o MP4. Extração de áudio, diarização, SRT, resumo — uma passagem.

RequerNavegador, é só isso
Diarização de locutorIntegrada, todo trabalho
Saída SRTAlinhada por quadro à fonte
Tempo em um MP4 de 1 hora~4 min, via streaming
Áudio multifaixaListamos todos os fluxos
Custo · por min$0.03
Best forQualquer pessoa com um MP4 que queira o texto e SRT sem aprender um editor de vídeo ou uma CLI.
Option 03

Descript / VEED

Carregue o MP4 no editor. A transcrição aparece como parte da interface da timeline.

RequerConta + curva de aprendizado do editor
Diarização de locutorSim, afinada para EN
Saída SRTControlada por plano de exportação
Limite de upload5 GB (Descript gratuito)
Áudio multifaixaApenas primeira faixa
Custo$12–24/usuário/mês
Best forEditores que querem cortar o vídeo e a transcrição na mesma ferramenta.

Preços e limites de recursos aproximados em 2026. Nomes de planos do Descript e VEED mudam frequentemente — consulte o site deles para limites atuais.

Específico para MP4

Três coisas que pegam as pessoas em ferramentas genéricas de transcrição.

MP4 é um container, não um codec — e a maioria das ferramentas de transcrição o trata como um grande blob de áudio. É daí que vêm os erros.

O que dá errado

  1. 1MP4 multifaixa com boom + lapela. Ferramentas genéricas pegam a faixa 1 e ignoram o resto, então você perde o microfone mais limpo. Comum em exportações do FCP e Premiere.
  2. 2Música de fundo em vlogs e anúncios dispara palavras fantasmas. O reconhecedor tenta transcrever os vocais na cama de música.
  3. 3Timestamps SRT derivam quando a ferramenta recodifica o vídeo na entrada. No minuto 40 as legendas estão um segundo atrasadas.

O que mudar aqui

  1. 1Envio — sondamos cada fluxo de áudio e deixamos você escolher qual é transcrito. O padrão é a faixa de maior taxa de bits.
  2. 2Ative Supressão de música no formulário de trabalho. Portamos o reconhecedor em VAD de fala para que seções instrumentais fiquem vazias.
  3. 3Nunca recodificamos vídeo. Áudio é extraído na taxa de amostragem nativa, timestamps fazem referência à lista de edição do container — SRT se alinha com precisão de quadro.

Configura��ões de trabalho recomendadas para MP4

Envie um MP4 e estas ativam por padrão. Anule por trabalho no formulário.

Extração de áudio
Taxa de amostragem nativa, sem recodificação
Seleção de faixa
Fluxo de maior taxa de bits
Diarização
Acústica · 1-6 locutores
Supressão de música
Ativada para presets vlog/anúncio
Formato SRT
≤42 caracteres/linha, máximo 2 linhas
Exportação
SRT · VTT · DOCX · TXT com timestamp

Accuracy · real-world numbers

95% em uma gravação limpa. Números honestos quando o áudio bate na conta.

A precisão de MP4 é definida pelo microfone, não pelo codec. Um microfone de lapela em um set silencioso sempre supera uma câmera 4K com áudio integrado. Os números abaixo vêm de MP4s reais de clientes, ordenados pelo que estava capturando o áudio.

96%+
Gravação de estúdio, microfone de lapela ou shotgun

Lapela ou boom em um gravador, AAC 48 kHz a 192+ kbps, sala tratada. O caso perfeito. Rótulos de locutor funcionam muito bem em uma gravação de duas pessoas.

93%
DSLR com shotgun na câmera

Microfone no topo da câmera, 2-4 pés do locutor. Algum tom de sala mas a fala é inteligível. A maioria dos vídeos de criadores do YouTube fica aqui.

89%
Gravação de tela com microfone USB

Exportações OBS, Loom, Camtasia. Microfone próximo mas sala sem tratamento, geralmente com vazamento de áudio do sistema. Muito bom para transcrições de tutoriais.

84%
Vlog gravado em telefone, microfone interno

Microfone de telefone integrado, ruído de vento ou manipulação, distância varia de plano para plano. Palavras utilizáveis, espere 1-2 correções por minuto em nomes próprios.

Perguntas comuns

8 coisas que as pessoas perguntam sobre transcrição de MP4.

01Vocês recodificam meu vídeo?+
Não. Apenas lemos o fluxo de áudio do container MP4. O fluxo de vídeo nunca é tocado, nunca recodificado e nunca armazenado após o trabalho terminar — você mantém seu arquivo original inalterado.
02Quais codecs dentro do MP4 são suportados?+
H.264 + AAC padrão é o caso fácil. Também tratamos HEVC/H.265, ProRes-em-MP4 e áudio em MP3, Opus, ALAC ou PCM. Se ffmpeg pode sondar, podemos transcrever.
03Qual é o limite de tamanho de arquivo?+
10 GB por upload no uploader da web, 50 GB via API com segmentos retomáveis. Um MP4 típico de 1 hora e 1080p é 1-3 GB então a maioria dos arquivos cabe no caminho da web sem pensar.
04O SRT se alinhará com meu vídeo original?+
Sim — timestamps fazem referência à lista de edição do MP4 e à taxa de amostragem nativa. Não recodificamos, então não há deriva. Coloque o SRT ao lado do MP4 em qualquer player ou NLE e as legendas sincronizam no primeiro carregamento.
05Posso queimar as legendas no vídeo?+
Não do nosso lado — saímos com o SRT e deixamos a queimadura para seu editor. ffmpeg one-liner, HandBrake, Premiere, DaVinci, Kapwing todos aceitam o SRT que produzimos. Não queremos ser a ferramenta de codificação também.
06E quanto a MOV, MKV, M4V, WebM?+
Todos suportados pelo mesmo pipeline. MOV especialmente — mesma família MPEG-4, caminho de extração idêntico. MKV com múltiplas faixas de áudio obtém a mesma interface de seletor de fluxo que um MP4 multifaixa.
07Posso apenas enviar uma URL do YouTube ou Vimeo?+
Sim para YouTube — cole uma URL pública na tela de upload e buscamos o áudio diretamente, nenhum download de MP4 necessário. Vimeo requer um arquivo direto ou um link de download assinado porque seu player controla o fluxo.
08E se não houver diálogo falado, apenas música ou B-roll?+
VAD detecta seções silenciosas e apenas música e as pula, então você não paga por filmagem ambiente. A transcrição marca essas faixas como `[music]` ou `[no speech]` em vez de inventar palavras.

Envie seu MP4. Obtenha a transcrição e SRT de volta.

30 minutos grátis todo mês. Sem cartão. Áudio extraído no servidor, rótulos de locutor, SRT com precisão de quadro — tudo incluído.

Começar gratuitamente