Transcreva vídeo MP4 para texto.Áudio extraído automaticamente.

Solte o arquivo MP4 como está — nós extraímos a trilha de áudio no servidor, retornamos uma transcrição marcada com timestamps, e entregamos um SRT que cai direto no YouTube, Vimeo, ou sua NLE.

Solte seu áudio ou vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Grave direto do navegador

O cadastro leva 30 segundos — a gravação abre logo em seguida, no painel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTArquivos apagados automaticamente em 24h

↓ Veja o que sai

MP4 entra. Transcrição + SRT sai.

MP4 é um contêiner — lemos o fluxo de áudio direto, nunca recodificamos o vídeo. Os timestamps permanecem frame-accurate em relação à sua linha do tempo original, então o SRT se alinha na primeira importação.

training-module-04.mp4REC 1080p · 22:14 · 412 MB
auto-detectado en-USAAC 48 kHz estéreo · 192 kbps
~90s
Transcrição · streamingAcurácia de 95%
S1

Certo, neste módulo vamos percorrer o fluxo de reembolso do início ao fim.

S2

Pergunta rápida antes de começar — isso se aplica a reembolsos parciais também?

S1

Boa observação. Reembolsos parciais usam a mesma tela mas um código de motivo diferente.

S2

Entendi. E o limite de aprovação continua sendo duzentos dólares?

95% em diálogo limpoSRT · VTT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Três opções reais · comparação honesta

DIY com ffmpeg. Um editor de vídeo. Ou nós.

Você pode extrair o áudio você mesmo e executar o Whisper. Pode arrastar o MP4 para o Descript ou VEED e ficar dentro do editor deles. Ou pode soltar o arquivo aqui e obter a transcrição + SRT de volta, sem fazer lock-in com nenhum editor.

Option 01

ffmpeg + Whisper

Gratuito, local, complicado. Você é dono do pipeline e de cada bug nele.

RequerCLI + modelo de 10 GB + GPU
Diarização de locutorFerramenta separada (pyannote)
Saída SRTSim, com flag manual
Tempo em um MP4 de 1 hora20–90 min em CPU
Áudio multi-trilhaVocê escolhe o fluxo
Custo$0 + seu hardware
Best forEngenheiros que já executam Whisper localmente e não se importam de costurar diarização por cima.
Option 02

Transcription.Solutions

Solte o MP4. Extração de áudio, diarização, SRT, resumo — tudo em uma passagem.

RequerNavegador, é tudo
Diarização de locutorIntegrada, em cada job
Saída SRTAlinhada em frame à origem
Tempo em um MP4 de 1 hora~4 min, streaming
Áudio multi-trilhaListamos todos os fluxos
Custo · por minuto$0.03
Best forQualquer pessoa com um MP4 que quer o texto e o SRT sem aprender um editor de vídeo ou uma CLI.
Option 03

Descript / VEED

Carregue MP4 no editor. A transcrição aparece como parte da UI da linha do tempo.

RequerConta + curva de aprendizado do editor
Diarização de locutorSim, sintonizado para EN
Saída SRTLimitada por plano
Limite de upload5 GB (Descript grátis)
Áudio multi-trilhaApenas primeira trilha
Custo$12–24/usuário/mês
Best forEditores que querem cortar o vídeo e a transcrição na mesma ferramenta.

Preços e limites de recursos aproximados a partir de 2026. Nomes de planos Descript e VEED mudam frequentemente — verifique o site deles para limites atuais.

Específico para MP4

Três coisas que pegam as pessoas em ferramentas genéricas de transcrição.

MP4 é um contêiner, não um codec — e a maioria das ferramentas de transcrição o trata como um grande blob de áudio. É aí que vêm os erros.

O que dá errado

  1. 1MP4 multi-trilha com boom + lapela. Ferramentas genéricas pegam trilha 1 e ignoram o resto, então você perde o microfone mais limpo. Comum em exportações de FCP e Premiere.
  2. 2Música de fundo em vlogs e anúncios dispara palavras fantasmas. O reconhecedor tenta transcrever os vocais na trilha musical.
  3. 3Timestamps de SRT sofrem drift quando a ferramenta recodifica o vídeo na entrada. No minuto 40 as legendas estão um segundo atrasadas.

O que mudar aqui

  1. 1Upload — nós testamos cada fluxo de áudio e deixamos você escolher qual transcreve. O padrão é a trilha com maior taxa de bits.
  2. 2Ative Supressão de música no formulário de job. Nós filtramos o reconhecedor em speech VAD para que seções instrumentais permaneçam vazias.
  3. 3Nós nunca recodificamos vídeo. Áudio é extraído em taxa de amostragem nativa, timestamps referenciam a lista de edição do contêiner — SRT se alinha frame-accurate.

Configurações de job recomendadas para MP4

Solte um MP4 e essas configurações ligam por padrão. Sobrescreva por job a partir do formulário.

Extração de áudio
Taxa de amostragem nativa, sem recodificação
Seleção de trilha
Fluxo com maior taxa de bits
Diarização
Acústica · 1-6 locutores
Supressão de música
Ativa para presets de vlog/anúncio
Formato SRT
≤42 caracteres/linha, 2 linhas no máximo
Exportação
SRT · VTT · DOCX · TXT com timestamps

Accuracy · real-world numbers

95% em uma gravação limpa. Números honestos quando o áudio complica.

A acurácia de MP4 é definida pelo microfone, não pelo codec. Um microfone de lapela em um set tranquilo sempre bate uma câmera 4K com áudio integrado. Os números abaixo vêm de MP4s reais de clientes, divididos pelo que estava capturando o áudio.

96%+
Gravação em estúdio, microfone de lapela ou boom

Lapela ou boom em um gravador, AAC 48 kHz a 192+ kbps, sala tratada. O caso limite superior. Identificação de locutor acerta tudo em uma gravação de duas pessoas.

93%
DSLR com microfone shotgun na câmera

Microfone na câmera 2-4 pés do locutor. Alguns tons ambientes mas fala é inteligível. A maioria do conteúdo de criadores do YouTube cai aqui.

89%
Gravação de tela com microfone USB

Exportações de OBS, Loom, Camtasia. Microfone é próximo mas sala não é tratada, muitas vezes com derramamento de áudio do sistema. Muito bom para transcrições de tutoriais.

84%
Vlog gravado no telefone, microfone integrado

Microfone integrado do telefone, ruído de vento ou manipulação, distância varia quadro a quadro. Palavras usáveis, espere 1-2 correções por minuto em nomes próprios.

Perguntas comuns

8 coisas que as pessoas perguntam sobre transcrição de MP4.

01Vocês recodificam meu vídeo?+
Não. Nós apenas lemos o fluxo de áudio do contêiner MP4. O fluxo de vídeo nunca é tocado, nunca recodificado, e nunca armazenado após o job terminar — você mantém seu arquivo original inalterado.
02Quais codecs dentro do MP4 são suportados?+
H.264 padrão + AAC é o caso fácil. Também tratamos HEVC/H.265, ProRes-em-MP4, e áudio em MP3, Opus, ALAC, ou PCM. Se ffmpeg consegue testar, nós conseguimos transcrever.
03Qual é o limite de tamanho de arquivo?+
10 GB por upload no uploader web, 50 GB via API com chunks resumíveis. Um MP4 1080p típico de 1 hora tem 1-3 GB então a maioria dos arquivos cabe no caminho web sem pensar nisto.
04O SRT vai se alinhar com meu vídeo original?+
Sim — timestamps referenciam a lista de edição do MP4 e a taxa de amostragem nativa. Nós não recodificamos, então não há drift. Solte o SRT ao lado do MP4 em qualquer player ou NLE e legenda se sincroniza na primeira carga.
05Posso queimar as legendas dentro do vídeo?+
Não do nosso lado — nós exportamos o SRT e deixamos a queimadura para seu editor. Uma linha de ffmpeg, HandBrake, Premiere, DaVinci, Kapwing todas aceitam o SRT que produzimos. Nós não queremos ser a ferramenta de codificação também.
06E quanto MOV, MKV, M4V, WebM?+
Todos suportados através do mesmo pipeline. MOV especialmente — mesma família MPEG-4, caminho de extração idêntico. MKV com múltiplas trilhas de áudio tem a mesma UI do seletor de fluxo que um MP4 multi-trilha.
07Posso apenas enviar uma URL do YouTube ou Vimeo?+
Sim para YouTube — cole uma URL pública na tela de upload e nós buscamos o áudio diretamente, sem necessidade de download de MP4. Vimeo requer um arquivo direto ou um link de download assinado porque seu player bloqueia o fluxo.
08E se não houver diálogo falado, apenas música ou B-roll?+
VAD detecta seções silenciosas e somente-música e as pula, então você não paga por filmagem ambiente. A transcrição marca essas faixas como `[music]` ou `[no speech]` em vez de inventar palavras.

Solte seu MP4. Obtenha a transcrição e SRT de volta.

30 minutos grátis todo mês. Sem cartão. Áudio extraído no servidor, identificação de locutor, SRT frame-accurate — tudo incluído.

Começar grátis