ffmpeg + Whisper
Gratuito, local, complicado. Você é dono do pipeline e de cada bug nele.
Solte o arquivo MP4 como está — nós extraímos a trilha de áudio no servidor, retornamos uma transcrição marcada com timestamps, e entregamos um SRT que cai direto no YouTube, Vimeo, ou sua NLE.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Veja o que sai
MP4 é um contêiner — lemos o fluxo de áudio direto, nunca recodificamos o vídeo. Os timestamps permanecem frame-accurate em relação à sua linha do tempo original, então o SRT se alinha na primeira importação.
Certo, neste módulo vamos percorrer o fluxo de reembolso do início ao fim.
Pergunta rápida antes de começar — isso se aplica a reembolsos parciais também?
Boa observação. Reembolsos parciais usam a mesma tela mas um código de motivo diferente.
Entendi. E o limite de aprovação continua sendo duzentos dólares?
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Três opções reais · comparação honesta
Você pode extrair o áudio você mesmo e executar o Whisper. Pode arrastar o MP4 para o Descript ou VEED e ficar dentro do editor deles. Ou pode soltar o arquivo aqui e obter a transcrição + SRT de volta, sem fazer lock-in com nenhum editor.
Gratuito, local, complicado. Você é dono do pipeline e de cada bug nele.
Solte o MP4. Extração de áudio, diarização, SRT, resumo — tudo em uma passagem.
Carregue MP4 no editor. A transcrição aparece como parte da UI da linha do tempo.
Preços e limites de recursos aproximados a partir de 2026. Nomes de planos Descript e VEED mudam frequentemente — verifique o site deles para limites atuais.
Específico para MP4
MP4 é um contêiner, não um codec — e a maioria das ferramentas de transcrição o trata como um grande blob de áudio. É aí que vêm os erros.
Solte um MP4 e essas configurações ligam por padrão. Sobrescreva por job a partir do formulário.
Accuracy · real-world numbers
A acurácia de MP4 é definida pelo microfone, não pelo codec. Um microfone de lapela em um set tranquilo sempre bate uma câmera 4K com áudio integrado. Os números abaixo vêm de MP4s reais de clientes, divididos pelo que estava capturando o áudio.
Lapela ou boom em um gravador, AAC 48 kHz a 192+ kbps, sala tratada. O caso limite superior. Identificação de locutor acerta tudo em uma gravação de duas pessoas.
Microfone na câmera 2-4 pés do locutor. Alguns tons ambientes mas fala é inteligível. A maioria do conteúdo de criadores do YouTube cai aqui.
Exportações de OBS, Loom, Camtasia. Microfone é próximo mas sala não é tratada, muitas vezes com derramamento de áudio do sistema. Muito bom para transcrições de tutoriais.
Microfone integrado do telefone, ruído de vento ou manipulação, distância varia quadro a quadro. Palavras usáveis, espere 1-2 correções por minuto em nomes próprios.
Perguntas comuns
30 minutos grátis todo mês. Sem cartão. Áudio extraído no servidor, identificação de locutor, SRT frame-accurate — tudo incluído.
Começar grátis