Whisper local / código aberto
Gratuito se você tem uma GPU e uma tarde. Sem diarização de locutor pronta para usar.
Solte um arquivo MP3 em qualquer bitrate de 64 a 320 kbps. Obtenha uma transcrição com timestamp e identificação de locutores em 99 idiomas — sem conversão de formato, sem re-codificação, sem esperar na fila.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Veja o que sai
Lemos os cabeçalhos de quadro MP3 diretamente — VBR, CBR, joint-stereo, qualquer codificador (LAME, Fraunhofer, FFmpeg). Se o arquivo é estéreo real com locutores em canais separados, usamos isso para dividir vozes. A redução a mono recorre à diarização acústica.
Então, quando você percebeu que o arquivo estava incompleto?
Provavelmente por volta de 2019, quando começamos a digitalizar os reels.
E as fitas desaparecidas — elas foram catalogadas em algum lugar?
Há um índice em papel de '78, mas metade está danificada pela água.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Três opções reais · comparação honesta
Você pode executar Whisper em seu próprio laptop gratuitamente se for técnico. Otter e Sonix aceitam uploads de MP3 dentro de painéis de assinatura. Pegamos o arquivo, devolvemos a transcrição e não o obrigamos a viver dentro de uma interface.
Gratuito se você tem uma GPU e uma tarde. Sem diarização de locutor pronta para usar.
Solte o MP3. Obtenha texto com rótulos de locutor de volta em aproximadamente tempo real × 0,025.
Painel polido, limite mensal de minutos, afinado para inglês. Upload de arquivo parece um recurso secundário.
Preços e disponibilidade de recursos precisos a partir de maio de 2026. O desempenho do Whisper varia por tamanho de modelo e hardware.
Específico para MP3
MP3 é um formato, não um estilo de gravação — o que significa que os modos de falha vêm do codificador, não da fala.
Padrões que se encaixam em ~80% dos arquivos MP3. Sobrescrever por trabalho do formulário.
Accuracy · real-world numbers
A precisão do MP3 é limitada pelo que o codificador manteve, não por nós. A compressão perceptual acima de ~96 kbps preserva a inteligibilidade da fala muito bem; abaixo de 64 kbps, sibilantes e consoantes começam a desaparecer. Os números abaixo são de MP3s reais de clientes em produção.
Quase sem perda de qualidade para fala. Masters de podcast, exportações de aplicativos de ditado, rigs de entrevista profissional. Diarização limpa se locutores em canais separados.
Bitrate mais comum para MP3s de palavra falada. Exportações de Zoom, downloads de Riverside, padrão de gravadores de voz. Artefatos de compressão inaudíveis para reconhecedor.
Padrões de memorando de voz na maioria dos telefones. Diarização acústica lida com 2-4 locutores. Números e nomes próprios ocasionalmente precisam de verificação.
Rips de máquina de resposta antiga, arquivos de aula, fontes de banda estreita. Consoantes de alta frequência (f/s/sh) ficam borradas. Ainda legível — planeje uma revisão.
Perguntas comuns
30 minutos gratuitos a cada mês. Sem cartão necessário. Rótulos de locutor, 99 idiomas, cada formato de exportação incluído.
Começar gratuitamente