Whisper local / código aberto
Grátis se você tiver uma GPU e uma tarde. Sem diarização de falantes fora da caixa.
Solte um arquivo MP3 em qualquer taxa de bits de 64 a 320 kbps. Obtenha uma transcrição com marcação de tempo e identificação de falantes em 99 idiomas — sem conversão de formato, sem recodificação, sem fila de espera.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Veja o resultado
Lemos os cabeçalhos de quadros MP3 diretamente — VBR, CBR, joint-stereo, qualquer codificador (LAME, Fraunhofer, FFmpeg). Se o arquivo for verdadeiramente estéreo com falantes em canais separados, usamos isso para separar vozes. A redução mono recua para diarização acústica.
Então quando você percebeu que o arquivo estava incompleto?
Provavelmente por volta de 2019, quando começamos a digitalizar as bobinas.
E as fitas desaparecidas — foram catalogadas em algum lugar?
Há um índice em papel de '78, mas metade está danificada pela água.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Três opções reais · comparação honesta
Você pode executar Whisper em seu próprio laptop gratuitamente se for técnico. Otter e Sonix aceitam uploads de MP3 dentro de painéis de assinatura. Nós pegamos o arquivo, retornamos a transcrição e não o fazemos viver dentro de uma interface.
Grátis se você tiver uma GPU e uma tarde. Sem diarização de falantes fora da caixa.
Solte o MP3. Obtenha texto com identificação de falantes de volta em aproximadamente tempo real × 0,025.
Painel refinado, limite mensal de minutos, otimizado para inglês. Upload de arquivo parece um recurso secundário.
Preços e disponibilidade de recursos precisos em maio de 2026. O desempenho do Whisper varia conforme o tamanho do modelo e o hardware.
Específico para MP3
MP3 é um formato, não um estilo de gravação — o que significa que os modos de falha vêm do codificador, não da fala.
Padrões que funcionam em ~80% dos arquivos MP3. Substitua por trabalho no formulário.
Accuracy · real-world numbers
A precisão do MP3 é limitada pelo que o codificador preservou, não por nós. A compressão perceptiva acima de ~96 kbps preserva a inteligibilidade da fala muito bem; abaixo de 64 kbps, sibilantes e consoantes começam a desaparecer. Os números abaixo são de MP3s reais de clientes em produção.
Praticamente sem perda para fala. Podcasts mestres, exportações de aplicativos de ditado, rigs de entrevista profissional. Diarização limpa se falantes em canais separados.
Taxa de bits mais comum para MP3s com conteúdo falado. Exportações do Zoom, downloads do Riverside, padrão dos gravadores de voz. Artefatos de compressão inaudíveis ao reconhecedor.
Padrão de notas de voz na maioria dos telefones. Diarização acústica lida com 2-4 falantes. Números e nomes próprios ocasionalmente precisam de uma olhada.
Rips de máquinas de resposta antigas, arquivos de palestras, fontes de banda estreita. Consoantes de alta frequência (f/s/sh) ficam desfocadas. Ainda legível — planeje uma revisão.
Perguntas comuns
30 minutos grátis por mês. Sem cartão necessário. Identificação de falantes, 99 idiomas, todos os formatos de exportação inclusos.
Começar grátis