Transcreva MP3 para texto.Identificação de falantes, 100+ idiomas.

Solte um arquivo MP3 em qualquer taxa de bits de 64 a 320 kbps. Obtenha uma transcrição com marcação de tempo e identificação de falantes em 99 idiomas — sem conversão de formato, sem recodificação, sem fila de espera.

Solte seu áudio ou vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Grave diretamente do seu navegador

O cadastro leva 30 segundos — a gravação abre logo após, no painel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTArquivos são excluídos automaticamente em 24h

↓ Veja o resultado

MP3 entra. Transcrição diarizada sai.

Lemos os cabeçalhos de quadros MP3 diretamente — VBR, CBR, joint-stereo, qualquer codificador (LAME, Fraunhofer, FFmpeg). Se o arquivo for verdadeiramente estéreo com falantes em canais separados, usamos isso para separar vozes. A redução mono recua para diarização acústica.

interview-tape-04.mp3REC 192 kbps · estéreo · 38:42
en-GB detectado automaticamente44.1 kHz · LAME 3.100
~90s
Transcrição · transmissãoPrecisão de 95%
S1

Então quando você percebeu que o arquivo estava incompleto?

S2

Provavelmente por volta de 2019, quando começamos a digitalizar as bobinas.

S1

E as fitas desaparecidas — foram catalogadas em algum lugar?

S2

Há um índice em papel de '78, mas metade está danificada pela água.

95% em 192 kbps estéreoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Três opções reais · comparação honesta

Whisper local grátis. Otter ou Sonix. Ou nós.

Você pode executar Whisper em seu próprio laptop gratuitamente se for técnico. Otter e Sonix aceitam uploads de MP3 dentro de painéis de assinatura. Nós pegamos o arquivo, retornamos a transcrição e não o fazemos viver dentro de uma interface.

Option 01

Whisper local / código aberto

Grátis se você tiver uma GPU e uma tarde. Sem diarização de falantes fora da caixa.

ConfiguraçãoPython + CUDA + modelos de 10 GB
Diarização de falantesNão incluído (complemento pyannote)
Velocidade · 1 hora MP35–40 min em GPU de consumo
Idiomas99, mas o modelo pequeno fica abaixo de 80%
ExportaçãoTXT / SRT / VTT / JSON
CustoGrátis + sua eletricidade
Best forEngenheiros que já possuem uma GPU, não precisam de identificação de falantes e desejam privacidade totalmente local.
Option 02

Transcription.Solutions

Solte o MP3. Obtenha texto com identificação de falantes de volta em aproximadamente tempo real × 0,025.

ConfiguraçãoArrastar e soltar, sem necessidade de conta para experimentar
Diarização de falantesIntegrado (planos Pro e Business)
Velocidade · 1 hora MP3~90 segundos
Idiomas99, detectados automaticamente
ExportaçãoSRT · VTT · DOCX · TXT · JSON
Custo · por minuto$0,03
Best forQualquer pessoa com um MP3 — gravação de jornalista, exportação de podcast, nota de voz, cópia de arquivo — que apenas deseja texto preciso no final.
Option 03

Otter / Sonix

Painel refinado, limite mensal de minutos, otimizado para inglês. Upload de arquivo parece um recurso secundário.

ConfiguraçãoConta + plano pago
Diarização de falantesAcústico, com tendência para EN
Velocidade · 1 hora MP35–10 min em fila
IdiomasOtter apenas EN; Sonix ~40
ExportaçãoBloqueado atrás de camadas pagas
Custo$17+/mês ou $10+/hora (Sonix)
Best forEquipes que desejam um editor de transcrição e interface de colaboração mais do que um fluxo limpo de arquivo→texto no estilo API.

Preços e disponibilidade de recursos precisos em maio de 2026. O desempenho do Whisper varia conforme o tamanho do modelo e o hardware.

Específico para MP3

Três coisas que pegam pessoas em ferramentas de transcrição genéricas.

MP3 é um formato, não um estilo de gravação — o que significa que os modos de falha vêm do codificador, não da fala.

O que dá errado

  1. 1Cabeçalhos VBR mal analisados. Algumas ferramentas leem MP3s de taxa variável como taxa fixa e recalculam a duração incorretamente — marcas de tempo desviam por minutos durante um arquivo de uma hora.
  2. 2Joint-stereo é achatado para mono durante pré-processamento de upload. Você perde a separação de canal por falante que realmente estava no arquivo.
  3. 3Arte incorporada do álbum ID3 faz alguns carregadores tropeçarem — eles rejeitam o arquivo como 'não é áudio puro' ou a removem e recodificam, reduzindo ainda mais a qualidade.

O que fazemos em vez disso

  1. 1Usamos o cabeçalho Xing/LAME quando presente e fallback de contagem de quadros quando não. Marcas de tempo VBR permanecem precisas em ±0,1 s em arquivos de várias horas.
  2. 2MP3s joint-stereo e true-stereo são decodificados para PCM L/R antes da diarização. Se seus falantes foram panoramizados, mantemos a separação.
  3. 3Tags ID3v1, ID3v2, APE, arte incorporada — tudo mantido intacto. Nunca recodificamos seu MP3.

Configurações recomendadas de trabalho para uploads de MP3

Padrões que funcionam em ~80% dos arquivos MP3. Substitua por trabalho no formulário.

Decodificador
Preciso de quadro, sem recodificação
Diarização
Divisão de canal se estéreo, caso contrário acústico
Modelo de falante
Automático · 1-12 falantes
Idioma
Detecção automática dos primeiros 30 s
Palavras de preenchimento
Removidas (alterne para manter)
Pacote de exportação
DOCX + SRT + TXT com marcação de tempo

Accuracy · real-world numbers

95%+ em 192 kbps estéreo. Utilizável até 64 kbps mono.

A precisão do MP3 é limitada pelo que o codificador preservou, não por nós. A compressão perceptiva acima de ~96 kbps preserva a inteligibilidade da fala muito bem; abaixo de 64 kbps, sibilantes e consoantes começam a desaparecer. Os números abaixo são de MP3s reais de clientes em produção.

96%
320 kbps estéreo, fonte de estúdio

Praticamente sem perda para fala. Podcasts mestres, exportações de aplicativos de ditado, rigs de entrevista profissional. Diarização limpa se falantes em canais separados.

95%
192 kbps estéreo, 2-3 falantes

Taxa de bits mais comum para MP3s com conteúdo falado. Exportações do Zoom, downloads do Riverside, padrão dos gravadores de voz. Artefatos de compressão inaudíveis ao reconhecedor.

91%
128 kbps mono, conversacional

Padrão de notas de voz na maioria dos telefones. Diarização acústica lida com 2-4 falantes. Números e nomes próprios ocasionalmente precisam de uma olhada.

84%
64 kbps mono, arquivo / despejo de telefone

Rips de máquinas de resposta antigas, arquivos de palestras, fontes de banda estreita. Consoantes de alta frequência (f/s/sh) ficam desfocadas. Ainda legível — planeje uma revisão.

Perguntas comuns

8 coisas que as pessoas perguntam sobre transcrição MP3.

01Qual é a taxa de bits mínima do MP3 que ainda fornece uma transcrição utilizável?+
64 kbps é o piso prático. Abaixo disso, sibilantes (s, sh, f) se comprimem em ruído e a taxa de erro de palavras sobe acima de 20%. Se você estiver gravando novo, aponte para 128 kbps mono ou 192 kbps estéreo — qualquer coisa mais alta é exagero para fala.
02Preciso converter meu MP3 para WAV primeiro?+
Não. Recodificar MP3 → WAV não adiciona precisão porque os dados que o codificador descartou desapareceram para sempre. Envie o MP3 diretamente. Decodificamos quadros em memória e alimentamos PCM ao reconhecedor.
03MP3 estéreo me dará rótulos de falantes melhores do que mono?+
Apenas se os falantes foram realmente gravados em canais separados — a maioria dos MP3s estéreo tem o mesmo áudio em ambos os lados ('dual mono') e não ganham nada. A divisão de canal real (por exemplo, exportações do Riverside, rigs de campo com dois microfones) nos permite pular a diarização acústica e rotular falantes quasi-perfeitamente.
04Qual é o tamanho máximo de arquivo MP3 que você aceita?+
5 GB por upload, o que é aproximadamente 60 horas em 192 kbps ou 90 horas em 128 kbps. Se seu arquivo for maior, mostraremos um upload em lotes — sem necessidade de dividir você mesmo.
05Quanto tempo leva para transcrever um MP3 de 60 minutos?+
Normalmente 90 segundos desde o upload completo até a transcrição pronta, independentemente da taxa de bits. Decodificar quadros MP3 é rápido; o tempo está no reconhecedor. Diarização adiciona 5-10 segundos em arquivos multi-falante.
06Meu MP3 tem música de fundo — a transcrição será arruinada?+
Música de fundo silenciosa sob a fala é bem-vinda. Música alta que compete com a voz (sintonizações de introdução, pontuação em entrevistas) às vezes dispara mal-reconhecimentos em sílabas sobrepostas. Alterne supressão de música no formulário de trabalho para pré-filtrar.
07Você pode lidar com MP3s extraídos de correio de voz de telefone ou máquinas de resposta?+
Sim, embora geralmente sejam re-codificadas como MP3 de banda estreita de 8 kHz — o teto de qualidade de áudio é definido pela captura PSTN original, não pelo wrapper MP3. Espere uma precisão de 78-85% nesse tipo de fonte, o que é o mesmo que teríamos na chamada subjacente.
08Você mantém meu MP3 após a transcrição ser concluída?+
Arquivos são deletados após 30 dias por padrão, ou imediatamente sob solicitação via painel. A transcrição permanece em sua conta até você deletá-la. Nós não usamos áudio de clientes para treinar nenhum modelo — nunca.

Solte seu MP3. Obtenha texto de volta em 90 segundos.

30 minutos grátis por mês. Sem cartão necessário. Identificação de falantes, 99 idiomas, todos os formatos de exportação inclusos.

Começar grátis