Transcrever arquivos WAV com identificação de falantes.Qualidade sem perdas.

Solte uma gravação WAV direto de seu equipamento de campo, bounce de DAW ou kit de entrevista. Mantemos o espaço de cabeça de 24 bits intacto, executamos diarização no PCM bruto e retornamos uma transcrição com timestamp e SRT em minutos.

Solte seu áudio ou vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Grave direto do navegador

O cadastro leva 30 segundos — a gravação abre logo em seguida, no painel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTArquivos apagados automaticamente em 24h

↓ Veja o que sai

PCM bruto entra. Transcrição limpa sai.

WAV sem perdas significa que cada sibilante, plosiva e palavra silenciosa sobrevivem intactas — sem mancha de MP3 em consoantes. Se o arquivo tiver múltiplas faixas (um falante por canal), ignoramos completamente a diarização acústica e dividimos no layout do canal.

WAV · 48 kHz / 24-bitREC 2 faixas · 1h 12m · 743 MB
detectado automaticamente en-GBPCM estéreo · não comprimido
~90s
Transcrição · streamingAcurácia de 97%
S1

Leve-me de volta para aquela manhã de setenta e oito — que horas a ligação chegou?

S2

Quinze para as cinco, mais ou menos. O bule estava ligado, lembro disso.

S1

E de lá você dirigiu direto para o porto?

S2

Direto para o estaleiro. As luzes ainda estavam acesas quando entrei.

97% em WAV por faixaSRT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Três opções reais · comparação honesta

Adobe Audition. Descript. Ou nós.

O Speech to Text do Audition é fornecido com o Creative Cloud e permanece dentro da timeline. Descript importa o WAV para seu próprio editor. Pegamos o arquivo como está, retornamos exportações padrão e não pedimos para você mover seu projeto para lugar nenhum.

Option 01

Adobe Audition / Premiere

Painel de transcrição dentro da timeline do Adobe. Vinculado ao Creative Cloud e ao arquivo do projeto.

RequerAssinatura Creative Cloud
Diarização de falantesSim, apenas combinado
WAV multifaixaNivelado antes de STT
ExportarSRT · CSV · XML
Idiomas18, seleção manual
Custo~$23/mês (aplicativo único)
Best forEditores já cortando em Premiere ou Audition que querem legendas costuradas na timeline.
Option 02

Transcription.Solutions

Solte o WAV. Diarização por canal se for multifaixa. Fonte deletada em 24h.

RequerNada — apenas o arquivo
Diarização de falantesPor faixa ou acústica
WAV multifaixaAté 16 canais
ExportarSRT · VTT · DOCX · TXT · JSON
Idiomas99, detectado automaticamente
Custo · por min$0.03
Best forQualquer pessoa com um WAV bruto — gravadores de campo, podcasters fazendo bounce de um DAW, arquivistas de história oral, pesquisadores.
Option 03

Descript

Importa seu WAV para o editor do Descript. Poderoso, mas você precisa trabalhar dentro dele.

RequerConta Descript + importação
Diarização de falantesAcústica, afinada para EN
WAV multifaixaImportar como clipes separados
ExportarTXT · SRT · DOCX
Idiomas23, precisão varia
Custo$16–24/usuário/mês
Best forEditores de podcast que querem editar o áudio editando a transcrição — o superpoder real do Descript.

Preços precisos em 2026. Os sinalizadores de recursos do Adobe e Descript mudam frequentemente; verifique a documentação atual antes de se comprometer.

Específico de WAV

Três coisas que pegam as pessoas em ferramentas de transcrição genéricas.

A maioria dos uploaders reduz silenciosamente sua taxa de amostragem WAV antes de enviá-la para um reconhecedor. Não fazemos.

O que dá errado

  1. 1WAV multifaixa fica achatado. Uma gravação de campo de 4 canais de um Sound Devices MixPre é misturada em mono antes de STT. A separação por microfone pela qual você pagou é descartada.
  2. 2WAVs de ponto flutuante de 32 bits da série Zoom F ou MixPre são rejeitados completamente, ou recortados para 16 bits e perdem sua recuperação de espaço de cabeça.
  3. 3Entrevistas de 96 kHz / 24-bit levam uma eternidade para fazer upload porque a ferramenta recodifica para MP3 no navegador antes de enviar.

O que mudar aqui

  1. 1Faça upload do WAV multifaixa como está (até 16 canais). Lemos o layout do canal do cabeçalho WAV e atribuímos um falante por faixa — sem adivinhação acústica.
  2. 2Ponto flutuante de 32 bits é aceito nativamente. Preservamos o espaço de cabeça flutuante ao normalizar para o reconhecedor, para que picos acima de 0 dBFS não sejam cortados.
  3. 3Upload binário direto, sem transcodificação no navegador. Um WAV de 2 GB se move em sua largura de banda total e começa a processar no momento em que o último byte chega.

Configurações de trabalho recomendadas para WAV

Solte um WAV e esses ativam por padrão. Anule por trabalho no formulário.

Taxa de amostragem
Nativa (sem redução)
Profundidade de bits
24-bit / 32-float preservado
Diarização
Por canal se multifaixa
Modelo de falante
Entrevista · 2-8 falantes
Palavras de preenchimento
Mantidas (desativar se necessário)
Exportação
DOCX · SRT · TXT com timestamp

Accuracy · real-world numbers

97%+ em WAV por faixa. WAV fornece ao reconhecedor o sinal mais limpo possível.

Como WAV armazena PCM bruto sem compressão perceptual, consoantes e sibilantes não são manchadas da forma como MP3 as mancha. O reconhecedor ouve o que o microfone ouviu. Os números abaixo vêm de trabalhos reais de WAV de clientes em produção.

98%
WAV de estúdio · falante único

48 kHz / 24-bit, condensador de diafragma grande, sala tratada. Narração, audiolivro, reservas de voice-over chegam aqui.

96%
WAV de entrevista multifaixa

Um canal por falante (lavs ou mics de limite). Diarização é apenas roteamento de canal — erro apenas de texto.

92%
Gravador de campo portátil

Zoom H5, Tascam DR-40, similar. Captador XY estéreo, 2-3 falantes, alguma reflexão da sala. A maioria dos WAVs de podcast chegam aqui.

85%
WAV de campo em ambiente ruidoso

Ar livre, café, veículo. A captura sem perdas ajuda — o ruído é real, não artefato de codec — mas a precisão ainda cai na fala sobreposta.

Perguntas comuns

8 coisas que as pessoas perguntam sobre transcrição WAV.

01Qual é o tamanho máximo do arquivo WAV?+
5 GB por arquivo no plano padrão, o que é aproximadamente 8 horas de estéreo 48 kHz / 24-bit, ou 2,5 horas de 96 kHz / 24-bit. Arquivos maiores estão bem no plano de equipe — apenas entre em contato conosco antes do upload.
02Você suporta WAV de ponto flutuante de 32 bits da série Zoom F ou MixPre?+
Sim, nativamente. Lemos as amostras flutuantes sem recorte em 0 dBFS, para que transientes altos que você planejou puxar em pós-processamento ainda sejam transcritos limpos. A maioria dos uploaders genéricos reduz silenciosamente para 16 bits primeiro.
03Tenho um WAV de 4 canais de um gravador de campo — um microfone por pessoa. A diarização usará isso?+
Sim. Faça upload do WAV polifônico diretamente (não faça bounce para estéreo primeiro). Analisamos o layout do canal do cabeçalho WAV e atribuímos um falante por faixa — muito mais confiável do que diarização acústica em vozes similares.
04Você fará downsampling do meu WAV de 96 kHz?+
O reconhecedor funciona internamente a 16 kHz — esse é o teto da inteligibilidade da fala humana. Mas mantemos seu arquivo original intacto e o usamos para qualquer pós-processamento, como noise gating. Suas exportações fazem referência à timeline original.
05WAV é realmente mais preciso que MP3 para transcrição?+
Marginalmente, sim — geralmente 1-2 pontos de WER em fala limpa. A maior lacuna aparece em sibilantes e passagens silenciosas, onde a compressão psicoacústica do MP3 descarta informações que o reconhecedor teria usado. Para trabalho de arquivo ou forense, WAV é a escolha certa.
06Os metadados BWF e timecode são preservados?+
Lemos chunks BWF (bext, iXML) e usamos o timecode de início para alinhar a transcrição à sua timeline de sessão. O WAV original nunca é modificado — trabalhamos em uma cópia que é deletada em 24h.
07Posso soltar uma pasta de arquivos WAV de uma exportação de sessão DAW?+
Sim. O upload em lote aceita até 50 arquivos por vez. Cada WAV recebe seu próprio trabalho e transcrição. Se forem stems de uma sessão, você também pode mesclá-los em um único WAV multifaixa antes do upload e faremos diarização por canal.
08Quanto tempo leva um WAV estéreo de 1 hora?+
O upload é a parte mais lenta — um WAV estéreo de 1 hora 48 kHz / 24-bit tem cerca de 600 MB e leva 2-5 minutos em banda larga típica. Após o upload, a própria transcrição é executada em aproximadamente 4-6 minutos na fila padrão.

Solte seu WAV. Mantenha a qualidade sem perdas. Veja o que sai.

30 minutos gratuitos todos os meses. Sem cartão. Diarização por faixa, ponto flutuante de 32 bits suportado, áudio de origem deletado em 24h.

Começar grátis