Transcreva arquivos WAV com identificação de palestrante.Qualidade lossless.

Solte uma gravação WAV direto do seu equipamento de campo, bounce de DAW ou kit de entrevista. Mantemos os 24 bits de headroom intactos, rodamos diarização no PCM bruto e retornamos uma transcrição com marcação de tempo e SRT em minutos.

Solte seu áudio ou vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Grave diretamente do seu navegador

O cadastro leva 30 segundos — a gravação abre logo após, no painel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTArquivos são excluídos automaticamente em 24h

↓ Veja o que sai

PCM bruto. Transcrição limpa.

WAV lossless significa que cada sibilante, plosiva e palavra fraca sobrevivem intactas — nenhuma mancha MP3 em consoantes. Se o arquivo for multi-faixa (um palestrante por canal), pulamos a diarização acústica completamente e separamos no layout do canal.

WAV · 48 kHz / 24-bitREC 2 faixas · 1h 12m · 743 MB
en-GB detectado automaticamentePCM estéreo · não comprimido
~90s
Transcrição · streamingPrecisão de 97%
S1

Leve-me de volta àquele dia de setenta e oito — que horas a chamada chegou?

S2

Quinze para as cinco, mais ou menos. A chaleira estava ligada, lembro disso.

S1

E dali você foi direto ao porto?

S2

Direto ao estaleiro. As luzes ainda estavam acesas quando entrei.

Precisão de 97% em WAV por faixaSRT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Três opções reais · comparação honesta

Adobe Audition. Descript. Ou nós.

O áudio para texto do Audition vem em pacote com a Creative Cloud e fica dentro da linha do tempo. Descript importa o WAV em seu próprio editor. Nós pegamos o arquivo como está, retornamos exportações padrão e não pedimos para você mover seu projeto para nenhum lugar.

Option 01

Adobe Audition / Premiere

Painel de transcrição dentro da linha do tempo do Adobe. Vinculado à Creative Cloud e ao arquivo de projeto.

RequerAssinatura Creative Cloud
Diarização de palestranteSim, apenas mesclado
WAV multi-faixaAchatado antes de STT
ExportaçãoSRT · CSV · XML
Idiomas18, seleção manual
Custo~$23/mês (app único)
Best forEditores que já cortam em Premiere ou Audition e querem legendas costuradas na linha do tempo.
Option 02

Transcription.Solutions

Solte o WAV. Diarização por canal se for multi-faixa. Fonte deletada em 24h.

RequerNada — só o arquivo
Diarização de palestrantePor faixa ou acústica
WAV multi-faixaAté 16 canais
ExportaçãoSRT · VTT · DOCX · TXT · JSON
Idiomas99, detectado automaticamente
Custo · por minuto$0,03
Best forQualquer um com um WAV bruto — gravadores de campo, podcasters fazendo bounce de uma DAW, arquivistas de história oral, pesquisadores.
Option 03

Descript

Importa seu WAV para o editor Descript. Poderoso, mas você precisa trabalhar dentro dele.

RequerConta Descript + importação
Diarização de palestranteAcústica, otimizada para EN
WAV multi-faixaImporta como clipes separados
ExportaçãoTXT · SRT · DOCX
Idiomas23, precisão varia
Custo$16–24/usuário/mês
Best forEditores de podcast que querem editar o áudio editando a transcrição — isso é o verdadeiro diferencial do Descript.

Preços precisos em 2026. As flags de recurso do Adobe e Descript mudam frequentemente; verifique a documentação atual antes de se comprometer.

Específico para WAV

Três coisas que pegam as pessoas em ferramentas de transcrição genéricas.

A maioria dos carregadores redimensiona silenciosamente seu WAV antes de enviá-lo a um reconhecedor. Nós não fazemos.

O que dá errado

  1. 1Um WAV multi-faixa é achatado. Uma gravação de 4 canais de um gravador de campo Sound Devices MixPre é misturada para mono antes do STT. A separação por microfone que você pagou é descartada.
  2. 2WAVs float de 32 bits do Zoom F-series ou MixPre são rejeitados completamente, ou cortados para 16 bits e perdem sua recuperação de headroom.
  3. 3Entrevistas de 96 kHz / 24 bits levam uma eternidade para fazer upload porque a ferramenta recodifica para MP3 no navegador antes de enviar.

O que mudar aqui

  1. 1Carregue o WAV multi-faixa como está (até 16 canais). Lemos o layout do canal do cabeçalho WAV e atribuímos um palestrante por faixa — sem adivinhação acústica.
  2. 2Float de 32 bits é aceito nativamente. Preservamos o headroom float ao normalizar para o reconhecedor, então picos acima de 0 dBFS não são cortados.
  3. 3Upload binário direto, nenhuma transcodificação no navegador. Um WAV de 2 GB se move na sua largura de banda máxima e começa a processar no momento em que o último byte chega.

Configurações de trabalho recomendadas para WAV

Solte um WAV e estas ficam ativadas por padrão. Anule configurações por trabalho a partir do formulário.

Taxa de amostragem
Nativa (sem redimensionamento)
Profundidade de bit
24-bit / 32-float preservados
Diarização
Por canal se multi-faixa
Modelo de palestrante
Entrevista · 2-8 palestrantes
Palavras de preenchimento
Mantidas (desativar se necessário)
Exportação
DOCX · SRT · TXT com marcação de tempo

Accuracy · real-world numbers

97%+ em WAV por faixa. WAV oferece ao reconhecedor o sinal mais limpo possível.

Como WAV armazena PCM bruto sem compressão perceptual, consoantes e sibilantes não são manchadas da maneira como MP3 as mancha. O reconhecedor ouve o que o microfone ouviu. Os números abaixo vêm de trabalhos reais de WAV de clientes em produção.

98%
WAV de estúdio · palestrante único

48 kHz / 24-bit, microfone condensador de grande diafragma, sala tratada. Narração, audiobook e trabalhos de voice-over se encaixam aqui.

96%
WAV de entrevista multi-faixa

Um canal por palestrante (microfones de lapela ou boundary). Diarização é apenas roteamento de canal — erro apenas de texto.

92%
Gravador de campo portátil

Zoom H5, Tascam DR-40, similares. Captação estéreo XY, 2-3 palestrantes, algo de reflexão da sala. A maioria dos WAVs de podcast se encaixa aqui.

85%
WAV de campo em ambiente ruidoso

Outdoor, café, veículo. A captura lossless ajuda — o ruído é real, não artefato de codec — mas a precisão ainda cai na fala sobreposta.

Perguntas comuns

8 coisas que as pessoas perguntam sobre transcrição de WAV.

01Qual é o tamanho máximo do arquivo WAV?+
5 GB por arquivo no plano padrão, que é aproximadamente 8 horas de estéreo 48 kHz / 24-bit, ou 2,5 horas de 96 kHz / 24-bit. Arquivos maiores funcionam bem no plano de equipe — apenas entre em contato conosco antes do upload.
02Vocês suportam WAV float de 32 bits do Zoom F-series ou MixPre?+
Sim, nativamente. Lemos as amostras float sem corte em 0 dBFS, então os transientes altos que você planejava reduzir em pós-produção ainda são transcritos com clareza. A maioria dos carregadores genéricos converte silenciosamente para 16 bits primeiro.
03Tenho um WAV de 4 canais de um gravador de campo — um microfone por pessoa. A diarização vai usar isso?+
Vai usar. Carregue o WAV polifônico diretamente (não faça bounce para estéreo primeiro). Analisamos o layout do canal do cabeçalho WAV e atribuímos um palestrante por faixa — muito mais confiável que diarização acústica em vozes similares.
04Vocês vão redimensionar meu WAV de 96 kHz?+
O reconhecedor roda em 16 kHz internamente — esse é o teto da inteligibilidade da fala humana. Mas mantemos seu arquivo original intacto e o usamos para qualquer pós-processamento como noise gating. Suas exportações referenciam a linha do tempo original.
05WAV é realmente mais preciso que MP3 para transcrição?+
Marginalmente, sim — geralmente 1-2 pontos de WER em fala limpa. A lacuna maior aparece em sibilantes e passagens quietas, onde a compressão psicoac ústica MP3 descarta informações que o reconhecedor teria usado. Para trabalho de arquivo ou forense, WAV é a escolha certa.
06Os metadados BWF e timecode são preservados?+
Lemos chunks BWF (bext, iXML) e usamos o timecode inicial para alinhar a transcrição à sua linha do tempo de sessão. O WAV original nunca é modificado — trabalhamos em uma cópia que é deletada dentro de 24h.
07Posso soltar uma pasta de arquivos WAV de uma exportação de sessão DAW?+
Sim. O upload em lote aceita até 50 arquivos por vez. Cada WAV tem seu próprio trabalho e transcrição. Se forem stems de uma sessão, você também pode mesclá-los em um único WAV multi-faixa antes do upload e faremos diarização por canal.
08Quanto tempo de fato demora um WAV estéreo de 1 hora?+
O upload é a parte mais lenta — um WAV estéreo de 1 hora 48 kHz / 24-bit tem cerca de 600 MB e leva 2-5 minutos em banda larga típica. Uma vez carregado, a transcrição em si roda em aproximadamente 4-6 minutos na fila padrão.

Solte seu WAV. Mantenha a qualidade lossless. Veja o que sai.

30 minutos grátis por mês. Sem cartão. Diarização por faixa, float de 32 bits suportado, áudio-fonte deletado em 24h.

Comece grátis