Whisper local / codi obert
Gratis si tens una GPU i una tarda. Sense diarització de parlants per defecte.
Deixa un fitxer MP3 a qualsevol taxa de bits de 64 a 320 kbps. Obtén una transcripció amb marca de temps i etiquetes d'orador en 99 idiomes — sense conversió de format, sense recodificació, sense cues.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Mira què surt
Llegim els capçaleres de marc MP3 directament — VBR, CBR, joint-stereo, qualsevol codificador (LAME, Fraunhofer, FFmpeg). Si el fitxer és veritable estèreo amb parlants en canals separats, ho fem servir per separar veus. La barreja mono torna a la diarització acústica.
Aleshores, quan et vas adonar que l'arxiu era incomplet?
Probablement el 2019, quan vam començar a digitalitzar els carrets.
I les cintes que faltaven — estaven catalogades en algun lloc?
Hi ha un índex en paper del 78, però la meitat està malmesa per l'aigua.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Tres opcions reals · comparació honesta
Pots executar Whisper al teu portàtil gratis si ets tècnic. Otter i Sonix accepten pujades d'MP3 dins de quadres de control de subscripció. Nosaltres agafem el fitxer, retornem la transcripció i no et fem viure dins una interfície.
Gratis si tens una GPU i una tarda. Sense diarització de parlants per defecte.
Deixa l'MP3. Obtén text amb etiquetes de parlant en aproximadament temps real × 0,025.
Quadre de control polidor, límit de minuts mensuals, ajustat a l'anglès. La pujada de fitxers sembla una característica secundària.
Preu i disponibilitat de característiques exactes a partir de maig de 2026. El rendiment de Whisper varia segons la mida del model i el maquinari.
Específic per a MP3
MP3 és un format, no un estil de gravació — el qual significa que els modes de fallada provenen del codificador, no de la parla.
Valors per defecte que s'ajusten a ~80% dels fitxers MP3. Substitueix per treball del formulari.
Accuracy · real-world numbers
La precisió d'MP3 està limitada per el que l'codificador va mantenir, no per nosaltres. La compressió perceptiva per sobre de ~96 kbps conserva molt bé la intel·ligibilitat de la parla; per sota de 64 kbps, els sibilants i les consonants comencen a dissoldre's. Els números següents provenen d'MP3 reals de clients en producció.
Gairebé sense pèrdua per a la parla. Masters de podcast, exportacions d'aplicació de dictat, rigs d'entrevista professional. Diarització clara si els parlants estan en canals separats.
Taxa de bits més comuna per a MP3s de parla. Exportacions Zoom, descàrregues Riverside, registradors de veu per defecte. Els artefactes de compressió són inaudibles per al reconeixedor.
Defaults de nota de veu a la majoria de telèfons. La diarització acústica maneja 2-4 parlants. Els números i noms propis ocasionalment necessiten una ullada.
Ripis de secretaris automàtics antics, arxius de lectures, fonts de banda estreta. Les consonants d'alta freqüència (f/s/sh) es difuminen. Encara legible — planifica una revisió.
Preguntes comuns
30 minuts gratis cada mes. Sense targeta necessària. Etiquetes d'orador, 99 idiomes, tot format d'exportació inclòs.
Comença gratis