Whisper locale / open source
Gratuito se hai una GPU e un pomeriggio. Nessuna diarizzazione speaker pronta all'uso.
Carica un file MP3 a qualsiasi bitrate da 64 a 320 kbps. Ottieni una trascrizione con timestamp e etichette speaker in 99 lingue — nessuna conversione di formato, nessuna riencodifica, nessuna attesa in fila.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Guarda il risultato
Leggiamo gli header dei frame MP3 direttamente — VBR, CBR, joint-stereo, qualsiasi encoder (LAME, Fraunhofer, FFmpeg). Se il file è stereo vero con speaker su canali separati, lo usiamo per dividere le voci. Il mix-down mono ricade sulla diarizzazione acustica.
Allora, quando ti sei accorto per la prima volta che l'archivio era incompleto?
Probabilmente intorno al 2019, quando abbiamo iniziato a digitalizzare i nastri.
E i nastri mancanti — erano catalogati da qualche parte?
C'è un indice cartaceo del '78, ma metà è danneggiato dall'acqua.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Tre opzioni reali · confronto onesto
Puoi eseguire Whisper sul tuo laptop gratuitamente se hai competenze tecniche. Otter e Sonix accettano upload di MP3 nei loro dashboard a pagamento. Noi prendiamo il file, restituiamo la trascrizione e non ti facciamo vivere dentro un'interfaccia.
Gratuito se hai una GPU e un pomeriggio. Nessuna diarizzazione speaker pronta all'uso.
Carica l'MP3. Ottieni il testo con etichette speaker indietro in tempo quasi reale × 0,025.
Dashboard raffinato, limite mensile di minuti, ottimizzato per l'inglese. L'upload di file sembra una funzione secondaria.
Prezzi e disponibilità funzioni accurati a maggio 2026. Le prestazioni di Whisper variano a seconda della dimensione del modello e dell'hardware.
Specifico per MP3
MP3 è un formato, non uno stile di registrazione — il che significa che le modalità di errore provengono dall'encoder, non dal parlato.
Impostazioni predefinite che si adattano a circa l'80% dei file MP3. Sovrascrivi per lavoro dal modulo.
Accuracy · real-world numbers
La precisione MP3 è limitata da quello che l'encoder ha mantenuto, non da noi. La compressione percettiva al di sopra di ~96 kbps preserva molto bene l'intelligibilità del parlato; al di sotto di 64 kbps, le sibilanti e le consonanti iniziano a dissolversi. I numeri sottostanti provengono da veri MP3 dei clienti in produzione.
Quasi senza perdita per il parlato. Master podcast, esportazioni app di dettatura, configurazioni di interviste professionali. Diarizzazione pulita se i speaker sono su canali separati.
Bitrate più comune per MP3 di parola parlata. Esportazioni Zoom, download Riverside, impostazione predefinita dei registratori vocali. Artefatti di compressione inudibili al riconoscitore.
Impostazioni predefinite memo vocale su la maggior parte dei telefoni. La diarizzazione acustica gestisce 2-4 speaker. Numeri e nomi propri occasionalmente necessitano un controllo.
Vecchie registrazioni da segreteria telefonica, archivi di lezioni, fonti a banda stretta. Le consonanti ad alta frequenza (f/s/sh) diventano sfocate. Ancora leggibile — pianifica una correzione.
Domande comuni
30 minuti gratuiti ogni mese. Carta non richiesta. Etichette speaker, 99 lingue, ogni formato di esportazione incluso.
Inizia gratis