Whisper helyi / nyílt forráskódú
Ingyenes, ha van GPU-d és egy délutanod. Speaker diárizálás nincs a dobozban.
Dobj egy MP3 fájlt bármilyen bitrátán 64–320 kbps között. Kapj egy időbélyeggel és beszélőjelölésekkel ellátott szöveget 99 nyelven — nincs formátum konvertálás, nincs újrakódolás, nincs sorban állás.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Nézd meg, mi jön ki
Az MP3 frame headereket közvetlenül olvassuk — VBR, CBR, joint-stereo, bármilyen kódoló (LAME, Fraunhofer, FFmpeg). Ha a fájl valódi sztereo, külön csatornákon lévő beszélőkkel, azt használjuk a hangok szétválasztásához. A mono mix-down akusztikus diárizálásra esik vissza.
Szóval mikor vetted észre először, hogy az archívum hiányos?
Valószínűleg 2019 körül, amikor elkezdtük a tekercseket digitalizálni.
A hiányzó szalagokat — katalogizálták-e ezt bárki valahol?
Van egy papír alapú index a '78-ból, de fele vízroncsolódott.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Három valódi lehetőség · őszinte összehasonlítás
Lefuttathatod a Whisper-t ingyen a saját gépeden, ha technikai-szempontból jártas vagy. Az Otter és Sonix elfogadja az MP3 feltöltéseket előfizetési irányítópultokon belül. Mi vagyunk azok, akik a fájlt, visszaadjuk a szöveget, és nem kötünk téged egy felhasználói felülethez.
Ingyenes, ha van GPU-d és egy délutanod. Speaker diárizálás nincs a dobozban.
Dobd el az MP3-at. Kapj speaker-jelölt szöveget vissza nagyjából valós időben × 0.025.
Csiszolt irányítópult, havi percek limitálva, angol-optimalizált. A fájl feltöltése egy oldaljellegzetes funkciónak tűnik.
Árazás és funkcióelérhetőség pontos 2026. május szerint. Whisper teljesítmény a modell méretétől és hardvertől függ.
Specifikus az MP3-hoz
Az MP3 egy formátum, nem egy rögzítési stílus — which azt jelenti, hogy a kudarc módjai az encoder-ből, nem a beszédből jönnek.
Alapértelmezettei ~80% MP3-fájlhoz illeszkednek. Bírálatot per-job-ként az űrlapról.
Accuracy · real-world numbers
Az MP3 pontossága az encoder által megőrzöttekre korlátozódik, nem ránk. A ~96 kbps feletti percepcionális tömörítés nagyon jól megőrzi a beszéd értelmezhetőségét; 64 kbps alatt a sibilánsok és mássalhangzók kezdenek feloldódni. Az alábbi számok valós ügyfél MP3-okból származnak a termelésben.
Szinte veszteségmentesség a beszédhez. Podcast mesterek, diktálóalkalmazás exportok, professzionális interjúkészülékek. Diárizálás tiszta, ha beszélők külön csatornákon vannak.
A leggyakoribb bitráta beszélt szöveges MP3-okhoz. Zoom exportok, Riverside letöltések, hangrögzítők alapértelmezés. Tömörítési artefaktumok nem hallhatók az felismerő számára.
Hangüzenet alapértelmezettei a legtöbb telefonon. Az akusztikus diárizálás kezel 2-4 beszélőt. A számok és tulajdonnevek időnként igényelnek egy pillantást.
Régi válaszcsatorna-gépek rip-jei, előadás archívumok, szűkkeblű források. A magas frekvenciájú mássalhangzók (f/s/sh) elmosódnak. Még mindig olvasható — tervezz proofread-ot.
Gyakori kérdések
Ingyenes 30 perc havonta. Nincs szükség kártyára. Speaker jelölések, 99 nyelvek, minden export formátum tartalmazza.
Ingyenes indítás