Transkrybuj pliki WAV z przypisaniem mówców.Bez strat jakości.

Wrzuć nagranie WAV prosto z rejestratora polowego, DAW lub zestawu do wywiadów. Zachowujemy 24 bity headroomu, uruchamiamy diaryzację na surowym PCM i zwracamy transkrypt ze znacznikami czasu i SRT w kilka minut.

Wrzuć audio lub wideo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Nagrywaj prosto z przeglądarki

Rejestracja zajmuje 30 sekund — nagrywanie otwiera się od razu po niej, w panelu.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTPliki znikają automatycznie po 24 h

↓ Zobacz co wychodzi

Surowe PCM na wejściu. Czysty transkrypt na wyjściu.

Bezstratny WAV oznacza, że każdy sybiland, eksplozja i ciche słowo przetrwa nienaruszone — brak zniekształceń MP3 spowodowanych spółgłoskami. Jeśli plik jest wielościeżkowy (jeden mówca na kanał), pomijamy diaryzację akustyczną i dzielimy na podstawie układu kanałów.

WAV · 48 kHz / 24-bitREC 2 kanały · 1h 12m · 743 MB
auto-detekт en-GBstereo PCM · bez kompresji
~90s
Transkrypt · strumieniowy97% dokładności
S1

Zabierz mnie z powrotem do tamtego poranka w siedemdziesiątym ósmym roku — o której godzinie przyszło wezwanie?

S2

Za piętnaście piąta, mniej więcej. Czajnik był już włączony, pamiętam dokładnie.

S1

I stąd pojechałeś prosto do portu?

S2

Wprost do stoczni. Światła jeszcze świeciły, gdy podjechałem.

97% na WAV z diaryzacją na kanałSRT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Trzy realne opcje · szczera ocena

Adobe Audition. Descript. Albo my.

Speech to Text z Audition jest dołączony do Creative Cloud i zostaje na osi czasu. Descript importuje WAV do własnego edytora. My bierzemy plik takim jaki jest, zwracamy standardowe eksporty i nie prosimy ciebie aby przenosił projekt gdziekolwiek.

Option 01

Adobe Audition / Premiere

Panel transkryptu wewnątrz osi czasu Adobe. Związany z Creative Cloud i plikiem projektu.

WymagaSubskrypcja Creative Cloud
Diaryzacja mówcówTak, tylko zmixowany
Wielościeżkowy WAVSpłaszczany przed STT
EksportSRT · CSV · XML
Języki18, wybór ręczny
Koszt~$23/mies (aplikacja pojedyncza)
Best forEdytorzy pracujący w Premiere lub Audition, którzy chcą napisy powiązane z osią czasu.
Option 02

Transcription.Solutions

Wrzuć WAV. Diaryzacja na kanał jeśli wielościeżkowy. Źródło usunięte w 24h.

WymagaNic — tylko plik
Diaryzacja mówcówNa kanał lub akustyczna
Wielościeżkowy WAVDo 16 kanałów
EksportSRT · VTT · DOCX · TXT · JSON
Języki99, auto-detekt
Koszt · za minutę$0.03
Best forKażdy kto ma surowy WAV — reporterzy polowi, podcasterzy bounce z DAW, archiwiści historii ustnej, badacze.
Option 03

Descript

Importuje twój WAV do edytora Descript. Potężny, ale musisz pracować wewnątrz niego.

WymagaKonto Descript + import
Diaryzacja mówcówAkustyczna, dostrojona ENG
Wielościeżkowy WAVImport jako osobne klipy
EksportTXT · SRT · DOCX
Języki23, dokładność zmienna
Koszt$16–24/użytkownik/mies
Best forEdytorzy podcastów którzy chcą edytować audio poprzez edycję transkryptu — rzeczywista supermoc Descript.

Ceny aktualne na 2026 rok. Flagi funkcji Adobe i Descript zmieniają się często; sprawdź bieżącą dokumentację przed podjęciem decyzji.

Specyficzne dla WAV

Trzy rzeczy które zaskakują ludzi na generycznych narzędziach transkrypcji.

Większość uploaderów po cichu zmniejsza próbkowanie twojego WAV przed wysłaniem go do rozpoznawacza. My nie.

Co idzie nie tak

  1. 1Wielościeżkowy WAV zostaje spłaszczony. 4-kanałowe nagranie polowe z Sound Devices MixPre zostaje zmixowane do mono przed STT. Separacja na mikrofilm za którą zapłaciłeś zostaje wyrzucona.
  2. 232-bitowe float WAV z serii Zoom F lub MixPre są odrzucane całkowicie, albo obcinane do 16-bit i tracą możliwość odzyskania headroomu.
  3. 396 kHz / 24-bit wywiady wiecznie się przesyłają ponieważ narzędzie transkoduje do MP3 w przeglądarce przed wysłaniem.

Co zmienić tutaj

  1. 1Załaduj wielościeżkowy WAV jaki jest (do 16 kanałów). Czytamy układ kanałów z nagłówka WAV i przypisaliśmy jeden mówca na ścieżkę — bez akustycznych zgadywań.
  2. 232-bit float jest akceptowany natywnie. Zachowujemy float headroom przy normalizacji dla rozpoznawacza, więc szczyty powyżej 0 dBFS nie są obcinane.
  3. 3Bezpośredni upload binarny, brak transkodu w przeglądarce. 2 GB WAV porusza się z pełną przepustowością i zaczyna przetwarzanie w momencie kiedy ostatni bajt sądzi.

Zalecane ustawienia zadania dla WAV

Wrzuć WAV i te ustawienia włączają się domyślnie. Przesłań per-zadanie z formularza.

Szybkość próbkowania
Natywna (bez zmniejszenia)
Głębia bitu
24-bit / 32-float zachowany
Diaryzacja
Na kanał jeśli wielościeżkowy
Model mówcy
Wywiad · 2-8 mówców
Słowa wypełniające
Zachowane (przełącz jeśli trzeba)
Eksport
DOCX · SRT · TXT ze znacznikami czasu

Accuracy · real-world numbers

97%+ na WAV z diaryzacją na kanał. WAV daje rozpoznawaczowi czystszy możliwy sygnał.

Ponieważ WAV przechowuje surowy PCM bez kompresji percepcyjnej, spółgłoski i sybillanty nie są zniekształcane jak w MP3. Rozpoznawacz słyszy to co słyszał mikrofon. Liczby poniżej pochodzą z rzeczywistych zadań WAV od klientów w produkcji.

98%
WAV studyjny · jeden mówca

48 kHz / 24-bit, duża membrana, akustycznie przygotowany pokój. Narracja, audiobook, voice-over pracują tutaj.

96%
Wielościeżkowy WAV wywiadu

Jeden kanał na mówcę (lavalier lub mikrofony graniczne). Diaryzacja to zwyczajnie routing kanałów — błąd tekstu.

92%
Przenośny rejestrator polowy

Zoom H5, Tascam DR-40, podobne. Pickup stereo XY, 2-3 mówcy, odbicia od pomieszczeń. Większość podcastów WAV trafia tutaj.

85%
WAV z hałasem środowiska

Na zewnątrz, kawiarnia, pojazd. Bezstratna rejestracja pomaga — hałas jest rzeczywisty, nie artefakt kodeka — ale dokładność spada przy zachodzących na siebie mowach.

Częste pytania

8 rzeczy które ludzie pytają o transkrypcję WAV.

01Jaka jest maksymalna wielkość pliku WAV?+
5 GB na plik w planie standardowym, co to mniej więcej 8 godzin stereo 48 kHz / 24-bit, albo 2,5 godzin 96 kHz / 24-bit. Większe pliki są w porządku w planie zespołowym — skontaktuj się z nami przed uploadem.
02Czy obsługujecie 32-bitowe float WAV z Zoom F-series lub MixPre?+
Tak, natywnie. Czytamy float samples bez obcinania na 0 dBFS, więc głośne transjenty które planowałeś ściągnąć w post nadal są transkrybowane czyszczą. Większość generycznych uploaderów po cichu rzutuje do 16-bit najpierw.
03Mam 4-kanałowy WAV z rejestatora — jeden mikrofon na osobę. Czy diaryzacja to wykorzysta?+
Tak. Załaduj polyphoniczny WAV bezpośrednio (nie robić bounce do stereo najpierw). Parsujemy układ kanałów z nagłówka WAV i przypisujemy jednego mówcę na ścieżkę — znacznie bardziej niezawodnie niż diaryzacja akustyczna na podobnych głosach.
04Czy zmniejszycie moją próbkowanie mojego 96 kHz WAV?+
Rozpoznawacz pracuje na 16 kHz wewnętrznie — to pułap ludzkiej inteligencji mowy. Ale zachowujemy oryginalny plik niezmieniony i używamy go do przetwarzania pośle jak gating szumu. Twoje eksporty odwołują się do oryginalnej osi czasu.
05Czy WAV jest faktycznie dokładniejszy niż MP3 do transkrypcji?+
Marginalnie, tak — zwykle 1-2 punkty WER na czystej mowie. Większa luka pojawia się na sybilantach i cichych fragmentach, gdzie kompresja psychoakustyczna MP3 odrzuca informacje które rozpoznawacz by wykorzystał. Do archiwów lub pracy sądowej WAV to właściwy wybór.
06Czy metadane BWF i timecode są zachowane?+
Czytamy chunki BWF (bext, iXML) i używamy timecode początkowego do wyrównania transkryptu do osi czasu twojej sesji. Oryginalny WAV nigdy nie jest modyfikowany — pracujemy na kopii która jest usunięta w ciągu 24h.
07Czy mogę wrzucić folder plików WAV z eksportu sesji DAW?+
Tak. Batch upload akceptuje do 50 plików naraz. Każdy WAV otrzymuje swoje zadanie i transkrypt. Jeśli to stemy z jednej sesji, możesz również zmergować je w jeden wielościeżkowy WAV przed uploadem i diaryzujemy na kanał.
08Jak długo trwa faktycznie 1-godzinny stereo WAV?+
Upload to najwolniejsza część — 1-godzinny 48 kHz / 24-bit stereo WAV to około 600 MB i trwa 2-5 minut na typowym broadbandzie. Po załadowaniu, transkrypcja sama w sobie uruchamia się w mniej więcej 4-6 minut w standardowej kolejce.

Wrzuć twój WAV. Zachowaj bezstratną jakość. Sprawdź co wychodzi.

30 minut bezpłatnie co miesiąc. Bez karty. Diaryzacja na kanał, 32-bit float wspierany, pierwotny plik audio usunięty w 24h.

Zacznij za darmo