Przejdź do treści

Dźwięk na tekst, bez upload.

Wrzuć plik MP3, WAV, M4A lub wideo i odzyskaj tekst. Bez limitu długości, bez konta, a nagranie nigdy nie opuszcza Twojego komputera. Eksportuj zwykły tekst, tekst ze znacznikiem czasu lub plik .srt.

Działa na Twoim komputerze · Brak przesyłania · Brak ograniczenia długości

Modelka

Zaczynam od transcription w górę

Upuść plik audio lub wideo

MP3, WAV, M4A, MP4, MOV – dowolna długość

O tym narzędziu

Jak działa ten darmowy i dokładny konwerter audio na tekst

Upuść plik na stronie i po kolei dzieją się trzy rzeczy. Twoja przeglądarka dekoduje ścieżkę audio na surowy dźwięk. Model mowy jest pobierany raz i zapisywany w pamięci podręcznej, więc przy drugim transkrypcji pliku pomija się to oczekiwanie. Następnie model odczytuje dźwięk i zapisuje tekst na Twoim komputerze, korzystając z własnego procesora lub karty graficznej.

Do wyboru są dwa modele. Ta szybka jest dostępna tylko w języku angielskim i zajmuje około 44 MB, co jest właściwym wyborem w przypadku notatki głosowej, solowego podcastu lub wykładu w języku angielskim, w którym głównie chcesz szybko przeczytać tekst. Zrównoważony jest wielojęzyczny i zajmuje około 80MB. Pobiera się go wolniej i działa wolniej, a także lepiej radzi sobie z akcentami, cichszymi nagraniami i wszystkim, co nie jest w języku angielskim.

Maszyny z WebGPU działają kilka razy szybciej niż w czasie rzeczywistym. Starsze przeglądarki wracają do wolniejszej ścieżki, która nadal działa, tylko zajmuje to więcej czasu. Tak czy inaczej, praca odbywa się lokalnie, więc nic na temat Twojego pliku nie jest nigdzie wysyłane.

Jakie formaty audio i wideo mogę transkrybować?

Wszystkie pliki MP3, WAV, M4A, FLAC i OGG działają, podobnie jak ścieżka dźwiękowa większości filmów MP4 i MOV. Narzędzie odczytuje dźwięk i ignoruje obraz, więc wystarczy nagranie ekranu, eksport Zoom lub wideo nagrane telefonem.

Obsługa formatów pochodzi z dekodera audio Twojej przeglądarki, a nie z utrzymywanej przez nas listy, co oznacza, że większość rzeczy działa, a kilka nietypowych kodeków nie. Jeśli plik zostanie odrzucony, wyeksportowanie go w formacie MP3 lub WAV w dowolnym edytorze lub w programie QuickTime rozwiąże problem.

Długość ma znacznie większe znaczenie niż rozmiar pliku. Duży bezstratny plik WAV z dziesięciominutową przemową kończy się na długo przed małym plikiem MP3 z dwugodzinnego panelu, ponieważ w modelu liczy się czas odczytu, a nie megabajty. Mocno skompresowane nagrania, które po przejściu przez aplikację do czatu brzmią cienko i pusto, powodują więcej błędów, dlatego jeśli nadal je masz, użyj oryginalnego pliku.

Transkrypcja długiego dźwięku bez ograniczeń długości

Większość darmowych narzędzi w tej kategorii Cię gdzieś ogranicza. Dziesięć minut na pierwszym pliku, trzy pliki dziennie po trzydzieści minut każdy, miesięczny limit minut lub poziom bezpłatny, który tak naprawdę jest okresem próbnym z kartą na końcu. Ograniczenia te istnieją, ponieważ nagranie jest przesyłane na serwer i ktoś musi zapłacić za czas przetwarzania.

Nic nie jest tutaj przesyłane, więc nie ponosimy żadnych kosztów za ograniczenie. Trzygodzinna rozmowa kwalifikacyjna jest traktowana tak samo, jak trzydziestosekundowa notatka głosowa. Nie ma dziennego limitu, kolejki ani konta, na którym można by osiągnąć limit.

Prawdziwymi ograniczeniami są Twoja cierpliwość i sprzęt. Długi plik sprawia, że ​​karta przeglądarki jest zajęta przez jakiś czas i karta ta musi pozostać otwarta, więc rozpocznij dwugodzinne nagrywanie, kiedy możesz zostawić laptopa samego na kilka minut. Jeśli możesz, trzymaj kartę na pierwszym planie, ponieważ przeglądarki spowalniają karty działające w tle.

Transkrypuj dźwięk bez przesyłania go na serwer

Brak przesyłania jest tutaj faktem strukturalnym, a nie polityką, o którą prosimy Cię, abyś przyjął ją na wiarę. Plik modelu zostanie pobrany do Twojej przeglądarki i od tego momentu dźwięk, model i gotowy tekst będą znajdować się w tej samej zakładce na Twoim komputerze.

Możesz to sprawdzić sam. Załaduj stronę, poczekaj, aż model zakończy pobieranie, wyłącz Wi-Fi, a następnie upuść plik. Nadal się transkrybuje.

Ma to największe znaczenie, gdy nagranie nie jest Twoją własnością i nie możesz go przekazać. Rozmowy z klientami, rozmowy z pacjentami, spotkania HR, wywiady badawcze objęte formularzem zgody, materiały niepublikowane objęte embargiem. Przesłanie dowolnego z nich do bezpłatnego narzędzia internetowego powoduje przeniesienie ich do infrastruktury innej osoby i do zasad przechowywania innej osoby.

Nie będziemy twierdzić, że dzięki temu narzędzie jest zgodne z jakimkolwiek konkretnym przepisem, ponieważ to zależy od Twojej organizacji i od tego, co później zrobisz z transkrypcją. Możemy wyraźnie powiedzieć, że ta strona w ogóle nie przesyła Twojego nagrania.

Eksportuj zwykły tekst, tekst ze znacznikiem czasu lub plik SRT

Jedno uruchomienie daje trzy eksporty.

Zwykły tekst to transkrypcja w postaci ciągłej prozy, gotowa do wklejenia do dokumentu, e-maila lub notatki. Tego właśnie oczekuje większość ludzi od rozmowy kwalifikacyjnej lub wykładu.

Tekst ze znacznikiem czasu umieszcza znacznik czasu w każdej linii. Używaj go, gdy chcesz znaleźć moment, w którym ktoś coś powiedział: wyciągaj cytaty, sprawdzaj roszczenia na taśmie lub pisz notatki z programów ze znacznikami rozdziałów.

SRT to format napisów czytany przez edytory wideo, YouTube, Vimeo i większość odtwarzaczy. Upuść plik obok swojego filmu, a podpisy będą zgodne z przemową.

Możesz skopiować dowolne z trzech do schowka lub pobrać je jako plik. Nic nie jest przechowywane pomiędzy wizytami, więc zapisz to, czego potrzebujesz, zanim zamkniesz kartę. Jeśli napisy są jedynym powodem, dla którego tu przyszedłeś, nasz generator napisów korzysta z tego samego silnika, a przepływ pracy opiera się na taktowaniu sygnału i długości linii.

Czego nie może zrobić: rozróżnienia głośników

Nie jest w stanie rozpoznać, kto mówi. Wywiad z dwiema osobami to jeden ciągły blok tekstu bez etykiet. To jedyna rzecz, której darmowe narzędzie tak naprawdę nie robi i wolelibyśmy to powiedzieć tutaj, niż pozwolić ci dowiedzieć się, ile godzin minęło od nagrania.

Powodem jest waga. Dzielenie nagrania na głos wymaga drugiego modelu działającego równolegle z transkrypcją, porównującego każdy segment mowy z każdym innym. To zbyt wiele, aby wymagać od strony internetowej, która już pobrała model mowy, a złe wykonanie tego jest gorsze niż nie zrobienie tego, ponieważ naprawienie transkrypcji z dołączonymi błędnymi nazwami zajmuje więcej czasu niż transkrypcji bez nazw.

Jeśli kto powiedział, jaki jest cały sens nagrania, aplikacja komputerowa Yaps tworzy transkrypcje spotkań i wywiadów z etykietami prelegentów na Twoim własnym komputerze, przy tej samej zasadzie bez przesyłania. Dla jednego głośnika ta strona wystarczy.

Transkrypcja wywiadów, wykładów, podcastów i notatek głosowych

Dziennikarze używają tego do nagrywania taśm z wywiadami, a to właśnie jest materiał, którego nie należy przekazywać do darmowego serwisu internetowego. Studenci przepisują nagrane wykłady, a następnie wyszukują w tekście część, której dotyczy egzamin. Podcasterzy pobierają notatki i cytaty z odcinków, zanim trafią one do redaktora. Badacze przepuszczają za jego pośrednictwem nagrania terenowe, nie łamiąc przy tym zgody etycznej, która stanowi, że dźwięk pozostaje na zatwierdzonych urządzeniach.

Zespoły wsparcia i sprzedaży transkrybują nagrania rozmów, aby znaleźć powtarzające się sformułowania. Pisarze przekształcają chodzącą notatkę głosową w wstępną wersję roboczą. Zespoły ds. ułatwień dostępu tworzą tekstową alternatywę dla filmu, w którym nigdy takiej nie było.

Wspólny wątek to plik, który już istnieje i tekst, który musi z niego wyjść. Jeśli zamiast tego chcesz pisać, mówiąc, na żywo, w dowolnej aplikacji, którą masz przed sobą otwartą, jest to raczej dyktando niż transkrypcja i jest to inne narzędzie o innym kształcie.

Jak używać dźwięku do tekstu w przeglądarce

  1. Wybierz model

    Wybierz szybki model tylko w języku angielskim do szybkich nagrań w języku angielskim lub zrównoważony model wielojęzyczny do akcentów, cichszego dźwięku i innych języków. Model zostanie pobrany raz, a następnie zostanie zapisany w pamięci podręcznej przeglądarki.

  2. Dodaj plik audio lub wideo

    Przeciągnij plik MP3, WAV, M4A, FLAC, OGG, MP4 lub MOV do strefy upuszczania lub kliknij, aby go wyszukać. Plik zostanie odczytany w przeglądarce i nie zostanie przesłany.

  3. Poczekaj, aż nastąpi transkrypcja

    Strona odczytuje dźwięk, ładuje model, a następnie dokonuje transkrypcji. Dłuższe nagrania trwają dłużej. Trzymaj kartę otwartą i na pierwszym planie, aby Twoja przeglądarka nie spowalniała pracy.

  4. Przeczytaj i sprawdź transkrypcję

    Przełączaj między widokiem zwykłego tekstu a widokiem ze znacznikiem czasu. Przeglądaj nazwy, nazwy miejscowości i terminy techniczne, czyli słowa, które model mowy najczęściej myli.

  5. Skopiuj lub pobierz tekst

    Skopiuj transkrypcję do schowka lub pobierz ją jako zwykły tekst, tekst ze znacznikiem czasu lub plik napisów .srt. Po zamknięciu karty nic nie jest zachowywane, więc zapisz ją przed opuszczeniem.

Pytania

Czy ten konwerter audio na tekst jest naprawdę darmowy?

Tak, i za darmo w zwykłym sensie, a nie w sensie próbnym. Nie ma limitu minut, dziennego limitu plików ani karty. Transkrypcja działa na Twoim własnym procesorze, więc nic nas nie kosztuje, abyś mógł ją uruchamiać tak często, jak chcesz. Zarabiamy na Yaps aplikacjach komputerowych i na Androida, a nie na tej stronie.

Czy muszę się rejestrować lub tworzyć konto?

Nie. Przed wynikiem nie ma konta, skrzynki e-mail ani ściany logowania. Otwórz stronę, wrzuć plik i weź tekst.

Czy istnieje ograniczenie długości nagrania?

Brak limitu długości. Trzygodzinne nagranie działa dokładnie tak samo, jak trzyminutowe nagranie, tyle że trwa dłużej. Trzymaj kartę otwartą i na pierwszym planie podczas jej działania, ponieważ przeglądarki spowalniają karty w tle.

Czy mój plik audio jest gdziekolwiek przesyłany?

Nie. Model mowy jest pobierany do przeglądarki raz, a następnie dźwięk i transkrypcja pozostają na tej karcie na Twoim komputerze. Po załadowaniu modelu i dalszym transkrypcji narzędzia odłącz się od Internetu.

Jakie pliki audio i wideo akceptuje?

MP3, WAV, M4A, FLAC i OGG, a także ścieżka dźwiękowa większości filmów MP4 i MOV. Jeśli Twoja przeglądarka nie może otworzyć określonego pliku, zawsze działa wyeksportowanie go najpierw w formacie MP3.

Czy może mi powiedzieć, kto mówi?

Nie. Identyfikacja mówcy wymaga drugiego modelu, który jest zbyt ciężki, aby można go było umieścić na stronie internetowej, więc nagranie wieloosobowe będzie przedstawiane jako jeden blok tekstu. Aplikacja komputerowa Yaps tworzy transkrypcje wywiadów i spotkań z etykietami mówców.

Jakie języki obsługuje?

Zrównoważony model jest wielojęzyczny i obejmuje szeroką gamę języków, chociaż dokładność różni się w zależności od języka i czystości nagrania. Szybki model jest dostępny tylko w języku angielskim. Wybierz zrównoważony dla wszystkiego, co nie jest angielskie.

Jak dokładne jest to rozwiązanie?

Nie podajemy procentu dokładności, ponieważ szczera odpowiedź zależy od Twojego dźwięku. Jeden wyraźny głośnik blisko mikrofonu gra bardzo dobrze. Przesłuchy, szumy tła, duża kompresja i mocne akcenty w hałaśliwym pomieszczeniu powodują powstawanie błędów. Spodziewaj się, że go przeczytasz i poprawisz nazwy i terminy techniczne.

Czy mogę otrzymać znaczniki czasu lub napisy?

Tak. Każde uruchomienie generuje zwykły tekst, tekst ze znacznikiem czasu i plik napisów .srt, który można skopiować lub pobrać dowolny z nich. Jeśli napisy są jedyną rzeczą, której potrzebujesz, darmowy generator napisów jest zbudowany wokół tego zadania.

Czy to działa na telefonie?

Może działać w przeglądarce mobilnej, ale telefony mają mniej pamięci i zapisywanie długich plików zajmuje dużo więcej czasu, dlatego lepszym miejscem do transkrypcji wywiadu jest laptop lub komputer stacjonarny. Aplikacja Yaps na Androida służy do pisania głosowego na telefonie, a nie do transkrypcji plików.

Ile czasu zajmuje godzina dźwięku?

Na najnowszym laptopie z WebGPU jest to zwykle kilka minut, ponieważ transkrypcja przebiega kilka razy szybciej niż w czasie rzeczywistym. Starsze maszyny wracają na wolniejszą ścieżkę i zajmują znacznie więcej czasu. Jednorazowe pobranie modelu odbywa się tylko przy pierwszym uruchomieniu.

Co stanie się z moją transkrypcją, gdy zamknę kartę?

To zniknęło. Nic nie jest zapisywane pomiędzy wizytami, więc skopiuj lub pobierz tekst przed opuszczeniem strony. Jeśli chcesz, aby historia transkrypcji pozostała na Twoim urządzeniu, właśnie do tego służy aplikacja komputerowa.

Zacznij szczekaćMac · Windows · Linux · Android

Teraz dowiedz się kto co powiedział.

Transkrypcje wywiadów i spotkań oznaczone przez mówcę.

Pobierz na komputer Mac

Wymaga macOS 13.0+ (zalecane Apple Silicon)Już wkrótce iOS