Swoboda mowy na tekst bezpośrednio w Twoim browser.
Kliknij mikrofon, mów normalnie i zobacz, jak zmienia się w tekst. Model mowy jest pobierany raz, a następnie uruchamiany na Twoim komputerze, więc nie jest przesyłany żaden dźwięk, nie ma konta ani nie ma limitu czasu.
Działa na Twoim komputerze · Twój głos nigdy nie opuszcza tego urządzenia
Zaczynam od pisanie głosowe w górę
Właśnie się konfiguruję…
O tym narzędziu
Jak działa pisanie głosowe w Internecie bez przesyłania głosu
Kiedy strona się ładuje, pobiera do Twojej przeglądarki model rozpoznawania mowy o nazwie Whisper. Jest to rozmiar podstawowy, skwantowany do int8 i wynosi około 80 MB. Pasek postępu pokazuje pobieranie. Model podróżuje do Ciebie, a nie Twój głos do serwera.
Następnie narzędziem jest funkcja „Naciśnij i mów”. Dotykasz mikrofonu, przeglądarka pyta o pozwolenie na korzystanie z mikrofonu, a miernik poziomu pokazuje, że Cię słyszy. Stuknij ponownie, a nagranie przejdzie bezpośrednio do modelu działającego w tej samej zakładce. Dźwięk jest odtwarzany w 30-sekundowych oknach z 5-sekundowymi przerwami, więc długi odcinek rozmowy nie jest przerywany w połowie zdania.
Tam, gdzie Twoja przeglądarka obsługuje WebGPU, model działa na karcie graficznej i jest kilka razy szybszy. Jeśli tak się nie dzieje, wraca do WebAssembly na procesorze, który jest wolniejszy, ale nadal działa. Twoja przeglądarka buforuje pliki modelu po pierwszym uruchomieniu, więc późniejsze wizyty rozpoczynają się natychmiast. Nad polem tekstowym znajduje się liczba słów i szacunkowa liczba słów na minutę.
Pisanie głosowe bez przesyłania, rejestracji i konta
Większość bezpłatnych witryn do pisania głosowego ma jedną z dwóch postaci. Niektórzy nagrywają dźwięk i wysyłają go na swoje serwery w celu transkrypcji. Inni nazywają rozpoznawanie mowy wbudowane w Chrome lub Edge, które wysyła dźwięk do usługi dostawcy przeglądarki. Tak czy inaczej, Twój głos opuszcza Twoją maszynę i ufasz polityce prywatności, której nie napisałeś.
Ta strona ma inny kształt. Nie ma przesyłania, konta ani serwera transkrypcji. Plik modelu jest pobierany statycznie, a transkrypcja odbywa się na karcie przed tobą. Możesz to sprawdzić sam. Załaduj stronę, poczekaj na przybycie modelu, następnie wyłącz Wi-Fi i dyktuj dalej. Działa dalej, ponieważ rozpoznanie nigdy nie korzystało z sieci.
Struktura ta ma również skutki praktyczne. Nic nie jest liczone, więc nie ma limitu minut, dziennego limitu ani ściany z prośbą o zarejestrowanie się w połowie nagrania. Oznacza to również, że nie możemy odczytać, przechowywać ani utracić transkrypcji. Jeśli zamkniesz kartę, tekst zniknie, więc skopiuj lub pobierz wszystko, co chcesz zachować.
Jak korzystać z narzędzia do pisania głosowego, krok po kroku
Poczekaj, aż model zakończy pobieranie. Przycisk mikrofonu pozostaje nieaktywny, dopóki nie będzie gotowy, ponieważ wcześniej nie ma nic do transkrypcji. W przypadku normalnego połączenia zajmuje to kilka sekund i ma miejsce tylko podczas pierwszej wizyty.
Kliknij mikrofon. Za pierwszym razem Twoja przeglądarka poprosi o pozwolenie na użycie mikrofonu. Pozwól na to. Obserwuj, jak wskaźnik poziomu porusza się podczas mówienia, co jest najszybszym sposobem sprawdzenia, czy wybrano właściwe urządzenie wejściowe. Jeśli miernik jest płaski, zmień dane wejściowe w ustawieniach dźwięku systemu i załaduj ponownie.
Rozmawiaj w swoim normalnym tempie. Nie ma potrzeby zwalniać ani nadmiernie się wymawiać, a krzyk powoduje, że wyniki są raczej gorsze niż lepsze. Gdy skończysz myśleć, dotknij mikrofonu ponownie. Tekst pojawi się w polu poniżej.
Możesz iść dalej. Każde nowe nagranie jest dodawane na końcu już istniejącego, dzięki czemu można dyktować w krótkich seriach. Pole to jest zwykłym polem edytowalnym, więc popraw co chcesz, a następnie skopiuj lub pobierz jako plik .txt.
Jak dokładny jest i jakie języki i akcenty obsługuje?
Model jest wielojęzyczny i automatycznie wykrywa język, dzięki czemu możesz zacząć mówić bez wybierania czegokolwiek z menu. W praktyce dotyczy to większości głównych języków i jest zauważalnie silniejszy w przypadku tych z największą liczbą danych szkoleniowych, w tym przede wszystkim angielskiego.
Bądź realistą co do rozmiaru modelu. To jest baza Whisper, wybrana dlatego, że odwiedzający będzie czekał na pobranie 80 MB. Dobrze radzi sobie ze zwykłą mową połączoną i radzi sobie z szeroką gamą akcentów, ale nie jest to największy dostępny model i popełni więcej błędów niż ten dziesięciokrotnie większy. Rzeczowniki własne, nazwy produktów, żargon techniczny i imiona ludzi to miejsca, w których najczęściej się to myli.
Cichy pokój i przyzwoity mikrofon pomogą bardziej niż cokolwiek innego, co możesz zmienić. Mikrofony do laptopów wychwytują dźwięki klawiatury i echo pomieszczenia, co pogarsza jakość tekstu. Jeśli dużo dyktujesz, tani zestaw słuchawkowy będzie największym dostępnym ulepszeniem.
Do czego ludzie korzystają z bezpłatnego pisania głosowego
Najczęstszym zastosowaniem jest pierwsza wersja robocza. W przypadku większości ludzi mówienie jest szybsze niż pisanie, a szkic mówiony, który następnie edytujesz, zwykle przypomina pustą stronę. Eseje, posty na blogach, listy motywacyjne, długie e-maile, wpisy do dziennika i notatki ze spotkań – wszystko to sprawdza się w ten sposób.
Jest to również proste narzędzie ułatwiające dostępność. Jeśli pisanie jest bolesne, jeśli doznałeś kontuzji lub klawiatura po prostu wolno działa, dyktowanie na karcie przeglądarki nie wymaga instalacji, uprawnień administratora ani zakupu. Ma to znaczenie w przypadku zablokowanego laptopa służbowego lub komputera z biblioteką współdzieloną, na którym nie można zainstalować oprogramowania.
Uczniowie używają go do robienia notatek i szybkiego zapisywania długich cytatów. Osobom piszącym w obcym języku często łatwiej jest wypowiedzieć zdanie, niż je wpisać. Przydaje się także jako notatnik: uchwyć pomysł, gdy go masz, i uporządkuj go później.
Jeśli masz istniejące nagranie, a nie głos na żywo, jest to inne zadanie. Zamiast tego użyj narzędzia audio na tekst.
Pisanie głosowe w trybie offline, bez połączenia z Internetem
Gdy model znajdzie się w pamięci podręcznej przeglądarki, ta strona będzie nadal działać bez połączenia. Transkrypcja nigdy nie korzystała z sieci, więc samolot, pociąg lub niedziałające Wi-Fi w hotelu tego nie powstrzymują. Do załadowania potrzebna jest sama strona, więc otwórz ją, zanim stracisz sygnał.
Dwie rzeczy odsyłają Cię z powrotem do pobierania. Wyczyszczenie pamięci przeglądarki powoduje usunięcie modelu z pamięci podręcznej, a okno prywatne lub okno incognito zwykle rozpoczyna się od pustej pamięci podręcznej, więc plik jest ponownie pobierany. Różne przeglądarki również przechowują oddzielne pamięci podręczne, więc przejście z jednej na drugą oznacza jeszcze jedno pobranie.
Pierwsze pobranie to jedyny moment, w którym to narzędzie potrzebuje Internetu. Cała reszta, nagrywanie, rozpoznawanie i tekst, dzieje się na Twoim własnym sprzęcie. Warto powiedzieć otwarcie, bo to niezwykłe. Większość bezpłatnych witryn do dyktowania przestaje działać w momencie przejścia do trybu offline, ponieważ rozpoznawanie odbywa się gdzie indziej.
Ograniczenia pisania głosowego w przeglądarce i to, co dodaje aplikacja komputerowa
To narzędzie wpisuje tekst w jednym polu na jednej stronie internetowej. To jest uczciwa granica. Nie może umieścić tekstu w edytorze, kliencie poczty e-mail, Slacku ani dokumencie, więc za każdym razem kopiujesz wynik ręcznie. Jeśli chcesz dyktować coś innego, jest to praca dwuetapowa.
Tekst pojawia się także po zatrzymaniu, a nie słowo po słowie w trakcie mówienia, ponieważ nagranie jest transkrybowane w jednym przebiegu po ponownym dotknięciu mikrofonu. I nie ma przepustki na sprzątanie. Cokolwiek powiesz, to właśnie otrzymasz, włączając w to umy, falstarty i zdanie, które porzuciłeś w połowie.
Aplikacja komputerowa Yaps to ten sam pomysł na urządzenie, ale bez tych ograniczeń. Przytrzymujesz jeden klawisz skrótu, mówisz do aplikacji, w której już się znajdujesz, a tekst ląduje przy kursorze. Na bieżąco czyści słowa wypełniające i znaki interpunkcyjne, a po zainstalowaniu działa w trybie offline. Dostępna jest również klawiatura dla systemu Android, która znacznie lepiej nadaje się do dyktowania w telefonie niż karta przeglądarki.
Jak korzystać z pisania głosowego w przeglądarce
Poczekaj na pobranie modelu
Podczas pierwszej wizyty strona pobiera model rozpoznawania mowy o rozmiarze około 80 MB i wyświetla pasek postępu. Mikrofon pozostaje nieaktywny, dopóki nie będzie gotowy. Twoja przeglądarka buforuje je, więc dzieje się to tylko raz.
Kliknij mikrofon i zezwól na dostęp do mikrofonu
Twoja przeglądarka po raz pierwszy poprosi o pozwolenie na użycie mikrofonu. Zezwól na to, a następnie sprawdź, czy miernik poziomu porusza się, gdy mówisz, aby mieć pewność, że wybrano właściwe urządzenie wejściowe.
Rozmawiaj w swoim normalnym tempie
Mów tak, jakbyś mówił do człowieka. Nie ma potrzeby zwalniać, przesadzać ani podnosić głosu. Cichy pokój i zestaw słuchawkowy dają lepsze rezultaty niż mikrofon laptopa w przestrzeni echa.
Kliknij mikrofon ponownie, aby zatrzymać
Nagranie zostanie transkrybowane na Twoim urządzeniu, a tekst pojawi się w polu poniżej. Każde nowe nagranie jest dodawane na końcu, dzięki czemu można dyktować w krótkich seriach, a nie w jednym długim ujęciu.
Edytuj, a następnie skopiuj lub pobierz
Pole tekstowe jest w pełni edytowalne, więc napraw wszystko, co poszło nie tak w modelu. Następnie skopiuj tekst do schowka lub pobierz go jako plik .txt. Po zamknięciu karty nic nie zostanie zapisane.
Pytania
Czy to narzędzie do pisania głosowego jest naprawdę bezpłatne?
Tak i nie ma na co się zapisywać. Narzędzie działa na Twoim komputerze, więc nie musimy przekazywać Ci rachunku za transkrypcję. Nie ma limitu minut, dziennego limitu ani okresu próbnego, który się kończy.
Czy mój głos jest gdzieś przesłany?
Nie. Model rozpoznawania mowy jest pobierany do Twojej przeglądarki podczas pierwszej wizyty, a następnie wszystko działa na Twoim urządzeniu. Dźwięk z Twojego mikrofonu nigdy nie opuszcza Twojej maszyny. Nie ma serwera transkrypcji, na który można by go wysłać. Możesz to potwierdzić, wyłączając Wi-Fi po pobraniu modelu i mimo to dyktowaniu.
Czy muszę coś instalować?
Nie. To jest strona internetowa. Jedynym plikiem do pobrania jest sam model mowy, który Twoja przeglądarka pobiera i buforuje automatycznie i którego nigdy nie widzisz jako pliku na swoim komputerze.
Dlaczego przy pierwszym otwarciu strony muszę czekać?
Narzędzie pobiera model rozpoznawania mowy o rozmiarze około 80 MB, zanim będzie mogło dokonać transkrypcji. Pasek postępu pokazuje, jaki jest postęp. Twoja przeglądarka zapisuje je później w pamięci podręcznej, więc każda kolejna wizyta rozpoczyna się od razu.
Czy pisanie głosowe działa bez połączenia z Internetem?
Tak, po zapisaniu modelu w pamięci podręcznej. Rozpoznawanie nigdy nie korzystało z sieci, więc nadal działa w trybie offline. Potrzebujesz połączenia do pierwszej wizyty i do załadowania samej strony. Wyczyszczenie danych przeglądarki lub skorzystanie z prywatnego okna oznacza ponowne pobranie modelu.
Dlaczego tekst nie pojawia się, gdy jeszcze mówię?
Narzędzie najpierw nagrywa, a po ponownym dotknięciu mikrofonu dokonuje transkrypcji, dzięki czemu tekst pojawia się za jednym razem, a nie słowo po słowie. Dyktowanie w krótkich seriach przypomina pisanie na żywo, ponieważ każde nowe nagranie jest dodawane na końcu już istniejącego.
Czy mogę używać tego do pisania w Dokumentach Google, programie Word lub poczcie e-mail?
Nie bezpośrednio. Ta strona wpisuje tekst tylko do własnego pola tekstowego, więc wynik kopiujesz ręcznie. Dyktowanie bezpośrednio w dowolnej aplikacji jest tym, co robi aplikacja komputerowa Yaps: przytrzymujesz klawisz skrótu, a tekst ląduje na kursorze, gdziekolwiek jesteś.
Czy dodaje znaki interpunkcyjne i wielkie litery?
Modelka zapisuje to, co słyszy, w tym podstawowe znaki interpunkcyjne, ale po tym nie ma przejścia poprawkowego. Wypełniacze, słowa powtarzane i porzucone zdania pojawiają się w miarę ich wypowiadania. Aplikacja komputerowa czyści to, gdy mówisz.
Jak długo mogę rozmawiać za jednym razem?
Nie ma ustalonego limitu. Długi dźwięk jest przetwarzany w 30-sekundowych oknach z zakładką, dzięki czemu zdania nie są przecięte na pół. Praktycznym ograniczeniem jest cierpliwość: im dłuższe nagranie, tym dłuższa pauza po zatrzymaniu podczas transkrypcji.
Jakie języki obsługuje?
Model jest wielojęzyczny i automatycznie wykrywa język, dzięki czemu możesz po prostu zacząć mówić. Jest najsilniejszy w języku angielskim i innych powszechnie używanych językach, a także popełnia więcej błędów w językach, za którymi kryje się mniej danych szkoleniowych.
Czy to działa na telefonie?
Działa w przeglądarkach mobilnych, ale pobieranie modelu i przetwarzanie na urządzeniu są zauważalnie wolniejsze niż na laptopie. W systemie Android klawiatura Yaps zapewnia znacznie lepsze wrażenia, ponieważ funkcja dyktowania jest wbudowana w samą klawiaturę.
Co stanie się z moim tekstem, gdy zamknę kartę?
Znika. Nic nie jest zapisywane na koncie, ponieważ nie ma konta i nie ma gdzie wysłać SMS-a. Skopiuj tekst lub pobierz go jako plik .txt przed opuszczeniem strony, jeśli chcesz go zachować.
Więcej darmowych narzędzi
Teraz zrób to everywhere.
Jeden klawisz, dowolna aplikacja, czyszczona podczas mówienia.
Wymaga macOS 13.0+ (zalecane Apple Silicon)Już wkrótce iOS