Перейти к содержимому

Свободная речь в тексте прямо в вашем browser.

Коснитесь микрофона, говорите как обычно и наблюдайте, как он превращается в текст. Речевая модель загружается один раз, а затем запускается на вашем компьютере, поэтому звук не загружается, нет учетной записи и нет ограничений по времени.

Работает на вашем компьютере · Ваш голос никогда не покидает это устройство

Запускаем голосовой ввод

Только настраиваюсь…

0 wordс
Пока ничего — микрофон выше.

Об этом инструменте

Как работает голосовой набор онлайн без загрузки вашего голоса

Когда страница загружается, она загружает в ваш браузер модель распознавания речи под названием Whisper. Это базовый размер, квантованный до int8, и он составляет около 80 МБ. Индикатор выполнения показывает загрузку. Модель отправляется к вам, а не ваш голос отправляется на сервер.

После этого инструмент активируется. Вы нажимаете на микрофон, ваш браузер запрашивает разрешение микрофона, и индикатор уровня показывает, что он вас слышит. Нажмите еще раз, и запись перейдет прямо к модели, работающей на той же вкладке. Звук обрабатывается в 30-секундных окнах с 5-секундным перекрытием, поэтому длинный фрагмент речи не прерывается в середине предложения.

Если ваш браузер поддерживает WebGPU, модель работает на видеокарте и работает в несколько раз быстрее. Если этого не происходит, он возвращается к WebAssembly на ЦП, который работает медленнее, но все равно работает. Ваш браузер кэширует файлы модели после первого запуска, поэтому последующие посещения начнутся немедленно. Над текстовым полем указано количество слов и приблизительная цифра слов в минуту.

Голосовой ввод без загрузки, регистрации и учетной записи.

Большинство бесплатных сайтов голосового набора имеют одну из двух форм. Некоторые записывают ваш звук и публикуют его на своих серверах для транскрипции. Другие называют встроенное в Chrome или Edge распознавание речи, которое отправляет звук в службу поставщика браузера. В любом случае ваш голос покидает вашу машину, и вы доверяете политике конфиденциальности, которую не писали.

Эта страница имеет другую форму. Нет ни загрузки, ни учетной записи, ни сервера транскрипции. Файл модели загружается статически, а транскрипция выполняется на вкладке перед вами. Вы можете проверить это сами. Загрузите страницу, дождитесь прибытия модели, затем отключите Wi-Fi и продолжайте диктовать. Он продолжает работать, потому что распознавание никогда не использовало сеть.

Эта структура имеет и практические последствия. Ничто не измеряется, поэтому нет ограничения по минутам, дневного лимита и стены с просьбой зарегистрироваться в середине записи. Это также означает, что мы не можем прочитать, сохранить или потерять вашу расшифровку. Если вы закроете вкладку, текст исчезнет, ​​поэтому скопируйте или загрузите все, что хотите сохранить.

Как использовать инструмент голосового набора, шаг за шагом

Подождите, пока модель загрузится. Кнопка микрофона остается неактивной до тех пор, пока она не будет готова, потому что до этого времени переписывать нечего. При обычном соединении это занимает несколько секунд и происходит только при первом посещении.

Коснитесь микрофона. В первый раз ваш браузер запросит разрешение на использование микрофона. Разрешите это. Во время разговора наблюдайте за перемещением индикатора уровня. Это самый быстрый способ убедиться в том, что выбрано правильное устройство ввода. Если индикатор ровный, измените вход в настройках звука системы и перезагрузите компьютер.

Разговаривайте в обычном темпе. Нет необходимости замедлять темп или произносить слишком много слов, а крик скорее ухудшит, чем улучшит результаты. Когда закончите мысль, коснитесь микрофона еще раз. Текст появится в поле ниже.

Вы можете продолжать идти. Каждая новая запись добавляется в конец уже существующей, поэтому вы можете диктовать короткими очередями. Поле представляет собой обычное редактируемое поле, поэтому исправьте все, что захотите, а затем скопируйте или загрузите в виде файла .txt.

Насколько он точен и какие языки и акценты он поддерживает?

Модель многоязычна и автоматически определяет язык, поэтому вы можете начать говорить, не выбирая ничего из меню. На практике это охватывает большинство основных языков, и оно заметно сильнее на языках с наибольшим количеством обучающих данных, главным из которых является английский.

Будьте реалистичны в отношении размера модели. Это база Whisper, выбранная потому, что посетитель действительно будет ждать загрузки размером 80 МБ. Он хорош в обычной связной речи и выдерживает широкий диапазон акцентов, но это не самая большая из доступных моделей, и она будет делать больше ошибок, чем та, которая в десять раз больше. Чаще всего это касается имен собственных, названий продуктов, технического жаргона и имен людей.

Тихая комната и приличный микрофон помогут больше, чем что-либо еще, что вы можете изменить. Микрофоны ноутбука улавливают шум клавиатуры и эхо комнаты, и оба эти фактора ухудшают качество текста. Если вы много диктуете, дешевая гарнитура — самое большое обновление, доступное вам.

Для чего люди используют бесплатный голосовой набор

Чаще всего используется первый черновой вариант. Для большинства людей говорить быстрее, чем печатать, а черновой устный черновик, который вы затем редактируете, обычно заменяет пустую страницу. Эссе, сообщения в блогах, сопроводительные письма, длинные электронные письма, записи в журналах и заметки о встречах — все это хорошо работает.

Это также простой инструмент доступности. Если вам больно печатать, вы получили травму или клавиатура просто медленно работает, для диктовки во вкладке браузера не требуется ни установка, ни права администратора, ни покупка. Это имеет значение для заблокированного рабочего ноутбука или компьютера с общей библиотекой, на котором вы не можете установить программное обеспечение.

Студенты используют его для заметок и быстрого записи длинных цитат. Людям, пишущим на втором языке, часто легче произнести предложение, чем напечатать его. И он полезен в качестве блокнота: запишите идею, пока она у вас есть, и приведите ее в порядок позже.

Если у вас есть существующая запись, а не живой голос, это уже другая работа. Вместо этого используйте для этого инструмент преобразования аудио в текст.

Голосовой ввод в автономном режиме, без подключения к Интернету

Как только модель окажется в кеше вашего браузера, эта страница продолжит работать без подключения. Транскрипция вообще никогда не использовала сеть, поэтому самолет, поезд или отключенный Wi-Fi в отеле не помешает ей. Вам нужна сама страница для загрузки, поэтому откройте ее, прежде чем потеряете сигнал.

Две вещи вернут вас к загрузке. При очистке хранилища браузера кешированная модель удаляется, а личное окно или окно в режиме инкогнито обычно запускается с пустым кешем, поэтому файл извлекается заново. Разные браузеры также хранят отдельные кэши, поэтому переключение с одного на другой означает еще одну загрузку.

Эта первая загрузка — единственный момент, когда этому инструменту требуется Интернет. Все остальное, запись, распознавание и текст, происходит на вашем собственном оборудовании. Стоит сказать прямо, потому что это необычно. Большинство сайтов бесплатной диктовки перестают работать в тот момент, когда вы выходите из сети, потому что распознавание происходит где-то еще.

Ограничения голосового набора в браузере и что добавляет настольное приложение

Этот инструмент вводит данные в одно поле на одной веб-странице. Это честная граница. Он не может поместить текст в ваш редактор, почтовый клиент, Slack или документ, поэтому вы каждый раз копируете результат вручную. Если вы хотите диктовать что-то еще, это работа в два этапа.

Текст также появляется после того, как вы останавливаетесь, а не слово за словом, пока вы говорите, потому что запись расшифровывается за один проход, когда вы снова нажимаете на микрофон. И пропуска на уборку нет. Что бы вы ни сказали, вы это получите, включая «мм», фальстарты и предложение, которое вы бросили на полпути.

Настольное приложение Yaps представляет собой ту же идею для устройства, но без этих ограничений. Вы удерживаете одну горячую клавишу, говорите в любом приложении, в котором уже находитесь, и текст попадает под курсор. Он очищает слова-вставки и знаки препинания по ходу работы и после установки работает в автономном режиме. Также имеется клавиатура Android, которая гораздо лучше подходит для диктовки по телефону, чем вкладка браузера.

Как использовать голосовой ввод в браузере

  1. Подождите, пока загрузится модель.

    При первом посещении страница получает модель распознавания речи размером около 80 МБ и показывает индикатор выполнения. Микрофон остается неактивным, пока не будет готов. Ваш браузер кэширует его, поэтому это происходит только один раз.

  2. Коснитесь микрофона и разрешите доступ к микрофону.

    Ваш браузер запросит разрешение на использование микрофона в первый раз. Разрешите это, а затем проверьте, движется ли индикатор уровня, когда вы говорите, чтобы убедиться, что выбрано правильное устройство ввода.

  3. Разговаривайте в обычном темпе

    Говорите так, как вы бы говорили с человеком. Не нужно замедлять темп, произносить слишком громко или повышать голос. Тихая комната и гарнитура дают лучшие результаты, чем микрофон ноутбука в гулком помещении.

  4. Коснитесь микрофона еще раз, чтобы остановить

    Запись расшифровывается на вашем устройстве, и текст появляется в поле ниже. Каждая новая запись добавляется в конец, поэтому вы можете диктовать ее короткими сериями, а не одним длинным дублем.

  5. Отредактируйте, затем скопируйте или загрузите

    Текстовое поле полностью доступно для редактирования, поэтому исправьте все ошибки, допущенные в модели. Затем скопируйте текст в буфер обмена или загрузите его в виде файла .txt. После закрытия вкладки ничего не сохраняется.

Вопросы

Действительно ли этот инструмент голосового набора бесплатен?

Да и подписываться не на что. Инструмент работает на вашем собственном компьютере, поэтому нам не нужно передавать вам счет за транскрипцию. Нет ограничения по минутам, дневного лимита и пробного периода, который заканчивается.

Мой голос где-нибудь загружен?

Нет. Модель распознавания речи загружается в ваш браузер при первом посещении, а все последующие действия выполняются на вашем устройстве. Звук с вашего микрофона никогда не покидает вашу машину. Сервера транскрипции, на который можно было бы отправить, не существует. Вы можете подтвердить это, отключив Wi-Fi после загрузки модели и все равно продиктовав ее.

Нужно ли мне что-нибудь устанавливать?

Нет. Это веб-страница. Единственная загрузка — это сама речевая модель, которую ваш браузер автоматически извлекает и кэширует и которую вы никогда не увидите в виде файла на своем компьютере.

Почему при первом открытии страницы приходится ждать?

Инструмент загружает модель распознавания речи размером около 80 МБ, прежде чем сможет что-либо расшифровать. Индикатор выполнения показывает, насколько далеко вы продвинулись. После этого ваш браузер кэширует его, поэтому каждое последующее посещение начинается сразу же.

Работает ли голосовой набор без подключения к Интернету?

Да, как только модель будет кэширована. Распознавание никогда не пользовалось сетью, поэтому продолжает работать в автономном режиме. Вам необходимо подключение для первого посещения и для загрузки самой страницы. Очистка данных браузера или использование приватного окна означает повторную загрузку модели.

Почему текст не появляется, пока я говорю?

Инструмент сначала записывает, а затем расшифровывает, когда вы снова касаетесь микрофона, поэтому текст поступает сразу, а не слово за словом. Диктовка короткими сериями дает вам что-то близкое к живому набору текста, поскольку каждая новая запись добавляется в конец того, что уже есть.

Могу ли я использовать это для ввода данных в Документы Google, Word или электронную почту?

Не напрямую. Эта страница вводит текст только в собственное текстовое поле, поэтому вы копируете результат вручную. Настольное приложение Yaps позволяет диктовать прямо в любом приложении: вы удерживаете горячую клавишу, и текст попадает под курсор, где бы вы ни находились.

Добавляет ли он знаки препинания и заглавные буквы?

Модель записывает то, что слышит, включая основные знаки препинания, но после этого никаких корректирующих действий не происходит. Слова-вставки, повторяющиеся слова и заброшенные предложения — все они появляются, когда вы их произносите. Настольное приложение убирает это, пока вы говорите.

Как долго я могу говорить за один раз?

Установленного лимита нет. Длинный звук обрабатывается в 30-секундных окнах с перекрытием, поэтому предложения не разрезаются пополам. Практическим ограничением является терпение: чем дольше запись, тем длиннее пауза после остановки во время ее расшифровки.

Какие языки он поддерживает?

Модель многоязычна и автоматически определяет язык, поэтому вам достаточно просто начать говорить. Он наиболее силен в английском и других широко распространенных языках и допускает больше ошибок в языках, за которыми стоит меньше обучающих данных.

На телефоне работает?

Он работает в мобильных браузерах, но загрузка модели и обработка на устройстве происходят заметно медленнее, чем на ноутбуке. На Android клавиатура Yaps намного удобнее, поскольку диктовка встроена в саму клавиатуру.

Что произойдет с моим текстом, когда я закрою вкладку?

Оно исчезает. В аккаунте ничего не сохраняется, потому что аккаунта нет и отправлять текст некуда. Скопируйте текст или загрузите его в виде файла .txt, прежде чем покинуть страницу, если хотите сохранить его.

Начни тявкатьMac · Windows · Linux · Android

Теперь сделай это everywhere.

Один ключ, любое приложение, очищается, пока вы говорите.

Скачать для Mac

Требуется macOS 13.0+ (рекомендуется Apple Silicon)iOS скоро появится