Core ML Parakeet + локално почистване
- Микро WER
- 3.46%
- Честота на изтриване
- 0.41%
- Средна обработка
- 1,124 ms
- p95 обработка
- 2,807 ms
- Максимална обработка
- 2,958 ms
Състояние на личното диктуване · 2026
Точност, изтривания, латентност и наблюдаемо поведение на мрежата при инструментите за реч на устройството. Публикуваме метода, ограниченията и пречистените данни до числата.
С активирано локално почистване пилотът регистрира средно време за обработка от 1124 ms и 3,46% процент грешки в думата. Същите 20 чисти синтетични приспособления бяха декодирани три пъти на лента на един M1 Max MacBook Pro с помощта на Yaps 2.3.2129. По-ниските стойности на грешката и латентността са по-добри при тази точна настройка. Това са Yaps конфигурации, а не конкурентни продукти.
Времето за обработка включва разпознаване, финализиране на конвейера и локално почистване, когато е активирано. Изключва първоначална конструкция по време на изпълнение, зареждане на приспособления, запис на живо, изпращане на пряк път и вмъкване на курсор. Всички ленти оценяват крайния резултат от оценителя; лентите за почистване все още могат да прилагат промени в речника и форматирането.
Латентността използва 60 еднакво претеглени проби за декодиране на лента и R-7 линейни квантили. 20-те срещи съдържат 491 позиции на референтни думи на пас, преброени три пъти в знаменателя от 1473 думи. Повторенията не са независими изказвания. Неизправностите на прага на качеството остават включени: 3 с включено почистване на Core ML, 3 с изключено почистване на Core ML и 6 с Whisper.
Тълкуването е коригирано на 6 септември 2026 г. Оригиналните номера са непроменени. Прочетете одита на доказателствата, външни препратки, оставащи ограничения и инструкции за възпроизвеждане.
При тези изпълнения Whisper Base с изключено почистване имаше 2,85 процентни пункта по-високо WER, 0,20 точки по-висок процент на изтриване, 595 ms по-висока медиана и 947 ms по-висок p95 от Core ML Parakeet с изключено почистване.
Пилотът изключва човешката реч, акцентите, многоезичната реч, запис с жив микрофон, контролирания топлинен ред, наблюдението на мрежата, допълнителни устройства и продукти на трети страни.
Изтеглянето на теглата на модела е лесната част. Един полезен диктовъчен режим трябва надеждно да улавя аудио, да избира правилното изпълнително време, да подготвя речта за този модел, да открива непълни резултати, да запазва намерението на потребителя и да поставя резултата там, където той работи.
Yaps превръща способните локални модели за реч в един частен инструмент, който хората могат да използват в своите ежедневни приложения, без сами да сглобяват сървъри на модели, скриптове, аудио потоци или стъпки за експортиране.
Пряк път или мобилна клавиатура стартират частно записване, без да преместват потребителя в отделен инструмент за транскрипция.
Yaps прилага разпознаване на реч, обработка на тишината и подготовка на аудио във формата на устройството преди разпознаването.
Приложението избира инсталиран локален двигател за устройството, езика, предпочитаното качество и наличния хардуер.
Parakeet, Cohere, Whisper, или специализираният маршрут преобразува подготвения аудио файл в кандидат-текст.
Проверки за пълнота, резервни пътища, обработка на речника и локално почистване защитават доставения резултат.
Готовият текст се въвежда на курсора или в мобилния клавиатурен поток, готов за незабавна употреба.
Този контекст на продукта обяснява защо отчетът разграничава настройките за почистване и измереното изходно стъпало. Това не е доказателство, че Yaps е най-добрият и не превръща позиционирането на продукта в резултат от бенчмарк.
Тези спомагателни изследвания използваха различни устройства, корпуси, метрики и тестови протоколи. Техните числа обясняват текущите продуктови решения, но не трябва да се комбинират в единствена класация.
По-широко сравнение на M1 Max използваше 144 синтетични клипа на 24 езика и 65 човешки FLEURS клипа на 13 езика. В съответстващия поднабор от 20 човешки клипа, споделен от Cohere и всеки модел, Cohere отчете 4,2% проверени WER спрямо 12,0% за MLX Parakeet.
На лаптоп Ryzen 7 5700U Windows, Cohere и ONNX Parakeet изпълниха едни и същи 70 човешки FLEURS клипа на 14 езика. Cohere върна 70 непразни транскрипции; Parakeet върна 61. Cohere спечели 12 от 14 автоматизирани езикови сравнения, но средно за клип отне 3,654 секунди спрямо 1,394 секунди за Parakeet
Арабски FastConformer пакетът се изпълнява на Pixel 10 Pro. С изключение на една невалидна референтна двойка, 39 FLEURS клипа произвеждат 9,8% WER и 4,1% CER, с 624 ms медиана и 984 ms p95. По-широк чист и шумен MASC срез на Mac CPU по-късно отбеляза 22,5% WER, така че маршрутът остава Preview, вместо да се превърне в общо арабско твърдение.
Текущи доказателстваТекущият пилот с 20 инсталации, плюс отделно състезание с 144 синтетични и 65 човешки многоезични модела.
Следващ етап на проверка на доказателстватаДобавете спонтанна реч, повече Mac поколения, контролирана термична последователност и улавяне на жив микрофон.
Текущи доказателстваОтделна 70-клипова, 14-езикова човешка FLEURS валидация сравни Cohere и ONNX Parakeet на Windows 11.
Следващ етап на проверка на доказателстватаПубликувайте почистени редове под замразения протокол и добавете класове с по-ниска памет и допълнителни GPU.
Текущи доказателстваЕдна Pixel 10 Pro оценка измери арабски FastConformer пакет и тества реалния път на клавиатурата.
Следващ етап на проверка на доказателстватаДобавете спонтанна диалектна реч, повече нива на телефони, равенство с английския маршрут, батерия и измервания при продължителна употреба.
Текущи доказателстваYaps е наличен за Linux, но този доклад не съдържа нативен Linux тест за точност или забавяне с качество на доклад.
Следващ етап на проверка на доказателстватаСтартирайте родното Ubuntu повторение на фиксиране, диктовка на инсталиран пакет, CPU и Vulkan пътища, X11, и Wayland.
Текущи доказателстваYaps е наличен за iOS, но този доклад все още не включва бенчмарк за iPhone устройства.
Следващ етап на проверка на доказателстватаИзмерете реалното разширение на клавиатурата, зареждането на модела, натиска върху паметта, използването на енергия и латентността на крайно-до-крайното ангажиране.
Колко референтни думи се заменят, вмъкват или изтриват след детерминирана нормализация?
Става ли така, че транскриптът губи цели думи или фрази, като същевременно звучи достатъчно гладко, за да избегне бърз преглед?
Колко време отнема обработката в рамките на разпределение, а не само при едно най-бързо изпълнение?
Какви връзки и полезни натоварвания се наблюдават по време на определен работен процес, с ясно заявени ограничения за наблюдение на пакетите?
Пилотът разграничава настройките за семантично почистване, оценява крайния изход на оценителя, отчита независимо замествания, вмъквания и изтривания и запазва частното речево съдържание извън публичното издание. Сравними системи получават същите аудио байтове, когато техните интерфейси го позволяват; несъвместимите пътища за улавяне принадлежат към ясно разделени слоеве.