Przejdź do treści

Stan prywatnego dyktanda · 2026

Mierz to, co pomija dyktowanie.

Dokładność, usunięcia, opóźnienia i obserwowalne zachowanie sieci w narzędziach do rozpoznawania mowy na urządzeniu.Publikujemy metodę, limity i oczyszczone dane obok liczb.

01 · Wyniki pilotażu

Pierwsze liczby, w pełnym widoku.

Po włączeniu czyszczenia lokalnego pilot zanotował średni czas przetwarzania wynoszący 1124 ms i poziom błędów słów 3,46%. Te same 20 czystych, syntetycznych urządzeń zostało zdekodowanych trzy razy na linię na jednym M1 Max MacBook Pro przy użyciu Yaps 2.3.2129. Niższe wartości błędów i opóźnień są lepsze w przypadku tej dokładnej konfiguracji. To są konfiguracje Yaps, a nie produkty konkurencyjne.

Urządzenia
20
Działa na pas
60
Słowa z powtórzeniami
1,473
Pochodzenie mowy
Syntetyczny
Urządzenie testowe
1
Agregacja błędów
Mikro
Porządkowanie na60 działa

Core ML Parakeet + lokalne czyszczenie

Mikro WER
3.46%
Wskaźnik usuwania
0.41%
Mediana przetwarzania
1,124 ms
przetwarzanie p95
2,807 ms
Maksymalne przetwarzanie
2,958 ms
Czyszczenie wyłączone60 działa

Core ML Parakeet, czyszczenie wyłączone

Mikro WER
3.67%
Wskaźnik usuwania
0.20%
Mediana przetwarzania
250 ms
przetwarzanie p95
722 ms
Maksymalne przetwarzanie
1,863 ms
Czyszczenie wyłączone60 działa

Whisper Base, sprzątanie

Mikro WER
6.52%
Wskaźnik usuwania
0.41%
Mediana przetwarzania
844 ms
przetwarzanie p95
1,669 ms
Maksymalne przetwarzanie
2,189 ms

Czas przetwarzania obejmuje rozpoznawanie, finalizację potoku i lokalne czyszczenie, jeśli jest włączone. Nie obejmuje to początkowej konstrukcji środowiska wykonawczego, ładowania urządzeń, nagrywania na żywo, wysyłania skrótów i wstawiania kursora. Wszystkie pasy oceniają końcowe wyniki oceny; na pasach czyszczących nadal można zastosować zmiany słownictwa i formatowania.

Opóźnienie wykorzystuje 60 równomiernie ważonych próbek dekodowania na ścieżkę i kwantyle liniowe R-7. 20 urządzeń zawiera 491 pozycji słów referencyjnych na przebieg, liczonych trzykrotnie w mianowniku 1473 słów. Powtórzenia nie są wypowiedziami niezależnymi. Błędy progu jakości pozostają uwzględnione: 3 z włączonym czyszczeniem Core ML, 3 z wyłączonym czyszczeniem Core ML i 6 z Whisper.

Interpretacja poprawiona 6 września 2026. Numery oryginalne niezmienione. Przeczytaj audyt dowodów, odniesienia zewnętrzne, pozostałe ograniczenia i instrukcje dotyczące reprodukcji.

Co ten pilot obsługuje

Dopasowany obserwacja po oczyszczeniu.

W tych przebiegach Whisper Base przy wyłączonym oczyszczaniu był wyższy o 2,85 punktu procentowego WER, współczynnik usuwania wyższy o 0,20 punktu, mediana wyższa o 595 ms i p95 wyższe o 947 ms niż w przypadku Core ML Parakeet przy wyłączonym oczyszczaniu.

Czego nie może obsługiwać

Ogólne oświadczenie dotyczące produktu lub prywatności.

Pilot wyklucza ludzką mowę, akcenty, mowę wielojęzyczną, przechwytywanie na żywo z mikrofonu, kontrolowaną kolejność termiczną, obserwację sieci, dodatkowe urządzenia i produkty firm trzecich.

02 · Warstwa produktu

Model nie jest doświadczeniem dyktowania.

Dlaczego Yaps powinien znaleźć się w raporcie

Pobieranie wag modeli to łatwa część.Przydatny system dyktowania musi niezawodnie przechwytywać dźwięk, wybierać odpowiedni czas działania, przygotowywać mowę dla tego modelu, wykrywać niekompletny sygnał wyjściowy, zachowywać intencje użytkownika i umieszczać wynik w dowolnym miejscu, w którym pracuje.

Yaps przekształca lokalne modele mowy w jedno prywatne narzędzie, którego ludzie mogą używać w codziennych aplikacjach, bez konieczności samodzielnego składania serwerów modeli, skryptów, ścieżek audio czy etapów eksportu.
01

Przechwytywanie

Skrót lub klawiatura mobilna rozpoczyna prywatne nagranie bez przenoszenia użytkownika do osobnego narzędzia do transkrypcji.

02

Przygotuj

Yaps stosuje wykrywanie mowy, obsługę ciszy oraz przygotowanie dźwięku w kształcie urządzenia przed rozpoznawaniem.

03

Trasa

Aplikacja wybiera zainstalowany lokalny silnik dla urządzenia, języka, preferencji jakości i dostępnego sprzętu.

04

Rozpoznaj

Parakeet, Cohere, Whisper, lub specjalistyczna ścieżka konwertuje przygotowane audio na tekst kandydacki.

05

Strażnik

Kontrole kompletności, ścieżki ratunkowe, obsługa słownictwa i lokalne czyszczenie chronią dostarczony wynik.

06

Dostarcz

Gotowy tekst jest zatwierdzany przy kursorze lub w przepływie pracy klawiatury mobilnej, gotowy do natychmiastowego użycia.

Ten kontekst produktu wyjaśnia, dlaczego w raporcie rozróżniono ustawienia czyszczenia i zmierzony stopień wyjściowy. Nie stanowi to dowodu na to, że Yaps jest najlepszy i nie zmienia pozycjonowania produktu w wynik porównawczy.

03 · Szerszy materiał dowodowy

Program badawczy jest już większy niż jeden pilotaż.

Te towarzyszące badania używały różnych urządzeń, korpusów, metryk i protokołów testowych. Ich liczby wyjaśniają bieżące decyzje produktowe, ale nie można ich łączyć w jedno wspólne zestawienie wyników.

Apple Silicon · wielojęzycznyPowiązane badanie

Cohere zmienia kierowanie rozmowy.

W szerszym badaniu M1 Max wykorzystano 144 syntetyczne klipy w 24 językach i 65 ludzkich klipów FLEURS w 13 językach.W dopasowanym podzbiorze ludzi składającym się z 20 klipów, udostępnianym przez Cohere i każdy model, Cohere odnotował 4,2% skontrolowanego WER w porównaniu z 12,0% w przypadku MLX Parakeet.

Cohere WER
4.2%
MLX Parakeet
12.0%
Dopasowane fragmenty ludzkie
20
Cohere obsługuje węższy zestaw języków i wymaga przewidywanego języka.Pięć klipów w każdym języku pozostaje dowodem kierunkowym, a nie uniwersalnym zapewnieniem jakości.
Windows 11 · CoherePowiązane badanie

Wyższa niezawodność wielojęzyczna przy koszcie opóźnień.

Na laptopie Ryzen 7 5700U Windows, Cohere i ONNX Parakeet uruchomiły te same 70 ludzkich klipów FLEURS w 14 językach. Cohere zwróciło 70 niepustych transkrypcji; Parakeet zwróciło 61. Cohere wygrało 12 z 14 automatycznych porównań językowych, ale średnio zajmowało 3,654 sekundy na klip w porównaniu do 1,394 sekundy dla Parakeet.

Cohere niepusty
70/70
Parakeet niepusty
61/70
Cohere oznacza
3,654 s
Wyniki językowe pozostają kierunkowe, dopóki każda różnica różna od zera nie zostanie całkowicie oceniona ręcznie. Oczyszczone wiersze nie są jeszcze częścią tej publicznej wersji.
Android · Wersja arabskaPowiązane badanie

Prędkość urządzenia może minąć, podczas gdy pokrycie korpusu nadal nie jest możliwe.

Arabski pakiet FastConformer działał na Pixel 10 Pro. Wyłączając jedną nieprawidłową parę referencyjną, 39 klipów FLEURS dało 9,8% WER i 4,1% CER, z medianą 624 ms i p95 984 ms. Szerszy, czysty i hałaśliwy fragment MASC na procesorze Mac uzyskał później wynik 22,5% WER, więc trasa pozostaje wersją zapoznawczą, a nie ogólnym arabskim roszczeniem.

Ważne klipy
39
Mediana dekodowania
624 ms
dekodowanie p95
984 ms
Wynik foniczny obejmuje mowę czytaną, a nie spontaniczne użycie MSA i dialektów. Szerszy wynik MASC jest powodem, dla którego aplikacja utrzymuje trasę wyraźnie oznaczoną jako Podgląd.
04 · Zasięg platformy

Pokaż luki zamiast je ukrywać.

macOS · Apple Silicon

Opublikowano pilota

Aktualne dowodyObecny 20-elementowy pilotaż, plus osobna próba porównawcza 144 syntetycznych i 65 ludzkich modeli wielojęzycznych.

Następna brama dowodowaDodaj spontaniczną mowę, więcej generacji komputerów Mac, kontrolowany porządek termiczny i przechwytywanie mikrofonu na żywo.

Windows · x64

Powiązane dowody

Aktualne dowodyOddzielna walidacja FLEURS obejmująca 70 klipów i 14 języków porównała Cohere i ONNX Parakeet w systemie Windows 11.

Następna brama dowodowaPublikuj oczyszczone wiersze zgodnie z zamrożonym protokołem i dodaj klasy o mniejszej pamięci oraz dodatkowe klasy GPU.

Android · ARM64

Powiązane dowody

Aktualne dowodyOcena Pixel 10 Pro zmierzyła arabski pakiet FastConformer i przetestowała rzeczywistą ścieżkę klawiatury.

Następna brama dowodowaDodaj spontaniczną mowę w dialekcie, więcej poziomów telefonów, parzystość trasy w języku angielskim, baterię i pomiary długotrwałego użytkowania.

Linux · x64

Luka badawcza

Aktualne dowodyYaps jest dostępny na Linux, ale ten raport nie zawiera testów dokładności ani opóźnień w jakości raportu dla natywnego Linuxa.

Następna brama dowodowaUruchom natywne odtwarzanie zestawu testowego Ubuntu, dyktowanie zainstalowanych pakietów, ścieżki CPU i Vulkan, X11 oraz Wayland.

iOS · ARM64

Luka badawcza

Aktualne dowodyYaps jest dostępny na iOS, ale ten raport nie zawiera jeszcze benchmarku dla urządzeń iPhone.

Następna brama dowodowaZmierz rzeczywiste rozszerzenie klawiatury, ładowanie modelu, obciążenie pamięci, zużycie energii i opóźnienie zatwierdzania end-to-end.

05 · Pytanie badawcze

Płynna transkrypcja może być nadal błędna.

01

Dokładność

Ile słów referencyjnych jest zastępowanych, wstawianych lub usuwanych po normalizacji deterministycznej?

02

Ciche usunięcie

Czy transkrypcja traci całe słowa lub frazy, a jednocześnie brzmi na tyle płynnie, że można uniknąć szybkiej recenzji?

03

Reaktywność

Jak długo trwa przetwarzanie w całej dystrybucji, a nie tylko w jednym najszybszym uruchomieniu?

04

Zachowanie sieci

Jakie połączenia i ładunki są obserwowane podczas zdefiniowanego przepływu pracy, z jasno określonymi ograniczeniami obserwacji pakietów?

06 · Projekt publikacji

Dowód, który możesz prześledzić aż do źródła.

Pilot rozróżnia ustawienia czyszczenia semantycznego, ocenia końcowe wyniki oceny, niezależnie zgłasza podstawienia, wstawienia i usunięcia oraz przechowuje prywatne treści mowy poza publikacją. Porównywalne systemy otrzymują te same bajty audio, jeśli pozwalają na to ich interfejsy; niezgodne ścieżki przechwytywania należą do wyraźnie oddzielnych warstw.

01Zamrożony korpus publiczny lub za zgodą
02Zadeklarowany system, model i urządzenie
03Powtarzające się uruchomienia z zachowanymi niepowodzeniami
04Word-poziom S/I/D
05Bez zawartościpubliczne wiersze i agregaty
07 · Przeczytaj zapis

Sprawdź metodę i każdy publiczny wiersz.

Stan prywatnego dyktanda 2026Wersja metody 0.1.0Tylko dowody pilotażoweZaprojektowane i opublikowane przez Yaps