Core ML Parakeet + lokalne czyszczenie
- Mikro WER
- 3.46%
- Wskaźnik usuwania
- 0.41%
- Mediana przetwarzania
- 1,124 ms
- przetwarzanie p95
- 2,807 ms
- Maksymalne przetwarzanie
- 2,958 ms
Stan prywatnego dyktanda · 2026
Dokładność, usunięcia, opóźnienia i obserwowalne zachowanie sieci w narzędziach do rozpoznawania mowy na urządzeniu.Publikujemy metodę, limity i oczyszczone dane obok liczb.
Po włączeniu czyszczenia lokalnego pilot zanotował średni czas przetwarzania wynoszący 1124 ms i poziom błędów słów 3,46%. Te same 20 czystych, syntetycznych urządzeń zostało zdekodowanych trzy razy na linię na jednym M1 Max MacBook Pro przy użyciu Yaps 2.3.2129. Niższe wartości błędów i opóźnień są lepsze w przypadku tej dokładnej konfiguracji. To są konfiguracje Yaps, a nie produkty konkurencyjne.
Czas przetwarzania obejmuje rozpoznawanie, finalizację potoku i lokalne czyszczenie, jeśli jest włączone. Nie obejmuje to początkowej konstrukcji środowiska wykonawczego, ładowania urządzeń, nagrywania na żywo, wysyłania skrótów i wstawiania kursora. Wszystkie pasy oceniają końcowe wyniki oceny; na pasach czyszczących nadal można zastosować zmiany słownictwa i formatowania.
Opóźnienie wykorzystuje 60 równomiernie ważonych próbek dekodowania na ścieżkę i kwantyle liniowe R-7. 20 urządzeń zawiera 491 pozycji słów referencyjnych na przebieg, liczonych trzykrotnie w mianowniku 1473 słów. Powtórzenia nie są wypowiedziami niezależnymi. Błędy progu jakości pozostają uwzględnione: 3 z włączonym czyszczeniem Core ML, 3 z wyłączonym czyszczeniem Core ML i 6 z Whisper.
Interpretacja poprawiona 6 września 2026. Numery oryginalne niezmienione. Przeczytaj audyt dowodów, odniesienia zewnętrzne, pozostałe ograniczenia i instrukcje dotyczące reprodukcji.
W tych przebiegach Whisper Base przy wyłączonym oczyszczaniu był wyższy o 2,85 punktu procentowego WER, współczynnik usuwania wyższy o 0,20 punktu, mediana wyższa o 595 ms i p95 wyższe o 947 ms niż w przypadku Core ML Parakeet przy wyłączonym oczyszczaniu.
Pilot wyklucza ludzką mowę, akcenty, mowę wielojęzyczną, przechwytywanie na żywo z mikrofonu, kontrolowaną kolejność termiczną, obserwację sieci, dodatkowe urządzenia i produkty firm trzecich.
Pobieranie wag modeli to łatwa część.Przydatny system dyktowania musi niezawodnie przechwytywać dźwięk, wybierać odpowiedni czas działania, przygotowywać mowę dla tego modelu, wykrywać niekompletny sygnał wyjściowy, zachowywać intencje użytkownika i umieszczać wynik w dowolnym miejscu, w którym pracuje.
Yaps przekształca lokalne modele mowy w jedno prywatne narzędzie, którego ludzie mogą używać w codziennych aplikacjach, bez konieczności samodzielnego składania serwerów modeli, skryptów, ścieżek audio czy etapów eksportu.
Skrót lub klawiatura mobilna rozpoczyna prywatne nagranie bez przenoszenia użytkownika do osobnego narzędzia do transkrypcji.
Yaps stosuje wykrywanie mowy, obsługę ciszy oraz przygotowanie dźwięku w kształcie urządzenia przed rozpoznawaniem.
Aplikacja wybiera zainstalowany lokalny silnik dla urządzenia, języka, preferencji jakości i dostępnego sprzętu.
Parakeet, Cohere, Whisper, lub specjalistyczna ścieżka konwertuje przygotowane audio na tekst kandydacki.
Kontrole kompletności, ścieżki ratunkowe, obsługa słownictwa i lokalne czyszczenie chronią dostarczony wynik.
Gotowy tekst jest zatwierdzany przy kursorze lub w przepływie pracy klawiatury mobilnej, gotowy do natychmiastowego użycia.
Ten kontekst produktu wyjaśnia, dlaczego w raporcie rozróżniono ustawienia czyszczenia i zmierzony stopień wyjściowy. Nie stanowi to dowodu na to, że Yaps jest najlepszy i nie zmienia pozycjonowania produktu w wynik porównawczy.
Te towarzyszące badania używały różnych urządzeń, korpusów, metryk i protokołów testowych. Ich liczby wyjaśniają bieżące decyzje produktowe, ale nie można ich łączyć w jedno wspólne zestawienie wyników.
W szerszym badaniu M1 Max wykorzystano 144 syntetyczne klipy w 24 językach i 65 ludzkich klipów FLEURS w 13 językach.W dopasowanym podzbiorze ludzi składającym się z 20 klipów, udostępnianym przez Cohere i każdy model, Cohere odnotował 4,2% skontrolowanego WER w porównaniu z 12,0% w przypadku MLX Parakeet.
Na laptopie Ryzen 7 5700U Windows, Cohere i ONNX Parakeet uruchomiły te same 70 ludzkich klipów FLEURS w 14 językach. Cohere zwróciło 70 niepustych transkrypcji; Parakeet zwróciło 61. Cohere wygrało 12 z 14 automatycznych porównań językowych, ale średnio zajmowało 3,654 sekundy na klip w porównaniu do 1,394 sekundy dla Parakeet.
Arabski pakiet FastConformer działał na Pixel 10 Pro. Wyłączając jedną nieprawidłową parę referencyjną, 39 klipów FLEURS dało 9,8% WER i 4,1% CER, z medianą 624 ms i p95 984 ms. Szerszy, czysty i hałaśliwy fragment MASC na procesorze Mac uzyskał później wynik 22,5% WER, więc trasa pozostaje wersją zapoznawczą, a nie ogólnym arabskim roszczeniem.
Aktualne dowodyObecny 20-elementowy pilotaż, plus osobna próba porównawcza 144 syntetycznych i 65 ludzkich modeli wielojęzycznych.
Następna brama dowodowaDodaj spontaniczną mowę, więcej generacji komputerów Mac, kontrolowany porządek termiczny i przechwytywanie mikrofonu na żywo.
Aktualne dowodyOddzielna walidacja FLEURS obejmująca 70 klipów i 14 języków porównała Cohere i ONNX Parakeet w systemie Windows 11.
Następna brama dowodowaPublikuj oczyszczone wiersze zgodnie z zamrożonym protokołem i dodaj klasy o mniejszej pamięci oraz dodatkowe klasy GPU.
Aktualne dowodyOcena Pixel 10 Pro zmierzyła arabski pakiet FastConformer i przetestowała rzeczywistą ścieżkę klawiatury.
Następna brama dowodowaDodaj spontaniczną mowę w dialekcie, więcej poziomów telefonów, parzystość trasy w języku angielskim, baterię i pomiary długotrwałego użytkowania.
Aktualne dowodyYaps jest dostępny na Linux, ale ten raport nie zawiera testów dokładności ani opóźnień w jakości raportu dla natywnego Linuxa.
Następna brama dowodowaUruchom natywne odtwarzanie zestawu testowego Ubuntu, dyktowanie zainstalowanych pakietów, ścieżki CPU i Vulkan, X11 oraz Wayland.
Aktualne dowodyYaps jest dostępny na iOS, ale ten raport nie zawiera jeszcze benchmarku dla urządzeń iPhone.
Następna brama dowodowaZmierz rzeczywiste rozszerzenie klawiatury, ładowanie modelu, obciążenie pamięci, zużycie energii i opóźnienie zatwierdzania end-to-end.
Ile słów referencyjnych jest zastępowanych, wstawianych lub usuwanych po normalizacji deterministycznej?
Czy transkrypcja traci całe słowa lub frazy, a jednocześnie brzmi na tyle płynnie, że można uniknąć szybkiej recenzji?
Jak długo trwa przetwarzanie w całej dystrybucji, a nie tylko w jednym najszybszym uruchomieniu?
Jakie połączenia i ładunki są obserwowane podczas zdefiniowanego przepływu pracy, z jasno określonymi ograniczeniami obserwacji pakietów?
Pilot rozróżnia ustawienia czyszczenia semantycznego, ocenia końcowe wyniki oceny, niezależnie zgłasza podstawienia, wstawienia i usunięcia oraz przechowuje prywatne treści mowy poza publikacją. Porównywalne systemy otrzymują te same bajty audio, jeśli pozwalają na to ich interfejsy; niezgodne ścieżki przechwytywania należą do wyraźnie oddzielnych warstw.