Wyniki pilotażu · korekta interpretacji 6 września 2026
Trzy kategorie testów. Jedno ograniczone badanie pilotażowe.
Te same 20 czystych urządzeń syntetycznych, zdekodowanych trzy razy na linię na jednym M1 Max MacBook Pro przy użyciu Yaps 2.3.2129. Core ML Parakeet i Whisper Base to konfiguracje modeli wewnątrz Yaps, a nie produkty konkurencji.
01 · Rekord zbiorczy
Rozpoznawanie z czyszczeniem lokalnym, mierzone łącznie.
Yaps syntetyczny pilot odtwarzania urządzenia testowego. Niższe wartości WER, wskaźnika usuwania i opóźnienia wskazują na mniejszą liczbę błędów lub krótszy czas przetwarzania w tym konkretnym ustawieniu uruchomienia; nie są to rankingi produktów.
Yaps tor wyjściowy
Rola
Działa
Słowa z powtórzeniami
Mikro WER
Wskaźnik usuwania
Mediana przetwarzania
przetwarzanie p95
Maksymalne przetwarzanie
Core ML Parakeet + lokalne czyszczenie
Porządkowanie na
60
1,473
3.46%
0.41%
1,124 ms
2,807 ms
2,958 ms
Core ML Parakeet, czyszczenie wyłączone
Czyszczenie wyłączone
60
1,473
3.67%
0.20%
250 ms
722 ms
1,863 ms
Whisper Base, sprzątanie
Czyszczenie wyłączone
60
1,473
6.52%
0.41%
844 ms
1,669 ms
2,189 ms
Czas przetwarzania obejmuje rozpoznawanie, finalizację potoku i lokalne czyszczenie, jeśli jest włączone. Nie obejmuje to początkowej konstrukcji środowiska wykonawczego, ładowania urządzeń, nagrywania na żywo, wysyłania skrótów i wstawiania kursora. Wszystkie pasy oceniają końcowe wyniki oceny; na pasach czyszczących nadal można zastosować zmiany słownictwa i formatowania.
Opóźnienie wykorzystuje 60 równomiernie ważonych próbek dekodowania na ścieżkę i kwantyle liniowe R-7. 20 urządzeń zawiera 491 pozycji słów referencyjnych na przebieg, liczonych trzykrotnie w mianowniku 1473 słów. Powtórzenia nie są wypowiedziami niezależnymi. Błędy progu jakości pozostają uwzględnione: 3 z włączonym czyszczeniem Core ML, 3 z wyłączonym czyszczeniem Core ML i 6 z Whisper.
„Mikro” oznacza, że liczba operacji edycyjnych i słowa referencyjne zostały zsumowane przed obliczeniem każdej stawki.Nie jest to średnia makro wartości procentowych przypadających na klip.
02 · Ograniczone czytanie
Co te trzy rzędy mogą obsłużyć.
Czyszczenie wyłączone
Dopasowane konfiguracje czyszczenia
Whisper Base z wyłączonym czyszczeniem miał o 2,85 punktu procentowego wyższy WER, współczynnik usuwania wyższy o 0,20 punktu, medianę wyższą o 595 ms i o 947 ms wyższe p95 niż Core ML Parakeet z wyłączonym czyszczeniem w tych dopasowanych pilotuje.
Pas z włączoną funkcją czyszczenia
Wspólne rozpoznanie i oczyszczenie
Pas z włączoną funkcją czyszczenia Core ML obejmuje lokalne czyszczenie semantyczne. Jej mediana 1124 ms i 2807 ms p95 opisują łącznie rozpoznanie i finalizację przed umieszczeniem w innej aplikacji.
Co zadziałało
Pipeline publikacji
Sanitizer zachował liczniki i opóźnienia, wykluczając transkrypcje, odniesienia, podpowiedzi i kontekst aplikacji. Integralność plików publicznych jest rejestrowana przy użyciu skrótów SHA-256.
Co pozostaje
Dowody porównawcze
Nadal wymagana jest ludzka mowa, wiele akcentów i języków, przechwytywanie mikrofonu na żywo, kontrolowany porządek termiczny, obserwacja sieci, więcej urządzeń i systemy innych firm.
03 · Wyłączenia jawne
Czego ten pilot nie pokazuje.
Porównanie wydajności z jakimkolwiek innym produktem.
Wydajność w odniesieniu do ludzkiej mowy, akcentów lub wielojęzycznej mowy.
Mikrofon na żywo, redukcja szumów, bramka ciszy, pierwsze słowo lub zachowanie przy wyciszeniu końcowych fragmentów.
Wydajność zimna i ciepła w ramach kontrolowanego protokołu termicznego.
Zachowanie offline lub związane z prywatnością ustalone poprzez obserwację sieci.
Ogólne twierdzenie, że jedna surowa lub oczyszczona konfiguracja jest lepsza.
Korpus, matryca urządzenia, kolejność i procedura termiczna nie zostały wstępnie zarejestrowane. Te obserwacje opisują te sekwencyjne uruchomienia, na tym korpusie, urządzeniu, wersji oprogramowania i dacie.