Reprodukowalny korpus
Publicznie licencjonowane wypowiedzi i zatwierdzone skrypty, używając tych samych fragmentów audio tam, gdzie to obsługiwane, w celu izolowania rozpoznawania i post-processingu.
Metodologia · wersja 0.1.0
Protokół przypominający rejestrację wstępną, pozwalający na równą kontrolę korzystnych i niekorzystnych wyników.Obecna wersja jest nadal pilotażowa;zasady te definiują bramkę dla przyszłego benchmarku.
Każdy system jest krotką: publiczna wersja produktu, wersja systemu operacyjnego, wersja silnika lub modelu, ustawienia wpływające na rozpoznawanie i czyszczenie, klasa urządzenia i ścieżka przechwytywania.Wyniki z różnych krotek nigdy nie są łączone w cichej puli.
Jeśli produkt nie akceptuje tej samej ścieżki audio, jest to zgłaszane w osobnej warstwie.Nagranie z mikrofonu na żywo nie jest bezpośrednio porównywalne z odtwarzaniem pliku.
| Platforma | Klasa podstawowa | Aktualna klasa | Cel |
|---|---|---|---|
| macOS | Wpis Apple Silicon | Aktualny Apple Silicon | Lokalny zakres pulpitu |
| Windows | Laptop x86 dla mainstreamu | Aktualna wydajność laptopa | Różnice w CPU i GPU |
| Androida | Obsługiwane urządzenia średniej klasy | Aktualny flagowiec | Zmienność mobilna |
Publicznie licencjonowane wypowiedzi i zatwierdzone skrypty, używając tych samych fragmentów audio tam, gdzie to obsługiwane, w celu izolowania rozpoznawania i post-processingu.
Skalibrowane odtwarzanie w udokumentowanych pomieszczeniach i mikrofonach w celu wykrycia zachowań związanych z usuwaniem szumów, przed filmem, bramką wyciszającą i płukaniem ogona.
Nowo wyrażający zgodę mówcy czytają wcześniej zarejestrowane podpowiedzi. Prywatne nagrania wsparcia nigdy nie są wprowadzane do publicznego korpusu.
Język, odmiana regionalna, czas trwania, hałas, warunki w pomieszczeniu, imiona, liczby, terminy techniczne, pauzy i poprawki w mowie.
Word poziom błędu obliczany jest jako podstawienia plus wstawienia plus skreślenia podzielone przez słowa referencyjne. W badaniu opisano również każdą operację osobno, ponieważ pojedynczy płynny zapis może ukryć brakujące zdanie.
Zagregowane stawki to micro-word-weighted: liczba operacji i słowa referencyjne są sumowane przed obliczeniem stawki. Opóźnienie publikuje liczbę próbek, medianę, p95 i maksimum. Ukończony pilot ma mieszany stan termiczny; kontrolowane przebiegi zimne i ciepłe oraz dostarczanie interfejsu użytkownika na żywo to przyszłe pomiary.
Czas przetwarzania obejmuje rozpoznawanie, finalizację potoku i lokalne czyszczenie, jeśli jest włączone. Nie obejmuje to początkowej konstrukcji środowiska wykonawczego, ładowania urządzeń, nagrywania na żywo, wysyłania skrótów i wstawiania kursora. Wszystkie pasy oceniają końcowe wyniki oceny; na pasach czyszczących nadal można zastosować zmiany słownictwa i formatowania.
Opóźnienie wykorzystuje 60 równomiernie ważonych próbek dekodowania na ścieżkę i kwantyle liniowe R-7. 20 urządzeń zawiera 491 pozycji słów referencyjnych na przebieg, liczonych trzykrotnie w mianowniku 1473 słów. Powtórzenia nie są wypowiedziami niezależnymi. Błędy progu jakości pozostają uwzględnione: 3 z włączonym czyszczeniem Core ML, 3 z wyłączonym czyszczeniem Core ML i 6 z Whisper.
Interpretacja poprawiona 6 września 2026. Numery oryginalne niezmienione. Przeczytaj audyt dowodów, odniesienia zewnętrzne, pozostałe ograniczenia i instrukcje dotyczące reprodukcji.
Protokół rejestruje, czy przepływ pracy kończy się w trybie offline po konfiguracji, obserwowane cele i bajty oraz czy zaobserwowano opuszczanie urządzenia przez dane audio lub tekstowe. Przechwytywanie pakietów ma martwe punkty, więc defensowalne stwierdzenie brzmi: „w tym teście nie zaobserwowano danych audio/tekstowych”. Nigdy nie twierdz, że „nic nigdy nie wychodzi”.
Obecny zestaw testowy głównie testuje potok transkrypcji po przechwyceniu. Nie odtwarza w pełni dźwięku z plików testowych przez rzeczywisty zestaw mikrofonów, więc przycinanie przy nagrywaniu, artefakty redukcji szumów, wstępne nagranie, bramkowanie ciszy i końcowe wyczyszczenie wymagają wyposażenia fazy B.
Obserwacja sieci nie może udowodnić braku zaszyfrowanej treści ani przewidzieć przyszłego zachowania. Publiczny korpus nie może reprezentować każdego akcentu, niepełnosprawności, mikrofonu, pomieszczenia ani spontanicznego stylu mówienia. Każdy wynik jest związany z określoną wersją i datą.