Reproducerbart korpus
Offentligt licensierat tal och godkända manus, med användning av samma ljudbitar där det stöds för att isolera igenkänning och efterbearbetning.
Metodologi · version 0.1.0
Ett förregistreringsprotokoll för att göra gynnsamma och ogynnsamma resultat lika inspekterbara.Den nuvarande utgåvan är fortfarande en pilot;dessa regler definierar porten för ett framtida benchmark.
Varje system är en tuppel: offentlig produktversion, operativsystemversion, motor- eller modellrevidering, inställningar som påverkar igenkänning och rensning, enhetsklass och fångstväg. Resultat från olika tupper samlas aldrig tyst ihop.
Om en produkt inte kan acceptera samma ljudväg rapporteras det i ett separat skikt. En direkt mikrofoninspelning presenteras inte som direkt jämförbar med en filuppspelning.
| Plattform | Baslinjeklass | Aktuell klass | Syfte |
|---|---|---|---|
| macOS | Post Apple Silicon | Aktuell Apple Silicon | Lokal skrivbordsräckvidd |
| Windows | Mainstream x86-bärbar dator | Aktuell bärbar dator med prestanda | CPU- och GPU-varians |
| Android | Stödd mellan-range-enhet | Aktuellt flaggskepp | Mobil varians |
Offentligt licensierat tal och godkända manus, med användning av samma ljudbitar där det stöds för att isolera igenkänning och efterbearbetning.
Kalibrerad uppspelning genom dokumenterade rum och mikrofoner för att exponera denoise, pre-roll, silence-gate och tail-flush beteenden.
Nyss samtyckta talare läser förregistrerade uppmaningar. Privat stödmaterial förs aldrig över till den offentliga korpusen.
Språk, regional variation, varaktighet, brus, rumsförhållanden, namn, siffror, tekniska termer, pauser och muntliga korrigeringar.
Word felfrekvens beräknas som substitutioner plus infogningar plus raderingar, dividerat med referensord. Studien rapporterar också varje operation separat eftersom ett enda flytande transkript kan dölja en saknad fras.
Aggregerade priser är micro-word-weighted: operationsräkningar och referensord summeras innan hastigheten beräknas. Latens publicerar provantal, median, p95 och maximum. Den avslutade piloten har blandat termiskt tillstånd; kontrollerade kalla och varma körningar och live UI-leverans förblir framtida mätningar.
Behandlingstiden inkluderar igenkänning, slutförande av pipeline och lokal rensning när aktiverat. Det utesluter initial runtime-konstruktion, fixturladdning, liveinspelning, genvägsutskick och markörinsättning. Alla banor ger slutliga utvärderingsresultat; Rensningsbanor kan fortfarande tillämpa ordförråd och formateringsändringar.
Latensen använder 60 lika viktade avkodningsprov per körfält och R-7 linjära kvantiler. De 20 matcherna innehåller 491 referensordspositioner per pass, räknade tre gånger i nämnaren på 1 473 ord. Upprepningar är inte självständiga yttranden. Kvalitetströskelfel förblir inkluderade: 3 med Core ML rensning på, 3 med Core ML rensning av och 6 med Whisper.
Tolkning korrigerad 6 september 2026. Originalnummer är oförändrade. Läs bevisgranskningen, externa referenser, återstående begränsningar och reproduktionsinstruktioner.
Protokollet registrerar om ett arbetsflöde slutförs offline efter installation, observerade destinationer och byte, samt om ljud- eller textdata observerades lämna enheten. Paketfångst har blinda fläckar, så det försvarbara uttalandet är "ingen ljud-/textdata observerades i detta test." Påstå aldrig "inget lämnar någonsin."
Det nuvarande testverktyget testar främst transkriptionsflödet efter inspelning. Det spelar inte helt upp fixerat ljud genom den live mikrofonkedjan, så klippning vid inspelning, brusreduceringsartefakter, förspolning, tystnadsgate och tail flush kräver instrumentering i Fas B.
Nätverksobservation kan inte bevisa frånvaron av krypterat innehåll eller förutsäga framtida beteende. Ett offentligt korpus kan inte representera varje accent, funktionsnedsättning, mikrofon, rum eller spontant talande stil. Varje resultat är kopplat till en specifik version och datum.