Reproduceerbaar corpus
Publiek gelicentieerd spraakmateriaal en goedgekeurde scripts, gebruikmakend van dezelfde audiobestanden waar ondersteund om herkenning en nabewerking te isoleren.
Methodologie · versie 0.1.0
Een protocol in preregistratiestijl om gunstige en ongunstige uitkomsten in gelijke mate inspecteerbaar te maken.De huidige release is nog steeds een pilot;deze regels definiëren de poort voor een toekomstige benchmark.
Elk systeem is een tupel: openbare productversie, versie van het besturingssysteem, engine- of modelrevisie, instellingen die van invloed zijn op herkenning en opschoning, apparaatklasse en vastleggingspad.Resultaten van verschillende tupels worden nooit stilzwijgend samengevoegd.
Als een product niet hetzelfde audiopad kan accepteren, wordt dit in een apart stratum gerapporteerd.Een live microfoonopname wordt niet gepresenteerd als direct vergelijkbaar met het afspelen van bestanden.
| Platform | Basisklasse | Huidige klasse | Doel |
|---|---|---|---|
| macOS | Entry Apple Silicon | Huidige Apple Silicon | Lokaal desktopbereik |
| Windows | Mainstream x86-laptop | Huidige prestatielaptop | CPU- en GPU-variantie |
| Android | Ondersteund mid-range apparaat | Huidig vlaggenschip | Mobiele variatie |
Publiek gelicentieerd spraakmateriaal en goedgekeurde scripts, gebruikmakend van dezelfde audiobestanden waar ondersteund om herkenning en nabewerking te isoleren.
Gekalibreerde weergave via gedocumenteerde kamers en microfoons om denoise-, pre-roll-, quiet-gate- en tail-flush-gedrag bloot te leggen.
Nieuwelijk toegestemde sprekers lezen vooraf geregistreerde prompts. Private ondersteuningsopnames worden nooit gepromoveerd naar het publieke corpus.
Taal, regionale variatie, duur, lawaai, kameromstandigheden, namen, nummers, technische termen, pauzes en gesproken correcties.
Word Het foutenpercentage wordt berekend als vervangingen plus invoegingen plus verwijderingen, gedeeld door referentiewoorden. Het onderzoek rapporteert ook elke bewerking afzonderlijk, omdat een enkel vloeiend transcript een ontbrekende zin kan verbergen.
Geaggregeerde tarieven zijn micro-word-weighted: aantal bewerkingen en referentiewoorden worden opgeteld voordat het tarief wordt berekend. Latency publiceert het aantal monsters, de mediaan, p95 en het maximum. De voltooide pilot heeft een gemengde thermische toestand; gecontroleerde koude en warme runs en live UI-levering blijven toekomstige metingen.
De verwerkingstijd omvat herkenning, pijplijnafronding en lokale opschoning, indien ingeschakeld. Het omvat de initiële runtime-constructie, het laden van de armatuur, live-opname, het verzenden van snelkoppelingen en het invoegen van de cursor. Alle rijstroken scoren de uiteindelijke output van de evaluator; Opruimstroken kunnen nog steeds wijzigingen in de woordenschat en opmaak toepassen.
Latency gebruikt 60 gelijk gewogen decodeermonsters per baan en R-7 lineaire kwantielen. De 20 armaturen bevatten 491 referentiewoordposities per pass, drie keer geteld in de noemer van 1.473 woorden. Herhalingen zijn geen onafhankelijke uitingen. Fouten op het gebied van de kwaliteitsdrempel blijven inbegrepen: 3 met Core ML opschonen aan, 3 met Core ML opschonen uit en 6 met Whisper.
Interpretatie gecorrigeerd op 6 september 2026. Originele cijfers zijn ongewijzigd. Lees de bewijsaudit, externe referenties, resterende beperkingen en reproductie-instructies.
Het protocol registreert of een workflow offline wordt voltooid na de installatie, waargenomen bestemmingen en bytes, en of audio- of tekstinhoud werd waargenomen die het apparaat verliet. Pakketopname heeft blinde vlekken, dus de verdedigbare verklaring is “er werd geen audio-/tekstinhoud waargenomen in deze test.” Claim nooit “niets verlaat ooit het apparaat.”
Het huidige testkader test voornamelijk de transcriptiepijplijn na opname. Het speelt de fixture-audio niet volledig af via de live microfoonstack, dus capture clipping, denoise-artefacten, pre-roll, silence gating en tail flush vereisen Phase B-instrumentatie.
Netwerkobservatie kan het ontbreken van versleutelde inhoud niet bewijzen of toekomstig gedrag voorspellen. Een openbaar corpus kan niet elke accent, beperking, microfoon, kamer of spontane spreekstijl vertegenwoordigen. Elk resultaat is gebonden aan een specifieke versie en datum.