Ga naar de inhoud

Methodologie · versie 0.1.0

De regels komen vóór de resultaten.

Een protocol in preregistratiestijl om gunstige en ongunstige uitkomsten in gelijke mate inspecteerbaar te maken.De huidige release is nog steeds een pilot;deze regels definiëren de poort voor een toekomstige benchmark.

01 · Systeemdefinitie

Een productnaam is geen testconditie.

Elk systeem is een tupel: openbare productversie, versie van het besturingssysteem, engine- of modelrevisie, instellingen die van invloed zijn op herkenning en opschoning, apparaatklasse en vastleggingspad.Resultaten van verschillende tupels worden nooit stilzwijgend samengevoegd.

Als een product niet hetzelfde audiopad kan accepteren, wordt dit in een apart stratum gerapporteerd.Een live microfoonopname wordt niet gepresenteerd als direct vergelijkbaar met het afspelen van bestanden.

Voorgesteld apparaatmatrix voor de eerste volledige benchmarkrelease.
PlatformBasisklasseHuidige klasseDoel
macOSEntry Apple SiliconHuidige Apple SiliconLokaal desktopbereik
WindowsMainstream x86-laptopHuidige prestatielaptopCPU- en GPU-variantie
AndroidOndersteund mid-range apparaatHuidig vlaggenschipMobiele variatie
02 · Drie fasen

Herhaalbaarheid in het laboratorium, daarna realiteit van echte apparaten.

Fase A

Reproduceerbaar corpus

Publiek gelicentieerd spraakmateriaal en goedgekeurde scripts, gebruikmakend van dezelfde audiobestanden waar ondersteund om herkenning en nabewerking te isoleren.

Fase B

Captuur met echt apparaat

Gekalibreerde weergave via gedocumenteerde kamers en microfoons om denoise-, pre-roll-, quiet-gate- en tail-flush-gedrag bloot te leggen.

Fase C

Natuurlijke dictatie

Nieuwelijk toegestemde sprekers lezen vooraf geregistreerde prompts. Private ondersteuningsopnames worden nooit gepromoveerd naar het publieke corpus.

Over alle fasen heen

Zichtbare lagen

Taal, regionale variatie, duur, lawaai, kameromstandigheden, namen, nummers, technische termen, pauzes en gesproken correcties.

03 · Primaire statistieken

WER is het begin, niet het hele verhaal.

Word Het foutenpercentage wordt berekend als vervangingen plus invoegingen plus verwijderingen, gedeeld door referentiewoorden. Het onderzoek rapporteert ook elke bewerking afzonderlijk, omdat een enkel vloeiend transcript een ontbrekende zin kan verbergen.

Geaggregeerde tarieven zijn micro-word-weighted: aantal bewerkingen en referentiewoorden worden opgeteld voordat het tarief wordt berekend. Latency publiceert het aantal monsters, de mediaan, p95 en het maximum. De voltooide pilot heeft een gemengde thermische toestand; gecontroleerde koude en warme runs en live UI-levering blijven toekomstige metingen.

De verwerkingstijd omvat herkenning, pijplijnafronding en lokale opschoning, indien ingeschakeld. Het omvat de initiële runtime-constructie, het laden van de armatuur, live-opname, het verzenden van snelkoppelingen en het invoegen van de cursor. Alle rijstroken scoren de uiteindelijke output van de evaluator; Opruimstroken kunnen nog steeds wijzigingen in de woordenschat en opmaak toepassen.

Latency gebruikt 60 gelijk gewogen decodeermonsters per baan en R-7 lineaire kwantielen. De 20 armaturen bevatten 491 referentiewoordposities per pass, drie keer geteld in de noemer van 1.473 woorden. Herhalingen zijn geen onafhankelijke uitingen. Fouten op het gebied van de kwaliteitsdrempel blijven inbegrepen: 3 met Core ML opschonen aan, 3 met Core ML opschonen uit en 6 met Whisper.

Interpretatie gecorrigeerd op 6 september 2026. Originele cijfers zijn ongewijzigd. Lees de bewijsaudit, externe referenties, resterende beperkingen en reproductie-instructies.

Netwerkobservatie

Het protocol registreert of een workflow offline wordt voltooid na de installatie, waargenomen bestemmingen en bytes, en of audio- of tekstinhoud werd waargenomen die het apparaat verliet. Pakketopname heeft blinde vlekken, dus de verdedigbare verklaring is “er werd geen audio-/tekstinhoud waargenomen in deze test.” Claim nooit “niets verlaat ooit het apparaat.”

04 · Publicatiepoorten

Geen ranglijst totdat elke poort is gepasseerd.

Methode eerst bevrorenVersie en analysecommit geregistreerd vóór de benchmarkverzameling.
Corpus vastgezetOnveranderlijke revisies en SHA-256-samenvattingen voor elke bron en verzonden bestand.
Beoordeelde referentiesTwee-persoons referentiereview en één normalisatiebeleid voor elk systeem.
Invoer vergelijkbaarZelfde bytes of een expliciet, afzonderlijk gerapporteerd capture-niveau.
Herkomst voltooidProduct, model, apparaat, instellingen, stroomstatus en opnamepad geregistreerd.
Mislukkingen behoudenTimeouts en ontbrekende transcripties blijven in de noemer.
Operaties reconciliërenVervangingen, toevoegingen en verwijderingen vormen samen de bewerkingsafstand.
PrivacybeoordelingSanitizer passeert en een mens inspecteert de grens van het openbare artefact.
Conflict onthuldYaps auteurschap, uitsluitingen, afwijkingen en beperkingen blijven prominent.
Gegevens worden verzonden met claimsGesaneerde rijen, aggregaten, manifesten en correctiekanaalpublicatie samen.
05 · Bekende beperkingen

Wat dit protocol nog steeds niet kan zien.

Het huidige testkader test voornamelijk de transcriptiepijplijn na opname. Het speelt de fixture-audio niet volledig af via de live microfoonstack, dus capture clipping, denoise-artefacten, pre-roll, silence gating en tail flush vereisen Phase B-instrumentatie.

Netwerkobservatie kan het ontbreken van versleutelde inhoud niet bewijzen of toekomstig gedrag voorspellen. Een openbaar corpus kan niet elke accent, beperking, microfoon, kamer of spontane spreekstijl vertegenwoordigen. Elk resultaat is gebonden aan een specifieke versie en datum.

Toestand van Privédictaat 2026Methode versie 0.1.0Alleen pilootbewijsOntworpen en uitgegeven door Yaps