Zum Inhalt springen

Methodik · Version 0.1.0

Die Regeln kommen vor den Ergebnissen.

Ein Protokoll im Vorregistrierungsstil, um günstige und ungünstige Ergebnisse gleichermaßen überprüfbar zu machen. Bei der aktuellen Version handelt es sich noch um eine Pilotversion;Diese Regeln definieren das Tor für einen zukünftigen Benchmark.

01 · Systemdefinition

Ein Produktname ist keine Testbedingung.

Jedes System ist ein Tupel: öffentliche Produktversion, Betriebssystemversion, Engine- oder Modellrevision, Einstellungen, die sich auf Erkennung und Bereinigung auswirken, Geräteklasse und Erfassungspfad. Ergebnisse aus verschiedenen Tupeln werden niemals stillschweigend zusammengefasst.

Wenn ein Produkt nicht den gleichen Audiopfad akzeptieren kann, wird es in einem separaten Stratum gemeldet. Eine Live-Mikrofonaufnahme wird nicht als direkt mit einer Dateiwiedergabe vergleichbar dargestellt.

Vorgeschlagene Gerätematrix für die erste vollständige Benchmark-Veröffentlichung.
PlattformBasisklasseAktuelle KlasseZweck
macOSEintrag Apple SiliconAktuelle Apple SiliconLokaler Desktop-Bereich
WindowsMainstream-x86-LaptopAktueller Performance-LaptopCPU- und GPU-Varianz
AndroidUnterstütztes MittelklassegerätAktuelles FlaggschiffMobile Varianz
02 · Drei Phasen

Wiederholbarkeit im Labor, dann reale Geräterealität.

Phase A

Reproduzierbarer Korpus

Öffentlich lizenzierte Sprache und genehmigte Skripte unter Verwendung derselben Audiobytes, sofern unterstützt, um Erkennung und Nachbearbeitung zu isolieren.

Phase B

Erfassung realer Geräte

Kalibrierte Wiedergabe über dokumentierte Räume und Mikrofone, um Rauschunterdrückung, Pre-Roll, Silence-Gate und Tail-Flush-Verhalten aufzudecken.

Phase C

Natürliches Diktat

Neu zugelassene Redner lesen vorregistrierte Eingabeaufforderungen. Private Support-Erfassungen werden niemals in das öffentliche Korpus aufgenommen.

Über alle Phasen hinweg

Sichtbare Schichten

Sprache, regionale Vielfalt, Dauer, Lärm, Raumbedingungen, Namen, Nummern, Fachbegriffe, Pausen und gesprochene Korrekturen.

03 · Primärmetriken

WER ist der Anfang, nicht die ganze Geschichte.

Word Die Fehlerrate wird berechnet als Ersetzungen plus Einfügungen plus Löschungen, dividiert durch Referenzwörter. Die Studie berichtet auch über jeden Vorgang separat, da ein einzelnes fließendes Transkript eine fehlende Phrase verbergen kann.

Aggregierte Raten sind micro-word-weighted: Operationsanzahl und Referenzwörter werden summiert, bevor die Rate berechnet wird. Latenz veröffentlicht Beispielanzahl, Median, p95 und Maximum. Der abgeschlossene Pilot hat einen gemischten thermischen Zustand; Kontrollierte Kalt- und Warmläufe und Live-UI-Bereitstellung bleiben künftige Messungen.

Die Verarbeitungszeit umfasst Erkennung, Pipeline-Abschluss und lokale Bereinigung, wenn aktiviert. Ausgenommen sind die anfängliche Laufzeitkonstruktion, das Laden von Fixtures, die Live-Aufzeichnung, das Versenden von Verknüpfungen und das Einfügen von Cursorn. Alle Bahnen bewerten die endgültige Ausgabe des Bewerters. Aufräumspuren können weiterhin Vokabular- und Formatierungsänderungen vornehmen.

Latency verwendet 60 gleichgewichtete Dekodierproben pro Spur und lineare R-7-Quantile. Die 20 Spiele enthalten 491 Referenzwortpositionen pro Durchgang, die im 1.473 Wörter umfassenden Nenner dreimal gezählt werden. Wiederholungen sind keine eigenständigen Äußerungen. Qualitätsschwellenfehler bleiben enthalten: 3 mit aktivierter Core ML-Bereinigung, 3 mit deaktivierter Core ML-Bereinigung und 6 mit Whisper.

Dolmetschen korrigiert am 6. September 2026. Die ursprünglichen Zahlen bleiben unverändert. Lesen Sie die Beweisprüfung, externe Referenzen, verbleibende Einschränkungen und Reproduktionshinweise.

Netzwerkbeobachtung

Das Protokoll zeichnet auf, ob ein Workflow nach der Einrichtung offline abgeschlossen wird, welche Ziele und Bytes beobachtet wurden und ob beim Verlassen des Geräts Audio- oder Textnutzlasten beobachtet wurden. Die Paketerfassung weist blinde Flecken auf, daher lautet die vertretbare Aussage: „Bei diesem Test wurde keine Audio-/Textnutzlast beobachtet.“Behaupten Sie niemals, dass „nichts jemals weggeht“.

04 · Veröffentlichungstore

Keine Bestenliste, bis jedes Tor passiert ist.

Methode zuerst eingefrorenVersion und Analyse-Commit werden vor der Benchmark-Erfassung aufgezeichnet.
Korpus angepinntUnveränderliche Revisionen und SHA-256-Digests für jede Quelle und jede ausgegebene Datei.
Referenzen überprüftReferenzüberprüfung durch zwei Personen und eine Normalisierungsrichtlinie für jedes System.
Eingaben vergleichbarGleiche Bytes oder eine explizite, separat gemeldete Erfassungsschicht.
Provenienz abgeschlossenProdukt, Modell, Gerät, Einstellungen, Energiestatus und Erfassungspfad aufgezeichnet.
Fehler bleiben erhaltenTimeouts und fehlende Transkripte bleiben im Nenner.
BetriebsabgleichErsetzungen, Einfügungen und Löschungen ergeben zusammen den Bearbeitungsabstand.
DatenschutzbewertungDesinfektionsmittel passiert und ein Mensch inspiziert die öffentliche Artefaktgrenze.
Konflikt offengelegtUrheberschaft, Ausschlüsse, Abweichungen und Einschränkungen von Yaps bleiben im Vordergrund.
Daten werden mit Ansprüchen geliefertBereinigte Zeilen, Aggregate, Manifeste und Korrekturkanalveröffentlichung zusammen.
05 · Bekannte Einschränkungen

Was dieses Protokoll noch nicht sehen kann.

Der aktuelle Harness testet hauptsächlich die Transkript-Pipeline nach der Erfassung. Das Audiosignal des Geräts wird nicht vollständig über den Live-Mikrofonstapel wiedergegeben. Daher sind für die Erfassung von Clipping, das Entfernen von Rauschartefakten, Pre-Roll, Silence Gating und Tail Flush Phase-B-Instrumente erforderlich.

Die Netzwerkbeobachtung kann weder das Fehlen verschlüsselter Inhalte nachweisen noch zukünftiges Verhalten vorhersagen. Ein öffentlicher Korpus kann nicht jeden Akzent, jede Behinderung, jedes Mikrofon, jeden Raum oder jeden spontanen Sprechstil abbilden. Jedes Ergebnis ist an eine bestimmte Version und ein bestimmtes Datum gebunden.

Stand des privaten Diktats 2026Methodenversion 0.1.0Nur PilotnachweiseEntworfen und veröffentlicht von Yaps