Reproduzierbarer Korpus
Öffentlich lizenzierte Sprache und genehmigte Skripte unter Verwendung derselben Audiobytes, sofern unterstützt, um Erkennung und Nachbearbeitung zu isolieren.
Methodik · Version 0.1.0
Ein Protokoll im Vorregistrierungsstil, um günstige und ungünstige Ergebnisse gleichermaßen überprüfbar zu machen. Bei der aktuellen Version handelt es sich noch um eine Pilotversion;Diese Regeln definieren das Tor für einen zukünftigen Benchmark.
Jedes System ist ein Tupel: öffentliche Produktversion, Betriebssystemversion, Engine- oder Modellrevision, Einstellungen, die sich auf Erkennung und Bereinigung auswirken, Geräteklasse und Erfassungspfad. Ergebnisse aus verschiedenen Tupeln werden niemals stillschweigend zusammengefasst.
Wenn ein Produkt nicht den gleichen Audiopfad akzeptieren kann, wird es in einem separaten Stratum gemeldet. Eine Live-Mikrofonaufnahme wird nicht als direkt mit einer Dateiwiedergabe vergleichbar dargestellt.
| Plattform | Basisklasse | Aktuelle Klasse | Zweck |
|---|---|---|---|
| macOS | Eintrag Apple Silicon | Aktuelle Apple Silicon | Lokaler Desktop-Bereich |
| Windows | Mainstream-x86-Laptop | Aktueller Performance-Laptop | CPU- und GPU-Varianz |
| Android | Unterstütztes Mittelklassegerät | Aktuelles Flaggschiff | Mobile Varianz |
Öffentlich lizenzierte Sprache und genehmigte Skripte unter Verwendung derselben Audiobytes, sofern unterstützt, um Erkennung und Nachbearbeitung zu isolieren.
Kalibrierte Wiedergabe über dokumentierte Räume und Mikrofone, um Rauschunterdrückung, Pre-Roll, Silence-Gate und Tail-Flush-Verhalten aufzudecken.
Neu zugelassene Redner lesen vorregistrierte Eingabeaufforderungen. Private Support-Erfassungen werden niemals in das öffentliche Korpus aufgenommen.
Sprache, regionale Vielfalt, Dauer, Lärm, Raumbedingungen, Namen, Nummern, Fachbegriffe, Pausen und gesprochene Korrekturen.
Word Die Fehlerrate wird berechnet als Ersetzungen plus Einfügungen plus Löschungen, dividiert durch Referenzwörter. Die Studie berichtet auch über jeden Vorgang separat, da ein einzelnes fließendes Transkript eine fehlende Phrase verbergen kann.
Aggregierte Raten sind micro-word-weighted: Operationsanzahl und Referenzwörter werden summiert, bevor die Rate berechnet wird. Latenz veröffentlicht Beispielanzahl, Median, p95 und Maximum. Der abgeschlossene Pilot hat einen gemischten thermischen Zustand; Kontrollierte Kalt- und Warmläufe und Live-UI-Bereitstellung bleiben künftige Messungen.
Die Verarbeitungszeit umfasst Erkennung, Pipeline-Abschluss und lokale Bereinigung, wenn aktiviert. Ausgenommen sind die anfängliche Laufzeitkonstruktion, das Laden von Fixtures, die Live-Aufzeichnung, das Versenden von Verknüpfungen und das Einfügen von Cursorn. Alle Bahnen bewerten die endgültige Ausgabe des Bewerters. Aufräumspuren können weiterhin Vokabular- und Formatierungsänderungen vornehmen.
Latency verwendet 60 gleichgewichtete Dekodierproben pro Spur und lineare R-7-Quantile. Die 20 Spiele enthalten 491 Referenzwortpositionen pro Durchgang, die im 1.473 Wörter umfassenden Nenner dreimal gezählt werden. Wiederholungen sind keine eigenständigen Äußerungen. Qualitätsschwellenfehler bleiben enthalten: 3 mit aktivierter Core ML-Bereinigung, 3 mit deaktivierter Core ML-Bereinigung und 6 mit Whisper.
Dolmetschen korrigiert am 6. September 2026. Die ursprünglichen Zahlen bleiben unverändert. Lesen Sie die Beweisprüfung, externe Referenzen, verbleibende Einschränkungen und Reproduktionshinweise.
Das Protokoll zeichnet auf, ob ein Workflow nach der Einrichtung offline abgeschlossen wird, welche Ziele und Bytes beobachtet wurden und ob beim Verlassen des Geräts Audio- oder Textnutzlasten beobachtet wurden. Die Paketerfassung weist blinde Flecken auf, daher lautet die vertretbare Aussage: „Bei diesem Test wurde keine Audio-/Textnutzlast beobachtet.“Behaupten Sie niemals, dass „nichts jemals weggeht“.
Der aktuelle Harness testet hauptsächlich die Transkript-Pipeline nach der Erfassung. Das Audiosignal des Geräts wird nicht vollständig über den Live-Mikrofonstapel wiedergegeben. Daher sind für die Erfassung von Clipping, das Entfernen von Rauschartefakten, Pre-Roll, Silence Gating und Tail Flush Phase-B-Instrumente erforderlich.
Die Netzwerkbeobachtung kann weder das Fehlen verschlüsselter Inhalte nachweisen noch zukünftiges Verhalten vorhersagen. Ein öffentlicher Korpus kann nicht jeden Akzent, jede Behinderung, jedes Mikrofon, jeden Raum oder jeden spontanen Sprechstil abbilden. Jedes Ergebnis ist an eine bestimmte Version und ein bestimmtes Datum gebunden.