再現可能なコーパス
認識と後処理を分離するためにサポートされている同じオーディオ バイトを使用する、公的にライセンスされた音声と同意されたスクリプト。
方法論 · バージョン 0.1.0
有利な結果と不利な結果を同等に検査可能にするための事前登録スタイルのプロトコル。現在のリリースはまだパイロット版です。これらのルールは、将来のベンチマークのゲートを定義します。
すべてのシステムは、公開製品バージョン、オペレーティング システムのバージョン、エンジンまたはモデルのリビジョン、認識とクリーンアップに影響を与える設定、デバイス クラス、およびキャプチャ パスのタプルです。さまざまなタプルからの結果がサイレントにプールされることはありません。
製品が同じオーディオ パスを受け入れられない場合は、別の階層でレポートされます。ライブ マイク キャプチャは、ファイルの再生と直接比較できるものではありません。
| プラットフォーム | ベースラインクラス | 現在のクラス | 目的 |
|---|---|---|---|
| macOS | エントリー Apple Silicon | 現在の Apple Silicon | ローカル デスクトップ範囲 |
| Windows | メインストリーム x86 ラップトップ | 現在のパフォーマンスのラップトップ | CPU と GPU の差異 |
| Android | サポートされているミッドレンジ デバイス | 現在の主力製品 | モバイルの差異 |
認識と後処理を分離するためにサポートされている同じオーディオ バイトを使用する、公的にライセンスされた音声と同意されたスクリプト。
文書化された部屋とマイクを介して再生を調整し、ノイズ除去、プリロール、サイレンスゲート、テールフラッシュの動作を明らかにしました。
新しく同意したスピーカーが事前登録されたプロンプトを読み上げます。プライベート サポート キャプチャがパブリック コーパスに昇格されることはありません。
言語、地域の多様性、時間、騒音、部屋の状況、名前、番号、専門用語、一時停止、音声の修正。
Word エラー率は次のように計算されます。置換、挿入、削除を参照語で割ったもの。また、単一の流暢なトランスクリプトが欠落したフレーズを隠す可能性があるため、この研究では各操作を個別に報告しています。
集計レートは micro-word-weighted: レートを計算する前に、操作数と参照単語が合計されます。レイテンシでは、サンプル数、中央値、p95、および最大値が公開されます。完成したパイロットには混合熱状態があります。制御されたコールド実行とウォーム実行、およびライブ UI 配信は今後の測定値として残ります。
処理時間には、認識、パイプラインのファイナライズ、有効時のローカル クリーンアップが含まれます。これには、最初のランタイム構築、フィクスチャのロード、ライブレコーディング、ショートカットのディスパッチ、カーソル挿入は含まれません。すべてのレーンが最終評価出力をスコア化します。クリーンアップオフレーンでも語彙や書式の変更を適用できます。
レイテンシは、レーンごとに 60 個の均等に重み付けされたデコード サンプルと R-7 線形分位数を使用します。20 個のフィクスチャには、パスごとに 491 個の参照単語位置が含まれており、1,473 単語の分母で 3 回カウントされます。繰り返しは独立した発話ではありません。品質しきい値エラーも引き続き含まれます。Core ML クリーンアップがオンの場合が 3 件、Core ML クリーンアップがオフの場合が 3 件、Whisper の場合が 6 件です。
解釈は 2026 年 9 月 6 日に修正されました。元の数値は変更されていません。 証拠監査、外部参照、残りの制限、および再現指示を読み上げます。
このプロトコルは、セットアップ後にワークフローがオフラインで完了したかどうか、観察された宛先とバイト数、デバイスからの音声またはテキストのペイロードが観察されたかどうかを記録します。パケット キャプチャには盲点があるため、「このテストでは音声/テキスト ペイロードは観察されなかった」という主張が擁護可能です。「何も残らない」とは決して主張しないでください。
現在のハーネスは、主にキャプチャ後のトランスクリプト パイプラインをテストします。ライブマイクスタックを介してフィクスチャオーディオを完全に再生するわけではないため、クリッピングのキャプチャ、ノイズアーティファクトの除去、プリロール、サイレンスゲート、テールフラッシュにはフェーズBのインストルメンテーションが必要です。
ネットワークの観察では、暗号化されたコンテンツがないことを証明したり、将来の動作を予測したりすることはできません。パブリック コーパスは、すべてのアクセント、障害、マイク、部屋、または自発的な話し方を表すことはできません。すべての結果は特定のバージョンと日付に関連付けられます。