コンテンツにスキップ

プライベート ディクテーションの現状 · 2026 年

音声入力で抜け落ちる内容を測定する。

正確さ、削除、遅延、およびデバイス上の音声ツール全体で観察可能なネットワーク動作。数値の横に方法、制限、サニタイズしたデータを公開しています。

01 ・パイロット結果

最初の数字の全体像。

ローカル クリーンアップを有効にした場合、パイロットは処理時間の中央値 1,124 ミリ秒とワード エラー率 3.46% を記録しました。同じ 20 個のクリーンな合成フィクスチャが、Yaps 2.3.2129 を使用して 1 つの M1 Max MacBook Pro でレーンごとに 3 回デコードされました。この正確な設定内では、エラーとレイテンシの値が低いほど優れています。これらは Yaps 構成であり、競合製品ではありません。

備品
20
車線ごとに走行
60
単語、繰り返しあり
1,473
音声発信元
合成
テストデバイス
1
エラー集計
マイクロ
クリーンアップオン60 が実行されます。

Core ML Parakeet とローカルクリーンアップが必要です

マイクロ WER
3.46%
削除率
0.41%
中央値処理用
1,124 ms
p95 処理
2,807 ms
最大処理量
2,958 ms
クリーンアップをオフ60 が実行されます。

Core ML Parakeet、クリーンアップオフ

マイクロ WER
3.67%
削除率
0.20%
中央値処理用
250 ms
p95 処理
722 ms
最大処理量
1,863 ms
クリーンアップをオフ60 が実行されます。

Whisper Base、クリーンアップオフ

マイクロ WER
6.52%
削除率
0.41%
中央値処理用
844 ms
p95 処理
1,669 ms
最大処理量
2,189 ms

処理時間には、認識、パイプラインのファイナライズ、有効時のローカル クリーンアップが含まれます。これには、最初のランタイム構築、フィクスチャのロード、ライブレコーディング、ショートカットのディスパッチ、カーソル挿入は含まれません。すべてのレーンが最終評価出力をスコア化します。クリーンアップオフレーンでも語彙や書式の変更を適用できます。

レイテンシは、レーンごとに 60 個の均等に重み付けされたデコード サンプルと R-7 線形分位数を使用します。20 個のフィクスチャには、パスごとに 491 個の参照単語位置が含まれており、1,473 単語の分母で 3 回カウントされます。繰り返しは独立した発話ではありません。品質しきい値エラーも引き続き含まれます。Core ML クリーンアップがオンの場合が 3 件、Core ML クリーンアップがオフの場合が 3 件、Whisper の場合が 6 件です。

解釈は 2026 年 9 月 6 日に修正されました。元の数値は変更されていません。 証拠監査、外部参照、残りの制限、および再現指示を読み上げます。

このパイロットがサポートするもの

一致しましたクリーンアップオフの観察。

これらの実行では、クリーンアップをオフにした Whisper Base の方が 2.85 パーセント ポイント高かったWER、クリーンアップをオフにした場合の Core ML Parakeet と比較して、削除率が 0.20 ポイント高く、中央値が 595 ミリ秒高く、p95 が 947 ミリ秒高かった。

サポートできないもの

一般的な商品またはプライバシーの主張。

パイロットでは、人間の音声、アクセント、多言語音声、ライブマイクキャプチャ、制御された熱順序、ネットワーク観察、追加デバイス、およびサードパーティ製品は除外されます。

02 · プロダクト層

モデルは口述体験ではありません。

Yaps がレポートに含まれる理由

モデルの重みをダウンロードするのは簡単です。有用なディクテーション システムは、音声を確実にキャプチャし、適切なランタイムを選択し、そのモデルに合わせて音声を準備し、不完全な出力を検出し、ユーザーの意図を保持し、ユーザーが作業している場所に結果を配置する必要があります。

のデスクトップ アプリで実行されます。 Yaps は、モデル サーバー、スクリプト、オーディオ パイプライン、またはエクスポート ステップ自体を組み立てることなく、有能なローカル音声モデルを人々が日常のアプリ全体で使用できる単一のプライベート ツールに変えます。
01

キャプチャ

ショートカットまたはモバイル キーボードは、ユーザーを別の文字起こしツールに移動させることなく、プライベート録音を開始します。

02

準備する

Yaps は、認識前に音声検出、無音処理、およびデバイス形状の音声準備を適用します。

03

ルート

アプリは、デバイス、言語、品質設定、および利用可能なハードウェアにインストールされているローカル エンジンを選択します。

04

認識

Parakeet 、 Cohere 、 Whisper 、または専門ルートは、準備された音声を候補テキストに変換します。

05

ガード

完全性チェック、レスキュー パス、語彙処理、およびローカル クリーンアップにより、配信された結果が保護されます。

06

配信

完成したテキストはカーソル位置またはモバイル キーボード ワークフローにコミットされ、すぐに使用できるようになります。

この製品コンテキストは、レポートがクリーンアップ設定と測定された出力ステージを区別する理由を説明しています。Yaps が最適であるという証拠ではなく、製品のポジショニングをベンチマーク結果に変えるものでもありません。

03 ・より広範な証拠

研究プログラムはすでに 1 つのパイロットを超える規模になっています。

これらの関連研究では、さまざまなデバイス、コーパス、測定基準、およびテストプロトコルが使用されました。これらの数値は現在の製品に関する決定を説明していますが、これらを 1 つのリーダーボードに組み合わせてはなりません。

Apple Silicon・多言語対応関連研究

Cohere はルーティング会話を変更します。

より広範な M1 Max ベイクオフでは、24 言語にわたる 144 個の合成クリップと、13 言語にわたる 65 個の人間 FLEURS クリップが使用されました。Cohere とすべてのモデルが共有する、一致する 20 クリップの人間サブセットでは、Cohere は 4.2% の監査済み WER を記録しましたが、MLX Parakeet では 12.0% でした。

Cohere WER
4.2%
MLX Parakeet
12.0%
一致する人間のクリップ
20
Cohereはより狭い言語セットをサポートしており、予想される言語を必要とします。言語ごとに 5 つのクリップは依然として方向性の証拠であり、普遍的な品質を主張するものではありません。
Windows 11 · Cohere関連研究

多言語の信頼性が高くなりますが、遅延コストが発生します。

Ryzen 7 5700U Windows ラップトップ上で、Cohere と ONNX Parakeet は、14 の言語にわたって同じ 70 個のヒト FLEURS クリップを実行しました。Cohere は 70 個の空ではないトランスクリプトを返しました。Parakeet は 61 を返しました。自動言語比較 14 件中 12 件では Cohere が勝ちましたが、クリップあたりの平均時間は 3.654 秒であったのに対し、Parakeet は 1.394 秒でした。

Cohere は空ではありません
70/70
Parakeet 空ではない
61/70
Cohere は空でないことを意味します
3.654 s
ゼロ以外の差異がすべて完全な手動判定を受けるまで、言語スコアには方向性が残ります。サニタイズされた行はまだこの公開リリースの一部ではありません。
Android · アラビア語プレビュー関連研究

コーパス カバレッジが依然として失敗しても、デバイスの速度は向上する可能性があります。

アラビア語の FastConformer パックがPixel 10 Pro。1 つの無効なリファレンス ペアを除くと、39 個の FLEURS クリップは 9.8% WER と 4.1% CER を生成し、中央値は 624 ミリ秒、p95 は 984 ミリ秒でした。Mac CPU 上のより広範囲のクリーンでノイズの多い MASC スライスは、後に 22.5% WER のスコアを獲得したため、ルートは一般的なアラビア語の主張になるのではなく、プレビューのままです。

有効なクリップ
39
中央値デコード
624ミリ秒
p95 デコード
984 ミリ秒
電話の結果には、自発的な MSA や方言の使用ではなく、読み上げ音声が含まれます。より広範な MASC 結果が、アプリがルートに明示的に「プレビュー」というラベルを付けたままにする理由です。
04 · プラットフォーム カバレッジ

ギャップを隠すのではなく、ギャップを表示します。

macOS · Apple Silicon

公開済みパイロット版

現在の証拠現在の 20 のフィクスチャのパイロットに加えて、別の 144 の合成モデルと 65 の人間による多言語モデルのベイクオフが行われます。

次の証拠ゲート自発的なスピーチ、より多くの Mac 世代、制御された熱順序、ライブ マイク キャプチャを追加します。

Windows · x64

関連証拠

現在の証拠別の 70 クリップ、14 言語の人による FLEURS 検証により、Windows 11 上で Cohere と ONNX Parakeet が比較されました。

次の証拠ゲート凍結されたプロトコルの下でサニタイズされた行を公開し、低メモリおよび追加の GPU クラスを追加します。

Android · ARM64

関連証拠

現在の証拠Pixel 10 Pro の評価では、アラビア語 FastConformer パックを測定し、実際のキーボード パスを実行しました。

次の証拠ゲート自発的な方言音声、より多くの電話階層、英語ルート パリティ、バッテリー、および持続使用測定を追加します。

Linux · x64

研究ギャップ

現在の証拠Yaps は Linux で使用できますが、このレポートにはレポートグレードのネイティブ Linux の精度や遅延の実行は含まれていません。

次の証拠ゲートを実行します。 ネイティブ Ubuntu フィクスチャ リプレイ、インストール済みパッケージのディクテーション、CPU および Vulkan パス、 X11 、および Wayland を実行します。

iOS・ARM64

研究ギャップ

現在の証拠Yaps は iOS で利用できますが、このレポートには iPhone デバイスのベンチマークがまだ含まれていません。

次の証拠ゲート実際のキーボード拡張、モデルの読み込み、メモリ負荷、エネルギー使用量、エンドツーエンドのコミット待ち時間を測定します。

05 ・リサーチクエスチョン

流暢なトランスクリプトであっても、間違っている可能性があります。

01

精度

決定的正規化後に置換、挿入、または削除された参照語の数はいくつですか?

02

サイレント削除

トランスクリプトでは単語やフレーズ全体が失われていますが、簡単なレビューを回避できるほど流暢に聞こえますか?

03

応答性

単一の最速実行だけでなく、ディストリビューション全体での処理にはどのくらい時間がかかりますか?

04

ネットワークの動作

パケット監視の制限が明確に示されている場合、定義されたワークフロー中にどのような接続とペイロードが監視されますか?

06 ・出版デザイン

情報源まで追跡できる証拠。

パイロットは、セマンティック クリーンアップ設定を区別し、最終評価出力をスコアリングし、置換、挿入、削除を個別にレポートし、プライベートな音声コンテンツを公開外に保ちます。同等のシステムは、インターフェイスで許可されている場合は同じオーディオ バイトを受信します。互換性のないキャプチャ パスは、明確に分離された階層に属します。

01凍結された公開コーパスまたは同意されたコーパス
02宣言されたシステム、モデル、デバイス
03失敗を保持したまま実行を繰り返す
04Word レベルの S / I / D アライメント
05コンテンツのないパブリック行そして骨材
07 ・記録を読む

メソッドとすべてのパブリック行を検査します。

プライベート ディクテーションの現状 2026メソッド バージョン 0.1.0パイロット証拠のみYapsによって設計および発行されました