Core ML Parakeet とローカルクリーンアップが必要です
- マイクロ WER
- 3.46%
- 削除率
- 0.41%
- 中央値処理用
- 1,124 ms
- p95 処理
- 2,807 ms
- 最大処理量
- 2,958 ms
プライベート ディクテーションの現状 · 2026 年
正確さ、削除、遅延、およびデバイス上の音声ツール全体で観察可能なネットワーク動作。数値の横に方法、制限、サニタイズしたデータを公開しています。
ローカル クリーンアップを有効にした場合、パイロットは処理時間の中央値 1,124 ミリ秒とワード エラー率 3.46% を記録しました。同じ 20 個のクリーンな合成フィクスチャが、Yaps 2.3.2129 を使用して 1 つの M1 Max MacBook Pro でレーンごとに 3 回デコードされました。この正確な設定内では、エラーとレイテンシの値が低いほど優れています。これらは Yaps 構成であり、競合製品ではありません。
処理時間には、認識、パイプラインのファイナライズ、有効時のローカル クリーンアップが含まれます。これには、最初のランタイム構築、フィクスチャのロード、ライブレコーディング、ショートカットのディスパッチ、カーソル挿入は含まれません。すべてのレーンが最終評価出力をスコア化します。クリーンアップオフレーンでも語彙や書式の変更を適用できます。
レイテンシは、レーンごとに 60 個の均等に重み付けされたデコード サンプルと R-7 線形分位数を使用します。20 個のフィクスチャには、パスごとに 491 個の参照単語位置が含まれており、1,473 単語の分母で 3 回カウントされます。繰り返しは独立した発話ではありません。品質しきい値エラーも引き続き含まれます。Core ML クリーンアップがオンの場合が 3 件、Core ML クリーンアップがオフの場合が 3 件、Whisper の場合が 6 件です。
解釈は 2026 年 9 月 6 日に修正されました。元の数値は変更されていません。 証拠監査、外部参照、残りの制限、および再現指示を読み上げます。
これらの実行では、クリーンアップをオフにした Whisper Base の方が 2.85 パーセント ポイント高かったWER、クリーンアップをオフにした場合の Core ML Parakeet と比較して、削除率が 0.20 ポイント高く、中央値が 595 ミリ秒高く、p95 が 947 ミリ秒高かった。
パイロットでは、人間の音声、アクセント、多言語音声、ライブマイクキャプチャ、制御された熱順序、ネットワーク観察、追加デバイス、およびサードパーティ製品は除外されます。
モデルの重みをダウンロードするのは簡単です。有用なディクテーション システムは、音声を確実にキャプチャし、適切なランタイムを選択し、そのモデルに合わせて音声を準備し、不完全な出力を検出し、ユーザーの意図を保持し、ユーザーが作業している場所に結果を配置する必要があります。
のデスクトップ アプリで実行されます。 Yaps は、モデル サーバー、スクリプト、オーディオ パイプライン、またはエクスポート ステップ自体を組み立てることなく、有能なローカル音声モデルを人々が日常のアプリ全体で使用できる単一のプライベート ツールに変えます。
ショートカットまたはモバイル キーボードは、ユーザーを別の文字起こしツールに移動させることなく、プライベート録音を開始します。
Yaps は、認識前に音声検出、無音処理、およびデバイス形状の音声準備を適用します。
アプリは、デバイス、言語、品質設定、および利用可能なハードウェアにインストールされているローカル エンジンを選択します。
Parakeet 、 Cohere 、 Whisper 、または専門ルートは、準備された音声を候補テキストに変換します。
完全性チェック、レスキュー パス、語彙処理、およびローカル クリーンアップにより、配信された結果が保護されます。
完成したテキストはカーソル位置またはモバイル キーボード ワークフローにコミットされ、すぐに使用できるようになります。
この製品コンテキストは、レポートがクリーンアップ設定と測定された出力ステージを区別する理由を説明しています。Yaps が最適であるという証拠ではなく、製品のポジショニングをベンチマーク結果に変えるものでもありません。
これらの関連研究では、さまざまなデバイス、コーパス、測定基準、およびテストプロトコルが使用されました。これらの数値は現在の製品に関する決定を説明していますが、これらを 1 つのリーダーボードに組み合わせてはなりません。
より広範な M1 Max ベイクオフでは、24 言語にわたる 144 個の合成クリップと、13 言語にわたる 65 個の人間 FLEURS クリップが使用されました。Cohere とすべてのモデルが共有する、一致する 20 クリップの人間サブセットでは、Cohere は 4.2% の監査済み WER を記録しましたが、MLX Parakeet では 12.0% でした。
Ryzen 7 5700U Windows ラップトップ上で、Cohere と ONNX Parakeet は、14 の言語にわたって同じ 70 個のヒト FLEURS クリップを実行しました。Cohere は 70 個の空ではないトランスクリプトを返しました。Parakeet は 61 を返しました。自動言語比較 14 件中 12 件では Cohere が勝ちましたが、クリップあたりの平均時間は 3.654 秒であったのに対し、Parakeet は 1.394 秒でした。
アラビア語の FastConformer パックがPixel 10 Pro。1 つの無効なリファレンス ペアを除くと、39 個の FLEURS クリップは 9.8% WER と 4.1% CER を生成し、中央値は 624 ミリ秒、p95 は 984 ミリ秒でした。Mac CPU 上のより広範囲のクリーンでノイズの多い MASC スライスは、後に 22.5% WER のスコアを獲得したため、ルートは一般的なアラビア語の主張になるのではなく、プレビューのままです。
現在の証拠現在の 20 のフィクスチャのパイロットに加えて、別の 144 の合成モデルと 65 の人間による多言語モデルのベイクオフが行われます。
次の証拠ゲート自発的なスピーチ、より多くの Mac 世代、制御された熱順序、ライブ マイク キャプチャを追加します。
現在の証拠別の 70 クリップ、14 言語の人による FLEURS 検証により、Windows 11 上で Cohere と ONNX Parakeet が比較されました。
次の証拠ゲート凍結されたプロトコルの下でサニタイズされた行を公開し、低メモリおよび追加の GPU クラスを追加します。
現在の証拠Pixel 10 Pro の評価では、アラビア語 FastConformer パックを測定し、実際のキーボード パスを実行しました。
次の証拠ゲート自発的な方言音声、より多くの電話階層、英語ルート パリティ、バッテリー、および持続使用測定を追加します。
現在の証拠Yaps は Linux で使用できますが、このレポートにはレポートグレードのネイティブ Linux の精度や遅延の実行は含まれていません。
次の証拠ゲートを実行します。 ネイティブ Ubuntu フィクスチャ リプレイ、インストール済みパッケージのディクテーション、CPU および Vulkan パス、 X11 、および Wayland を実行します。
現在の証拠Yaps は iOS で利用できますが、このレポートには iPhone デバイスのベンチマークがまだ含まれていません。
次の証拠ゲート実際のキーボード拡張、モデルの読み込み、メモリ負荷、エネルギー使用量、エンドツーエンドのコミット待ち時間を測定します。
決定的正規化後に置換、挿入、または削除された参照語の数はいくつですか?
トランスクリプトでは単語やフレーズ全体が失われていますが、簡単なレビューを回避できるほど流暢に聞こえますか?
単一の最速実行だけでなく、ディストリビューション全体での処理にはどのくらい時間がかかりますか?
パケット監視の制限が明確に示されている場合、定義されたワークフロー中にどのような接続とペイロードが監視されますか?
パイロットは、セマンティック クリーンアップ設定を区別し、最終評価出力をスコアリングし、置換、挿入、削除を個別にレポートし、プライベートな音声コンテンツを公開外に保ちます。同等のシステムは、インターフェイスで許可されている場合は同じオーディオ バイトを受信します。互換性のないキャプチャ パスは、明確に分離された階層に属します。