跳至内容

私人听写状态 · 2026

衡量听写遗漏的内容。

设备上语音工具的准确性、删除、延迟和可观察的网络行为。我们发布了方法、限制以及数字旁的已清理数据。

01 · 试点结果

前面的数字,全部可见。

启用本地清理后,试点记录的中值处理时间为 1,124 毫秒,字错误率为 3.46%。使用 Yaps 2.3.2129 在一台 M1 Max MacBook Pro 上对相同的 20 个干净的合成装置在每个通道上解码 3 次。在这个精确的设置中,错误和延迟值越低越好。这些是 Yaps 配置,不是竞争产品。

灯具
20
按通道运行
60
单词,有重复
1,473
语音来源
合成
测试设备
1
错误聚合
微观
清理60 运行

Core ML Parakeet + 本地清理

微观 WER
3.46%
删除率
0.41%
中值处理
1,124 ms
p95 处理
2,807 ms
最大处理量
2,958 ms
清除关闭60 运行

Core ML Parakeet,清理

微观 WER
3.67%
删除率
0.20%
中值处理
250 ms
p95 处理
722 ms
最大处理量
1,863 ms
清除关闭60 运行

Whisper Base,清理

微观 WER
6.52%
删除率
0.41%
中值处理
844 ms
p95 处理
1,669 ms
最大处理量
2,189 ms

处理时间包括识别、管道最终确定和启用时的本地清理。它不包括初始运行时构建、夹具加载、实时录制、快捷方式调度和光标插入。所有车道对最终评估器输出进行评分;清理通道仍然可以应用词汇和格式更改。

延迟使用每通道 60 个等权解码样本和 R-7 线性分位数。20 个装置每次包含 491 个参考字位置,在 1,473 个字的分母中计算三倍。重复不是独立的话语。质量阈值故障仍然包括在内:3 个启用 Core ML 清理,3 个启用 Core ML 清理,6 个启用 Whisper。

解释于 2026 年 9 月 6 日更正。原始数字不变。 阅读证据审核、外部参考、剩余限制和复制说明。

这个试点支持什么

匹配的清理观察。

在这些运行中,关闭清理的 Whisper Base与关闭清理功能的 Core ML Parakeet 相比,WER 高 2.85 个百分点,删除率高 0.20 个百分点,中位数高 595 毫秒,p95 高 947 毫秒。

它不能支持的内容

关于产品或隐私的普遍说法。

该试点不包括人类语言、口音、多语言语音、实时麦克风捕获、受控热顺序、网络监控、附加设备和第三方产品。

02 · 产品层

模型不是听写体验。

为什么 Yaps 应该包含在报告中

下载模型权重是简单的部分。一个有用的听写系统必须可靠地捕捉音频,选择合适的运行时,为该模型准备语音,检测不完整的输出,保留用户的意图,并将结果放置到用户工作的任何位置。

Yaps 将功能强大的本地语音模型转换为一个单一的私人工具,人们可以在日常应用程序中使用,而无需自己组装模型服务器、脚本、音频管道或导出步骤。
01

捕获

快捷方式或移动键盘会启动私人录音,而不会将用户移入单独的转录工具。

02

准备

Yaps 在识别之前会应用语音检测、静音处理和设备优化的音频准备。

03

路线

该应用会根据设备、语言、质量偏好和可用硬件选择已安装的本地引擎。

04

识别

Parakeet、Cohere、Whisper 或专家路线将准备好的音频转换为候选文本。

05

守卫

完整性检查、救援路径、词汇处理和本地清理保护交付的结果。

06

交付

完成的文本会在光标处或移动键盘工作流程中提交,可立即使用。

这个产品上下文解释了为什么报告区分清理设置和测量的输出阶段。这并不能证明Yaps是最好的,也不能将产品定位转化为基准结果。

03 · 更广泛的证据

研究计划的规模已经超过了一个试点。

这些配套研究使用了不同的设备、语料库、指标和测试协议。它们的数据解释了当前的产品决策,但不能将它们合并到单一排行榜中。

Apple Silicon · 多语言相关研究

Cohere 改变了路由对话。

更广泛的 M1 Max 测试使用了 144 个跨 24 种语言的合成剪辑,以及 65 个跨 13 种语言的人类 FLEURS 剪辑。在 Cohere 与每个模型共享的匹配 20 剪辑人类子集上,Cohere 记录了 4.2% 审核 WER,而 MLX Parakeet 为 12.0%。

Cohere WER
4.2%
MLX Parakeet
12.0%
匹配的人类片段
20
Cohere 支持较窄的语言集合,并且需要预期的语言。每种语言五个剪辑仍然是方向性证据,而不是普遍质量声明。
Windows 11 · Cohere相关研究

更高的多语言可靠性,但会有延迟成本。

在一台 Ryzen 7 5700U Windows 笔记本上,Cohere 和 ONNX Parakeet 使用 14 种语言运行了相同的 70 个真人 FLEURS 剪辑。Cohere 返回了 70 个非空转录;Parakeet 返回了 61 个。Cohere 在 14 次自动语言比较中赢得了 12 次,但每个剪辑平均耗时 3.654 秒,而 Parakeet 为 1.394 秒。

Cohere 非空
70/70
Parakeet 非空
61/70
Cohere 的意思
3.654 秒
语言评分在每一个非零差异都经过完整的人工裁定之前,仍然只是方向性的。净化后的数据行尚未包含在此公开发布中。
Android · 阿拉伯语预览相关研究

设备速度可能通过,但语料覆盖仍会失败。

一个阿拉伯语 FastConformer 包运行在Pixel 10 Pro。排除一对无效参考对,39 个 FLEURS 剪辑产生了 9.8% WER 和 4.1% CER,中位数为 624 毫秒,p95 为 984 毫秒。Mac CPU 上更广泛的干净且嘈杂的 MASC 切片后来得分为 22.5% WER,因此该路线仍然是预览版,而不是成为一般的阿拉伯声明。

有效片段
39
中位解码
624 毫秒
p95 解码
984 毫秒
电话结果涵盖的是朗读的语音,而不是自发的现代标准阿拉伯语和方言使用。更广泛的 MASC 结果是应用程序保持路线明确标记为“预览”的原因。
04 · 平台覆盖范围

显示间隙而不是隐藏它们。

macOS · Apple Silicon

已发布的试点

当前证据当前的 20 个插件试点,加上一个单独的 144 个合成和 65 个人工多语言模型比试。

下一个证据关卡添加自发语音、更多 Mac 生成、可控热序以及实时麦克风捕获。

Windows · x64

相关证据

当前证据一个单独的 70 剪辑、14 种语言的人类 FLEURS 验证比较了 Cohere 和 ONNX Parakeet 在 Windows 11 上的表现。

下一个证据关卡根据冻结协议发布清理后的行,并添加低内存和额外的 GPU 类。

Android · ARM64

相关证据

当前证据一次 Pixel 10 Pro 评估测量了一个阿拉伯语 FastConformer 包,并测试了真实的键盘路径。

下一个证据关卡添加自发方言语音、更多手机层级、英语路线等效、电池和持续使用测量。

Linux · x64

研究空白

当前证据Yaps 可用于 Linux,但本报告未包含具有报告等级的本地 Linux 准确性或延迟测试。

下一个证据关卡运行本地 Ubuntu 测试回放、已安装包的听写、CPU 和 Vulkan 路径、X11,以及 Wayland。

iOS · ARM64

研究空白

当前证据Yaps 可用于 iOS,但本报告尚未包含 iPhone 设备的基准测试。

下一个证据关卡测量真实的键盘扩展、模型加载、内存压力、能耗以及端到端提交延迟。

05 · 研究问题

流利的文字记录仍可能是错误的。

01

准确度

确定性归一化后,有多少参考词被替换、插入或删除?

02

静默删除

转录内容会在听起来仍然足够流畅以逃过快速审核的情况下丢失整个单词或短语吗?

03

响应能力

通过分布式处理(而不仅仅是单次最快运行)需要多长时间?

04

网络行为

在定义的工作流程中观察到哪些连接和有效载荷,并明确说明数据包观察的限制?

06 · 出版设计

你可以追踪回其来源的证据。

试点区分​​语义清理设置,对最终评估器输出进行评分,独立报告替换、插入和删除,并将私人语音内容保留在公开发布之外。类似的系统在其接口允许的情况下接收相同的音频字节;不兼容的捕获路径属于明显分离的层。

01冻结的公共或经同意的语料库
02声明的系统、型号和设备
03保留失败的重复运行
04Word-级别 S/I/D 对齐
05不含内容的公共行和聚合
07 · 阅读记录

检查方法和每一行公共记录。

私人听写状态 2026方法版本 0.1.0仅试点证据由 Yaps 设计并发布