Core ML Parakeet + 本地清理
- 微观 WER
- 3.46%
- 删除率
- 0.41%
- 中值处理
- 1,124 ms
- p95 处理
- 2,807 ms
- 最大处理量
- 2,958 ms
私人听写状态 · 2026
设备上语音工具的准确性、删除、延迟和可观察的网络行为。我们发布了方法、限制以及数字旁的已清理数据。
启用本地清理后,试点记录的中值处理时间为 1,124 毫秒,字错误率为 3.46%。使用 Yaps 2.3.2129 在一台 M1 Max MacBook Pro 上对相同的 20 个干净的合成装置在每个通道上解码 3 次。在这个精确的设置中,错误和延迟值越低越好。这些是 Yaps 配置,不是竞争产品。
处理时间包括识别、管道最终确定和启用时的本地清理。它不包括初始运行时构建、夹具加载、实时录制、快捷方式调度和光标插入。所有车道对最终评估器输出进行评分;清理通道仍然可以应用词汇和格式更改。
延迟使用每通道 60 个等权解码样本和 R-7 线性分位数。20 个装置每次包含 491 个参考字位置,在 1,473 个字的分母中计算三倍。重复不是独立的话语。质量阈值故障仍然包括在内:3 个启用 Core ML 清理,3 个启用 Core ML 清理,6 个启用 Whisper。
解释于 2026 年 9 月 6 日更正。原始数字不变。 阅读证据审核、外部参考、剩余限制和复制说明。
在这些运行中,关闭清理的 Whisper Base与关闭清理功能的 Core ML Parakeet 相比,WER 高 2.85 个百分点,删除率高 0.20 个百分点,中位数高 595 毫秒,p95 高 947 毫秒。
该试点不包括人类语言、口音、多语言语音、实时麦克风捕获、受控热顺序、网络监控、附加设备和第三方产品。
下载模型权重是简单的部分。一个有用的听写系统必须可靠地捕捉音频,选择合适的运行时,为该模型准备语音,检测不完整的输出,保留用户的意图,并将结果放置到用户工作的任何位置。
Yaps 将功能强大的本地语音模型转换为一个单一的私人工具,人们可以在日常应用程序中使用,而无需自己组装模型服务器、脚本、音频管道或导出步骤。
快捷方式或移动键盘会启动私人录音,而不会将用户移入单独的转录工具。
Yaps 在识别之前会应用语音检测、静音处理和设备优化的音频准备。
该应用会根据设备、语言、质量偏好和可用硬件选择已安装的本地引擎。
Parakeet、Cohere、Whisper 或专家路线将准备好的音频转换为候选文本。
完整性检查、救援路径、词汇处理和本地清理保护交付的结果。
完成的文本会在光标处或移动键盘工作流程中提交,可立即使用。
这个产品上下文解释了为什么报告区分清理设置和测量的输出阶段。这并不能证明Yaps是最好的,也不能将产品定位转化为基准结果。
这些配套研究使用了不同的设备、语料库、指标和测试协议。它们的数据解释了当前的产品决策,但不能将它们合并到单一排行榜中。
更广泛的 M1 Max 测试使用了 144 个跨 24 种语言的合成剪辑,以及 65 个跨 13 种语言的人类 FLEURS 剪辑。在 Cohere 与每个模型共享的匹配 20 剪辑人类子集上,Cohere 记录了 4.2% 审核 WER,而 MLX Parakeet 为 12.0%。
在一台 Ryzen 7 5700U Windows 笔记本上,Cohere 和 ONNX Parakeet 使用 14 种语言运行了相同的 70 个真人 FLEURS 剪辑。Cohere 返回了 70 个非空转录;Parakeet 返回了 61 个。Cohere 在 14 次自动语言比较中赢得了 12 次,但每个剪辑平均耗时 3.654 秒,而 Parakeet 为 1.394 秒。
一个阿拉伯语 FastConformer 包运行在Pixel 10 Pro。排除一对无效参考对,39 个 FLEURS 剪辑产生了 9.8% WER 和 4.1% CER,中位数为 624 毫秒,p95 为 984 毫秒。Mac CPU 上更广泛的干净且嘈杂的 MASC 切片后来得分为 22.5% WER,因此该路线仍然是预览版,而不是成为一般的阿拉伯声明。
当前证据当前的 20 个插件试点,加上一个单独的 144 个合成和 65 个人工多语言模型比试。
下一个证据关卡添加自发语音、更多 Mac 生成、可控热序以及实时麦克风捕获。
当前证据一个单独的 70 剪辑、14 种语言的人类 FLEURS 验证比较了 Cohere 和 ONNX Parakeet 在 Windows 11 上的表现。
下一个证据关卡根据冻结协议发布清理后的行,并添加低内存和额外的 GPU 类。
当前证据一次 Pixel 10 Pro 评估测量了一个阿拉伯语 FastConformer 包,并测试了真实的键盘路径。
下一个证据关卡添加自发方言语音、更多手机层级、英语路线等效、电池和持续使用测量。
当前证据Yaps 可用于 Linux,但本报告未包含具有报告等级的本地 Linux 准确性或延迟测试。
下一个证据关卡运行本地 Ubuntu 测试回放、已安装包的听写、CPU 和 Vulkan 路径、X11,以及 Wayland。
当前证据Yaps 可用于 iOS,但本报告尚未包含 iPhone 设备的基准测试。
下一个证据关卡测量真实的键盘扩展、模型加载、内存压力、能耗以及端到端提交延迟。
确定性归一化后,有多少参考词被替换、插入或删除?
转录内容会在听起来仍然足够流畅以逃过快速审核的情况下丢失整个单词或短语吗?
通过分布式处理(而不仅仅是单次最快运行)需要多长时间?
在定义的工作流程中观察到哪些连接和有效载荷,并明确说明数据包观察的限制?
试点区分语义清理设置,对最终评估器输出进行评分,独立报告替换、插入和删除,并将私人语音内容保留在公开发布之外。类似的系统在其接口允许的情况下接收相同的音频字节;不兼容的捕获路径属于明显分离的层。