跳至内容

方法论 · 版本 0.1.0

规则优先于结果。

一种预注册式的协议,用于使有利和不利结果同样可检查。当前版本仍然是试点;这些规则定义了未来基准的门槛。

01 · 系统定义

产品名称不是测试条件。

每个系统都是一个元组:公开的产品版本、操作系统版本、引擎或模型修订、影响识别和清理的设置、设备类别以及捕获路径。不同元组的结果从不被悄悄合并。

如果产品无法接受相同的音频路径,则会在单独的层中进行报告。现场麦克风捕获不能直接与文件回放进行比较。

首次完整基准发布的拟议设备矩阵。
平台基线类当前等级目的
macOS条目 Apple Silicon当前 Apple Silicon本地桌面范围
Windows主流 x86 笔记本当前高性能笔记本CPU 和 GPU 的差异
Android支持的中端设备当前旗舰移动差异
02 · 三个阶段

先是实验室可重复性,然后是实际设备的现实。

阶段A

可重现语料库

公共许可的演讲和经同意的脚本,在支持的情况下使用相同的音频字节以隔离识别和后处理。

阶段B

真实设备捕获

通过记录的房间和麦克风进行校准播放,以展示去噪、预滚、静音门和尾冲行为。

阶段C

自然口述

新同意的发言者正在阅读预先注册的提示。私人支持的录音从不被纳入公开语料库。

在所有阶段

可见层

语言、地区差异、持续时间、噪音、房间条件、姓名、数字、技术术语、停顿和口头纠正。

03 · 主要指标

WER 是开始,而不是完整的故事。

Word 错误率的计算方式为替换加插入加删除除以参考词。该研究还单独报告每个操作,因为单个流畅的转录本可以隐藏缺失的短语。

聚合率为 micro-word-weighted:在计算速率之前对操作计数和参考字进行求和。延迟发布样本计数、中位数、p95 和最大值。完成的试点具有混合热状态;受控冷热运行以及实时 UI 交付仍然是未来的衡量标准。

处理时间包括识别、管道最终确定和启用时的本地清理。它不包括初始运行时构建、夹具加载、实时录制、快捷方式调度和光标插入。所有车道对最终评估器输出进行评分;清理通道仍然可以应用词汇和格式更改。

延迟使用每通道 60 个等权解码样本和 R-7 线性分位数。20 个装置每次包含 491 个参考字位置,在 1,473 个字的分母中计算三倍。重复不是独立的话语。质量阈值故障仍然包括在内:3 个启用 Core ML 清理,3 个启用 Core ML 清理,6 个启用 Whisper。

解释于 2026 年 9 月 6 日更正。原始数字不变。 阅读证据审核、外部参考、剩余限制和复制说明。

网络观察

该协议记录了工作流在设置后是否离线完成、观察到的目的地和字节,以及是否观察到音频或文本有效负载离开设备。数据包捕获存在盲点,因此可辩护的说法是“在此测试中未观察到音频/文本有效负载”。永远不要声称“没有任何东西会离开”。

04 · 发布门槛

在每个关卡通过之前没有排行榜。

方法首次冻结在基准收集前记录的版本和分析提交。
语料已固定每个源文件和生成文件的不可变修订和 SHA-256 摘要。
已审核的参考资料每个系统的双人参考评审和一项规范化政策。
输入可比较相同的字节或一个明确的、单独报告的捕获层。
来源完整记录产品、型号、设备、设置、电源状态和捕获路径。
保留失败项超时和缺失的记录仍然包含在分母中。
运营对账替换、插入和删除累加成编辑距离。
隐私审查消毒程序通过后,有人检查公共工件边界。
披露冲突Yaps 的作者、排除、偏差和限制仍然显著。
数据附带声明已清理的行、汇总、清单和修正通道一起发布。
05 · 已知限制

这个协议仍然无法看到的东西。

当前的测试支架主要测试捕获后的转录管道。它没有通过实时麦克风堆栈完全重放固定音频,因此捕获剪辑、降噪伪影、预滚、静音门控和尾部刷新需要B阶段仪器。

网络观察无法证明加密内容的不存在,也无法预测未来的行为。公共语料库无法代表每一种口音、残疾、麦克风、房间或即兴的说话风格。每个结果都与特定的版本和日期相关联。

私人听写状态 2026方法版本 0.1.0仅试点证据由 Yaps 设计并发布