可重现语料库
公共许可的演讲和经同意的脚本,在支持的情况下使用相同的音频字节以隔离识别和后处理。
方法论 · 版本 0.1.0
一种预注册式的协议,用于使有利和不利结果同样可检查。当前版本仍然是试点;这些规则定义了未来基准的门槛。
每个系统都是一个元组:公开的产品版本、操作系统版本、引擎或模型修订、影响识别和清理的设置、设备类别以及捕获路径。不同元组的结果从不被悄悄合并。
如果产品无法接受相同的音频路径,则会在单独的层中进行报告。现场麦克风捕获不能直接与文件回放进行比较。
| 平台 | 基线类 | 当前等级 | 目的 |
|---|---|---|---|
| macOS | 条目 Apple Silicon | 当前 Apple Silicon | 本地桌面范围 |
| Windows | 主流 x86 笔记本 | 当前高性能笔记本 | CPU 和 GPU 的差异 |
| Android | 支持的中端设备 | 当前旗舰 | 移动差异 |
公共许可的演讲和经同意的脚本,在支持的情况下使用相同的音频字节以隔离识别和后处理。
通过记录的房间和麦克风进行校准播放,以展示去噪、预滚、静音门和尾冲行为。
新同意的发言者正在阅读预先注册的提示。私人支持的录音从不被纳入公开语料库。
语言、地区差异、持续时间、噪音、房间条件、姓名、数字、技术术语、停顿和口头纠正。
Word 错误率的计算方式为替换加插入加删除除以参考词。该研究还单独报告每个操作,因为单个流畅的转录本可以隐藏缺失的短语。
聚合率为 micro-word-weighted:在计算速率之前对操作计数和参考字进行求和。延迟发布样本计数、中位数、p95 和最大值。完成的试点具有混合热状态;受控冷热运行以及实时 UI 交付仍然是未来的衡量标准。
处理时间包括识别、管道最终确定和启用时的本地清理。它不包括初始运行时构建、夹具加载、实时录制、快捷方式调度和光标插入。所有车道对最终评估器输出进行评分;清理通道仍然可以应用词汇和格式更改。
延迟使用每通道 60 个等权解码样本和 R-7 线性分位数。20 个装置每次包含 491 个参考字位置,在 1,473 个字的分母中计算三倍。重复不是独立的话语。质量阈值故障仍然包括在内:3 个启用 Core ML 清理,3 个启用 Core ML 清理,6 个启用 Whisper。
解释于 2026 年 9 月 6 日更正。原始数字不变。 阅读证据审核、外部参考、剩余限制和复制说明。
该协议记录了工作流在设置后是否离线完成、观察到的目的地和字节,以及是否观察到音频或文本有效负载离开设备。数据包捕获存在盲点,因此可辩护的说法是“在此测试中未观察到音频/文本有效负载”。永远不要声称“没有任何东西会离开”。
当前的测试支架主要测试捕获后的转录管道。它没有通过实时麦克风堆栈完全重放固定音频,因此捕获剪辑、降噪伪影、预滚、静音门控和尾部刷新需要B阶段仪器。
网络观察无法证明加密内容的不存在,也无法预测未来的行为。公共语料库无法代表每一种口音、残疾、麦克风、房间或即兴的说话风格。每个结果都与特定的版本和日期相关联。