Tập dữ liệu có thể tái tạo
Bài phát biểu công khai được cấp phép và kịch bản có sự đồng ý, sử dụng cùng các đoạn âm thanh khi được hỗ trợ để tách riêng nhận dạng và xử lý hậu kỳ.
Phương pháp luận · phiên bản 0.1.0
Một giao thức kiểu đăng ký trước để làm cho kết quả thuận lợi và không thuận lợi đều có thể kiểm tra được. Phiên bản hiện tại vẫn đang ở giai đoạn thử nghiệm; những quy tắc này định nghĩa cổng cho một chuẩn mực trong tương lai.
Mỗi hệ thống là một bộ gồm: phiên bản sản phẩm công khai, phiên bản hệ điều hành, phiên bản động cơ hoặc mô hình, các cài đặt ảnh hưởng đến nhận dạng và dọn dẹp, loại thiết bị, và đường dẫn thu thập. Kết quả từ các bộ khác nhau không bao giờ được gộp lại một cách âm thầm.
Nếu một sản phẩm không thể chấp nhận cùng một đường dẫn âm thanh, nó sẽ được báo cáo trong một tầng riêng biệt. Việc thu âm trực tiếp bằng micro không được trình bày như thể có thể so sánh trực tiếp với việc phát lại tệp.
| Nền tảng | Lớp cơ bản | Lớp hiện tại | Mục đích |
|---|---|---|---|
| macOS | Mục Apple Silicon | Hiện tại Apple Silicon | Phạm vi máy tính để bàn cục bộ |
| Windows | Laptop x86 phổ biến | Laptop hiệu năng cao hiện tại | Sự khác biệt giữa CPU và GPU |
| Android | Thiết bị tầm trung được hỗ trợ | Sản phẩm chủ lực hiện tại | Biến thể di động |
Bài phát biểu công khai được cấp phép và kịch bản có sự đồng ý, sử dụng cùng các đoạn âm thanh khi được hỗ trợ để tách riêng nhận dạng và xử lý hậu kỳ.
Phát lại được hiệu chuẩn qua các phòng và micro đã được tài liệu hóa để hiển thị hành vi khử ồn, pre-roll, cổng im lặng, và làm sạch đuôi.
Những người đọc mới được đồng ý đang đọc các lời nhắc đã đăng ký trước. Các bản ghi hỗ trợ riêng tư sẽ không bao giờ được đưa vào kho dữ liệu công cộng.
Ngôn ngữ, biến thể vùng miền, thời lượng, tiếng ồn, điều kiện phòng, tên riêng, số, thuật ngữ kỹ thuật, những khoảng dừng, và các điều chỉnh khi nói.
Word được tính bằng cách thay thế cộng với chèn thêm cộng với xóa, chia cho các từ tham chiếu. Nghiên cứu cũng báo cáo từng thao tác riêng biệt vì một bản ghi lưu loát có thể ẩn một cụm từ còn thiếu.
Tỷ lệ tổng hợp là micro-word-weighted: số lượng thao tác và các từ tham chiếu được tính tổng trước khi tính tỷ lệ. Độ trễ xuất bản số lượng mẫu, trung vị, p95 và tối đa. Phi công hoàn thành có trạng thái nhiệt hỗn hợp; Các hoạt động chạy nguội và ấm có kiểm soát cũng như phân phối giao diện người dùng trực tiếp vẫn là các phép đo trong tương lai.
Thời gian xử lý bao gồm nhận dạng, hoàn thiện quy trình và dọn dẹp cục bộ khi được bật. Nó không bao gồm việc xây dựng thời gian chạy ban đầu, tải lịch thi đấu, ghi trực tiếp, gửi phím tắt và chèn con trỏ. Tất cả các làn đều ghi điểm đầu ra của người đánh giá cuối cùng; các làn đường dọn dẹp vẫn có thể áp dụng các thay đổi về từ vựng và định dạng.
Độ trễ sử dụng 60 mẫu giải mã có trọng số bằng nhau trên mỗi làn và phân vị tuyến tính R-7. 20 bộ cố định chứa 491 vị trí từ tham chiếu trên mỗi lượt, được tính ba lần trong mẫu số 1.473 từ. Sự lặp lại không phải là những phát ngôn độc lập. Vẫn bao gồm các lỗi ở ngưỡng chất lượng: 3 khi bật tính năng dọn dẹp Core ML, 3 khi tắt tính năng dọn dẹp Core ML và 6 khi bật tính năng dọn dẹp Whisper.
Bản giải thích được sửa vào ngày 6 tháng 9 năm 2026. Các số gốc không thay đổi. Đọc kiểm tra bằng chứng, tài liệu tham khảo bên ngoài, các hạn chế còn lại và hướng dẫn sao chép.
Giao thức ghi lại liệu một quy trình công việc có hoàn tất ngoại tuyến sau khi thiết lập, các đích và byte đã quan sát, và liệu các gói âm thanh hoặc văn bản có được quan sát khi rời khỏi thiết bị hay không. Bắt gói có những điểm mù, vì vậy tuyên bố có thể bảo vệ là “không có gói âm thanh/văn bản nào được quan sát trong thử nghiệm này.” Không bao giờ nói “không gì bao giờ rời đi.”
Bộ dây hiện tại chủ yếu kiểm tra quy trình chuyển ngữ sau khi ghi lại. Nó không phát lại đầy đủ âm thanh của thiết bị qua hệ thống micro trực tiếp, vì vậy việc cắt âm thanh khi ghi, các hiện tượng nhiễu, pre-roll, tắt tiếng, và xả đuôi yêu cầu các công cụ đo lường Giai đoạn B.
Quan sát mạng không thể chứng minh sự vắng mặt của nội dung được mã hóa hoặc dự đoán hành vi trong tương lai. Một tập hợp dữ liệu công khai không thể đại diện cho mọi giọng, khuyết tật, micro, phòng hoặc phong cách nói tự phát. Mỗi kết quả đều gắn liền với một phiên bản và ngày cụ thể.