Chuyển đến nội dung

Tình trạng Ghi âm Riêng Tư · 2026

Đo lường những nội dung bị bỏ sót khi đọc chính tả.

Độ chính xác, việc xóa, độ trễ và hành vi mạng có thể quan sát được trên các công cụ giọng nói trên thiết bị. Chúng tôi đang công bố phương pháp, các giới hạn và dữ liệu đã được làm sạch bên cạnh các con số.

01 · Kết quả thí điểm

Các số đầu tiên, trong tầm nhìn đầy đủ.

Khi bật tính năng dọn dẹp cục bộ, thử nghiệm đã ghi lại thời gian xử lý trung bình là 1.124 mili giây và tỷ lệ lỗi từ là 3,46%. 20 thiết bị tổng hợp sạch tương tự đã được giải mã ba lần trên mỗi làn trên một M1 Max MacBook Pro bằng cách sử dụng Yaps 2.3.2129. Giá trị lỗi và độ trễ thấp hơn sẽ tốt hơn trong thiết lập chính xác này. Đây là cấu hình Yaps, không phải sản phẩm cạnh tranh.

Thiết bị cố định
20
Chạy theo từng làn
60
Các từ, có lặp lại
1,473
Nguồn gốc giọng nói
Tổng hợp
Thiết bị thử nghiệm
1
Tổng hợp lỗi
Vi mô

Thời gian xử lý bao gồm nhận dạng, hoàn thiện quy trình và dọn dẹp cục bộ khi được bật. Nó không bao gồm việc xây dựng thời gian chạy ban đầu, tải lịch thi đấu, ghi trực tiếp, gửi phím tắt và chèn con trỏ. Tất cả các làn đều ghi điểm đầu ra của người đánh giá cuối cùng; các làn đường dọn dẹp vẫn có thể áp dụng các thay đổi về từ vựng và định dạng.

Độ trễ sử dụng 60 mẫu giải mã có trọng số bằng nhau trên mỗi làn và phân vị tuyến tính R-7. 20 bộ cố định chứa 491 vị trí từ tham chiếu trên mỗi lượt, được tính ba lần trong mẫu số 1.473 từ. Sự lặp lại không phải là những phát ngôn độc lập. Vẫn bao gồm các lỗi ở ngưỡng chất lượng: 3 khi bật tính năng dọn dẹp Core ML, 3 khi tắt tính năng dọn dẹp Core ML và 6 khi bật tính năng dọn dẹp Whisper.

Bản giải thích được sửa vào ngày 6 tháng 9 năm 2026. Các số gốc không thay đổi. Đọc kiểm tra bằng chứng, tài liệu tham khảo bên ngoài, các hạn chế còn lại và hướng dẫn sao chép.

Những gì phi công thử nghiệm này hỗ trợ.

Một bản trùng khớp quan sát dọn dẹp.

Trong các lần chạy này, Whisper Base khi tắt tính năng dọn dẹp có cao hơn 2,85 điểm phần trăm WER, tốc độ xóa cao hơn 0,20 điểm, trung vị cao hơn 595 mili giây và p95 cao hơn 947 mili giây so với Core ML Parakeet khi tắt tính năng dọn dẹp.

Những gì mà nó không thể hỗ trợ

Một khẳng định chung về sản phẩm hoặc quyền riêng tư.

Phi công loại trừ lời nói của con người, giọng điệu, lời nói đa ngôn ngữ, ghi âm trực tiếp bằng micro, thứ tự nhiệt kiểm soát, giám sát mạng, thiết bị bổ sung và sản phẩm của bên thứ ba.

02 · Lớp sản phẩm

Một mô hình không phải là một trải nghiệm đọc chính tả.

Tại sao Yaps nên xuất hiện trong báo cáo

Tải trọng số của mô hình là phần dễ dàng. Một hệ thống phiên âm hữu ích phải ghi lại âm thanh một cách đáng tin cậy, chọn runtime phù hợp, chuẩn bị giọng nói cho mô hình đó, phát hiện đầu ra chưa hoàn chỉnh, bảo vệ ý định của người dùng và đặt kết quả ở bất cứ nơi nào họ đang làm việc.

Yaps biến các mô hình giọng nói cục bộ có khả năng thành một công cụ riêng tư duy nhất mà mọi người có thể sử dụng trên các ứng dụng hàng ngày của họ, mà không cần tự dựng máy chủ mô hình, kịch bản, đường dẫn âm thanh hoặc các bước xuất.
01

Chụp

Một phím tắt hoặc bàn phím điện thoại sẽ bắt đầu ghi âm riêng tư mà không đưa người dùng vào công cụ phiên âm riêng biệt.

02

Chuẩn bị

Yaps áp dụng nhận diện giọng nói, xử lý khoảng lặng, và chuẩn bị âm thanh theo thiết bị trước khi nhận dạng.

03

Tuyến đường

Ứng dụng chọn một công cụ cục bộ đã được cài đặt cho thiết bị, ngôn ngữ, sở thích chất lượng và phần cứng có sẵn.

04

Nhận ra

Parakeet, Cohere, Whisper, hoặc một tuyến chuyên gia chuyển đổi âm thanh đã chuẩn bị thành văn bản ứng viên.

05

Người bảo vệ

Kiểm tra đầy đủ, đường dẫn cứu hộ, xử lý từ vựng và làm sạch cục bộ bảo vệ kết quả đã giao.

06

Giao

Văn bản hoàn thiện được cam kết tại con trỏ hoặc trong quy trình bàn phím di động, sẵn sàng sử dụng ngay lập tức.

Ngữ cảnh sản phẩm này giải thích lý do tại sao báo cáo này phân biệt cài đặt dọn dẹp và giai đoạn đầu ra được đo lường. Nó không phải là bằng chứng cho thấy Yaps là tốt nhất và nó không biến việc định vị sản phẩm thành kết quả chuẩn.

03 · Bằng chứng rộng hơn

Chương trình nghiên cứu đã lớn hơn một dự án thí điểm.

Các nghiên cứu kèm theo này sử dụng các thiết bị, tập dữ liệu, chỉ số và giao thức thử nghiệm khác nhau. Các con số của họ giải thích các quyết định sản phẩm hiện tại, nhưng chúng không được kết hợp thành một bảng xếp hạng duy nhất.

Apple Silicon · đa ngôn ngữNghiên cứu liên quan

Cohere thay đổi cuộc trò chuyện định tuyến.

Một cuộc so sánh rộng hơn của M1 Max sử dụng 144 đoạn clip tổng hợp trên 24 ngôn ngữ và 65 đoạn clip FLEURS của con người trên 13 ngôn ngữ. Trên tập con 20 đoạn clip của con người được chia sẻ bởi Cohere và mọi mô hình, Cohere ghi nhận 4,2% WER đã được kiểm tra so với 12,0% của MLX Parakeet.

Cohere WER
4.2%
MLX Parakeet
12.0%
Các đoạn clip người thật đã khớp
20
Cohere hỗ trợ một tập hợp ngôn ngữ hẹp hơn và yêu cầu một ngôn ngữ dự đoán trước. Năm đoạn ghi âm mỗi ngôn ngữ vẫn là bằng chứng chỉ dẫn, không phải là tuyên bố chất lượng chung.
Windows 11 · CohereNghiên cứu liên quan

Độ tin cậy đa ngôn ngữ cao hơn, với chi phí độ trễ.

Trên một chiếc laptop Ryzen 7 5700U Windows, Cohere và ONNX Parakeet đã chạy cùng 70 clip FLEURS của con người trên 14 ngôn ngữ. Cohere trả về 70 bản ghi không rỗng; Parakeet trả về 61. Cohere thắng 12 trong số 14 so sánh ngôn ngữ tự động, nhưng trung bình mất 3.654 giây cho mỗi clip so với 1.394 giây của Parakeet.

Cohere không rỗng
70/70
Parakeet không trống
61/70
Cohere có nghĩa là
3.654 giây
Các điểm số ngôn ngữ vẫn chỉ mang tính chỉ hướng cho đến khi mọi khác biệt không bằng không được xử lý hoàn toàn thủ công. Các hàng đã được làm sạch vẫn chưa là một phần của bản phát hành công khai này.
Android · Xem trước tiếng Ả RậpNghiên cứu liên quan

Tốc độ thiết bị có thể đạt yêu cầu trong khi phạm vi dữ liệu vẫn chưa đầy đủ.

Một gói FastConformer tiếng Ả Rập chạy trên Pixel 10 Pro. Loại trừ một cặp tham chiếu không hợp lệ, 39 clip FLEURS tạo ra 9,8% WER và 4,1% CER, với giá trị trung bình là 624 ms và 984 ms p95. Một lát cắt MASC sạch hơn và ồn ào hơn trên CPU Mac sau đó đã ghi được 22,5% WER, do đó lộ trình vẫn là Bản xem trước thay vì trở thành một tuyên bố chung bằng tiếng Ả Rập.

Các đoạn clip hợp lệ
39
Giải mã trung vị
624 ms
p95 giải mã
984 ms
Kết quả điện thoại bao gồm giọng đọc, không phải MSA tự phát và việc sử dụng phương ngữ. Kết quả MASC rộng hơn là lý do ứng dụng giữ lộ trình được gắn nhãn rõ ràng là Xem trước.
04 · Phủ sóng nền tảng

Hiển thị các khoảng trống thay vì ẩn chúng.

macOS · Apple Silicon

Phiên bản thử nghiệm đã xuất bản

Bằng chứng hiện tạiChương trình thử nghiệm hiện tại với 20 thiết bị, cùng với một cuộc so sánh riêng biệt giữa 144 mô hình tổng hợp và 65 mô hình đa ngôn ngữ của con người.

Cổng bằng chứng tiếp theoThêm giọng nói tự phát, nhiều thế hệ Mac hơn, thứ tự nhiệt độ được kiểm soát, và thu âm trực tiếp từ micro.

Windows · x64

Bằng chứng liên quan

Bằng chứng hiện tạiMột bộ kiểm tra riêng gồm 70 clip, 14 ngôn ngữ FLEURS do con người thực hiện, so sánh Cohere và ONNX Parakeet trên Windows 11.

Cổng bằng chứng tiếp theoXuất bản các hàng đã được làm sạch theo giao thức đã đóng băng và thêm các lớp bộ nhớ thấp hơn và GPU bổ sung.

Android · ARM64

Bằng chứng liên quan

Bằng chứng hiện tạiMột đánh giá Pixel 10 Pro đã đo một gói FastConformer bằng tiếng Ả Rập và kiểm tra đường đi bàn phím thực.

Cổng bằng chứng tiếp theoThêm giọng nói địa phương tự phát, nhiều cấp điện thoại hơn, sự tương đương đường dẫn tiếng Anh, pin và các phép đo sử dụng liên tục.

Linux · x64

Khoảng trống nghiên cứu

Bằng chứng hiện tạiYaps có sẵn trên Linux, nhưng báo cáo này không chứa kết quả chính xác hoặc độ trễ gốc của Linux đạt chuẩn báo cáo.

Cổng bằng chứng tiếp theoChạy phát lại fixture gốc Ubuntu, gói cài đặt dictation, CPU và các đường dẫn Vulkan, X11, và Wayland.

iOS · ARM64

Khoảng trống nghiên cứu

Bằng chứng hiện tạiYaps có sẵn trên iOS, nhưng báo cáo này vẫn chưa bao gồm điểm chuẩn thiết bị iPhone.

Cổng bằng chứng tiếp theoĐo lường phần mở rộng bàn phím thực, tải mô hình, áp lực bộ nhớ, sử dụng năng lượng và độ trễ cam kết đầu-cuối.

05 · Câu hỏi nghiên cứu

Bản ghi trôi chảy vẫn có thể sai.

01

Độ chính xác

Bao nhiêu từ tham chiếu được thay thế, chèn vào, hoặc xóa sau khi chuẩn hóa xác định?

02

Xóa im lặng

Một bản ghi có bị mất từ hoặc cụm từ trong khi vẫn nghe trôi chảy đủ để qua một lần xem nhanh không?

03

Độ phản hồi

Mất bao lâu để xử lý trên toàn bộ phân phối, không chỉ trong lần chạy nhanh nhất?

04

Hành vi mạng

Những kết nối và payload nào được quan sát trong một luồng công việc xác định, với giới hạn quan sát gói tin được nêu rõ ràng?

06 · Thiết kế ấn phẩm

Bằng chứng mà bạn có thể truy lại nguồn gốc.

Phi công phân biệt các cài đặt dọn dẹp ngữ nghĩa, tính điểm đầu ra của người đánh giá cuối cùng, báo cáo các thay thế, chèn và xóa một cách độc lập, đồng thời giữ nội dung giọng nói riêng tư bên ngoài bản phát hành công khai. Các hệ thống có thể so sánh nhận được các byte âm thanh giống nhau khi giao diện của chúng cho phép; các đường dẫn chụp không tương thích thuộc về các tầng được phân tách rõ ràng.

01Tập hợp dữ liệu công khai hoặc được đồng ý đông cứng
02Hệ thống, mô hình và thiết bị đã khai báo
03Các lần chạy lặp lại với các lỗi được giữ lại
04Word-cấp độ S / I / D
05Các hàng công khai và các tổng hợp không có nội dung
07 · Đọc hồ sơ

Kiểm tra phương pháp và mọi hàng công khai.

Tình trạng Nghe lệnh riêng tư 2026Phiên bản phương pháp 0.1.0Chỉ bằng chứng thí điểmĐược thiết kế và xuất bản bởi Yaps