Core ML Parakeet + dọn dẹp cục bộ
- Vi mô WER
- 3.46%
- Tỷ lệ xóa
- 0.41%
- Xử lý trung bình
- 1,124 ms
- p95 xử lý
- 2,807 ms
- Xử lý tối đa
- 2,958 ms
Tình trạng Ghi âm Riêng Tư · 2026
Độ chính xác, việc xóa, độ trễ và hành vi mạng có thể quan sát được trên các công cụ giọng nói trên thiết bị. Chúng tôi đang công bố phương pháp, các giới hạn và dữ liệu đã được làm sạch bên cạnh các con số.
Khi bật tính năng dọn dẹp cục bộ, thử nghiệm đã ghi lại thời gian xử lý trung bình là 1.124 mili giây và tỷ lệ lỗi từ là 3,46%. 20 thiết bị tổng hợp sạch tương tự đã được giải mã ba lần trên mỗi làn trên một M1 Max MacBook Pro bằng cách sử dụng Yaps 2.3.2129. Giá trị lỗi và độ trễ thấp hơn sẽ tốt hơn trong thiết lập chính xác này. Đây là cấu hình Yaps, không phải sản phẩm cạnh tranh.
Thời gian xử lý bao gồm nhận dạng, hoàn thiện quy trình và dọn dẹp cục bộ khi được bật. Nó không bao gồm việc xây dựng thời gian chạy ban đầu, tải lịch thi đấu, ghi trực tiếp, gửi phím tắt và chèn con trỏ. Tất cả các làn đều ghi điểm đầu ra của người đánh giá cuối cùng; các làn đường dọn dẹp vẫn có thể áp dụng các thay đổi về từ vựng và định dạng.
Độ trễ sử dụng 60 mẫu giải mã có trọng số bằng nhau trên mỗi làn và phân vị tuyến tính R-7. 20 bộ cố định chứa 491 vị trí từ tham chiếu trên mỗi lượt, được tính ba lần trong mẫu số 1.473 từ. Sự lặp lại không phải là những phát ngôn độc lập. Vẫn bao gồm các lỗi ở ngưỡng chất lượng: 3 khi bật tính năng dọn dẹp Core ML, 3 khi tắt tính năng dọn dẹp Core ML và 6 khi bật tính năng dọn dẹp Whisper.
Bản giải thích được sửa vào ngày 6 tháng 9 năm 2026. Các số gốc không thay đổi. Đọc kiểm tra bằng chứng, tài liệu tham khảo bên ngoài, các hạn chế còn lại và hướng dẫn sao chép.
Trong các lần chạy này, Whisper Base khi tắt tính năng dọn dẹp có cao hơn 2,85 điểm phần trăm WER, tốc độ xóa cao hơn 0,20 điểm, trung vị cao hơn 595 mili giây và p95 cao hơn 947 mili giây so với Core ML Parakeet khi tắt tính năng dọn dẹp.
Phi công loại trừ lời nói của con người, giọng điệu, lời nói đa ngôn ngữ, ghi âm trực tiếp bằng micro, thứ tự nhiệt kiểm soát, giám sát mạng, thiết bị bổ sung và sản phẩm của bên thứ ba.
Tải trọng số của mô hình là phần dễ dàng. Một hệ thống phiên âm hữu ích phải ghi lại âm thanh một cách đáng tin cậy, chọn runtime phù hợp, chuẩn bị giọng nói cho mô hình đó, phát hiện đầu ra chưa hoàn chỉnh, bảo vệ ý định của người dùng và đặt kết quả ở bất cứ nơi nào họ đang làm việc.
Yaps biến các mô hình giọng nói cục bộ có khả năng thành một công cụ riêng tư duy nhất mà mọi người có thể sử dụng trên các ứng dụng hàng ngày của họ, mà không cần tự dựng máy chủ mô hình, kịch bản, đường dẫn âm thanh hoặc các bước xuất.
Một phím tắt hoặc bàn phím điện thoại sẽ bắt đầu ghi âm riêng tư mà không đưa người dùng vào công cụ phiên âm riêng biệt.
Yaps áp dụng nhận diện giọng nói, xử lý khoảng lặng, và chuẩn bị âm thanh theo thiết bị trước khi nhận dạng.
Ứng dụng chọn một công cụ cục bộ đã được cài đặt cho thiết bị, ngôn ngữ, sở thích chất lượng và phần cứng có sẵn.
Parakeet, Cohere, Whisper, hoặc một tuyến chuyên gia chuyển đổi âm thanh đã chuẩn bị thành văn bản ứng viên.
Kiểm tra đầy đủ, đường dẫn cứu hộ, xử lý từ vựng và làm sạch cục bộ bảo vệ kết quả đã giao.
Văn bản hoàn thiện được cam kết tại con trỏ hoặc trong quy trình bàn phím di động, sẵn sàng sử dụng ngay lập tức.
Ngữ cảnh sản phẩm này giải thích lý do tại sao báo cáo này phân biệt cài đặt dọn dẹp và giai đoạn đầu ra được đo lường. Nó không phải là bằng chứng cho thấy Yaps là tốt nhất và nó không biến việc định vị sản phẩm thành kết quả chuẩn.
Các nghiên cứu kèm theo này sử dụng các thiết bị, tập dữ liệu, chỉ số và giao thức thử nghiệm khác nhau. Các con số của họ giải thích các quyết định sản phẩm hiện tại, nhưng chúng không được kết hợp thành một bảng xếp hạng duy nhất.
Một cuộc so sánh rộng hơn của M1 Max sử dụng 144 đoạn clip tổng hợp trên 24 ngôn ngữ và 65 đoạn clip FLEURS của con người trên 13 ngôn ngữ. Trên tập con 20 đoạn clip của con người được chia sẻ bởi Cohere và mọi mô hình, Cohere ghi nhận 4,2% WER đã được kiểm tra so với 12,0% của MLX Parakeet.
Trên một chiếc laptop Ryzen 7 5700U Windows, Cohere và ONNX Parakeet đã chạy cùng 70 clip FLEURS của con người trên 14 ngôn ngữ. Cohere trả về 70 bản ghi không rỗng; Parakeet trả về 61. Cohere thắng 12 trong số 14 so sánh ngôn ngữ tự động, nhưng trung bình mất 3.654 giây cho mỗi clip so với 1.394 giây của Parakeet.
Một gói FastConformer tiếng Ả Rập chạy trên Pixel 10 Pro. Loại trừ một cặp tham chiếu không hợp lệ, 39 clip FLEURS tạo ra 9,8% WER và 4,1% CER, với giá trị trung bình là 624 ms và 984 ms p95. Một lát cắt MASC sạch hơn và ồn ào hơn trên CPU Mac sau đó đã ghi được 22,5% WER, do đó lộ trình vẫn là Bản xem trước thay vì trở thành một tuyên bố chung bằng tiếng Ả Rập.
Bằng chứng hiện tạiChương trình thử nghiệm hiện tại với 20 thiết bị, cùng với một cuộc so sánh riêng biệt giữa 144 mô hình tổng hợp và 65 mô hình đa ngôn ngữ của con người.
Cổng bằng chứng tiếp theoThêm giọng nói tự phát, nhiều thế hệ Mac hơn, thứ tự nhiệt độ được kiểm soát, và thu âm trực tiếp từ micro.
Bằng chứng hiện tạiMột bộ kiểm tra riêng gồm 70 clip, 14 ngôn ngữ FLEURS do con người thực hiện, so sánh Cohere và ONNX Parakeet trên Windows 11.
Cổng bằng chứng tiếp theoXuất bản các hàng đã được làm sạch theo giao thức đã đóng băng và thêm các lớp bộ nhớ thấp hơn và GPU bổ sung.
Bằng chứng hiện tạiMột đánh giá Pixel 10 Pro đã đo một gói FastConformer bằng tiếng Ả Rập và kiểm tra đường đi bàn phím thực.
Cổng bằng chứng tiếp theoThêm giọng nói địa phương tự phát, nhiều cấp điện thoại hơn, sự tương đương đường dẫn tiếng Anh, pin và các phép đo sử dụng liên tục.
Bằng chứng hiện tạiYaps có sẵn trên Linux, nhưng báo cáo này không chứa kết quả chính xác hoặc độ trễ gốc của Linux đạt chuẩn báo cáo.
Cổng bằng chứng tiếp theoChạy phát lại fixture gốc Ubuntu, gói cài đặt dictation, CPU và các đường dẫn Vulkan, X11, và Wayland.
Bằng chứng hiện tạiYaps có sẵn trên iOS, nhưng báo cáo này vẫn chưa bao gồm điểm chuẩn thiết bị iPhone.
Cổng bằng chứng tiếp theoĐo lường phần mở rộng bàn phím thực, tải mô hình, áp lực bộ nhớ, sử dụng năng lượng và độ trễ cam kết đầu-cuối.
Bao nhiêu từ tham chiếu được thay thế, chèn vào, hoặc xóa sau khi chuẩn hóa xác định?
Một bản ghi có bị mất từ hoặc cụm từ trong khi vẫn nghe trôi chảy đủ để qua một lần xem nhanh không?
Mất bao lâu để xử lý trên toàn bộ phân phối, không chỉ trong lần chạy nhanh nhất?
Những kết nối và payload nào được quan sát trong một luồng công việc xác định, với giới hạn quan sát gói tin được nêu rõ ràng?
Phi công phân biệt các cài đặt dọn dẹp ngữ nghĩa, tính điểm đầu ra của người đánh giá cuối cùng, báo cáo các thay thế, chèn và xóa một cách độc lập, đồng thời giữ nội dung giọng nói riêng tư bên ngoài bản phát hành công khai. Các hệ thống có thể so sánh nhận được các byte âm thanh giống nhau khi giao diện của chúng cho phép; các đường dẫn chụp không tương thích thuộc về các tầng được phân tách rõ ràng.