Công cụ làm được gì
Công cụ chuyển lời nói trong âm thanh thành văn bản có thể chỉnh sửa bằng mô hình Whisper chạy trong trình duyệt. Trước khi nhận dạng, trình duyệt có thể chuẩn bị âm thanh qua bộ giải mã WASM, tải mô hình rồi dùng tài nguyên của máy tính hoặc điện thoại.
Cách sử dụng
- Thêm tệp âm thanh ở định dạng mà trình duyệt của bạn hỗ trợ.
- Chọn ngôn ngữ nói, hoặc để tự động nhận diện.
- Bắt đầu nhận dạng và theo dõi các bước: chuẩn bị âm thanh, tải mô hình, nhận dạng và kết quả.
- Kiểm tra văn bản, chỉnh sửa nếu cần, rồi sao chép hoặc tải tệp TXT.
Định dạng, chất lượng giọng nói và độ chính xác
Công cụ chuyển lời nói thành văn bản phù hợp cho ghi chú thoại, phỏng vấn, bài giảng, podcast và tin nhắn âm thanh. MP3, WAV, M4A, OGG, WebM và các tệp khác thường dùng được khi trình duyệt hoặc bộ giải mã WASM đọc được. Sau khi mở, âm thanh được chuẩn bị cho nhận dạng, vì vậy giọng nói rõ quan trọng hơn định dạng chứa ban đầu.
Tiếng ồn, nhạc nền, tiếng vọng, nhiều người nói cùng lúc và bản ghi quá nhỏ làm giảm độ chính xác. Bitrate cao không tự động tạo bản chép tốt hơn, nhưng âm thanh nén quá mạnh có nhiễu méo sẽ khó nhận dạng hơn. Với podcast và phụ đề, nên chia bản ghi dài và kiểm tra lại tên, số liệu, thuật ngữ chuyên môn.
Xử lý cục bộ và giới hạn trình duyệt
Quá trình nhận dạng chạy trên thiết bị của bạn: trình duyệt tải mô hình Whisper và dùng CPU, bộ nhớ, đôi khi cả tăng tốc phần cứng. Tệp âm thanh không được tải lên máy chủ All Tools, nên công cụ phù hợp cho ghi chú công việc, bản nháp chép lời và tin nhắn cá nhân.
Lần chạy đầu có thể chậm vì cần tải mô hình. Bản ghi dài cần nhiều bộ nhớ, nhất là trên điện thoại và laptop cũ; nếu tab bị đóng hoặc trình duyệt báo lỗi, hãy thử tệp ngắn hơn, đóng bớt tab hoặc dùng trình duyệt trên máy tính.