Vấn đề của nhập liệu bằng giọng nói chưa bao giờ là máy tính không nghe được bạn. Chúng nghe bạn rất rõ. Vấn đề là chúng ghi lại chính xác những gì bạn đã nói — mà những gì con người nói ra, trong thời gian thực, không giống với cách văn bản được viết.
Bạn bắt đầu một câu, rồi giữa chừng nhận ra đó là câu sai, và bắt đầu lại. Bạn nói "um" trong lúc suy nghĩ. Bạn tự sửa mình. Bản chép nguyên văn trung thực giữ lại tất cả những thứ đó, rồi đưa cho bạn một đoạn văn mà giờ bạn phải chỉnh sửa. Với rất nhiều người, việc chỉnh sửa đó mất gần bằng thời gian gõ phím.
Hướng dẫn này nói về cách thu hẹp khoảng cách đó: điều gì gây ra nó, điều gì không khắc phục được, và điều gì thì có.
Điểm chính
- Khoảng cách này mang tính cấu trúc — ngôn ngữ nói có từ đệm và các lần bắt đầu lại; ngôn ngữ viết thì không. Bản chép nguyên văn không thể bắc cầu qua nó.
- Nói cẩn thận hơn không hiệu quả trong thời gian dài, và nó làm mất đi lợi thế tốc độ vốn khiến nhập liệu bằng giọng nói trở nên hấp dẫn.
- Một lớp dọn sạch thì có hiệu quả — công cụ loại bỏ từ đệm và các lần bắt đầu sai trước khi bạn nhìn thấy văn bản.
- Dọn sạch nên là một lựa chọn, không phải mặc định — đôi khi bạn muốn đúng nguyên văn, nên Raw, Tidy và Formal là các chế độ riêng biệt.
- Từ vựng tùy chỉnh quan trọng hơn độ chính xác thô đối với tên riêng, thuật ngữ chuyên ngành và tên sản phẩm.
Vì sao chép nguyên văn lại tạo thêm việc
Hãy nói to câu này với tốc độ bình thường: "so I think we should — actually, can we push the roadmap review, um, to Thursday instead?"
Một công cụ chép nguyên văn sẽ viết đúng y như vậy. Điều bạn muốn là: "Can we push the roadmap review to Thursday instead?"
Mỗi đoạn được đọc ra đều mang một phiên bản nào đó của vấn đề này. Cách sửa mà mọi người thường nghĩ đến đầu tiên là nói cẩn thận hơn — chậm hơn, có chủ ý hơn, không dùng từ đệm. Nó hiệu quả khoảng hai phút, rồi rất mệt, và nó xóa luôn lý do bạn bắt đầu dùng nhập liệu bằng giọng nói: vì nói nhanh hơn gõ.
Điều gì không khắc phục được
Nhận dạng giọng nói tốt hơn. Cải thiện độ chính xác khiến bản chép sát với lời nói của bạn hơn, mà điều đó làm vấn đề tệ hơn một chút, chứ không tốt hơn. Một công cụ chép hoàn hảo sẽ giữ lại mọi "um" một cách hoàn hảo.
Lệnh dấu câu. Nói to "comma" và "new paragraph" giúp về cấu trúc, nhưng không làm gì với từ đệm và các lần bắt đầu sai. Nó cũng khiến việc nói chuyện giống như đang lập trình.
Chỉnh sửa sau đó. Đây là hiện trạng, và cũng là lý do khiến nhiều người âm thầm ngừng dùng nhập liệu bằng giọng nói sau một tuần.
Điều gì có hiệu quả: Một lớp dọn sạch
Cách khắc phục là đặt một bước giữa nhận dạng và đầu ra. Công cụ nghe những gì bạn nói, hiểu ý bạn muốn nói, rồi đưa cho bạn phiên bản viết ra.
MirrorCaption Typer làm điều này với ba chế độ tinh chỉnh mà bạn chọn theo từng lúc, vì mức độ dọn sạch phù hợp không phải lúc nào cũng giống nhau:
- Raw speech — đúng nguyên văn những gì bạn nói, giữ lại mọi từ đệm và mọi lần bắt đầu sai. Hữu ích khi từng chữ đúng nguyên văn là quan trọng: trích dẫn, ghi chú về cách ai đó diễn đạt điều gì đó, luyện ngôn ngữ.
- Tidy (mặc định) — loại bỏ các từ đệm như "um" và "uh", bỏ các lỗi nói và các lần bắt đầu sai, thêm dấu câu, và giữ nguyên ý nghĩa cùng giọng điệu của bạn. Đây là chế độ khiến nhập liệu bằng giọng nói cuối cùng cũng trở nên đúng như lẽ ra nó phải có.
- Formal — viết lại đoạn văn thành ngôn ngữ gọn gàng, chuyên nghiệp, sẵn sàng đưa vào email hoặc tài liệu. Nó có thay đổi cách diễn đạt của bạn, một cách có chủ ý, nên đây là chế độ bạn phải tự chọn.
Lấy ví dụ ở trên: Raw cho bạn câu có phần bắt đầu lại và từ "um". Tidy cho bạn "Can we push the roadmap review to Thursday instead?" Formal cho bạn một câu gần hơn với "Could we move the roadmap review to Thursday?"
Phần còn lại: Đưa văn bản đến đúng nơi bạn cần
Văn bản sạch mới chỉ là một nửa công việc. Nếu nó rơi vào một ứng dụng chép lời, bạn vẫn phải sao chép nó vào cửa sổ mà bạn thực sự muốn dùng.
Typer chạy trong một cửa sổ nhỏ nổi phía trên mọi thứ khác — ứng dụng email, tài liệu, hộp chat của bạn. Khi bạn ngừng nói, văn bản đã được tinh chỉnh sẽ tự động được sao chép vào clipboard của bạn. Không có nút nào phải tìm và cũng không có ứng dụng nào phải chuyển sang. Bạn dán vào, thế là xong.
Vì nó chạy trong trình duyệt nên không cần cài đặt gì, điều này rất quan trọng trên các máy tính xách tay công việc được quản lý, nơi việc cài phần mềm đồng nghĩa với việc phải gửi yêu cầu.
Tên riêng, thuật ngữ chuyên ngành và những từ thực sự là của bạn
Những lỗi còn sót lại sau một lớp dọn sạch tốt thường là danh từ riêng: tên đồng nghiệp, tên sản phẩm, thuật ngữ nội bộ, thuật ngữ kỹ thuật. Không có mô hình tổng quát nào từng thấy chúng.
Có hai điều giúp ích. Thứ nhất, một từ vựng tùy chỉnh — bạn thêm các thuật ngữ mình dùng, và chúng sẽ được nhận dạng trước. Thứ hai, học từ các chỉnh sửa của bạn: khi bạn sửa một chỗ nào đó, công cụ ghi nhớ sở thích của bạn thay vì bắt bạn sửa lại vào tuần sau.
Khi bạn dùng nhiều ngôn ngữ cùng lúc
Rất nhiều người không nói một ngôn ngữ tại một thời điểm. Một người nói tiếng Trung chèn tên sản phẩm tiếng Anh vào. Một kỹ sư người Đức dùng các thuật ngữ kỹ thuật tiếng Anh giữa câu. Hầu hết các công cụ nhập liệu bằng giọng nói buộc bạn phải chọn một ngôn ngữ nhận dạng và chuyển thủ công, điều này làm đứt mạch đến mức nhiều người bỏ cuộc.
Typer cho phép bạn đặt nhiều ngôn ngữ nhận dạng cùng lúc, nên một câu pha trộn vẫn được ghi chính xác mà không cần chuyển chế độ. Nếu vấn đề của bạn lại là người khác nói những ngôn ngữ mà bạn không biết, thì đó là chép lời và dịch thuật chứ không phải nhập liệu bằng giọng nói — xem dictation vs. transcription để biết bạn đang ở phía nào.
Khi nguyên văn là câu trả lời đúng
Dọn sạch không phải lúc nào cũng là điều bạn muốn. Hãy dùng chế độ Raw khi bạn đang trích dẫn ai đó, khi cách diễn đạt chính xác là điều quan trọng, khi bạn đang luyện một ngôn ngữ và muốn xem mình thực sự đã nói gì, hoặc khi bạn đang ghi lại một ý nghĩ đúng theo hình dạng nó xuất hiện. Điểm mấu chốt là đó là một lựa chọn, chứ không phải lựa chọn duy nhất.
Câu hỏi thường gặp
Làm sao để nhập văn bản bằng giọng nói mà không cần chỉnh sửa?
Hãy dùng một công cụ nhập liệu bằng giọng nói có dọn sạch trong lúc gõ thay vì chép nguyên văn. Chế độ Tidy của MirrorCaption Typer loại bỏ các từ đệm như "um" và "uh", bỏ các lần bắt đầu sai và lỗi nói, đồng thời thêm dấu câu trước khi văn bản đến clipboard của bạn, nên thao tác dán là bước cuối cùng chứ không phải bước đầu trong nhiều bước.
Nhập liệu bằng giọng nói có thể tự động bỏ "um" và "uh" không?
Các công cụ tích hợp như Apple Dictation, Windows Voice Typing và Google Docs Voice Typing chép nguyên văn, nên các từ đệm vẫn còn. Các công cụ có lớp dọn sạch sẽ tự động loại bỏ chúng. Trong MirrorCaption Typer, đây là một chế độ bạn chọn theo từng lúc: Raw giữ lại mọi thứ, Tidy loại bỏ từ đệm và thêm dấu câu, Formal viết lại đoạn văn thành ngôn ngữ chuyên nghiệp.
Việc dọn sạch lời nói của tôi có làm thay đổi ý tôi muốn nói không?
Không nên. Chế độ Tidy được thiết kế để giữ nguyên ý nghĩa và giọng điệu của bạn, chỉ loại bỏ phần nhiễu — từ đệm, các lần bắt đầu lại, và lỗi nói. Chế độ Formal cố ý viết lại cách diễn đạt, đó là lý do nó là một chế độ riêng mà bạn chọn, chứ không phải mặc định.
Tôi có thể nhập bằng nhiều ngôn ngữ cùng lúc không?
Với hầu hết công cụ thì không — bạn chọn một ngôn ngữ nhận dạng rồi chuyển khi đổi ngôn ngữ. MirrorCaption Typer cho phép bạn đặt nhiều ngôn ngữ nhận dạng cùng lúc, nên việc trộn tiếng Trung với tiếng Anh, hoặc tiếng Đức với tiếng Anh, trong cùng một câu vẫn được ghi chính xác.
Làm sao để nhập liệu bằng giọng nói nhận ra tên riêng và thuật ngữ chuyên ngành?
Hãy thêm chúng vào một từ vựng tùy chỉnh. Typer cho phép bạn thêm các tên riêng, thuật ngữ sản phẩm và thuật ngữ chuyên ngành mà bạn thường dùng để chúng được nhận dạng trước, và nó học từ các chỉnh sửa bạn thực hiện với đầu ra của nó, nên cùng một lỗi sẽ không lặp lại.
Nhập liệu bằng giọng nói có hoạt động trong các ứng dụng khác ngoài trình duyệt không?
Typer chạy trong một cửa sổ trình duyệt nhỏ nổi phía trên các ứng dụng khác của bạn và tự động sao chép văn bản hoàn chỉnh vào clipboard, nên bạn có thể dán vào email, tài liệu, chat hoặc bất kỳ ứng dụng nào khác. Không có gì để cài đặt, đồng nghĩa cũng không có gì để IT phê duyệt.
Kết luận
Nhập liệu bằng giọng nói đã không còn là vấn đề về độ chính xác từ khá lâu rồi. Đó là vấn đề dịch thuật — giữa cách con người nói và cách văn bản được kỳ vọng phải đọc — và bản chép nguyên văn để phần dịch đó cho bạn tự làm.
Các công cụ làm thay bạn biến nhập liệu bằng giọng nói từ thứ bạn thử một lần thành thứ bạn dùng mỗi ngày. Hãy so sánh các lựa chọn trong best dictation software guide của chúng tôi.
Nói lộn xộn. Dán sạch sẽ.
Typer loại bỏ từ đệm và các lần bắt đầu sai trước khi văn bản đến clipboard của bạn. 1 giờ miễn phí, không cần thẻ tín dụng, không cần cài đặt gì.
Dùng thử Typer miễn phí