語音打字的問題從來不是電腦聽不見你。它們聽得很清楚。問題在於它們會把你說的每個字原封不動寫下來——而人們在即時口語中說出來的內容,和書面文字的樣子並不一樣。

你開始說一句話,講到一半又覺得這不是你要說的句子,於是重來一次。你思考時會說「嗯」。你會修正自己。逐字轉錄會忠實保留這一切,然後把一段你現在還得自己編修的文字交給你。對很多人來說,這些編修花的時間跟打字一樣久。

這份指南就是要縮小這個落差:它是怎麼造成的、什麼方法無法解決、以及什麼方法真的有效。

重點摘要

為什麼逐字轉錄會增加工作量

用正常速度大聲說這句話:「所以我覺得我們應該——其實,我們可以把路線圖檢討,嗯,改到星期四嗎?」

逐字轉錄器會一字不差地寫下來。你真正想要的是:「我們可以把路線圖檢討改到星期四嗎?」

每一段口述內容都會帶著某種這樣的問題。人們第一個想到的解法是更小心地說——更慢、更刻意、不用填充詞。這方法大概能撐兩分鐘,然後你就累了,而且它也拿掉了你開始用口述輸入的原因:說話比打字快。

什麼方法無法解決

更好的語音辨識。 準確率提升只會讓轉錄更忠實於你的口語,反而讓問題稍微更嚴重,而不是更好。完美的轉錄器會完美保留每一個「嗯」。

標點指令。 大聲說「逗號」和「換段」有助於結構,但對填充詞和錯誤開頭毫無幫助。它也會讓說話感覺像在寫程式。

之後再編修。 這就是現狀,而這也是為什麼很多人會在一週後默默停止使用口述輸入。

真正有效的是:清理層

解法是在辨識和輸出之間加上一個步驟。工具先聽你說了什麼,再判斷你的意思,然後給你書面版本。

MirrorCaption Typer 透過三種你可依當下情境選擇的潤飾模式來做到這件事,因為每次需要的清理程度都不一樣:

以上面的例子來說:Raw 會給你帶有重來和「嗯」的句子。Tidy 會給你 「我們可以把路線圖檢討改到星期四嗎?」 Formal 則會更接近 「我們可以把路線圖檢討改到星期四嗎?」

另一半:把文字送到你需要的地方

乾淨的文字只完成了一半。如果它落在轉錄應用程式裡,你還是得把它複製到你真正想放的視窗中。

Typer 會在一個小視窗中執行,浮在其他所有東西上方——你的郵件用戶端、文件、聊天框。當你停止說話時,潤飾後的文字會自動複製到剪貼簿。你不需要找按鈕,也不需要切換應用程式。貼上,然後就完成了。

因為它在瀏覽器中執行,所以不需要安裝任何東西;這在受管理的工作筆電上特別重要,因為安裝軟體通常代表要先送出工單。

人名、術語,以及真正屬於你的那些字

即使有很好的清理層,仍然會漏掉的錯誤通常都是專有名詞:同事姓名、產品名稱、內部術語、技術名詞。一般模型從來沒看過這些詞。

有兩件事有幫助。第一,自訂詞彙——把你常用的詞加入,系統會優先辨識。第二,從你的編修中學習:當你修正某個詞時,工具會記住你的偏好,而不是下週又要你再修一次。

當你混用語言時

很多人不是一次只說一種語言。中文使用者會夾帶英文產品名稱。德國工程師會在句子中間使用英文技術詞彙。大多數口述輸入工具都會強迫你選一種辨識語言,然後手動切換,這會嚴重破壞流暢度,讓人乾脆放棄。

Typer 讓你一次設定多種辨識語言,所以混合句子也能準確輸出,不需要切換模式。如果你的問題其實是別人說的是你不懂的語言,那就是轉錄加翻譯,而不是口述輸入——請參考 dictation vs. transcription,看看你屬於哪一邊。

什麼時候逐字才是正確答案

清理並不總是你要的。當你在引用某人、當精確措辭就是重點、當你在練習語言並想看自己實際說了什麼,或當你想把一個念頭以它剛出現時的樣子記下來時,就使用 Raw 模式。重點在於它是一個選項,而不是唯一選擇。

常見問題

我要怎麼口述出不需要編修的文字?

使用會在輸入時自動清理的口述工具,而不是逐字轉錄。MirrorCaption Typer 的 Tidy 模式會在文字進入剪貼簿之前,移除像「嗯」和「呃」這類填充詞、刪掉錯誤開頭和口誤,並加入標點,所以貼上是最後一步,而不是一連串步驟中的第一步。

語音打字可以自動移除嗯和呃嗎?

Apple Dictation、Windows Voice Typing 和 Google Docs Voice Typing 這類內建工具會逐字轉錄,所以填充詞會保留下來。帶有清理層的工具則會自動移除它們。在 MirrorCaption Typer 中,這是你可依當下情境選擇的模式:Raw 保留全部內容,Tidy 移除填充詞並加入標點,Formal 則把內容改寫成專業措辭。

清理我的口語會改變我原本的意思嗎?

不應該。Tidy 模式的設計目標是保留你的意思和語氣,只移除雜訊——填充詞、重來和口誤。Formal 模式則是刻意改寫措辭,這也是它為什麼是你另外選擇的獨立模式,而不是預設值。

我可以同時用超過一種語言口述嗎?

大多數工具不行——你得先選一種辨識語言,換語言時再切換。MirrorCaption Typer 讓你一次設定多種辨識語言,所以在同一句裡混用中文和英文,或德文和英文,仍然能準確輸出。

我要怎麼讓語音打字辨識人名和術語?

把它們加入自訂詞彙。Typer 讓你加入常用的人名、產品名稱和術語,讓它們優先被辨識,而且它也會從你對輸出的修正中學習,所以同樣的錯誤不會一再重複。

語音打字在瀏覽器以外的應用程式也能用嗎?

Typer 會在一個浮在其他應用程式上方的小型瀏覽器視窗中執行,並自動把完成的文字複製到剪貼簿,所以你可以貼到電子郵件、文件、聊天或任何其他應用程式中。它不需要安裝,這也代表不需要 IT 核准。

結論

語音打字在一段時間前就不再是準確率問題了。它是一個翻譯問題——介於人們怎麼說話,和文字應該怎麼讀之間——而逐字轉錄把這個翻譯工作留給了你。

能替你完成這件事的工具,會把口述輸入從你試過一次的東西,變成你每天都會用的東西。請在我們的 最佳口述輸入軟體指南 中比較各種選項。

說得凌亂。貼上乾淨。

Typer 會在文字進入你的剪貼簿之前移除填充詞和錯誤開頭。1 小時免費,無需信用卡,也不用安裝任何東西。

免費試用 Typer