多說話者即時翻譯一次完成兩件事:它會標記房間裡每個人的聲音,並在大家還在說話時,把每一輪內容翻成你的語言。 MirrorCaption 直接在瀏覽器中處理這兩件事,支援 50+ 種可選語言,而且不需要機器人加入通話。你能即時看到是誰說了什麼,而不是等會議結束十分鐘後才看到。
想像一通四人會議:倫敦一位說英語的 PM、上海一位說中文的開發者、東京一位說日語的客戶,以及一位在兩者之間切換的設計師。每個人都在說話。你的逐字稿是一整面沒有標註來源的三語文字牆。你知道一定有重要內容被說出來了,但不知道是誰說的,也不清楚對方真正的意思。
這正是本指南要補上的缺口。沒有說話者標籤的翻譯只能告訴你說了什麼。多說話者即時翻譯則會即時用你的語言告訴你是誰說的。以下我們會說明它是什麼、為什麼標籤很重要、MirrorCaption 如何運作、這項技術真正的難點在哪裡,以及如何在沒有機器人的情況下跨平台使用它。
- 多說話者即時翻譯把兩件事合在一起:分離每個聲音並翻譯每一輪內容,而且是在會議進行中完成,而不是事後。
- 說話者標籤能把一整面翻譯文字牆變成可採取行動、可引用、可搜尋的「誰說了什麼」紀錄。
- MirrorCaption 會將聲音標記為 Speaker 1、Speaker 2、Speaker 3(可自由重新命名),並在 50+ 種語言中把原文與翻譯並列顯示,通話中不會有機器人加入。
- 嚴重交談重疊與幾乎相同的聲音,對任何即時系統都很難;分開的麥克風與乾淨的會議分頁音訊最有幫助。
- Premium 為 99 歐元一次性(付一次,不用訂閱續費),包含 200 小時的代管轉錄額度與所有未來更新。
什麼是多說話者即時翻譯?
多說話者即時翻譯是一種即時系統,會在大家還在說話時,分離並標記對話中的每個聲音,並把每一輪內容翻成你選擇的語言。它把說話者偵測與翻譯兩項任務合併成一條即時串流,讓你能跟上多語、多人的對話進行過程。
多數工具只做好其中一半。平台字幕會翻譯,但很少能在跨語言情境下清楚標示每一輪內容的歸屬。開發者用的轉錄工具可以分離聲音,但通常是上傳錄音後、先以英文處理、事後才完成。把標籤、翻譯、以及通話進行中這三件事合在一起,幾乎沒有人真正解決。如果你想更全面了解這個類別,我們整理的 最佳即時會議翻譯工具 文章涵蓋了整個市場。
說話者標籤 vs. 說話者分離
你會看到這兩個詞被鬆散地交替使用。說話者分離是技術流程,指的是依照「誰在什麼時候說話」來切分音訊,這項任務在 NIST 的 Rich Transcription evaluations 中有相關說明。說話者標籤則是面向使用者的結果:你實際會讀到的標記,例如 Speaker 1 和 Speaker 2,你也可以把它們重新命名為「Priya」或「Kenji」。
分離是引擎,標籤是儀表板。對會議來說,你在意的是儀表板:一份乾淨、可讀的紀錄,清楚標示每一輪內容的歸屬並完成翻譯。為字幕加入說話者身分也是無障礙最佳實務之一,正如 W3C 關於字幕的指引 所指出的,對於無法只靠聲音分辨不同人的觀眾尤其重要。
為什麼在翻譯會議時,說話者標籤很重要
在單一語言的會議裡,你通常可以自己分辨不同聲音。但在多語會議中,你已經把心力花在閱讀翻譯上,所以歸屬標示最容易被忽略。也正因如此,它最重要。
標籤會改變三件事。第一,決策:知道是誰提出異議,才能知道該回應誰的顧慮,以及這個顧慮有多重要。第二,可搜尋紀錄:有「誰說了什麼」的逐字稿,你就能直接跳到「客戶對時程說了什麼」。第三,順暢交接:跨境業務與法務團隊需要逐字、可歸屬的引述,而不是模糊改寫後的內容。
沒有標註來源的翻譯逐字稿有什麼問題
以下就是沒有標籤的逐字稿在實務上為什麼會失敗。假設 Speaker 2 說中文,表示價格有疑慮;同一時間 Speaker 3 正在講完一段關於時程的英文句子。在平面的逐字稿裡,這兩行會疊在一起,而價格疑慮看起來就像是那位在談日期的人提出的。
有了標籤,同一個時刻就會清楚很多:
Translation: 我們還需要再討論這個價格。
現在,價格疑慮明確歸屬給提出它的人,你也能對正確的人、正確的問題做出回應。這裡的歸屬標示不是錦上添花,而是會改變你接下來要說什麼。
MirrorCaption 中的多說話者即時翻譯如何運作
MirrorCaption 是以網頁應用程式運作,因此不需要安裝客戶端,也不需要批准會議機器人。多說話者通話的流程很簡單:
- 在桌面版 Chrome 或 Microsoft Edge 開啟 MirrorCaption,並啟動 Meet 模式。
- 分享會議分頁,讓 MirrorCaption 擷取通話音訊(以及你的麥克風)。
- 說話者偵測會分離聲音並標記為 Speaker 1、Speaker 2、Speaker 3。
- 每一輪內容都會以原文與翻譯並列顯示,使用你選擇的語言。
- 將說話者重新命名為真實姓名,然後搜尋、匯出或摘要逐字稿。
自動說話者偵測(Speaker 1、Speaker 2,可重新命名)
即時轉錄層會辨識不同聲音並自動加上標籤。你不需要事先標記任何人。當你認出某個聲音時,點擊標籤並重新命名,這個名稱就會套用到整份逐字稿。從那之後,這個人的每一輪發言都會以他的名字歸屬。
原文與翻譯並列顯示,按說話者分開呈現
MirrorCaption 會把原文與翻譯保留在一起,而不是用翻譯取代原文,因此細微語意不會流失。舉個經典的雙語例子:一位日本客戶說「ちょっと難しいです」。直譯是「有點困難」,語言上正確,商務上則是委婉的拒絕。因為原文會與翻譯並列,你可以點選任何字詞查看原文,並更準確地判讀現場語氣。若想進一步了解這些翻譯有多忠實,請參考我們對 即時翻譯準確度 的說明。
可選的 Speak Translations,跨語言直接口說回覆
只讀文字有時不夠。透過 Speak Translations,MirrorCaption 可以用接近即時的節奏,將你的翻譯內容以目標語言朗讀出來。你說英語,對方聽到日語;你說中文,對方聽到英語。音訊可以透過筆電喇叭、配對的手機喇叭,或在 Mac 用戶端上透過虛擬麥克風路由到 Zoom、Meet 或 Teams。這會把有標籤的逐字稿變成真正的雙向對話,雙方都能繼續用自己的語言說話。
說話者偵測在哪些情況下會變難(誠實的限制)
沒有任何即時系統能在雜亂音訊上完美分離聲音,若聲稱可以,那是不誠實的。有幾種情況確實很難處理。
交談重疊。 當兩個人同時說話時,音訊會重疊,輪次邊界也會變得模糊。標籤可能會延遲,或在其中一個聲音結束前被合併。
幾乎相同的聲音。 兩位說話者如果音高與口音相近,而且共用同一支麥克風,軟體有時連人都很難分辨,對人來說也是如此。
麥克風設定不佳。 一支筆電麥克風收進整個會議室的聲音,能提供給偵測器的資訊,遠少於分開使用的裝置。
實務上有幫助的方法是:讓每個人說完再接話、盡可能使用分開的麥克風,並依賴乾淨的會議分頁音訊,而不是房間麥克風。這些條件也同樣能提升任何工具的準確度,我們的 多語轉錄指南 有更詳細的說明。
跨平台的多說話者翻譯,不需要機器人
因為 MirrorCaption 是擷取瀏覽器音訊,而不是加入會議,所以它可以與主持人已經選定的工具並行使用。在桌面版 Chrome 或 Edge 中,Meet 模式可擷取瀏覽器版 Zoom、Microsoft Teams、Google Meet 與 Webex 通話的會議分頁。沒有人需要接受機器人加入,而且任何會議音訊都不會儲存在伺服器上,只有你選擇本機保存的逐字稿會被保留。
若是面對面、多方對話,手機上的 Talk 模式會以單一連續工作階段運作。你只要啟動一次,讓大家輪流發言;它不是按住說話,也不會在每一句後重置。這讓它適合桌邊圓桌討論,而不只是單句短語查詢。
以下是針對「即時標記聲音並翻譯每一輪內容」這項特定工作,各種常見做法的比較:
| 做法 | 說話者標籤 | 即時翻譯 | 通話進行中 | 無機器人 | 語言 |
|---|---|---|---|---|---|
| 平台原生字幕(Zoom、Teams、Meet) | 依平台而異 | 通常受方案等級限制 | 有,在字幕中 | 內建,但僅限該平台 | 由供應商與方案決定 |
| STT / diarization API(開發者工具) | 有,效果強 | 依供應商而異 | 即時或後處理,視實作而定 | 不適用,需要程式碼 | 依供應商與模型而異 |
| MirrorCaption | 有,自動且可重新命名 | 有,並列顯示 | 有,說話時即顯示 | 有,瀏覽器分頁擷取 | 50+ 種可選 |
重點不是其他工具不好。平台字幕在自家環境內很方便,而 diarization API 對建立客製化流程也非常出色。MirrorCaption 補上的,是「標記說話者、即時翻譯、而且可在你團隊使用的任何瀏覽器型工具上運作」這個特定缺口。
真正有價值的實際情境
以下為示意性工作流程,並非客戶見證。
多語全員大會。 想像一個分散式團隊,聖保羅的 Maria、深圳的 Wei、柏林的 Anna 一起參加每日站會。與其強迫大家都用英文,不如讓每個人都用自己的語言閱讀會議內容,且每一輪發言都有歸屬標示。晚加入的人打開即時摘要,一次閱讀就能跟上進度。這就是 遠端團隊即時翻譯 的日常情境。
跨境談判。 想像一通供應商會議,供應商端有兩位說中文,買方端有兩位說英文。當 Speaker 2 在 Speaker 1 還在談條款時提出交期風險,標籤會把兩條線索分開,讓買方能對正確的人回應風險,而不是答非所問。
多語教室。 想像一場線上研討會,一位說韓文的學生在英文講課中提問。帶有標籤與翻譯的逐字稿,能讓講師看出是誰問了什麼並精準回應,而學生也能保留一份並列記錄,方便之後複習。
常見問題
什麼是多說話者即時翻譯?
多說話者即時翻譯是一種即時系統,同時完成兩件事:分離並標記對話中的每個聲音,並在大家還在說話時,把每一輪內容翻成你選擇的語言,讓你能即時看到是誰說了什麼。
可以在沒有機器人的情況下翻譯有多位說話者的會議嗎?
可以。MirrorCaption 會在你的瀏覽器分頁中執行,並在桌面版 Chrome 或 Microsoft Edge 直接擷取會議音訊,因此不會有機器人加入通話。它會在會議進行中標記每個聲音並翻譯每一輪內容,而且不會把會議音訊儲存在伺服器上。
說話者偵測如何分辨不同聲音?
說話者偵測會分離音訊中的不同聲音,並標記為 Speaker 1、Speaker 2 等,你可以重新命名。它在清楚的音訊與分開的麥克風下效果最好。嚴重交談重疊或幾乎相同的聲音,會讓這項工作更困難。
對方可以聽到翻譯,而不只是看到文字嗎?
可以。Speak Translations 能以接近即時的節奏,透過筆電喇叭、配對的手機喇叭,或 Mac 虛擬麥克風,把你的翻譯內容用目標語言朗讀出來,讓對話持續進行,不必等會後逐字稿。
多說話者即時翻譯支援多少種語言?
MirrorCaption 提供 50+ 種可選語言,且可雙向使用,包括中文、日文、韓文、西班牙文、法文、德文等。每一輪有標籤的內容都會與翻譯並列顯示,你也可以點選任何字詞查看原文。
結論
多說話者即時翻譯就是把三件事合在一起:標記每個聲音、翻譯每一輪內容,並且在對話還在進行時完成這兩件事。只有翻譯,能告訴你說了什麼;加上說話者標籤,才能告訴你是誰說的,而這才是真正讓你能在當下回應、引用與決策的關鍵。
要做到這點,請在 Chrome 或 Edge 中使用會議分頁音訊,讓說話者偵測標記聲音,重新命名,並將原文與翻譯並列閱讀。當只看文字還不夠時,開啟 Speak Translations,讓對方能聽到訊息並繼續對話。而在音訊雜亂時,請記得更乾淨的麥克風與不急促的輪流發言,對所有工具都有幫助,我們也不例外。