多说话人实时翻译一次完成两项工作:它会标记房间里的每个声音,并在大家还在说话时把每一轮发言翻译成你的语言。 MirrorCaption 在浏览器中即可完成这两件事,支持 50+ 可选语言,通话中无需机器人加入。你能在话音刚落时就看到是谁说了什么,而不是等会议结束十分钟后才看到。

想象一个四人通话场景:伦敦一位说英语的 PM、上海一位说普通话的开发者、东京一位说日语的客户,以及一位在两种语言之间切换的设计师。每个人都在说话。你的转录稿是一整面没有归属的三语文本墙。你知道有人说了重要的话,但不知道是谁说的,也不清楚具体是什么意思。

这正是本指南要填补的空白。没有说话人标签的翻译只能告诉你说了什么。多说话人实时翻译则能实时用你的语言告诉你说了这句话。下面我们会介绍它是什么、为什么标签重要、它在 MirrorCaption 中如何工作、这项技术真正的难点在哪里,以及如何在没有机器人的情况下跨平台使用它。

要点总结

什么是多说话人实时翻译?

多说话人实时翻译是一种实时系统,它会在大家还在说话时,分离并标记对话中的每个声音,并把每一轮发言翻译成你选择的语言。它把说话人检测和翻译这两项任务合并成一条实时流,让你能够跟上正在发生的多语言、多参与者对话。

大多数工具只把其中一半做好。平台字幕会翻译,但很少能在不同语言之间清晰地标注每一轮发言。开发者转录工具能分离声音,但通常是对上传录音处理,先英文,且是事后完成。把标签、翻译和通话中这三件事合在一起,几乎没人真正解决。如果你想更全面地了解这个类别,我们整理的 最佳实时会议翻译工具 综述涵盖了整个领域。

说话人标签 vs. 说话人分离

你会看到这两个术语被宽泛地使用。说话人分离是按“谁在什么时候说话”来划分音频的技术过程,NIST 的 Rich Transcription evaluations 对此有相关说明。说话人标签则是面向人的结果:你真正会读到的标签,比如 Speaker 1 和 Speaker 2,你还可以把它们重命名为“Priya”或“Kenji”。

分离是引擎,标签是仪表盘。对于会议来说,你关心的是仪表盘:一份清晰、可读、带归属且已翻译的每轮发言记录。W3C 关于字幕的 指导 也指出,为字幕添加说话人身份是无障碍最佳实践之一,因为有些观众不能只靠声音来区分不同的人。

为什么在翻译会议时说话人标签很重要

在单语言会议中,你通常可以自己分辨不同的声音。但在多语言会议里,你已经在花精力阅读翻译内容,所以归属信息最容易被忽略。而这恰恰是它最重要的时候。

标签会改变三件事。第一,决策:知道是谁提出异议,就能知道该回应谁的顾虑,以及它有多大分量。第二,可搜索记录:一份“谁说了什么”的转录稿能让你直接跳到“客户对时间表说过的所有内容”。第三,清晰交接:跨境销售和法务团队需要逐字、带归属的引语,而不是被改写得模糊不清的内容。

想看看在你自己的通话里,带标签的翻译发言是什么样吗?免费试用 MirrorCaption,一小时,无需信用卡,无需安装。

没有归属信息的翻译转录稿有什么问题

下面就是为什么没有标签的转录稿在实际中会失效。假设 Speaker 2 说普通话,提到价格是个问题,而 Speaker 3 正在同时结束一句关于时间表的英文句子。在平铺式转录稿里,这两行会叠在一起,价格担忧看起来像是来自那个在谈日期的人。

有了标签,同一时刻就会清楚得多:

Speaker 2 (中文): 这个价格我们还要再商量。
Translation: 我们还需要再讨论这个价格。
Speaker 3 (English): Right, and the timeline works for our Q4 launch.

现在,价格方面的顾虑就明确归属于提出它的人,你也可以把正确的问题回应给正确的人。这里的归属信息不是锦上添花,它会改变你接下来要说什么。

MirrorCaption 中的多说话人实时翻译如何工作

MirrorCaption 作为网页应用运行,因此无需安装客户端,也无需批准会议机器人。多说话人通话的流程很简单:

  1. 在桌面版 Chrome 或 Microsoft Edge 中打开 MirrorCaption,并启动 Meet 模式。
  2. 共享会议标签页,让 MirrorCaption 捕获通话音频(以及你自己的麦克风)。
  3. 说话人检测会分离不同声音,并标记为 Speaker 1、Speaker 2、Speaker 3。
  4. 每一轮发言都会以原文和你所选语言的译文并排显示。
  5. 将说话人重命名为真实姓名,然后搜索、导出或总结转录稿。

自动说话人检测(Speaker 1、Speaker 2,可重命名)

实时转录层会识别不同的声音并自动加上标签。你无需提前标记任何人。当你认出某个声音时,点击标签并重命名,这个名字会应用到整份转录稿中。从那时起,这个人的每一轮发言都会按姓名归属。

原文与译文并排显示,按说话人分开

MirrorCaption 会把原文和译文放在一起,而不是用译文替换原文,因此细微含义不会丢失。以经典的双语例子来说:一位日本客户说「ちょっと難しいです」。直译是“有点困难”,语言上没错,但在商务语境里其实是委婉的拒绝。因为原文紧挨着译文,你可以点按任意词查看原文,并准确判断语境。想了解这些翻译有多忠实,可查看我们关于 实时翻译准确度 的说明。

可选的 Speak Translations,用不同语言直接开口回应

只读文字有时还不够。借助 Speak Translations,MirrorCaption 可以按接近实时的节奏,用目标语言朗读你的译文。你说英语,对方听到日语;你说普通话,对方听到英语。音频可以通过笔记本扬声器、配对的手机扬声器播放,或者在 Mac 客户端中通过虚拟麦克风路由到 Zoom、Meet 或 Teams。这样,带标签的转录稿就变成了真正的双向交流,双方都能继续使用自己的语言说话。

准备在一次真实的多语言通话中测试差异了吗? 免费开始,几分钟内就能为你的第一次会议加上标签。

说话人检测在哪些地方会变难(诚实的限制)

没有任何实时系统能在杂乱音频上完美分离声音,如果声称可以,那就是不诚实。有几种情况确实很难。

交叉说话。 当两个人同时说话时,音频会重叠,轮次之间的边界会变得模糊。标签可能会延迟,或者在其中一个声音结束前被合并。

近似相同的声音。 两位说话人如果音高和口音都很相似,而且共用同一个麦克风,软件有时甚至人也很难区分。

糟糕的麦克风设置。 一支笔记本麦克风去收整个会议室的声音,能提供给检测器的信息远少于分开的设备。

实际中最有帮助的是:尽量让每个人说完再接话,能用分开的麦克风就用分开的麦克风,并依赖干净的会议标签页音频,而不是房间麦克风。这些条件同样能提升任何工具的准确度,我们的 多语言转录指南 里对此有更详细的说明。

跨平台多说话人翻译,无需机器人

因为 MirrorCaption 捕获的是浏览器音频,而不是加入会议,所以它可以与主持人已经选择的工具并行工作。在桌面版 Chrome 或 Edge 中,Meet 模式可捕获基于浏览器的 Zoom、Microsoft Teams、Google Meet 和 Webex 通话的会议标签页。没人需要接受机器人加入,而且会议音频不会存储在服务器上,只有你选择本地保存的转录稿会被保留。

对于面对面、多方参与的对话,手机上的 Talk 模式会作为一个连续会话运行。你只需启动一次,然后让大家轮流发言;它不是按住说话,也不会在每句话后重置。这使它适合围桌讨论,而不只是单句短语查询。

下面是针对“实时标记声音并翻译每轮发言”这一特定任务,各种常见方案的对比:

方案 说话人标签 实时翻译 通话中 无需机器人 语言
平台原生字幕(Zoom、Teams、Meet) 因平台而异 通常受套餐限制 是,在字幕中 内置,但仅限该平台 由供应商和套餐决定
STT / diarization APIs(开发者工具) 是,效果强 因提供商而异 实时或会后处理,取决于实现 不适用,需要代码 因提供商和模型而异
MirrorCaption 是,自动且可重命名 是,并排显示 是,按说话时同步显示 是,浏览器标签页捕获 50+ 可选

重点不是说其他工具不好。平台字幕在各自生态内很方便,而 diarization APIs 对构建自定义流程非常出色。MirrorCaption 填补的是这样一个特定空白:在你团队使用的任何基于浏览器的工具中,实时提供带标签、已翻译的每轮发言。

真正能体现价值的现实场景

以下内容为示意性工作流,不是客户证言。

多语言全员大会。 想象一个分布式团队:圣保罗的 Maria、深圳的 Wei 和柏林的 Anna 一起参加站会。不是强迫所有人都用英语,而是每个人都能用自己的语言阅读会议内容,并且每一轮发言都有归属。晚加入的人打开实时摘要,读一遍就能跟上。这就是 面向远程团队的实时翻译 的日常场景。

跨境谈判。 想象一次供应商电话会议,供应商一侧有两个人说普通话,买方一侧有两个人说英语。当 Speaker 2 在 Speaker 1 还在谈条款时指出交付风险,标签会把两条线索分开,这样买方就能把回应发给正确的人,而不是答非所问。

多语言课堂。 想象一场在线研讨会,一位说韩语的学生在英语讲座中提问。带标签、已翻译的转录稿能让讲师看清是谁问了什么并准确回应,而学生也能保留一份并排记录,方便之后复习。

常见问题

什么是多说话人实时翻译?

多说话人实时翻译是一种实时系统,它一次完成两项工作:分离并标记对话中的每个声音,同时在大家还在说话时把每一轮发言翻译成你选择的语言,这样你就能在事情发生时看到是谁说了什么。

我可以在没有机器人的情况下翻译有多位说话人的会议吗?

可以。MirrorCaption 运行在你的浏览器标签页中,并在桌面版 Chrome 或 Microsoft Edge 里直接捕获会议音频,因此不会有机器人加入通话。它会在会议进行中标记每个声音并翻译每一轮发言,而且会议音频不会存储在服务器上。

说话人检测是如何区分不同声音的?

说话人检测会分离音频中的不同声音,并将它们标记为 Speaker 1、Speaker 2 等,你可以重命名这些标签。它在清晰音频和分开的麦克风条件下效果最好。严重的交叉说话或几乎相同的声音会让这项工作更难。

对方能听到翻译,而不只是看到文字吗?

可以。Speak Translations 可以按接近实时的节奏,用目标语言朗读你的译文,通过笔记本扬声器、配对的手机扬声器或 Mac 虚拟麦克风播放,这样交流就能继续推进,而不必等待会后转录稿。

多说话人实时翻译支持多少种语言?

MirrorCaption 提供 50+ 种可选语言,支持双向翻译,包括普通话、日语、韩语、西班牙语、法语、德语等。每一轮带标签的发言都会与译文并排显示,你还可以点按任意词查看原文。

结论

多说话人实时翻译是一项组合工作:标记每个声音、翻译每一轮发言,并且在对话仍在进行时同时完成这两件事。单纯翻译只能告诉你说了什么;加上说话人标签才能告诉你是谁说的,而这才是真正让你能够在当下回应、引用和决策的关键。

要实现这一点,请在 Chrome 或 Edge 中使用会议标签页音频,让说话人检测为声音加标签并重命名,然后把原文与译文并排阅读。当只看文字还不够时,开启 Speak Translations,让对方能听到信息并继续对话。至于音频比较杂乱的场景,请记住更干净的麦克风和不急不躁的轮流发言对所有工具都有帮助,我们的工具也不例外。

为每个声音加标签,为每一轮发言做翻译

从一个免费小时开始。无需信用卡、无需每月重置、无需安装。实时查看是谁说了什么,并以你的语言呈现。

Get Started Free