语音输入的问题从来不是电脑听不见你。它们听得很清楚。问题在于它们会把你说的每一个字原封不动写下来——而人们在实时开口说出来的话,并不像书面文字那样。
你开始说一句话,说到一半又觉得不对,于是重来一遍。你思考的时候会说“呃”。你会自我纠正。逐字转写会忠实保留这一切,然后把一段你现在还得自己编辑的文字交给你。对很多人来说,这种编辑花的时间和打字差不多。
本指南要解决的就是这个差距:它是怎么产生的,什么办法解决不了,以及什么办法真的有用。
关键要点
- 这个差距是结构性的——口语里有填充词和重启;书面语没有。逐字转写无法弥合这一点。
- 更小心地说话并不管用,而且坚持不了多久,还会让你失去让口述输入变得有吸引力的速度优势。
- 清理层确实有用——工具会在你看到文本之前去掉填充词和错误开头。
- 清理应该是可选项,而不是默认项——有时你就是想要原话,所以 Raw、Tidy 和 Formal 是分开的模式。
- 自定义词汇比原始准确率更重要,尤其是对姓名、行话和产品术语而言。
为什么逐字转写会制造额外工作
用正常语速大声说这句话:“所以我觉得我们应该——其实,我们能不能把路线图评审推迟到周四,呃?”
逐字转写器会一字不差地写下来。你真正想要的是:“我们能不能把路线图评审推迟到周四?”
每一段口述内容都会带着某种这样的痕迹。人们最先想到的补救办法是更小心地说——更慢、更刻意、不加填充词。它大概能管两分钟,然后你就累了,而且它还会抹掉你开始口述的原因:说话比打字快。
什么办法解决不了
更好的语音识别。 准确率提升只会让转写更忠实于你的说话内容,这反而会让问题稍微更严重,而不是更好。一个完美的转写器会完美保留每一个“呃”。
标点命令。 大声说“逗号”和“新段落”有助于结构,但对填充词和错误开头毫无作用。它还会让说话感觉像在编程。
之后再编辑。 这就是现状,也正是为什么很多人会在一周后悄悄停止使用口述输入。
真正有效的办法:清理层
解决办法是在识别和输出之间加一步。工具先听你说了什么,判断你真正想表达什么,然后给你书面版本。
MirrorCaption Typer 通过三种润色模式来实现这一点,你可以按需选择,因为合适的清理程度并不是每次都一样:
- Raw speech——完全照你说的来,保留每一个填充词和错误开头。适合原话很重要的时候:引用、记录别人怎么说的、语言练习。
- Tidy(默认)——去掉“呃”“嗯”之类的填充词,删掉口误和错误开头,补上标点,并保留你的意思和语气。这就是让口述输入终于像它本该有的样子的模式。
- Formal——把内容改写成干净、专业的措辞,随时可以直接放进邮件或文档里。它确实会有意改变你的表达,所以它是可选开启的。
以上面的例子来说:Raw 会给你带着重启和“呃”的那句话。Tidy 会给你 “我们能不能把路线图评审推迟到周四?” Formal 会给你更接近 “我们能否将路线图评审改到周四?” 的版本。
另一半:把文本送到你需要的地方
干净的文本只完成了一半工作。如果它落在一个转写应用里,你还是得把它复制到你真正想用的窗口中。
Typer 运行在一个悬浮在其他所有窗口之上的小窗口里——你的邮件客户端、文档、聊天框都可以。你一停止说话,润色后的文本就会自动复制到剪贴板。你不用找按钮,也不用切换应用。直接粘贴,就完成了。
因为它运行在浏览器里,所以无需安装,这一点在受管控的工作笔记本上尤其重要,因为安装软件通常意味着要提交工单。
姓名、行话,以及真正属于你的词
即使有了很好的清理层,仍然会留下来的错误通常都是专有名词:同事姓名、产品名称、内部行话、技术术语。没有通用模型见过这些词。
有两件事能帮上忙。第一,自定义词汇——把你常用的术语加进去,它们会优先被识别。第二,从你的修改中学习:当你纠正某个词时,工具会记住你的偏好,而不是下周又让你再改一遍。
当你混用多种语言时
很多人并不是一次只说一种语言。中文使用者会夹入英文产品名。德国工程师会在句子中间使用英文技术术语。大多数口述工具会强迫你选择一种识别语言并手动切换,这会严重打断流畅度,最后让人放弃。
Typer 允许你同时设置多种识别语言,因此混合句子也能准确输出,而不需要切换模式。如果你的问题是别人说的是你不懂的语言,那这属于转写和翻译,而不是口述输入——请看 口述输入 vs. 转写,看看你属于哪一边。
什么时候逐字才是正确答案
清理并不总是你想要的。当你在引用别人原话、当精确措辞本身就是重点、当你在练习一门语言并想看看自己到底说了什么,或者当你想把一个念头按它出现时的形状记录下来时,就用 Raw 模式。关键在于,它是一个选择,而不是唯一选项。
常见问题
我该如何口述出不需要编辑的文本?
使用一种在输入时就会清理内容,而不是逐字转写的口述工具。MirrorCaption Typer 的 Tidy 模式会去掉“呃”“嗯”之类的填充词,删掉错误开头和口误,并在文本进入剪贴板之前补上标点,这样粘贴就是最后一步,而不是一连串步骤中的第一步。
语音输入能自动去掉呃和嗯吗?
Apple Dictation、Windows Voice Typing 和 Google Docs Voice Typing 等内置工具会逐字转写,所以填充词会保留下来。带清理层的工具会自动去掉它们。在 MirrorCaption Typer 中,这是你按需选择的模式:Raw 保留全部内容,Tidy 去掉填充词并添加标点,Formal 会把内容改写成专业措辞。
清理我的口语会改变我的意思吗?
不应该。Tidy 模式的设计目标是保留你的意思和语气,只去掉噪音——填充词、重启和口误。Formal 模式则会有意改写措辞,这也是它作为单独模式供你选择,而不是默认项的原因。
我能同时用多种语言口述吗?
大多数工具不行——你要先选一种识别语言,换语言时再切换。MirrorCaption Typer 允许你同时设置多种识别语言,因此在一句话里混用中文和英文,或者德语和英文,也能准确输出。
我该如何让语音输入识别姓名和行话?
把它们加入自定义词汇。Typer 允许你添加常用的姓名、产品术语和行话,让它们优先被识别,而且它会从你对输出结果所做的更正中学习,因此同样的错误不会反复出现。
语音输入在浏览器以外的应用里也能用吗?
Typer 运行在一个悬浮于其他应用之上的小型浏览器窗口中,并会自动把完成的文本复制到剪贴板,因此你可以粘贴到邮件、文档、聊天或任何其他应用里。无需安装,这也意味着不需要 IT 审批。
结论
语音输入在很久以前就不再是准确率问题了。它是一个翻译问题——在“人们怎么说”和“文字应该怎么读”之间的翻译问题——而逐字转写把这项翻译工作留给了你。
替你完成这一步的工具,会把口述输入从一次尝试变成你每天都会用的东西。请在我们的 最佳口述输入软件指南 中比较这些选项。