Проблема голосового ввода никогда не заключалась в том, что компьютеры вас не слышат. Они слышат вас нормально. Проблема в том, что они записывают ровно то, что вы сказали — а то, что люди говорят вслух в реальном времени, совсем не похоже на письменный текст.
Вы начинаете предложение, на середине понимаете, что оно не то, и начинаете заново. Вы говорите «э-э», пока думаете. Вы исправляете себя. Дословная расшифровка добросовестно сохраняет всё это и выдаёт вам абзац, который теперь нужно редактировать. Для многих людей это редактирование занимает столько же времени, сколько занял бы набор текста.
Это руководство о том, как сократить этот разрыв: что его вызывает, что не помогает и что помогает.
Ключевые выводы
- Разрыв носит структурный характер — в устной речи есть заполнители и перезапуски; в письменной речи их нет. Дословная расшифровка не может это преодолеть.
- Говорить осторожнее не помогает надолго, а ещё лишает вас преимущества в скорости, ради которого диктовка и кажется удобной.
- Слой очистки помогает — инструмент убирает заполнители и ложные старты ещё до того, как вы увидите текст.
- Очистка должна быть выбором, а не настройкой по умолчанию — иногда вам нужны буквальные слова, поэтому Raw, Tidy и Formal — это отдельные режимы.
- Пользовательский словарь важнее сырой точности для имён, жаргона и названий продуктов.
Почему дословная расшифровка создаёт лишнюю работу
Скажите это вслух в обычном темпе: «так, я думаю, нам стоит — вообще-то, можем мы перенести обсуждение дорожной карты, э-э, на четверг?»
Дословный транскрибатор запишет именно это. А вам нужно было: «Можем мы перенести обсуждение дорожной карты на четверг?»
Каждый продиктованный абзац содержит какую-то версию этого. Первое, что люди пытаются сделать, — говорить аккуратнее: медленнее, более обдуманно, без заполнителей. Это работает примерно две минуты, потом утомляет и убирает саму причину, по которой вы вообще начали диктовать: говорить быстрее, чем печатать.
Что не помогает
Лучшее распознавание речи. Улучшение точности делает расшифровку более верной вашей речи, а значит, проблема становится чуть хуже, а не лучше. Идеальный транскрибатор идеально сохраняет каждое «э-э».
Команды пунктуации. Произносить вслух «запятая» и «новый абзац» помогает со структурой, но ничего не делает с заполнителями и ложными стартами. К тому же это заставляет речь ощущаться как программирование.
Редактирование после. Это статус-кво, и именно из-за него люди тихо перестают пользоваться диктовкой уже через неделю.
Что помогает: слой очистки
Решение — вставить шаг между распознаванием и выводом. Инструмент слышит, что вы сказали, понимает, что вы имели в виду, и выдаёт письменную версию.
MirrorCaption Typer делает это с тремя режимами полировки, которые вы выбираете в зависимости от момента, потому что нужная степень очистки не всегда одна и та же:
- Raw speech — ровно то, что вы сказали, со всеми заполнителями и ложными стартами. Полезно, когда важны буквальные слова: цитаты, заметки о том, как кто-то что-то сформулировал, языковая практика.
- Tidy (по умолчанию) — убирает заполнители вроде «э-э» и «мм», удаляет оговорки и ложные старты, добавляет пунктуацию и сохраняет смысл и тон. Это режим, благодаря которому диктовка наконец ощущается так, как должна была ощущаться с самого начала.
- Formal — переписывает фрагмент в чистую, профессиональную формулировку, готовую вставить в письмо или документ. Он действительно меняет вашу формулировку, намеренно, поэтому его нужно включать отдельно.
Возьмём пример выше: Raw даст вам предложение с перезапуском и «э-э». Tidy даст «Можем мы перенести обсуждение дорожной карты на четверг?» Formal даст что-то ближе к «Можем ли мы перенести обсуждение дорожной карты на четверг?»
Вторая половина: как доставить текст туда, где он нужен
Чистый текст — это только половина дела. Если он попадает в приложение для транскрибации, вам всё равно придётся копировать его в то окно, где он действительно нужен.
Typer работает в небольшом окне, которое плавает поверх всего остального — вашего почтового клиента, документа, чата. Когда вы перестаёте говорить, отредактированный текст автоматически копируется в буфер обмена. Не нужно искать кнопку и не нужно переключаться в другое приложение. Вы вставляете текст — и всё готово.
Поскольку он работает в браузере, ничего устанавливать не нужно, а это важно на рабочих ноутбуках с управляемым доступом, где установка ПО означает создание заявки.
Имена, жаргон и слова, которые действительно ваши
Ошибки, которые переживают хороший слой очистки, обычно связаны с именами собственными: именами коллег, названиями продуктов, внутренним жаргоном, техническими терминами. Общая модель их никогда не видела.
Помогают две вещи. Во-первых, пользовательский словарь — вы добавляете термины, которыми пользуетесь, и они распознаются в первую очередь. Во-вторых, обучение на ваших правках: когда вы что-то исправляете, инструмент запоминает ваше предпочтение, а не заставляет вас исправлять это снова на следующей неделе.
Когда вы смешиваете языки
Многие люди не говорят на одном языке за раз. Китайскоговорящий человек вставляет английские названия продуктов. Немецкий инженер использует английские технические термины посреди предложения. Большинство инструментов диктовки заставляют выбрать один язык распознавания и переключать его вручную, из-за чего поток речи ломается настолько, что люди сдаются.
Typer позволяет задать сразу несколько языков распознавания, поэтому смешанное предложение получается точно, без переключения режимов. Если же ваша проблема в том, что другие люди говорят на языках, которых вы не знаете, это уже транскрибация и перевод, а не диктовка — см. диктовка vs. транскрибация, чтобы понять, на какой вы стороне.
Когда буквальный вариант — правильный ответ
Очистка нужна не всегда. Используйте режим Raw, когда вы цитируете кого-то, когда важна точная формулировка, когда вы практикуете язык и хотите видеть, что именно сказали, или когда вы фиксируете мысль в том виде, в каком она пришла. Смысл в том, что это выбор, а не единственный вариант.
Часто задаваемые вопросы
Как диктовать текст, который не нужно редактировать?
Используйте инструмент диктовки, который очищает текст по мере ввода, а не расшифровывает его дословно. Режим Tidy в MirrorCaption Typer убирает заполнители вроде «э-э» и «мм», удаляет ложные старты и оговорки, добавляет пунктуацию ещё до того, как текст попадёт в буфер обмена, так что вставка становится последним шагом, а не первым из нескольких.
Может ли голосовой ввод автоматически удалять «э-э» и «мм»?
Встроенные инструменты, такие как Apple Dictation, Windows Voice Typing и Google Docs Voice Typing, расшифровывают дословно, поэтому заполнители остаются. Инструменты со слоем очистки удаляют их автоматически. В MirrorCaption Typer это режим, который вы выбираете в зависимости от момента: Raw сохраняет всё, Tidy убирает заполнители и добавляет пунктуацию, Formal переписывает фрагмент в профессиональной формулировке.
Изменит ли очистка моей речи то, что я имел в виду?
Не должна. Режим Tidy создан для того, чтобы сохранять смысл и тон и убирать только шум — заполнители, перезапуски и оговорки. Режим Formal действительно переписывает формулировку, поэтому это отдельный режим, который вы выбираете, а не настройка по умолчанию.
Можно ли диктовать сразу на нескольких языках?
В большинстве инструментов — нет: вы выбираете язык распознавания и переключаете его при смене языка. MirrorCaption Typer позволяет задать сразу несколько языков распознавания, поэтому смешение китайского с английским или немецкого с английским в одном предложении всё равно распознаётся точно.
Как заставить голосовой ввод распознавать имена и жаргон?
Добавьте их в пользовательский словарь. Typer позволяет добавлять часто используемые имена, названия продуктов и жаргон, чтобы они распознавались в первую очередь, а также учится на исправлениях, которые вы вносите в его вывод, так что одна и та же ошибка не повторяется.
Работает ли голосовой ввод в приложениях, отличных от браузера?
Typer работает в небольшом окне браузера, которое плавает поверх других приложений и автоматически копирует готовый текст в буфер обмена, так что вы можете вставлять его в почту, документы, чат или любое другое приложение. Ничего устанавливать не нужно, а значит, и IT ничего не должен утверждать.
Итог
Голосовой ввод перестал быть проблемой точности уже довольно давно. Это проблема перевода — между тем, как люди говорят, и тем, как должен читаться текст, — а дословная расшифровка оставляет этот перевод на вас.
Инструменты, которые делают это за вас, превращают диктовку из того, что вы попробовали один раз, в то, чем пользуетесь каждый день. Сравните варианты в нашем руководстве по лучшему ПО для диктовки.
Говорите небрежно. Вставляйте чисто.
Typer убирает заполнители и ложные старты ещё до того, как текст попадёт в буфер обмена. 1 бесплатный час, без кредитной карты, ничего устанавливать не нужно.
Попробовать Typer бесплатно