Problem z pisaniem głosowym nigdy nie polegał na tym, że komputery cię nie słyszą. Słyszą cię dobrze. Problem w tym, że zapisują dokładnie to, co powiedziałeś — a to, co ludzie mówią na głos, w czasie rzeczywistym, nie wygląda jak tekst pisany.

Zaczynasz zdanie, w połowie uznajesz, że to było złe zdanie, i zaczynasz od nowa. Mówisz „yyy”, kiedy myślisz. Poprawiasz się. Dosłowna transkrypcja wiernie zachowuje to wszystko i oddaje ci akapit, który teraz musisz edytować. Dla wielu osób taka edycja zajmuje tyle samo czasu, co zajęłoby pisanie.

Ten przewodnik dotyczy zamknięcia tej luki: co ją powoduje, co jej nie naprawia i co działa.

Najważniejsze wnioski

Dlaczego dosłowna transkrypcja tworzy dodatkową pracę

Powiedz to na głos w normalnym tempie: „więc myślę, że powinniśmy — właściwie, czy możemy przesunąć przegląd roadmapy, yyy, na czwartek zamiast tego?”

Dosłowny transkrybent zapisze dokładnie to. To, co chciałeś powiedzieć, brzmiało: „Czy możemy przesunąć przegląd roadmapy na czwartek zamiast tego?”

Każdy dyktowany akapit niesie jakąś wersję tego problemu. Pierwszym odruchem jest mówienie ostrożniej — wolniej, bardziej świadomie, bez wypełniaczy. Działa to przez około dwie minuty, jest męczące i odbiera powód, dla którego zacząłeś dyktować: że mówienie jest szybsze niż pisanie.

Co tego nie naprawia

Lepiej rozpoznawanie mowy. Poprawa dokładności sprawia, że transkrypcja wierniej oddaje twoją mowę, co tylko trochę pogarsza problem, a nie go rozwiązuje. Idealny transkrybent perfekcyjnie zachowuje każde „yyy”.

Polecenia interpunkcyjne. Mówienie na głos „przecinek” i „nowy akapit” pomaga w strukturze, ale nic nie robi z wypełniaczami i fałszywymi startami. Sprawia też, że mówienie zaczyna przypominać programowanie.

Późniejsza edycja. To status quo i właśnie ono sprawia, że ludzie po tygodniu po cichu przestają używać dyktowania.

Co działa: warstwa czyszcząca

Rozwiązaniem jest wstawienie kroku między rozpoznawanie a wynik. Narzędzie słyszy to, co powiedziałeś, ustala, co miałeś na myśli, i daje ci wersję pisaną.

MirrorCaption Typer robi to za pomocą trzech trybów dopracowania, które wybierasz w danej chwili, ponieważ odpowiednia ilość czyszczenia nie zawsze jest taka sama:

Wracając do przykładu powyżej: Raw daje zdanie z ponownym rozpoczęciem i „yyy”. Tidy daje „Czy możemy przesunąć przegląd roadmapy na czwartek zamiast tego?” Formal daje coś bliższego „Czy moglibyśmy przesunąć przegląd roadmapy na czwartek?”

Druga połowa: dostarczenie tekstu tam, gdzie go potrzebujesz

Czysty tekst to tylko połowa zadania. Jeśli trafia do aplikacji do transkrypcji, nadal musisz skopiować go do okna, w którym naprawdę go chciałeś mieć.

Typer działa w małym oknie, które unosi się nad wszystkim innym — klientem poczty, dokumentem, oknem czatu. Gdy przestajesz mówić, dopracowany tekst jest automatycznie kopiowany do schowka. Nie ma przycisku, którego trzeba szukać, ani aplikacji, na którą trzeba się przełączać. Wklejasz i gotowe.

Ponieważ działa w przeglądarce, niczego nie trzeba instalować, co ma znaczenie na służbowych laptopach zarządzanych centralnie, gdzie instalacja oprogramowania oznacza zgłoszenie w systemie.

Nazwy, żargon i słowa, które naprawdę są twoje

Błędy, które przetrwają dobrą warstwę czyszczącą, to zwykle nazwy własne: nazwiska współpracowników, nazwy produktów, wewnętrzny żargon, terminy techniczne. Żaden ogólny model ich nie widział.

Pomagają dwie rzeczy. Po pierwsze, własny słownik — dodajesz używane przez siebie terminy, a one są rozpoznawane w pierwszej kolejności. Po drugie, uczenie się na podstawie twoich poprawek: gdy coś poprawisz, narzędzie zapamiętuje twoją preferencję zamiast kazać ci naprawiać to znowu w przyszłym tygodniu.

Gdy mieszasz języki

Wiele osób nie mówi jednym językiem naraz. Osoba mówiąca po chińsku wtrąca angielskie nazwy produktów. Niemiecki inżynier używa angielskich terminów technicznych w środku zdania. Większość narzędzi do dyktowania zmusza do wybrania jednego języka rozpoznawania i ręcznego przełączania, co tak bardzo psuje płynność, że ludzie się poddają.

Typer pozwala ustawić kilka języków rozpoznawania jednocześnie, dzięki czemu mieszane zdanie wychodzi dokładnie bez przełączania trybów. Jeśli twoim problemem jest raczej to, że inni ludzie mówią w językach, których nie znasz, to jest to transkrypcja i tłumaczenie, a nie dyktowanie — zobacz dyktowanie a transkrypcja, aby sprawdzić, po której stronie jesteś.

Kiedy dosłowność jest właściwą odpowiedzią

Czyszczenie nie zawsze jest tym, czego chcesz. Użyj trybu Raw, gdy cytujesz kogoś, gdy dokładne brzmienie ma znaczenie, gdy ćwiczysz język i chcesz zobaczyć, co naprawdę powiedziałeś, albo gdy zapisujesz myśl w takiej formie, w jakiej przyszła. Chodzi o to, że jest to wybór, a nie jedyna opcja.

Często zadawane pytania

Jak dyktować tekst, który nie wymaga edycji?

Użyj narzędzia do dyktowania, które czyści tekst w trakcie pisania, zamiast transkrybować dosłownie. Tryb Tidy w MirrorCaption Typer usuwa wypełniacze takie jak „yyy” i „eee”, usuwa fałszywe starty i przejęzyczenia oraz dodaje interpunkcję, zanim tekst trafi do schowka, więc wklejanie jest ostatnim krokiem, a nie pierwszym z kilku.

Czy pisanie głosowe może automatycznie usuwać yyy i eee?

Wbudowane narzędzia, takie jak Apple Dictation, Windows Voice Typing i Google Docs Voice Typing, transkrybują dosłownie, więc wypełniacze zostają. Narzędzia z warstwą czyszczącą usuwają je automatycznie. W MirrorCaption Typer jest to tryb wybierany w danej chwili: Raw zachowuje wszystko, Tidy usuwa wypełniacze i dodaje interpunkcję, Formal przepisuje fragment na profesjonalne brzmienie.

Czy czyszczenie mojej mowy zmieni to, co miałem na myśli?

Nie powinno. Tryb Tidy został zaprojektowany tak, aby zachować znaczenie i ton oraz usuwać tylko szum — wypełniacze, ponowne starty i przejęzyczenia. Tryb Formal celowo przepisuje sformułowanie, dlatego jest osobnym trybem, który wybierasz, a nie ustawieniem domyślnym.

Czy mogę dyktować w więcej niż jednym języku naraz?

W większości narzędzi nie — wybierasz jeden język rozpoznawania i przełączasz się, gdy zmieniasz język. MirrorCaption Typer pozwala ustawić kilka języków rozpoznawania jednocześnie, więc mieszanie chińskiego z angielskim albo niemieckiego z angielskim w jednym zdaniu nadal wychodzi dokładnie.

Jak sprawić, by pisanie głosowe rozpoznawało nazwy i żargon?

Dodaj je do własnego słownika. Typer pozwala dodawać często używane nazwy, terminy produktowe i żargon, aby były rozpoznawane w pierwszej kolejności, a także uczy się na podstawie poprawek, które wprowadzasz do jego wyników, więc ten sam błąd się nie powtarza.

Czy pisanie głosowe działa w aplikacjach innych niż przeglądarka?

Typer działa w małym oknie przeglądarki, które unosi się nad innymi aplikacjami i automatycznie kopiuje gotowy tekst do schowka, więc możesz wkleić go do e-maila, dokumentów, czatu lub dowolnej innej aplikacji. Niczego nie trzeba instalować, co oznacza też, że IT nie ma czego zatwierdzać.

Najważniejszy wniosek

Pisanie głosowe przestało być problemem dokładności już jakiś czas temu. To problem tłumaczenia — między tym, jak ludzie mówią, a tym, jak tekst powinien wyglądać — a dosłowna transkrypcja zostawia to tłumaczenie tobie.

Narzędzia, które robią to za ciebie, zamieniają dyktowanie z czegoś, co próbowałeś raz, w coś, z czego korzystasz codziennie. Porównaj opcje w naszym przewodniku po najlepszym oprogramowaniu do dyktowania.

Mów chaotycznie. Wklejaj czysto.

Typer usuwa wypełniacze i fałszywe starty, zanim tekst trafi do schowka. 1 darmowa godzina, bez karty kredytowej, nic do instalacji.

Wypróbuj Typer za darmo