A több beszélős élő fordítás egyszerre két feladatot végez: megjelöli a teremben hallható minden hangot, és minden megszólalást lefordít az Ön nyelvére, miközben az emberek még beszélnek. A MirrorCaption mindkettőt a böngészőben kezeli, 50+ választható nyelven, úgy, hogy nem csatlakozik bot a híváshoz. Látja, ki mit mondott, éppen akkor, amikor elhangzik, nem tíz perccel az értekezlet vége után.

Képzeljen el egy négyfős hívást. Egy londoni, angolul beszélő PM, egy sanghaji fejlesztő mandarinul, egy tokiói ügyfél japánul, és egy tervező, aki kettőjük között váltogat. Mindenki beszél. Az átirat egy háromnyelvű, névtelen szövegfal. Tudja, hogy valami fontos elhangzott, de nem tudja, ki mondta, vagy pontosan mire gondolt.

Ez az a rés, amelyet ez az útmutató bezár. A beszélőcímkék nélküli fordítás megmondja, mit mondtak. A több beszélős élő fordítás megmondja, ki mondta, az Ön nyelvén, valós időben. Az alábbiakban áttekintjük, mi ez, miért fontosak a címkék, hogyan működik a MirrorCaptionben, hol ütközik valódi korlátokba a technológia, és hogyan futtatható platformokon át, bot nélkül.

Fő tanulságok

Mi az a több beszélős élő fordítás?

A több beszélős élő fordítás egy valós idejű rendszer, amely elkülöníti és megjelöli a beszélgetés minden hangját, és minden megszólalást az Ön által választott nyelvre fordít, miközben az emberek még beszélnek. Két feladatot, a beszélőfelismerést és a fordítást, egyetlen élő folyamattá egyesít, így egy többnyelvű, több résztvevős beszélgetést annak történése közben követhet.

A legtöbb eszköz csak az egyik felét végzi jól. A platformos feliratok fordítanak, de ritkán rendelik egyértelműen a megszólalásokat a különböző nyelvek között. A fejlesztői átíróeszközök elkülönítik a hangokat, de feltöltött felvételeken, először angolul, utólag dolgoznak. Az együttes feladat, címkék plusz fordítás plusz hívás közben, az a rész, amelyet szinte senki nem old meg. Ha szélesebb képet szeretne a kategóriáról, a legjobb valós idejű értekezletfordító eszközökről szóló összefoglalónk lefedi a teljes mezőt.

Beszélőcímkék vs. beszélődiarizáció

Két kifejezést gyakran lazán használnak. A beszélődiarizáció az a technikai folyamat, amely az audiót aszerint tagolja, hogy „ki mikor beszélt”, ahogyan azt a NIST Rich Transcription értékelései is leírják. A beszélőcímkék a felhasználó számára látható eredmény: azok a címkék, amelyeket ténylegesen olvas, például Speaker 1 és Speaker 2, és amelyeket átnevezhet „Priya” vagy „Kenji” névre.

A diarizáció a motor. A címkék a műszerfal. Egy értekezletnél Önnek a műszerfal számít: egy tiszta, olvasható nyilvántartás minden megszólalásról, hozzárendelve és lefordítva. A beszélőazonosság hozzáadása a feliratokhoz az akadálymentesítés szempontjából is bevált gyakorlat, ahogyan a W3C feliratokra vonatkozó útmutatója is megjegyzi azoknál a nézőknél, akik nem tudnak pusztán a hang alapján különbséget tenni az emberek között.

Miért fontosak a beszélőcímkék, amikor egy értekezletet fordít?

Egy egynyelvű értekezleten gyakran saját maga is meg tudja különböztetni a hangokat. Egy többnyelvűnél már eleve a fordítások olvasására fordít energiát, ezért a hozzárendelés az első dolog, ami kicsúszik. Pont ekkor a legfontosabb.

A címkék három dolgot változtatnak meg. Először is, a döntéshozatalt: ha tudja, ki emelt kifogást, tudja, kinek az aggályát kell kezelni, és mekkora súlya van. Másodszor, a kereshető nyilvántartásokat: egy ki-mit-mondott átiratban azonnal a „mindent, amit az ügyfél a határidőkről mondott” részhez ugorhat. Harmadszor, a tiszta átadásokat: a határokon átnyúló értékesítési és jogi csapatoknak szó szerinti, hozzárendelt idézetekre van szükségük, nem egy elmosódott parafrázisra.

Szeretné látni a címkézett, lefordított megszólalásokat a saját hívásában? Próbálja ki ingyen a MirrorCaptiont, egy órán át, bankkártya nélkül, telepítés nélkül.

Mi a gond a névtelen, lefordított átiratokkal?

Íme, miért vall kudarcot a gyakorlatban egy címke nélküli átirat. Tegyük fel, hogy a 2. beszélő mandarinul azt mondja, hogy az ár aggasztó, miközben a 3. beszélő éppen befejez egy angol mondatot az ütemtervről. Egy lapos átiratban ez a két sor egymásra csúszik, és az ár miatti aggodalom úgy tűnik, mintha attól származna, aki a dátumokról beszélt.

Címkékkel ugyanaz a pillanat tisztán olvasható:

Speaker 2 (中文): 这个价格我们还要再商量。
Fordítás: Ezt az árat még meg kell beszélnünk.
Speaker 3 (English): Right, and the timeline works for our Q4 launch.

Most az ár miatti aggodalom egyértelműen ahhoz a személyhez van rendelve, aki felvetette, és a megfelelő kérdésre a megfelelő embernek tud válaszolni. Itt a hozzárendelés nem udvariassági kérdés. Megváltoztatja, mit mond a következő pillanatban.

Hogyan működik a több beszélős élő fordítás a MirrorCaptionben?

A MirrorCaption webalkalmazásként fut, így nincs telepítendő kliens és nincs jóváhagyandó értekezleti bot. A több beszélős hívás folyamata rövid:

  1. Nyissa meg a MirrorCaptiont asztali Chrome-ban vagy Microsoft Edge-ben, és indítsa el a Meet módot.
  2. Ossza meg az értekezletfület, hogy a MirrorCaption rögzítse a hívás hangját (plusz a saját mikrofonját).
  3. A beszélőfelismerés elkülöníti a hangokat, és Speaker 1, Speaker 2, Speaker 3 címkéket ad nekik.
  4. Minden megszólalás az eredeti szöveggel együtt jelenik meg az Ön által választott nyelvre fordítva.
  5. Nevezze át a beszélőket valódi nevekre, majd keressen, exportáljon vagy foglalja össze az átiratot.

Automatikus beszélőfelismerés (Speaker 1, Speaker 2, átnevezés)

Az élő átírási réteg azonosítja a különböző hangokat, és automatikusan címkézi őket. Előre nem kell senkit megjelölnie. Amikor felismer egy hangot, kattintson a címkére, és nevezze át; a név az egész átiratra érvényes lesz. Innentől kezdve az adott személy minden megszólalása a nevéhez lesz rendelve.

Egymás mellett az eredeti és a fordítás, beszélőnként

A MirrorCaption az eredeti szöveget és a fordítást együtt tartja, ahelyett hogy az egyiket a másikkal helyettesítené, így a finom árnyalatok soha nem vesznek el. Vegyük a klasszikus kétnyelvű példát: egy japán ügyfél azt mondja, hogy 「ちょっと難しいです」. A szó szerinti fordítás „egy kicsit nehéz”, ami nyelvileg helyes, üzletileg pedig finom nem. Mivel a forrás a fordítás mellett látható, bármelyik szóra rákoppinthat, hogy lássa az eredetit, és pontosan értelmezze a helyzetet. Arról, mennyire hűek ezek az átültetések, lásd a mennyire pontos a valós idejű fordítás című magyarázatunkat.

Opcionális Speak Translations, válaszoljon hangosan nyelvek között

Az olvasás nem mindig elég. A Speak Translations segítségével a MirrorCaption közel valós idejű időzítéssel felolvashatja az Ön lefordított beszédét a célnyelven. Beszéljen angolul, és a másik oldal japánul hallja; beszéljen mandarinul, és ők angolul hallják. A hang lejátszható a laptop hangszóróján, egy párosított telefonhangszórón, vagy Mac kliensen egy virtuális mikrofonon keresztül, amely továbbítja a Zoomba, a Meetbe vagy a Teamsbe. Így a címkézett átirat valódi oda-vissza beszélgetéssé válik, ahol mindkét fél a saját nyelvén folytatja a beszédet.

Készen áll arra, hogy egy valódi többnyelvű hívásban tesztelje a különbséget? Indítsa el ingyen, és címkézze fel az első értekezletét percek alatt.

Hol válik nehézzé a beszélőfelismerés? (Őszinte korlátok)

Egyetlen élő rendszer sem választja szét tökéletesen a hangokat zajos hanganyagon, és nem lenne őszinte ennek az ellenkezőjét állítani. Néhány helyzet valóban nehéz.

Áthallás. Amikor két ember egyszerre beszél, a hangok átfedik egymást, és a megszólalások közötti határ elmosódik. A címke késhet vagy összeolvadhat, amíg az egyik hang ki nem tisztul.

Szinte azonos hangok. Két, hasonló hangmagasságú és akcentusú beszélő ugyanazon a mikrofonon nehezen különíthető el, szoftvernek és néha embereknek is.

Gyenge mikrofonbeállítások. Egyetlen laptopmikrofon, amely egy egész konferenciatermet vesz fel, kevesebb információt ad a detektornak, mint a külön eszközök.

Ami a gyakorlatban segít: hagyja, hogy a megszólalások leérkezzenek, ne szakítsa félbe őket; használjon külön mikrofonokat, ahol lehet; és támaszkodjon a tiszta értekezletfül-audióra a teremmikrofon helyett. Ezek ugyanazok a feltételek, amelyek bármely eszköz pontosságát javítják, ahogyan a többnyelvű átírási útmutatónk részletesebben is bemutatja.

Több beszélős fordítás platformokon át, bot nélkül

Mivel a MirrorCaption böngészőhangot rögzít ahelyett, hogy csatlakozna az értekezlethez, együtt működik azzal az eszközzel, amelyet a házigazda már kiválasztott. Asztali Chrome-ban vagy Edge-ben a Meet mód rögzíti az értekezletfület a böngészőalapú Zoom-, Microsoft Teams-, Google Meet- és Webex-hívásokhoz. Senkinek sem kell botot beengednie, és az értekezlet hangja nem kerül tárolásra a szerveren, csak az a transzkriptum, amelyet Ön helyben elment.

Személyes, több résztvevős beszélgetéshez a Talk mód telefonon egyetlen folyamatos munkamenetként fut. Egyszer indítja el, és hagyja, hogy az emberek felváltva beszéljenek; ez nem push-to-talk, és nem indul újra minden mondat után. Ez alkalmassá teszi egy asztal körüli kerekasztalra, nem csak egy-egy kifejezés gyors keresésére.

Így hasonlítanak össze a gyakori megközelítések a hangok megjelölésének és a megszólalások élő fordításának konkrét feladatára:

Megközelítés Beszélőcímkék Élő fordítás Hívás közben Bot nélkül Nyelvek
Platformba épített feliratok (Zoom, Teams, Meet) Platformonként változó Gyakran csomagszinthez kötött Igen, feliratokban Beépített, de az adott platformhoz kötött A szolgáltató és a csomag határozza meg
STT / diarizációs API-k (fejlesztői eszközök) Igen, erős Szolgáltatótól függ Élő vagy utófeldolgozott, a megvalósítástól függően N/A, kódot igényel Szolgáltatótól és modelltől függ
MirrorCaption Igen, automatikus és átnevezhető Igen, egymás mellett Igen, ahogy elhangzik Igen, böngészőfül-rögzítéssel 50+ választható

A lényeg nem az, hogy a többi eszköz rossz. A platformos feliratok kényelmesek a saját falain belül, a diarizációs API-k pedig kiválóak egyedi folyamatok építéséhez. A MirrorCaption azt a konkrét rést tölti be, ahol címkézett, lefordított megszólalásokra van szükség, élőben, bármely böngészőalapú eszközön, amelyet a csapata használ.

Valós helyzetek, ahol valóban megéri

Az alábbiak szemléltető munkafolyamatok, nem ügyfél-visszajelzések.

A többnyelvű all-hands. Képzeljen el egy elosztott csapatot, ahol Maria São Paulóban, Wei Sencsenben és Anna Berlinben mind csatlakoznak egy napi standuphoz. Ahelyett, hogy mindenkit angolra kényszerítenének, mindenki a saját nyelvén olvassa az értekezletet, minden megszólalás hozzárendelve. A későn csatlakozók megnyitják a futó összefoglalót, és egy olvasással felzárkóznak. Ez a valós idejű fordítás távoli csapatoknak mindennapi esete.

A határokon átnyúló tárgyalás. Képzeljen el egy beszállítói hívást, ahol a szállítói oldalon két ember mandarinul, a vevői oldalon pedig két ember angolul beszél. Amikor a 2. beszélő szállítási kockázatra hívja fel a figyelmet, miközben az 1. beszélő még a feltételekről beszél, a címkék külön tartják a két szálat, így a vevő a megfelelő személynek válaszol a kockázatra, ahelyett hogy elbeszélne mellette.

A többnyelvű tanterem. Gondoljon egy online szemináriumra, ahol egy koreaiul beszélő hallgató kérdez egy angol nyelvű előadás közben. A címkézett, lefordított átirat lehetővé teszi az oktató számára, hogy lássa, ki mit kérdezett, és pontosan válaszoljon, a hallgató pedig később tanuláshoz használható, egymás melletti jegyzőkönyvet kap.

Gyakran ismételt kérdések

Mi az a több beszélős élő fordítás?

A több beszélős élő fordítás egy valós idejű rendszer, amely egyszerre két feladatot végez: elkülöníti és megjelöli a beszélgetés minden hangját, és minden megszólalást az Ön által választott nyelvre fordít, miközben az emberek még beszélnek, így láthatja, ki mit mondott, ahogy történik.

Le tudok fordítani egy több beszélős értekezletet bot nélkül?

Igen. A MirrorCaption a böngészőfülben fut, és közvetlenül rögzíti az értekezlet hangját asztali Chrome-ban vagy Microsoft Edge-ben, így nem csatlakozik bot a híváshoz. Minden hangot címkéz, és minden megszólalást az értekezlet alatt fordít, és az értekezlet hangja nem kerül tárolásra a szerveren.

Hogyan különbözteti meg a beszélőfelismerés a hangokat?

A beszélőfelismerés elkülöníti a különböző hangokat az audióban, és Speaker 1, Speaker 2 és így tovább címkéket ad nekik, amelyeket átnevezhet. A legjobban tiszta hanggal és külön mikrofonokkal működik. Az erős áthallás vagy a szinte azonos hangok megnehezítik a feladatot.

A másik oldal nemcsak olvasni, hanem hallani is tudja a fordítást?

Igen. A Speak Translations közel valós idejű időzítéssel felolvashatja az Ön lefordított beszédét a célnyelven, a laptop hangszóróján, egy párosított telefonhangszórón vagy a Mac virtuális mikrofonon keresztül, így a beszélgetés nem áll meg a megbeszélés utáni átiratra várva.

Hány nyelvet támogat a több beszélős élő fordítás?

A MirrorCaption 50+ választható nyelvet kínál, kétirányúan, többek között mandarin, japán, koreai, spanyol, francia, német és még sok más nyelvet. Minden címkézett megszólalás egymás mellett jelenik meg a fordításával, és bármelyik szóra rákoppinthat, hogy lássa az eredetit.

A lényeg

A több beszélős élő fordítás az egyesített feladat: minden hangot megjelölni, minden megszólalást lefordítani, és mindezt akkor, amikor a beszélgetés még zajlik. A puszta fordítás megmondja, mit mondtak. A beszélőcímkék hozzáadása megmondja, ki mondta, és ez az, ami valójában lehetővé teszi, hogy azonnal reagáljon, idézzen és döntsön.

Ehhez használja a Chrome vagy Edge értekezletfül-audióját, hagyja, hogy a beszélőfelismerés címkézze a hangokat, nevezze át őket, és olvassa az eredetit a fordítás mellett. Amikor az olvasás nem elég, kapcsolja be a Speak Translations funkciót, hogy a másik oldal hallhassa az üzenetet és folytathassa a beszélgetést. És ahol a hanganyag zavaros, ne feledje, hogy a tisztább mikrofonok és a nyugodtabb megszólalások minden eszköznek segítenek, a miénknek is.

Jelölje meg minden hangot, fordítson le minden megszólalást

Kezdje egy ingyenes órával. Nincs bankkártya, nincs havi megújítás, nincs telepítés. Lássa, ki mit mondott, élőben, az Ön nyelvén.

Get Started Free