Tools voor realtime vertaling van vergaderingen behalen 85–95% nauwkeurigheid van spraak naar tekst bij heldere Engelse audio, en zakken naar 65–80% bij meertalige gesprekken met achtergrondgeluid. Vertaling voegt een tweede variabele toe: EN-ES- en EN-FR-paren halen op moderne LLM-pipelines ongeveer 88–92%; EN-ZH en EN-JA dalen naar 75–82%. Dit is wat die cijfers in de praktijk betekenen, en hoe vier toonaangevende tools zich tot elkaar verhouden.
Drie minuten in het gesprek zegt je klant in Tokio 「ちょっと難しいです」. Het onderschrift leest: "Een beetje moeilijk." Je knikt en gaat door naar de volgende slide. Zesenveertig minuten later ontdek je dat ze bedoelden: "Dit gaat voor ons niet werken." Geen vertaalfout. Gewoon een contextfout die een beter nauwkeurigheidsmodel had kunnen opvangen. Dáár gaat dit artikel over.
Nauwkeurigheidsclaims zijn overal. Geverifieerde, vergaderingsspecifieke benchmarks die de volledige pipeline dekken, van spraak naar tekst tot vertaling, zijn er bijna niet. We hebben een tweetalig EN+ZH-zakelijk gesprek van 30 minuten door vier grote tools gehaald en de resultaten gecombineerd met openbare data uit WMT 2024 en de CHiME-6 challenge-dataset. Dit vonden we.
- Realtime STT-nauwkeurigheid: 85–95% bij heldere spraak; 65–80% bij typische vergaderaudio met ruis of accenten.
- EN-ZH- en EN-JA-vertaalnauwkeurigheid blijft over alle tools heen 10–15% achter op EN-ES/FR door structurele taalkundige verschillen.
- Streaming-systemen ruilen ongeveer 3–8% nauwkeurigheid in voor sub-seconde latency, meestal de juiste afweging wanneer beslissingen live worden genomen.
- Het vorige 3–5 gespreksegmenten meegeven aan elke vertaalopdracht verbetert de nauwkeurigheid van domeinwoordenschat met ~15–20%.
- "Meest nauwkeurig" is de verkeerde vraag. "Nauwkeurig genoeg, snel genoeg om op te handelen" is de juiste.
Hoe realtime vertaalnauwkeurigheid wordt gemeten
Word Error Rate: de STT-benchmark
Word Error Rate (WER) meet het percentage woorden dat een spraakherkenningssysteem fout heeft. Een WER van 5% in een zin van 100 woorden betekent dat 5 woorden onjuist, vervangen of ontbrekend waren. Topsystemen halen 5–8% WER op heldere, gecontroleerde audio. Vergaderaudio is lastiger.
Achtergrondgeluid, meerdere sprekers, laptopmicrofoons en niet-moedertaalaccenten duwen WER in echte vergadersituaties consequent naar 15–25%, volgens de resultaten van de CHiME-6 challenge op natuurlijk voorkomende vergaderdata. Dat is het verschil tussen "keur het budget goed" en "bewijs de bult", fouten die downstream-vertaling vervolgens overneemt.
Streaming STT voegt nog een laag toe. Realtime systemen leggen voorlopige woordtokens vast voordat de zin compleet is, en herzien die vervolgens zodra er meer audio binnenkomt. Die woord-voor-woord zelfcorrectie is wat streaming snel laat aanvoelen, maar het betekent ook dat het onderschrift op seconde 2 kan verschillen van het onderschrift op seconde 4. De definitief vastgelegde tekst is wat nauwkeurigheidsbenchmarks meten; de live weergave is waarop je vergadering draait.
BLEU-scores en kwaliteit van machinevertaling
BLEU (Bilingual Evaluation Understudy)-scores meten hoe dicht machinevertaling bij een menselijke referentie komt. Scores lopen van 0 tot 100. Alles boven 50 wordt als sterk beschouwd; de meeste enterprise MT-systemen scoren 40–60 op gangbare taalparen bij WMT 2024.
EN-ES en EN-FR halen op moderne LLM-pipelines consistent 52–60 BLEU. EN-ZH en EN-JA zitten op 35–48, niet omdat AI-vertaling slechter is, maar omdat structurele verschillen (woordvolgorde, geen spaties tussen tekens, contextafhankelijke betekenis) ervoor zorgen dat geautomatiseerde scoring geldige vertalingen afstraft die niet woord voor woord overeenkomen met de referentie.
Voor realtime gebruik is één nuance belangrijk: BLEU wordt op documentniveau berekend. Streamingvertaling werkt met zinsfragmenten, soms met losse woorden. De effectieve kwaliteit op zinsniveau ligt 10–15 punten lager dan documentbenchmarks suggereren. Wat in een lab goed scoort, worstelt vaak in de vierde minuut van een snelle salescall.
Het pipeline-probleem waar niemand over praat
Vergadervertaling bestaat uit twee stappen: spraak naar tekst, daarna tekst naar vertaling. Fouten in stap één werken door in stap twee. Een WER van 10% betekent grofweg dat één op de tien woorden fout is. Wanneer dat verkeerde woord een naam, een getal of een ontkenning is, verandert "niet goedgekeurd" in "goedgekeurd"; de vertaling neemt de fout over en versterkt die vaak nog.
Wij schatten dat een STT-WER van 10% kan leiden tot 20–30% semantische degradatie in de vertaaloutput voor zakelijke woordenschat, omdat het MT-model niet kan weten dat het bronwoord fout was. Daarom mist benchmarken van STT en MT afzonderlijk de kern. Het cijfer dat ertoe doet, is de gecombineerde pipelinekwaliteit op echte vergaderaudio.
Wil je pipeline-nauwkeurigheid in actie zien? MirrorCaption biedt 2 gratis uur, geen creditcard vereist.
Probeer het in je volgende gesprek5 factoren die realtime vertaalnauwkeurigheid beïnvloeden
1. Audiokwaliteit en achtergrondgeluid
Achtergrondgeluid is de grootste afzonderlijke factor voor nauwkeurigheid, nog meer dan de keuze van de STT-engine. In onze tests verhoogde overschakelen van een USB-headset naar een ingebouwde laptopmicrofoon in een stille ruimte de WER met 5–8 procentpunten. Het toevoegen van typisch open-kantoor-achtergrondgeluid duwde dat naar 15–20 punten boven de basislijn.
Speakerphones in vergaderruimtes zijn bijzonder uitdagend. Geluid kaatst tegen muren, meerdere sprekers overlappen elkaar en de microfoon staat ver van elke stem. WER in deze omstandigheden komt routinematig boven de 25% uit, zelfs bij de sterkste STT-engines. Een USB-headset van €30 doet meer voor nauwkeurigheid dan upgraden naar een premium tool op een slechte microfoon.
2. Spreektempo en accent
Snelle sprekers, boven 180 woorden per minuut, zetten streaming STT onder druk omdat de buffer segmenten niet kan afronden voordat de volgende golf binnenkomt. De nauwkeurigheid bij snelle spraak daalt 5–10% ten opzichte van een normaal gesprekstempo. 15–20% langzamer spreken op kritieke momenten is de eenvoudigste nauwkeurigheidsverbetering die geen softwarewijziging vereist.
Engels met accent laat een genuanceerder patroon zien. Grote STT-systemen zijn de afgelopen twee jaar aanzienlijk verbeterd op veelvoorkomende niet-moedertaalaccenten. Onze streaming STT presteert bijzonder goed op Engels met Aziatisch accent vergeleken met Whisper, wat relevant is voor MirrorCaption's primaire use case van EN-ZH- en EN-JA-vergaderingen. Zware regionale accenten en taalwisselingen midden in een zin blijven voor alle systemen lastiger.
3. Moeilijkheid van het taalpaar
Niet alle taalparen zijn even moeilijk om realtime te vertalen:
- Makkelijke paren (EN-ES, EN-FR, EN-DE, EN-PT): ~88–92% op GPT-4-pipelines. Gedeelde woordstammen, vergelijkbare zinsstructuur, veel trainingsdata.
- Gemiddelde paren (EN-RU, EN-AR, EN-HI): ~80–86%. Andere schriftsystemen of woordvolgorde creëren ambiguïteit; minder trainingsdata voor zakelijke woordenschat.
- Moeilijke paren (EN-ZH, EN-JA, EN-KO): ~75–82%. Logografische of agglutinerende schriftsystemen, geen spaties tussen woorden, rijke beleefdheidssystemen en structurele verschillen die volledige zinscontext vereisen om correct te worden opgelost.
Realtime systemen worden zwaarder afgestraft bij moeilijke paren omdat ze vertalingen vastleggen met gedeeltelijke context, werkend vanuit een zinsfragment en niet vanuit een volledige uiting. Hier is het streaming-vs-batchverschil het grootst.
4. De afweging tussen streaming en batch
Tools na de vergadering, zoals Otter.ai, verwerken complete audio met volledige zinscontext nadat het gesprek is afgelopen. Daarom haalt Otter 90–95% nauwkeurigheid op helder Engels: het wacht op alles voordat het iets vastlegt. Realtime streamingtools leggen binnen 500 ms vast. Dat is de afweging, en het is een echte.
Maar kijk eens naar het alternatief. Priya leidt grensoverschrijdende salescalls tussen haar team in Mumbai en Japanse enterprise-klanten. Na een bijzonder verwarrend gesprek begon ze een transcriptietool na de vergadering te gebruiken. Die gaf haar een nette samenvatting van precies wat er al mis was gegaan. De prijsbezwaren die ze had gemist, stonden in het transcript op minuut 12. Ze las ze op minuut 75, nadat het gesprek al voorbij was.
Een transcript met 92% nauwkeurigheid dat pas na het gesprek arriveert, helpt je niet om op minuut 12 op een prijsbezwaar te reageren. Een onderschrift met 84% nauwkeurigheid dat verschijnt terwijl de spreker nog praat, wel. Nauwkeurigheid is niet de primaire maatstaf voor live beslissingen. Timing is dat wel.
5. Context meegeven en domeinwoordenschat
Algemene LLM-vertaalmodellen hebben moeite met technische zakelijke woordenschat, productnamen, financiële termen en regelgevende formuleringen. "Strike" betekent iets anders in baseball, arbeidsrecht en bowlen; de context bepaalt welke betekenis geldt. Vertaling van één enkele zin kiest vaak automatisch de meest voorkomende weergave en zit dan fout.
MirrorCaption geeft de vorige 3–5 gespreksegmenten mee aan elke vertaalopdracht. Dat contextvenster laat het model weten of je het hebt over "een deal sluiten" in een salescontext of over "staking" in een arbeidscontext. Onze interne tests laten zien dat deze aanpak de nauwkeurigheid van domeinwoordenschat met ~15–20% verbetert vergeleken met vertaling van één enkele zin op dezelfde audio. Context meegeven is vooral belangrijk bij code-switching: het moment waarop een spreker midden in het gesprek van de ene taal naar de andere overschakelt, is precies waar contextloze MT het snelst instort.
Benchmarking van de belangrijkste realtime vertaaltools in 2026
| Tool | Realtime vertaling? | EN→ES-kwaliteit | EN→ZH-kwaliteit | End-to-end latency | Werkt op |
|---|---|---|---|---|---|
| MirrorCaption Streaming STT + GPT-4 |
Ja | ~88% | ~80–85% | <500ms | Elke browser |
| Zoom AI Companion | Ja (5 paren) | ~89% | ~75–79% | 2–5s | Alleen Zoom |
| Google Meet Live Translation | Ja | ~88% | ~76–80% | 1–3s | Alleen Google Meet |
| Otter.ai | Nee, alleen na de vergadering | N.v.t. | N.v.t. | Na de vergadering | Zoom/Meet/Teams |
Vertaalkwaliteit = gecombineerde STT+MT-pipeline op audio van zakelijke vergaderingen. Bronnen: WMT 2024 shared task-resultaten, CHiME-6 challenge-data, praktijktests. Otter's STT-nauwkeurigheid op helder Engels (na verwerking) is ~90–95%; de N.v.t. weerspiegelt het ontbreken van realtime vertaling, niet de STT-kwaliteit.
Zoom AI Companion
Zoom AI Companion biedt live vertaling voor een beperkte set taalparen, ongeveer vijf combinaties waaronder EN-ES, EN-FR, EN-JA en EN-ZH. STT-nauwkeurigheid op helder Engels is concurrerend, rond 86–90% in onze tests. De vertaalkwaliteit voor EN-ES was degelijk, rond 89%. EN-ZH daalde op zakelijke woordenschat, vooral op eigennamen en productnamen die inconsistent voorkwamen.
De harde beperking is platform lock-in. Zoom AI Companion werkt alleen binnen Zoom. Als je gesprekspartner Teams gebruikt, of als je een face-to-face gesprek met een klant voert, heb je een andere tool nodig. Vertaling vereist ook specifieke betaalde abonnementsniveaus; het is niet beschikbaar op de basislicentie.
Google Meet Live Translation
De live vertaling van Google Meet is snel, gratis binnen Google Workspace en sterk op gangbare Europese taalparen. EN-ES- en EN-FR-kwaliteit in onze tests lag rond 88%. EN-ZH kwam uit op 76–80% voor algemene zakelijke zinnen, en zakte verder op technische woordenschat en eigennamen. Google's model kiest standaard de meest voorkomende weergave van dubbelzinnige zinnen, wat problemen oplevert wanneer een bedrijfsnaam of productterm botst met een gangbaar Mandarijns woord.
De belangrijkste beperking is dat ondertitels vluchtig zijn. Er is geen exporteerbaar transcript, geen sprekerstoewijzing en geen AI-samenvatting. Wat drie minuten geleden in het ondertitelvenster stond, is weg. Als je wilt terugzoeken wat er is gezegd, een zin wilt opzoeken of het verslag wilt delen met een collega die niet in het gesprek zat, kan Google Meet je niet helpen.
Otter.ai
Otter.ai's Engelse STT-nauwkeurigheid na de vergadering is uitstekend, 90–95% op heldere audio, de beste van deze lijst, omdat het wacht op de volledige opname voordat het iets vastlegt. De kwaliteit is zichtbaar. Otter's transcripts zijn verzorgd en leesbaar op een manier die realtime streaming-output niet is.
Maar Otter biedt geen realtime vertaling. Vertaling is een add-on die na de vergadering draait en een vertaalde versie van het Engelse transcript oplevert. Voor een interne samenvatting in het Engels is Otter uitstekend. Voor een tweetalige vergadering waarin je moet reageren op wat er nú wordt gezegd, helpt het niet. Zie de volledige MirrorCaption vs. Otter.ai-vergelijking voor een gedetailleerde featurevergelijking.
MirrorCaption (Streaming STT + GPT-4)
MirrorCaption's pipeline gebruikt onze WebSocket-streaming STT voor transcriptie en GPT-4 voor vertaling, waarbij de vorige 3–5 gespreksegmenten per opdracht als context worden meegegeven. End-to-end latency is minder dan 500 ms. Output woord voor woord verschijnt terwijl de spreker nog praat; voorlopige tokens corrigeren zichzelf zodra er meer context binnenkomt.
STT-nauwkeurigheid in onze test was ~88–92% op heldere Engelse audio. Op de gemengde-accent EN+ZH-segmenten daalde dat naar ~78–84%. EN-ZH-vertaalkwaliteit op zakelijke woordenschat: ~80–85%, lager dan benchmarks voor losse zinnen bij EN-ES, maar hoger voor meerturnige zakelijke context waarin eerdere segmenten belangrijk zijn. De eerlijke beperking: voor taalparen met weinig bronnen buiten de grote 60+ ondersteunde talen heeft GPT-gestuurde vertaling niet de gespecialiseerde domeintraining die onze STT aan de audiokant wel dekt.
Voer je tweetalige vergaderingen? Zie hoe MirrorCaption omgaat met de taalparen die voor je team belangrijk zijn.
Start 2 gratis uurWaarom Aziatische taalparen een andere aanpak nodig hebben
Hiroshi leidt een engineeringteam in Tokio dat rapporteert aan een Amerikaanse productleider. Hun wekelijkse stand-up is in het Engels, Hiroshi's tweede taal, goed gesproken maar niet moedertaalachtig. Op een donderdag vroeg de Amerikaanse lead naar de tijdlijn van een featurelevering. Hiroshi antwoordde: "We can try to make that date." In de Japanse werkcultuur draagt deze uitdrukking een sterke impliciete twijfel. Het is een beleefde manier om "nee, waarschijnlijk niet" te zeggen. In de Engelse zakenwereld klinkt "we can try" juist voorzichtig optimistisch. De productleider markeerde de feature als toegezegd. Twee weken later miste het team de datum waarvan iedereen aan Hiroshi's kant al privé had afgesproken dat die onrealistisch was.
In dat gesprek faalde geen enkele vertaaltool. Het gesprek vond in het Engels plaats. Wat faalde, was de kloof tussen woorden en culturele register, en die kloof is het grootst bij Aziatische taalparen.
De structurele redenen zijn concreet. Japans en Chinees drukken betekenis uit via context, relatie en woordvolgorde op manieren die Europese talen niet doen. 「ちょっと難しいです」 bestaat uit drie tokens in het Japans, letterlijk "een beetje moeilijk", maar in een zakelijke onderhandeling signaleert het serieuze twijfel of een beleefde afwijzing. EN-ES-vertaling heeft dit probleem niet in dezelfde mate, omdat Spaans en Engels zinsstructuren en conventies voor directheid delen.
Voor meertalige remote teams die werken over Japans, Chinees of Koreaans heen, is de praktische conclusie deze: nauwkeurigheidspercentages voor Aziatische taalparen zullen altijd lager uitvallen dan voor Europese paren, ongeacht welke tool je gebruikt. Het verschil tussen tools zit niet alleen in het getal, maar in de vraag of het systeem genoeg gesprekscontext meegeeft om gevallen op te vangen waarin letterlijke vertaling misleidt.
Context meegeven helpt. Het lost niet elk cultureel registerverschil op. Voor onderhandelingen met hoge inzet in Aziatische markten: plan tijd in voor verduidelijking en overweeg AI-vertaling te combineren met een menselijke moderator die beide talen kent. De tool verwerkt de hoeveelheid; de mens vangt de nuance op die de tool mist.
5 manieren om je realtime vertaalnauwkeurigheid te verbeteren
- Gebruik een headset, niet je laptopmicrofoon. Dit is de verandering met de grootste impact. Een USB- of Bluetooth-headset dicht bij je mond vermindert omgevingsgeluid en elimineert de meeste echo-problemen. Daarmee daalt de WER met 5–15 procentpunten nog vóór softwarewijzigingen.
- Stel de brontaal expliciet in. Automatische detectie werkt in de meeste gevallen, maar kost extra verwerkingstijd en herkent soms de eerste seconden van een gesprek verkeerd. Door bij de start van de sessie EN of ZH in te stellen, voorkom je foutieve starts op kritieke vroege content.
- Begin met 60 seconden kalibratie-audio. Smalltalk vóór de agenda geeft de STT-engine tijd om zich aan te passen aan je stem, je ruimte en je netwerk. De transcriptiekwaliteit van de eerste 60 seconden van een sessie is consequent slechter dan de rest van het gesprek. Begin niet met je belangrijkste inhoud.
- Let op zelfcorrigerende woorden. In streamingmodus zie je soms dat een woord verschijnt en vervolgens verandert zodra er meer context binnenkomt. Als dat gebeurt, is de uiteindelijke versie betrouwbaarder; het systeem heeft genoeg signaal ontvangen om zijn eerste inschatting te herzien. Woorden die onveranderd blijven, zijn met hoge zekerheid vastgelegd.
- Voor EN-ZH- of EN-JA-gesprekken: plan tijd in voor verduidelijking. Reken op ~75–85% nauwkeurigheid voor deze paren en plan daar op in. Bouw op kritieke beslismomenten, prijzen, toezeggingen, scopewijzigingen, een bevestigingslus van 15 seconden in: "Laat me even bevestigen wat ik heb begrepen." Dat is sneller dan later een misverstand ontwarren.
Veelgestelde vragen
Hoe nauwkeurig is AI-vertaling in realtime?
Realtime AI-vertaling voor vergaderingen haalt 85–95% nauwkeurigheid van spraak naar tekst op heldere Engelse audio en 65–80% op vergaderaudio met achtergrondgeluid. Vertaling voegt een tweede variabele toe: EN-ES- en EN-FR-paren halen 88–92% op moderne LLM-pipelines; EN-ZH en EN-JA bereiken 75–82%. Deze cijfers vertegenwoordigen de volledige gecombineerde pipeline, niet geïsoleerde STT- of MT-benchmarks. Individuele vergaderomstandigheden, microfoonk kwaliteit, accent en spreektempo zijn net zo belangrijk als de tool zelf.
Is realtime vertaling even nauwkeurig als een menselijke tolk?
Nog niet. Professionele conferentietolken halen 95–98% nauwkeurigheid met volledige context, domeinvoorbereiding en culturele kennis. Realtime AI haalt 80–88% in optimale omstandigheden en 65–75% in lastige audio-omgevingen. De afweging zit in kosten en schaal: AI levert ondertitels binnen 500 ms voor een fractie van de kosten van een tolk en schaalt naar elk aantal gelijktijdige vergaderingen. Voor situaties met hoge inzet, juridische verhoren, diplomatieke onderhandelingen en grote conferenties blijven menselijke tolken sterker in nuance. Voor alledaagse zakelijke gesprekken met bekende deelnemers en voorspelbare woordenschat is AI meestal voldoende.
Welke tool is het nauwkeurigst voor Chinese of Japanse vergaderingen?
Voor EN-ZH en EN-JA presteren MirrorCaption (Streaming STT + GPT-4 met context meegeven) en Google Meet Live Translation vergelijkbaar op losse zinnen. MirrorCaption heeft een voordeel bij meerturnige gesprekken waarin eerdere context de vertaalkeuzes beïnvloedt. Zoom AI Companion ondersteunt Mandarijn, maar vereist een Enterprise-licentie en laat nauwkeurigheid dalen op technische woordenschat en eigennamen. Otter.ai biedt geen realtime EN-ZH- of EN-JA-vertaling, alleen verwerking na de vergadering. Controleer voor deze taalparen eerst de taalondersteuning voordat je de nauwkeurigheid beoordeelt.
Heeft realtime vertaling een grote invloed op latency?
Moderne streaming STT+LLM-pipelines leveren output binnen 500 ms end-to-end, snel genoeg om te lezen terwijl de spreker nog praat. Het toevoegen van LLM-vertaling aan een streaming STT-pipeline voegt ongeveer 50–200 ms toe boven op de transcriptielatency. In de praktijk is dat vrijwel niet merkbaar. Tools na de vergadering hebben geen latencybeperking, maar kunnen geen beslissingen tijdens het gesprek ondersteunen. De vraag is niet "maakt latency uit", maar "moet de beslissing tijdens het gesprek of erna worden genomen".
Wat is het verschil tussen realtime en transcriptienauwkeurigheid na de vergadering?
Tools na de vergadering verwerken de volledige audio met complete zinscontext en nabewerking, en halen 90–95% nauwkeurigheid op helder Engels. Realtime streamingtools verwerken audiofragmenten zodra ze binnenkomen, en halen 85–90% op heldere spraak en 65–80% op rumoerige vergaderaudio. Het verschil wordt aanzienlijk kleiner in gecontroleerde audio-omstandigheden: headset, stille ruimte, één spreker. Voor beslissingen die tijdens de vergadering moeten worden genomen, is 85% nauwkeurigheid nu beter dan 95% nauwkeurigheid op minuut 60. Lees meer over de beste vergadervertalers in 2026 als je een bredere toolvergelijking wilt.
De juiste vraag is niet "meest nauwkeurig"
Realtime vertaalnauwkeurigheid is een pipelinevraag, geen enkel getal. STT-nauwkeurigheid, vertaalkwaliteit, moeilijkheid van het taalpaar, context meegeven en latency beïnvloeden elkaar allemaal. Een tool die 95% scoort op een schone Engelse benchmark en 72% in een echte EN-ZH-salescall is voor jouw team geen tool met 95% nauwkeurigheid.
De tools die in de praktijk het best presteren, balanceren alle vier dimensies: snel genoeg om tijdens het gesprek te lezen, nauwkeurig genoeg om de bedoeling te vangen, eerlijk over de beperkingen en niet vastgezet op één platform. Voor realtime vergadervertaling die over taalparen en platforms heen werkt zonder meetingbot, is dat de basis waarop MirrorCaption is gebouwd.
Als je je huidige tool nog niet hebt getest op de taalparen die echt belangrijk zijn voor je vergaderingen, is dit het moment. Twee gratis uur per maand, geen creditcard vereist.
Test de nauwkeurigheid in je volgende gesprek
Elke maand 2 uur gratis. Elke browser, elk platform. Geen installatie, geen bot, geen creditcard.
Gratis aan de slag