MirrorCaption bietet Forschenden Live-Transkription und Übersetzung während des Interviews selbst — mit über 50 auswählbaren Sprachen, ohne serverseitige Audioaufzeichnung durch MirrorCaption, zu einem einmaligen Preis von €49 (Lifetime-Plan, 200 Stunden inklusive). Viele Transkriptions-Workflows in der Forschung gehen davon aus, dass man zuerst aufzeichnet und später analysiert. MirrorCaption geht davon aus, dass Sie noch im Raum sind.

Wenn Sie 30 Interviews in einer qualitativen Studie hinter sich haben, ist das Letzte, was Sie brauchen, darauf zu warten, dass die heutige Aufnahme fertig verarbeitet ist, nur um festzustellen, dass Sie eine Nachfassfrage verpasst haben. Stellen Sie sich eine Soziologie-Doktorandin in Berlin vor, die einen vietnamesischen Einwanderer zu Wohnungsdienstleistungen interviewt: Eine mehrdeutige Antwort rahmt die Forschungsfrage neu, aber die Forschende merkt das erst, wenn das Transkript am nächsten Morgen eintrifft.

Transkription in Echtzeit beschleunigt nicht nur Ihren Workflow. Sie verändert, wie Sie interviewen.

🏫 Zentrale Erkenntnisse

Warum Live-Transkription Forschungsinterviews verändert

Die meisten Transkriptionstools gehen von derselben Annahme aus: Sie zeichnen auf, sie transkribieren, Sie lesen. Die Lücke zwischen Aufnahme und Transkript misst sich bei KI-Diensten in Minuten und bei menschlichen in Stunden. Für ein Debriefing nach dem Meeting ist diese Verzögerung in Ordnung.

Forschungsinterviews sind anders.

Die wertvollsten Nachfassfragen entstehen in den ersten zehn Sekunden, nachdem eine teilnehmende Person etwas Unerwartetes gesagt hat. Eine Pause, eine Neuformulierung, eine Einladung, tiefer einzusteigen — diese Momente existieren nur im Raum, solange das Gespräch noch live ist. Sobald Sie die Aufnahme statt die Person beobachten, haben Sie den Hinweis bereits verpasst.

Das Problem des Hochladens und Wartens ist praktisch, nicht theoretisch. Manuelle Transkription kann mehrere Stunden pro Stunde Audio dauern, und uploadbasierte KI-Dienste erfordern weiterhin, dass das Interview endet, bevor die Verarbeitung beginnt. MirrorCaption stellt jedes Wort dar, sobald es gesprochen wird, mit unter 500 ms End-to-End-Latenz, sodass Sie lesen, was Ihre teilnehmende Person sagt, während sie es noch sagt.

Bei mehrsprachigen Interviews ist noch mehr auf dem Spiel. Wenn Ihre teilnehmende Person auf Türkisch antwortet und Sie Deutsch sprechen, bedeutet das Warten auf eine Übersetzung nach der Sitzung, dass Sie mit unvollständigem Verständnis bereits zur nächsten Frage übergegangen sind. Mit Live-Übersetzung parallel zum Quelltranskript erfassen Sie die Nuance, bevor die nächste Frage überhaupt aus Ihrem Mund kommt.

Das ist kein Geschwindigkeitsmerkmal. Das ist ein Gesprächsmerkmal.

Wie MirrorCaption für die Forschung funktioniert

MirrorCaption läuft vollständig in Ihrem Browser. Nichts zu installieren, keine Chrome-Erweiterung, und kein Bot tritt dem Meeting bei. Es passt zu drei gängigen Forschungs-Workflows:

💻

Online-Interviews

Der Meet-Modus in Desktop-Chrome oder Edge erfasst den Audio-Stream des Meeting-Tabs von Zoom, Teams oder Google Meet, ohne dass ein Bot dem Anruf beitritt.

📷

Feldforschung vor Ort

Der Talk-Modus auf dem Mobilgerät nutzt das Mikrofon Ihres Telefons. Mit Einwilligung legen Sie es auf den Tisch zwischen sich und Ihrer teilnehmenden Person — kein Laptop oder dediziertes Aufnahmegerät erforderlich.

📋

Fokusgruppen

Die automatische Sprechererkennung erstellt Erstlabels für unterschiedliche Stimmen. Benennen Sie Sprecher 1, Sprecher 2 nach der Sitzung in Teilnehmendencodes (P1, P2) um.

🌎

Mehrsprachige Studien

Stellen Sie Quellsprache und Zielsprache unabhängig voneinander ein. Beide erscheinen in Echtzeit nebeneinander — Vietnamesisch links, Deutsch rechts, während die teilnehmende Person spricht.

Online-Interviews (Zoom, Teams, Google Meet)

Öffnen Sie MirrorCaption in Desktop-Chrome oder Microsoft Edge neben Ihrem Videoanruf. Der Meet-Modus erfasst den Audio-Stream des Meeting-Tabs direkt aus Ihrem Browser — er tritt niemals als Teilnehmer dem Anruf bei, sodass Ihre interviewte Person keinen zusätzlichen Anwesenden sieht und keine Benachrichtigung erhält. Die automatische Sprechererkennung kennzeichnet Beiträge automatisch.

Die Nebeneinanderansicht zeigt die Originalsprache links und Ihre gewählte Übersetzung rechts. Für eine englischsprachige Forschende, die über Zoom eine mandarinsprachige teilnehmende Person interviewt, erscheinen beide Streams gleichzeitig, während das Gespräch stattfindet. Tippen Sie auf ein beliebiges übersetztes Wort, um das Quellwort anzuzeigen, aus dem es stammt — nützlich, um zu prüfen, ob ein kulturell aufgeladener Begriff oder eine höfliche Abschwächung wie erwartet wiedergegeben wurde. Dies ist derselbe Echtzeit-Ansatz, der auch von mehrsprachigen Remote-Teams verwendet wird, angewendet auf ein Einzelinterview.

Feldforschung vor Ort

Nicht alle Forschung findet per Videoanruf statt. Ethnografische Feldforschung, partizipative Forschung mit der Community und Interviews in den Wohnungen der Teilnehmenden finden oft ohne Videoplattform oder vollständiges Laptop-Setup statt.

Nutzen Sie den Talk-Modus: Öffnen Sie MirrorCaption in Chrome auf Ihrem Telefon, legen Sie den Transkriptions-Workflow gemäß Ihrem Protokoll offen, platzieren Sie das Telefon auf dem Tisch und wählen Sie beide Sprachen aus. Das Telefonmikrofon erfasst beide Sprecher; Transkript und Übersetzung erscheinen in Echtzeit auf dem Bildschirm. Ein Laptop oder ein dediziertes Aufnahmegerät ist nicht erforderlich.

Für Forschung, bei der Aufnahmegeräte die Offenheit der Teilnehmenden beeinflussen — traumasensible Arbeit, nicht dokumentierte Bevölkerungsgruppen, sensible Gesundheitsthemen — kann sich ein telefonbasierter Workflow weniger invasiv anfühlen als ein dediziertes Aufnahmegerät, solange Einwilligung und Hinweis ordnungsgemäß gehandhabt werden. Audio wird für die Echtzeit-Spracherkennung übertragen und nicht als serverseitige Aufnahme bei MirrorCaption gespeichert. Das Transkript bleibt standardmäßig in Ihrem Browser. MirrorCaption wird ähnlich von Journalistinnen und Journalisten genutzt, die bei Quelleninterviews Diskretion benötigen — die Datenschutzarchitektur ist dieselbe.

Fokusgruppen und Interviews mit mehreren Sprechern

Die automatische Sprechererkennung funktioniert als Erstfassung über mehrere Stimmen hinweg. MirrorCaption vergibt Sprecherlabels, die Sie nach der Sitzung in Teilnehmendencodes umbenennen können. Bei einer Fokusgruppe mit sechs Teilnehmenden sollten Sie die Labels als Ausgangspunkt behandeln und sie mit Ihren Feldnotizen abgleichen.

Hinweis: Die Genauigkeit der Sprechererkennung sinkt in lauten Räumen oder wenn Teilnehmende gleichzeitig sprechen. Behandeln Sie automatische Labels als Erstfassung und gleichen Sie sie bei Projekten mit hoher Relevanz mit den Sitzungsnotizen ab.

Starten Sie mit 1 kostenloser Stunde — keine Kreditkarte, kein monatlicher Reset. Sehen Sie, wie Live-Transkription Ihr nächstes Forschungsinterview verändert.

MirrorCaption kostenlos testen

Datenschutz, Ethikkommissionen und Datenmanagement

Wenn Ihre Forschung Menschen als Teilnehmende einbezieht, hat Ihre Ethikkommission oder Ihr IRB mit ziemlicher Sicherheit gefragt, wie mit Teilnahmedaten umgegangen wird. KI-Transkriptionstools werfen eine spezifische Frage auf: Wohin gehen die Audiodaten, wer verarbeitet sie, und wie lange werden sie aufbewahrt?

Hier ist die technische Antwort für MirrorCaption, so formuliert, dass Sie sie direkt in einen Datenmanagementplan oder eine IRB-Einreichung aufnehmen können:

"Audio wird in Echtzeit vom Browser der Forschenden an den Anbieter des Spracherkennungsdienstes von MirrorCaption zur Transkription und Übersetzung übertragen. MirrorCaption erstellt oder speichert keine serverseitige Audioaufzeichnung. Der Transkripttext wird im Browser der Forschenden gespeichert (IndexedDB-Lokalspeicher), sofern die Forschenden ihn nicht exportieren oder optionale cloudgestützte Funktionen wie Zusammenfassungen nutzen. Die Forschenden kontrollieren das Löschen lokaler Transkriptdaten. MirrorCaption erfasst Nutzungsmetadaten wie verbrauchte Minuten für Kontingent und Abrechnung, nicht den Gesprächsinhalt."

Was das in der Praxis bedeutet:

Das Qualitative Data Repository der Syracuse University bietet Leitlinien zum Umgang mit sensiblen qualitativen Daten, einschließlich der Frage, wie Forschungsartefakte getrennt, beschrieben und geschützt werden können. Für Fragen zu KI-Tools und Forschungsethik ist die Ethikrichtlinie der American Anthropological Association eine nützliche Referenz für Feldforschungskontexte.

Ob diese Architektur Ihre spezifische IRB-Anforderung erfüllt, hängt von Ihrer Institution, Rechtsordnung, Einwilligungsformulierung und Studiendesign ab. Geben Sie Ihrer institutionellen Forschungsstelle die obige technische Beschreibung, statt eine Genehmigung vorauszusetzen.

Mehrsprachige Forschung — Wo die meisten Tools an ihre Grenzen stoßen

Mehrsprachige Forschung ist keine Nische. Migrationsforschung, Diaspora-Interviews, interkulturelle Ethnografie, globale Gesundheitsforschung und internationale Politikwissenschaft umfassen regelmäßig Forschende und Teilnehmende, die keine gemeinsame Erstsprache haben. Die meisten Transkriptionstools behandeln das als Sonderfall.

Die Standard-Umgehungslösung — in Sprache A aufzeichnen, durch einen einsprachigen Transkriptionsdienst laufen lassen, einen Übersetzer beauftragen, warten — fügt jedem Interviewzyklus Tage hinzu und führt eine zweite Fehlerquelle ein: den Übersetzer, der nicht im Raum war, der das Zögern vor einer Schlüsselphrase nicht gehört hat, der Intonation nicht gegen den Kontext abwägen kann.

MirrorCaption handhabt das anders: über 50 auswählbare Sprachen mit Live-Ausgabe nebeneinander. Sie wählen die Quellsprache (was Ihre teilnehmende Person spricht) und die Zielsprache (was Sie lesen). Beide erscheinen gleichzeitig auf dem Bildschirm, Wort für Wort, während die teilnehmende Person spricht.

Sprachpaare, die in der qualitativen Forschung häufig vorkommen:

Jedes Wort in der Übersetzung ist mit dem Quellwort verknüpft, aus dem es stammt. Tippen Sie auf ein beliebiges übersetztes Wort, um das Original anzuzeigen — nützlich, um zu prüfen, ob ein kulturell sensibler Begriff, ein Höflichkeitsmarker oder eine bewusste Abschwächung wie beabsichtigt wiedergegeben wurde, statt durch automatische Übersetzung geglättet zu werden. Unser Leitfaden zur mehrsprachigen Transkription behandelt die breitere Tool-Landschaft für internationale und sprachübergreifende Forschung.

Was Forschungstranskription tatsächlich kostet

Die Preisgestaltung pro Minute summiert sich in einer Studie schnell. Hier ist, was eine Studie mit 40 Interviews (je eine Stunde pro Interview, insgesamt 40 Stunden Audio) bei den am häufigsten verwendeten Tools kostet:

Tool Preisgestaltung Kosten für 40 Stunden Echtzeit? Am besten geeignet für
Sonix $10/Stunde nach Verbrauch $400 Nein für den Upload-Workflow Batch-Transkription und Untertitel nach der Aufnahme
Happy Scribe $17/Monat Basic; zusätzliche Credits zu $0.20/Min Abhängig vom Plan; 40 zusätzliche Stunden zum Aufladepreis kosten $480 Nein für den Upload-Workflow Untertitel, Dateitranskription und Review-Workflows
Otter.ai Pro $16.99/Nutzer/Monat Pro Hängt von Studiendauer und monatlichen Minutenlimits ab Englisch-zentrierter Meeting-Workflow Meeting-Notizen, Zusammenfassungen und Zusammenarbeit
MirrorCaption Lifetime €49 einmalig (200h inklusive) €49 gesamt Ja, über 50 Sprachen Live mehrsprachige Interviews und lokal-first Transkripte

Für eine Doktorandin oder einen Doktoranden, die bzw. der eine Dissertation abschließt, ist die Rechnung direkt. Eine typische qualitative Dissertation kann 20–40 Interviews umfassen. Bei $10 pro Stunde kosten 30 Interviews à eine Stunde $300, bevor irgendeine Überprüfungs- oder Übersetzungsarbeit anfällt. MirrorCaption Lifetime kostet €49 für 200 inklusive Stunden.

Für aktive Forschende, die aufeinanderfolgende Studien durchführen, decken die 200 enthaltenen Lifetime-Stunden den Großteil des Bedarfs ab. Voice Pack-Aufladungen (5 Stunden für €2.99, 15 Stunden für €7.99) erweitern die Kapazität auf €0.53–0.60 pro Stunde — weit unter den Stundensätzen der oben genannten uploadbasierten Tools.

Export- und Analyse-Workflow

Nach dem Interview exportiert MirrorCaption in zwei Formaten:

Die Suche in der App ermöglicht es Ihnen, nach Stichworten zu scannen oder zu Segmenten nach Sprecherlabel zu springen, ohne zu exportieren. Für die thematische Analyse werden so Muster über eine lange Sitzung hinweg sichtbar, ohne die gesamte Aufnahme erneut anzusehen. Sie können auch einzelne Gesprächsausschnitte in ein Forschungsmemo kopieren.

Ehrliche Einschränkung: MirrorCaption hat Stand 2026 keine direkte API-Integration mit NVivo, ATLAS.ti oder MAXQDA. Der Workflow lautet: als Klartext exportieren, als Dokument in QDA-Software importieren, wie gewohnt codieren. Das kostet im Vergleich zu einer nativen Integration etwa fünf Minuten pro Interview zusätzlich.

Wenn ein nativer QDA-Import eine harte Anforderung ist, exportiert Sonix als DOCX mit NVivo-Unterstützung — zu $10 pro Stunde, nur Upload, ohne Echtzeit-Transkription oder Live-Übersetzung. Unser Leitfaden Echtzeit- vs. Nach-Meeting-Transkription behandelt diese Abwägungen ausführlicher.

Häufig gestellte Fragen

Ist KI-Transkription für akademische Forschung genau genug?

Das hängt von Audioqualität, Sprecherüberlappung, Akzenten, Terminologie und der Art der Analyse ab. Für thematische Analyse, Grounded Theory oder narrative Forschung kann KI-Ausgabe ein nützlicher erster Entwurf sein. Bei mehrsprachigen Interviews fügt die Übersetzung eine zweite Ebene der Annäherung hinzu. Für wortgetreue Diskursanalyse, Gesprächsanalyse oder Zitate mit hoher Relevanz sollten Sie KI-Ausgabe als Entwurf behandeln, der menschliche Überprüfung benötigt. Für einen Benchmark-Kontext zur Übersetzungsgenauigkeit siehe unsere Aufschlüsselung der Echtzeit-Übersetzungsgenauigkeit.

Erfüllt MirrorCaption die Anforderungen von IRB oder Ethikkommission?

Die Architektur von MirrorCaption ist darauf ausgelegt, die Datenexposition zu minimieren: Live-Audio wird für die Spracherkennung übertragen, keine serverseitige Audioaufzeichnung wird von MirrorCaption gespeichert, und Transkripte leben standardmäßig lokal in Ihrem Browser. Ob dies Ihr spezifisches IRB erfüllt, hängt von Ihrer Institution und Ihrem Studiendesign ab — das können wir nicht für Sie entscheiden. Verwenden Sie die technische Beschreibung im Datenschutzabschnitt oben als Grundlage für Ihren Datenmanagementplan und wenden Sie sich für formale Hinweise an Ihre institutionelle Forschungsstelle.

Kann ich Interviews in anderen Sprachen als Englisch transkribieren?

Ja. MirrorCaption unterstützt über 50 auswählbare Sprachen, darunter Mandarin, Vietnamesisch, Arabisch, Türkisch, Hindi, Japanisch, Koreanisch, Russisch, Portugiesisch, Spanisch, Französisch und Deutsch. Sie stellen Quellsprache (die Sprache Ihrer teilnehmenden Person) und Zielsprache (das, was Sie lesen) unabhängig voneinander ein. Beide erscheinen gleichzeitig auf dem Bildschirm, während die teilnehmende Person spricht.

Funktioniert MirrorCaption für persönliche Interviews vor Ort?

Ja. Der Talk-Modus nutzt das Mikrofon Ihres Telefons in Chrome auf dem Mobilgerät. Mit Einwilligung der teilnehmenden Person legen Sie das Telefon auf den Tisch zwischen sich und Ihrer teilnehmenden Person, wählen das relevante Sprachpaar aus, und die Transkription beginnt sofort. Zoom oder ein Laptop sind nicht erforderlich.

Worin unterscheidet sich MirrorCaption für Forschung von Otter.ai?

Otter.ai ist in erster Linie ein Meeting-Assistent für englischsprachige Workflows. Der Pro-Plan ist mit $16.99/Nutzer/Monat angegeben, und seine Stärken liegen in Meeting-Notizen, Zusammenfassungen, Suche und Zusammenarbeit. MirrorCaption konzentriert sich auf über 50 auswählbare Sprachen mit Live-Übersetzung nebeneinander, einen €49 Lifetime-Plan, standardmäßig lokale Transkripte und keinen Bot, der dem Anruf beitritt. Für mehrsprachige oder datenschutzsensible Forschung sind die Unterschiede erheblich. Für englischsprachige Anwendungsfälle mit CRM-Integrationen siehe unseren vollständigen Vergleich MirrorCaption vs Otter.ai.

Kann ich MirrorCaption ohne Zoom- oder Teams-Konto verwenden?

Ja. Der Talk-Modus funktioniert vollständig über das Mikrofon Ihres Telefons — keine Videokonferenzplattform erforderlich. Für Online-Interviews funktioniert MirrorCaption mit jedem browserbasierten Meeting-Tool (Zoom, Teams, Google Meet, Webex), das in Desktop-Chrome oder Edge läuft. Sie benötigen weder ein bestimmtes Tarifniveau noch ein Premium-Konto bei einer dieser Plattformen.

Bereit für Ihr nächstes Forschungsinterview?

Starten Sie mit 1 kostenloser Stunde. Keine Kreditkarte. Kein monatlicher Reset. Keine Installation.

Kostenlos mit dem Transkribieren beginnen

Forschung schreitet in Gesprächen voran. Jede verpasste Nachfassfrage, jedes Transkript, das erst eintrifft, nachdem Sie bereits die nächste Sitzung geplant haben, jedes mehrsprachige Interview, das durch einen Übersetzer rekonstruiert wird, der nicht im Raum war — das sind Kosten, die sich über eine Studie hinweg summieren.

MirrorCaption verändert nicht, wie qualitative Forschung funktioniert. Es gibt Ihnen den Moment des Interviews zurück: über 50 auswählbare Sprachen, live während des Anrufs, keine serverseitige Audioaufzeichnung, €49 einmalig. Kostenlos starten — 1 Stunde, keine Kreditkarte.