الترجمة الحية متعددة المتحدثين تؤدي مهمتين في آن واحد: فهي تُعرِّف كل صوت في الغرفة وتترجم كل مداخلة إلى لغتك بينما لا يزال الناس يتحدثون. يتولى MirrorCaption المهمتين داخل المتصفح، بأكثر من 50 لغة قابلة للاختيار، من دون انضمام روبوت إلى المكالمة. سترى من قال ماذا أثناء قوله، لا بعد عشر دقائق من انتهاء الاجتماع.

تخيل مكالمة من أربعة أشخاص. مدير منتج يتحدث الإنجليزية في لندن، ومطور في شنغهاي يتحدث الماندرين، وعميل في طوكيو يتحدث اليابانية، ومصمم ينتقل بين اثنين منهم. الجميع يتحدث. نصك التفريغي عبارة عن جدار من النص غير المنسوب بثلاث لغات. أنت تعلم أن شيئًا مهمًا قيل، لكنك لا تعرف من قاله، ولا ما الذي قصده بالضبط.

هذه هي الفجوة التي يغلقها هذا الدليل. الترجمة من دون تسميات للمتحدثين تخبرك بما قيل. أما الترجمة الحية متعددة المتحدثين فتخبرك من قاله، بلغتك، وفي الوقت الفعلي. أدناه نغطي ماهيتها، ولماذا تهم التسميات، وكيف تعمل في MirrorCaption، وأين تواجه التقنية صعوبات حقيقية، وكيف تشغلها عبر المنصات من دون روبوت.

النقاط الرئيسية

ما هي الترجمة الحية متعددة المتحدثين؟

الترجمة الحية متعددة المتحدثين هي نظام يعمل في الوقت الفعلي يفصل كل صوت في المحادثة ويُسميه، ويترجم كل مداخلة إلى اللغة التي تختارها بينما لا يزال الناس يتحدثون. وهو يدمج مهمتين، هما تمييز المتحدث والترجمة، في بث حي واحد حتى تتمكن من متابعة محادثة متعددة اللغات ومتعددة الأشخاص كما تحدث.

تؤدي معظم الأدوات نصف المهمة فقط على نحو جيد. فالتسميات التوضيحية في المنصات تترجم لكنها نادرًا ما تنسب المداخلات بوضوح عبر اللغات. وأدوات النسخ للمطورين تفصل الأصوات لكنها تعمل على التسجيلات المرفوعة، وبالإنجليزية أولًا، وبعد وقوع الحدث. أما المهمة المجمعة، أي التسميات مع الترجمة أثناء المكالمة، فهي الجزء الذي لا يكاد أحد يحله. وإذا أردت رؤية أوسع للفئة، فإن جولتنا لأفضل أدوات أفضل مترجم اجتماعات فوري تغطي المجال كاملًا.

تسميات المتحدثين مقابل تمييز المتحدثين

سترى مصطلحين يُستخدمان بشكل غير دقيق. تمييز المتحدثين هو العملية التقنية لتقسيم الصوت بحسب "من تحدث ومتى"، وهي مهمة موصوفة في تقييمات Rich Transcription التابعة لـ NIST. أما تسميات المتحدثين فهي النتيجة الموجهة للمستخدم: العلامات التي تقرأها فعليًا، مثل Speaker 1 وSpeaker 2، والتي يمكنك إعادة تسميتها إلى "Priya" أو "Kenji".

التمييز هو المحرك. أما التسميات فهي لوحة القيادة. بالنسبة للاجتماع، ما يهمك هو لوحة القيادة: سجل نظيف ومقروء لكل مداخلة، منسوب ومترجم. كما أن إضافة هوية المتحدث إلى التسميات التوضيحية تُعد أيضًا من أفضل ممارسات الإتاحة، كما تشير إرشادات W3C حول التسميات التوضيحية للمشاهدين الذين لا يستطيعون الاعتماد على الصوت وحده لتمييز الأشخاص.

لماذا تهم تسميات المتحدثين عند ترجمة اجتماع؟

في اجتماع بلغة واحدة، يمكنك غالبًا تمييز الأصوات بنفسك. أما في اجتماع متعدد اللغات، فأنت تبذل جهدًا أصلًا في قراءة الترجمات، لذا تكون الإسنادية أول ما يتعثر. وهذا بالضبط هو الوقت الذي تصبح فيه أكثر أهمية.

تغيّر التسميات ثلاثة أشياء. أولًا، اتخاذ القرار: معرفة من أثار اعتراضًا تخبرك لمن يجب أن توجه القلق وكم الوزن الذي يحمله. ثانيًا، السجلات القابلة للبحث: يتيح لك النص التفريغي الذي يوضح من قال ماذا الانتقال إلى "كل ما قاله العميل عن الجداول الزمنية". ثالثًا، التسليمات النظيفة: تحتاج فرق المبيعات والقانون عبر الحدود إلى اقتباسات حرفية منسوبة، لا إلى صياغة مبهمة.

هل تريد رؤية المداخلات المترجمة والموسومة على مكالمتك أنت؟ جرّب MirrorCaption مجانًا، لمدة ساعة، من دون بطاقة ائتمان، ومن دون أي تثبيت.

مشكلة النصوص المترجمة غير المنسوبة

إليك لماذا يفشل النص غير الموسوم عمليًا. لنفترض أن Speaker 2، وهو يتحدث الماندرين، يقول إن السعر يمثل مشكلة، وفي اللحظة نفسها ينهي Speaker 3 جملة بالإنجليزية عن الجدول الزمني. في نص مسطح، تتكدس هاتان السطران معًا، ويبدو أن القلق بشأن السعر صدر من الشخص الذي يتحدث عن التواريخ.

مع التسميات، تُقرأ اللحظة نفسها بوضوح:

Speaker 2 (中文): 这个价格我们还要再商量。
الترجمة: ما زلنا بحاجة إلى مناقشة هذا السعر.
Speaker 3 (English): Right, and the timeline works for our Q4 launch.

الآن أصبح القلق بشأن السعر منسوبًا بوضوح إلى الشخص الذي أثاره، ويمكنك الرد على المشكلة الصحيحة مع الشخص الصحيح. الإسناد هنا ليس ترفًا. إنه يغيّر ما ستقوله بعد ذلك.

كيف تعمل الترجمة الحية متعددة المتحدثين في MirrorCaption

يعمل MirrorCaption كتطبيق ويب، لذلك لا يوجد عميل لتثبيته ولا روبوت اجتماع للموافقة عليه. تسلسل العمل في مكالمة متعددة المتحدثين قصير:

  1. افتح MirrorCaption في Chrome أو Microsoft Edge على سطح المكتب وابدأ وضع Meet.
  2. شارك تبويب الاجتماع حتى يلتقط MirrorCaption صوت المكالمة (إضافة إلى الميكروفون الخاص بك).
  3. يفصل تمييز المتحدثين الأصوات ويضع عليها الوسوم Speaker 1 وSpeaker 2 وSpeaker 3.
  4. تظهر كل مداخلة مع النص الأصلي بجانب ترجمتها إلى اللغة التي اخترتها.
  5. أعد تسمية المتحدثين إلى الأسماء الحقيقية، ثم ابحث في النص التفريغي أو صدّره أو لخّصه.

اكتشاف تلقائي للمتحدثين (Speaker 1 وSpeaker 2، وأعد تسميتهم)

تحدد طبقة النسخ الحي الأصوات المميزة وتضع عليها تسميات تلقائيًا. لا تحتاج إلى وسم أي شخص مسبقًا. عندما تتعرف على صوت ما، انقر على التسمية وأعد تسميتها، وسيُطبَّق الاسم على النص التفريغي بالكامل. ومنذ تلك اللحظة، تُنسب كل مداخلة من ذلك الشخص إليه بالاسم.

الأصل والترجمة جنبًا إلى جنب، لكل متحدث

يحافظ MirrorCaption على النص الأصلي والترجمة معًا بدلًا من استبدال أحدهما بالآخر، لذلك لا تضيع الدقة الدلالية أبدًا. خذ المثال ثنائي اللغة الكلاسيكي: يقول عميل ياباني 「ちょっと難しいです」. الترجمة الحرفية هي "صعب قليلًا"، وهي صحيحة لغويًا وتعني تجاريًا رفضًا لطيفًا. وبما أن المصدر يظهر بجانب الترجمة، يمكنك النقر على أي كلمة لرؤية الأصل وقراءة الموقف بدقة. ولمزيد من المعلومات حول مدى أمانة هذه الصياغات، راجع شرحنا عن مدى دقة الترجمة الفورية.

Speak Translations الاختيارية، للرد بصوت عالٍ عبر اللغات

القراءة ليست دائمًا كافية. مع Speak Translations، يمكن لـ MirrorCaption أن يقرأ كلامك المترجم بصوت عالٍ باللغة المستهدفة بتوقيت قريب من الوقت الفعلي. تحدث بالإنجليزية، فيسمع الطرف الآخر اليابانية؛ تحدث بالماندرين، فيسمع الإنجليزية. يمكن تشغيل الصوت عبر مكبر صوت الكمبيوتر المحمول، أو مكبر صوت هاتف مقترن، أو، في عميل Mac، عبر ميكروفون افتراضي يمرره إلى Zoom أو Meet أو Teams. وهذا يحول النص التفريغي الموسوم إلى تبادل حقيقي ذهابًا وإيابًا، حيث يواصل كل طرف التحدث بلغته الخاصة.

هل أنت مستعد لاختبار الفرق في مكالمة متعددة اللغات حقيقية؟ ابدأ مجانًا ووسم اجتماعك الأول في دقائق.

أين يصبح تمييز المتحدثين صعبًا (الحدود الصادقة)

لا يوجد نظام حي يفصل الأصوات على نحو مثالي في الصوتيات الفوضوية، وسيكون من غير الصدق الادعاء بغير ذلك. هناك بعض الحالات الصعبة حقًا.

التداخل في الحديث. عندما يتحدث شخصان فوق بعضهما، يتداخل الصوت وتصبح الحدود بين المداخلات ضبابية. قد يتأخر الوسم أو يندمج حتى يصفو صوت واحد.

الأصوات المتشابهة جدًا. يصعب على البرامج وأحيانًا على البشر التمييز بين متحدثين لهما طبقة صوت ولهجة متقاربتان، ويستخدمان الميكروفون نفسه.

إعدادات الميكروفون الضعيفة. يمنح ميكروفون حاسوب محمول واحد يلتقط قاعة اجتماع كاملة البيانات أقل مما تمنحه الأجهزة المنفصلة.

ما يساعد عمليًا: دع المداخلات تستقر بدلًا من المقاطعة، واستخدم ميكروفونات منفصلة حيثما أمكن، واعتمد على صوت تبويب الاجتماع النظيف بدلًا من ميكروفون الغرفة. هذه هي الشروط نفسها التي تحسن الدقة لأي أداة، كما يوضح دليلنا للنسخ متعدد اللغات بمزيد من التفصيل.

الترجمة متعددة المتحدثين عبر المنصات، من دون روبوت

لأن MirrorCaption يلتقط صوت المتصفح بدلًا من الانضمام إلى الاجتماع، فإنه يعمل جنبًا إلى جنب مع الأداة التي اختارها المضيف بالفعل. في Chrome أو Edge على سطح المكتب، يلتقط وضع Meet تبويب الاجتماع لمكالمات Zoom وMicrosoft Teams وGoogle Meet وWebex المعتمدة على المتصفح. لا يحتاج أحد إلى قبول روبوت، ولا يُخزن أي صوت للاجتماع على الخادم، بل فقط النصوص التفريغية التي تختار حفظها محليًا.

أما للمحادثات المباشرة متعددة الأطراف، فيعمل وضع Talk على الهاتف كجلسة واحدة متصلة. تبدأه مرة واحدة وتترك الناس يتحدثون بالتناوب؛ فهو ليس نظام ضغط للتحدث ولا يعيد الضبط بعد كل جملة. وهذا يجعله مناسبًا لطاولة نقاش جماعية، لا مجرد البحث عن عبارة واحدة في كتاب عبارات.

إليك كيف تقارن الأساليب الشائعة في المهمة المحددة المتمثلة في وسم الأصوات وترجمة المداخلات مباشرة:

النهج تسميات المتحدثين الترجمة الحية أثناء المكالمة من دون روبوت اللغات
التسميات التوضيحية المدمجة في المنصة (Zoom, Teams, Meet) تختلف حسب المنصة غالبًا ما تكون مرتبطة بمستوى الخطة نعم، ضمن التسميات التوضيحية مدمجة، لكنها مقيدة بتلك المنصة تحددها الجهة الموردة والخطة
واجهات برمجة تطبيقات STT / diarization (أدوات المطورين) نعم، قوية تختلف حسب المزود مباشرة أو بعد المعالجة، حسب التنفيذ غير متاح، يحتاج إلى برمجة تختلف حسب المزود والنموذج
MirrorCaption نعم، تلقائي وقابل لإعادة التسمية نعم، جنبًا إلى جنب نعم، أثناء النطق نعم، عبر التقاط تبويب المتصفح أكثر من 50 لغة قابلة للاختيار

الفكرة ليست أن الأدوات الأخرى سيئة. فالتسميات التوضيحية في المنصات مريحة داخل حدودها، وواجهات برمجة تطبيقات التمييز ممتازة لبناء مسارات عمل مخصصة. أما MirrorCaption فيسد الفجوة المحددة الخاصة بالمداخلات الموسومة والمترجمة، مباشرة، عبر أي أداة تعتمد على المتصفح يستخدمها فريقك.

سيناريوهات حقيقية يستحق فيها الأمر

ما يلي مسارات عمل توضيحية، وليس شهادات من عملاء.

الاجتماع الشامل متعدد اللغات. تخيل فريقًا موزعًا حيث تنضم ماريا في ساو باولو، وWei في شنتشن، وAnna في برلين إلى اجتماع يومي. بدلًا من إجبار الجميع على الإنجليزية، يقرأ كل شخص الاجتماع بلغته الخاصة، مع إسناد كل مداخلة. أما المتأخرون فيفتحون الملخص الجاري ويلحقون بما فات في قراءة واحدة. هذه هي الحالة اليومية لـ الترجمة الفورية للفرق البعيدة.

التفاوض عبر الحدود. تخيل مكالمة مع مورد يتحدث فيها شخصان من جانب البائع الماندرين وشخصان من المشترين الإنجليزية. عندما يلفت Speaker 2 الانتباه إلى خطر في التسليم بينما لا يزال Speaker 1 يتحدث عن الشروط، تحافظ التسميات على الفصل بين المسارين، فيرد المشتري على الخطر للشخص الصحيح بدلًا من الحديث بجانبه.

الفصل الدراسي متعدد اللغات. تخيل ندوة عبر الإنترنت يطرح فيها طالب يتحدث الكورية سؤالًا أثناء محاضرة بالإنجليزية. يتيح النص التفريغي الموسوم والمترجم للمدرس أن يرى من سأل ماذا ويرد بدقة، بينما يحتفظ الطالب بسجل جانبي يذاكر منه لاحقًا.

الأسئلة الشائعة

ما هي الترجمة الحية متعددة المتحدثين؟

الترجمة الحية متعددة المتحدثين هي نظام يعمل في الوقت الفعلي ويؤدي مهمتين في آن واحد: يفصل كل صوت في المحادثة ويُسميه، ويترجم كل مداخلة إلى اللغة التي تختارها بينما لا يزال الناس يتحدثون، حتى تتمكن من رؤية من قال ماذا كما يحدث.

هل يمكنني ترجمة اجتماع يضم عدة متحدثين من دون روبوت؟

نعم. يعمل MirrorCaption داخل تبويب المتصفح لديك ويلتقط صوت الاجتماع مباشرة في Chrome أو Microsoft Edge على سطح المكتب، لذلك لا ينضم أي روبوت إلى المكالمة. وهو يضع تسميات لكل صوت ويترجم كل مداخلة أثناء الاجتماع، ولا يُخزن أي صوت للاجتماع على الخادم.

كيف يميز تمييز المتحدثين بين الأصوات؟

يفصل تمييز المتحدثين الأصوات المميزة في الصوت ويضع عليها تسميات Speaker 1 وSpeaker 2 وما إلى ذلك، ويمكنك إعادة تسميتها. ويعمل بأفضل شكل مع الصوت الواضح والميكروفونات المنفصلة. أما التداخل الشديد في الحديث أو الأصوات المتشابهة جدًا فيجعلان المهمة أصعب.

هل يمكن للطرف الآخر سماع الترجمة، لا مجرد قراءتها؟

نعم. يمكن لـ Speak Translations أن يقرأ كلامك المترجم بصوت عالٍ باللغة المستهدفة بتوقيت قريب من الوقت الفعلي، عبر مكبر صوت الحاسوب المحمول أو مكبر صوت هاتف مقترن أو الميكروفون الافتراضي على Mac، بحيث تستمر المحادثة من دون انتظار نص تفريغي بعد الاجتماع.

كم لغة تدعمها الترجمة الحية متعددة المتحدثين؟

يوفر MirrorCaption أكثر من 50 لغة قابلة للاختيار، باتجاهين، بما في ذلك الماندرين واليابانية والكورية والإسبانية والفرنسية والألمانية وغيرها. تظهر كل مداخلة موسومة جنبًا إلى جنب مع ترجمتها، ويمكنك النقر على أي كلمة لرؤية الأصل.

الخلاصة

الترجمة الحية متعددة المتحدثين هي المهمة المجمعة: وسم كل صوت، وترجمة كل مداخلة، والقيام بالأمرين بينما لا تزال المحادثة جارية. الترجمة وحدها تخبرك بما قيل. أما إضافة تسميات المتحدثين فتخبرك من قاله، وهذا ما يتيح لك فعليًا الرد والاقتباس واتخاذ القرار في اللحظة نفسها.

وللوصول إلى ذلك، استخدم صوت تبويب الاجتماع في Chrome أو Edge، ودع تمييز المتحدثين يوسم الأصوات، وأعد تسميتها، واقرأ النص الأصلي بجانب الترجمة. وعندما لا تكفي القراءة، فعّل Speak Translations حتى يتمكن الطرف الآخر من سماع الرسالة ومواصلة الحديث. وعندما يكون الصوت فوضويًا، تذكر أن الميكروفونات الأنظف والمداخلات غير المتعجلة تساعد كل أداة، بما فيها أداتنا.

وسم كل صوت، وترجم كل مداخلة

ابدأ بساعة مجانية واحدة. لا بطاقة ائتمان، ولا إعادة ضبط شهرية، ولا شيء لتثبيته. شاهد من قال ماذا، مباشرة، بلغتك.

ابدأ مجانًا