اليابان لا يمكن الاستهانة بها! روعة نماذج التعرف على الكلام Izanami + Kushinada + BERT
تحليل عميق لنماذج معالجة الصوت اليابانية "Izanami" و"Kushinada" التي تطورها AIST. ونستعرض كيف تنافس نموذج Whisper large-v3.
في سباق تطوير الذكاء الاصطناعي العالمي، كان "حاجز اللغة" لليابانية عقبة في بعض الأحيان، وتربة لتطور فريد في أحيان أخرى. ومن عام 2025 إلى 2026، يعلق مجتمع الذكاء الاصطناعي للتعرف على الكلام الياباني آمالاً كبيرة على "Izanami" و"Kushinada"، وهي نماذج أساسية للكلام الياباني تم تطويرها بواسطة AIST (المعهد الوطني للعلوم الصناعية المتقدمة والتكنولوجيا).
ومع اكتساح نموذج Whisper من OpenAI للعالم، يُنظر إلى التعرف على الكلام غالباً على أنه "مشكلة تم حلها". ومع ذلك، في أعماق اللغة اليابانية، ظلت العديد من التحديات قائمة. ومن خلال كشف نتائج الاختبارات المعيارية الأخيرة، نوضح بالتفصيل القدرات المذهلة لـ "Izanami/Kushinada + BERT"، والتي تفتح أفقاً جديداً للإدخال الصوتي الياباني، والسيناريو الذي يتفوق فيه الذكاء الاصطناعي المحلي على المنافسين الأجانب.
1. خلفية "Izanami و Kushinada": لماذا تعد النماذج الأساسية المحلية ضرورية
حتى الآن، كان التعرف على الكلام الياباني خاضعاً لسيطرة نماذج أجنبية مثل Speech-to-Text من جوجل و Whisper من OpenAI. وعلى الرغم من قوتها الكبيرة، إلا أن هذه النماذج تعطي الأولوية للدعم متعدد اللغات، وتفشل أحياناً في التقاط الفروق الدقيقة الفريدة في اليابانية بشكل كامل، مثل كثرة الكلمات المتشابهة في النطق، والاستخدام الدقيق للأدوات، والاختصارات المعتمدة على السياق.
وبشكل خاص في بيئات العمل اليابانية والجهات الحكومية والرعاية الطبية، تُطلب مستويات أمان عالية إلى جانب اتصالات صارمة حيث لا يُقبل فيها الخطأ في التعرف. وكانت هناك معضلة: فالذكاء الاصطناعي الأجنبي القائم على السحابة يثير مخاوف بشأن تسرب البيانات إلى الخارج، في حين يتطلب تشغيلها محلياً موارد حوسبة هائلة.
وقد تعلمت نماذج AIST "Izanami" و "Kushinada" من حوالي 60,000 ساعة من بيانات الكلام اليابانية، وهو المقياس الأكبر في البلاد. ويظهر حجم البيانات هذا بوضوح عند مقارنته بالنماذج المحلية السابقة التي كانت في حدود مئات إلى آلاف الساعات. ومن خلال استيعاب مجموعة متنوعة من "اليابانية الحية" من البرامج التلفزيونية ومحاضر الاجتماعات والمحادثات اليومية، تم الوصول لـ "أذن يابانية" تبدو طبيعية للمتحدثين الأصليين.
2. التشريح الفني: تقنية wav2vec 2.0 لـ Izanami وتقنية HuBERT لـ Kushinada
كما توحي أسماؤها المستمدة من الميثولوجيا اليابانية — إيزانامي (الخالق) وكوشينادا (الداعم) — فإن لهذين النموذجين أدواراً مصممة بوضوح.
Izanami: ذروة التعلم الخاضع للإشراف الذاتي
يعتمد "Izanami" على تقنية "wav2vec 2.0" المقترحة من قِبل Meta. وتلك طريقة لتعلم انتظام الكلام نفسه من كميات هائلة من البيانات الصوتية دون تسميات (نصوص صحيحة). وإيزانامي مسؤول عن بناء "القوة البدنية الأساسية" للكلام الياباني ويتم تحسينه كقاعدة عند الضبط الدقيق للمصطلحات الخاصة بصناعة معينة.
Kushinada: ذكاء يستوعب المعنى والسياق
في المقابل، يعتمد نموذج "Kushinada" تقنية "HuBERT (Hidden-Unit BERT)"، والتي تطبق بنية BERT من جوجل على الكلام. وهو يحول الإشارات الصوتية إلى رموز منفصلة تسمى "الوحدات المخفية" ويتنبأ بالصوت التالي من السياق المحيط، ويتعلم بعمق ليس فقط الخصائص الصوتية ولكن أيضاً ارتباط المعاني اللغوية. ونتيجة لذلك، فإنه يحقق معدل دقة يبلغ 84.77% في التعرف على المشاعر (الفرح، الغضب، الحزن، الطبيعي)، متجاوزاً بشكل كبير النماذج غير الأساسية السابقة (حوالي 70%).
3. الاختبارات المعيارية تثبت القوة الكامنة للتكنولوجيا المحلية: منافسة Whisper large-v3
إذاً، ما هو الأداء الفعلي؟ كانت نتائج الاختبارات التي أجراها مختبرنا واعدة للغاية. ويبين الجدول أدناه مقارنة دقة التعرف على الكلام الياباني بواسطة النماذج الرئيسية.
اسم النموذج | دقة الحروف (Character Accuracy) | معدل خطأ الحروف (CER) | وقت المعالجة |
OpenAI Whisper large-v3 | 81.2% | 18.8% | 14.04 ثانية |
Kushinada-Hubert (خام) | 76.1% | 23.9% | 128.96 ثانية |
Kushinada + BERT Punctuation | 81.0% | 19.0% | 0.11 ثانية (BERT) |
والجدير بالذكر أن إضافة استعادة علامات الترقيم باستخدام نموذج BERT الياباني إلى نتيجة التعرف لـ Kushinada (76.1%) جعل **دقة الحروف تقفز إلى 81.0%**. وهذا يكاد يكون على قدم المساواة مع 81.2% لـ Whisper large-v3، البطل الحالي في الذكاء الاصطناعي للتعرف على الكلام. وبينما يعتمد Whisper على القوة الغاشمة مع عدد هائل من المعلمات والبيانات العالمية، فإن الجمع بين Kushinada+BERT يحقق مخرجات **أخف وزناً** وعالية الدقة من خلال تخصصها في اللغة اليابانية.
4. التآزر مع BERT: من مجرد تفريغ نصي إلى "توليد الجمل"
إن الجمع بين "Kushinada + BERT" قوي لأنه لا يكتفي بتحويل الأصوات إلى نص؛ بل إنه يحسن بشكل كبير "المنطقية" و "القابلية للقراءة" كجمل. فالبيانات الخام التي تطرحها نماذج التعرف على الكلام غالباً ما تكون "سلسلة من الحروف" دون علامات ترقيم، مما يسبب إزعاجاً للقارئ البشري. ومن خلال دمج BERT، الذي يفهم السياق الياباني بعمق، يتم إدخال الفواصل والنقاط المناسبة وفقاً للسياق، وفي بعض الحالات، يتم إجراء تصحيح تلقائي للأخطاء المطبعية.
5. قوة التشغيل في بيئة محلية
في البيئات التي تتعامل مع معلومات حساسة للغاية مثل المجالات الطبية والقضائية والبرلمانية، يكون إرسال الصوت إلى الذكاء الاصطناعي السحابي الخارجي أمراً صعباً. ويمكن لنظام يعتمد على "Izanami/Kushinada" أن يعمل على خوادم محلية منفصلة عن الإنترنت. ويمكنك الاستمتاع بأعلى مستوى من الدقة في العالم مع حماية الخصوصية. وهذه هي القيمة الأكبر التي تقدمها النماذج المحلية. وعلاوة على ذلك، فإن الاستقرار الاقتصادي الذي لا يتأثر بتكاليف واجهة برمجة التطبيقات المقومة بالدولار يمثل أيضاً جاذبية كبيرة للشركات اليابانية.
[المصادر]
1. إعلان AIST الرسمي حول إطلاق النماذج الأساسية للتعرف على الكلام الياباني 'Izanami' و 'Kushinada'
2. مقال Ledge.ai حول إطلاق أكبر نموذج ذكاء اصطناعي صوتي محلي من AIST
3. تدوينة Note حول التحقق من قدرات Kushinada وتحسين الدقة بواسطة BERT