blog AI Business

مستقبل الرعاية الاجتماعية يتغير بالـ "صوت": مقارنة نماذج الذكاء الاصطناعي ومتطلبات الدقة

التعرف الصوتي بالذكاء الاصطناعي يغير رعاية المسنين. نكشف عن نتائج معيارية تظهر الدقة العالية لـ Whisper وتحديات Kotoba-Whisper.


لقد أدى تطور الذكاء الاصطناعي (AI) إلى تحسين سرعة ودقة تحويل "أصواتنا" إلى بيانات رقمية بشكل كبير. وبشكل خاص، فإن ظهور نماذج التعرف على الكلام بقيادة "Whisper" من OpenAI يجلب ثورة هادئة ولكنها مطردة إلى مجالات الرعاية الاجتماعية والتمريض، والتي كانت مثقلة تاريخياً بالأعباء الإدارية الثقيلة مثل "السجلات، السجلات، السجلات" لكل شيء.

التطور الدراماتيكي للتعرف على الكلام بالذكاء الاصطناعي وتأثيراته على الرعاية الاجتماعية

في الماضي، ربما كان لإدخال الصوت انطباع قوي بصعوبة الاستخدام بسبب انخفاض معدلات التعرف ومتاعب التصحيحات. ومع ذلك، يمكن لنماذج الذكاء الاصطناعي الحديثة التقاط الكلمات بدقة مساوية للبشر أو أكبر منها، حتى في البيئات التي تحتوي على أقنعة أو ضوضاء خلفية. ويلفت هذا التقدم التكنولوجي الانتباه كأداة لتقليل العبء الإداري على الموظفين بشكل كبير في مجالات الرعاية الاجتماعية التي تواجه نقصاً حاداً في العمالة.

قدرات أحدث نماذج Whisper والنماذج المشتقة منها: مقارنة معيارية

تتطلب بيئات الرعاية الاجتماعية والرعاية الصحية أكثر من مجرد السرعة. ونظراً لأنها تتعامل مع معلومات تتعلق بحياة البشر، فإن الدقة التي لا تقبل الخطأ أمر بالغ الأهمية أيضاً. ولقد تحققنا بدقة من دقة تفريغ النصوص لنماذج الذكاء الاصطناعي الرئيسية باستخدام ملفات صوتية تحاكي إعدادات الرعاية والصحة الفعلية. وسلطت النتائج الضوء على اختلاف مفاجئ في القدرة بين النماذج. ويرجى ملاحظة أن الصوت المستخدم تمت قراءته بصوت عالٍ بواسطة Kurousagi، وهو ذكر يبلغ من العمر حوالي ستين عاماً، لذا قد تختلف النتائج بالنسبة للإناث.

اسم النموذج

حجم النموذج

السرعة (176 حرفاً)

دقة الحروف (Char Acc)

التقييم

OpenAI Whisper Large-v3

3.0 جيجابايت

14.04 ثانية

81.2%

【أعلى دقة】 فهم سياقي عميق، يحافظ على دقة عالية حتى للمصطلحات التقنية.

OpenAI Whisper Large-v3-turbo

1.5 جيجابايت

6.66 ثانية

80.1%

【عملي】 يحافظ على دقة عالية مع المعالجة في حوالي نصف وقت large-v3.

ReazonSpeech NeMo v2

2.4 جيجابايت

10.63 ثانية

79.0%

يخرج نصاً متصلاً، ودقة الحروف قريبة من Whisper، ولكن يحتاج لإضافة علامات الترقيم يدوياً.

OpenAI Whisper medium

1.5 جيجابايت

7.99 ثانية

67.4%

تنخفض دقة مطابقة الحروف مقارنة بـ Large.

kotoba-whisper-v2.2

1.5 جيجابايت

5.90 ثانية

36.9%

ينقطع الجزء الأخير من الجمل، مع نقص كبير في المحتوى. بعيد عن الاستخدام العملي.

Qwen3-ASR-1.7B

4.5 جيجابايت

617.52 ثانية

80.7%

بطيء للغاية. معدل التعرف ليس سيئاً، ولكن البطء قاتل عند كثرة المستخدمين.

وفقاً للنتائج المعيارية، سجل نموذج Whisper large-v3 من OpenAI أعلى مستوى من الدقة. ومن ناحية أخرى، سجل نموذج "kotoba-whisper-v2.2" المرتقب دقة منخفضة تبلغ 36.9%، مع مشكلة انقطاع النص في منتصف الجملة. وبسبب افتقاره إلى الدقة، يبدو من الصعب وضعه في الاستخدام العملي في بيئات الرعاية الاجتماعية في حالته الحالية.

مخاطر التحويلات الخاطئة الكبيرة

وسلط هذا التحقق الضوء أيضاً على مشكلات لا يمكن قياسها بالدقة الرقمية المستخدمة في الاختبارات المعيارية. على سبيل المثال، رأينا حالات تم فيها تحديد "الفشل الكلوي" على أنه "فقر دم"، أو تم تحويل "غسيل الكلى" إلى "رمي الحجارة". وتلك ليست أخطاء إملائية بسيطة، بل أخطاء جسيمة يمكن أن تشوه محتوى الرعاية نفسه. ولذلك، عند إدخال الذكاء الاصطناعي، فإن التطوير المخصص للمصطلحات الخاصة بالرعاية الصحية أمر ضروري للغاية.

[المصادر]


1. موقع CareNews لإنتاجية الرعاية والخدمات الاجتماعية
2. تقرير وأبحاث نموذج Whisper من OpenAI
3. إرشادات وزارة الصحة والعمل والرفاهية لتعزيز إنتاجية الرعاية والخدمات