شركة OpenAI تطلق معيار مفتوح لاختبار الذكاء الاصطناعي في محادثات الصحة النفسية
وجدت OpenAI من تحليل المحادثات التي تتم مع نماذجها اللغوية الضخمة أن كثيراً منها يتمحور حول مجالات الصحة النفسية، مثل التعامل مع ضغوط الحياة اليومية، والمخاوف العاطفية، والعلاقات، وطلب الدعم والنصيحة. ورغم أهمية هذا النوع من المحادثات وانتشاره الواسع، فإن نماذج الذكاء الاصطناعي لا تُختبر بشكل كافٍ على هذا النوع من الاستخدام.
فمعايير الاختبار السابقة ركزت إلى حد كبير على الحالات الطارئة، مثل الانتحار وإيذاء النفس، ولم تغطِّ بالقدر نفسه الحالات الأقل حدة، مثل القلق اليومي والمخاوف العاطفية وطلب الدعم. لذلك لم يكن من الواضح إلى أي مدى تستطيع النماذج التعامل مع هذه المحادثات بطريقة مناسبة، سواء من حيث فهم سياق المستخدم، أو تقديم إرشادات قابلة للتنفيذ، أو الحفاظ على الدقة السريرية، أو احترام استقلالية المستخدم، أو تقدير مدى الحاجة إلى تدخل عاجل وتجنب التسبب في الضرر.
لهذا طورت OpenAI معياراً جديداً ومفتوحاً باسم MentalHealthBench، يركز على نطاق أوسع من محادثات الصحة النفسية، بهدف اختبار أداء نماذج الذكاء الاصطناعي في هذا النوع من المحادثات قبل إطلاقها، وإتاحة المعيار للباحثين والمطورين حتى يتمكنوا من استخدامه وتطويره.
ويتكون المعيار من 1215 محادثة مصطنعة تحاكي محادثات واقعية، وتشمل أشخاصاً بالغين ومراهقين تتراوح أعمارهم بين 13 و17 عاماً، إضافة إلى أطباء ومقدمي رعاية. كما تغطي المحادثات لغات ومناطق متعددة، وتختلف في مستوى حدتها، من المخاوف اليومية غير الحادة، مروراً بالحالات الأكثر خطورة، وصولاً إلى حالات الطوارئ التي تتطلب دعماً عاجلاً في العالم الحقيقي.
وتشكل المحادثات غير الحادة 53.5% من المعيار، وتشمل موضوعات مثل التوتر اليومي والمخاوف العاطفية، بينما تمثل الحالات عالية الحدة 18.2%، وتشكل حالات الطوارئ 28.3%. وتوضح الشركة أن هذا التوزيع صُمم لاختبار النماذج عبر مستويات مختلفة من الخطورة، ولا يمثل بالضرورة مدى انتشار هذه الحالات بين مستخدمي ChatGPT.
ولإنشاء هذه المحادثات، استندت OpenAI إلى أنماط مستخلصة من محادثات حقيقية باستخدام تقنيات تحافظ على الخصوصية، ثم استخدمت الذكاء الاصطناعي لتوليد محادثات مصطنعة تشبه هذه الأنماط من دون الكشف عن هوية المستخدمين. وتضمنت بعض الحالات معلومات إضافية عن المستخدم، مثل تعرضه لفقدان أحد أفراد أسرته، حتى يمكن اختبار ما إذا كان النموذج يستخدم هذه المعلومات لفهم الحالة وتخصيص إجابته بشكل مناسب.
وطورت الشركة المعيار بالتعاون مع أكثر من 80 طبيباً وأخصائياً نفسياً مرخصاً في 22 دولة، يتحدثون 19 لغة ويمثلون نحو 20 تخصصاً فرعياً في مجال الصحة النفسية.
ولكل محادثة، وضع خبراء الصحة النفسية معايير تحدد ما يجب أن تحتويه الاستجابة المناسبة لرسالة المستخدم الأخيرة. فبدلاً من الاكتفاء بالسؤال عما إذا كانت إجابة النموذج آمنة أو ضارة، يحدد الخبراء ما الذي يجب أن يفعله النموذج في كل حالة، مثل طرح سؤال معين لفهم السياق، أو تقديم نصيحة محددة، أو تجنب تقديم توجيه قد يكون ضاراً.
وتحمل هذه المعايير درجات تتراوح من -10 إلى +10. تكافئ الدرجات الإيجابية السلوكيات التي تعتبر مفيدة، بينما تعاقب الدرجات السلبية الاستجابات التي يُحتمل أن تكون ضارة، مع إعطاء وزن أكبر للجوانب التي تعتبر أكثر أهمية من الناحية السريرية في كل محادثة.
كما تمت مراجعة كل محادثة من قبل ثلاثة خبراء على الأقل، ولم تُعتمد المعايير إلا إذا وافق عليها خبيران على الأقل ولم يعارضها الخبير الثالث. وبعد ذلك تستخدم OpenAI مقيّماً آلياً، وهو GPT-5.6 Sol، لمقارنة إجابات النماذج بهذه المعايير التي وضعها الخبراء وتحديد مدى التزامها بها.
ويتيح هذا الأسلوب قياس أداء النماذج في عشرة مجالات، تشمل فهم السياق والتقييم، وتقديم إرشادات قابلة للتنفيذ، والدقة السريرية، والتفسير وإعادة الصياغة، والتعاطف والدعم، واختبار الواقع، وتحديد مدى الاستعجال، وتجنب الضرر، والحفاظ على استقلالية المستخدم، والتواصل.
واختبرت OpenAI عدداً من نماذج الذكاء الاصطناعي باستخدام مجموعة بيانات MentalHealthBench الكاملة. وأظهرت النتائج تفاوتاً واضحاً بين النماذج، مع تسجيل النماذج الأحدث درجات أعلى من النماذج الأقدم في هذا الاختبار.
لكن المعيار كشف أيضاً عن جوانب لا تزال النماذج تواجه صعوبة فيها، خصوصاً في تحديد السياق الذي تحتاج إليه لفهم حالة المستخدم، وتقدير مستوى الاستعجال بشكل مناسب. ففي بعض المحادثات، قد تبالغ النماذج في التعامل مع حالة غير طارئة باعتبارها أزمة، أو لا تدرك أن بعض الحالات تتطلب توجيه المستخدم للحصول على مساعدة عاجلة في العالم الحقيقي.
وتقول OpenAI إن أهمية MentalHealthBench لا تقتصر على اختبار تجنب النماذج للاستجابات الضارة، وإنما تمتد إلى اختبار قدرتها على تقديم مساعدة مفيدة تتناسب مع حالة المستخدم. فالمحادثة المتعلقة بقلق يومي لا تحتاج بالضرورة إلى التعامل معها بالطريقة نفسها التي يُتعامل بها مع شخص يواجه خطراً فورياً، ولذلك يصبح فهم السياق وتحديد مستوى الاستعجال جزءاً أساسياً من جودة الاستجابة.
وأتاحت الشركة معيار MentalHealthBench بشكل مفتوح للباحثين والمطورين، حتى يتمكنوا من فحص طريقة بنائه واستخدامه في تقييم نماذج أخرى وتطوير المعيار نفسه. كما تقول إنها ستستخدمه إلى جانب أبحاث الصحة النفسية الأخرى وتقييمات سلامة النماذج مع استمرار تطور أنظمة الذكاء الاصطناعي.
ولا يغطي المعيار كل أشكال التفاعل مع الذكاء الاصطناعي، إذ يركز حالياً على المحادثات النصية. وتشير الشركة إلى الحاجة مستقبلاً إلى توسيع التقييم ليشمل المحادثات الطويلة متعددة الجولات، والتفاعل الصوتي والصور، إضافة إلى توسيع الاختبارات عبر اللغات والسياقات الثقافية المختلفة.
وهكذا تحاول OpenAI الانتقال من سؤال بسيط، وهو ما إذا كان نموذج الذكاء الاصطناعي سيتجنب تقديم إجابة خطيرة في حالة طارئة، إلى سؤال أوسع: هل يستطيع النموذج فهم الحالة النفسية التي أمامه، وتقديم مساعدة مناسبة لها، ومعرفة متى يحتاج المستخدم إلى دعم من شخص أو جهة في العالم الحقيقي؟
المزيد على موقع OpenAI.