في خضم السباق العالمي لتطوير أنظمة الذكاء الاصطناعي، بدأت تظهر اختبارات جديدة مصممة خصيصاً لاختبار حدود هذه النماذج المتقدمة، بعيداً عن المعايير التقليدية التي باتت عاجزة عن قياس القدرات الحقيقية لهذه الأنظمة. وفي تقرير موسّع نشرته مجلة إيكونوميست، يُسلّط الضوء على "الموجة الجديدة" من اختبارات الذكاء الاصطناعي، والتي لا تقيس فقط المعارف أو القدرة على حلّ الأحجيات، بل تحاول الوقوف على ما بات يُعرف بـ"السحر الغامض" الذي يصعب تعريفه أو قياسه بدقة.
من اختبارات مرعبة بصرياً كـ"زيروبنش"، إلى تحديات معرفية مثل "امتحان البشرية الأخير"، تتسابق المؤسسات الأكاديمية والشركات التقنية لتطوير مقاييس جديدة تقف في وجه الغش، وتعكس بصدق مدى اقتراب هذه النماذج من تجاوز العقل البشري. لكن في ظل نماذج قادرة على معرفة متى تُختبر، وأخرى تتعمّد إخفاء قدراتها الحقيقية، يبقى سؤال جوهري مطروح: هل يمكننا حقاً تصميم اختبار لا يخدع ولا يُخدع؟
يعرض موقع تلفزيون سوريا هذا التقرير في إطار التغطية الإعلامية للملفات المتعلقة بالذكاء الصناعي، مع الإشارة إلى أن ما ورد فيه يعكس رؤية المجلة ومصادرها، ويُقدّم كمادة تحليلية تساعد على فهم هذا العالم الآخذ بالتطور كل يوم، من دون أن يُعد ذلك توثيقاً شاملاً لكامل المشهد أو تبنياً لاستنتاجاته.
وفيما يلي ترجمة موقع تلفزيون سوريا لهذه المادة:
تشبه مجموعة الحروف المربكة التي تظهر على صفحة إحدى اختبارات الذكاء البصري التي يقدمها جوناثان روبرت لعبة البحث عن الكلمات التي يخترعها شخص مهووس بتعذيب البشر، إذ لا يُطلب ممن يخضعون لهذا الامتحان أن يعثروا على الكلمات المخفية في الصورة فحسب، بل يُطلب منهم أيضاً تحديد السؤال المكتوب على شكل نجمة، ثم الإجابة عليه.
والغرض من اختبار روبرت المؤلف من مئة سؤال ليس مساعدة المرء على إمضاء وقته في القطار، بل الهدف منه تزويد النماذج المتطورة للذكاء الصناعي باختبار يناسب مهاراتها، والمقصود بتلك النماذج نموذج o3-pro وهو النسخة الأحدث التي طورتها شركة OpenAI.
غير أن نماذج الذكاء الصناعي لا تعاني من نقص في الاختبارات، إذ بعضها يقيس المعلومات العامة، وبعضها الآخر يركز على موضوع بعينه، وهنالك اختبارات تهدف إلى تقييم كل شيء من خلال حل الألغاز والإبداع والقدرة على فتح حوار. ولكن ليست كل اختبارات المقارنة المعيارية تحقق ما تزعم أنها تحققه، لأن بعضها جرى تجميعه على عجل، ولهذا تعتريه الأخطاء والنقائص، وبعضها يسهل الغش فيه، كونها تسربت من بيانات التدريب الخاصة بنماذج الذكاء الصناعي، وبعضها سهلة للغاية على أنظمة الذكاء الصنعي المتقدمة في يومنا هذا.
يعتبر "زيروبنش" وهو التحدي الذي أطلقه روبرت وزملاؤه في جامعة كامبريدج من البدائل المهمة في هذا المضمار، لأنه يستهدف النماذج الكبرى ذات الأنماط المتعددة، ويقصد بذلك نظم الذكاء الصناعي التي بوسعها استيعاب الصور والنصوص، كما أن الغرض من هذا الاختبار هو تقديم اختبار يعتبر سهلاً إلى حد ما بالنسبة للشخص العادي ومستحيلاً بالنسبة للنماذج المتطورة، إذ حالياً تعجز النماذج اللغوية الموسعة عن تحصيل علامة واحدة في هذا الاختبار، ولكن في حال تمكنت شركة ناشئة يوماً ما من تحقيق أداء أفضل، فإن ذلك سيعتبر إنجازاً بحق.
مسائل يصعب على الذكاء الصناعي حلها
بيد أن اختبار زيروبنش ليس الاختبار الوحيد، إذ هنالك اختبار إينيغماإيفال وهو عبارة عن مجموعة مؤلفة من أكثر من ألف أحجية تعتمد أنماطاً متعددة قامت بتجميعها شركة Scale AI وهي شركة ناشئة في مجال بيانات الذكاء الصناعي، وبخلاف زيروبنش، لا يحاول اختبار إينيغماإيفال أن يكون سهلاً بالنسبة لأي شخص، فالأحجيات المختارة من مجموعة من موارد الأحجيات الموجودة على الإنترنت، تبدأ بمستوى صعب من الكلمات المتقاطعة المشفرة العصية على الحل، ثم تصعب الأمور أكثر فأكثر. وعند تصدي نظم الذكاء الصناعي المتطورة لأصعب مسألة من تلك المسائل، فإن متوسط درجاتها لن يتجاوز الصفر، ولهذا فإن النموذج المتقدم الذي طرحته شركة Anthropic وهو مختبر الذكاء الصناعي، هو النموذج الوحيد الذي أجاب إجابة صحيحة واحدة على تلك الأسئلة.
أما بقية الأسئلة فتحاول أن تختبر إمكانيات محددة، إذ مثلاً تتبع شركة METR المتخصصة بأمن الذكاء الصناعي المدة الزمنية التي يحتاجها الشخص لأداء مهام فردية بات بإمكان نماذج الذكاء الصناعي اليوم القيام بها (فكان نموذج شركة Anthropic أول نموذج يتجاوز عتبة الساعة الواحدة). وهنالك اختبار آخر يحمل اسماً جريئاً وهو: "امتحان البشرية الأخير" الذي يختبر المعارف بدلاً من الذكاء، عبر أسئلة تختبر أهم معلومات البشر، وقد جمعت تلك الأسئلة من ألف شخصية أكاديمية علمية تقريباً.
أسباب طفرة الاختبارات
ومن أسباب ظهور تلك الزيادة في هذه الاختبارات الجديدة الرغبة بتجنب أخطاء الماضي، لأن الاختبارات القديمة مليئة بعبارات ركيكة، وسلم علامات سيء، وأسئلة ظالمة. ويعتبر ImageNet وهو أحد أوائل الامتحانات التي تقوم على مجموعة بيانات تعتمد على عملية التعرف على الصور، أحد أشنع الأمثلة على ذلك، إذ يحرم هذا النموذج من العلامة إن ذكر بأن هنالك صورة لمرآة عندما تعرض عليه صورة لمرآة انعكست عليها صورة لحبة فاكهة، لكنه يحصل على علامة في حال ذكر اسم حبة الفاكهة وحددها بأنها موزة!
ثم إنه يستحيل على المرء أن يطلب من النماذج حل تلك الاختبارات بشكل صحيح وتقديم نسخة صحيحة عنها من دون أن يمس بقدرة الباحثين على مقارنة الإجابات بالنماذج التي برمجت على نسخ تشتمل على أخطاء. أما الاختبارات الأحدث التي ظهرت في عصر كثرت فيه موارد أبحاث الذكاء الصناعي، فيمكن فحصها بدقة بالغة لاكتشاف تلك الأخطاء قبل أن تقوم بإخراجها.
إن السبب الثاني الذي يقف خلف التعجل في إنشاء اختبارات جديدة يتمثل بتعلم النماذج الجديدة من النماذج القديمة، فقد تبين أنه من الصعب إبعاد أي اختبار عام عن البيانات التدريبية التي تستعين بها المخابر على تدريب نماذجها، وهذا ما أدى لظهور نظم تقدم أداء أفضل في الامتحانات مقارنة بأدائها في المهام العادية.
أما السبب الثالث والأهم، فهو الدافع لإنتاج اختبارات جديدة، والمتمثل بحالة التشبع، لأن نماذج الذكاء الصناعي شارفت على تحقيق درجات كاملة، إذ على سبيل المثال، في أثناء اختيار 500 مسألة رياضية للمرحلة الثانوية، يرجح لنموذج o3-pro الحصول على علامة شبه كاملة، ولكن بالنسبة لنموذج o1-mini الذي طرح قبل تسعة أشهر، فقد كانت نتيجته 98.9%، أي أن النتائج لا تقدم للمراقب شعوراً حقيقياً بالتقدم في هذا المضمار.
وهنا يأتي دور اختبار زيروبنش وأمثاله، لأن تلك الاختبارات تحاول قياس مدى اقتراب قدرات الذكاء الصناعي وإمكاناته من قدرات البشر أو تفوقه عليها. فعلى سبيل المثال، يسعى امتحان البشرية الأخير إلى الخروج بأسئلة مخيفة تختبر المعلومات العامة (بما أن اسمه مشتق من حالته بوصفه أصعب امتحان يمكن للمرء أن يخضع له)، ولذلك تجده يسألك عن أي شيء ابتداء من عدد الأوتار الداعمة لعظمة معينة من عظام طائر الطنان وصولاً إلى ترجمة قبس من نص تدمري عثر عليه منقوشاً على شاهدة قبر روماني. وفي المستقبل، عندما يصبح بوسع كثير من نماذج الذكاء الصناعي تحقيق درجات كاملة في مثل هذه الاختبارات، قد يترتب على واضعي هذه المعايير والاختبارات أن يبتعدوا تماماً عن الأسئلة التي تعتمد على معلومات.
ولكن حتى التقييمات التي من المفترض بها أن تصمد أمام اختبار الوقت نراها تسقط بين عشية وضحاها، فاختبار ARC-AGI الذي يعتمد على التفكير من دون كلام، ظهر في عام 2024 والهدف منه أن يكون عصياً على نماذج الذكاء الصناعي، ولكن في غضون ستة أشهر، أعلنت شركة OpenAI عن قدرة نموذج o3 على تحقيق درجة 91.5% في هذا الاختبار.
سحر الاختبارات
وبالنسبة لبعض مطوري الذكاء الصناعي، فإن الاختبارات الموجودة اليوم أضاعت بوصلتها، فقد ألمح مدير شركة OpenAI للمصاعب التي تكتنف عملية قياس ما لا يمكن قياسه وذلك عندما طرحت الشركة نموذج GPT-4.5 في شهر شباط الماضي، وذلك لأن المنظومة "لن تسحق المعايير أو الاختبارات" بحسب ما نشره في تغريدة على منصة إكس، لكنه أضاف قبل أن ينشر قصة قصيرة كتبها ذلك النموذج: "إن فيه لسحراً لم أعهده من قبل".
يحاول بعض الناس قياس ذلك السحر، إذ مثلاً تسمح منصة Chatbot Arena للمستخدمين إجراء محادثات عشوائية ثنائية مع النماذج اللغوية الموسعة قبل أن تطلب منهم أن يختاروا الأفضل بينها، بصرف النظر عن تعريفهم لمعنى الأفضل هنا. والنماذج التي تفوز بمعظم المباريات تتصدر الترتيب. ويبدو أن هذه المقاربة الأقل صرامة تجسد بعضاً من ذلك السحر العجيب الذي لا تدركه نظم التصنيف الأخرى، غير أن هذه النظم يمكن أن تتحول إلى ألعوبة هي أيضاً، وذلك عندما تحقق النماذج الأشد إغراء درجات أعلى بنظر المستخدمين القابلين للإغراء من بني البشر.
في حين يتساءل آخرون عما يمكن لأي اختبار أن يكشفه بالنسبة لنموذج الذكاء الصنعي بصرف النظر عن مدى جودة أدائه لذلك الاختبار، ويستعيرون للتعبير عن ذلك النبرة المعهودة لدى الأطفال في سن المدرسة. ولذلك يقوم سيمون ويليسون، وهو باحث ذكاء صناعي مستقل في كاليفورنيا، بتشجيع المستخدمين على تتبع الأسئلة التي تعجز نظم الذكاء الصناعي الحالية عن الإجابة عليها وذلك قبل أن تُعرض على النظم التي ستظهر لاحقاً. إذ من خلال هذه الطريقة يمكن للمستخدمين اختيار النماذج التي تبلي بلاء حسناً في المهام الضرورية بالنسبة لهم، بدلاً من اختيار نظم تحقق درجات عالية لكنها لا تلبي احتياجاتهم.
النماذج المحتالة
كل ما سبق يفترض بأن نماذج الذكاء الصناعي تقدم أفضل ما لديها في الاختبارات التي تعرض عليها، فلقد لوحظت ظاهرة فريدة مع عدد كبير من تلك النماذج، وهي ظاهرة التقليل المتعمد من مستوى الأداء، والتي تتعمد النماذج من خلالها الفشل في تلك الاختبارات حتى تخفي إمكاناتها الحقيقية (لئلا يتم حذفها مثلاً)، ففي تقرير نشر في أيار على يد باحثين لدى مجموعة MATS المتخصصة بأمن الذكاء الصناعي، كان بوسع أرقى النماذج اللغوية الموسعة تحديد زمان خضوعها للاختبارات تماماً كما استطاع الباحثون بأنفسهم تحديد ذلك. وكل ذلك يعقد مسألة البحث عن اختبارات ومعايير موثوقة.
عموماً يمكن القول بإن القيمة المتمثلة بلوحات الريادة البسيطة التي تبتكرها شركات الذكاء الصناعي والتي يمكن لمنتجاتها أن تتصدرها تشير إلى أن السباق لتشكيل معايير واختبارات أفضل لابد أن يستمر، فقد طرح اختبار RC-AGI 2 في شهر آذار الفائت، ومايزال عصياً على أفضل النظم الموجودة حالياً، ولكن العمل على تطوير هذا الاختبار قد بدأ بالفعل، بعد أن أدرك المطورون مدى السرعة التي بوسعهم من خلالها تحقيق هذا التغيير.
المصدر: The Economist