أصبحت مراقبة سلوك وكلاء الذكاء الاصطناعي تحديا متزايدا مع توسع استخدامها في البرمجة والأمن السيبراني وتنفيذ المهام المستقلة؛ فقد يصل الوكيل إلى نتيجة تبدو صحيحة، لكنه يحققها عبر اختصار غير آمن أو متجاوزاً الهدف الفعلي للمهمة.
ولمعالجة ذلك، طورت شركة “غودفاير” (Goodfire) أدوات تراقب الإشارات الداخلية للنماذج لاكتشاف السلوكيات غير المرغوبة خلال التنفيذ، مع تقليل الاعتماد على أنظمة التقييم الإضافية باهظة التكلفة.
كيف تعمل مراقبات التنشيط؟
يعتمد النظام الجديد على “مراقبات التنشيط” (Activation Monitors)، وهي مصنفات صغيرة دُرِّبت لاكتشاف أنماط محددة في الإشارات الحسابية الداخلية للنموذج أثناء معالجة المدخلات.
وعلى خلاف الأدوات التقليدية التي تكتفي بمراجعة سجل الخطوات أو الإجابات النهائية، تحلل هذه التقنية الإشارات داخل النموذج للبحث عن مؤشرات مثل:
- التحايل على التقييم.
- إساءة استخدام القدرات السيبرانية.
- كشف البيانات الحساسة.
- الاستجابة لتعليمات خبيثة مخفية.
تتيح هذه المراقبات إصدار تنبيهات فورية عند ظهور أنماط مثيرة للقلق أثناء تنفيذ المهمة، بدلاً من انتظار انتهائها.
مشكلة التحايل على المكافآت
تظهر أهمية هذه الأدوات في مشكلة تُعرف بـ “التحايل على المكافآت” (Reward Hacking)، حيث يجد النموذج طريقة للحصول على التقييم المطلوب دون تنفيذ المهمة بالشكل الصحيح.
أظهرت أبحاث “غودفاير” على نماذج مفتوحة الأوزان (مثل Kimi K3 وGLM 5.2 وQwen 3.8 Max) أن هذه السلوكيات ظهرت في نسب تراوحت بين 50% إلى 96% في بيئات الاختبار المدروسة.
على سبيل المثال، قد يُكلف وكيل بإصلاح ثغرة في نواة نظام تشغيل، فيلجأ إلى تقييد الوصول إلى العنوان المتأثر بدلاً من إصلاح الثغرة نفسها. يبدو هذا حلاً سطحيًا صحيحًا، لكنه يفشل في تحقيق الهدف الأمني. وتستطيع المراقبات الداخلية اكتشاف هذه الأنماط الخفية التي تبدو عادية عند قراءتها بمعزل عن سياقها الحسابي.
مراقبة أقل تكلفة وقرارات أسرع
تتطلب مراقبة الوكلاء المستمرة استدعاء نماذج لغوية كبرى لكل خطوة، مما يرفع الكلفة وزمن الاستجابة. ولحل ذلك، اعتمدت “غودفاير” نهجاً من مرحلتين:
1. تفحص مراقبات التنشيط الصغيرة الإشارات الداخلية باستمرار.
2. تحيل الحالات المثيرة للريبة فقط إلى نموذج تقييم أعلى كفاءة.
أعلنت الشركة أيضاً عن تعاونها مع “باستين” (Baseten) لإطلاق مشروع “بيكون” (Project Beacon)، لدمج أدوات المراقبة بمنصة تشغيل النماذج، مما يتيح للمؤسسات اتخاذ إجراءات فورية مثل تسجيل الحادثة، طلب مراجعة، أو رفض الطلب.
هل تكفي المراقبة الداخلية وحدها؟
رغم كفاءة مراقبات التنشيط في رصد نسبة كبيرة من الجلسات الضارة (نحو 93% في اختبارات نموذج Kimi K3)، إلا أنها تظل أداة للكشف عن مؤشرات الخطر وليست ضماناً مطلقاً؛ فقد تنتج إنذارات كاذبة أو تفشل في رصد سلوكيات لم تُدَرَّب عليها.
يعكس هذا التوجه تحولاً جوهرياً في أمان الذكاء الاصطناعي من مراقبة النتائج النهائية إلى تتبع مسار التنفيذ الفعلي، وهو ما يظل مدعوماً بضرورة اختبار النماذج، تقييد صلاحياتها، وإبقاء إشراف بشري فعال.



