أصبحت مراقبة سلوك وكلاء الذكاء الاصطناعي تحديا متزايدا مع توسع استخدامها في البرمجة والأمن السيبراني وتنفيذ المهام المتعددة بصورة مستقلة، وذلك أن الوكيل قد يتمكن من تحقيق نتيجة تبدو صحيحة، لكنه يصل إليها عبر اختصار غير آمن أو يتجاوز الهدف الفعلي للمهمة.
وفي محاولة لمعالجة هذه المشكلة، أعلنت شركة غودفاير (Goodfire) الأمريكية، المتخصصة في أبحاث قابلية تفسير نماذج الذكاء الاصطناعي، تطوير أدوات تراقب الإشارات الداخلية للنماذج لاكتشاف السلوكيات غير المرغوبة خلال التنفيذ، مع تقليل الاعتماد على أنظمة تقييم إضافية مرتفعة التكلفة.
نشرت غودفاير قبل يومين تفاصيل عن نظام لمراقبة السلوكيات غير المرغوبة، يعتمد على ما تسميه مراقبات التنشيط (Activation Monitors)، وهي مصنفات صغيرة تدرب على اكتشاف أنماط محددة في الإشارات الحسابية الداخلية للنموذج، المعروفة باسم التنشيطات (Activations)، التي تتولد أثناء معالجة المدخلات وإنتاج المخرجات.
وعلى خلاف أدوات المراقبة التي تكتفي بقراءة إجابات الوكيل أو مراجعة سجل خطواته، تحلل هذه الطريقة إشارات داخل النموذج نفسه، بحثا عن مؤشرات مرتبطة بسلوكيات مثل التحايل على التقييم، أو إساءة استخدام القدرات السيبرانية، أو كشف البيانات الحساسة، أو الاستجابة لتعليمات خبيثة مخفية داخل المحتوى.
وتوضح الشركة أن المراقبات تستطيع العمل خلال تنفيذ المهمة، بما يتيح إصدار تنبيه عند ظهور نمط مثير للقلق، بدلا من انتظار انتهاء المهمة ومراجعة نتائجها.
لكن هذه التقنية لا تعني أن النظام يقرأ أفكار النموذج بصورة مباشرة، ولا أنها تكشف كل دوافعه، فهي تبحث عن أنماط حسابية تعلّمت الارتباط بسلوكيات معينة، وتظل دقة اكتشافها مرتبطة بجودة التدريب والاختبارات ومدى تشابه السلوك الفعلي مع الحالات التي دربت عليها.
التعليقات (0)