f 𝕏 W
أداة لمراقبة سلوك وكلاء الذكاء الاصطناعي من الداخل.. كيف ذلك؟

الجزيرة

رياضة منذ 4 سا 0 2 د قراءة
زيارة المصدر ←

أداة لمراقبة سلوك وكلاء الذكاء الاصطناعي من الداخل.. كيف ذلك؟

تطور شركة غودفاير أداة ترصد الإشارات الداخلية لوكلاء الذكاء الاصطناعي لاكتشاف السلوكيات غير المرغوب فيها أثناء التنفيذ بهدف تعزيز السلامة وخفض تكاليف المراقبة.

أصبحت مراقبة سلوك وكلاء الذكاء الاصطناعي تحديا متزايدا مع توسع استخدامها في البرمجة والأمن السيبراني وتنفيذ المهام المتعددة بصورة مستقلة، وذلك أن الوكيل قد يتمكن من تحقيق نتيجة تبدو صحيحة، لكنه يصل إليها عبر اختصار غير آمن أو يتجاوز الهدف الفعلي للمهمة.

وفي محاولة لمعالجة هذه المشكلة، أعلنت شركة غودفاير (Goodfire) الأمريكية، المتخصصة في أبحاث قابلية تفسير نماذج الذكاء الاصطناعي، تطوير أدوات تراقب الإشارات الداخلية للنماذج لاكتشاف السلوكيات غير المرغوبة خلال التنفيذ، مع تقليل الاعتماد على أنظمة تقييم إضافية مرتفعة التكلفة.

نشرت غودفاير قبل يومين تفاصيل عن نظام لمراقبة السلوكيات غير المرغوبة، يعتمد على ما تسميه مراقبات التنشيط (Activation Monitors)، وهي مصنفات صغيرة تدرب على اكتشاف أنماط محددة في الإشارات الحسابية الداخلية للنموذج، المعروفة باسم التنشيطات (Activations)، التي تتولد أثناء معالجة المدخلات وإنتاج المخرجات.

وعلى خلاف أدوات المراقبة التي تكتفي بقراءة إجابات الوكيل أو مراجعة سجل خطواته، تحلل هذه الطريقة إشارات داخل النموذج نفسه، بحثا عن مؤشرات مرتبطة بسلوكيات مثل التحايل على التقييم، أو إساءة استخدام القدرات السيبرانية، أو كشف البيانات الحساسة، أو الاستجابة لتعليمات خبيثة مخفية داخل المحتوى.

وتوضح الشركة أن المراقبات تستطيع العمل خلال تنفيذ المهمة، بما يتيح إصدار تنبيه عند ظهور نمط مثير للقلق، بدلا من انتظار انتهاء المهمة ومراجعة نتائجها.

لكن هذه التقنية لا تعني أن النظام يقرأ أفكار النموذج بصورة مباشرة، ولا أنها تكشف كل دوافعه، فهي تبحث عن أنماط حسابية تعلّمت الارتباط بسلوكيات معينة، وتظل دقة اكتشافها مرتبطة بجودة التدريب والاختبارات ومدى تشابه السلوك الفعلي مع الحالات التي دربت عليها.

المقال الكامل متوفر على موقع المصدر
اقرأ الخبر كاملاً من الجزيرة
←

شارك هذه المقالة

التعليقات (0)