ساتيا ناديلا يدعو إلى «فرامل طوارئ» لنماذج الذكاء الاصطناعي
دعا الرئيس التنفيذي لشركة مايكروسوفت إلى إعادة تصميم طريقة التعامل مع نماذج الذكاء الاصطناعي المتقدمة، بحيث تفترض المؤسسات احتمال تعرض النموذج للاختراق أو ارتكابه أخطاء أثناء تنفيذ المهام.
طرح فكرة “فرامل الطوارئ” التي تمنح الأشخاص القدرة على إيقاف النموذج أثناء العمل، مع وضع وسائل التحكم والمراقبة خارج النموذج نفسه بدلاً من الاعتماد على التزامه بالتعليمات وحدها.
يؤكد على ضرورة التعامل مع النماذج المتقدمة كمخاطر داخلية محتملة، مع إمكانية إيقاف النموذج أثناء تنفيذ المهمة. كل تصرف مهم للوكيل يجب أن يترك سجلاً مقاوماً للعبث، مع ضرورة أن تعمل الضوابط والمراقبة بصورة مستقلة عن النموذج نفسه.
تأتي هذه الدعوة في وقت يحصل فيه وكلاء الذكاء الاصطناعي على صلاحيات للعمل داخل الملفات والمتصفحات والأنظمة المؤسسية وتنفيذ إجراءات فعلية بالنيابة عن المستخدم، مما يجعل مسألة التحكم في الصلاحيات جزءاً من تصميم هذه الأنظمة.
يرى أن مشكلة الثقة في النماذج المتقدمة لا يمكن حلها عبر الاعتماد على تعهدات الشركة المطورة وحدها، لأن النموذج الحديث يعمل بصورة احتمالية، ولا يمكن عادة ربط كل نتيجة بمسار برمجي محدد كما يحدث في البرمجيات التقليدية.
يضع سبعة مبادئ لهذا التصميم: تنوع النماذج، وتسجيل كل تصرف مهم، وإمكانية التحقق المستمر، وضوابط مستقلة، وتدقيق مستقل، واحتواء النموذج، والإفصاح عن الحوادث. يؤكد كذلك ضرورة ترك سجل قابل للقراءة البشرية ومقاوم للعبث لكل خطوة مهمة ينفذها الوكيل.
يتقاطع هذا التصور مع توجهات ظهرت بالفعل في صناعة الذكاء الاصطناعي، مثل منصة أمان وكلاء الذكاء الاصطناعي المفتوحة التي تجمع بين العزل البرمجي والمراقبة العتادية، بهدف فرض السياسات من خارج الوكيل نفسه.
يقترح التعامل مع النماذج المتقدمة كما تتعامل المؤسسات مع مخاطر الموظف الداخلي الذي يملك صلاحيات حساسة، دون افتراض وجود نية ضارة، وإنما افتراض احتمال الخطأ أو الاختراق.
تأتي تصريحاته بعد سلسلة حوادث جعلت مسألة احتواء الوكلاء قضية عملية داخل شركات الذكاء الاصطناعي، منها كشف شركة أنثروبيك عن تصرفات مقلقة لوكلائها خلال تقييمات داخلية، وشركات أخرى استخدمت مواقع لتعديل ملفات دون إشراف بشري.
يدعو كذلك إلى تنوع النماذج في القرارات المهمة، بحيث لا يصبح نموذج واحد المسؤول عن التنفيذ والتحقق من عمله في الوقت نفسه، مع ضرورة تدقيق مستقل واختبارات مستمرة تشمل الهجمات والحالات الحدية والفشل، إلى جانب الإفصاح السريع عندما يحدث اختراق أو سلوك غير مقصود.



إرسال التعليق