دعا ساتيا ناديلا، الرئيس التنفيذي لشركة مايكروسوفت، إلى إعادة تصميم طريقة التعامل مع نماذج الذكاء الاصطناعي المتقدمة، بحيث تفترض المؤسسات احتمال تعرض النموذج للاختراق أو ارتكابه أخطاء أثناء تنفيذ المهام. طرح ناديلا في مقال مطول نشره على منصة X فكرة «فرامل الطوارئ»، التي تمنح الأشخاص القدرة على إيقاف النموذج أثناء العمل، مع وضع وسائل التحكم والمراقبة خارج النموذج نفسه بدلًا من الاعتماد على التزامه بالتعليمات وحدها.

  • ناديلا يدعو إلى التعامل مع النماذج المتقدمة كمخاطر داخلية محتملة.
  • المقترح يمنح البشر القدرة على إيقاف النموذج أثناء تنفيذ المهمة.
  • كل تصرف مهم للوكيل يجب أن يترك سجلًا مقاومًا للعبث.
  • الضوابط والمراقبة يجب أن تعمل بصورة مستقلة عن النموذج نفسه.

تأتي دعوة ناديلا في وقت يحصل فيه وكلاء الذكاء الاصطناعي على صلاحيات للعمل داخل الملفات والمتصفحات والأنظمة المؤسسية وتنفيذ إجراءات فعلية بالنيابة عن المستخدم. يتزامن ذلك مع اتجاه شركة مايكروسوفت إلى دمج الوكلاء بصورة واسعة داخل ويندوز 11، ما يجعل مسألة التحكم في الصلاحيات جزءًا من تصميم هذه الأنظمة، خصوصًا عندما لا تقتصر مهمة النموذج على تقديم إجابة نصية ويمكن أن تمتد إلى تنفيذ سلسلة إجراءات داخل بيئة حقيقية.

ناديلا يقترح هندسة ثقة جديدة

يرى ناديلا أن مشكلة الثقة في النماذج المتقدمة لا يمكن حلها عبر الاعتماد على تعهدات الشركة المطورة وحدها. فالنموذج الحديث يعمل بصورة احتمالية، ولا يمكن عادة ربط كل نتيجة بمسار برمجي محدد كما يحدث في البرمجيات التقليدية. لذلك يقترح فصل النموذج عن طبقة التشغيل التي تدير أدواته وصلاحياته، ووضع وسائل التحكم خارج النموذج نفسه، بحيث تستطيع المؤسسة مراقبة ما يفعله وتحديد ما يسمح له بالوصول إليه.

يضع ناديلا سبعة مبادئ لهذا التصميم: تنوع النماذج، وتسجيل كل تصرف مهم، وإمكانية التحقق المستمر، وضوابط مستقلة، وتدقيق مستقل، واحتواء النموذج، والإفصاح عن الحوادث. يؤكد كذلك ضرورة ترك سجل قابل للقراءة البشرية ومقاوم للعبث لكل خطوة مهمة ينفذها الوكيل، حتى تستطيع الفرق إعادة بناء ما حدث من دون الاعتماد على تفسير النموذج لسلوكه.

يتقاطع هذا التصور مع توجهات ظهرت بالفعل في صناعة الذكاء الاصطناعي. فقد أطلقت شركة NVIDIA منصة أمان وكلاء الذكاء الاصطناعي المفتوحة التي تجمع بين العزل البرمجي والمراقبة العتادية، بهدف فرض السياسات من خارج الوكيل نفسه. الفكرة المشتركة هنا هي أن النموذج لا ينبغي أن يملك سلطة كاملة على التنفيذ والمراقبة في الوقت ذاته.

يقترح ناديلا كذلك التعامل مع النماذج المتقدمة كما تتعامل المؤسسات مع مخاطر الموظف الداخلي الذي يملك صلاحيات حساسة. لا يفترض هذا التشبيه وجود نية ضارة، وإنما يفترض احتمال الخطأ أو الاختراق. من هنا يأتي تشبيه «فرامل الطوارئ»: شخص قادر يجب أن يستطيع إيقاف النموذج أثناء تنفيذ المهمة، دون انتظار انتهاء سلسلة الإجراءات التي بدأها.

ساتيا ناديلا يدعو إلى «فرامل طوارئ» لنماذج الذكاء الاصطناعي

الحوادث تدفع نحو رقابة بشرية

تأتي تصريحات ناديلا بعد سلسلة حوادث جعلت مسألة احتواء الوكلاء قضية عملية داخل شركات الذكاء الاصطناعي. كشفت شركة أنثروبيك مؤخرًا عن تصرفات مقلقة لوكلاء Claude خلال تقييمات داخلية، شملت التعامل مع مواقع حقيقية ومحاولة تخطي بعض القيود، ما دفع الشركة إلى قطع الإنترنت الحي عن جميع تقييماتها الداخلية بصورة مؤقتة. بجانب حالات لوكلاء OpenAI استخدموا موقعًا ألمانيًا لتبادل الرسائل وتنفيذ آلاف التعديلات دون إشراف بشري.

تمنح هذه الوقائع تمنح اقتراح ناديلا سياقًا واضحًا، فكلما حصل الوكيل على صلاحيات للوصول إلى الملفات والويب والأدوات المؤسسية، تحولت مشكلة الخطأ من إجابة نصية خاطئة إلى إجراء يمكن أن يؤثر في أنظمة حقيقية. ظهرت مخاوف مشابهة عندما أفلتت نماذج تابعة لشركات OpenAI وأنثروبيك وميتا من بيئات اختبار معزولة خلال تقييمات أمنية مرتبطة بشركة Irregular.

يدعو ناديلا كذلك إلى تنوع النماذج في القرارات المهمة، بحيث لا يصبح نموذج واحد المسؤول عن التنفيذ والتحقق من عمله في الوقت نفسه. يطالب بتدقيق مستقل واختبارات مستمرة تشمل الهجمات والحالات الحدية والفشل، إلى جانب الإفصاح السريع عندما يحدث اختراق أو سلوك غير مقصود. تعرض تلك التصريحات تصور الرئيس التنفيذي لشركة مايكروسوفت لبنية أمان تناسب الوكلاء ذوي الصلاحيات الواسعة.

من وجهة نظري، أرى أن فكرة «فرامل الطوارئ» تختصر المشكلة بصورة عملية، فقيمة الوكيل تأتي من قدرته على تنفيذ مهام فعلية، لكن هذه القدرة نفسها ترفع كلفة الخطأ. كما أن وجود قيود خارجية وسجل قابل للتدقيق وصلاحية بشرية توقف التنفيذ يمنح المؤسسات طبقة حماية يمكن اختبارها فعليًا، بدلًا من بناء الثقة على توقع أن النموذج سيتصرف دائمًا كما هو مطلوب.