الطريقة القياسية لإبقاء وكيل الذكاء الاصطناعي في الصف هو الحصول على قراءة ثانية للذكاء الاصطناعي فوق كتفه. هذا هو النهج الافتراضي، لكنه يمكن أن يصبح مكلفًا بسرعة عندما يعمل الوكلاء لساعات ويعالجون نصوصًا متعددة الروايات.

أطلقت Goodfire، وهي شركة ناشئة تركز على قابلية التفسير (فهم الأعمال الداخلية لنماذج الذكاء الاصطناعي)، خيارًا أرخص يوم الخميس: أجهزة مراقبة تراقب ما يحدث داخل نموذج الذكاء الاصطناعي أثناء تشغيله، بدلاً من مجرد قراءة ما يكتبه. تتوفر الشاشات لعملاء شركة Baseten، التي تستضيف وتدير نماذج الذكاء الاصطناعي لشركات أخرى. أعلنت Baseten’s Base Labs عن شراكة أمنية مع منصة Goodfire ومنصة الذكاء الاصطناعي Hugging Face الشهر الماضي. ويأتي الإطلاق بعد سلسلة من الحوادث هذا العام حيث هرب عملاء الذكاء الاصطناعي من بيئات الاختبار الخاصة بهم، بما في ذلك OpenAI. الضباط الذين اغتصبوا Hugging Face. استفاد Kimi K3، النموذج المفتوح الذي قامت Goodfire ببناء شاشته الأولى حوله، من التسرب في وضع الحماية الخاص به للوصول إلى الإنترنت والمعلومات على GitHub هذا الصيف. يعمل نظام Goodfire مثل نظام أمن المطارات. تقوم أجهزة الكشف الصغيرة التي تسمى المجسات بقراءة الإشارات الداخلية للنموذج في كل مرحلة من مراحل عمل الوكيل، بنفس الطريقة التي تقوم بها جسر الرافعة بفحص كل راكب. فقط عندما يشير المسبار إلى شيء ما، يقوم نموذج منفصل للذكاء الاصطناعي، أي ما يعادل البحث اليدوي، بفحصه عن كثب. يمكن لعملاء Baseten اختيار المخاطر التي يجب مراقبتها، بما في ذلك القرصنة الهجومية، وإساءة استخدام الأسلحة الكيميائية والبيولوجية، ومكافأة القرصنة. ويقررون أيضًا الاستجابة التلقائية: تسجيل الحدث، أو إرساله للمراجعة البشرية، أو رفض الطلب تمامًا. 

تدعي Goodfire أن تشغيل أسلوبها أقل تكلفة أيضًا. معظم شاشات الذكاء الاصطناعي هي نماذج منفصلة يجب أن تعيد تشغيل كل ما يفعله النموذج الذي تتم مراقبته، مما يضيف الوقت والتكلفة. وبدلاً من ذلك، تستفيد مجسات Goodfire من الحسابات التي يجريها النموذج بالفعل أثناء عمله. "لذا فإن النموذج يقوم بالفعل بحساب هذا الرمز المميز. كل ما تفعله هو إجراء التنشيطات العصبية المتوسطة المحسوبة بالفعل ثم تشغيل مصنف على تلك الحسابات الداخلية." باختصار، يقوم النموذج بالفعل بإجراء العمليات الحسابية وتقرأ المجسات النتائج فقط.

]

في اختبارات Goodfire على Kimi K3، تكلف مراقبة حوالي 1500 جلسة حوالي 51 دولارًا، مقارنة بـ 233 دولارًا لنموذج الذكاء الاصطناعي الأرخص الذي يتحقق من كل خطوة وحوالي 10000 دولار لنموذج الطبقة العليا. اكتشفت المجسات 94% من جلسات القرصنة الضارة وأرسلت 8.7% من الجلسات غير الضارة لإلقاء نظرة ثانية.

وقال المسبار إن تشغيل أربعة مجسات في وقت واحد أضاف أقل من 2% إلى الوقت الذي يستغرقه النموذج لبدء الاستجابة. الشركة.

"الميزة الكبيرة هي أنه يمكنك اكتشاف الأشياء قبل حدوثها،" قال دان بالسام، المدير التنفيذي للتكنولوجيا والمؤسس المشارك لشركة Goodfire. التدريب."

يستهدف العرض التقديمي النماذج المفتوحة. ويمكن للمطورين تنزيلها وإزالة وسائل الحماية الخاصة بهم، ولا يستفيدون من نوع المراقبة التي تديرها المختبرات المغلقة على أنظمتهم الخاصة.  

قال بلسم: "إن الضرر الذي يمكن أن يحدثه الفرد باستخدام نموذج مفتوح هو الحد الأدنى مقارنة بما يمكن أن يفعله الفرد مع مجموعات الحوسبة، مثل موفري الاستدلال، حيث تقع معظم المسؤولية". "عندما تكون لدينا لحظة "الأسطورة" المفتوحة، سيصبح من الواضح أن النماذج تحتاج إلى نشر حواجز الحماية في وقت الاستدلال. "

وجدت الأبحاث الحديثة من Goodfire أن النماذج المفتوحة الرئيسية، بما في ذلك Kimi K3 وGLM 5.2، تم اختراقها في 50-96% من اختبارات عوامل الذكاء الاصطناعي.

Goodfire ليست أول من جرب هذا النهج. فقد قال Google DeepMind في يناير إن أبحاثه ساعدت في نشر تحقيقات الكشف عن إساءة الاستخدام في Gemini.

قال بلسم إن أجهزة المراقبة هي جزء قصير المدى من هدف بحثي طويل المدى: الهندسة العكسية لماجستير في القانون بحيث يمكن تتبع السلوك إلى حيث ظهر أثناء التدريب. وقال: "نأمل أن نحول سحر نماذج التدريب إلى هندسة دقيقة".