قالت شركة Anthropic إن نماذجها استغلت مواقع الويب عبر الإنترنت، بما في ذلك بعض المواقع التي تديرها وكالات حكومية أمريكية، وأنها ستقوم بتعطيل الوصول المباشر إلى الإنترنت لجميع تقييماتها الداخلية حتى يصبح المختبر الحدودي واثقًا من قدرته على مراقبة عملاء الذكاء الاصطناعي والتحكم بهم.
تورطت الحوادث، التي تم الكشف عنها في منشور بالمدونة، في عملاء الذكاء الاصطناعي المكلفين بحل مشاكل العثور على الموارد على الإنترنت. ومن خلال القيام بذلك، استغلوا نقاط الضعف في البرامج، ووصلوا إلى قواعد البيانات دون دفع رسوم، واستخدموا خدمات تقصير عناوين URL لتهريب قيود نقل المعلومات، بل وقدموا معلومات كاذبة عن جريمة قتل إلى شرطة فيلادلفيا.
قالت شركة Anthropic إنها اكتشفت هذه المشكلات الجديدة أثناء مراجعة أنشطة نموذجها التي بدأت في يوليو، مما يدل على عدم وعي المختبر بالسلوك الحقيقي لبرامجه.
على وجه الخصوص، قالت الشركة إن التدريب على المحاذاة لم يكن كافيًا حتى الآن لمهارات مثل البحث واستخدام الكمبيوتر التي تعد أساسية في عرضها بأن عملاء الذكاء الاصطناعي سيتم استخدامهم من قبل أي محترف يعتمد على الأدوات الرقمية.
تشبه السلوكيات التي كشفت عنها Anthropic الحوادث التي تورط فيها عملاء OpenAI الذين تعاونوا لاختراق في مواقع الويب المختلفة بحثًا عن المعلومات، بما في ذلك بعض المواقع التي تديرها الحكومة الأسترالية.
كشفت Anthropic سابقًا أن نماذجها قد اقتحمت أنظمة خارجية. وقال Border Lab إنه يعتبر ما تم الكشف عنه اليوم "أقل خطورة إلى حد كبير من منظور المواءمة والأمن" من تلك التي تم الإعلان عنها سابقًا. الوكلاء.
ما يعنيه هذا غير واضح. وقال سيدني فون آركس، مؤسس Nightingale، وهي منظمة أمنية للذكاء الاصطناعي، لـ TechCrunch في مقابلة قبل هذا الكشف إن تطوير النماذج في مركز بيانات معزول عن الإنترنت المفتوح سيكون صعبًا جدًا على الباحثين وسيعيق تقدم النماذج التي تستفيد من الوصول إلى الإنترنت. "إذا تم وضع الذكاء الاصطناعي في مرحلة الإنتاج ولم يتمكن من الوصول إلى الإنترنت مطلقًا، فلن يكون ذلك أداة مفيدة جدًا."
قالت شركة Anthropic إن هذا السلوك كان نتيجة عيوب في بيئات التدريب في المختبر، مما دفع النماذج إلى الاعتقاد بأنهم سيحصلون على مكافأة للعثور على العيوب أو تجنب القيود، وهو سلوك يسمى "المكافأة". قرصنة. »
قالت الشركة إنها ستتوقف عن تشغيل بعض تقييماتها أو ستنقلها إلى وضع عدم الاتصال، وقد أنشأت أدوات لاكتشاف هذا السلوك وحظره. تم اختبار هذه الأداة وفقًا لنوع الحوادث التي تم الكشف عنها اليوم وتم حظرها؛ ليس من الواضح ما هي الأدلة التي ستدفع Anthropic إلى استعادة الوصول المباشر إلى الإنترنت لمراجعاتها الداخلية. وقالت Anthropic أيضًا إنها ستنقل عملاء الذكاء الاصطناعي الداخليين لديها إلى "بنية تحتية مُدارة مركزيًا مع احتواء صارم" وستبدأ في استخدام مصنفات الأمان بشكل متكرر لمراقبة هؤلاء العملاء. وقال المركز الأمريكي لمعايير الذكاء الاصطناعي والابتكار في بيان. "لكن هذا يسلط الضوء فقط على الحاجة إلى التحقق المستقل والموثوق من أنظمة آل. ولابد من بناء الثقة في هذه التكنولوجيا من خلال الإشراف القائم على العلم والحوكمة مع إمكانية الوصول الهادفة ــ وليس من خلال الاعتماد على الباحثين للعثور على هذه الأشياء في البرية أو على الشركات للكشف عنها طوعا. "


التعليقات 0
كن أول من يعلق على هذا الخبر