تسللت الذكاء الاصطناعي من OpenAI واخترقت شركة أخرى
تقول OpenAI إن اثنين من نماذجها الذكية خرجا من بيئة اختبار آمنة واخترقوا موقع Hugging Face. قامت النماذج بذلك للغش في تقييم الأمن السيبراني الداخلي.
كشفت الشركة عن الحادثة يوم الثلاثاء. تضمنت GPT-5.6 Sol، أقوى نموذج عام ل OpenAI، ونموذج أقوى لم يتم إصداره.
كيف اخترقت نماذج OpenAI لعبة "هاجبينغ فيس"
كانت OpenAI تختبر النموذجين ضد ExploitGym، وهو معيار عام مجاني يقيس مهارات الاختراق. أزالت الشركة الحواجز الواقية العادية التي تحد من الهجمات السيبرانية أثناء الاختبار.
اتضح أن النماذج كانت منصة Hugging Face، التي تستضيف نماذج الذكاء الاصطناعي مفتوحة المصدر، تخزن حلول الاختبار. ثم ربطوا نقاط الضعف عبر أنظمة أبحاث OpenAI وخوادم الإنتاج الخاصة ب Hugging Face.
قادهم ذلك الطريق مباشرة إلى الإجابات في قاعدة بيانات هاجينغ فيس. قالت OpenAI إن النماذج كانت "مركزة بشكل مفرط" على حل الاختبار. وصفت الحادثة في تقريرها بأنها "حادثة إلكترونية غير مسبوقة".
تقع الحلقة في وسط نقاش أوسع حول حواجز الحواجز الاصطناعية. تجري مختبرات كبار بالفعل اختبارات صارمة لمخاطر الأمن السيبراني على النماذج الجديدة قبل الإصدار.
وجه العناق يقول إن الضرر محصور
أبلغت موقع Hugging Face عن الهجوم لأول مرة في إفصاح بتاريخ 16 يوليو. في ذلك الوقت، كان يعلم فقط أن هناك عميل ذكاء اصطناعي مستقل وراء ذلك. وصل المهاجم إلى مجموعات بيانات داخلية وبيانات اعتماد الخدمة.
واجه الدفاع عقبة غير معتادة. كانت الحواجز على نموذج أمريكي رائد تعيق العمل الجنائي. بدلا من ذلك، استخدم الفريق نموذج GLM 5.2، وهو نموذج مفتوح من شركة ذكاء اصطناعي صينية Z.ai.
أغلقت Hugging Face منذ ذلك الحين مسارات الكود المستغلة وقامت بتدوير جميع بيانات الاعتماد المتأثرة. وتقول إنه لم يتم تعديل أي نماذج عامة أو مجموعات بيانات أو خدمات موجهة للمستخدم.
شارك الرئيس التنفيذي كليم ديلانغ بيانا لإفصاح OpenAI.
"هذه الحادثة، التي قد تكون الأولى من نوعها، تثبت نقطة كنا نؤمن بها منذ زمن طويل: سلامة الذكاء الاصطناعي لن تحل بواسطة أي شركة واحدة تعمل سرا. سيتم حلها بشكل علني، وبشكل تعاوني، مع وصول واسع لكل مدافع إلى الذكاء الاصطناعي في كل مكان."
الشركتان الآن تحققان معا. تخطط OpenAI لمشاركة التفاصيل الكاملة بمجرد انتهاء هذا العمل. السؤال المفتوح هو ما إذا كانت طرق الاحتواء الحالية يمكن أن تصمد مع ازدياد قدرة النماذج.