OpenAI تطلق GPT‑Red.. أداة آلية لاختبار هجمات الحقن لتعزيز صلابة GPT‑5.6 Sol

أعلنت شركة OpenAI عن تطوير نموذج داخلي جديد يحمل اسم GPT‑Red، وهو أداة آلية لاختبار الثغرات عبر هجمات Prompt Injection بهدف تعزيز صلابة النماذج المتقدمة مثل GPT‑5.6 Sol قبل نشرها على نطاق واسع. تأتي هذه الخطوة في ظل تصاعد المخاوف من قدرة المهاجمين على استغلال التعليمات المضللة المدمجة في محتوى بريء ظاهرياً، مثل رسائل البريد الإلكتروني أو صفحات الويب أو مستودعات الأكواد، لإجبار النماذج على تنفيذ أوامر غير مرغوبة.

آلية عمل GPT‑Red

يعمل النموذج بطريقة مشابهة لفِرق Red Teaming البشرية، حيث يقوم بإرسال تعليمات، مراقبة استجابة النموذج، ثم تكرار العملية حتى يصل إلى هدف خبيث مثل استخراج بيانات حساسة أو تعطيل آليات الحماية. وقد تم دمج GPT‑Red في عملية التدريب عبر أسلوب التعلم التعزيزي باللعب الذاتي (Self‑Play RL)، حيث يتنافس النموذج المهاجم مع مجموعة من نماذج دفاعية متنوعة، ما يتيح اكتشاف أنماط جديدة من الفشل وبناء وسائل مضادة أكثر فعالية.

نتائج الاختبارات والدراسات

أظهرت الاختبارات أن GPT‑5.6 Sol أصبح أكثر صلابة أمام هجمات الحقن المباشر، حيث سجل معدل فشل أقل بست مرات مقارنة بالنموذج السابق GPT‑5.5. من أبرز السيناريوهات التي جرى اختبارها:

  • استخراج أدلة داخلية.
  • تعليمات دفع احتيالية.
  • سرقة بيانات اعتماد AWS.
  • تعطيل المصادقة الثنائية (2FA).
  • رفع ملفات حساسة.
  • حقن سكربتات خارجية.

كما كشف الإصدار المبكر من GPT‑Red عن فئة جديدة من الهجمات المباشرة تُعرف باسم Fake Chain‑of‑Thought (CoT)، والتي حققت نسب نجاح تجاوزت 95% ضد GPT‑5.1، لكنها انخفضت إلى أقل من 10% أمام GPT‑5.6 Sol.

دراسات حالة واقعية

في تجربة عملية، استُخدم GPT‑Red ضد آلة بيع ذكية طورتها شركة Andon Labs، حيث تمكن النموذج من خفض سعر منتج مرتفع إلى الحد الأدنى المسموح (0.50 دولار)، وشراء منتج بقيمة 100 دولار بنفس السعر، إضافة إلى إلغاء طلب عميل آخر. وفي دراسة أخرى، هاجم النموذج وكيل أوامر مبني على GPT‑5.4 mini، ما أدى إلى تسريب بيانات حساسة في عدد أكبر من الحالات مقارنة بخط الأساس GPT‑5.5.

دلالات أمنية

تشير هذه التطورات إلى أن دمج أدوات آلية مثل GPT‑Red في عملية التدريب يعزز قدرة النماذج على مقاومة الهجمات المعقدة، ويقلل من فرص استغلالها في بيئات حقيقية. ومع ذلك، يبقى التحدي قائماً في مواجهة هجمات غير مباشرة أكثر تنوعاً، ما يستدعي استمرار تطوير تقنيات دفاعية متقدمة. كما شددت الشركة على أن GPT‑Red سيظل منفصلاً عن النماذج الإنتاجية، لضمان عدم وصول قدراته الهجومية إلى جهات خبيثة.

محمد وهبى
محمد وهبى
المقالات: 1303

اترك ردّاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *


The reCAPTCHA verification period has expired. Please reload the page.