شو اللي صار يوم 2 تمّوز
Anthropic نزّلت يوم 2 تمّوز تفصيل جديد عن حمايات Fable 5 الإلكترونية، ومعه مسوّدة أوّلية لإطار عمل (framework) لقياس خطورة محاولات كسر الحمايات (jailbreaks)، طوّروه مع شركاء Project Glasswing. بالمرة، فتحوا برنامج إبلاغ عام على HackerOne خاص بـ cyber jailbreaks — يعني أي باحث أمني يقدر يرسل اكتشافه بشكل منظّم.
هاد مش خبر تقني جاف. هاد بيتكلم عن شي بيمسّك كل شخص عم يستخدم Claude Fable 5: شو بيصير إذا واحد لقى طريقة يخلّي النموذج يعمل شي ما مفروض يعمله، وكيف Anthropic عم تحاول ترتّب الفوضى قبل ما تتفاقم.
شو يعني "jailbreak" بالضبط
ببساطة، الـ jailbreak هو أي طريقة بتخلّي النموذج يتجاوز قواعده. مش بس "اسأله شو ما بدك" — في تقنيات متطوّرة بتستخدم قصص معقّدة، سيناريوهات لعب أدوار، أو حتّى payloads مكتوبة بالـ code.
Fable 5 هاد أول نموذج من Anthropic يجي بـ safety classifiers متقدّمة — يعني "أربع فئات" للسلوك:
- ممنوع (prohibited): طلبات متل مساعدة بكتابة malware أو عمليات اختراق. النظام بيرفض مباشرة.
- ثنائي الاستخدام عالي الخطورة (high-risk dual-use): طلبات ممكن تنفّذ بشكل مشروع أو ضار. هون في نقاش.
- ثنائي الاستخدام منخفض الخطورة (low-risk dual-use): أدوات فيها احتمال خطر بس واقعياً نادر.
- آمن (benign): الطلب العادي.
اللي صار قبل هيك: النموذج كان يرفض أو يقبل بدون تفسير. هلّق، إذا تم الرفض، الـ API بترجع `stop_reason: "refusal"` كاستجابة ناجحة (HTTP 200) مع اسم الـ classifier اللي رفض. يعني المطوّر بيعرف ليش تم الرفض، والـ enterprise بتقدر تاخذ قرارها بنفسها.
ليش هاد الـ framework مهم
قبل هيك، كل مختبر كان عم يقيس خطورة الـ jailbreaks بطريقته. واحد بيقول "كارثة"، وآخر بيقول "بسيط". ما كان في مقياس موحّد. النتيجة: النقاش العام عن "هل AI خطير؟" كان قائم على انطباعات.
الـ framework الجديد بيحاول يحل هاد بـ:
- مقياس رقمي موحّد للخطورة — أي باحث، أي مختبر، أي حكومة بتقدر تقرأ نفس الرقم.
- تصنيف واضح للـ payload — مش بس "نجح" أو "ما نجح".
- قناة إبلاغ رسمية (HackerOne) — أي اكتشاف بيتسجّل، بيتدرّج، بيتنشر للناس اللي يهمّها.
بالمختصر: بدل ما السوق يحكم بانطباعات، صار في مقياس فعلي. هاد بيسهّل النقاش عن قيود التصدير، وعن متى يجب على المختبر يسحب نموذج من السوق، وكمان بيسهّل على الباحثين الشغل بدون ما يخافوا من ملاحقة قانونية.
شو الجديد عملياً للباحثين
قبل هيك، إذا باحث لقى jailbreak بـ Claude، كان عنده خيارين سيّئين:
- ينشره علناً — فيخلي المستخدمين العاديين يستفيدوا، بس بنفس الوقت يفتح الباب للمشاكل.
- يبعت لـ Anthropic بس — فيأخذ وقت طويل، وما حدا بيعرف شو صار.
البرنامج الجديد على HackerOne بيعطي:
- مسار إبلاغ منظّم بـ scope واضح.
- اعتراف علني (public disclosure) بعد ما يصير في إصلاح.
- مكافآت (bounties) للأبحاث عالية الجودة — حسب شو مكتوب بـ scope.
إذا كنت باحث أمني أو مهتم بـ AI safety، هاد باب رسمي صار مفتوح. ما بقا مضطر تتواصل بشكل غير رسمي مع الشركة أو تخاف من الملاحقة.
⚡ جرّبها بنفسك
إذا كنت باحث أو مستخدم متقدّم:
- افتح صفحة Anthropic على HackerOne وتفقّد الـ scope. شو الأنواع المقبولة للإبلاغ، وشو مش مقبول.
- إذا عندك اختبار آمن لـ Fable 5 (مش على production) وجربت prompt يعمل refusal، سجّل الـ prompt والـ response بالتفصيل.
- قبل ما تبلّغ، اقرأ شروط البرنامج: شو بيصير بالاعتراف العلني، متى رح تتواصل معك، وهل في مكافأة.
إذا كنت مستخدم عادي:
- الخبر هاد ما بيغيّر شو بتعمل بـ Claude — استخدمه متل قبل.
- بس إذا شفت بأخبار تالية "Anthropic أوقفت jailbreak جديد"، هلّق بتعرف هاد جزء من برنامج منظّم، مش فوضى.
خلاصة بجملة وحدة
لأول مرة، عندنا مقياس موحّد + باب إبلاغ رسمي لمحاولات كسر حمايات نماذج الـ AI الحدودية. هاد بيخلّي النقاش العام عن أمان الـ AI قائم على أرقام مش انطباعات، وبيعطي الباحثين مسار واضح بدل الفوضى اللي كانت قبل.