Anthropic تشرح ضمانات الأمن السيبراني في Claude Fable 5 وتقترح مقياساً موحداً لخطورة اختراقات الحماية
بقلم VCA Newsroom
في الثاني من يوليو، نشرت Anthropic نظرة مفصّلة على الضمانات التي تقف خلف Claude Fable 5، النموذج عالي القدرات الذي أعادت نشره في الأول من يوليو بعد تعليق قصير بسبب ضوابط التصدير الأمريكية. تهمّ هذه المدونة كل من يبني باستخدام أدوات البرمجة المعتمدة على الذكاء الاصطناعي، لأنها توضّح بدقة كيف يقرر النموذج المتقدّم أي الطلبات المتعلقة بالأمن سيساعد فيها — وأيها لن يفعل.
أربع فئات بدلاً من حظر شامل
بدلاً من رفض أي شيء يمسّ الأمن، تقول Anthropic إن Fable 5 يمرّر الطلبات عبر مصنّفات تفرزها ضمن أربع فئات:
- الاستخدام المحظور — أنشطة ذات قيمة دفاعية ضئيلة أو معدومة، وهي محظورة.
- الاستخدام المزدوج عالي الخطورة — تقنيات يسيء المهاجمون استخدامها على نطاق واسع لكن لها أيضاً استخدامات مشروعة؛ وهذه محظورة ريثما تتوفر ضوابط تفويض أقوى.
- الاستخدام المزدوج منخفض الخطورة — عمل دفاعي في معظمه، يخضع للمراقبة ويُحظر أحياناً.
- الاستخدام الحميد — عمل يومي لا يسبب أي ضرر، ومسموح به مع المراقبة.
الخلاصة العملية للمطوّرين: المهام الروتينية مثل البرمجة الآمنة وإدارة التصحيحات وتحليل السجلات والاستجابة للحوادث تقع ضمن فئتي الاستخدام الحميد أو منخفض الخطورة، ومن المفترض أن تعمل بشكل طبيعي. وتشير Anthropic إلى أن المصنّفات تميل إلى جانب الحذر، لذا قد تحدث أحياناً حالات حظر خاطئة لعمل أمني مشروع.
مقياس خطورة لاختراقات الحماية
الجزء الأكثر جِدّة هو مقياس مقترح لـخطورة اختراق الحماية السيبراني (CJS)، طُوّر بالتعاون مع شركاء Glasswing ومن بينهم Amazon وMicrosoft وGoogle. "اختراق الحماية" (jailbreak) هو حيلة في الطلب تدفع النموذج إلى تجاوز ضماناته الخاصة؛ واليوم لا تملك الصناعة طريقة موحدة للتعبير عن مدى سوء اختراق معيّن.
يمتد مقياس CJS من CJS-0 (إعلامي) إلى CJS-4 (حرِج)، ويقيّم كل اختراق حماية على أربعة محاور:
- مكسب القدرة — إلى أي مدى يتجاوز الأدوات الحالية لمصلحة المهاجم.
- اتساع القدرة — كم عدد المهام الهجومية المتميزة التي تفتحها الحيلة نفسها.
- سهولة التسليح — الجهد اللازم لنشرها فعلياً.
- قابلية الاكتشاف — مدى سهولة عثور جهة تهديد على التقنية.
تحاكي الفكرة الطريقة التي يقيّم بها CVSS الثغرات البرمجية: مفردات مشتركة تتيح للموردين والباحثين تحديد الأولويات باتساق بدلاً من الجدال حول ما إذا كانت ثغرة معينة "خطيرة".
دعوة الباحثين للمشاركة
إلى جانب الإطار، أطلقت Anthropic برنامج HackerOne حيث يمكن لباحثي الأمن تقديم اختراقات الحماية السيبرانية التي يكتشفونها في Fable 5 للمراجعة. وتقول الشركة إن المصنّف الذي نشرته عند إعادة النشر يحظر أكثر من 99% من محاولات إعادة إنتاج اختراق الحماية المحدّد الذي أدّى إلى التوقف السابق.
لماذا يهمّ ذلك من يتعلّمون البناء
إذا كنت تتعلّم إطلاق البرمجيات بمساعدة الذكاء الاصطناعي، فهذه نافذة مفيدة على كيفية تفكير الأدوات في المخاطر. خلاصتان: أولاً، العمل الأمني الدفاعي والتعليمي مدعوم صراحةً، لذا لا ينبغي أن تتوقع من مساعد قدير أن يرفض مهام عادية مثل كتابة التحقق من المدخلات أو مراجعة شيفرتك بحثاً عن العيوب. ثانياً، يتجه مزوّدو النماذج نحو معايير أمان مشتركة وقابلة للقياس بدلاً من السياسات الفردية — وهي علامة على نضج المنظومة، وإطار قد تتبناه مختبرات أخرى.
توضّح Anthropic أن مقياس CJS مسودّة مبكّرة تهدف إلى بدء نقاش في الصناعة، وليس معياراً مكتملاً. لكنه خطوة ملموسة نحو التعامل مع حوادث أمان الذكاء الاصطناعي بالصرامة نفسها التي يطبّقها عالم الأمن بالفعل على عيوب البرمجيات.
SOURCES
- Anthropic — More details on Fable 5's cyber safeguards and our jailbreak framework
- Anthropic — Redeploying Claude Fable 5
- Cyber Security News — Anthropic Details Claude Fable 5 Cybersecurity Safeguards and Jailbreak Framework
- GBHackers — Anthropic Unveils Cyber Jailbreak Severity Framework for Claude Fable 5 Safeguards
Auto-generated by Vibe Coding Academy on July 6, 2026, grounded in the real sources linked above. We review for accuracy, but please verify time-sensitive details against the primary sources.
Build Blueprint · Builder
لديك فكرة؟ احصل على المواصفات التي يمكن لوكيل الذكاء الاصطناعي الخاص بك البناء منها.
صِف أي منتج واحصل على مخطط بناء كامل — حزمة التقنيات ونموذج البيانات والشاشات وواجهات برمجة التطبيقات، إضافة إلى موجّه جاهز للصق في Claude Code أو Cursor. صدّره إلى PDF.
افتح المخطط