Anthropic מפרטת את מנגנוני ההגנה של Claude Fable 5 בתחום הסייבר ומציעה סולם חומרה משותף למעקפי הגנה
מאת VCA Newsroom
ב-2 ביולי פרסמה Anthropic מבט מעמיק על מנגנוני ההגנה שמאחורי Claude Fable 5, המודל בעל היכולות הגבוהות שאותו פרסה מחדש ב-1 ביולי לאחר השעיה קצרה בשל בקרות ייצוא אמריקאיות. הפרסום נוגע לכל מי שבונה בעזרת כלי קוד מבוססי בינה מלאכותית, משום שהוא מפרט בדיוק כיצד מודל חזית מחליט באילו בקשות הקשורות לאבטחה הוא יסייע — ובאילו לא.
ארבע דרגות במקום חסימה גורפת
במקום לסרב לכל דבר שנוגע לאבטחה, Anthropic מספרת ש-Fable 5 מריצה בקשות דרך מסווגים הממיינים אותן לארבע קטגוריות:
- שימוש אסור — פעילויות בעלות ערך הגנתי מועט עד אפסי, אשר נחסמות.
- שימוש כפול בסיכון גבוה — טכניקות שנוצלות לרעה בהיקף רחב על ידי תוקפים אך יש להן גם שימושים לגיטימיים; אלה נחסמות עד להטמעת בקרות הרשאה חזקות יותר.
- שימוש כפול בסיכון נמוך — עבודה הגנתית ברובה, שנתונה למעקב ולעיתים נחסמת.
- שימוש תמים — עבודה שגרתית שאינה גורמת נזק, מותרת תוך מעקב.
המסקנה המעשית עבור מפתחים: משימות שגרתיות כמו כתיבת קוד מאובטח, ניהול טלאים, ניתוח יומנים ותגובה לאירועים נופלות בסלי השימוש התמים או הסיכון הנמוך, ואמורות לעבוד כרגיל. Anthropic מציינת שהמסווגים נוטים לצד הזהירות, כך שחסימות שווא מזדמנות של עבודת אבטחה לגיטימית עדיין עשויות להתרחש.
סולם חומרה למעקפי הגנה
החלק החדשני יותר הוא הצעה לסולם חומרת מעקפי הגנה בסייבר (CJS), שפותח בשיתוף שותפי Glasswing ובהם Amazon, Microsoft ו-Google. "מעקף הגנה" (jailbreak) הוא תחבולת הנחיה הגורמת למודל לעקוף את מנגנוני ההגנה של עצמו; כיום אין לתעשייה דרך משותפת לומר עד כמה מעקף נתון חמור.
סולם ה-CJS נע מ-CJS-0 (מידעי) ועד CJS-4 (קריטי), ומדרג כל מעקף הגנה בארבעה צירים:
- תוספת יכולת — עד כמה הוא מקדם תוקף מעבר לכלים הקיימים.
- רוחב היכולת — כמה משימות התקפיות נבדלות אותה תחבולה פותחת.
- קלות ההנשקה — המאמץ הנדרש כדי להפעיל אותו בפועל.
- ניתנות לגילוי — כמה בקלות גורם איום יכול למצוא את הטכניקה.
הרעיון משקף את האופן שבו CVSS מדרג פגיעויות תוכנה: אוצר מילים משותף מאפשר לספקים ולחוקרים לתעדף באופן עקבי במקום להתווכח האם ניצול נתון "רציני".
הזמנת חוקרים פנימה
לצד המסגרת, Anthropic השיקה תוכנית HackerOne שבה חוקרי אבטחה יכולים להגיש לבחינה מעקפי הגנה בסייבר שהם מגלים ב-Fable 5. החברה אומרת שהמסווג שהיא פרסה בעת הפריסה מחדש חוסם יותר מ-99% מהניסיונות לשחזר את מעקף ההגנה הספציפי שהוביל להשהיה המוקדמת.
מדוע זה חשוב לאנשים שלומדים לבנות
אם אתם לומדים להשיק תוכנה בעזרת בינה מלאכותית, זהו צוהר מועיל לאופן שבו הכלים חושבים על סיכון. שתי תובנות: ראשית, עבודת אבטחה הגנתית וחינוכית נתמכת במפורש, ולכן אין לצפות שעוזר יכולתי יסרב למשימות רגילות כמו כתיבת אימות קלט או סקירת הקוד שלכם לאיתור פגמים. שנית, ספקי המודלים נעים לעבר תקני בטיחות משותפים וניתנים למדידה במקום מדיניות נקודתית — סימן להתבגרות המערכת האקולוגית, ומסגרת שמעבדות אחרות עשויות לאמץ.
Anthropic מבהירה שסולם ה-CJS הוא טיוטה מוקדמת שנועדה לפתוח שיח בתעשייה, ולא תקן גמור. אך זהו צעד מוחשי לעבר התייחסות לאירועי בטיחות בבינה מלאכותית באותה קפדנות שעולם האבטחה כבר מיישם על באגים בתוכנה.
SOURCES
- Anthropic — More details on Fable 5's cyber safeguards and our jailbreak framework
- Anthropic — Redeploying Claude Fable 5
- Cyber Security News — Anthropic Details Claude Fable 5 Cybersecurity Safeguards and Jailbreak Framework
- GBHackers — Anthropic Unveils Cyber Jailbreak Severity Framework for Claude Fable 5 Safeguards
Auto-generated by Vibe Coding Academy on July 6, 2026, grounded in the real sources linked above. We review for accuracy, but please verify time-sensitive details against the primary sources.
Build Blueprint · Builder
יש לכם רעיון? קבלו את המפרט שסוכן הבינה המלאכותית שלכם יכול לבנות ממנו.
תארו כל מוצר וקבלו מתווה בנייה מלא — סטאק, מודל נתונים, מסכים, ממשקי API, ופרומפט מוכן להדבקה עבור Claude Code או Cursor. ייצוא ל-PDF.
פתחו את ה-Blueprint