Anthropic ने Claude Fable 5 के साइबर सुरक्षा उपायों और जेलब्रेक के लिए साझा गंभीरता पैमाने का विवरण दिया
VCA Newsroom द्वारा
2 जुलाई को, Anthropic ने Claude Fable 5 के पीछे के सुरक्षा उपायों पर एक विस्तृत नज़र प्रकाशित की — यह वही उच्च-क्षमता वाला मॉडल है जिसे उसने अमेरिकी निर्यात-नियंत्रण के तहत एक संक्षिप्त निलंबन के बाद 1 जुलाई को फिर से तैनात किया। यह पोस्ट AI कोडिंग टूल्स के साथ निर्माण करने वाले हर व्यक्ति के लिए मायने रखती है, क्योंकि यह ठीक-ठीक बताती है कि एक अग्रणी मॉडल कैसे तय करता है कि किन सुरक्षा-संबंधी अनुरोधों में वह मदद करेगा — और किनमें नहीं।
एकसमान रोक के बजाय चार श्रेणियाँ
सुरक्षा से जुड़ी हर चीज़ को अस्वीकार करने के बजाय, Anthropic का कहना है कि Fable 5 अनुरोधों को क्लासिफ़ायर्स के ज़रिए चलाता है जो उन्हें चार श्रेणियों में बाँटते हैं:
- निषिद्ध उपयोग — ऐसी गतिविधियाँ जिनका रक्षात्मक मूल्य बहुत कम या शून्य है, जिन्हें रोक दिया जाता है।
- उच्च-जोखिम वाला दोहरा उपयोग — ऐसी तकनीकें जिनका हमलावर व्यापक रूप से दुरुपयोग करते हैं पर जिनके वैध उपयोग भी हैं; इन्हें मज़बूत प्राधिकरण नियंत्रण आने तक रोका जाता है।
- कम-जोखिम वाला दोहरा उपयोग — ज़्यादातर रक्षात्मक कार्य, जिसकी निगरानी की जाती है और कभी-कभी रोका जाता है।
- सौम्य उपयोग — रोज़मर्रा का कार्य जो कोई नुकसान नहीं पहुँचाता, निगरानी के साथ अनुमति प्राप्त।
डेवलपर्स के लिए व्यावहारिक निष्कर्ष: सुरक्षित कोडिंग, पैच प्रबंधन, लॉग विश्लेषण और घटना प्रतिक्रिया जैसे नियमित कार्य सौम्य या कम-जोखिम वाली श्रेणियों में आते हैं और सामान्य रूप से काम करने चाहिए। Anthropic बताता है कि क्लासिफ़ायर सावधानी की ओर झुकते हैं, इसलिए वैध सुरक्षा कार्य पर कभी-कभार ग़लत रोक फिर भी लग सकती है।
जेलब्रेक के लिए एक गंभीरता पैमाना
अधिक नवीन हिस्सा है एक प्रस्तावित साइबर जेलब्रेक गंभीरता (CJS) पैमाना, जिसे Glasswing के साझेदारों — जिनमें Amazon, Microsoft और Google शामिल हैं — के साथ विकसित किया गया। "जेलब्रेक" एक प्रॉम्प्ट-तरकीब है जो किसी मॉडल को अपने ही सुरक्षा उपायों को दरकिनार करने पर मजबूर कर देती है; आज उद्योग के पास यह कहने का कोई साझा तरीका नहीं है कि कोई दिया गया जेलब्रेक कितना गंभीर है।
CJS पैमाना CJS-0 (सूचनात्मक) से लेकर CJS-4 (गंभीर) तक चलता है और प्रत्येक जेलब्रेक को चार आयामों पर आँकता है:
- क्षमता में वृद्धि — यह किसी हमलावर को मौजूदा टूल्स से कितना आगे ले जाता है।
- क्षमता की व्यापकता — वही तरकीब कितने अलग-अलग आक्रामक कार्यों को खोल देती है।
- हथियार बनाने की आसानी — इसे वास्तव में तैनात करने के लिए ज़रूरी मेहनत।
- खोज-योग्यता — कोई ख़तरा-कर्ता इस तकनीक को कितनी आसानी से पा सकता है।
यह विचार उस तरीके को दर्शाता है जिससे CVSS सॉफ़्टवेयर कमज़ोरियों को स्कोर करता है: एक साझा शब्दावली विक्रेताओं और शोधकर्ताओं को इस पर बहस करने के बजाय कि कोई एक्सप्लॉइट "गंभीर" है या नहीं, संगत रूप से प्राथमिकता तय करने देती है।
शोधकर्ताओं को आमंत्रित करना
इस ढाँचे के साथ-साथ, Anthropic ने एक HackerOne कार्यक्रम शुरू किया जहाँ सुरक्षा शोधकर्ता Fable 5 में खोजे गए साइबर जेलब्रेक समीक्षा के लिए जमा कर सकते हैं। कंपनी का कहना है कि पुनः-तैनाती पर उसने जो क्लासिफ़ायर लगाया, वह उस विशिष्ट जेलब्रेक को दोहराने के 99% से अधिक प्रयासों को रोक देता है जिसने पहले वाला विराम प्रेरित किया था।
निर्माण सीखने वालों के लिए यह क्यों मायने रखता है
यदि आप AI की मदद से सॉफ़्टवेयर तैयार करना सीख रहे हैं, तो यह इस बात की एक उपयोगी झलक है कि ये टूल्स जोखिम के बारे में कैसे सोचते हैं। दो बातें: पहली, रक्षात्मक और शैक्षिक सुरक्षा कार्य को स्पष्ट रूप से समर्थन प्राप्त है, इसलिए आपको यह उम्मीद नहीं करनी चाहिए कि एक सक्षम सहायक इनपुट वैलिडेशन लिखने या अपने ही कोड में खामियों की समीक्षा करने जैसे सामान्य कार्यों को अस्वीकार कर देगा। दूसरी, मॉडल प्रदाता एकबारगी नीतियों के बजाय साझा, मापने योग्य सुरक्षा मानकों की ओर बढ़ रहे हैं — यह इस बात का संकेत है कि पारिस्थितिकी-तंत्र परिपक्व हो रहा है, और एक ऐसा ढाँचा जिसे अन्य प्रयोगशालाएँ अपना सकती हैं।
Anthropic स्पष्ट है कि CJS पैमाना एक शुरुआती मसौदा है जिसका उद्देश्य उद्योग में बातचीत शुरू करना है, न कि कोई तैयार मानक। लेकिन यह AI सुरक्षा घटनाओं को उसी कठोरता से बरतने की दिशा में एक ठोस कदम है जो सुरक्षा जगत पहले से ही सॉफ़्टवेयर बग्स पर लागू करता है।
SOURCES
- Anthropic — More details on Fable 5's cyber safeguards and our jailbreak framework
- Anthropic — Redeploying Claude Fable 5
- Cyber Security News — Anthropic Details Claude Fable 5 Cybersecurity Safeguards and Jailbreak Framework
- GBHackers — Anthropic Unveils Cyber Jailbreak Severity Framework for Claude Fable 5 Safeguards
Auto-generated by Vibe Coding Academy on July 6, 2026, grounded in the real sources linked above. We review for accuracy, but please verify time-sensitive details against the primary sources.
Build Blueprint · Builder
कोई आइडिया है? वह स्पेक पाएँ जिससे आपका AI एजेंट बना सके।
किसी भी प्रोडक्ट का वर्णन करें और एक संपूर्ण बिल्ड ब्लूप्रिंट पाएँ — स्टैक, डेटा मॉडल, स्क्रीन, API और Claude Code या Cursor के लिए तैयार-पेस्ट प्रॉम्प्ट। PDF में एक्सपोर्ट करें।
ब्लूप्रिंट खोलें