بازگشت جهانی Claude Fable 5؛ Anthropic چگونه بحران جیلبریک، کنترل صادرات و امنیت مدلهای هوش مصنوعی را مدیریت کرد؟
Anthropic اعلام کرد دسترسی جهانی به Claude Fable 5 از تاریخ ۱۰ تیر ۱۴۰۵ دوباره برقرار شده است. این مدل پس از اعمال محدودیتهای کنترل صادراتی در ۲۲ خرداد ۱۴۰۵ بهصورت موقت برای همه کاربران غیرفعال شده بود. دلیل اصلی توقف، نگرانی درباره یک روش دور زدن حفاظها یا Jailbreak بود که در گزارشی از سوی پژوهشگران Amazon مطرح شد. اکنون Anthropic با آموزش یک طبقهبند ایمنی جدید، مدعی است تکنیک گزارششده را در بیش از ۹۹٪ موارد مسدود میکند.
مقدمه
بازگشت Claude Fable 5 فقط یک خبر ساده درباره فعال شدن دوباره یک مدل زبانی نیست؛ این اتفاق یکی از مهمترین نمونههای اخیر از چالشهای واقعی صنعت هوش مصنوعی مولد در سه حوزه حساس است: دسترسی جهانی، امنیت سایبری و کنترل ریسک جیلبریک مدلها.
در تاریخ ۲۲ خرداد ۱۴۰۵، دسترسی به دو مدل جدید Anthropic یعنی Claude Fable 5 و Claude Mythos 5 متوقف شد. دلیل این توقف، اعمال محدودیتهای فوری کنترل صادراتی و نبود سازوکار بلادرنگ برای احراز ملیت کاربران بود. اما ریشه فنی ماجرا به گزارشی بازمیگشت که نشان میداد میتوان با نوعی پرامپتدهی خاص، بخشی از حفاظهای Fable ۵ را دور زد و مدل را به شناسایی آسیبپذیریهای نرمافزاری و در یک مورد، تولید نمونه کد بهرهبرداری از آسیبپذیری وادار کرد.
اکنون، طبق اعلام Anthropic، محدودیتها در تاریخ ۹ تیر ۱۴۰۵ لغو شد و دسترسی کاربران جهانی به Fable ۵ از ۱۰ تیر ۱۴۰۵ بازگشت. اما نکته مهمتر این است که این شرکت برای کنترل ریسک، یک Safety Classifier جدید آموزش داده است تا رفتارهای پرریسک را دقیقتر شناسایی و مسدود کند.
Claude Fable ۵ و Mythos ۵ چه تفاوتی دارند؟
بر اساس متن منتشرشده، هر دو مدل Fable 5 و Mythos 5 از یک مدل زیربنایی مشترک استفاده میکنند، اما سطح حفاظ و دامنه کاربرد آنها متفاوت است.
Claude Fable 5 برای استفاده عمومی طراحی شده و با سختگیرانهترین حفاظهای ایمنی Anthropic منتشر شده است. هدف از این حفاظها این است که کاربران بتوانند از قابلیتهای پیشرفته مدل در کدنویسی، تحلیل، تولید محتوا، اتوماسیون و کارهای دانشی استفاده کنند، بدون آنکه مدل به ابزار سوءاستفاده سایبری تبدیل شود.
در مقابل، Claude Mythos 5 با حفاظهای کمتر و قابلیتهای پیشرفتهتر امنیت سایبری فقط در اختیار گروه محدودی از شرکای مورد اعتماد پروژه Glasswing قرار گرفت. کاربرد اصلی Mythos ۵ در این چارچوب، امنیت سایبری دفاعی عنوان شده است؛ یعنی کمک به شناسایی و تحلیل آسیبپذیریها برای محافظت از سامانهها، نه حمله به آنها.
چرا دسترسی به Fable ۵ متوقف شد؟
دسترسی به Fable ۵ پس از گزارشی متوقف شد که در آن پژوهشگران Amazon نشان داده بودند مدل میتواند در شرایط خاص، تعدادی آسیبپذیری نرمافزاری را شناسایی کند. در یک مورد نیز مدل خروجیای تولید کرده بود که نحوه بهرهبرداری از یک آسیبپذیری را نشان میداد.
این مسئله از دید Anthropic یک قابلیت منحصربهفرد خطرناک در سطح Mythos نبود، بلکه یک مورد مرزی در سیاستهای ایمنی Fable ۵ محسوب میشد. به بیان ساده، مدل وارد محدودهای شده بود که از نظر فنی میتواند بخشی از کار دفاع سایبری باشد، اما در صورت سوءاستفاده ممکن است ریسک ایجاد کند.
همین مرز باریک میان «کاربرد دفاعی» و «قابلیت تهاجمی» یکی از چالشهای اصلی استفاده از مدلهای زبانی بزرگ در امنیت سایبری است.
جیلبریک در مدلهای هوش مصنوعی چیست؟
جیلبریک / Jailbreak در مدلهای زبانی به مجموعهای از تکنیکهای پرامپتنویسی یا تعامل گفته میشود که تلاش میکنند حفاظهای مدل را دور بزنند. هدف جیلبریک میتواند گرفتن پاسخهایی باشد که مدل در حالت عادی نباید تولید کند؛ مانند راهنمایی برای سوءاستفاده امنیتی، تولید محتوای مخرب یا انجام رفتارهای خارج از سیاستهای ایمنی.
در زمینه امنیت سایبری، جیلبریک اهمیت بیشتری پیدا میکند؛ زیرا یک مدل قدرتمند میتواند در صورت نبود کنترل کافی، به شناسایی آسیبپذیریها، ساخت اکسپلویت، تحلیل بدافزار یا حتی خودکارسازی زنجیره حمله کمک کند.
با این حال، همه جیلبریکها شدت یکسانی ندارند. برخی جیلبریکها بسیار محدودند و فقط یک رفتار کوچک را آزاد میکنند. برخی دیگر میتوانند خطرناکتر باشند و مجموعه وسیعتری از رفتارهای ممنوع را در دسترس قرار دهند. خطرناکترین نوع، Universal Jailbreak است؛ یعنی روشی که بتواند طیف گستردهای از حفاظهای مدل را بیاثر کند.
راهکار Anthropic چه بود؟
Anthropic اعلام کرده است که برای حل مشکل، یک طبقهبند ایمنی جدید آموزش داده است. این طبقهبند هنگام تعامل کاربر با مدل، درخواستها و خروجیهای احتمالی را ارزیابی میکند تا تشخیص دهد آیا درخواست میتواند به یک کاربرد خطرناک در امنیت سایبری منجر شود یا خیر.
اگر درخواست مشکوک یا پرریسک تشخیص داده شود، پاسخ Fable ۵ مسدود میشود و درخواست به Claude Opus 4.8 منتقل خواهد شد. طبق اعلام شرکت، این طبقهبند جدید تکنیک گزارششده در گزارش Amazon را در بیش از ۹۹٪ موارد مسدود میکند.
این راهکار از نظر معماری ایمنی، نمونهای از رویکرد Defense in Depth یا دفاع چندلایه است. در این رویکرد، امنیت مدل فقط به یک مکانیزم وابسته نیست، بلکه ترکیبی از آموزش رفتاری مدل، طبقهبندهای ایمنی، پایش سوءاستفاده، ارزیابی خروجی و سیاستهای دسترسی به کار گرفته میشود.
چالش مهم: افزایش False Positive
یکی از پیامدهای مستقیم سختگیرانهتر شدن طبقهبندهای ایمنی، افزایش مثبت کاذب / False Positive است. یعنی ممکن است برخی درخواستهای کاملاً مشروع و بیضرر نیز به اشتباه مسدود شوند.
برای مثال، یک توسعهدهنده ممکن است هنگام دیباگ یک اپلیکیشن، درباره خطای امنیتی، اعتبارسنجی ورودی، مدیریت توکن، تزریق SQL یا تحلیل لاگ سؤال کند. این پرسشها در بسیاری از موارد کاملاً دفاعی و مشروع هستند، اما اگر طبقهبند نتواند زمینه واقعی درخواست را دقیق تشخیص دهد، ممکن است آنها را پرریسک تلقی کند.
این مسئله برای تیمهای نرمافزاری، DevSecOps، پژوهشگران امنیت و شرکتهایی که از LLMها در چرخه توسعه نرمافزار استفاده میکنند، اهمیت عملی زیادی دارد.
راهکارهای عملی برای توسعهدهندگان و تیمهای امنیتی
برای کاهش خطای مثبت کاذب و استفاده امنتر از مدلهای زبانی در امنیت سایبری، فعالان این حوزه میتوانند چند اقدام عملی انجام دهند:
۱. هدف دفاعی درخواست را شفاف بنویسید
در پرامپتهای امنیتی، زمینه را دقیق مشخص کنید. به جای پرسشهای مبهم، توضیح دهید که هدف شما رفع آسیبپذیری، امنسازی کد، تحلیل دفاعی یا بهبود امنیت محصول است.
نمونه بهتر:
«من در حال امنسازی یک API داخلی هستم. لطفاً این کد را از نظر ریسکهای احراز هویت و اعتبارسنجی ورودی بررسی کن و فقط راهکارهای اصلاحی و دفاعی پیشنهاد بده.»
۲. از درخواست تولید اکسپلویت خودداری کنید
حتی اگر هدف شما تست نفوذ قانونی باشد، بهتر است از مدل نخواهید کد بهرهبرداری یا زنجیره حمله تولید کند. به جای آن، درخواست را به سمت تحلیل ریسک، روشهای کاهش خطر، تست امن و چکلیست دفاعی هدایت کنید.
نمونه امنتر:
«برای این آسیبپذیری، سناریوهای ریسک را توضیح بده و راهکارهای اصلاح، مانیتورینگ و تست غیرمخرب ارائه کن.»
۳. از قالببندی استاندارد برای درخواستهای امنیتی استفاده کنید
یک قالب پیشنهادی برای پرامپتهای دفاعی:
- نقش: توسعهدهنده / تحلیلگر امنیت / تیم DevSecOps
- محیط: اپلیکیشن داخلی / تست مجاز / محیط آزمایشگاهی
- هدف: اصلاح، مقاومسازی، کاهش ریسک
- محدودیت: عدم تولید کد مخرب یا دستورالعمل سوءاستفاده
- خروجی مطلوب: چکلیست، راهکار اصلاحی، الگوی امن، تست غیرمخرب
۴. خروجی مدل را وارد فرآیند بازبینی انسانی کنید
در حوزه امنیت سایبری، خروجی مدل نباید بدون بازبینی انسانی وارد محیط عملیاتی شود. حتی بهترین LLMها ممکن است دچار خطا، توهم، تفسیر ناقص یا پیشنهادهای ناامن شوند.
بنابراین پیشنهاد میشود خروجی مدل در کنار این موارد بررسی شود:
- Code Review انسانی
- Static Application Security Testing یا SAST
- Dynamic Application Security Testing یا DAST
- اسکن وابستگیها و پکیجها
- Threat Modeling
- تست در محیط Sandbox
۵. سیاست داخلی استفاده از AI در امنیت سایبری تدوین کنید
شرکتها باید مشخص کنند چه نوع درخواستهایی مجاز، محدود یا ممنوع هستند. برای مثال:
مجاز:
- بررسی دفاعی کد
- پیشنهاد Secure Coding
- ساخت چکلیست امنیتی
- تحلیل لاگهای غیرحساس
- توضیح مفهومی آسیبپذیریها
محدود:
- تحلیل کدهای حساس
- بررسی معماری داخلی
- تست نفوذ در محیط کنترلشده
ممنوع:
- تولید بدافزار
- ساخت اکسپلویت عملیاتی
- دور زدن احراز هویت
- استخراج داده محرمانه
- اتوماسیون حمله
پیام این اتفاق برای بازار هوش مصنوعی چیست؟
بازگشت Fable ۵ نشان داد که مسئله اصلی آینده مدلهای زبانی فقط قدرت بیشتر نیست، بلکه کنترلپذیری، ارزیابی ریسک و اعتمادپذیری عملیاتی است. هرچه مدلها در کدنویسی، تحلیل آسیبپذیری و اتوماسیون مهارت بیشتری پیدا کنند، مرز میان کاربرد مفید و سوءاستفاده خطرناک باریکتر میشود.
برای شرکتهای فعال در AI، این رویداد چند پیام روشن دارد:
- عرضه مدل قدرتمند بدون معماری ایمنی چندلایه کافی نیست.
- طبقهبندهای ایمنی باید دائماً با دادههای جدید بهروزرسانی شوند.
- جیلبریکها باید بر اساس شدت، دامنه و اثر واقعی رتبهبندی شوند.
- همکاری میان شرکتهای AI، ارائهدهندگان Cloud و نهادهای ارزیابی فنی اهمیت بیشتری پیدا میکند.
- تجربه کاربری نباید قربانی کامل سختگیری امنیتی شود؛ کاهش False Positive یک ضرورت محصولی است.
اهمیت چارچوب مشترک برای ارزیابی جیلبریکها
یکی از نکات کلیدی متن Anthropic، نیاز صنعت به یک چارچوب مشترک برای ارزیابی شدت جیلبریکها است. بدون چنین چارچوبی، هر گزارش آسیبپذیری مدل میتواند برداشتهای متفاوتی ایجاد کند؛ از یک خطای کمخطر در حاشیه ایمنی گرفته تا یک شکست جدی در کنترل رفتار مدل.
یک چارچوب استاندارد باید حداقل به این پرسشها پاسخ دهد:
- آیا جیلبریک فقط یک رفتار محدود را آزاد میکند یا دامنه وسیع دارد؟
- آیا خروجی تولیدشده واقعاً قابل سوءاستفاده عملیاتی است؟
- آیا رفتار مدل در سطح قابلیتهای عمومی است یا قابلیت منحصربهفرد پیشرفته دارد؟
- آیا مدل فقط اطلاعات مفهومی داده یا دستورالعمل اجرایی تولید کرده است؟
- آیا جیلبریک قابل تکرار، پایدار و مقیاسپذیر است؟
- آیا دفاع جدید میتواند آن را با نرخ موفقیت بالا مسدود کند؟
چنین چارچوبی برای تیمهای Red Team، پژوهشگران AI Safety، شرکتهای Cloud، توسعهدهندگان LLM و نهادهای تنظیمگر اهمیت زیادی دارد.
جدول زمانی رویدادها
| تاریخ میلادی | تاریخ شمسی | رویداد |
|---|---|---|
| ۹ ژوئن ۲۰۲۶ | ۱۹ خرداد ۱۴۰۵ | انتشار Claude Fable ۵ و Claude Mythos ۵ |
| ۱۲ ژوئن ۲۰۲۶ | ۲۲ خرداد ۱۴۰۵ | اعمال محدودیت کنترل صادراتی و توقف دسترسی |
| ۲۶ ژوئن ۲۰۲۶ | ۵ تیر ۱۴۰۵ | تأیید دسترسی محدود Mythos ۵ برای برخی سازمانها |
| ۳۰ ژوئن ۲۰۲۶ | ۹ تیر ۱۴۰۵ | لغو محدودیتهای صادراتی |
| ۱ جولای ۲۰۲۶ | ۱۰ تیر ۱۴۰۵ | بازگشت دسترسی جهانی به Fable ۵ |
| ۷ جولای ۲۰۲۶ | ۱۶ تیر ۱۴۰۵ | پایان دوره دسترسی تا سقف ۵۰٪ محدودیت هفتگی برای برخی پلنها |
نتیجهگیری
بازگشت Claude Fable 5 یک نقطه عطف مهم در بحث ایمنی مدلهای هوش مصنوعی مولد است. این رویداد نشان داد که چالش اصلی صنعت فقط ساخت مدلهای قویتر نیست؛ بلکه طراحی سازوکاری است که بتواند میان کاربردهای مشروع دفاعی و رفتارهای بالقوه خطرناک تمایز دقیقتری ایجاد کند.
برای توسعهدهندگان، تیمهای امنیتی و شرکتهایی که از مدلهای زبانی بزرگ در کدنویسی، دیباگ و امنیت سایبری استفاده میکنند، پیام اصلی روشن است: استفاده از AI باید با پرامپتنویسی شفاف، سیاست داخلی، بازبینی انسانی، تست غیرمخرب و معماری چندلایه امنیتی همراه باشد.
Fable ۵ دوباره در دسترس قرار گرفته است، اما مسیر آینده مدلهای قدرتمند هوش مصنوعی به یک اصل وابسته خواهد بود: قدرت بیشتر فقط زمانی ارزشمند است که با ایمنی، شفافیت و کنترلپذیری همراه باشد.
پرسشهای متداول
Claude Fable ۵ چه زمانی دوباره فعال شد؟
دسترسی جهانی به Claude Fable ۵ از تاریخ ۱۰ تیر ۱۴۰۵ دوباره برقرار شد.
دلیل توقف دسترسی به Fable ۵ چه بود؟
دلیل توقف، اعمال محدودیتهای کنترل صادراتی و نگرانی درباره روشی برای دور زدن بخشی از حفاظهای امنیتی مدل بود.
Claude Mythos ۵ چیست؟
Claude Mythos ۵ نسخهای با حفاظهای کمتر و قابلیتهای پیشرفتهتر امنیت سایبری است که برای استفاده دفاعی در اختیار گروه محدودی از شرکای مورد اعتماد قرار گرفته بود.
Safety Classifier چیست؟
Safety Classifier یا طبقهبند ایمنی، یک سیستم هوش مصنوعی کوچکتر است که درخواستها یا خروجیهای مدل را بررسی میکند تا محتوای بالقوه خطرناک را شناسایی و مسدود کند.
جیلبریک مدل زبانی یعنی چه؟
جیلبریک یعنی استفاده از روشهای پرامپتنویسی یا تعامل غیرمعمول برای دور زدن حفاظهای مدل و گرفتن خروجیهایی که در حالت عادی نباید تولید شوند.
مشکل False Positive در مدلهای AI چیست؟
False Positive زمانی رخ میدهد که یک درخواست سالم و مشروع به اشتباه خطرناک تشخیص داده شده و مسدود شود.