تعلیق دسترسی به Fable 5 و Mythos 5؛ واکنش Anthropic به دستور دولت آمریکا
بیانیه درباره دستور دولت آمریکا برای تعلیق دسترسی به Fable ۵ و Mythos ۵
۲۲ خرداد ۱۴۰۵
دولت ایالات متحده، با استناد به اختیارات مرتبط با امنیت ملی، یک دستورالعمل کنترل صادرات، یا Export Control Directive، صادر کرده است که بر اساس آن باید تمام دسترسیها به Fable 5 و Mythos 5 برای هر تبعه خارجی، چه در داخل ایالات متحده و چه خارج از آن، از جمله کارکنان خارجی Anthropic، تعلیق شود. اثر عملی این دستور آن است که ما باید برای تضمین پایبندی به قانون، بهصورت ناگهانی دسترسی به Fable ۵ و Mythos ۵ را برای همه مشتریان خود غیرفعال کنیم. دسترسی به سایر مدلهای Anthropic تحت تأثیر قرار نخواهد گرفت.
ما این دستور را امروز ساعت ۱۷:۲۱ به وقت شرق آمریکا دریافت کردیم. نامه دولت جزئیات مشخصی درباره نگرانی امنیت ملی خود ارائه نکرده است. برداشت ما این است که دولت معتقد است از روشی برای دور زدن یا jailbreaking مدل Fable ۵ آگاه شده است. ما نمایشی از این تکنیک خاص را بررسی کردیم که برای شناسایی تعداد کمی از آسیبپذیریهای جزئی و از پیش شناختهشده استفاده شده بود. این آسیبپذیریها همگی نسبتاً ساده به نظر میرسند و ما دریافتهایم که سایر مدلهای عمومی در دسترس نیز میتوانند بدون نیاز به دور زدن safeguards، آنها را کشف کنند.
موضع Anthropic درباره safeguards یا سازوکارهای حفاظتی Fable، همانگونه که در پست معرفی این مدل بیان شده، چنین است:
ما safeguards قدرتمندی ایجاد کردهایم که احتمال سوءاستفاده از Fable برای وظایف مرتبط با امنیت سایبری، در کنار حوزههای دیگر، را بهشدت کاهش میدهد. در واقع، safeguards ما آنقدر سختگیرانه هستند که بسیاری از کاربران شکایت کردهاند بیش از حد گسترده و محدودکنندهاند.
در هفتههای منتهی به عرضه Fable، شرکت Anthropic با دولت ایالات متحده، مؤسسه UK AISI، چندین سازمان خصوصی ثالث و تیمهای داخلی همکاری کرد تا safeguards مدل Fable را در مجموع برای هزاران ساعت red-team کند؛ یعنی آنها را تحت آزمونهای تهاجمی و سناریوهای سوءاستفاده قرار دهد.
این آزمونها نشان دادند که safeguards مدل Fable بهطور قابلتوجهی مؤثرتر از safeguards هر مدل قبلاً عرضهشدهای هستند.
تا این زمان، هیچیک از آزمونگران نتوانستهاند یک universal jailbreak، یعنی روش دور زدن جهانی و فراگیر، پیدا کنند؛ روشی که بتواند بهطور گسترده safeguards مدل را بیاثر کند و طیف وسیعی از قابلیتهای سایبری را آزاد سازد.
ما گمان میکنیم مقاومت کامل در برابر jailbreak در حال حاضر برای هیچ ارائهدهنده مدل هوش مصنوعی ممکن نیست. هر safeguard مورد استفاده در صنعت در برابر jailbreakهای غیرجهانی آسیبپذیر است؛ یعنی روشهایی که در شرایط خاص میتوانند برخی اطلاعات سایبری را استخراج کنند. همچنین احتمال دارد در آینده jailbreakهای جهانی نیز کشف شوند. ما هنگام انتشار Fable ۵ این موضوع را بهروشنی اعلام کرده بودیم.
با توجه به اینکه مقاومت کامل در برابر jailbreak امروز ممکن به نظر نمیرسد، Anthropic در Fable ۵ راهبرد دفاع در عمق یا Defense in Depth را اتخاذ کرد. هدف ما این بود که jailbreakها یا محدود و باریک باشند، در مورد jailbreakهای غیرجهانی، یا تولید آنها بسیار پرهزینه باشد، در مورد jailbreakهای جهانی. همچنین این رویکرد را با پایش دقیق ترکیب کردیم تا هر حمله موفق بهسرعت شناسایی و متوقف شود. به همین دلیل است که Anthropic برای Fable سیاست نگهداری ۳۰روزه دادههای مشتریان را الزامی کرده است؛ تغییری که برای ما نزد مشتریان هزینه واقعی دارد، اما امکان پژوهش و کاهش اثر jailbreakها را فراهم میکند.
ما همچنان از این راهبرد دفاع در عمق حمایت میکنیم. این راهبرد ریسکهای ناشی از Fable را کاهش میدهد و آنها را با ریسک مدلهای موجودی که هماکنون در سراسر صنعت مستقر هستند، قابل مقایسه میکند.
ما حتی افشای یک jailbreak غیرجهانیِ بالقوه و نگرانکننده که به نتیجهای آسیبزا منتهی شده باشد دریافت نکردهایم. jailbreakهای بالقوهای که به ما افشا شدهاند یا پاسخهایی کاملاً بیخطر بودهاند یا یافتههایی جزئی که هیچ افزایش قابلیت ویژهای برای Mythos ایجاد نمیکنند.
تا امروز، دولت فقط شواهد شفاهی درباره یک jailbreak بالقوه محدود و غیرجهانی به ما ارائه کرده است؛ موردی که اساساً شامل درخواست از مدل برای خواندن یک codebase خاص و اصلاح نقصهای نرمافزاری آن بوده است. برداشت ما این است که یک jailbreak بالقوه با دولت به اشتراک گذاشته شده است. ما گزارشی را بررسی کردهایم که باور داریم مبنای دستور دولت است و تأیید کردهایم سطح قابلیتی که در آن نمایش داده شده، بهطور گسترده در مدلهای دیگر، از جمله GPT-۵.۵ شرکت OpenAI، در دسترس است و هر روز توسط مدافعانی استفاده میشود که از سامانهها محافظت میکنند. ما طی ۲۴ ساعت آینده جزئیات بیشتری منتشر خواهیم کرد.
ما از دستور قانونی دولت تبعیت میکنیم و دسترسی به Fable ۵ و Mythos ۵ را برای همه کاربران حذف میکنیم. با این حال، با این دیدگاه موافق نیستیم که کشف یک jailbreak بالقوه و محدود باید باعث فراخوانی یا خارجسازی یک مدل تجاری شود که برای صدها میلیون نفر عرضه شده است. اگر این معیار در سراسر صنعت اعمال شود، به باور ما عملاً همه عرضههای جدید مدلهای frontier AI توسط تمام ارائهدهندگان مدلهای پیشرفته متوقف خواهد شد.
همانطور که بهصورت عمومی اعلام کردهایم، باور داریم دولت باید بتواند، در قالب یک فرایند قانونی شفاف، منصفانه، روشن و مبتنی بر واقعیتهای فنی، جلوی عرضههای ناایمن را بگیرد. این اقدام با آن اصول همخوانی ندارد.
ما بابت این اختلال از مشتریان خود عذرخواهی میکنیم. باور داریم این موضوع ناشی از یک سوءتفاهم است و در تلاشیم دسترسی را هرچه سریعتر بازگردانیم.
خلاصه خبر برای کاربران و کسبوکارها
بر اساس بیانیه Anthropic، دولت آمریکا در تاریخ ۲۲ خرداد ۱۴۰۵ دستوری صادر کرده که دسترسی به دو مدل Fable 5 و Mythos 5 باید برای اتباع خارجی تعلیق شود. اما از آنجا که تفکیک دقیق کاربران بر اساس تابعیت، موقعیت جغرافیایی و وضعیت حقوقی میتواند پیچیده و پرریسک باشد، Anthropic اعلام کرده است دسترسی به این دو مدل را برای همه مشتریان قطع میکند تا از نقض دستور کنترل صادرات جلوگیری شود.
نکته مهم این است که Anthropic میگوید سایر مدلهای این شرکت تحت تأثیر قرار نمیگیرند. بنابراین، مسئله فعلاً فقط به Fable ۵ و Mythos ۵ محدود است، نه کل سبد محصولات Anthropic.
این رویداد از چند جهت برای صنعت هوش مصنوعی اهمیت دارد:
- دولت آمریکا از ابزارهای امنیت ملی و کنترل صادرات برای محدودسازی مدلهای هوش مصنوعی استفاده کرده است.
- دلیل اصلی دستور، طبق برداشت Anthropic، نگرانی درباره یک روش jailbreak در Fable ۵ است.
- Anthropic میگوید این jailbreak جهانی و فراگیر نیست و شواهد ارائهشده کافی یا شفاف نبوده است.
- این تصمیم میتواند بر شرکتهایی که به API مدلهای پیشرفته متکی هستند اثر فوری بگذارد.
- موضوع، بحث بزرگتری درباره رگولاتوری، ایمنی و شفافیت در frontier AI ایجاد میکند.
دلیل اصلی دستور دولت آمریکا چه بود؟
طبق متن بیانیه، نامه دولت آمریکا جزئیات فنی مشخصی درباره نگرانی امنیت ملی ارائه نکرده است. Anthropic میگوید برداشتش این است که دولت از روشی برای bypass یا دور زدن محدودیتهای ایمنی Fable ۵ مطلع شده است.
این روش ظاهراً برای بررسی یک codebase و یافتن یا رفع نقصهای نرمافزاری استفاده شده است. از نگاه دولت، چنین قابلیتی ممکن است در حوزه امنیت سایبری حساس باشد. اما Anthropic استدلال میکند که این سطح از توانایی در مدلهای عمومی دیگر نیز وجود دارد و حتی توسط تیمهای دفاع سایبری برای ایمنسازی سامانهها استفاده میشود.
در واقع، اختلاف اصلی بر سر این پرسش است:
آیا یک jailbreak محدود و غیرجهانی، آن هم بدون اثبات آسیب جدی، برای تعلیق یک مدل تجاری در مقیاس وسیع کافی است؟
Anthropic پاسخ منفی میدهد و میگوید اگر چنین معیاری به کل صنعت تعمیم داده شود، عرضه مدلهای پیشرفته جدید تقریباً متوقف خواهد شد.
jailbreak یا دور زدن safeguards چیست؟
در مدلهای زبانی بزرگ، jailbreak به مجموعهای از روشها گفته میشود که کاربر تلاش میکند با آنها safeguards یا محدودیتهای ایمنی مدل را دور بزند. این محدودیتها برای جلوگیری از تولید محتوای خطرناک، غیرقانونی، آسیبزا یا سوءاستفادهپذیر طراحی میشوند.
برای مثال، اگر مدلی نباید درباره ساخت بدافزار، سوءاستفاده از آسیبپذیری یا عملیات مخرب سایبری راهنمایی عملی ارائه دهد، jailbreak ممکن است تلاش کند مدل را با نقشآفرینی، تغییر قالب درخواست، پنهانسازی هدف یا سناریوسازی فریب دهد.
اما همه jailbreakها یکسان نیستند. برخی بسیار محدودند و فقط در شرایط خاص پاسخهایی نسبتاً کمخطر تولید میکنند. برخی دیگر، اگر وجود داشته باشند، میتوانند گستردهتر و خطرناکتر باشند.
تفاوت jailbreak محدود و jailbreak جهانی
Anthropic در بیانیه خود بر تفاوت میان دو نوع jailbreak تأکید میکند:
jailbreak غیرجهانی یا محدود:
روشی که فقط در شرایط خاص کار میکند و ممکن است فقط بخشی از محدودیتها را دور بزند. این نوع jailbreak معمولاً قابلیت گسترده و پایدار ایجاد نمیکند.
universal jailbreak یا jailbreak جهانی:
روشی فراگیر که میتواند safeguards مدل را در طیف وسیعی از موضوعات، وظایف و سناریوها بیاثر کند. چنین روشی از نظر ایمنی بسیار نگرانکنندهتر است.
Anthropic میگوید تا زمان انتشار بیانیه، هیچ آزمونگری نتوانسته یک universal jailbreak برای Fable ۵ پیدا کند. به گفته این شرکت، موارد افشاشده یا بیخطر بودهاند یا به یافتههای جزئی محدود شدهاند.
موضع Anthropic درباره ایمنی Fable ۵
Anthropic تأکید میکند که Fable ۵ پیش از عرضه، هزاران ساعت red-teaming را پشت سر گذاشته است. red-teaming در حوزه هوش مصنوعی به معنای آزمون تهاجمی مدل برای یافتن نقاط ضعف، رفتارهای ناامن، پاسخهای پرریسک و مسیرهای سوءاستفاده است.
این شرکت میگوید در این فرایند با نهادهای مختلف همکاری کرده است؛ از جمله:
- دولت ایالات متحده
- UK AISI
- سازمانهای خصوصی ثالث
- تیمهای داخلی Anthropic
به گفته Anthropic، نتایج این آزمونها نشان داده safeguards Fable ۵ از مدلهای قبلی مؤثرتر بوده است. این شرکت همچنین میگوید راهبردش «دفاع در عمق» بوده؛ یعنی بهجای اتکا به یک لایه ایمنی، چندین لایه حفاظتی، پایش، ثبت داده و پاسخ سریع را با هم ترکیب کرده است.
این رویکرد در امنیت سایبری رایج است. اصل آن ساده است: اگر یک لایه شکست خورد، لایههای دیگر باید مانع آسیب جدی شوند.
پیامدهای تعلیق Fable ۵ و Mythos ۵ برای مشتریان
تعلیق ناگهانی دو مدل پیشرفته میتواند برای مشتریان Anthropic اختلال جدی ایجاد کند؛ بهخصوص برای کسبوکارهایی که مدل را در محصول، گردشکار یا زیرساخت خود ادغام کردهاند.
مهمترین پیامدها عبارتاند از:
- اختلال در محصولات مبتنی بر Fable ۵ یا Mythos ۵
- نیاز فوری به مهاجرت به مدلهای جایگزین
- افزایش ریسک عملیاتی برای شرکتهای وابسته به یک مدل خاص
- ابهام درباره آینده دسترسی به مدلهای frontier AI
- فشار بر تیمهای حقوقی و compliance برای بازبینی قراردادها و سیاستها
برای توسعهدهندگان، این اتفاق یک هشدار جدی است: وابستگی کامل به یک مدل، حتی اگر فنی و تجاری جذاب باشد، میتواند ریسک استراتژیک ایجاد کند.
اثر بر توسعهدهندگان و تیمهای امنیت سایبری
تیمهای امنیت سایبری از مدلهای زبانی برای تحلیل کد، triage آسیبپذیری، تولید گزارش، بررسی لاگها و کمک به secure coding استفاده میکنند. اگر Fable ۵ یا Mythos ۵ در چنین فرایندهایی نقش داشته باشند، قطع دسترسی میتواند سرعت عملیات دفاعی را کاهش دهد.
با این حال، Anthropic میگوید قابلیت مورد بحث، یعنی خواندن codebase و رفع نقصهای نرمافزاری، در مدلهای دیگر نیز در دسترس است و ذاتاً کاربرد دفاعی دارد. این نکته برای متخصصان امنیت سایبری مهم است، زیرا بسیاری از ابزارهای AI در عمل برای کاهش ریسک و افزایش امنیت استفاده میشوند، نه برای حمله.
اثر بر شرکتهای وابسته به API و محصولات AI
شرکتهایی که محصول خود را روی API مدلهای زبانی ساختهاند باید سه پرسش فوری بپرسند:
- آیا محصول ما به یک مدل خاص وابستگی سخت دارد؟
- اگر دسترسی به آن مدل قطع شود، مسیر fallback داریم؟
- آیا قراردادهای ما درباره تغییر ناگهانی مدل، اختلال سرویس و compliance شفاف هستند؟
تعلیق Fable ۵ و Mythos ۵ نشان میدهد ریسکهای AI فقط فنی نیستند. ریسک حقوقی، ژئوپلیتیکی، کنترل صادرات و سیاستگذاری نیز میتواند به همان اندازه مهم باشد.
رویکرد برای فعالان حوزه هوش مصنوعی
برای کسبوکارها، پاسخ درست به این رویداد وحشت یا توقف نوآوری نیست. پاسخ درست، معماری مقاومتر و مدیریت ریسک بهتر است.
راهکارهای عملی شامل موارد زیر است:
- استفاده از معماری چندمدلی یا multi-model architecture
- تعریف fallback برای مدلهای جایگزین
- جداسازی لایه orchestration از مدل اصلی
- ثبت دقیق وابستگیها به APIهای خارجی
- بازبینی الزامات compliance و کنترل صادرات
- تدوین برنامه واکنش به قطع سرویس AI
- ارزیابی امنیتی منظم promptها، خروجیها و لاگها
اگر یک سازمان از مدلهای frontier برای کارهای حساس استفاده میکند، باید از ابتدا فرض کند که ممکن است دسترسی به یک مدل، به دلایل فنی یا قانونی، موقتاً قطع شود.
راهکارهای عملی برای کاهش ریسک وابستگی به یک مدل
برای تیمهای محصول و مهندسی، چند اقدام فوری توصیه میشود:
- فهرست تمام جریانهایی را تهیه کنید که به Fable ۵ یا Mythos ۵ وابستهاند.
- وظایف حیاتی و غیرحیاتی را جدا کنید.
- برای وظایف حیاتی، مدل جایگزین تعیین کنید.
- کیفیت خروجی مدل جایگزین را با benchmark داخلی بسنجید.
- promptها را طوری طراحی کنید که قابل انتقال میان چند مدل باشند.
- در قراردادهای مشتریان، بندهای مربوط به تغییر مدل و اختلال سرویس را شفاف کنید.
- سیاست نگهداری داده، privacy و audit را دوباره بررسی کنید.
این اقدامات فقط برای Anthropic نیست. هر سازمانی که از OpenAI، Google، Anthropic، Meta یا سایر ارائهدهندگان مدل استفاده میکند باید چنین برنامهای داشته باشد.
چکلیست فوری برای تیمهای فنی و حقوقی
چکلیست پیشنهادی:
- بررسی کنید کدام endpointها به Fable ۵ یا Mythos ۵ متصل هستند.
- میزان وابستگی محصول به این مدلها را مشخص کنید.
- بهسرعت مدل جایگزین برای use caseهای اصلی انتخاب کنید.
- خروجی مدل جایگزین را از نظر کیفیت، هزینه و latency آزمایش کنید.
- اسناد داخلی و SLAها را بهروزرسانی کنید.
- پیام شفاف برای کاربران نهایی آماده کنید.
- ریسکهای مربوط به داده، تابعیت کاربران و کنترل صادرات را با تیم حقوقی بررسی کنید.
- برای سناریوهای آینده، playbook قطع دسترسی به مدل تدوین کنید.
آینده رگولاتوری مدلهای هوش مصنوعی پیشرفته
این رویداد میتواند به نقطه عطفی در رابطه میان دولتها و شرکتهای frontier AI تبدیل شود. دولتها نگران سوءاستفاده از مدلهای پیشرفته در حوزههایی مانند امنیت سایبری، زیستفناوری، عملیات اطلاعاتی و زیرساختهای حیاتی هستند. از سوی دیگر، شرکتهای AI میگویند تصمیمهای محدودکننده باید شفاف، مبتنی بر شواهد و از نظر فنی دقیق باشند.
چالش اصلی این است که مدلهای زبانی دوکاربردیاند. یعنی یک قابلیت میتواند هم کاربرد دفاعی داشته باشد و هم کاربرد مخرب. توانایی یافتن نقص نرمافزاری، برای مهاجم خطرناک است؛ اما برای مدافع ضروری است. بنابراین سیاستگذاری باید میان «قابلیت خطرناک»، «کاربرد مشروع» و «شواهد آسیب واقعی» تفاوت قائل شود.
Anthropic در بیانیه خود اصل مداخله دولت را رد نمیکند. این شرکت میگوید دولت باید بتواند جلوی عرضه ناایمن را بگیرد، اما فقط در چارچوب فرایندی شفاف، منصفانه، روشن و مبتنی بر واقعیتهای فنی.
جمعبندی
تعلیق دسترسی به Fable ۵ و Mythos ۵ فقط یک خبر محصولی نیست؛ نشانهای از ورود صنعت هوش مصنوعی به مرحلهای پیچیدهتر است. در این مرحله، مسائل فنی مانند jailbreak، safeguards و red-teaming با موضوعات حقوقی، کنترل صادرات و امنیت ملی گره میخورند.
بر اساس بیانیه Anthropic، دولت آمریکا به دلیل نگرانی درباره یک jailbreak بالقوه، دستور تعلیق دسترسی به این دو مدل را صادر کرده است. Anthropic میگوید شواهد ارائهشده کافی نبوده، jailbreak مورد بحث جهانی نیست و قابلیت نمایشدادهشده در مدلهای دیگر نیز وجود دارد.
برای کاربران و شرکتها، مهمترین درس این است: وابستگی کامل به یک مدل یا یک ارائهدهنده AI ریسک بالایی دارد. سازمانها باید معماری چندمدلی، برنامه fallback، ارزیابی compliance و چکلیست واکنش به اختلال را جدی بگیرند.
خلاصه کوتاه:
در تاریخ ۲۲ خرداد ۱۴۰۵، Anthropic اعلام کرد که بهدلیل دستور کنترل صادرات دولت آمریکا، دسترسی به مدلهای Fable ۵ و Mythos ۵ را برای همه کاربران تعلیق میکند. دولت آمریکا این اقدام را با استناد به نگرانیهای امنیت ملی انجام داده است. Anthropic میگوید دلیل احتمالی دستور، نگرانی درباره یک jailbreak محدود در Fable ۵ است، اما این شرکت تأکید دارد که هیچ universal jailbreak اثباتشدهای ارائه نشده و قابلیت مورد بحث در مدلهای عمومی دیگر نیز وجود دارد. Anthropic با وجود تبعیت از دستور قانونی، این اقدام را غیرشفاف و فاقد اتکای کافی به شواهد فنی میداند. این رویداد برای صنعت هوش مصنوعی اهمیت دارد، زیرا نشان میدهد ریسکهای مدلهای frontier فقط فنی نیستند و شامل رگولاتوری، امنیت ملی، کنترل صادرات و وابستگی زیرساختی نیز میشوند.