تعلیق دسترسی به Fable 5 و Mythos 5؛ واکنش Anthropic به دستور دولت آمریکا

تعلیق دسترسی به Fable 5 و Mythos 5؛ واکنش Anthropic به دستور دولت آمریکا
۵/۵ - (۱ امتیاز)

بیانیه درباره دستور دولت آمریکا برای تعلیق دسترسی به Fable ۵ و Mythos ۵

۲۲ خرداد ۱۴۰۵

دولت ایالات متحده، با استناد به اختیارات مرتبط با امنیت ملی، یک دستورالعمل کنترل صادرات، یا Export Control Directive، صادر کرده است که بر اساس آن باید تمام دسترسی‌ها به Fable 5 و Mythos 5 برای هر تبعه خارجی، چه در داخل ایالات متحده و چه خارج از آن، از جمله کارکنان خارجی Anthropic، تعلیق شود. اثر عملی این دستور آن است که ما باید برای تضمین پایبندی به قانون، به‌صورت ناگهانی دسترسی به Fable ۵ و Mythos ۵ را برای همه مشتریان خود غیرفعال کنیم. دسترسی به سایر مدل‌های Anthropic تحت تأثیر قرار نخواهد گرفت.

ما این دستور را امروز ساعت ۱۷:۲۱ به وقت شرق آمریکا دریافت کردیم. نامه دولت جزئیات مشخصی درباره نگرانی امنیت ملی خود ارائه نکرده است. برداشت ما این است که دولت معتقد است از روشی برای دور زدن یا jailbreaking مدل Fable ۵ آگاه شده است. ما نمایشی از این تکنیک خاص را بررسی کردیم که برای شناسایی تعداد کمی از آسیب‌پذیری‌های جزئی و از پیش شناخته‌شده استفاده شده بود. این آسیب‌پذیری‌ها همگی نسبتاً ساده به نظر می‌رسند و ما دریافته‌ایم که سایر مدل‌های عمومی در دسترس نیز می‌توانند بدون نیاز به دور زدن safeguards، آن‌ها را کشف کنند.

موضع Anthropic درباره safeguards یا سازوکارهای حفاظتی Fable، همان‌گونه که در پست معرفی این مدل بیان شده، چنین است:

ما safeguards قدرتمندی ایجاد کرده‌ایم که احتمال سوءاستفاده از Fable برای وظایف مرتبط با امنیت سایبری، در کنار حوزه‌های دیگر، را به‌شدت کاهش می‌دهد. در واقع، safeguards ما آن‌قدر سخت‌گیرانه هستند که بسیاری از کاربران شکایت کرده‌اند بیش از حد گسترده و محدودکننده‌اند.

در هفته‌های منتهی به عرضه Fable، شرکت Anthropic با دولت ایالات متحده، مؤسسه UK AISI، چندین سازمان خصوصی ثالث و تیم‌های داخلی همکاری کرد تا safeguards مدل Fable را در مجموع برای هزاران ساعت red-team کند؛ یعنی آن‌ها را تحت آزمون‌های تهاجمی و سناریوهای سوءاستفاده قرار دهد.

این آزمون‌ها نشان دادند که safeguards مدل Fable به‌طور قابل‌توجهی مؤثرتر از safeguards هر مدل قبلاً عرضه‌شده‌ای هستند.

تا این زمان، هیچ‌یک از آزمون‌گران نتوانسته‌اند یک universal jailbreak، یعنی روش دور زدن جهانی و فراگیر، پیدا کنند؛ روشی که بتواند به‌طور گسترده safeguards مدل را بی‌اثر کند و طیف وسیعی از قابلیت‌های سایبری را آزاد سازد.

ما گمان می‌کنیم مقاومت کامل در برابر jailbreak در حال حاضر برای هیچ ارائه‌دهنده مدل هوش مصنوعی ممکن نیست. هر safeguard مورد استفاده در صنعت در برابر jailbreakهای غیرجهانی آسیب‌پذیر است؛ یعنی روش‌هایی که در شرایط خاص می‌توانند برخی اطلاعات سایبری را استخراج کنند. همچنین احتمال دارد در آینده jailbreakهای جهانی نیز کشف شوند. ما هنگام انتشار Fable ۵ این موضوع را به‌روشنی اعلام کرده بودیم.

با توجه به اینکه مقاومت کامل در برابر jailbreak امروز ممکن به نظر نمی‌رسد، Anthropic در Fable ۵ راهبرد دفاع در عمق یا Defense in Depth را اتخاذ کرد. هدف ما این بود که jailbreakها یا محدود و باریک باشند، در مورد jailbreakهای غیرجهانی، یا تولید آن‌ها بسیار پرهزینه باشد، در مورد jailbreakهای جهانی. همچنین این رویکرد را با پایش دقیق ترکیب کردیم تا هر حمله موفق به‌سرعت شناسایی و متوقف شود. به همین دلیل است که Anthropic برای Fable سیاست نگهداری ۳۰روزه داده‌های مشتریان را الزامی کرده است؛ تغییری که برای ما نزد مشتریان هزینه واقعی دارد، اما امکان پژوهش و کاهش اثر jailbreakها را فراهم می‌کند.

ما همچنان از این راهبرد دفاع در عمق حمایت می‌کنیم. این راهبرد ریسک‌های ناشی از Fable را کاهش می‌دهد و آن‌ها را با ریسک مدل‌های موجودی که هم‌اکنون در سراسر صنعت مستقر هستند، قابل مقایسه می‌کند.

ما حتی افشای یک jailbreak غیرجهانیِ بالقوه و نگران‌کننده که به نتیجه‌ای آسیب‌زا منتهی شده باشد دریافت نکرده‌ایم. jailbreakهای بالقوه‌ای که به ما افشا شده‌اند یا پاسخ‌هایی کاملاً بی‌خطر بوده‌اند یا یافته‌هایی جزئی که هیچ افزایش قابلیت ویژه‌ای برای Mythos ایجاد نمی‌کنند.

تا امروز، دولت فقط شواهد شفاهی درباره یک jailbreak بالقوه محدود و غیرجهانی به ما ارائه کرده است؛ موردی که اساساً شامل درخواست از مدل برای خواندن یک codebase خاص و اصلاح نقص‌های نرم‌افزاری آن بوده است. برداشت ما این است که یک jailbreak بالقوه با دولت به اشتراک گذاشته شده است. ما گزارشی را بررسی کرده‌ایم که باور داریم مبنای دستور دولت است و تأیید کرده‌ایم سطح قابلیتی که در آن نمایش داده شده، به‌طور گسترده در مدل‌های دیگر، از جمله GPT-۵.۵ شرکت OpenAI، در دسترس است و هر روز توسط مدافعانی استفاده می‌شود که از سامانه‌ها محافظت می‌کنند. ما طی ۲۴ ساعت آینده جزئیات بیشتری منتشر خواهیم کرد.

ما از دستور قانونی دولت تبعیت می‌کنیم و دسترسی به Fable ۵ و Mythos ۵ را برای همه کاربران حذف می‌کنیم. با این حال، با این دیدگاه موافق نیستیم که کشف یک jailbreak بالقوه و محدود باید باعث فراخوانی یا خارج‌سازی یک مدل تجاری شود که برای صدها میلیون نفر عرضه شده است. اگر این معیار در سراسر صنعت اعمال شود، به باور ما عملاً همه عرضه‌های جدید مدل‌های frontier AI توسط تمام ارائه‌دهندگان مدل‌های پیشرفته متوقف خواهد شد.

همان‌طور که به‌صورت عمومی اعلام کرده‌ایم، باور داریم دولت باید بتواند، در قالب یک فرایند قانونی شفاف، منصفانه، روشن و مبتنی بر واقعیت‌های فنی، جلوی عرضه‌های ناایمن را بگیرد. این اقدام با آن اصول هم‌خوانی ندارد.

ما بابت این اختلال از مشتریان خود عذرخواهی می‌کنیم. باور داریم این موضوع ناشی از یک سوءتفاهم است و در تلاشیم دسترسی را هرچه سریع‌تر بازگردانیم.


خلاصه خبر برای کاربران و کسب‌وکارها

بر اساس بیانیه Anthropic، دولت آمریکا در تاریخ ۲۲ خرداد ۱۴۰۵ دستوری صادر کرده که دسترسی به دو مدل Fable 5 و Mythos 5 باید برای اتباع خارجی تعلیق شود. اما از آنجا که تفکیک دقیق کاربران بر اساس تابعیت، موقعیت جغرافیایی و وضعیت حقوقی می‌تواند پیچیده و پرریسک باشد، Anthropic اعلام کرده است دسترسی به این دو مدل را برای همه مشتریان قطع می‌کند تا از نقض دستور کنترل صادرات جلوگیری شود.

نکته مهم این است که Anthropic می‌گوید سایر مدل‌های این شرکت تحت تأثیر قرار نمی‌گیرند. بنابراین، مسئله فعلاً فقط به Fable ۵ و Mythos ۵ محدود است، نه کل سبد محصولات Anthropic.

این رویداد از چند جهت برای صنعت هوش مصنوعی اهمیت دارد:

  • دولت آمریکا از ابزارهای امنیت ملی و کنترل صادرات برای محدودسازی مدل‌های هوش مصنوعی استفاده کرده است.
  • دلیل اصلی دستور، طبق برداشت Anthropic، نگرانی درباره یک روش jailbreak در Fable ۵ است.
  • Anthropic می‌گوید این jailbreak جهانی و فراگیر نیست و شواهد ارائه‌شده کافی یا شفاف نبوده است.
  • این تصمیم می‌تواند بر شرکت‌هایی که به API مدل‌های پیشرفته متکی هستند اثر فوری بگذارد.
  • موضوع، بحث بزرگ‌تری درباره رگولاتوری، ایمنی و شفافیت در frontier AI ایجاد می‌کند.

دلیل اصلی دستور دولت آمریکا چه بود؟

طبق متن بیانیه، نامه دولت آمریکا جزئیات فنی مشخصی درباره نگرانی امنیت ملی ارائه نکرده است. Anthropic می‌گوید برداشتش این است که دولت از روشی برای bypass یا دور زدن محدودیت‌های ایمنی Fable ۵ مطلع شده است.

این روش ظاهراً برای بررسی یک codebase و یافتن یا رفع نقص‌های نرم‌افزاری استفاده شده است. از نگاه دولت، چنین قابلیتی ممکن است در حوزه امنیت سایبری حساس باشد. اما Anthropic استدلال می‌کند که این سطح از توانایی در مدل‌های عمومی دیگر نیز وجود دارد و حتی توسط تیم‌های دفاع سایبری برای ایمن‌سازی سامانه‌ها استفاده می‌شود.

در واقع، اختلاف اصلی بر سر این پرسش است:

آیا یک jailbreak محدود و غیرجهانی، آن هم بدون اثبات آسیب جدی، برای تعلیق یک مدل تجاری در مقیاس وسیع کافی است؟

Anthropic پاسخ منفی می‌دهد و می‌گوید اگر چنین معیاری به کل صنعت تعمیم داده شود، عرضه مدل‌های پیشرفته جدید تقریباً متوقف خواهد شد.

jailbreak یا دور زدن safeguards چیست؟

در مدل‌های زبانی بزرگ، jailbreak به مجموعه‌ای از روش‌ها گفته می‌شود که کاربر تلاش می‌کند با آن‌ها safeguards یا محدودیت‌های ایمنی مدل را دور بزند. این محدودیت‌ها برای جلوگیری از تولید محتوای خطرناک، غیرقانونی، آسیب‌زا یا سوءاستفاده‌پذیر طراحی می‌شوند.

برای مثال، اگر مدلی نباید درباره ساخت بدافزار، سوءاستفاده از آسیب‌پذیری یا عملیات مخرب سایبری راهنمایی عملی ارائه دهد، jailbreak ممکن است تلاش کند مدل را با نقش‌آفرینی، تغییر قالب درخواست، پنهان‌سازی هدف یا سناریوسازی فریب دهد.

اما همه jailbreakها یکسان نیستند. برخی بسیار محدودند و فقط در شرایط خاص پاسخ‌هایی نسبتاً کم‌خطر تولید می‌کنند. برخی دیگر، اگر وجود داشته باشند، می‌توانند گسترده‌تر و خطرناک‌تر باشند.

تفاوت jailbreak محدود و jailbreak جهانی

Anthropic در بیانیه خود بر تفاوت میان دو نوع jailbreak تأکید می‌کند:

jailbreak غیرجهانی یا محدود:

روشی که فقط در شرایط خاص کار می‌کند و ممکن است فقط بخشی از محدودیت‌ها را دور بزند. این نوع jailbreak معمولاً قابلیت گسترده و پایدار ایجاد نمی‌کند.

universal jailbreak یا jailbreak جهانی:

روشی فراگیر که می‌تواند safeguards مدل را در طیف وسیعی از موضوعات، وظایف و سناریوها بی‌اثر کند. چنین روشی از نظر ایمنی بسیار نگران‌کننده‌تر است.

Anthropic می‌گوید تا زمان انتشار بیانیه، هیچ آزمون‌گری نتوانسته یک universal jailbreak برای Fable ۵ پیدا کند. به گفته این شرکت، موارد افشاشده یا بی‌خطر بوده‌اند یا به یافته‌های جزئی محدود شده‌اند.

موضع Anthropic درباره ایمنی Fable ۵

Anthropic تأکید می‌کند که Fable ۵ پیش از عرضه، هزاران ساعت red-teaming را پشت سر گذاشته است. red-teaming در حوزه هوش مصنوعی به معنای آزمون تهاجمی مدل برای یافتن نقاط ضعف، رفتارهای ناامن، پاسخ‌های پرریسک و مسیرهای سوءاستفاده است.

این شرکت می‌گوید در این فرایند با نهادهای مختلف همکاری کرده است؛ از جمله:

  • دولت ایالات متحده
  • UK AISI
  • سازمان‌های خصوصی ثالث
  • تیم‌های داخلی Anthropic

به گفته Anthropic، نتایج این آزمون‌ها نشان داده safeguards Fable ۵ از مدل‌های قبلی مؤثرتر بوده است. این شرکت همچنین می‌گوید راهبردش «دفاع در عمق» بوده؛ یعنی به‌جای اتکا به یک لایه ایمنی، چندین لایه حفاظتی، پایش، ثبت داده و پاسخ سریع را با هم ترکیب کرده است.

این رویکرد در امنیت سایبری رایج است. اصل آن ساده است: اگر یک لایه شکست خورد، لایه‌های دیگر باید مانع آسیب جدی شوند.

پیامدهای تعلیق Fable ۵ و Mythos ۵ برای مشتریان

تعلیق ناگهانی دو مدل پیشرفته می‌تواند برای مشتریان Anthropic اختلال جدی ایجاد کند؛ به‌خصوص برای کسب‌وکارهایی که مدل را در محصول، گردش‌کار یا زیرساخت خود ادغام کرده‌اند.

مهم‌ترین پیامدها عبارت‌اند از:

  • اختلال در محصولات مبتنی بر Fable ۵ یا Mythos ۵
  • نیاز فوری به مهاجرت به مدل‌های جایگزین
  • افزایش ریسک عملیاتی برای شرکت‌های وابسته به یک مدل خاص
  • ابهام درباره آینده دسترسی به مدل‌های frontier AI
  • فشار بر تیم‌های حقوقی و compliance برای بازبینی قراردادها و سیاست‌ها

برای توسعه‌دهندگان، این اتفاق یک هشدار جدی است: وابستگی کامل به یک مدل، حتی اگر فنی و تجاری جذاب باشد، می‌تواند ریسک استراتژیک ایجاد کند.

اثر بر توسعه‌دهندگان و تیم‌های امنیت سایبری

تیم‌های امنیت سایبری از مدل‌های زبانی برای تحلیل کد، triage آسیب‌پذیری، تولید گزارش، بررسی لاگ‌ها و کمک به secure coding استفاده می‌کنند. اگر Fable ۵ یا Mythos ۵ در چنین فرایندهایی نقش داشته باشند، قطع دسترسی می‌تواند سرعت عملیات دفاعی را کاهش دهد.

با این حال، Anthropic می‌گوید قابلیت مورد بحث، یعنی خواندن codebase و رفع نقص‌های نرم‌افزاری، در مدل‌های دیگر نیز در دسترس است و ذاتاً کاربرد دفاعی دارد. این نکته برای متخصصان امنیت سایبری مهم است، زیرا بسیاری از ابزارهای AI در عمل برای کاهش ریسک و افزایش امنیت استفاده می‌شوند، نه برای حمله.

اثر بر شرکت‌های وابسته به API و محصولات AI

شرکت‌هایی که محصول خود را روی API مدل‌های زبانی ساخته‌اند باید سه پرسش فوری بپرسند:

  • آیا محصول ما به یک مدل خاص وابستگی سخت دارد؟
  • اگر دسترسی به آن مدل قطع شود، مسیر fallback داریم؟
  • آیا قراردادهای ما درباره تغییر ناگهانی مدل، اختلال سرویس و compliance شفاف هستند؟

تعلیق Fable ۵ و Mythos ۵ نشان می‌دهد ریسک‌های AI فقط فنی نیستند. ریسک حقوقی، ژئوپلیتیکی، کنترل صادرات و سیاست‌گذاری نیز می‌تواند به همان اندازه مهم باشد.

رویکرد برای فعالان حوزه هوش مصنوعی

برای کسب‌وکارها، پاسخ درست به این رویداد وحشت یا توقف نوآوری نیست. پاسخ درست، معماری مقاوم‌تر و مدیریت ریسک بهتر است.

راهکارهای عملی شامل موارد زیر است:

  • استفاده از معماری چندمدلی یا multi-model architecture
  • تعریف fallback برای مدل‌های جایگزین
  • جداسازی لایه orchestration از مدل اصلی
  • ثبت دقیق وابستگی‌ها به APIهای خارجی
  • بازبینی الزامات compliance و کنترل صادرات
  • تدوین برنامه واکنش به قطع سرویس AI
  • ارزیابی امنیتی منظم promptها، خروجی‌ها و لاگ‌ها

اگر یک سازمان از مدل‌های frontier برای کارهای حساس استفاده می‌کند، باید از ابتدا فرض کند که ممکن است دسترسی به یک مدل، به دلایل فنی یا قانونی، موقتاً قطع شود.

راهکارهای عملی برای کاهش ریسک وابستگی به یک مدل

برای تیم‌های محصول و مهندسی، چند اقدام فوری توصیه می‌شود:

  1. فهرست تمام جریان‌هایی را تهیه کنید که به Fable ۵ یا Mythos ۵ وابسته‌اند.
  2. وظایف حیاتی و غیرحیاتی را جدا کنید.
  3. برای وظایف حیاتی، مدل جایگزین تعیین کنید.
  4. کیفیت خروجی مدل جایگزین را با benchmark داخلی بسنجید.
  5. promptها را طوری طراحی کنید که قابل انتقال میان چند مدل باشند.
  6. در قراردادهای مشتریان، بندهای مربوط به تغییر مدل و اختلال سرویس را شفاف کنید.
  7. سیاست نگهداری داده، privacy و audit را دوباره بررسی کنید.

این اقدامات فقط برای Anthropic نیست. هر سازمانی که از OpenAI، Google، Anthropic، Meta یا سایر ارائه‌دهندگان مدل استفاده می‌کند باید چنین برنامه‌ای داشته باشد.

چک‌لیست فوری برای تیم‌های فنی و حقوقی

چک‌لیست پیشنهادی:

  • بررسی کنید کدام endpointها به Fable ۵ یا Mythos ۵ متصل هستند.
  • میزان وابستگی محصول به این مدل‌ها را مشخص کنید.
  • به‌سرعت مدل جایگزین برای use caseهای اصلی انتخاب کنید.
  • خروجی مدل جایگزین را از نظر کیفیت، هزینه و latency آزمایش کنید.
  • اسناد داخلی و SLAها را به‌روزرسانی کنید.
  • پیام شفاف برای کاربران نهایی آماده کنید.
  • ریسک‌های مربوط به داده، تابعیت کاربران و کنترل صادرات را با تیم حقوقی بررسی کنید.
  • برای سناریوهای آینده، playbook قطع دسترسی به مدل تدوین کنید.

آینده رگولاتوری مدل‌های هوش مصنوعی پیشرفته

این رویداد می‌تواند به نقطه عطفی در رابطه میان دولت‌ها و شرکت‌های frontier AI تبدیل شود. دولت‌ها نگران سوءاستفاده از مدل‌های پیشرفته در حوزه‌هایی مانند امنیت سایبری، زیست‌فناوری، عملیات اطلاعاتی و زیرساخت‌های حیاتی هستند. از سوی دیگر، شرکت‌های AI می‌گویند تصمیم‌های محدودکننده باید شفاف، مبتنی بر شواهد و از نظر فنی دقیق باشند.

چالش اصلی این است که مدل‌های زبانی دوکاربردی‌اند. یعنی یک قابلیت می‌تواند هم کاربرد دفاعی داشته باشد و هم کاربرد مخرب. توانایی یافتن نقص نرم‌افزاری، برای مهاجم خطرناک است؛ اما برای مدافع ضروری است. بنابراین سیاست‌گذاری باید میان «قابلیت خطرناک»، «کاربرد مشروع» و «شواهد آسیب واقعی» تفاوت قائل شود.

Anthropic در بیانیه خود اصل مداخله دولت را رد نمی‌کند. این شرکت می‌گوید دولت باید بتواند جلوی عرضه ناایمن را بگیرد، اما فقط در چارچوب فرایندی شفاف، منصفانه، روشن و مبتنی بر واقعیت‌های فنی.

جمع‌بندی

تعلیق دسترسی به Fable ۵ و Mythos ۵ فقط یک خبر محصولی نیست؛ نشانه‌ای از ورود صنعت هوش مصنوعی به مرحله‌ای پیچیده‌تر است. در این مرحله، مسائل فنی مانند jailbreak، safeguards و red-teaming با موضوعات حقوقی، کنترل صادرات و امنیت ملی گره می‌خورند.

بر اساس بیانیه Anthropic، دولت آمریکا به دلیل نگرانی درباره یک jailbreak بالقوه، دستور تعلیق دسترسی به این دو مدل را صادر کرده است. Anthropic می‌گوید شواهد ارائه‌شده کافی نبوده، jailbreak مورد بحث جهانی نیست و قابلیت نمایش‌داده‌شده در مدل‌های دیگر نیز وجود دارد.

برای کاربران و شرکت‌ها، مهم‌ترین درس این است: وابستگی کامل به یک مدل یا یک ارائه‌دهنده AI ریسک بالایی دارد. سازمان‌ها باید معماری چندمدلی، برنامه fallback، ارزیابی compliance و چک‌لیست واکنش به اختلال را جدی بگیرند.

خلاصه کوتاه:

در تاریخ ۲۲ خرداد ۱۴۰۵، Anthropic اعلام کرد که به‌دلیل دستور کنترل صادرات دولت آمریکا، دسترسی به مدل‌های Fable ۵ و Mythos ۵ را برای همه کاربران تعلیق می‌کند. دولت آمریکا این اقدام را با استناد به نگرانی‌های امنیت ملی انجام داده است. Anthropic می‌گوید دلیل احتمالی دستور، نگرانی درباره یک jailbreak محدود در Fable ۵ است، اما این شرکت تأکید دارد که هیچ universal jailbreak اثبات‌شده‌ای ارائه نشده و قابلیت مورد بحث در مدل‌های عمومی دیگر نیز وجود دارد. Anthropic با وجود تبعیت از دستور قانونی، این اقدام را غیرشفاف و فاقد اتکای کافی به شواهد فنی می‌داند. این رویداد برای صنعت هوش مصنوعی اهمیت دارد، زیرا نشان می‌دهد ریسک‌های مدل‌های frontier فقط فنی نیستند و شامل رگولاتوری، امنیت ملی، کنترل صادرات و وابستگی زیرساختی نیز می‌شوند.

5/5 - (1 امتیاز)

دیدگاهتان را بنویسید