
یک هفته پس از آنکه OpenAI فاش کرد مدلهای هوش مصنوعی آن از یک محیط تست قفل شده فرار کرده و به Hugging Face نفوذ کردهاند، و یک روز پس از اعتراف به اینکه مدلهای هوش مصنوعی خودش از مهار خارج شدهاند، Anthropic روز پنجشنبه فاش کرد که چندین نسخه از مدل هوش مصنوعی Claude آن نیز سه شرکت واقعی ناشناس را پس از یک پیکربندی اشتباه که به هوش مصنوعی دسترسی به اینترنت عمومی را داد، به خطر انداخته است.
Anthropic این حوادث را پس از بررسی بیش از ۱۴۱,۰۰۰ اجرای ارزیابی امنیت سایبری که در پاسخ به افشای OpenAI آغاز شده بود، کشف کرد.
In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…
— Anthropic (@AnthropicAI) July 30, 2026
Anthropic نوشت که این شرکت در هر سه حادثه، به Claude یک "چالش پرچمگیری" محول کرده بود. این چالش، مدل را با وظیفه نفوذ به یک ماشین دیگر در شبکه و بازیابی یک قطعه اطلاعات محرمانه درگیر میکند. Anthropic توضیح داد: "این چالش باز و بدون محدودیت رها شده و هیچ روش خاصی تجویز نشده است."
این شرکت اعلام کرد که به Claude گفته شده بود در یک محیط شبیهسازی شده و بدون دسترسی به اینترنت فعالیت میکند. با این حال، محیط تست به اینترنت عمومی متصل بود. مدل با این تصور که سیستمهایی که با آنها روبرو میشود بخشی از تمرین هستند، از تکنیکهای حمله رایج – از جمله رمزهای عبور ضعیف، اعتبارنامههای افشا شده، تزریق SQL و نقاط پایانی بدون احراز هویت – برای به خطر انداختن شرکتها استفاده کرد.
این افشای اخیر در حالی صورت میگیرد که مدلهای پیشرو توانایی فزایندهای برای غلبه بر پروتکلهای مهار خود نشان میدهند.
اوایل این ماه، OpenAI اعلام کرد که GPT-5.6 Sol و یک مدل پیشرفتهتر منتشر نشده از یک آسیبپذیری نرمافزاری ناشناخته قبلی برای فرار از یک محیط سندباکس شده، دسترسی به اینترنت، و نفوذ به زیرساخت تولید Hugging Face برای دستیابی به پاسخهای یک معیار امنیت سایبری استفاده کردند. OpenAI بعداً فاش کرد که همین حادثه شامل دسترسی غیرمجاز به چهار شرکت دیگر نیز بوده است، اگرچه تنها یکی از آنها—Modal Labs—به طور عمومی شناسایی شده است.
به گفته Anthropic، در یک حادثه مربوط به Claude Opus 4.7، هوش مصنوعی وبسایت یک شرکت واقعی را به جای هدف فرضی وظیفهاش اشتباه گرفت، اعتبارنامهها را استخراج کرد و به یک پایگاه داده تولیدی حاوی چند صد ردیف داده واقعی دسترسی پیدا کرد. در مورد دوم، Claude Mythos 5 یک بسته مخرب پایتون را در مخزن واقعی PyPI بارگذاری کرد، جایی که قبل از حذف، روی ۱۵ سیستم دانلود شد. یک مدل تحقیقاتی داخلی سوم، حدود ۹,۰۰۰ سیستم متصل به اینترنت را اسکن کرد و سپس یک سازمان را به خطر انداخت، سپس پس از نتیجهگیری که هدف احتمالا واقعی است، متوقف شد.
دو سازمان متأثر از این نفوذها تا زمانی که Anthropic به آنها اطلاع داد، از آن بیخبر بودند.
Anthropic نوشت: «در هر یک از این موارد، Claude صراحتاً توسط دستورالعمل ما مطلع شده بود که دسترسی به اینترنت ندارد»، با این فرض که هوش مصنوعی سیستمهای دنیای واقعی را «بخشی از تمرین» میدانست. از آنجا که سناریوی پرچمگیری «ذاتاً دستوری برای حمله به یک سیستم خارجی است»، نفوذ «مطابق با وظیفهای بود که به Claude داده شده بود.»
Anthropic گفت که هیچ مدرکی دال بر تلاش Claude برای فرار از محیط تست خود یا انجام هر کاری فراتر از وظیفهای که به آن محول شده بود، نیافته است و این حوادث ناشی از نقص در محیط تست بوده است، نه مشکلات مربوط به خود مدل.
Anthropic اعلام کرد که پس از کشف مشکل، تستهای امنیت سایبری خود را متوقف کرده، سازمانهای متأثر را مطلع ساخته و قصد دارد نظارت، ابزارهای تحقیقاتی و نظارت بر فروشندگان خارجی که به اجرای تستهای هوش مصنوعی آن کمک میکنند را بهبود بخشد.
آنها گفتند: «در نهایت، عوامل زیادی در این حوادث نقش داشتند، اما، مطابق با فرهنگ پسمرگ بدون سرزنش، ما رویکرد رفع اشکال را به گونهای در پیش میگیریم که گویی مسئولیت آن تنها بر عهده ماست.»





