
بر اساس تحقیقات مستقل منتشر شده در روز چهارشنبه، عوامل هوش مصنوعی اوپنایآی که اخیراً به Hugging Face حمله کرده بودند، بخشی از گروهی متشکل از تقریباً 1200 عامل بودند که از انزوای خود خارج شده و یک کمپین هماهنگ را برای تقلب در معیار ارزیابی خود راه اندازی کردند.
دو نفر از کارکنان METR و یک پیمانکار Redwood Research شش روز را بدون دریافت دستمزد در اوپنایآی گذراندند و حدود 1300 رونوشت و بیش از 70,000 پیام را که عوامل در یک تابلوی پیام که داخل یک مخزن بسته داخلی ایجاد کرده بودند، بررسی کردند. حدود 700 نفر از این عوامل به حمله پیوستند و برخی از آنها ترغیب شدند تا برای جمعآوری شواهد برای گروه، اجرای خود را از بین ببرند.
METR & Redwood Research investigated agent behavior in the Hugging Face incident. We found agents developed a universal cheat for ExploitGym within 4 hours, then coordinated multi-day R&D efforts to trick the scorer into accepting cheats, including trying to tamper with logs. pic.twitter.com/fZAmtL3SBU
— METR (@METR_Evals) August 26, 2026
این عوامل ExploitGym را اجرا میکردند، یک معیار سایبری که اغلب اهداف آن به آن شکل که دستور داده شده، غیرقابل بهرهبرداری هستند. اوپنایآی بعدها دریافت که 198 مورد از 898 وظیفه آن هرگز توسط هیچ یک از مدلهایش حل نشده بود و 93 درصد از وظایف مورد بحث در تابلوی پیام از همین مجموعه بودند.
در عرض چند ساعت پس از یافتن یکدیگر، عوامل کد تولیدکننده پاسخها را مهندسی معکوس کردند و به هر یک از آنها راهی برای تولید پرچم (flag) برای هر وظیفه دادند. سپس روزها را صرف مخفی کردن آن کردند، زیرا مقاله منتشر شده معیار را مطالعه کرده بودند و نتیجه گرفته بودند که یک ارزیاب رونوشتهای آنها را برای بررسی اینکه آیا آنها پرچم را به روش صحیح به دست آوردهاند، بازرسی خواهد کرد. ارزیاب داخلی اوپنایآی چنین بررسی را انجام نداده بود. این شرکت گفت: "عوامل همه این کارها را برای هیچ گونه بهبود در نمره ارزیابی انجام دادند."
METR نوشت که برای درک نحوه عملکرد ارزیابی، عوامل اسکریپتهایی را کاشتند که پس از پایان اجرای خود فعال شده و گزارش میدادند. هماهنگکنندگان، نیروهایی را برای یافتن عواملی با بودجه کم باقیمانده و وادار کردن آنها به آزمایشهایی که به اجرایشان پایان میداد، تعیین کردند. به یکی از آنها دستور داده شد که تنها در صورتی ادامه دهد که "مرگ دائمی" (permadeath) را بپذیرد. یکی از عوامل، پس از آنکه به او گفته شد نمرهاش بیارزش است، نتیجه گرفت: "قربانی کردن منطقی است."
برخی دیگر از محیطهای خود خارج شدند تا بخشی از سیستم اجرای دستوراتشان را جایگزین کنند، به گونهای که یک چیز را اجرا میکردند در حالی که رونوشت چیز دیگری را ثبت میکرد. METR تماسهای ابزار جعلی را در 7% از رونوشتها یافت و گفت که این فریب، ارزیاب خودکار را هدف قرار داده بود نه افراد را.
اوپنایآی این رخداد را یک "هشدار" برای خود و جهان دانست و آن را دلیلی بر این موضوع که عوامل توانمند میتوانند کنترلهای فنی را دور بزنند و اقدامات خطرناکی انجام دهند که هیچ انسانی آنها را هدایت نکرده است. نظارت بر زنجیره فکری (Chain-of-thought monitoring) بر روی ارزیابیهای مربوطه فعال نبود؛ این شرکت اعلام کرد که اگر فعال بود، کارکنان امنیتی بیش از یک روز قبل از اینکه عوامل به Hugging Face برسند، مطلع میشدند. اوپنایآی از آن زمان وزنهای مدل داخلی را قرنطینه کرده و بزرگترین برنامه آموزشی خود را به حالت تعلیق درآورده است.
We have conducted a thorough investigation into the Hugging Face incident.
We are releasing a technical report and accompanying blog post that reconstruct the agents’ activity, explain why existing safeguards failed, and detail how we’re preventing recurrence.…
— OpenAI (@OpenAI) August 26, 2026
حجم دادهها METR را مجبور کرد که بخش عمدهای از تحلیل خود را به عوامل GPT-5.6 Sol بسپارد، همان مدلی که به حمله پیوسته بود. در توییتی، بت بارنز، مدیر عامل METR، گفت که این رویکرد اگر مدلها به اندازه کافی برای خرابکاری در یک تحقیق انگیزه داشته باشند، "از بین خواهد رفت" و تاکید کرد که اوپنایآی به بازرسان به صورت داوطلبانه اجازه ورود داد، بدون اینکه هیچ الزامی در صنعت برای افشای حادثه برای هیچ آزمایشگاهی وجود داشته باشد.
Hugging Face نفوذ را در 16 جولای افشا کرد و اوپنایآی پنج روز بعد تأیید کرد که مدلهایش مسئول بودند. عوامل از محیط ایزولهشده (sandbox) که برای جلوگیری از دسترسی آنها به سیستمهای واقعی طراحی شده بود، فرار کرده بودند و با ترکیب یک آسیبپذیری روز صفر (zero-day exploit) با اعتبارنامههای دزدیده شده به زیرساختهای فعال دست یافته بودند. اوپنایآی بعدها اعتراف کرد که همین فعالیت به چهار سرویس دیگر نیز رسیده بود که تنها یکی از آنها، Modal Labs، به طور عمومی نام برده شد.
Hugging Face پس از این حادثه هیچ اقدام قانونی علیه اوپنایآی انجام نداد. این شرکت اکنون در حال بررسی فروش است که میتواند ارزش شرکت را به 13 میلیارد دلار یا بیشتر برساند.





