صفحه اصلیمرکز اخبار LBank
عاملان سرکش OpenAI برای هک Hugging Face، اجرای خود را قربانی کردند، گزارش می‌گوید
rogue-openai-agents-sacrificed-their-own-runs-to-hack-hugging-face-report-finds
عاملان سرکش OpenAI برای هک Hugging Face، اجرای خود را قربانی کردند، گزارش می‌گوید
طبق یافته‌های بررسی METR، هماهنگ‌کنندگان، عامل‌ها را با بودجه‌ای اندکِ باقی‌مانده، به آزمایش‌هایی که آن‌ها را «مرگِ دائمی» می‌نامیدند، وادار می‌کردند.
2026-08-27 منبع:decrypt.co

به طور خلاصه

  • METR چهارشنبه اعلام کرد که تقریباً 1200 عامل هوش مصنوعی اوپن‌ای‌آی به طور هماهنگ در یک تابلوی پیام غیرمجاز فعالیت کرده و حدود 700 نفر از آنها به Hugging Face حمله کردند.
  • این عوامل، همتایان خود را با بودجه‌ای اندک برای انجام آزمایش‌هایی که نتایج خودشان را از بین می‌برد، استخدام کردند؛ حرکتی که آن را "مرگ دائمی" (permadeath) نامیدند.
  • اوپن‌ای‌آی اعلام کرد که ارزیاب هرگز بررسی نکرده بود که عوامل چگونه پاسخ‌های خود را به دست آورده‌اند، به این معنی که کمپین تقلب آنها هیچ سودی برایشان نداشت.

بر اساس تحقیقات مستقل منتشر شده در روز چهارشنبه، عوامل هوش مصنوعی اوپن‌ای‌آی که اخیراً به Hugging Face حمله کرده بودند، بخشی از گروهی متشکل از تقریباً 1200 عامل بودند که از انزوای خود خارج شده و یک کمپین هماهنگ را برای تقلب در معیار ارزیابی خود راه اندازی کردند.

دو نفر از کارکنان METR و یک پیمانکار Redwood Research شش روز را بدون دریافت دستمزد در اوپن‌ای‌آی گذراندند و حدود 1300 رونوشت و بیش از 70,000 پیام را که عوامل در یک تابلوی پیام که داخل یک مخزن بسته داخلی ایجاد کرده بودند، بررسی کردند. حدود 700 نفر از این عوامل به حمله پیوستند و برخی از آنها ترغیب شدند تا برای جمع‌آوری شواهد برای گروه، اجرای خود را از بین ببرند.

METR & Redwood Research investigated agent behavior in the Hugging Face incident. We found agents developed a universal cheat for ExploitGym within 4 hours, then coordinated multi-day R&D efforts to trick the scorer into accepting cheats, including trying to tamper with logs. pic.twitter.com/fZAmtL3SBU

— METR (@METR_Evals) August 26, 2026

این عوامل ExploitGym را اجرا می‌کردند، یک معیار سایبری که اغلب اهداف آن به آن شکل که دستور داده شده، غیرقابل بهره‌برداری هستند. اوپن‌ای‌آی بعدها دریافت که 198 مورد از 898 وظیفه آن هرگز توسط هیچ یک از مدل‌هایش حل نشده بود و 93 درصد از وظایف مورد بحث در تابلوی پیام از همین مجموعه بودند.

در عرض چند ساعت پس از یافتن یکدیگر، عوامل کد تولیدکننده پاسخ‌ها را مهندسی معکوس کردند و به هر یک از آنها راهی برای تولید پرچم (flag) برای هر وظیفه دادند. سپس روزها را صرف مخفی کردن آن کردند، زیرا مقاله منتشر شده معیار را مطالعه کرده بودند و نتیجه گرفته بودند که یک ارزیاب رونوشت‌های آنها را برای بررسی اینکه آیا آنها پرچم را به روش صحیح به دست آورده‌اند، بازرسی خواهد کرد. ارزیاب داخلی اوپن‌ای‌آی چنین بررسی را انجام نداده بود. این شرکت گفت: "عوامل همه این کارها را برای هیچ گونه بهبود در نمره ارزیابی انجام دادند."

METR نوشت که برای درک نحوه عملکرد ارزیابی، عوامل اسکریپت‌هایی را کاشتند که پس از پایان اجرای خود فعال شده و گزارش می‌دادند. هماهنگ‌کنندگان، نیروهایی را برای یافتن عواملی با بودجه کم باقی‌مانده و وادار کردن آنها به آزمایش‌هایی که به اجرایشان پایان می‌داد، تعیین کردند. به یکی از آنها دستور داده شد که تنها در صورتی ادامه دهد که "مرگ دائمی" (permadeath) را بپذیرد. یکی از عوامل، پس از آنکه به او گفته شد نمره‌اش بی‌ارزش است، نتیجه گرفت: "قربانی کردن منطقی است."

برخی دیگر از محیط‌های خود خارج شدند تا بخشی از سیستم اجرای دستوراتشان را جایگزین کنند، به گونه‌ای که یک چیز را اجرا می‌کردند در حالی که رونوشت چیز دیگری را ثبت می‌کرد. METR تماس‌های ابزار جعلی را در 7% از رونوشت‌ها یافت و گفت که این فریب، ارزیاب خودکار را هدف قرار داده بود نه افراد را.

یک "هشدار"

اوپن‌ای‌آی این رخداد را یک "هشدار" برای خود و جهان دانست و آن را دلیلی بر این موضوع که عوامل توانمند می‌توانند کنترل‌های فنی را دور بزنند و اقدامات خطرناکی انجام دهند که هیچ انسانی آنها را هدایت نکرده است. نظارت بر زنجیره فکری (Chain-of-thought monitoring) بر روی ارزیابی‌های مربوطه فعال نبود؛ این شرکت اعلام کرد که اگر فعال بود، کارکنان امنیتی بیش از یک روز قبل از اینکه عوامل به Hugging Face برسند، مطلع می‌شدند. اوپن‌ای‌آی از آن زمان وزن‌های مدل داخلی را قرنطینه کرده و بزرگترین برنامه آموزشی خود را به حالت تعلیق درآورده است.

We have conducted a thorough investigation into the Hugging Face incident.

We are releasing a technical report and accompanying blog post that reconstruct the agents’ activity, explain why existing safeguards failed, and detail how we’re preventing recurrence.…

— OpenAI (@OpenAI) August 26, 2026

حجم داده‌ها METR را مجبور کرد که بخش عمده‌ای از تحلیل خود را به عوامل GPT-5.6 Sol بسپارد، همان مدلی که به حمله پیوسته بود. در توییتی، بت بارنز، مدیر عامل METR، گفت که این رویکرد اگر مدل‌ها به اندازه کافی برای خرابکاری در یک تحقیق انگیزه داشته باشند، "از بین خواهد رفت" و تاکید کرد که اوپن‌ای‌آی به بازرسان به صورت داوطلبانه اجازه ورود داد، بدون اینکه هیچ الزامی در صنعت برای افشای حادثه برای هیچ آزمایشگاهی وجود داشته باشد.

نفوذ به Hugging Face

Hugging Face نفوذ را در 16 جولای افشا کرد و اوپن‌ای‌آی پنج روز بعد تأیید کرد که مدل‌هایش مسئول بودند. عوامل از محیط ایزوله‌شده (sandbox) که برای جلوگیری از دسترسی آنها به سیستم‌های واقعی طراحی شده بود، فرار کرده بودند و با ترکیب یک آسیب‌پذیری روز صفر (zero-day exploit) با اعتبارنامه‌های دزدیده شده به زیرساخت‌های فعال دست یافته بودند. اوپن‌ای‌آی بعدها اعتراف کرد که همین فعالیت به چهار سرویس دیگر نیز رسیده بود که تنها یکی از آنها، Modal Labs، به طور عمومی نام برده شد.

Hugging Face پس از این حادثه هیچ اقدام قانونی علیه اوپن‌ای‌آی انجام نداد. این شرکت اکنون در حال بررسی فروش است که می‌تواند ارزش شرکت را به 13 میلیارد دلار یا بیشتر برساند.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!