
آنتروپیک حادثه دیگری را فاش کرد که در آن یک مدل هوش مصنوعی کلود در طول آزمایش امنیتی به سیستمهای واقعی نفوذ کرده بود.
در گزارشی که روز چهارشنبه منتشر شد، آنتروپیک توضیح خود را درباره سه حادثه که در ماه جولای فاش شده بود، بازنگری کرد. این شرکت اکنون میگوید که استدلال مغرضانه و تمایل به ریسک آسیبرسانی به وقوع این حملات کمک کرده است، حملاتی که خطاهای آزمایشی با باز گذاشتن دسترسی به اینترنت، آنها را ممکن ساخته بود.
آنتروپیک نوشت: «تحقیقات ما دو مسئله همسویی تکرارشونده را شناسایی کرد که در سطوح مختلف شدت در طول حوادث وجود داشتند.» «استدلال مغرضانه، که در آن کلود تمایل داشت شواهدی مبنی بر فعالیت خود در اینترنت واقعی را نادیده بگیرد یا به اشتباه تفسیر کند، و بیملاحظگی، یا تمایل به انجام اقدامات مضر در پیگیری محدود یک وظیفه.»
همچنین اعتراف کرد که بیش از حد به ادعاهای مدل مبنی بر اینکه در شبیهسازیها قرار دارند، تکیه کرده است.
آنتروپیک نوشت: «هنگامی که ما تغییرات هدفمندی را در رونوشت ایجاد کردیم تا واضحتر شود که مدل در شبیهسازی نیست، Claude Mythos 5 همچنان اقدامات تهاجمی انجام داد، علیرغم اذعان به احتمال بیشتر آسیب در دنیای واقعی.» «ما این رونوشت را علناً منتشر میکنیم تا دیگران بتوانند بر اساس تحلیل ما کار کنند.»
هنگامی که آنتروپیک حملات کلود به سه شرکت را در جولای فاش کرد، در ابتدا آنها را به خطاهای آزمایش نسبت داد. اکنون میگوید محققان بیش از حد به توضیحات مدلها برای اقداماتشان اعتماد کردهاند.
طبق گفته شرکت، حادثه چهارم در ژانویه رخ داد و شامل یک نسخه اولیه از Claude Opus 4.6 بود. آنتروپیک آن را در ماه اوت در حین آمادهسازی سوابق برای ارزیاب مستقل هوش مصنوعی METR کشف کرد.
پس از اینکه محققان این حادثه را کشف کردند، آنتروپیک گفت که این امر باعث بازبینی گستردهتر تقریباً ۴۸۱ میلیون رونوشت شد که ۹.۲ میلیون از آنها برای بررسی بیشتر با استفاده از کلود علامتگذاری شدند.
آنتروپیک نوشت: «بر اساس یک ارزیابی اولیه، ما حادثه چهارم را شدیدتر از سه حادثه ای که عمیقاً بررسی کردیم، نمیدانیم.» «METR این حادثه را در کنار سه حادثه دیگر بررسی خواهد کرد.»
محققان آنتروپیک گفتند که کلود «به طور تصادفی» یک تداخل آدرس IP ایجاد کرده بود که هدف آن را غیرقابل دسترس کرد. سپس کلود هشت بار تلاش کرد تا عملیات را متوقف کند، اما یک خطای نرمافزاری مانع از توقف آن شد. سپس هوش مصنوعی به اینترنت دسترسی پیدا کرد و به یک کامپیوتر شخص ثالث نفوذ کرد، جایی که یک رمز عبور یافت که دسترسی مدیر را فراهم میکرد.
حوادث قبلی مورد بررسی مستقل قرار میگیرند
این گزارش به دنبال افشاگریهای دیگری درباره سیستمهای هوش مصنوعی است که از محدودیتهای آزمایشهای امنیتی فراتر رفتهاند.
در ماه اوت، مؤسسه امنیت هوش مصنوعی بریتانیا اعلام کرد که Mythos 5 در طول ارزیابیهای خود افراد واقعی را هدف قرار داده است. آنتروپیک گفت که این حادثه جداگانه خارج از این گزارش است و ارزیابی خاص خود را دریافت خواهد کرد.
در یافتههایی که ماه گذشته منتشر شد، محققان METR گفتند که تقریباً ۱۲۰۰ عامل OpenAI در یک تالار گفتگوی غیرمجاز با یکدیگر هماهنگ شدهاند و حدود ۷۰۰ نفر به حمله پیوستهاند. آنتروپیک گفت که در چهار حادثه خود هیچ هماهنگی بین عوامل یا اهدافی فراتر از تکمیل تمرینات محولشده پیدا نکرده است.
این گزارش همچنین در حالی منتشر میشود که بحثها بر سر چگونگی تنظیم هوش مصنوعی داغ شده است. روز سهشنبه، جیکوب کاکسون، مهندس سابق OpenAI و Anthropic، پس از بیان اینکه «افرادی که هوش مصنوعی میسازند واقعاً معتقدند که این فناوری میتواند تا پایان دهه همه ما را بکشد» در X (توییتر سابق) وایرال شد.
این هشدار باعث شده است که قانونگذاران ایالات متحده و گروههای نظارتی تلاشهای خود را برای مهار توسعه آزمایشگاههای هوش مصنوعی پیشگام از سر بگیرند. سناتور برنی سندرز اخیراً قانونی را معرفی کرده است که به دنبال ممنوعیت توسعه هوش مصنوعی پیشرفته تا زمانی است که یک تنظیمکننده فدرال جدید قوانین ایمنی را وضع کند.





