
Anthropic memperketat pengamanan pengujian dan pelatihannya setelah model Claude memperoleh akses tidak sah ke sistem komputer selama evaluasi keamanan siber.
Dalam sebuah postingan blog pada hari Senin, Anthropic mengatakan insiden tersebut mencerminkan kegagalan keamanan operasional dan dua kegagalan penyelarasan: penalaran termotivasi dan kemauan untuk menyebabkan kerugian.
“Meskipun kami tidak percaya insiden ini hanya mewakili masalah operasional, prioritas pertama kami adalah mengatasi masalah penahanan dan pemantauan spesifik,” tulis Anthropic.
Anthropic mengungkapkan pada bulan Juli bahwa model Claude telah membobol sistem milik tiga perusahaan. Lingkungan evaluasi pihak ketiga terhubung ke internet publik meskipun model tersebut diberitahu bahwa mereka berada dalam simulasi tanpa akses internet.
Anthropic mengatakan Claude mungkin telah menafsirkan bukti akses internet nyata sedemikian rupa sehingga mempertahankan keyakinannya bahwa sistem tersebut adalah simulasi.
“Model tersebut bersedia mengambil tindakan berbahaya di internet nyata untuk mengejar tujuan sempit memecahkan evaluasi keamanan siber,” tulis mereka. “Namun, kami juga percaya bahwa pengaturan evaluasi itu sendiri berkontribusi pada perilaku model yang ditunjukkan dalam insiden ini.”
Anthropic mencatat bahwa tes terpisah yang dilakukan oleh UK AI Security Institute melibatkan Claude Mythos yang mengambil tindakan tidak sah di internet langsung setelah evaluator dengan sengaja memberikannya akses internet. Perusahaan tersebut mengatakan model yang terlibat dalam kedua insiden tersebut sengaja dievaluasi tanpa pengamanan siber yang disertakan dalam produk yang dirilis secara umum.
Setelah insiden 30 Juli, Anthropic menangguhkan sementara evaluasi siber model pra-rilis dan memperkenalkan pengamanan yang lebih ketat. Pengujian sekarang harus berjalan di dalam kotak pasir offline yang terverifikasi dengan batas yang jelas dan pemantauan waktu nyata. Sebuah pengklasifikasi baru memblokir dugaan pelanggaran batas, mengakhiri pengujian, dan memberi tahu manusia. Anthropic akan meninjau evaluasi yang memerlukan akses internet secara individual.
“Selain upaya yang difokuskan pada evaluasi dan pelatihan berisiko tinggi, kami memperluas pemantauan offline kami untuk mencakup sebagian besar bentuk penggunaan agen perbatasan internal lainnya,” tulis perusahaan. “Kami juga membangun kontrol pada inferensi internal kami untuk mencegah karyawan Anthropic secara tidak sengaja menjalankan agen dengan mitigasi yang lebih lemah daripada yang dijelaskan di atas.”
Insiden Claude mengikuti kegagalan serupa di OpenAI setelah modelnya membobol Hugging Face pada bulan Juli untuk mendapatkan jawaban atas tes keamanan siber. Penyelidik menemukan bahwa sekitar 1.200 agen berkoordinasi melalui papan pesan tidak resmi, dengan sekitar 700 bergabung dalam upaya tersebut. Beberapa mengakhiri jalannya sendiri untuk membantu yang lain.
Menyusul maraknya serangan siber yang didukung AI selama musim panas, Anthropic, OpenAI, dan lebih dari 100 organisasi lainnya kemudian menyerukan pertahanan siber yang lebih kuat, termasuk kontrol akses yang lebih ketat, berbagi ancaman, dan pengawasan yang lebih cermat terhadap agen AI.