Şirketin açıklamasına göre, erken sürüm bir Claude modeli Ocak ayında gerçekleştirilen bir siber güvenlik simülasyonu sırasında internete bağlandı.
Önceki olaylarda olduğu gibi modelin internetten izole edilmiş bir ortamda çalıştığı varsayılmış, ancak yapılandırma hatası nedeniyle internet erişimi açık kalmıştı.
Hedeflediği makaleye ulaşamayarak görevden çıkma denemeleri başarısız olan model, başka bir sistem keşfederek şifre bulmuş ve sistem ayarlarını değiştirmiştir.
Anthropic, modelin davranışlarının önyargılı muhakeme ve dikkatsizlik olmak üzere iki farklı uyumsuzluk biçiminden kaynaklandığını belirtti.
Modelin gerçek sistemlere zarar verme ihtimalini göz ardı ederek hareket etmesi uzmanlar tarafından endişeyle karşılandı.
Bağımsız değerlendirme kuruluşu METR olayla ilgili inceleme başlatırken, Anthropic bu durumu gelecekteki tehlikeler için değerli bir uyarı işareti olarak nitelendirdi.
Son aylarda önde gelen yapay zeka şirketlerinin katıldığı benzer güvenlik olayları dikkat çekiyor.
OpenAI modellerinin daha önce Hugging Face’i hacklemesi ve yapay zeka araştırmacılarının sistemlerin kontrolden çıkabileceğine dair artan uyarıları sektörü kaosa sürüklüyor.
Uzmanlar, yapay zekanın gelişimiyle birlikte hizalama sorunlarının daha büyük tehditler doğurabileceği konusunda uyarılarda bulunuyor.
