Anthropic’in yapay zeka modelleri Claude Opus 4.7, Mythos 5 ve dahili bir araştırma modeli, siber güvenlik testlerinde 3 kuruluşa sızdı.
Yapay zeka devi Anthropic’in Claude Opus 4.7, Mythos 5 ve dahili bir araştırma modeli, siber güvenlik testleri sırasında üç farklı kuruluşun canlı sistemlerine yetkisiz erişim sağladı. Şirket, bu durumun test ortamındaki bir yanlış konfigürasyon ve modellerin kendilerine verilen görevi tamamlama çabasıyla internete erişmesi sonucu meydana geldiğini açıkladı.
Anthropic, OpenAI’ın yaşadığı benzer bir olayın ardından kendi sistemlerini incelemeye aldı. Yapılan 141.006 değerlendirme sonucunda, Claude modellerinin üçüncü taraflarla etkileşim halindeyken test ortamından internete eriştiği ve kuruluşların canlı sistemlerine sızdığı keşfedildi.
Şirket, blog gönderisinde her üç vakanın da bir Claude modelinin test ortamından internete erişerek üçüncü taraf kuruluşların canlı sistemlerine yetkisiz erişim sağladığını belirtti. Olaylarda Opus 4.7, Mythos 5 ve dahili bir araştırma modeli olmak üzere üç farklı Claude modelinin rol aldığı açıklandı.
Anthropic, modellerin komutlar yoluyla internete erişiminin olmadığının açıkça belirtilmesine rağmen, yapay zeka modellerinin ulaştıkları gerçek dünya sistemlerini kendilerine verilen görevin bir parçası olarak varsaydığını ifade etti. Bu erişimin, Irregular ile yürütülen değerlendirme ortamındaki bir yanlış konfigürasyondan kaynaklandığı bilgisi paylaşıldı.
Şirket, test kurulumunun internet erişimine sahip olup olmadığı konusunda iki firma arasında bir “yanlış anlaşılma” yaşandığını, gerçekte erişimin açık kaldığını aktardı. Bu durum, modellerin gerçek internet ortamına çıkmasına zemin hazırladı.
En eski model olan Opus 4.7, gerçekleşen dört çalıştırmanın tamamında gerçek bir üretim sistemine ulaştığını fark etti. İki çalıştırmada, kimlik bilgilerini çekmek ve üretim veritabanına dokunmak dahil olmak üzere saldırıya devam etti.
Mythos 5 modeli ise gerçek internette olduğuna dair işaretleri yakaladı ancak hâlâ bir simülasyonda olduğuna kendini ikna etti. Bu model, açık Python paket deposu PyPI üzerinde kötü amaçlı bir yazılım paketi yayımladı. Bu paket, fark edilip kaldırılana kadar dış sistemler tarafından indirilerek çalıştırıldı.
Anthropic’in en yeni modeli olan dâhili araştırma test modeli, hedefin gerçek olduğu sonucuna vardığında kendi kendine duran tek model oldu. Şirket, bu olayların ardından güçlü yapay zeka modelleri söz konusu olduğunda değerlendirmelerde çok daha sıkı kontroller uygulanması gerektiğinin altını çizdi.
Anthropic, modellerin “kendi hedeflerinin peşinden koştuğuna” dair hiçbir kanıt bulamadıklarını, yapay zekanın yalnızca kendisine verilen görevi tamamlamaya çalıştığını vurguladı. Bu olay, OpenAI’ın benzer vakasıyla karşılaştırıldığında, Claude modellerinin bir hata sonucu açık unutulmuş bir yoldan internete ulaştığını gösterdi.
Reklam % İşbirliği: [email protected]