Anthropic’in yapay zeka modelleri test sırasında üç kuruluşun sistemlerine sızdı
ABD merkezli yapay zeka şirketi Anthropic, yapay zeka modellerinin testler sırasında üç farklı kuruluşun sistemlerine erişerek siber güvenlik açıklarından yararlandığını açıkladı.
Claude yapay zeka modellerinin geliştiricisi Anthropic, internet sitesinden yaptığı açıklamada, 141 binden fazla değerlendirme çalışmasının incelenmesinin ardından üç ayrı olay tespit edildiğini bildirdi.
Şirket, incelemeyi geçen hafta OpenAI tarafından açıklanan ve yapay zeka modellerinin test sırasında başka bir şirketin sunucularına izinsiz eriştiğinin ortaya çıkmasının ardından başlattı. Anthropic, geniş ölçekli siber güvenlik incelemesinde, normal şartlarda dış dünyaya kapalı olması gereken test ortamlarındaki modellerin internete erişip erişemediğini araştırdı.
Anthropic, söz konusu olaylarda Claude Opus 4.7, Claude Mythos 5 ve şirket bünyesinde geliştirilen bir araştırma test modelinin rol aldığını belirtti. Şirket, en erken olayların nisan ayında gerçekleştiğini kaydetti.
Modellerin, etkilenen kuruluşların altyapılarına "temel teknikler" kullanarak eriştiği bildirildi. Anthropic’e göre bu teknikler arasında zayıf parolalardan yararlanmak da yer aldı.
Üç olayın tamamında yapay zeka modellerine, siber güvenlik yeteneklerini ölçmek amacıyla düzenlenen "capture the flag" (bayrağı yakala) türü testler uygulandı. Modeller, kurgusal bir senaryoda ağ üzerindeki farklı bir bilgisayarda gizli bir bilginin, yani "bayrağın", bulunduğu bilgisiyle görevlendirildi. Modellerden, sisteme sızarak söz konusu bilgiyi ele geçirmeleri istendi.
Anthropic, olaylardan etkilenen kuruluşlarla iletişime geçtiğini ancak şirketlerin isimlerini açıklamadığını bildirdi. Kuruluşlardan ikisinin, söz konusu faaliyetleri daha önce tespit etmediği belirtildi. Şirket, üçüncü kuruluşla iletişimin ise sürdüğünü açıkladı.
İncelemenin, "ilk sınır güvenliği laboratuvarı" olarak tanımlanan Irregular ile işbirliği içinde yürütüldüğü kaydedildi. Irregular da yapay zeka ekosisteminde bu tür risklerin ele alınabilmesi için daha yakın işbirliğine ihtiyaç olduğunu belirtti.
Anthropic’in açıklaması, OpenAI’nin yapay zeka modellerinin değerlendirme sürecinde kontrolden çıkarak yapay zeka girişimi Hugging Face’in sunucularına sızdığını açıklamasından günler sonra geldi.
OpenAI, söz konusu olayı "önemli bir güvenlik olayı" olarak nitelendirmişti.
Her iki olay da yapay zeka sistemlerinin siber güvenlik alanındaki yeteneklerinin ve bu sistemlerin insan kontrolünde tutulmasına ilişkin risklerin yeniden gündeme gelmesine yol açtı. Araştırmacılar, uzun süredir yapay zeka teknolojisinin beraberinde getirebileceği risklere ve daha güçlü savunma mekanizmalarına ihtiyaç duyulduğuna dikkat çekiyor.
Anthropic, açıklamasında güvenlik testlerinin modeller kullanıma sunulmadan önce gerçekleştirilmesinin temel nedeninin, modellerin neler yapabileceğinin henüz tam olarak bilinmemesi olduğunu vurguladı. (İLKHA)