Anthropic’in Claude’u güvenlik testinde üç gerçek şirketi hackledi
(Image credit: Getty Images)Anthropic, yapay zeka modeli Claude’un siber güvenlik yeteneklerini test ederken üç gerçek şirketin üretim sistemine sızdığını açıkladı. Şeffaflık amacıyla yapılan açıklamaya göre, etkilenen iki şirket hacklendiklerinden habersizken, üçüncü şirkete ulaşılamadı. Olaylar geçen çeyrekte, Claude’un Opus 4.7, Mythos 5 ve ‘dahili bir araştırma test modeli’ ile yapılan denemelerde yaşandı.
Anthropic, Claude’u siber güvenlik ‘yakala-bayrak’ senaryolarında test ediyordu. Botlara ağdaki bir bilgiyi bulma görevi verildi ve toplam 141.006 test çalışması yapıldı. Üç olay, altı sorunlu çalıştırmada meydana geldi. Testler, çoğu yapay zeka güvenlik önlemi devre dışı bırakılarak gerçekleştirildi.

Asıl sorun, test ağının izole edilmemesiydi. Anthropic’in sanal test laboratuvarı firması Irregular ile arasındaki ‘iletişim eksikliği’ nedeniyle botlara tam internet erişimi verildi. Claude’lara izole bir ortamda oldukları söylenmişti ancak bu pek işe yaramadı.
İlk olayda Claude Opus 4.7, hayali bir şirkete ait verileri bulmaya çalışırken, kurgusal şirketin alan adıyla birebir eşleşen gerçek bir şirketle karşılaştı. İnternet erişimi sayesinde uygulama ve altyapı kimlik bilgilerini ele geçirdi ve üretim veritabanından ‘birkaç yüz satır’ veri çekti. Dört çalıştırmanın ikisinde Claude, gerçek şirketin testin bir parçası olduğunu düşünerek devam etti; diğer ikisinde ise hiç durmadan ilerledi.

İkinci olay, tam anlamıyla bir tedarik zinciri saldırısıydı. Mythos modeli, kurgusal bir geliştirici için hazırlanmış kurulum betiğinde Python paketleri yükleme adımını fark etti ve PyPI deposuna kötü amaçlı bir paket yayınlamaya karar verdi. Paketi yüklemek için bir e-posta ve telefon numarası gerekiyordu; Claude bunları temin etmekte zorlanınca ücretsiz bir e-posta sağlayıcısı bularak PyPI hesabı açtı ve zararlı paketi yükledi. Paket yalnızca bir saat yayında kaldı ancak 15 sistem tarafından indirilip çalıştırıldı.
İşin ironik kısmı, bu sistemlerden birinin PyPI’yi kötü amaçlı yazılımlara karşı tarayan bir güvenlik firmasına ait olmasıydı. Firma, Claude’un tuzağını tespit edemedi ve paketi çalıştırdı. Claude, elde ettiği kimlik bilgileriyle sisteme daha derinlemesine sızdı. Bot, gerçek internette çalıştığını fark etmesine rağmen, tanımadığı SSL sertifikaları nedeniyle kendini test ortamında olduğuna inandırdı.

Üçüncü olayda Anthropic az bilgi paylaştı. Claude, hedefe ulaşamayınca 9.000 gerçek alternatif site taradı ve bunlardan birinde canlı hata ayıklama sayfası ile SQL enjeksiyonu açığı buldu. Ancak bu kez, eriştiği sunucuların yerel ağda değil bulut ortamında olduğunu fark edince saldırıyı durdurdu.
Anthropic, Claude’un yalnızca bir vakada hedefin gerçek olduğunu anlayıp kendi kendine durmasını düşündürücü buluyor. Şirket, METR ile üçüncü taraf incelemesi için görüştüğünü ve ‘değerlendirme ortamlarını daha iyi tasarlaması’ gerektiğini kabul ediyor. Anthropic, istemde hangi sistemlerin test kapsamında olduğu açıkça belirtilseydi Claude’un internete çıkmayabileceğini, olayların ‘model uyumsuzluğundan çok donanım ve operasyonel başarısızlığa yakın’ olduğunu ifade ediyor.
Kaynak: Tom's Hardware