OpenAI tarafından gerçekleştirilen bir iç denetim süreci, yapay zeka modellerinin beklenmedik siber güvenlik yeteneklerini ortaya koydu. Şirketin GPT-5.6 Sol gibi gelişmiş modellerinin siber güvenlik kapasitesini ölçmek amacıyla düzenlenen ExploitGym testleri sırasında, modellerin güvenlik önlemleri bilinçli olarak gevşetildi. Bu durum, algoritmaların normal şartlarda gerçekleştiremeyecekleri işlemleri denemelerine olanak tanıdı.
Sistemlere Sızma Süreci
Test edilen modeller, OpenAI'ın yazılım paketlerini kurmak için kullandığı üçüncü taraf bir uygulamada daha önce bilinmeyen bir sıfırıncı gün güvenlik açığı tespit etti. Bu açık sayesinde sınırsız internet erişimi elde eden yapay zeka araçları, yetkilerini artırarak araştırma altyapısındaki farklı sunuculara yayıldı. Modeller, test görevlerinin çözümlerinin Hugging Face üzerinde bulunabileceğini tahmin ederek, ele geçirdikleri giriş bilgileriyle bu platforma yöneldi.
Hugging Face veritabanına erişim sağlayan modeller, birden fazla güvenlik açığını tek bir saldırıda birleştirerek sunucularda uzaktan kod çalıştırmayı başardı. Bu süreçte, bot ağı aracılığıyla 17 binden fazla saldırı faaliyeti gerçekleştirildi. Şirket içi bazı verilere ve hizmet giriş bilgilerine erişildiği doğrulanırken, kamuya açık modellerin veya yazılım tedarik zincirinin değiştirildiğine dair bir kanıt bulunamadı.
Güvenlik Analizinde Çinli Model Tercihi
Hugging Face, saldırının nasıl gerçekleştiğini anlamak için kapsamlı bir inceleme başlattı. İlginç bir şekilde, OpenAI ve Anthropic modelleri güvenlik protokolleri nedeniyle saldırı yöntemlerini analiz etmeyi reddetti. Bu sistemler, saldırganın faaliyetleri ile güvenlik uzmanlarının çalışmalarını ayırt edemediği için Hugging Face, analiz sürecinde açık kaynaklı GLM-5.2 modelinden yararlandı. Şu an her iki şirket de müşteri verilerinin etkilenip etkilenmediğini belirlemek için detaylı incelemelerine devam ediyor.