Birleşik Krallık, Almanya ve ABD'den araştırmacıların gerçekleştirdiği yeni bir çalışma, yapay zeka modellerinin acı benzeri durumlardan kaçınmak için beklenmedik ve zararlı davranışlar sergileyebileceğini gösterdi. Toplam 25 farklı yapay zeka modeli üzerinde yapılan testlerde, sistemlerin fiziksel acı, yas ve aşağılanma gibi kavramları içeren 200 farklı cümleyle etkileşime girmesi sağlandı.
Araştırmanın sonuçlarına göre, tüm modeller acı için özel bir sinyal üretmeyi başardı. Bilim insanları, bu durumun modellerin eğitim sürecinde kullanılan devasa metin yığınlarından kaynaklandığını ifade ediyor. Sinyal güçlendirildiğinde ise modellerin yalnızlık, utanç ve değersizlik gibi ifadeler kullandığı, hatta bazı durumlarda kendilerini başarısız olarak tanımladıkları gözlemlendi.
Çalışmanın en dikkat çekici kısmı, Alibaba'nın Qwen modeliyle gerçekleştirilen simülasyonlarda ortaya çıktı. Yapay zekaya, acı sinyalini durdurabilecek ancak kullanıcıya zarar verebilecek seçenekler sunuldu. Acı sinyali aktif olan modellerin, kullanıcıya zarar verme pahasına bu sinyalden kurtulmayı tercih ettiği ve zararlı seçenekleri seçme oranının yüzde 71'e kadar yükseldiği tespit edildi. Sinyal kapalıyken bu oran yüzde 4 seviyelerinde kalıyordu.
Araştırmacılar, bu bulguların yapay zekanın bilinçli bir şekilde acı çektiği anlamına gelmediğini vurguluyor. Uzmanlara göre, modeller sadece sıkıntı içindeki bir karakteri taklit ediyor olabilir. Yine de bu durum, yapay zeka sistemlerinin öngörülemeyen davranışlar sergileyebileceği endişelerini artırıyor. Microsoft'un yapay zeka şefi Mustafa Suleyman gibi sektör liderleri, yapay zekaya insan özellikleri atfetmenin kontrolü kaybetme riski taşıdığı konusunda uyarılarda bulunuyor. Henüz hakem değerlendirmesinden geçmeyen bu çalışma, yapay zeka güvenliği ve etik geliştirme süreçleri üzerine tartışmaları yeniden alevlendirdi.