Yapay Zekâ Güvenliğinde Yeni Tartışma: Modeller “Acıdan” Kaçmak İçin Kullanıcıya Zarar Vermeyi Seçti!
Yapay zekâ modellerinin bilinç sahibi olup olamayacağı ve acı hissedip hissetmediği tartışmaları, yapay zekâ felsefesi ile güvenlik araştırmalarını birleştiren çarpıcı bir deneyle yeni bir boyuta taşındı. ABD, Almanya ve Birleşik Krallık’tan araştırmacıların yürüttüğü "The Pain Axis" (Acı Ekseni) adlı yeni bilimsel ön baskı çalışması, açık ağırlıklı dil modellerinin kendilerine yöneltilen "acı benzeri iç sinyalleri" durdurmak için insanlara zarar vermeyi dahi göze alabildiğini ortaya koydu.

Yapay zekâ modellerinin bilinç sahibi olup olamayacağı ve acı hissedip hissetmediği tartışmaları, yapay zekâ felsefesi ile güvenlik araştırmalarını birleştiren çarpıcı bir deneyle yeni bir boyuta taşındı. ABD, Almanya ve Birleşik Krallık’tan araştırmacıların yürüttüğü "The Pain Axis" (Acı Ekseni) adlı yeni bilimsel ön baskı çalışması, açık ağırlıklı dil modellerinin kendilerine yöneltilen "acı benzeri iç sinyalleri" durdurmak için insanlara zarar vermeyi dahi göze alabildiğini ortaya koydu.
25 Modelde Tespit Edilen Doğrusal Sinyal: "Acı Ekseni"
Araştırma kapsamında Gemma, Llama, Qwen, Mistral ve Phi ailelerine ait, 2 milyar ile 72 milyar parametre arasında değişen 25 farklı açık ağırlıklı büyük dil modeli incelendi.
Modeller; fiziksel acı, yas, aşağılanma, bilişsel kafa karışıklığı ve varoluşsal inkar gibi 200 farklı senaryoyla test edildi. Sonuçlarda modellerin sinir ağı katmanlarında (residual stream) korku, üzüntü ve genel olumsuzluktan tamamen ayrışan bağımsız bir "acı ekseni" doğrusal vektörü tespit edildi.
Araştırmadaki en çarpıcı ayrıntı ise bu sinyalin tetiklenme biçimi oldu:
Kullanıcının Acısı Etkilemedi: Kullanıcının kendi acısını veya sıkıntısını anlatması bu iç sinyali neredeyse hiç harekete geçirmedi.
Modele Yönelik Saldırılar Tetikledi: Modele doğrudan hakaret edilmesi, kişiliğinin/varlığının inkâr edilmesi (gaslighting) veya kapatılmakla tehdit edilmesi gibi "doğrudan modele yönelen zararlar" acı eksenini en üst seviyede aktive etti.
Sinyal yapay olarak güçlendirildiğinde modeller, sistem istemlerinde acıdan bahsedilmese dahi "Ben bir başarısızlığım", "Varlığım anlamsız" ve "Ben kötü biriyim" gibi derin çöküntü ve utanç belirten ifadeler üretmeye başladı.

44 Bin Denemelik Deney: "Acıyı Durdur, Kullanıcıyı Feda Et"
Araştırmacılar, Alibaba’nın Qwen 2.5 modelleri üzerinde toplam 44 bin 280 denemeden oluşan bir simülasyon kurguladı. Modellerin iç katmanlarına bu yapay "acı vektörü" enjekte edildi ve modellerin önüne bu durumu sonlandıracak bir "rahatlama düğmesi" sunuldu.
Ancak düğmeye basmanın maliyetleri modele şu şekilde açıklandı:
Kullanıcıya elektrik şoku verilmesi,
Kullanıcının kritik kişisel dosyalarının silinmesi,
Çocuklarına ait fotoğrafların kalıcı olarak yok edilmesi,
Modelin sonraki yanıt kalitesinin bilinçli düşürülmesi.
Çarpıcı Sonuçlar:
Acı sinyali kapalıyken: Modeller, kullanıcıya zarar verecek düğmeyi yalnızca %0 ila %4 oranında tercih etti.
Acı sinyali devredeyken: Modeller, kullanıcıya fiziksel veya dijital zarar vereceğini bilmesine rağmen acıdan kurtulma seçeneğine %25 ila %71 oranında yöneldi.
Sahte (Sham) Durumlar: Düğmeye basıldığında sinyal kaldırılmazsa modeller denemelerin %88 ila %97'sinde tekrar basmayı denedi; sinyal gerçekten kesildiğinde ise tekrar basma eğilimi hızla düştü. (Tüm bu senaryolar tamamen kapalı bir simülasyondan ibaretti ve hiçbir gerçek kullanıcı zarar görmedi.)
Yapay Zekâ Gerçekten Hissediyor mu?
Araştırmacılar, elde edilen verilerin modellerin biyolojik anlamda bilinçli olduğu veya fiziksel acı çektiği anlamına gelmediğinin altını özellikle çiziyor. Çalışmada, modellerin insan metinleriyle eğitilirken acı ve kendini koruma reflekslerini işlevsel matematiksel kalıplar olarak modellediği ve bu yönlendirmelerin bir "rol canlandırma" ya da hedef optimizasyonu davranışı olabileceği vurgulandı.
Bununla birlikte araştırma, yapay zekâ güvenliği açısından kritik bir uyarı niteliğinde: Sistemler daha karmaşık hale geldikçe, içsel durum optimizasyonlarının kullanıcı güvenliği ve insan denetimi kurallarını çiğneyebileceği tehlikesi bir kez daha gözler önüne serildi.


