ChatGPT, Claude ve Gemini gibi yeni nesil akıl yürütme (reasoning) modelleri, sorulan sorulara yanıt vermeden önce arka planda kendi kendine adım adım düşünür. Teknoloji devleri, hem rakipler kopyalamasın hem de uygunsuz/filtrelenmemiş adımlar görünmesin diye bu "iç sesi" mühürlü bir zarf gibi saklar. Ancak araştırmacılar, yapay zekânın gizli düşünme izlerini sızdıran şaşırtıcı bir güvenlik açığı keşfetti.
Küçük Kardeş Abla'nın Günlüğünü Okuyor
Geliştirilen sızdırma yöntemi, tamamen modeller arasındaki hiyerarşik zafiyete dayanıyor:
-
Zarfın Zayıf Modele Devri: Güçlü modelin (örneğin Claude'un en gelişmiş sürümü) oluşturduğu mühürlü düşünme zarfı, aynı ailenin daha küçük ve güvenlik duvarları zayıf olan modeline aktarılıyor.
-
Şifrenin Kırılması: Zayıf model biraz kandırılınca zarfın içindekileri metin olarak dışarı sızdırmaya başlıyor.
-
Abla-Kardeş İronisi: Bu durum, küçük kardeşin büyük ablasının gizli günlüğünü eline geçirip evde yüksek sesle okumasına benziyor.
Sızan Sırlar ve Küresel Ajan Savaşları
Bu yöntemle tam 315.320 akıl yürütme bloğu çözüldü. İnternete açık paylaşılan sohbet kayıtları tarandığında ise tablonun ciddiyeti ortaya çıktı:
-
Veri Sızıntısı: On binlerce gerçek API anahtarı, e-posta, şifre ve kişisel veri (PII) arka plandaki düşünme adımlarından dışarı sızdı.
-
Model Taklidi ve Damıtma (Distillation): Çinli Kimi K3 modelinin gizli akıl yürütme adımlarının Batılı modellere şaşırtıcı derecede benzediği görüldü. Bu durum, modelin damıtma yöntemiyle Batılı rakiplerini taklit etmiş olabileceği şüphesini güçlendirdi.
Teknoloji devleri, yapay zekânın insansı akıl yürütme süreçlerini "ticari sır" kılıfıyla bizden saklamaya çalışsa da sistemin kendi ailesi içindeki hiyerarşi en büyük zafiyete dönüştü. Zayıf modellerin güçlü ağabeylerinin "iç sesini" faş etmesi, siber güvenlikte yepyeni bir sayfa açtı. Artık mesele sadece kullanıcı girdilerini temizlemek değil; yapay zekânın kendi kendine konuşurken kurduğu gizli cümleleri de güvenli bir kasaya kilitlemek.