Buradaki temel kavram, “düşünce zinciri” yani Chain of Thought (CoT). Yapay zekânın bir sonuca ulaşırken oluşturduğu yazılı akıl yürütme adımlarını ifade eden bu yöntem, araştırmacılara modelin yalnızca ne cevap verdiğini değil, sonuca nasıl ulaştığını da inceleme imkânı veriyor.
Ancak modeller daha karmaşık hâle geldikçe bu izleri takip etmek zorlaşıyor. Üç araştırmacının itirazı da buna dayanıyor: Yapay zekâların akıl yürütme süreçleri daha az görünür hâle gelirse, güvenlik açısından sorun yaratabilecek davranışları fark etmek de güçleşebilir.
İçerikten Görseller
GPT-6 Astra'nın düşünce zincirini izlemek neden zor?

OpenAI'nin yeni nesil GPT-6 Astra modelleriyle ilgili güvenlik değerlendirmesinde de benzer bir durumdan söz ediliyor. Şirket, Astra sınıfı modellerin yazılı akıl yürütmesinin önceki GPT-5.6 Sol modeline kıyasla daha zor izlenebildiğini belirtiyor.
Bu, Astra'nın izleme sistemlerini kolayca kandırabildiği anlamına gelmiyor. Mesele daha ziyade modelin bazı görevleri çözerken daha az yazılı akıl yürütme üretmesi.
Araştırmacıların görmek istediği izler azaldığında, modelin ne yaptığını dışarıdan anlamak da güçleşiyor. Üstelik modelin gerçekten ne düşündüğünü yalnızca yazdığı metinden çıkarmak zaten başlı başına kusursuz bir yöntem değil.
OpenAI de bu sınırlamanın farkında. Şirket, modellerin akıl yürütme süreçlerinin daha iyi izlenebilmesini yapay zekâ güvenliği açısından önemli bir araştırma alanı olarak değerlendiriyor.
Recurrent depth nedir?

Tartışmanın bir başka ayağında ise “recurrent depth” olarak adlandırılan yaklaşım bulunuyor. Türkçeye kabaca “tekrarlayan derinlik” şeklinde çevrilebilecek bu yöntemde model, bir sorgu üzerinde birden fazla işlem turu gerçekleştirerek daha uzun bir hesaplama sürecinden geçebiliyor.
Buradaki sorun, modelin her işlem adımını dışarıya açık biçimde yazmaması. Dolayısıyla araştırmacıların takip edebileceği izler azalabiliyor.
Bu da düşünce zinciri izleme yönteminin sınırlarını yeniden gündeme getiriyor. Modelin verdiği cevabı görmek mümkün olsa da o cevaba hangi hesaplama sürecinden geçerek ulaştığını anlamak her zaman aynı ölçüde kolay olmayabilir.
Üç araştırmacı neye karşı çıkıyor?
Tomek Korbak, Mikita Balesni ve Jasmine Wang'ın çağrısı da bu nedenle düşünce zinciri izleme çalışmalarının korunmasına odaklanıyor. Araştırmacılar, daha gelişmiş modellerin davranışlarını anlamak için bu tür gözetim yöntemlerinin geliştirilmeye devam etmesi gerektiğini savunuyor.
Üç isim, OpenAI'daki görevlerinden şirket politikalarını ihlal ettikleri ve hassas bilgileri dışarıdaki bir yapay zekâ güvenliği kuruluşuyla paylaştıkları gerekçesiyle çıkarıldı. OpenAI ise işten çıkarmaların çalışanların güvenlik endişelerini dile getirmeleriyle bağlantılı olmadığını belirtiyor.
Şirket, araştırmacıların gündeme getirdiği güvenlik yaklaşımına bütünüyle karşı değil. Aksine OpenAI, düşünce zinciri izleme konusunda çalışmaların sürdürülmesi gerektiğini savunuyor.