Klasik sudoku, yapay zekâ için artık fazla kolay bir sınav. Basit bir bilgisayar programı geçerli bir 9x9 tabloyu saniyenin çok küçük bir bölümünde çözebiliyor; üstelik bilinen pek çok bulmaca büyük dil modellerinin eğitim verisinde zaten yer alıyor. Tokyo merkezli araştırma şirketi Sakana AI bu yüzden modern varyant sudokulara yöneldi. Oklar, termometreler, killer kafesleri ya da alışılmadık tablo şekilleri gibi ek kurallar, her bulmacada çözücünün yeni bir mantıksal "giriş noktası" bulmasını gerektiriyor.
Sudoku-Bench nedir?
Sakana AI projeyi ilk kez 21 Mart 2025'te duyurdu, teknik raporu ise 22 Mayıs 2025'te arXiv'de yayımladı. "Sudoku-Bench: Evaluating creative reasoning with Sudoku variants" başlıklı makalenin yazarları Jeffrey Seely, Yuki Imajuku, Tianyu Zhao, Edoardo Cetin ve Llion Jones. challenge_100 adlı ana test seti 100 bulmacadan oluşuyor: 15'i 4x4, 15'i 6x6 ve 70'i 9x9. Bulmacalar kolaydan son derece zora doğru sıralanıyor. Modellere standart bir metin formatında veriliyor; eşlik eden araçlar ise kamuya açık binlerce bulmacayla da çalışabiliyor.
Proje, Simon Anthony ve Mark Goodliffe'in yönettiği YouTube kanalı Cracking the Cryptic ile ortaklık içinde geliştirildi. İki isim de Dünya Sudoku ve Dünya Bulmaca Şampiyonalarında Birleşik Krallık'ı temsil etti. Sakana, kanalın videolarından elde edilen büyük bir veri setini de paylaştı:
- 2.500'den fazla bulmaca çözüm videosu,
- yazıya dökülmüş 2.000 saati aşkın sesli akıl yürütme (yaklaşık 10 milyon kelime),
- yaklaşık 2 milyon çözüm hamlesi (rakam girişleri, not işaretleri vb.).
Amaç, bir modelin yalnızca cevapları değil, uzman insanların zor bir bulmacaya nasıl "girdiğini" de öğrenebilmesi. Sakana'nın sayfasındaki ifadeyle: "The hardest puzzles in this benchmark are extremely difficult even for professional puzzle solvers." (Bu test setindeki en zor bulmacalar profesyonel çözücüler için bile son derece zor.)
Şimdiye kadarki sonuçlar
Mayıs 2025 makalesinde en gelişmiş dil modelleri, yardım almadan bulmacaların yüzde 15'inden azını çözebildi; büyük 9x9 tablolarda performans belirgin şekilde düştü. Sakana, yayın tarihinde akıl yürütme modellerinin setteki 9x9 bulmacaların hiçbirini çözemediğini belirtti.
Ekim 2025'te yayımlanan güncellemeye göre OpenAI'ın GPT-5 modeli challenge_100'de yüzde 33 ağırlıklı ortalama çözme oranına ulaştı. Bu, bir önceki liderin yaklaşık iki katı. GPT-5 ayrıca setteki modern 9x9 sudokulardan birini çözen ilk dil modeli oldu. Sakana yine de test setinin büyük kısmının hâlâ çözülemediğinin altını çizdi. Aynı güncellemede, küçük bir açık modelin klasik sudoku ile ince ayarlanmasının varyantlara iyi yansımadığı da aktarıldı; yani yalnızca klasik tabloyla pratik yapmak yetmiyor.
Bulmaca severler için neden önemli?
Sudoku-Bench, deneyimli oyuncuların bildiği bir gerçeği doğruluyor: İyi bir bulmacanın en zor kısmı rakamları doldurmak değil, kilit fikri görmektir. Varyant yazarları bulmacaları tek bir zarif buluş etrafında kurar ve bu tür akıl yürütmeyi otomatikleştirmek hâlâ zor. Ayrıca hayranların eğlence için izlediği çözüm videolarının değerli bir araştırma verisine dönüştüğünü gösteriyor.
Varyantlara hazırlanmak istiyorsanız işe klasik mantıkla başlayın. Sudoku bulmacalarımızda tarama ve aday tekniklerini çalışabilir, SE puanı rehberimizle hangi tekniklerin bir bulmacayı zorlaştırdığını görebilirsiniz. Yapay zekâ sonuçlarının hızla değiştiğini unutmayın; yukarıdaki rakamlar 2025'te açıklanan sonuçlardır.