El sudoku clásico ya es una prueba demasiado fácil para la inteligencia artificial: un programa sencillo resuelve cualquier cuadrícula 9x9 válida en una fracción de segundo, y muchos puzles conocidos ya están en los datos de entrenamiento de los grandes modelos de lenguaje. Por eso la empresa de investigación tokiota Sakana AI recurrió a los sudokus de variantes modernos, donde reglas adicionales como flechas, termómetros, jaulas killer o formas de cuadrícula poco habituales obligan a encontrar una nueva «entrada» lógica en cada puzle.
Qué es Sudoku-Bench
Sakana AI anunció el proyecto el 21 de marzo de 2025 y publicó el informe técnico en arXiv el 22 de mayo de 2025. El artículo «Sudoku-Bench: Evaluating creative reasoning with Sudoku variants» lo firman Jeffrey Seely, Yuki Imajuku, Tianyu Zhao, Edoardo Cetin y Llion Jones. El conjunto principal, llamado challenge_100, tiene 100 puzles: 15 de 4x4, 15 de 6x6 y 70 de 9x9, ordenados de fáciles a extremadamente difíciles. Los modelos reciben los puzles en un formato de texto estandarizado, y las herramientas asociadas funcionan con miles de puzles públicos.
El proyecto se desarrolló junto a Cracking the Cryptic, el canal de YouTube de Simon Anthony y Mark Goodliffe, que han representado al Reino Unido en los campeonatos mundiales de sudoku y de puzles. Sakana publicó además un gran conjunto de datos extraído de los vídeos del canal:
- más de 2.500 vídeos de resolución de puzles;
- más de 2.000 horas de razonamiento hablado transcrito, unos 10 millones de palabras;
- alrededor de 2 millones de acciones de resolución (dígitos, anotaciones, etc.).
La idea es que un modelo aprenda no solo respuestas, sino cómo piensan los expertos para abrir un puzle difícil. Como dice la página de Sakana: «The hardest puzzles in this benchmark are extremely difficult even for professional puzzle solvers» (los puzles más difíciles de esta prueba son extremadamente complicados incluso para solucionadores profesionales).
Resultados hasta ahora
En el artículo de mayo de 2025, los modelos de lenguaje más avanzados resolvieron menos del 15 % de los puzles sin ayuda, y el rendimiento cayó con fuerza en las cuadrículas 9x9. Sakana señaló que, en el lanzamiento, ningún modelo de razonamiento resolvía los puzles 9x9 del conjunto.
En octubre de 2025 llegó una actualización: GPT-5, de OpenAI, alcanzó una tasa media ponderada de resolución del 33 % en challenge_100, aproximadamente el doble que el líder anterior, y se convirtió en el primer modelo de lenguaje en resolver uno de los sudokus 9x9 modernos de la prueba. Sakana subrayó que la mayor parte del banco sigue sin resolverse. La actualización también indicó que ajustar un modelo abierto pequeño con sudokus clásicos apenas se trasladaba a las variantes: practicar solo cuadrículas clásicas no basta.
Por qué importa a los aficionados
Sudoku-Bench confirma algo que los jugadores con experiencia saben bien: lo más difícil de un buen puzle es ver la idea clave, no rellenar números. Los autores de variantes construyen sus puzles en torno a una única intuición elegante, y ese tipo de razonamiento sigue siendo difícil de automatizar. Además, demuestra que los vídeos de resolución que muchos ven por entretenimiento se han convertido en valiosos datos de investigación.
Si quieres prepararte para las variantes, empieza por la lógica clásica. Practica el escaneo y las técnicas de candidatos con nuestros sudokus y consulta la guía de la puntuación SE para ver qué técnicas hacen más difícil un puzle. Los resultados de la IA cambian rápido; las cifras anteriores corresponden a lo publicado en 2025.