E

Equipo editorial de Ozerlyn

Boulder, Colorado, EE. UU.11 de octubre de 2026 a las 02:094 min
Research

La IA resuelve algunos sudokus, pero no sabe explicar cómo, según CU Boulder

Un artículo publicado en Findings of ACL 2025 puso a prueba a cinco modelos de lenguaje con unos 2.300 sudokus de 6x6 y concluyó que las explicaciones eran el punto más débil.

Investigadores de la Universidad de Colorado Boulder pidieron a cinco grandes modelos de lenguaje que resolvieran y explicaran sudokus de 6x6. El mejor modelo resolvió alrededor del 65 % de los puzles, pero ninguno ofreció explicaciones que reflejaran un razonamiento estratégico real. Para los aficionados, es un recordatorio de que una cuadrícula correcta y un camino de resolución claro son cosas muy distintas.

El 28 de julio de 2025, la Universidad de Colorado Boulder (CU Boulder) dio a conocer un estudio que utiliza el sudoku para responder a una pregunta importante: ¿puede la inteligencia artificial explicar de forma fiable sus propias decisiones? El artículo «Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku» lo firman Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi y Fabio Somenzi, y fue aceptado en Findings of the Association for Computational Linguistics (ACL 2025), una de las principales publicaciones del procesamiento del lenguaje natural.

Qué hicieron los investigadores

El equipo creó cerca de 2.300 sudokus originales en una cuadrícula de seis por seis, una versión reducida del clásico 9x9. Usar puzles nuevos es clave: los sudokus conocidos y sus soluciones pueden estar ya en los datos de entrenamiento de los modelos, así que un conjunto inédito dificulta que el modelo simplemente recuerde la respuesta. Después se pidió a cinco grandes modelos de lenguaje (LLM) dos cosas: completar la cuadrícula y explicar con palabras sencillas cómo llegaron a la solución.

Principales resultados

  • La resolución fue desigual. Según CU Boulder, el modelo o1 de OpenAI (versión preliminar) encabezó la prueba y resolvió correctamente alrededor del 65 % de los puzles. El resumen del artículo habla de un único modelo con un éxito limitado.
  • Las explicaciones fueron mucho peores. Ninguno de los modelos logró explicar el proceso de una manera que reflejara razonamiento estratégico o resolución intuitiva de problemas.
  • Algunas explicaciones eran inexactas o directamente extrañas. Trivedi contó que la IA a veces se inventaba datos, y en un caso un modelo respondió a una pregunta sobre sudoku con una previsión del tiempo.

Somenzi explicó por qué eligieron este juego: «Puzzles are fun, but they're also a microcosm for studying the decision-making process in machine learning» (los puzles son divertidos, pero también un microcosmos para estudiar la toma de decisiones en el aprendizaje automático).

Por qué el sudoku es una buena prueba

Un sudoku tiene una única solución correcta que se puede comprobar al instante, y un jugador experimentado puede justificar cada número con una técnica concreta: candidato único, pareja oculta, X-Wing, etc. Eso permite ver con facilidad si una explicación es verdadera. Un modelo de lenguaje, en cambio, genera texto que suena plausible palabra a palabra. Puede llegar a una cuadrícula válida mientras describe pasos que nunca ocurrieron o cita una técnica que no se aplica a esas celdas.

Los autores lo plantean como un problema de confianza más amplio. Si la IA ayuda en planificación, logística u otras decisiones, las personas necesitan entender por qué eligió una respuesta, no solo aceptarla. El sudoku ofrece un entorno pequeño y controlado donde las explicaciones pueden revisarse línea por línea. El siguiente paso del equipo será un sistema que resuelva y explique puzles más complejos, empezando por el puzle lógico japonés hitori.

Qué significa para los jugadores

El estudio señala la habilidad que a las máquinas todavía les falta: poder decir por qué un dígito debe ir en una celda. Así es también como suele medirse la dificultad. La puntuación Sudoku Explainer (SE) clasifica un puzle según la técnica más difícil necesaria para resolverlo con lógica, de modo que una cadena de razonamiento clara es el corazón de esta afición. Puedes leer cómo funciona la escala en nuestra página sobre la puntuación SE o practicar explicándote cada jugada en los puzles de nuestra sección de sudoku.

Una advertencia: el estudio evaluó modelos disponibles en 2024 y 2025 con cuadrículas de 6x6. La IA avanza deprisa y los resultados futuros pueden cambiar. Aun así, el mensaje central se mantiene: acertar la respuesta no es lo mismo que demostrar cómo se llegó a ella.

Fuentes

news.share

X