O

Ozerlyn-Redaktion

Boulder, Colorado, USA11. Oktober 2026 um 02:094 min
Research

KI löst manche Sudokus, kann aber nicht erklären, wie – Studie aus Boulder

Ein Beitrag in den Findings of ACL 2025 testete fünf große Sprachmodelle an rund 2.300 Sudokus im Format 6x6 – die Erklärungen erwiesen sich als größte Schwäche.

Forschende der University of Colorado Boulder ließen fünf große Sprachmodelle 6x6-Sudokus lösen und die Lösung erklären. Das beste Modell löste etwa 65 Prozent der Rätsel, doch keines lieferte Erklärungen, die echtes strategisches Denken zeigten. Für Rätselfans eine wichtige Erinnerung: Ein korrekt ausgefülltes Gitter und ein nachvollziehbarer Lösungsweg sind zwei verschiedene Dinge.

Am 28. Juli 2025 stellte die University of Colorado Boulder eine Studie vor, die Sudoku als Prüfstein für eine wichtige Frage nutzt: Kann künstliche Intelligenz ihre eigenen Entscheidungen nachvollziehbar erklären? Der Fachartikel „Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku“ stammt von Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi und Fabio Somenzi. Er wurde in die Findings of the Association for Computational Linguistics (ACL 2025) aufgenommen, eine der zentralen Publikationsreihen der Computerlinguistik.

Was die Forschenden gemacht haben

Das Team erstellte knapp 2.300 neue Sudokus auf einem 6x6-Gitter, einer kleineren Variante des klassischen 9x9-Rätsels. Neue Rätsel sind wichtig: Bekannte Sudokus samt Lösungen könnten bereits in den Trainingsdaten der Modelle stecken, ein frischer Satz erschwert also das bloße Abrufen auswendig gelernter Antworten. Anschließend sollten fünf große Sprachmodelle (LLMs) zwei Aufgaben erfüllen: das Gitter ausfüllen und in normaler Sprache erklären, wie sie zur Lösung kamen.

Die wichtigsten Ergebnisse

  • Beim Lösen gab es große Unterschiede. Laut CU Boulder lag OpenAIs Modell o1 (Vorschauversion) vorn und löste rund 65 Prozent der Rätsel korrekt. Die Zusammenfassung des Artikels bescheinigt nur einem Modell überhaupt begrenzten Erfolg.
  • Beim Erklären schnitten alle deutlich schlechter ab. Keines der Modelle konnte den Lösungsweg so darstellen, dass strategisches Denken oder intuitives Problemlösen erkennbar wurde.
  • Manche Erklärungen waren falsch oder schlicht bizarr. Trivedi berichtete, die KI habe mitunter Fakten erfunden; ein Modell antwortete auf eine Sudoku-Frage sogar mit einer Wettervorhersage.

Somenzi begründete die Wahl des Spiels so: „Puzzles are fun, but they're also a microcosm for studying the decision-making process in machine learning.“ (Rätsel machen Spaß, sind aber auch ein Mikrokosmos, um Entscheidungsprozesse im maschinellen Lernen zu untersuchen.)

Warum Sudoku ein guter Test ist

Ein Sudoku hat genau eine richtige Lösung, die sich sofort überprüfen lässt. Erfahrene Rätselnde können jede Ziffer mit einer benannten Technik begründen: Naked Single, verstecktes Paar, X-Wing und so weiter. Dadurch lässt sich leicht prüfen, ob eine Erklärung tatsächlich stimmt. Ein Sprachmodell dagegen erzeugt Text, der Wort für Wort plausibel klingt. Es kann ein gültiges Gitter liefern und dabei Schritte beschreiben, die nie stattgefunden haben, oder eine Technik nennen, die auf die betreffenden Zellen gar nicht passt.

Die Forschenden sehen darin ein allgemeines Vertrauensproblem. Wenn KI bei Planung, Logistik oder anderen Entscheidungen hilft, müssen Menschen verstehen können, warum eine Antwort gewählt wurde. Sudoku bietet eine kleine, kontrollierte Umgebung, in der sich Erklärungen Zeile für Zeile überprüfen lassen. Als Nächstes will das Team ein System entwickeln, das komplexere Rätsel löst und erklärt – beginnend mit dem japanischen Logikrätsel Hitori.

Was das für Rätselfans bedeutet

Die Studie zeigt, welche Fähigkeit Maschinen noch fehlt: sagen zu können, warum eine Ziffer in eine Zelle gehört. Genau so wird auch die Schwierigkeit von Sudokus gemessen. Die Sudoku-Explainer-Bewertung (SE) richtet sich nach der schwierigsten Technik, die für eine rein logische Lösung nötig ist – eine klare Argumentationskette ist also der Kern des Hobbys. Wie die Skala funktioniert, erklärt unsere Seite zur SE-Bewertung; üben können Sie mit den Rätseln in unserem Sudoku-Bereich, indem Sie sich jeden Zug selbst begründen.

Eine Einschränkung: Getestet wurden Modelle aus den Jahren 2024 und 2025 auf 6x6-Gittern. KI entwickelt sich schnell, spätere Ergebnisse können anders ausfallen. Die Kernaussage bleibt dennoch: Die richtige Antwort zu finden ist nicht dasselbe, wie den Lösungsweg zu zeigen.

Quellen

news.share

X
KI löst manche Sudokus, kann aber nicht erklären, wie – Studie aus Boulder | Sudoku News