O

Ozerlyn-Redaktion

Tokio, Japan11. Oktober 2026 um 02:094 min
Technology

Sudoku-Bench: Sakana AI und Cracking the Cryptic testen KI an Sudoku-Varianten

Das Tokioter Unternehmen Sakana AI hat einen Test mit 100 modernen Sudoku-Varianten entwickelt – selbst die besten Sprachmodelle scheitern an den meisten davon.

Sakana AIs Sudoku-Bench misst kreatives Denken von KI mit handgemachten Sudoku-Varianten, viele davon gemeinsam mit dem YouTube-Kanal Cracking the Cryptic ausgewählt. Im Fachartikel vom Mai 2025 lösten Spitzenmodelle weniger als 15 Prozent der Rätsel; ein Update vom Oktober 2025 meldete 33 Prozent für GPT-5. Varianten bleiben ein Bereich, in dem geübte Menschen klar vorn liegen.

Klassisches Sudoku ist für künstliche Intelligenz kein echter Prüfstein mehr: Ein einfaches Computerprogramm löst jedes gültige 9x9-Gitter in Sekundenbruchteilen, und viele bekannte Rätsel stecken längst in den Trainingsdaten großer Sprachmodelle. Das Tokioter Forschungsunternehmen Sakana AI setzt deshalb auf moderne Sudoku-Varianten. Zusatzregeln wie Pfeile, Thermometer, Killer-Käfige oder ungewöhnliche Gitterformen zwingen dazu, für jedes Rätsel einen neuen logischen Einstieg zu finden.

Was Sudoku-Bench ist

Sakana AI kündigte das Projekt am 21. März 2025 an und veröffentlichte den technischen Bericht am 22. Mai 2025 auf arXiv. Der Artikel „Sudoku-Bench: Evaluating creative reasoning with Sudoku variants“ stammt von Jeffrey Seely, Yuki Imajuku, Tianyu Zhao, Edoardo Cetin und Llion Jones. Der Kerntest challenge_100 umfasst 100 Rätsel: 15 im Format 4x4, 15 im Format 6x6 und 70 im Format 9x9, sortiert von leicht bis extrem schwer. Die Rätsel erhalten die Modelle in einem standardisierten Textformat; die zugehörigen Werkzeuge funktionieren zudem mit Tausenden öffentlich verfügbaren Rätseln.

Partner des Projekts ist Cracking the Cryptic, der YouTube-Kanal von Simon Anthony und Mark Goodliffe, die beide Großbritannien bei Sudoku- und Rätsel-Weltmeisterschaften vertreten haben. Sakana veröffentlichte außerdem einen umfangreichen Datensatz aus den Videos des Kanals:

  • mehr als 2.500 Videos mit Rätsellösungen,
  • über 2.000 Stunden gesprochene Lösungswege als Text, rund 10 Millionen Wörter,
  • etwa 2 Millionen Lösungsaktionen wie Zifferneinträge und Notizen.

Die Idee: Ein Modell soll nicht nur Antworten lernen, sondern auch, wie Fachleute sich in ein schweres Rätsel hineindenken. Auf der Projektseite heißt es: „The hardest puzzles in this benchmark are extremely difficult even for professional puzzle solvers.“ (Die schwersten Rätsel dieses Tests sind selbst für professionelle Rätsellöser extrem schwierig.)

Bisherige Ergebnisse

Im Artikel vom Mai 2025 lösten aktuelle Spitzenmodelle ohne Hilfe weniger als 15 Prozent der Rätsel; bei den größeren 9x9-Gittern brach die Leistung deutlich ein. Laut Sakana konnte zum Start kein Reasoning-Modell eines der 9x9-Rätsel lösen.

Im Oktober 2025 folgte ein Update: OpenAIs GPT-5 erreichte auf challenge_100 eine gewichtete durchschnittliche Lösungsquote von 33 Prozent, etwa doppelt so viel wie der bisherige Spitzenreiter, und löste als erstes Sprachmodell eines der modernen 9x9-Sudokus des Tests. Sakana betonte, dass der Großteil des Benchmarks damit weiterhin ungelöst bleibt. Zudem zeigte sich, dass das Nachtrainieren eines kleinen offenen Modells mit klassischen Sudokus kaum auf Varianten übertragbar war – klassische Übung allein reicht also nicht.

Warum das für Rätselfans wichtig ist

Sudoku-Bench bestätigt, was erfahrene Rätselnde wissen: Das Schwierigste an einem guten Rätsel ist, die Schlüsselidee zu erkennen, nicht das Eintragen der Ziffern. Varianten-Autorinnen und -Autoren bauen ihre Rätsel um eine einzige elegante Einsicht, und genau diese Art des Denkens ist schwer zu automatisieren. Außerdem zeigt das Projekt, dass Lösungsvideos, die viele zur Unterhaltung schauen, zu wertvollen Forschungsdaten geworden sind.

Wer sich an Varianten heranwagen möchte, beginnt am besten mit klassischer Logik. Üben Sie Scannen und Kandidatentechniken mit unseren Sudoku-Rätseln und erfahren Sie im Leitfaden zur SE-Bewertung, welche Techniken ein Rätsel schwerer machen. KI-Ergebnisse ändern sich schnell; die Zahlen oben geben den Stand von 2025 wieder.

Quellen

news.share

X
Sudoku-Bench: Sakana AI und Cracking the Cryptic testen KI an Sudoku-Varianten | Sudoku News