O

Ozerlyn संपादकीय टीम

टोक्यो, जापान11 अक्टूबर 2026 को 02:09 am बजे4 मिनट
Technology

Sudoku-Bench: Sakana AI और Cracking the Cryptic ने वेरिएंट सुडोकू पर AI को परखा

टोक्यो की कंपनी Sakana AI ने आधुनिक सुडोकू वेरिएंट की 100 पहेलियों वाला बेंचमार्क बनाया, और सबसे अच्छे भाषा मॉडल भी इनमें से ज़्यादातर में विफल रहते हैं।

Sakana AI का Sudoku-Bench हाथ से बनाई गई वेरिएंट सुडोकू पहेलियों के ज़रिए AI की रचनात्मक तर्कशक्ति मापता है; इनमें से कई YouTube चैनल Cracking the Cryptic के साथ चुनी गईं। मई 2025 के शोधपत्र में शीर्ष मॉडल 15% से कम पहेलियाँ हल कर पाए; अक्टूबर 2025 के अपडेट में GPT-5 33% तक पहुँचा। वेरिएंट पहेलियाँ अब भी ऐसा क्षेत्र हैं जहाँ कुशल इंसान आगे हैं।

क्लासिक सुडोकू अब आर्टिफ़िशियल इंटेलिजेंस के लिए बहुत आसान परीक्षा बन चुका है। एक साधारण कंप्यूटर प्रोग्राम किसी भी वैध 9x9 ग्रिड को पल भर में हल कर देता है, और कई प्रसिद्ध पहेलियाँ पहले से बड़े भाषा मॉडलों के प्रशिक्षण डेटा में मौजूद हैं। इसलिए टोक्यो की शोध कंपनी Sakana AI ने आधुनिक वेरिएंट सुडोकू का रुख़ किया, जिनमें तीर, थर्मामीटर, किलर केज या असामान्य ग्रिड आकार जैसे अतिरिक्त नियम हर पहेली में एक नया तार्किक "प्रवेश बिंदु" खोजने को मजबूर करते हैं।

Sudoku-Bench क्या है

Sakana AI ने इस परियोजना की घोषणा 21 मार्च 2025 को की और तकनीकी रिपोर्ट 22 मई 2025 को arXiv पर प्रकाशित की। शोधपत्र "Sudoku-Bench: Evaluating creative reasoning with Sudoku variants" के लेखक जेफ़री सीली, युकी इमाजुकु, तियान्यू झाओ, एडोआर्दो चेतिन और लियोन जोन्स हैं। challenge_100 नाम के मुख्य सेट में 100 पहेलियाँ हैं: 15 पहेलियाँ 4x4, 15 पहेलियाँ 6x6 और 70 पहेलियाँ 9x9 ग्रिड पर, जो आसान से बेहद कठिन क्रम में रखी गई हैं। मॉडलों को पहेलियाँ एक मानकीकृत टेक्स्ट फ़ॉर्मैट में दी जाती हैं, और साथ के टूल हज़ारों सार्वजनिक पहेलियों के साथ भी काम करते हैं।

यह परियोजना YouTube चैनल Cracking the Cryptic के साथ साझेदारी में बनी, जिसे साइमन एंथनी और मार्क गुडलिफ़ चलाते हैं। दोनों विश्व सुडोकू और विश्व पज़ल चैंपियनशिप में ब्रिटेन का प्रतिनिधित्व कर चुके हैं। Sakana ने चैनल के वीडियो से निकाला गया बड़ा डेटासेट भी जारी किया:

  • 2,500 से अधिक पहेली-हल वीडियो;
  • टेक्स्ट में बदले गए 2,000 घंटे से अधिक बोले गए तर्क, लगभग 1 करोड़ शब्द;
  • लगभग 20 लाख हल करने की क्रियाएँ (अंक भरना, नोट्स लगाना आदि)।

मकसद यह है कि मॉडल केवल जवाब ही नहीं, बल्कि यह भी सीखे कि विशेषज्ञ किसी कठिन पहेली में प्रवेश कैसे सोचते हैं। Sakana के पेज के शब्दों में: "The hardest puzzles in this benchmark are extremely difficult even for professional puzzle solvers." (इस बेंचमार्क की सबसे कठिन पहेलियाँ पेशेवर सॉल्वरों के लिए भी बेहद मुश्किल हैं।)

अब तक के नतीजे

मई 2025 के शोधपत्र में सबसे उन्नत भाषा मॉडल बिना मदद के 15% से कम पहेलियाँ हल कर पाए, और बड़े 9x9 ग्रिड पर प्रदर्शन तेज़ी से गिरा। Sakana के अनुसार लॉन्च के समय कोई भी रीज़निंग मॉडल सेट की 9x9 पहेलियों में से एक भी हल नहीं कर सका था।

अक्टूबर 2025 में आए अपडेट के अनुसार OpenAI के GPT-5 ने challenge_100 पर 33% की भारित औसत हल दर हासिल की, जो पिछले अग्रणी मॉडल से लगभग दोगुनी है। GPT-5 बेंचमार्क की आधुनिक 9x9 सुडोकू में से एक को हल करने वाला पहला भाषा मॉडल भी बना। Sakana ने ज़ोर दिया कि बेंचमार्क का ज़्यादातर हिस्सा अब भी अनसुलझा है। अपडेट में यह भी बताया गया कि एक छोटे ओपन मॉडल को साधारण सुडोकू पर प्रशिक्षित करने से वेरिएंट में ख़ास फ़ायदा नहीं हुआ, यानी सिर्फ़ क्लासिक ग्रिड का अभ्यास काफ़ी नहीं है।

पहेली प्रेमियों के लिए यह क्यों अहम है

Sudoku-Bench वही बात पक्की करता है जो अनुभवी खिलाड़ी जानते हैं: अच्छी पहेली का सबसे कठिन हिस्सा अंक भरना नहीं, बल्कि मुख्य विचार को पहचानना है। वेरिएंट बनाने वाले अपनी पहेलियाँ एक सुंदर अंतर्दृष्टि के इर्द-गिर्द गढ़ते हैं, और ऐसी सोच को स्वचालित करना अब भी कठिन है। यह परियोजना यह भी दिखाती है कि जिन सॉल्विंग वीडियो को लोग मनोरंजन के लिए देखते हैं, वे अब मूल्यवान शोध डेटा बन गए हैं।

अगर आप वेरिएंट की तैयारी करना चाहते हैं, तो क्लासिक तर्क से शुरुआत करें। हमारी सुडोकू पहेलियों पर स्कैनिंग और कैंडिडेट तकनीकों का अभ्यास करें, और SE रेटिंग गाइड से जानें कि कौन-सी तकनीकें पहेली को कठिन बनाती हैं। AI के नतीजे जल्दी बदलते हैं; ऊपर दिए आँकड़े 2025 में प्रकाशित स्थिति बताते हैं।

स्रोत

news.share

X
Sudoku-Bench: Sakana AI और Cracking the Cryptic ने वेरिएंट सुडोकू पर AI को परखा | Sudoku News