अक्टूबर 2025 में Deloitte ने ऑस्ट्रेलियाई सरकार को पैसे वापस किए। फर्म ने रोजगार और कार्यस्थल संबंध विभाग को AU$4,40,000 की एक समीक्षा सौंपी थी; प्रकाशित रिपोर्ट में एक संघीय न्यायालय के फैसले से गढ़ा हुआ उद्धरण और ऐसे शैक्षणिक पेपरों के संदर्भ थे जो अस्तित्व में ही नहीं हैं (The Guardian, 2025)। संशोधित संस्करण में खुलासा हुआ कि मसौदे में GPT-4o का उपयोग किया गया था। बाद की रिपोर्टिंग के अनुसार धनवापसी लगभग AU$97,000 थी — अनुबंध की अंतिम किस्त।
एक विवरण पैसे से अधिक महत्वपूर्ण है। ये गढ़ी हुई बातें फर्म की समीक्षा में नहीं पकड़ी गईं, न ही क्लाइंट की समीक्षा में। उन्हें एक बाहरी शिक्षाविद् ने पकड़ा जिसने संदर्भ जाँचे। डिलीवरेबल जाँच की हर परत से गुजर चुका था जिसके लिए उसे बनाया गया था, क्योंकि उसमें कुछ भी गलत नहीं दिखता था।
यही वह श्रेणी है: वह मॉडल नहीं जो विफल होता है, बल्कि वह जो उत्तर लौटाता है। किसी भाषा मॉडल से दो सौ पंक्तियों का राजस्व जोड़ने को कहें और आपको सही परिमाण, सही मुद्रा चिह्न और उसके इर्द-गिर्द एक आत्मविश्वासी वाक्य के साथ उत्तर मिलता है। जो आपको विश्वसनीय रूप से नहीं मिलता वह है योग। एक अनुपस्थित उत्तर पकड़ा जाता है। अच्छे आत्मविश्वास वाला गलत उत्तर बोर्ड को भेज दिया जाता है।
और यह आत्मविश्वास कभी नहीं टूटता, क्योंकि वह भी उत्पन्न पाठ है। मॉडल को पता नहीं कि वह गलत है; दबाने के लिए कोई आंतरिक अलार्म नहीं है। संख्या को प्रतिपादित करने वाला वाक्य और संख्या स्वयं एक ही स्थान से आती है — अगला संभावित टोकन।
प्रशंसनीय, गणित की हुई नहीं
गलत संख्याओं को मॉडल की परिपक्वता के खाते में डालने की प्रवृत्ति होती है: निश्चित रूप से अगला संस्करण सही जोड़ेगा। शोध कहता है यह विफलता संरचनागत है, और इसके कारण के बारे में असामान्य रूप से एकमत है।
GPT-4 से दो तीन-अंकीय संख्याओं को गुणा करने पर zero-shot में 59% सही मिले; ChatGPT से 55% (arXiv, 2023)। चार अंकों पर GPT-4 3% तक गिर गया। पाँच पर, 0%। Faith and Fate के लेखकों ने तंत्र का पता लगाया: ट्रांसफॉर्मर संयोजनात्मक समस्याओं को उन्होंने जो देखा है उसके रैखिक खंडों का मिलान करके हल करते हैं — पैटर्न खोज, प्रक्रिया नहीं। चट्टान ठीक वहाँ है जहाँ पैटर्न समाप्त होते हैं।
जोड़ भी सुरक्षित नहीं है। 2025 के एक विश्लेषण में पाया गया कि LLMs एक एल्गोरिदम के बजाय एक-अंक के lookahead अनुमान से जोड़ते हैं: सटीकता ठीक वहाँ ध्वस्त होती है जहाँ carry एक अंक से आगे बढ़ती है, prompting या tokenization की परवाह किए बिना, और विफलताएँ अकेले carry संरचना से अनुमानित हैं (arXiv, 2025)। व्यवस्थित, शोरगुल वाली नहीं। मॉडल लगभग-गणना नहीं कर रहा। वह कुछ और कर रहा है जो अक्सर गणना से सहमत होता है।
Apple के GSM-Symbolic ने शेष खामी बंद की — कि शायद यह केवल कठिन अंकगणित को प्रभावित करता है (Apple, 2024)। प्राथमिक स्तर की शब्द समस्याएँ लें और केवल संख्याएँ बदलें: परीक्षण किए गए हर अत्याधुनिक मॉडल का प्रदर्शन खराब हुआ। एक प्रशंसनीय लेकिन अप्रासंगिक खंड जोड़ें: सटीकता 65% तक गिर गई। और सटीकता एक ही प्रश्न टेम्पलेट के नए उदाहरणों में उल्लेखनीय रूप से भिन्न थी — वही समस्या, दूसरे शब्दों में, उत्तरों का एक अलग वितरण देती है। यह अंतिम निष्कर्ष डेमो की समस्या समझाता है। डेमो वितरण से एक ड्रॉ है। ऑडिट वितरण है।
लेखकों का निर्णय — "वर्तमान LLMs वास्तविक तार्किक तर्क में सक्षम नहीं हैं" — एक शोध पत्र के लिए असामान्य रूप से स्पष्ट है। किसी ने इसे अभी तक वापस नहीं लिया।
स्पष्ट समाधान, मापे गए
इस विफलता से सामना होने पर हर टीम एक ही चार समाधानों की ओर बढ़ती है। प्रत्येक को मापा जा चुका है।
रिट्रीवल। FinanceBench ने GPT-4-Turbo से सार्वजनिक वित्तीय दाखिलों के बारे में 150 प्रश्न पूछे, एक रिट्रीवल सिस्टम दस्तावेज़ आपूर्ति करते हुए। इसने 81% का गलत उत्तर दिया या मना कर दिया (Patronus AI, 2023)। सोलह कॉन्फ़िगरेशन — GPT-4-Turbo, Llama 2, Claude 2, वेक्टर स्टोर, लंबा संदर्भ — ने 2,400 मैन्युअल रूप से समीक्षित उत्तरों में कमज़ोरियाँ दिखाईं, और जब साक्ष्य पृष्ठ पूरी तरह आपूर्ति नहीं किए गए तो मॉडलों ने आँकड़े गढ़े। रिट्रीवल दस्तावेज़ लाता है। मॉडल फिर भी संख्या बिगाड़ता है।
ग्राउंडिंग। BBC ने ChatGPT, Copilot, Gemini और Perplexity को अपने लेखों तक सीधी पहुँच दी और उनसे समाचारों के बारे में पूछा। 51% उत्तरों में महत्वपूर्ण समस्याएँ थीं; 91% में कम से कम कुछ। BBC सामग्री उद्धृत करने वाले 19% उत्तरों में तथ्यात्मक त्रुटियाँ थीं — गलत कथन, गलत संख्याएँ, गलत तारीखें — और BBC लेखों से जिम्मेदार 13% उद्धरण बदले हुए थे या कभी अस्तित्व में नहीं थे (BBC, 2025)। स्रोत हाथ में था। संख्याएँ फिर भी मुड़ गईं।
एक बेहतर मॉडल। OpenAI का अपना सिस्टम कार्ड रिपोर्ट करता है कि o3 PersonQA प्रॉम्प्ट के 33% पर और o4-mini 48% पर मतिभ्रम करता है — पुराने o1 के 16% के मुकाबले (OpenAI, 2025)। विक्रेता के अपने माप से, नए रीज़निंग मॉडल अपने पूर्ववर्ती से दो से तीन गुना अधिक मतिभ्रम करते हैं। o3 बस अधिक दावे करता है — अधिक सही और अधिक गढ़े हुए, एक ही निश्चितता के तापमान पर।
बेहतर prompting। चरण-दर-चरण scratchpad prompting GPT-4 की तीन-अंकीय गुणन को 59% से 92% तक उठाती है (arXiv, 2023)। बेहतर — और फिर भी बारह में एक गलत गुणनफल। यहाँ तक कि चार-अंकीय गुणन पर GPT-3 को exhaustively fine-tune करने पर अनदेखी चार-अंकीय समस्याओं पर लगभग 40% और पाँच अंकों पर 0% मिला। सीमा तंत्र है, prompt नहीं।
हर समाधान संभावना बदलता है। कोई भी यह नहीं बदलता कि अंकगणित कौन करता है। उत्तर अभी भी प्रशंसनीय संख्याओं के वितरण से नमूना लिया जाता है, और उस वितरण का ठीक एक सदस्य योग है।
अंकगणित कौन करे
संरचनागत उत्तर योग्यता की रेखा पर खींचा गया श्रम विभाजन है। भाषा मॉडल भाषा में श्रेष्ठ हैं और बहीखाते में अविश्वसनीय, इसलिए मॉडल को कभी भी वह चीज़ नहीं होनी चाहिए जो गणना करे।
SQAI उसी विभाजन पर बना है। मॉडल एक typed intent लिखता है — sum amount where region = "east" — और एक SQAI runtime इसे compiled code के रूप में निष्पादित करता है: hash-pinned contract के विरुद्ध सत्यापित, नीति के विरुद्ध जाँचा, एकल थ्रेड पर float64 में गणना, provenance के साथ लौटाया।
{
"status": "ok",
"value": 2130.5,
"rows_matched": 5
}
वह 2130.5 एक संभावित टोकन नहीं है। यह योग है, 445 मॉड्यूल में 4,574 read-only क्षमताओं की सतह से एक नियतात्मक kernel द्वारा उत्पन्न — उनमें से 4,564 पूरी तरह नियतात्मक — 0.83–0.93 ms warm में उत्तर देते हुए।
नियतात्मक का अर्थ है जाँचने योग्य। finance.npv(0.1, [-1000, 300, 420, 560, 680]) computation hash b74f67d0… के अंतर्गत 505.020148896933 लौटाता है — चाहे कॉल TypeScript से की जाए या Python से, वही मान और वही hash, क्योंकि परिणाम एक canonical JSON रूप पर hashed हैं। दावा ईमानदारी से सीमित है: घोषित निष्पादन दायरे के भीतर नियतात्मक, एक envelope के साथ जो runtime संस्करण, platform, precision mode और thread count दर्ज करता है — अतिदावे के बिना। एक मॉडल का उसी prompt पर उत्तर अगले रन पर खुद से मेल खाने का वादा नहीं कर सकता। यह महीनों बाद, किसी भी भाषा में, byte-identically replay होता है।
एक दूसरा रिसाव है, और अधिकांश स्टैक इसे खुला छोड़ देते हैं। एक compute engine जोड़ें, फिर raw query rows को "summarization के लिए" context में डालें — और मॉडल चुपचाप rows से संख्याएँ पुनः-व्युत्पन्न और पुनः-आविष्कार करता है। SQAI context को एक governed boundary मानता है: मॉडल तक अधिकतम 25 rows, 250 cells और 32,000 bytes पहुँचती हैं, 100 rows की default सीमा और 1,000 की hard execution ceiling के पीछे। Truncation हमेशा घोषित होता है, इसलिए मॉडल ईमानदारी से दावा नहीं कर सकता कि उसने जो देखा उसका योग किया। आंशिक rows कभी नहीं दिखाई जातीं, इसलिए कोई अधूरा रिकॉर्ड उसे कल्पना से पूरा करने के लिए प्रेरित नहीं करता। Aggregates boundary से पहले गणना किए जाते हैं। मॉडल को उत्तर मिलता है, होमवर्क नहीं।
और नीति एक prompt नहीं है। अनुमत sources, fields और functions createSQAI() के समय code में तय होते हैं और निष्पादन से पहले in-process जाँचे जाते हैं; मॉडल के tool input में कोई policy fields नहीं होते, इसलिए उसके पास विस्तार करने के लिए कुछ नहीं है। नीति के बाहर किसी क्षमता की माँग रचनात्मक समाधान नहीं देती — यह policy_denied_function देती है। तर्क वही है जो agents को SQL लिखने न देने के पीछे है: उत्पन्न पाठ को best-effort निर्देशों से नियंत्रित न करें; निष्पादन को allow-lists से नियंत्रित करें जिन्हें पाठ छू नहीं सकता।
अंकगणित किसने किया?
अगली बार जब कोई AI सिस्टम आपको एक राजस्व आँकड़ा सौंपे, एक प्रश्न बाज़ार की हर architecture को छाँट देता है: अंकगणित किसने किया?
यदि उत्तर है "मॉडल ने," तो आपके पास उत्कृष्ट आत्मविश्वास और अज्ञात provenance वाली एक संख्या है, और एकमात्र सत्यापन पथ एक मानव द्वारा काम दोहराना है — वही चीज़ जिसे आप स्वचालित करने की कोशिश कर रहे थे। Deloitte की गढ़ी हुई बातें इसलिए पकड़ी गईं क्योंकि प्रक्रिया के बाहर एक शिक्षाविद् ने जाँचने का निर्णय लिया। यह नियंत्रण नहीं है। यह भाग्य है।
यदि उत्तर है "एक SQAI runtime ने, और यह रहा hash," तो सत्यापन एक replay है: वही intent, वही runtime, वही bytes। विफलता तब और सूक्ष्म — और शांत — हो जाती है जब गलत संख्या गलत जोड़ के बजाय fanned-out join से आती है, जो अपनी अलग कहानी है। लेकिन अनुशासन एक वाक्य में समाता है: मॉडल प्रश्न लिखता है, उत्तर कभी नहीं।
गलत राजस्व संख्या खुद को घोषित नहीं करती। वह formatted, cited और आत्मविश्वासी होकर आती है — और पाँच अंकों के गुणन पर, कभी सही नहीं। pipeline ऐसा बनाएँ कि वह प्रवेश न कर सके।