अक्टूबर 2025 में Deloitte ने ऑस्ट्रेलियाई सरकार को पैसे वापस किए। फर्म ने Department of Employment and Workplace Relations को AU$440,000 की एक समीक्षा सौंपी थी; प्रकाशित रिपोर्ट में एक संघीय अदालत के फैसले से गढ़ा हुआ उद्धरण और ऐसे शैक्षणिक पेपरों के हवाले थे जो अस्तित्व में ही नहीं हैं (The Guardian, 2025)। संशोधित संस्करण में खुलासा हुआ कि मसौदे में GPT-4o का उपयोग किया गया था। बाद की रिपोर्टिंग के अनुसार धनवापसी लगभग AU$97,000 थी — अनुबंध की अंतिम किस्त।
एक विवरण पैसे से अधिक महत्वपूर्ण है। ये गढ़ी हुई बातें फर्म की समीक्षा में नहीं पकड़ी गईं, न ही क्लाइंट की समीक्षा में। उन्हें एक बाहरी शिक्षाविद् ने पकड़ा जिसने संदर्भों की जाँच की। डिलीवरेबल उन सभी जाँच परतों से पार हो गया था जिनसे उसे पार होना था, क्योंकि उसमें कुछ भी गलत नहीं दिखता था।
यही वह श्रेणी है: वह मॉडल नहीं जो विफल होता है, बल्कि वह जो उत्तर लौटाता है। किसी भाषा मॉडल से दो सौ पंक्तियों का राजस्व जोड़ने को कहें और आपको सही परिमाण, सही मुद्रा चिह्न और उसके इर्द-गिर्द एक आत्मविश्वासी वाक्य के साथ उत्तर मिलता है। जो आपको विश्वसनीय रूप से नहीं मिलता वह है योग। एक अनुपस्थित उत्तर पकड़ा जाता है। अच्छे आसन वाला गलत उत्तर बोर्ड को भेज दिया जाता है।
और आसन कभी नहीं टूटता, क्योंकि आत्मविश्वास भी उत्पन्न पाठ है। मॉडल को पता नहीं कि वह गलत है; दबाने के लिए कोई आंतरिक अलार्म नहीं है। संख्या का दावा करने वाला वाक्य और संख्या स्वयं एक ही स्थान से आती है — अगला संभावित टोकन।
प्रशंसनीय, गणना नहीं
गलत संख्याओं को मॉडल की परिपक्वता के तहत दर्ज करने की प्रवृत्ति होती है: निश्चित रूप से अगला संस्करण सही जोड़ता होगा। शोध कहता है यह विफलता संरचनात्मक है, और इसके कारण के बारे में असामान्य रूप से एकमत है।
GPT-4 से दो तीन-अंकीय संख्याओं को गुणा करने पर zero-shot में 59% सही मिले; ChatGPT में 55% (arXiv, 2023)। चार अंकों पर GPT-4 3% तक गिर गया। पाँच पर, 0%। Faith and Fate के लेखकों ने तंत्र का पता लगाया: transformers रैखिक रूप से देखे गए अंशों का मिलान करके संयोजन समस्याओं को हल करते हैं — पैटर्न खोज, प्रक्रिया नहीं। चट्टान ठीक वहाँ है जहाँ पैटर्न समाप्त होते हैं।
जोड़ भी सुरक्षित नहीं है। 2025 के एक विश्लेषण में पाया गया कि LLMs एक एल्गोरिदम के बजाय एक-अंकीय lookahead heuristic से जोड़ते हैं: prompting या tokenization की परवाह किए बिना, सटीकता ठीक वहाँ ढह जाती है जहाँ carry एक अंक से आगे बढ़ती है, और विफलताएँ केवल carry संरचना से अनुमानित हैं (arXiv, 2025)। व्यवस्थित, शोरगुल नहीं। मॉडल लगभग-गणना नहीं कर रहा। वह कुछ और कर रहा है जो अक्सर गणना से सहमत होता है।
Apple के GSM-Symbolic ने शेष खामी बंद की — कि शायद यह केवल कठिन अंकगणित को प्रभावित करता है (Apple, 2024)। प्राथमिक स्तर की शब्द समस्याएँ लें और केवल संख्याएँ बदलें: परीक्षण किए गए हर अत्याधुनिक मॉडल का प्रदर्शन खराब हुआ। एक प्रशंसनीय लेकिन अप्रासंगिक खंड जोड़ें: सटीकता 65% तक गिर गई। और एक ही प्रश्न टेम्पलेट के नए उदाहरणों में सटीकता उल्लेखनीय रूप से भिन्न थी — वही समस्या, दूसरे शब्दों में, उत्तरों का एक अलग वितरण देती है। यह अंतिम निष्कर्ष demo की समस्या समझाता है। Demo वितरण से एक draw है। ऑडिट वितरण है।
लेखकों का निर्णय — "current LLMs are not capable of genuine logical reasoning" — एक शोध पत्र के लिए असामान्य रूप से स्पष्ट है। किसी ने इसे वापस नहीं लिया।
स्पष्ट समाधान, मापे गए
इस विफलता से सामना होने पर हर टीम एक ही चार समाधानों की ओर बढ़ती है। प्रत्येक को मापा जा चुका है।
Retrieval। FinanceBench ने GPT-4-Turbo से सार्वजनिक वित्तीय दाखिलों के बारे में 150 प्रश्न पूछे, जिसमें एक retrieval प्रणाली दस्तावेज़ उपलब्ध करा रही थी। उसने 81% का गलत उत्तर दिया या मना कर दिया (Patronus AI, 2023)। सोलह कॉन्फ़िगरेशन — GPT-4-Turbo, Llama 2, Claude 2, vector stores, long context — ने 2,400 मैन्युअल रूप से समीक्षित उत्तरों में कमज़ोरियाँ दिखाईं, और जब साक्ष्य पृष्ठ पूरी तरह उपलब्ध नहीं थे तो मॉडलों ने आँकड़े गढ़े। Retrieval दस्तावेज़ लाता है। मॉडल फिर भी संख्या बिगाड़ता है।
Grounding। BBC ने ChatGPT, Copilot, Gemini और Perplexity को अपने लेखों तक सीधी पहुँच दी और उनसे समाचारों के बारे में पूछा। 51% उत्तरों में महत्वपूर्ण समस्याएँ थीं; 91% में कम से कम कुछ। BBC सामग्री का हवाला देने वाले 19% उत्तरों में तथ्यात्मक त्रुटियाँ थीं — गलत कथन, गलत संख्याएँ, गलत तारीखें — और BBC लेखों से जिम्मेदार 13% उद्धरण बदले हुए थे या कभी अस्तित्व में नहीं थे (BBC, 2025)। स्रोत हाथ में था। संख्याएँ फिर भी मुड़ गईं।
बेहतर मॉडल। OpenAI का अपना system card रिपोर्ट करता है कि o3 PersonQA prompts पर 33% और o4-mini 48% hallucinate करता है — पुराने o1 के 16% के मुकाबले (OpenAI, 2025)। विक्रेता के अपने माप से, नए reasoning मॉडल अपने पूर्ववर्ती से दो से तीन गुना अधिक hallucinate करते हैं। o3 बस अधिक दावे करता है — अधिक सही और अधिक गढ़े हुए, एक ही निश्चितता के तापमान पर।
बेहतर prompting। Step-by-step scratchpad prompting GPT-4 की तीन-अंकीय गुणन को 59% से 92% तक उठाती है (arXiv, 2023)। बेहतर — और फिर भी बारह में से एक गलत गुणनफल। यहाँ तक कि GPT-3 को चार-अंकीय गुणन पर exhaustively fine-tune करने पर अनदेखी चार-अंकीय समस्याओं पर लगभग 40% और पाँच अंकों पर 0% मिला। सीमा तंत्र है, prompt नहीं।
हर समाधान संभावना बदलता है। कोई भी यह नहीं बदलता कि अंकगणित कौन करता है। उत्तर अभी भी प्रशंसनीय संख्याओं के वितरण से sample किया जाता है, और उस वितरण का ठीक एक सदस्य योग है।
अंकगणित कौन करे
संरचनात्मक उत्तर ठीक दक्षता की रेखा पर श्रम विभाजन है। भाषा मॉडल भाषा में श्रेष्ठ हैं और बहीखाते में अविश्वसनीय, इसलिए मॉडल को कभी भी वह चीज़ नहीं होनी चाहिए जो गणना करे।
SQAI उसी विभाजन पर बना है। मॉडल एक typed intent लिखता है — sum amount where region = "east" — और एक निर्धारणवादी इंजन इसे compiled code के रूप में निष्पादित करता है: hash-pinned contract के विरुद्ध validated, policy के विरुद्ध जाँचा, एकल thread पर float64 में गणना, provenance के साथ लौटाया।
{
"status": "ok",
"value": 2130.5,
"rows_matched": 5
}
वह 2130.5 एक संभावित टोकन नहीं है। यह योग है, 445 modules में 4,574 read-only capabilities की surface से एक निर्धारणवादी kernel द्वारा उत्पन्न — उनमें से 4,564 पूरी तरह निर्धारणवादी — 0.83–0.93 ms warm में उत्तर देते हुए।
निर्धारणवादी का अर्थ है जाँचने योग्य। finance.npv(0.1, [-1000, 300, 420, 560, 680]) computation hash b74f67d0… के तहत 505.020148896933 लौटाता है — चाहे call TypeScript से हो या Python से, वही मान और वही hash, क्योंकि परिणाम एक canonical JSON रूप पर hash किए जाते हैं। दावा ईमानदारी से scoped है: declared execution scope के भीतर निर्धारणवादी, एक envelope के साथ जो runtime version, platform, precision mode और thread count दर्ज करता है, बजाय अतिदावे के। एक मॉडल का उसी prompt पर उत्तर अगले run पर खुद से मेल खाने का वादा नहीं कर सकता। यह महीनों बाद, किसी भी भाषा में, byte-identically replay होता है।
एक दूसरा रिसाव है, और अधिकांश stacks इसे खुला छोड़ देते हैं। एक compute engine जोड़ें, फिर raw query rows को "summarization के लिए" context में डालें — और मॉडल चुपचाप rows से संख्याएँ फिर से निकालता और गढ़ता है। SQAI context को एक governed boundary मानता है: मॉडल तक अधिकतम 25 rows, 250 cells और 32,000 bytes पहुँचती हैं, 100 rows की default limit और 1,000 की hard execution ceiling के पीछे। Truncation हमेशा घोषित होती है, इसलिए मॉडल ईमानदारी से दावा नहीं कर सकता कि उसने जो देखा उसका योग किया। आंशिक rows कभी नहीं दिखाई जातीं, इसलिए कोई अधूरा रिकॉर्ड उसे कल्पना से पूरा करने के लिए नहीं उकसाता। Aggregates boundary से पहले गणना किए जाते हैं। मॉडल को उत्तर मिलता है, होमवर्क नहीं।
और policy एक prompt नहीं है। अनुमत sources, fields और functions createSQAI() के समय code में तय होते हैं और execution से पहले in-process जाँचे जाते हैं; मॉडल के tool input में कोई policy fields नहीं होते, इसलिए उसके पास चौड़ा करने के लिए कुछ नहीं है। Policy के बाहर किसी capability के लिए पूछना कोई रचनात्मक समाधान नहीं देता — यह policy_denied_function देता है। तर्क वही है जो agents को SQL लिखने न देने के पीछे है: generated text को best-effort निर्देशों से नियंत्रित न करें; execution को allow-lists से नियंत्रित करें जिन्हें text छू नहीं सकता।
अंकगणित किसने किया?
अगली बार जब कोई AI प्रणाली आपको राजस्व का आँकड़ा दे, एक प्रश्न बाज़ार की हर architecture को छाँट देता है: अंकगणित किसने किया?
यदि उत्तर है "मॉडल ने," तो आपके पास उत्कृष्ट आसन और अज्ञात provenance वाली एक संख्या है, और एकमात्र सत्यापन पथ एक मानव द्वारा काम दोहराना है — वही चीज़ जिसे आप automate करने की कोशिश कर रहे थे। Deloitte की गढ़ी हुई बातें इसलिए पकड़ी गईं क्योंकि प्रक्रिया के बाहर एक शिक्षाविद् ने जाँचने का फैसला किया। यह नियंत्रण नहीं है। यह भाग्य है।
यदि उत्तर है "एक निर्धारणवादी इंजन ने, और यह रहा hash," तो सत्यापन एक replay है: वही intent, वही इंजन, वही bytes। विफलता तब और सूक्ष्म — और शांत — हो जाती है जब गलत संख्या गलत जोड़ के बजाय fanned-out join से आती है, जो अपनी अलग कहानी है। लेकिन अनुशासन एक वाक्य में समाता है: मॉडल प्रश्न लिखता है, उत्तर कभी नहीं।
गलत राजस्व संख्या खुद को घोषित नहीं करती। वह formatted, cited और आत्मविश्वासी होकर आती है — और पाँच अंकों के गुणन पर, कभी सही नहीं। pipeline ऐसा बनाएँ कि वह अंदर आ ही न सके।