No. 003निर्धारणवाद9 मिनट पठन

आत्मविश्वास से गलत राजस्व संख्या: LLMs जोड़ क्यों नहीं कर सकते

मॉडल आपको एक राजस्व आँकड़ा सौंपता है — पूरे आत्मविश्वास के साथ, बिना किसी अंकगणित के। शोध कहता है यह विफलता संरचनात्मक है — और समाधान भी।

अक्टूबर 2025 में Deloitte ने ऑस्ट्रेलियाई सरकार को पैसे वापस किए। फर्म ने Department of Employment and Workplace Relations को AU$440,000 की एक समीक्षा सौंपी थी; प्रकाशित रिपोर्ट में एक संघीय अदालत के फैसले से गढ़ा हुआ उद्धरण और ऐसे शैक्षणिक पेपरों के हवाले थे जो अस्तित्व में ही नहीं हैं (The Guardian, 2025)। संशोधित संस्करण में खुलासा हुआ कि मसौदे में GPT-4o का उपयोग किया गया था। बाद की रिपोर्टिंग के अनुसार धनवापसी लगभग AU$97,000 थी — अनुबंध की अंतिम किस्त।

एक विवरण पैसे से अधिक महत्वपूर्ण है। ये गढ़ी हुई बातें फर्म की समीक्षा में नहीं पकड़ी गईं, न ही क्लाइंट की समीक्षा में। उन्हें एक बाहरी शिक्षाविद् ने पकड़ा जिसने संदर्भों की जाँच की। डिलीवरेबल उन सभी जाँच परतों से पार हो गया था जिनसे उसे पार होना था, क्योंकि उसमें कुछ भी गलत नहीं दिखता था।

यही वह श्रेणी है: वह मॉडल नहीं जो विफल होता है, बल्कि वह जो उत्तर लौटाता है। किसी भाषा मॉडल से दो सौ पंक्तियों का राजस्व जोड़ने को कहें और आपको सही परिमाण, सही मुद्रा चिह्न और उसके इर्द-गिर्द एक आत्मविश्वासी वाक्य के साथ उत्तर मिलता है। जो आपको विश्वसनीय रूप से नहीं मिलता वह है योग। एक अनुपस्थित उत्तर पकड़ा जाता है। अच्छे आसन वाला गलत उत्तर बोर्ड को भेज दिया जाता है।

और आसन कभी नहीं टूटता, क्योंकि आत्मविश्वास भी उत्पन्न पाठ है। मॉडल को पता नहीं कि वह गलत है; दबाने के लिए कोई आंतरिक अलार्म नहीं है। संख्या का दावा करने वाला वाक्य और संख्या स्वयं एक ही स्थान से आती है — अगला संभावित टोकन।

प्रशंसनीय, गणना नहीं

गलत संख्याओं को मॉडल की परिपक्वता के तहत दर्ज करने की प्रवृत्ति होती है: निश्चित रूप से अगला संस्करण सही जोड़ता होगा। शोध कहता है यह विफलता संरचनात्मक है, और इसके कारण के बारे में असामान्य रूप से एकमत है।

GPT-4 से दो तीन-अंकीय संख्याओं को गुणा करने पर zero-shot में 59% सही मिले; ChatGPT में 55% (arXiv, 2023)। चार अंकों पर GPT-4 3% तक गिर गया। पाँच पर, 0%। Faith and Fate के लेखकों ने तंत्र का पता लगाया: transformers रैखिक रूप से देखे गए अंशों का मिलान करके संयोजन समस्याओं को हल करते हैं — पैटर्न खोज, प्रक्रिया नहीं। चट्टान ठीक वहाँ है जहाँ पैटर्न समाप्त होते हैं।

जोड़ भी सुरक्षित नहीं है। 2025 के एक विश्लेषण में पाया गया कि LLMs एक एल्गोरिदम के बजाय एक-अंकीय lookahead heuristic से जोड़ते हैं: prompting या tokenization की परवाह किए बिना, सटीकता ठीक वहाँ ढह जाती है जहाँ carry एक अंक से आगे बढ़ती है, और विफलताएँ केवल carry संरचना से अनुमानित हैं (arXiv, 2025)। व्यवस्थित, शोरगुल नहीं। मॉडल लगभग-गणना नहीं कर रहा। वह कुछ और कर रहा है जो अक्सर गणना से सहमत होता है।

Apple के GSM-Symbolic ने शेष खामी बंद की — कि शायद यह केवल कठिन अंकगणित को प्रभावित करता है (Apple, 2024)। प्राथमिक स्तर की शब्द समस्याएँ लें और केवल संख्याएँ बदलें: परीक्षण किए गए हर अत्याधुनिक मॉडल का प्रदर्शन खराब हुआ। एक प्रशंसनीय लेकिन अप्रासंगिक खंड जोड़ें: सटीकता 65% तक गिर गई। और एक ही प्रश्न टेम्पलेट के नए उदाहरणों में सटीकता उल्लेखनीय रूप से भिन्न थी — वही समस्या, दूसरे शब्दों में, उत्तरों का एक अलग वितरण देती है। यह अंतिम निष्कर्ष demo की समस्या समझाता है। Demo वितरण से एक draw है। ऑडिट वितरण है।

लेखकों का निर्णय — "current LLMs are not capable of genuine logical reasoning" — एक शोध पत्र के लिए असामान्य रूप से स्पष्ट है। किसी ने इसे वापस नहीं लिया।

100 50 0 accuracy, % zero-shot scratchpad 59 92 3×3-digit 4 4×4-digit 0 5×5-digit
n-अंकीय × n-अंकीय गुणन पर GPT-4 की सटीकता, zero-shot बनाम step-by-step scratchpad। Faith and Fate, NeurIPS 2023।

स्पष्ट समाधान, मापे गए

इस विफलता से सामना होने पर हर टीम एक ही चार समाधानों की ओर बढ़ती है। प्रत्येक को मापा जा चुका है।

Retrieval। FinanceBench ने GPT-4-Turbo से सार्वजनिक वित्तीय दाखिलों के बारे में 150 प्रश्न पूछे, जिसमें एक retrieval प्रणाली दस्तावेज़ उपलब्ध करा रही थी। उसने 81% का गलत उत्तर दिया या मना कर दिया (Patronus AI, 2023)। सोलह कॉन्फ़िगरेशन — GPT-4-Turbo, Llama 2, Claude 2, vector stores, long context — ने 2,400 मैन्युअल रूप से समीक्षित उत्तरों में कमज़ोरियाँ दिखाईं, और जब साक्ष्य पृष्ठ पूरी तरह उपलब्ध नहीं थे तो मॉडलों ने आँकड़े गढ़े। Retrieval दस्तावेज़ लाता है। मॉडल फिर भी संख्या बिगाड़ता है।

Grounding। BBC ने ChatGPT, Copilot, Gemini और Perplexity को अपने लेखों तक सीधी पहुँच दी और उनसे समाचारों के बारे में पूछा। 51% उत्तरों में महत्वपूर्ण समस्याएँ थीं; 91% में कम से कम कुछ। BBC सामग्री का हवाला देने वाले 19% उत्तरों में तथ्यात्मक त्रुटियाँ थीं — गलत कथन, गलत संख्याएँ, गलत तारीखें — और BBC लेखों से जिम्मेदार 13% उद्धरण बदले हुए थे या कभी अस्तित्व में नहीं थे (BBC, 2025)। स्रोत हाथ में था। संख्याएँ फिर भी मुड़ गईं।

बेहतर मॉडल। OpenAI का अपना system card रिपोर्ट करता है कि o3 PersonQA prompts पर 33% और o4-mini 48% hallucinate करता है — पुराने o1 के 16% के मुकाबले (OpenAI, 2025)। विक्रेता के अपने माप से, नए reasoning मॉडल अपने पूर्ववर्ती से दो से तीन गुना अधिक hallucinate करते हैं। o3 बस अधिक दावे करता है — अधिक सही और अधिक गढ़े हुए, एक ही निश्चितता के तापमान पर।

बेहतर prompting। Step-by-step scratchpad prompting GPT-4 की तीन-अंकीय गुणन को 59% से 92% तक उठाती है (arXiv, 2023)। बेहतर — और फिर भी बारह में से एक गलत गुणनफल। यहाँ तक कि GPT-3 को चार-अंकीय गुणन पर exhaustively fine-tune करने पर अनदेखी चार-अंकीय समस्याओं पर लगभग 40% और पाँच अंकों पर 0% मिला। सीमा तंत्र है, prompt नहीं।

हर समाधान संभावना बदलता है। कोई भी यह नहीं बदलता कि अंकगणित कौन करता है। उत्तर अभी भी प्रशंसनीय संख्याओं के वितरण से sample किया जाता है, और उस वितरण का ठीक एक सदस्य योग है।

0 50 100 % RETRIEVAL · FINANCEBENCH 2023 wrong or refused 81% GROUNDING · BBC 2025 significant issues 51% factual errors introduced 19% REASONING · PERSONQA, OPENAI 2025 o1 (predecessor) 16% o3 33% o4-mini 48%
समाधान के बाद विफलता दर। FinanceBench 2023 · BBC 2025 · OpenAI o3 / o4-mini system card 2025।

अंकगणित कौन करे

संरचनात्मक उत्तर ठीक दक्षता की रेखा पर श्रम विभाजन है। भाषा मॉडल भाषा में श्रेष्ठ हैं और बहीखाते में अविश्वसनीय, इसलिए मॉडल को कभी भी वह चीज़ नहीं होनी चाहिए जो गणना करे।

SQAI उसी विभाजन पर बना है। मॉडल एक typed intent लिखता है — sum amount where region = "east" — और एक निर्धारणवादी इंजन इसे compiled code के रूप में निष्पादित करता है: hash-pinned contract के विरुद्ध validated, policy के विरुद्ध जाँचा, एकल thread पर float64 में गणना, provenance के साथ लौटाया।

{
  "status": "ok",
  "value": 2130.5,
  "rows_matched": 5
}

वह 2130.5 एक संभावित टोकन नहीं है। यह योग है, 445 modules में 4,574 read-only capabilities की surface से एक निर्धारणवादी kernel द्वारा उत्पन्न — उनमें से 4,564 पूरी तरह निर्धारणवादी — 0.83–0.93 ms warm में उत्तर देते हुए।

निर्धारणवादी का अर्थ है जाँचने योग्य। finance.npv(0.1, [-1000, 300, 420, 560, 680]) computation hash b74f67d0… के तहत 505.020148896933 लौटाता है — चाहे call TypeScript से हो या Python से, वही मान और वही hash, क्योंकि परिणाम एक canonical JSON रूप पर hash किए जाते हैं। दावा ईमानदारी से scoped है: declared execution scope के भीतर निर्धारणवादी, एक envelope के साथ जो runtime version, platform, precision mode और thread count दर्ज करता है, बजाय अतिदावे के। एक मॉडल का उसी prompt पर उत्तर अगले run पर खुद से मेल खाने का वादा नहीं कर सकता। यह महीनों बाद, किसी भी भाषा में, byte-identically replay होता है।

एक दूसरा रिसाव है, और अधिकांश stacks इसे खुला छोड़ देते हैं। एक compute engine जोड़ें, फिर raw query rows को "summarization के लिए" context में डालें — और मॉडल चुपचाप rows से संख्याएँ फिर से निकालता और गढ़ता है। SQAI context को एक governed boundary मानता है: मॉडल तक अधिकतम 25 rows, 250 cells और 32,000 bytes पहुँचती हैं, 100 rows की default limit और 1,000 की hard execution ceiling के पीछे। Truncation हमेशा घोषित होती है, इसलिए मॉडल ईमानदारी से दावा नहीं कर सकता कि उसने जो देखा उसका योग किया। आंशिक rows कभी नहीं दिखाई जातीं, इसलिए कोई अधूरा रिकॉर्ड उसे कल्पना से पूरा करने के लिए नहीं उकसाता। Aggregates boundary से पहले गणना किए जाते हैं। मॉडल को उत्तर मिलता है, होमवर्क नहीं।

और policy एक prompt नहीं है। अनुमत sources, fields और functions createSQAI() के समय code में तय होते हैं और execution से पहले in-process जाँचे जाते हैं; मॉडल के tool input में कोई policy fields नहीं होते, इसलिए उसके पास चौड़ा करने के लिए कुछ नहीं है। Policy के बाहर किसी capability के लिए पूछना कोई रचनात्मक समाधान नहीं देता — यह policy_denied_function देता है। तर्क वही है जो agents को SQL लिखने न देने के पीछे है: generated text को best-effort निर्देशों से नियंत्रित न करें; execution को allow-lists से नियंत्रित करें जिन्हें text छू नहीं सकता।

GOVERNED BOUNDARY MODEL language in, language out sum(amount) · region = "east" typed intent — never a SQL string ENGINE contract → policy → execute float64 · 1 thread · sub-ms warm value 2130.5 · rows 5 plan_hash f87610d8afeb… byte-identical replay · TS ≡ PY answer, not rows ≤ 25 rows · ≤ 250 cells · ≤ 32,000 B truncation always declared
श्रम विभाजन: मॉडल एक typed intent लिखता है; एक float64 kernel गणना करता है; row caps raw data को context से बाहर रखती हैं।

अंकगणित किसने किया?

अगली बार जब कोई AI प्रणाली आपको राजस्व का आँकड़ा दे, एक प्रश्न बाज़ार की हर architecture को छाँट देता है: अंकगणित किसने किया?

यदि उत्तर है "मॉडल ने," तो आपके पास उत्कृष्ट आसन और अज्ञात provenance वाली एक संख्या है, और एकमात्र सत्यापन पथ एक मानव द्वारा काम दोहराना है — वही चीज़ जिसे आप automate करने की कोशिश कर रहे थे। Deloitte की गढ़ी हुई बातें इसलिए पकड़ी गईं क्योंकि प्रक्रिया के बाहर एक शिक्षाविद् ने जाँचने का फैसला किया। यह नियंत्रण नहीं है। यह भाग्य है।

यदि उत्तर है "एक निर्धारणवादी इंजन ने, और यह रहा hash," तो सत्यापन एक replay है: वही intent, वही इंजन, वही bytes। विफलता तब और सूक्ष्म — और शांत — हो जाती है जब गलत संख्या गलत जोड़ के बजाय fanned-out join से आती है, जो अपनी अलग कहानी है। लेकिन अनुशासन एक वाक्य में समाता है: मॉडल प्रश्न लिखता है, उत्तर कभी नहीं।

गलत राजस्व संख्या खुद को घोषित नहीं करती। वह formatted, cited और आत्मविश्वासी होकर आती है — और पाँच अंकों के गुणन पर, कभी सही नहीं। pipeline ऐसा बनाएँ कि वह अंदर आ ही न सके।