No. 003नियतत्ववाद9 मिनट पठन

आत्मविश्वास से भरी गलत राजस्व संख्या: LLMs जोड़ क्यों नहीं कर सकते

मॉडल आपको एक राजस्व आँकड़ा सौंपता है — पूरे आत्मविश्वास के साथ, बिना किसी अंकगणित के। शोध कहता है यह विफलता संरचनागत है — और समाधान भी।

अक्टूबर 2025 में Deloitte ने ऑस्ट्रेलियाई सरकार को पैसे वापस किए। फर्म ने रोजगार और कार्यस्थल संबंध विभाग को AU$4,40,000 की एक समीक्षा सौंपी थी; प्रकाशित रिपोर्ट में एक संघीय न्यायालय के फैसले से गढ़ा हुआ उद्धरण और ऐसे शैक्षणिक पेपरों के संदर्भ थे जो अस्तित्व में ही नहीं हैं (The Guardian, 2025)। संशोधित संस्करण में खुलासा हुआ कि मसौदे में GPT-4o का उपयोग किया गया था। बाद की रिपोर्टिंग के अनुसार धनवापसी लगभग AU$97,000 थी — अनुबंध की अंतिम किस्त।

एक विवरण पैसे से अधिक महत्वपूर्ण है। ये गढ़ी हुई बातें फर्म की समीक्षा में नहीं पकड़ी गईं, न ही क्लाइंट की समीक्षा में। उन्हें एक बाहरी शिक्षाविद् ने पकड़ा जिसने संदर्भ जाँचे। डिलीवरेबल जाँच की हर परत से गुजर चुका था जिसके लिए उसे बनाया गया था, क्योंकि उसमें कुछ भी गलत नहीं दिखता था।

यही वह श्रेणी है: वह मॉडल नहीं जो विफल होता है, बल्कि वह जो उत्तर लौटाता है। किसी भाषा मॉडल से दो सौ पंक्तियों का राजस्व जोड़ने को कहें और आपको सही परिमाण, सही मुद्रा चिह्न और उसके इर्द-गिर्द एक आत्मविश्वासी वाक्य के साथ उत्तर मिलता है। जो आपको विश्वसनीय रूप से नहीं मिलता वह है योग। एक अनुपस्थित उत्तर पकड़ा जाता है। अच्छे आत्मविश्वास वाला गलत उत्तर बोर्ड को भेज दिया जाता है।

और यह आत्मविश्वास कभी नहीं टूटता, क्योंकि वह भी उत्पन्न पाठ है। मॉडल को पता नहीं कि वह गलत है; दबाने के लिए कोई आंतरिक अलार्म नहीं है। संख्या को प्रतिपादित करने वाला वाक्य और संख्या स्वयं एक ही स्थान से आती है — अगला संभावित टोकन।

प्रशंसनीय, गणित की हुई नहीं

गलत संख्याओं को मॉडल की परिपक्वता के खाते में डालने की प्रवृत्ति होती है: निश्चित रूप से अगला संस्करण सही जोड़ेगा। शोध कहता है यह विफलता संरचनागत है, और इसके कारण के बारे में असामान्य रूप से एकमत है।

GPT-4 से दो तीन-अंकीय संख्याओं को गुणा करने पर zero-shot में 59% सही मिले; ChatGPT से 55% (arXiv, 2023)। चार अंकों पर GPT-4 3% तक गिर गया। पाँच पर, 0%। Faith and Fate के लेखकों ने तंत्र का पता लगाया: ट्रांसफॉर्मर संयोजनात्मक समस्याओं को उन्होंने जो देखा है उसके रैखिक खंडों का मिलान करके हल करते हैं — पैटर्न खोज, प्रक्रिया नहीं। चट्टान ठीक वहाँ है जहाँ पैटर्न समाप्त होते हैं।

जोड़ भी सुरक्षित नहीं है। 2025 के एक विश्लेषण में पाया गया कि LLMs एक एल्गोरिदम के बजाय एक-अंक के lookahead अनुमान से जोड़ते हैं: सटीकता ठीक वहाँ ध्वस्त होती है जहाँ carry एक अंक से आगे बढ़ती है, prompting या tokenization की परवाह किए बिना, और विफलताएँ अकेले carry संरचना से अनुमानित हैं (arXiv, 2025)। व्यवस्थित, शोरगुल वाली नहीं। मॉडल लगभग-गणना नहीं कर रहा। वह कुछ और कर रहा है जो अक्सर गणना से सहमत होता है।

Apple के GSM-Symbolic ने शेष खामी बंद की — कि शायद यह केवल कठिन अंकगणित को प्रभावित करता है (Apple, 2024)। प्राथमिक स्तर की शब्द समस्याएँ लें और केवल संख्याएँ बदलें: परीक्षण किए गए हर अत्याधुनिक मॉडल का प्रदर्शन खराब हुआ। एक प्रशंसनीय लेकिन अप्रासंगिक खंड जोड़ें: सटीकता 65% तक गिर गई। और सटीकता एक ही प्रश्न टेम्पलेट के नए उदाहरणों में उल्लेखनीय रूप से भिन्न थी — वही समस्या, दूसरे शब्दों में, उत्तरों का एक अलग वितरण देती है। यह अंतिम निष्कर्ष डेमो की समस्या समझाता है। डेमो वितरण से एक ड्रॉ है। ऑडिट वितरण है।

लेखकों का निर्णय — "वर्तमान LLMs वास्तविक तार्किक तर्क में सक्षम नहीं हैं" — एक शोध पत्र के लिए असामान्य रूप से स्पष्ट है। किसी ने इसे अभी तक वापस नहीं लिया।

100 50 0 accuracy, % zero-shot scratchpad 59 92 3×3-digit 4 4×4-digit 0 5×5-digit
n-अंकीय × n-अंकीय गुणन पर GPT-4 की सटीकता, zero-shot बनाम चरण-दर-चरण scratchpad। Faith and Fate, NeurIPS 2023।

स्पष्ट समाधान, मापे गए

इस विफलता से सामना होने पर हर टीम एक ही चार समाधानों की ओर बढ़ती है। प्रत्येक को मापा जा चुका है।

रिट्रीवल। FinanceBench ने GPT-4-Turbo से सार्वजनिक वित्तीय दाखिलों के बारे में 150 प्रश्न पूछे, एक रिट्रीवल सिस्टम दस्तावेज़ आपूर्ति करते हुए। इसने 81% का गलत उत्तर दिया या मना कर दिया (Patronus AI, 2023)। सोलह कॉन्फ़िगरेशन — GPT-4-Turbo, Llama 2, Claude 2, वेक्टर स्टोर, लंबा संदर्भ — ने 2,400 मैन्युअल रूप से समीक्षित उत्तरों में कमज़ोरियाँ दिखाईं, और जब साक्ष्य पृष्ठ पूरी तरह आपूर्ति नहीं किए गए तो मॉडलों ने आँकड़े गढ़े। रिट्रीवल दस्तावेज़ लाता है। मॉडल फिर भी संख्या बिगाड़ता है।

ग्राउंडिंग। BBC ने ChatGPT, Copilot, Gemini और Perplexity को अपने लेखों तक सीधी पहुँच दी और उनसे समाचारों के बारे में पूछा। 51% उत्तरों में महत्वपूर्ण समस्याएँ थीं; 91% में कम से कम कुछ। BBC सामग्री उद्धृत करने वाले 19% उत्तरों में तथ्यात्मक त्रुटियाँ थीं — गलत कथन, गलत संख्याएँ, गलत तारीखें — और BBC लेखों से जिम्मेदार 13% उद्धरण बदले हुए थे या कभी अस्तित्व में नहीं थे (BBC, 2025)। स्रोत हाथ में था। संख्याएँ फिर भी मुड़ गईं।

एक बेहतर मॉडल। OpenAI का अपना सिस्टम कार्ड रिपोर्ट करता है कि o3 PersonQA प्रॉम्प्ट के 33% पर और o4-mini 48% पर मतिभ्रम करता है — पुराने o1 के 16% के मुकाबले (OpenAI, 2025)। विक्रेता के अपने माप से, नए रीज़निंग मॉडल अपने पूर्ववर्ती से दो से तीन गुना अधिक मतिभ्रम करते हैं। o3 बस अधिक दावे करता है — अधिक सही और अधिक गढ़े हुए, एक ही निश्चितता के तापमान पर।

बेहतर prompting। चरण-दर-चरण scratchpad prompting GPT-4 की तीन-अंकीय गुणन को 59% से 92% तक उठाती है (arXiv, 2023)। बेहतर — और फिर भी बारह में एक गलत गुणनफल। यहाँ तक कि चार-अंकीय गुणन पर GPT-3 को exhaustively fine-tune करने पर अनदेखी चार-अंकीय समस्याओं पर लगभग 40% और पाँच अंकों पर 0% मिला। सीमा तंत्र है, prompt नहीं।

हर समाधान संभावना बदलता है। कोई भी यह नहीं बदलता कि अंकगणित कौन करता है। उत्तर अभी भी प्रशंसनीय संख्याओं के वितरण से नमूना लिया जाता है, और उस वितरण का ठीक एक सदस्य योग है।

0 50 100 % RETRIEVAL · FINANCEBENCH 2023 wrong or refused 81% GROUNDING · BBC 2025 significant issues 51% factual errors introduced 19% REASONING · PERSONQA, OPENAI 2025 o1 (predecessor) 16% o3 33% o4-mini 48%
समाधान के बाद विफलता दर। FinanceBench 2023 · BBC 2025 · OpenAI o3 / o4-mini system card 2025।

अंकगणित कौन करे

संरचनागत उत्तर योग्यता की रेखा पर खींचा गया श्रम विभाजन है। भाषा मॉडल भाषा में श्रेष्ठ हैं और बहीखाते में अविश्वसनीय, इसलिए मॉडल को कभी भी वह चीज़ नहीं होनी चाहिए जो गणना करे।

SQAI उसी विभाजन पर बना है। मॉडल एक typed intent लिखता है — sum amount where region = "east" — और एक SQAI runtime इसे compiled code के रूप में निष्पादित करता है: hash-pinned contract के विरुद्ध सत्यापित, नीति के विरुद्ध जाँचा, एकल थ्रेड पर float64 में गणना, provenance के साथ लौटाया।

{
  "status": "ok",
  "value": 2130.5,
  "rows_matched": 5
}

वह 2130.5 एक संभावित टोकन नहीं है। यह योग है, 445 मॉड्यूल में 4,574 read-only क्षमताओं की सतह से एक नियतात्मक kernel द्वारा उत्पन्न — उनमें से 4,564 पूरी तरह नियतात्मक — 0.83–0.93 ms warm में उत्तर देते हुए।

नियतात्मक का अर्थ है जाँचने योग्य। finance.npv(0.1, [-1000, 300, 420, 560, 680]) computation hash b74f67d0… के अंतर्गत 505.020148896933 लौटाता है — चाहे कॉल TypeScript से की जाए या Python से, वही मान और वही hash, क्योंकि परिणाम एक canonical JSON रूप पर hashed हैं। दावा ईमानदारी से सीमित है: घोषित निष्पादन दायरे के भीतर नियतात्मक, एक envelope के साथ जो runtime संस्करण, platform, precision mode और thread count दर्ज करता है — अतिदावे के बिना। एक मॉडल का उसी prompt पर उत्तर अगले रन पर खुद से मेल खाने का वादा नहीं कर सकता। यह महीनों बाद, किसी भी भाषा में, byte-identically replay होता है।

एक दूसरा रिसाव है, और अधिकांश स्टैक इसे खुला छोड़ देते हैं। एक compute engine जोड़ें, फिर raw query rows को "summarization के लिए" context में डालें — और मॉडल चुपचाप rows से संख्याएँ पुनः-व्युत्पन्न और पुनः-आविष्कार करता है। SQAI context को एक governed boundary मानता है: मॉडल तक अधिकतम 25 rows, 250 cells और 32,000 bytes पहुँचती हैं, 100 rows की default सीमा और 1,000 की hard execution ceiling के पीछे। Truncation हमेशा घोषित होता है, इसलिए मॉडल ईमानदारी से दावा नहीं कर सकता कि उसने जो देखा उसका योग किया। आंशिक rows कभी नहीं दिखाई जातीं, इसलिए कोई अधूरा रिकॉर्ड उसे कल्पना से पूरा करने के लिए प्रेरित नहीं करता। Aggregates boundary से पहले गणना किए जाते हैं। मॉडल को उत्तर मिलता है, होमवर्क नहीं।

और नीति एक prompt नहीं है। अनुमत sources, fields और functions createSQAI() के समय code में तय होते हैं और निष्पादन से पहले in-process जाँचे जाते हैं; मॉडल के tool input में कोई policy fields नहीं होते, इसलिए उसके पास विस्तार करने के लिए कुछ नहीं है। नीति के बाहर किसी क्षमता की माँग रचनात्मक समाधान नहीं देती — यह policy_denied_function देती है। तर्क वही है जो agents को SQL लिखने न देने के पीछे है: उत्पन्न पाठ को best-effort निर्देशों से नियंत्रित न करें; निष्पादन को allow-lists से नियंत्रित करें जिन्हें पाठ छू नहीं सकता।

GOVERNED BOUNDARY MODEL language in, language out sum(amount) · region = "east" typed intent — never a SQL string ENGINE contract → policy → execute float64 · 1 thread · sub-ms warm value 2130.5 · rows 5 plan_hash f87610d8afeb… byte-identical replay · TS ≡ PY answer, not rows ≤ 25 rows · ≤ 250 cells · ≤ 32,000 B truncation always declared
श्रम विभाजन: मॉडल एक typed intent लिखता है; एक float64 kernel गणना करता है; row caps raw data को context से बाहर रखती हैं।

अंकगणित किसने किया?

अगली बार जब कोई AI सिस्टम आपको एक राजस्व आँकड़ा सौंपे, एक प्रश्न बाज़ार की हर architecture को छाँट देता है: अंकगणित किसने किया?

यदि उत्तर है "मॉडल ने," तो आपके पास उत्कृष्ट आत्मविश्वास और अज्ञात provenance वाली एक संख्या है, और एकमात्र सत्यापन पथ एक मानव द्वारा काम दोहराना है — वही चीज़ जिसे आप स्वचालित करने की कोशिश कर रहे थे। Deloitte की गढ़ी हुई बातें इसलिए पकड़ी गईं क्योंकि प्रक्रिया के बाहर एक शिक्षाविद् ने जाँचने का निर्णय लिया। यह नियंत्रण नहीं है। यह भाग्य है।

यदि उत्तर है "एक SQAI runtime ने, और यह रहा hash," तो सत्यापन एक replay है: वही intent, वही runtime, वही bytes। विफलता तब और सूक्ष्म — और शांत — हो जाती है जब गलत संख्या गलत जोड़ के बजाय fanned-out join से आती है, जो अपनी अलग कहानी है। लेकिन अनुशासन एक वाक्य में समाता है: मॉडल प्रश्न लिखता है, उत्तर कभी नहीं।

गलत राजस्व संख्या खुद को घोषित नहीं करती। वह formatted, cited और आत्मविश्वासी होकर आती है — और पाँच अंकों के गुणन पर, कभी सही नहीं। pipeline ऐसा बनाएँ कि वह प्रवेश न कर सके।