No. 003নির্ধারণবাদ7 মিনিট পড়া

আত্মবিশ্বাসের সাথে ভুল রাজস্ব সংখ্যা: কেন LLM-রা যোগ করতে পারে না

একটি মডেল নিখুঁত ভঙ্গিতে একটি রাজস্ব সংখ্যা দেয়, কিন্তু পেছনে কোনো গণিত নেই। গবেষণা বলছে এই ব্যর্থতা কাঠামোগত — এবং সমাধানটিও তাই।

২০২৫ সালের অক্টোবরে Deloitte অস্ট্রেলিয়ান সরকারকে অর্থ ফেরত দেয়। প্রতিষ্ঠানটি Department of Employment and Workplace Relations-এ AU$৪,৪০,০০০-এর একটি পর্যালোচনা জমা দিয়েছিল; প্রকাশিত প্রতিবেদনে একটি ফেডারেল আদালতের রায় থেকে বানোয়াট উদ্ধৃতি এবং অস্তিত্বহীন একাডেমিক পেপারের রেফারেন্স ছিল (The Guardian, 2025)। একটি সংশোধিত সংস্করণে স্বীকার করা হয় যে খসড়া তৈরিতে GPT-4o ব্যবহার করা হয়েছিল। পরবর্তী প্রতিবেদনে ফেরতের পরিমাণ প্রায় AU$৯৭,০০০ বলে জানা যায় — চুক্তির শেষ কিস্তি।

একটি বিষয় অর্থের চেয়ে বেশি গুরুত্বপূর্ণ। বানোয়াট তথ্যগুলো প্রতিষ্ঠানের নিজস্ব পর্যালোচনায় বা ক্লায়েন্টের পর্যালোচনায় ধরা পড়েনি। ধরা পড়েছিল একজন বাইরের গবেষকের কাছে, যিনি রেফারেন্সগুলো যাচাই করেছিলেন। ডেলিভারেবলটি যে স্তরের যাচাই-বাছাইয়ের জন্য ডিজাইন করা হয়েছিল, সেগুলো সব পার করে গিয়েছিল — কারণ এতে কিছুই ভুল দেখাচ্ছিল না।

এটাই সেই বিভাগ: যে মডেল ব্যর্থ হয় না, বরং উত্তর দিয়ে ফেরে। একটি ভাষা মডেলকে দুইশো সারি জুড়ে রাজস্ব যোগ করতে বললে আপনি পাবেন সঠিক মাত্রার, সঠিক মুদ্রা চিহ্নের এবং আত্মবিশ্বাসী বাক্যে মোড়া একটি উত্তর। কিন্তু যোগফলটি নির্ভরযোগ্যভাবে পাবেন না। একটি অনুপস্থিত উত্তর ধরা পড়ে। ভালো ভঙ্গিতে আসা একটি ভুল উত্তর বোর্ডে পাঠিয়ে দেওয়া হয়।

এবং ভঙ্গি কখনো ভাঙে না, কারণ আত্মবিশ্বাসটিও তৈরি করা টেক্সট। মডেল জানে না যে সে ভুল; দমন করার মতো কোনো অভ্যন্তরীণ সংকেত নেই। সংখ্যাটি দাবি করা বাক্য এবং সংখ্যাটি নিজে একই জায়গা থেকে আসে — পরবর্তী সম্ভাব্য টোকেন।

বিশ্বাসযোগ্য মানে গণনা করা নয়

স্বাভাবিক প্রবণতা হলো ভুল সংখ্যাকে মডেলের পরিপক্বতার সমস্যা হিসেবে দেখা: নিশ্চয়ই পরের সংস্করণ সঠিকভাবে যোগ করবে। গবেষণা বলছে এই ব্যর্থতা কাঠামোগত, এবং কারণ সম্পর্কে এটি অস্বাভাবিকভাবে সামঞ্জস্যপূর্ণ।

GPT-4-কে দুটি তিন-অঙ্কের সংখ্যা গুণ করতে বললে জিরো-শটে ৫৯% সঠিক পাওয়া গেছে; ChatGPT-তে ৫৫% (arXiv, 2023)। চার অঙ্কে GPT-4 নেমে আসে ৩%-এ। পাঁচ অঙ্কে, ০%। Faith and Fate-এর লেখকরা প্রক্রিয়াটি চিহ্নিত করেছেন: ট্রান্সফর্মার যৌগিক সমস্যাগুলো সমাধান করে দেখা রৈখিক খণ্ডগুলো মিলিয়ে — পদ্ধতি নয়, প্যাটার্ন অনুসন্ধান। প্যাটার্ন যেখানে শেষ হয়, সেখানেই খাড়া পতন।

যোগও নিরাপদ নয়। ২০২৫ সালের একটি বিশ্লেষণে দেখা গেছে যে LLM-রা অ্যালগরিদমের পরিবর্তে এক-অঙ্কের লুকঅহেড হিউরিস্টিক দিয়ে যোগ করে: প্রম্পটিং বা টোকেনাইজেশন নির্বিশেষে, ক্যারি এক অঙ্কের বেশি ছড়িয়ে পড়লেই নির্ভুলতা ভেঙে পড়ে, এবং ব্যর্থতাগুলো শুধু ক্যারি কাঠামো থেকেই পূর্বানুমানযোগ্য (arXiv, 2025)। পদ্ধতিগত, এলোমেলো নয়। মডেলটি প্রায়-গণনা করছে না। এটি অন্য কিছু করছে যা প্রায়ই গণনার সাথে মিলে যায়।

Apple-এর GSM-Symbolic শেষ ফাঁকফোকরটি বন্ধ করে দিয়েছে — হয়তো এটি শুধু কঠিন গণিতেই হয় (Apple, 2024)। প্রাথমিক স্তরের শব্দ সমস্যা নিয়ে শুধু সংখ্যা পরিবর্তন করুন: পরীক্ষিত প্রতিটি অত্যাধুনিক মডেলের ফলাফল খারাপ হয়েছে। একটি বিশ্বাসযোগ্য কিন্তু অপ্রাসঙ্গিক বাক্য যোগ করুন: নির্ভুলতা ৬৫% পর্যন্ত কমে যায়। এবং একই প্রশ্ন টেমপ্লেটের নতুন উদাহরণে নির্ভুলতা লক্ষণীয়ভাবে পরিবর্তিত হয় — একই সমস্যা, নতুন শব্দে, ভিন্ন বিতরণের উত্তর দেয়। এই শেষ আবিষ্কারটি ডেমোর সমস্যা ব্যাখ্যা করে। একটি ডেমো হলো বিতরণ থেকে একটি নমুনা। একটি অডিট হলো বিতরণ।

লেখকদের রায় — "বর্তমান LLM-রা প্রকৃত যৌক্তিক অনুমানে সক্ষম নয়" — একটি গবেষণাপত্রের জন্য অস্বাভাবিকভাবে স্পষ্ট। কেউ এটি প্রত্যাহার করেনি।

100 50 0 accuracy, % zero-shot scratchpad 59 92 3×3-digit 4 4×4-digit 0 5×5-digit
n-অঙ্ক × n-অঙ্কের গুণে GPT-4-এর নির্ভুলতা, জিরো-শট বনাম ধাপে-ধাপে স্ক্র্যাচপ্যাড। Faith and Fate, NeurIPS 2023।

স্পষ্ট সমাধানগুলো, পরিমাপ করা

এই ব্যর্থতার মুখোমুখি হওয়া প্রতিটি দল একই চারটি সমাধানের দিকে হাত বাড়ায়। প্রতিটি পরিমাপ করা হয়েছে।

রিট্রিভাল। FinanceBench GPT-4-Turbo-কে পাবলিক আর্থিক ফাইলিং সম্পর্কে ১৫০টি প্রশ্ন করেছিল, একটি রিট্রিভাল সিস্টেম নথি সরবরাহ করেছিল। এটি ৮১% ক্ষেত্রে ভুল উত্তর দিয়েছে বা প্রত্যাখ্যান করেছে (Patronus AI, 2023)। ষোলটি কনফিগারেশন — GPT-4-Turbo, Llama 2, Claude 2, ভেক্টর স্টোর, লং কনটেক্সট — ২,৪০০টি ম্যানুয়ালি পর্যালোচনা করা উত্তরে দুর্বলতা দেখিয়েছে, এবং প্রমাণের পৃষ্ঠাগুলো নিখুঁতভাবে সরবরাহ না করা হলে মডেলগুলো সংখ্যা হ্যালুসিনেট করেছে। রিট্রিভাল নথি আনে। মডেল তবুও সংখ্যা ভুল করে।

গ্রাউন্ডিং। BBC ChatGPT, Copilot, Gemini এবং Perplexity-কে তার নিজস্ব নিবন্ধে সরাসরি অ্যাক্সেস দিয়ে সংবাদ সম্পর্কে প্রশ্ন করেছিল। ৫১% উত্তরে উল্লেখযোগ্য সমস্যা ছিল; ৯১%-এ অন্তত কিছু সমস্যা ছিল। BBC কন্টেন্ট উদ্ধৃত করা ১৯% উত্তরে তথ্যগত ত্রুটি ছিল — ভুল বিবৃতি, ভুল সংখ্যা, ভুল তারিখ — এবং BBC নিবন্ধে দায়ী করা ১৩% উদ্ধৃতি পরিবর্তিত বা কখনো অস্তিত্বহীন ছিল (BBC, 2025)। উৎস হাতে ছিল। সংখ্যা তবুও বাঁকল।

আরও উন্নত মডেল। OpenAI-এর নিজস্ব সিস্টেম কার্ড রিপোর্ট করে যে o3 PersonQA প্রম্পটের ৩৩%-এ এবং o4-mini ৪৮%-এ হ্যালুসিনেট করে — পুরনো o1-এর ১৬%-এর বিপরীতে (OpenAI, 2025)। বিক্রেতার নিজস্ব পরিমাপে, নতুন রিজনিং মডেলগুলো তাদের পূর্বসূরির চেয়ে দুই থেকে তিনগুণ বেশি হ্যালুসিনেট করে। o3 কেবল বেশি দাবি করে — বেশি সঠিক এবং বেশি বানোয়াট, একই তাপমাত্রার নিশ্চয়তায়।

উন্নত প্রম্পটিং। ধাপে-ধাপে স্ক্র্যাচপ্যাড প্রম্পটিং GPT-4-এর তিন-অঙ্কের গুণকে ৫৯% থেকে ৯২%-এ নিয়ে যায় (arXiv, 2023)। উন্নত — এবং তবুও বারোটির মধ্যে একটি ভুল গুণফল। এমনকি চার-অঙ্কের গুণে GPT-3-কে নিবিড়ভাবে ফাইন-টিউন করেও অদেখা চার-অঙ্কের সমস্যায় প্রায় ৪০% এবং পাঁচ অঙ্কে ০% পাওয়া গেছে। সীমাটি প্রক্রিয়ার, প্রম্পটের নয়।

প্রতিটি সমাধান সম্ভাবনা বাড়ায়। কিন্তু কেউই পরিবর্তন করে না যে গণিতটি কে করছে। উত্তর এখনো সম্ভাব্য সংখ্যার একটি বিতরণ থেকে নমুনা করা হয়, এবং সেই বিতরণের ঠিক একটি সদস্যই যোগফল।

0 50 100 % RETRIEVAL · FINANCEBENCH 2023 wrong or refused 81% GROUNDING · BBC 2025 significant issues 51% factual errors introduced 19% REASONING · PERSONQA, OPENAI 2025 o1 (predecessor) 16% o3 33% o4-mini 48%
সমাধানের পরে ব্যর্থতার হার। FinanceBench 2023 · BBC 2025 · OpenAI o3 / o4-mini সিস্টেম কার্ড 2025।

গণিতটি কে করবে তা পরিবর্তন করুন

কাঠামোগত উত্তর হলো দক্ষতার রেখা বরাবর শ্রম বিভাজন। ভাষা মডেল ভাষায় অসাধারণ এবং হিসাবে অবিশ্বস্ত, তাই মডেল কখনো গণনাকারী হওয়া উচিত নয়।

SQAI সেই বিভাজনের উপর নির্মিত। মডেল একটি টাইপড ইন্টেন্ট রচনা করে — sum amount where region = "east" — এবং একটি নির্ধারণবাদী ইঞ্জিন এটি কম্পাইল করা কোড হিসেবে চালায়: হ্যাশ-পিন করা চুক্তির বিপরীতে যাচাই করা, নীতির বিপরীতে পরীক্ষা করা, একটি থ্রেডে float64-এ গণনা করা, প্রোভেন্যান্সসহ ফেরত দেওয়া।

{
  "status": "ok",
  "value": 2130.5,
  "rows_matched": 5
}

সেই 2130.5 একটি সম্ভাব্য টোকেন নয়। এটি যোগফল, ৪৪৫টি মডিউল জুড়ে ৪,৫৭৪টি রিড-অনলি ক্যাপাবিলিটির একটি পৃষ্ঠ থেকে একটি নির্ধারণবাদী কার্নেল দ্বারা উৎপাদিত — তার মধ্যে ৪,৫৬৪টি সম্পূর্ণ নির্ধারণবাদী — ওয়ার্ম অবস্থায় ০.৮৩–০.৯৩ ms-এ উত্তর দেয়।

নির্ধারণবাদী মানে যাচাইযোগ্য। finance.npv(0.1, [-1000, 300, 420, 560, 680]) কম্পিউটেশন হ্যাশ b74f67d0…-এর অধীনে 505.020148896933 ফেরত দেয় — TypeScript বা Python থেকে কল করা হোক না কেন একই মান এবং একই হ্যাশ, কারণ ফলাফলগুলো একটি canonical JSON ফর্মে হ্যাশ করা হয়। দাবিটি সৎভাবে সীমাবদ্ধ: ঘোষিত এক্সিকিউশন স্কোপের মধ্যে নির্ধারণবাদী, রানটাইম সংস্করণ, প্ল্যাটফর্ম, প্রিসিশন মোড এবং থ্রেড কাউন্ট রেকর্ড করা একটি এনভেলপ সহ — অতিরিক্ত দাবি না করে। একই প্রম্পটে একটি মডেলের উত্তর পরের রানে নিজের সাথে মিলবে বলে প্রতিশ্রুতি দিতে পারে না। এটি মাসের পর মাস পরে, যেকোনো ভাষায়, বাইট-অভিন্নভাবে পুনরায় চালানো যায়।

একটি দ্বিতীয় ফাঁক আছে, এবং বেশিরভাগ স্ট্যাক এটি খোলা রাখে। একটি কম্পিউট ইঞ্জিন সংযুক্ত করুন, তারপর "সারসংক্ষেপের জন্য" কাঁচা কোয়েরি সারিগুলো কনটেক্সটে ঢেলে দিন — এবং মডেল নিঃশব্দে সারি থেকে সংখ্যা পুনরায় উদ্ভব করে এবং পুনরায় উদ্ভাবন করে। SQAI কনটেক্সটকে একটি নিয়ন্ত্রিত সীমানা হিসেবে বিবেচনা করে: সর্বোচ্চ ২৫ সারি, ২৫০ সেল এবং ৩২,০০০ বাইট মডেলে পৌঁছায়, ১০০ সারির ডিফল্ট সীমা এবং ১,০০০-এর কঠোর এক্সিকিউশন সীলিং সহ। ট্রাংকেশন সর্বদা ঘোষণা করা হয়, তাই মডেল সৎভাবে দাবি করতে পারে না যে সে যা দেখেছে তা যোগ করেছে। আংশিক সারি কখনো দেখানো হয় না, তাই কোনো অর্ধ-রেকর্ড কল্পনা থেকে সম্পূর্ণ করার প্রলোভন দেয় না। সমষ্টিগুলো সীমানার আগে গণনা করা হয়। মডেল উত্তর পায়, হোমওয়ার্ক নয়।

এবং নীতিটি একটি প্রম্পট নয়। অনুমোদিত উৎস, ক্ষেত্র এবং ফাংশনগুলো createSQAI() সময়ে কোডে স্থির করা হয় এবং এক্সিকিউশনের আগে ইন-প্রসেসে পরীক্ষা করা হয়; মডেলের টুল ইনপুটে কোনো নীতি ক্ষেত্র নেই, তাই এটি প্রসারিত করার কিছু নেই। নীতির বাইরে একটি ক্যাপাবিলিটি চাওয়া সৃজনশীল সমাধান তৈরি করে না — এটি policy_denied_function তৈরি করে। যুক্তিটি এজেন্টদের SQL লিখতে না দেওয়ার পেছনের যুক্তির মতোই: তৈরি করা টেক্সটকে সর্বোত্তম-প্রচেষ্টার নির্দেশনা দিয়ে নিয়ন্ত্রণ করবেন না; টেক্সট স্পর্শ করতে পারে না এমন অনুমতি তালিকা দিয়ে এক্সিকিউশন নিয়ন্ত্রণ করুন।

GOVERNED BOUNDARY MODEL language in, language out sum(amount) · region = "east" typed intent — never a SQL string ENGINE contract → policy → execute float64 · 1 thread · sub-ms warm value 2130.5 · rows 5 plan_hash f87610d8afeb… byte-identical replay · TS ≡ PY answer, not rows ≤ 25 rows · ≤ 250 cells · ≤ 32,000 B truncation always declared
শ্রম বিভাজন: মডেল একটি টাইপড ইন্টেন্ট রচনা করে; একটি float64 কার্নেল গণনা করে; সারি সীমা কাঁচা ডেটা কনটেক্সটের বাইরে রাখে।

গণিতটি কে করেছে?

পরের বার যখন কোনো AI সিস্টেম আপনাকে একটি রাজস্ব সংখ্যা দেবে, একটি প্রশ্ন বাজারের প্রতিটি আর্কিটেকচার বাছাই করে: গণিতটি কে করেছে?

যদি উত্তর হয় "মডেল," আপনার কাছে চমৎকার ভঙ্গির এবং অজানা উৎসের একটি সংখ্যা আছে, এবং একমাত্র যাচাইয়ের পথ হলো একজন মানুষ কাজটি পুনরায় করা — যে জিনিসটি আপনি স্বয়ংক্রিয় করার চেষ্টা করছিলেন। Deloitte-এর বানোয়াট তথ্য ধরা পড়েছিল কারণ প্রক্রিয়ার বাইরের একজন গবেষক যাচাই করার সিদ্ধান্ত নিয়েছিলেন। এটি নিয়ন্ত্রণ নয়। এটি ভাগ্য।

যদি উত্তর হয় "একটি নির্ধারণবাদী ইঞ্জিন, এবং এখানে হ্যাশ আছে," যাচাই হলো একটি রিপ্লে: একই ইন্টেন্ট, একই ইঞ্জিন, একই বাইট। ব্যর্থতা আরও সূক্ষ্ম — এবং আরও নীরব — হয়ে যায় যখন ভুল সংখ্যা ভুল যোগের পরিবর্তে একটি ফ্যান-আউট জয়েন থেকে আসে, যা নিজেই আলাদা গল্প। কিন্তু নীতিটি একটি বাক্যে ধরা যায়: মডেল প্রশ্ন লেখে, কখনো উত্তর নয়।

ভুল রাজস্ব সংখ্যা নিজেকে ঘোষণা করে না। এটি ফরম্যাট করা, উদ্ধৃত এবং আত্মবিশ্বাসী হয়ে আসে — এবং পাঁচ অঙ্কের গুণে, কখনো সঠিক নয়। পাইপলাইন তৈরি করুন যাতে এটি প্রবেশ করতে না পারে।