No. 003নির্ধারণবাদ7 মিনিট পড়া

আত্মবিশ্বাসের সাথে ভুল রাজস্ব সংখ্যা: কেন LLM-রা যোগ করতে পারে না

একটি মডেল নিখুঁত ভঙ্গিতে একটি রাজস্ব সংখ্যা দেয়, কিন্তু পেছনে কোনো গাণিতিক হিসাব নেই। গবেষণা বলছে, এই ব্যর্থতা কাঠামোগত — এবং সমাধানটিও তাই।

২০২৫ সালের অক্টোবরে Deloitte অস্ট্রেলিয়ান সরকারকে অর্থ ফেরত দেয়। প্রতিষ্ঠানটি Department of Employment and Workplace Relations-এর জন্য AU$৪,৪০,০০০-এর একটি পর্যালোচনা সম্পন্ন করেছিল; প্রকাশিত প্রতিবেদনে একটি ফেডারেল আদালতের রায় থেকে বানোয়াট উদ্ধৃতি এবং অস্তিত্বহীন একাডেমিক পেপারের রেফারেন্স ছিল (The Guardian, 2025)। একটি সংশোধিত সংস্করণে প্রকাশ করা হয় যে খসড়া তৈরিতে GPT-4o ব্যবহার করা হয়েছিল। পরবর্তী প্রতিবেদনে ফেরতের পরিমাণ প্রায় AU$৯৭,০০০ বলে জানা যায় — চুক্তির শেষ কিস্তি।

একটি বিষয় অর্থের চেয়ে বেশি গুরুত্বপূর্ণ। বানোয়াট তথ্যগুলো প্রতিষ্ঠানের নিজস্ব পর্যালোচনায় বা ক্লায়েন্টের পর্যালোচনায় ধরা পড়েনি। ধরা পড়েছিল একজন বাইরের একাডেমিকের কাছে, যিনি রেফারেন্সগুলো যাচাই করেছিলেন। ডেলিভারেবলটি যে স্তরের যাচাই-বাছাইয়ের জন্য ডিজাইন করা হয়েছিল, সেগুলো সব পার করে গিয়েছিল — কারণ এতে কিছুই ভুল দেখাচ্ছিল না।

এটাই সেই বিভাগ: যে মডেল ব্যর্থ হয় না, বরং উত্তর দিয়ে ফেরে। একটি ভাষা মডেলকে দুইশো সারি জুড়ে রাজস্ব যোগ করতে বললে আপনি পাবেন সঠিক মাত্রার, সঠিক মুদ্রা চিহ্নের এবং আত্মবিশ্বাসী বাক্যে মোড়া একটি উত্তর। কিন্তু যোগফলটি নির্ভরযোগ্যভাবে পাবেন না। একটি অনুপস্থিত উত্তর ধরা পড়ে। ভালো ভঙ্গিতে আসা একটি ভুল উত্তর বোর্ডে পাঠিয়ে দেওয়া হয়।

এবং ভঙ্গি কখনো ভাঙে না, কারণ আত্মবিশ্বাসটিও উৎপন্ন টেক্সট। মডেল জানে না যে সে ভুল; দমন করার মতো কোনো অভ্যন্তরীণ সংকেত নেই। সংখ্যাটি দাবি করা বাক্য এবং সংখ্যাটি নিজে একই জায়গা থেকে আসে — পরবর্তী সম্ভাব্য টোকেন।

বিশ্বাসযোগ্য মানে গণনা করা নয়

স্বাভাবিক প্রবণতা হলো ভুল সংখ্যাকে মডেলের পরিপক্কতার সমস্যা হিসেবে দেখা: নিশ্চয়ই পরবর্তী সংস্করণ সঠিকভাবে যোগ করবে। গবেষণা বলছে এই ব্যর্থতা কাঠামোগত, এবং কারণ সম্পর্কে এটি অস্বাভাবিকভাবে সামঞ্জস্যপূর্ণ।

GPT-4-কে দুটি তিন-অঙ্কের সংখ্যা গুণ করতে বললে জিরো-শটে ৫৯% সঠিক পাওয়া গেছে; ChatGPT-তে ৫৫% (arXiv, 2023)। চার অঙ্কে GPT-4 নেমে আসে ৩%-এ। পাঁচ অঙ্কে, ০%। Faith and Fate-এর লেখকরা প্রক্রিয়াটি চিহ্নিত করেছেন: ট্রান্সফর্মার কম্পোজিশনাল সমস্যাগুলো সমাধান করে তারা যা দেখেছে তার রৈখিক খণ্ডগুলো মিলিয়ে — প্যাটার্ন অনুসন্ধান, পদ্ধতি নয়। ধস ঠিক সেখানেই শুরু হয় যেখানে প্যাটার্ন শেষ হয়।

যোগও নিরাপদ নয়। ২০২৫ সালের একটি বিশ্লেষণে দেখা গেছে যে LLM-রা অ্যালগরিদমের পরিবর্তে এক-অঙ্কের লুকঅ্যাহেড হিউরিস্টিক দিয়ে যোগ করে: প্রম্পটিং বা টোকেনাইজেশন নির্বিশেষে, ক্যারি এক অঙ্কের বেশি ছড়িয়ে পড়লেই নির্ভুলতা ভেঙে পড়ে, এবং ব্যর্থতাগুলো শুধু ক্যারি কাঠামো থেকেই পূর্বানুমানযোগ্য (arXiv, 2025)। পদ্ধতিগত, এলোমেলো নয়। মডেলটি প্রায়-গণনা করছে না। এটি অন্য কিছু করছে যা প্রায়ই গণনার সাথে মিলে যায়।

Apple-এর GSM-Symbolic শেষ ফাঁকফোকরটি বন্ধ করে দিয়েছে — হয়তো এটি শুধু কঠিন গণিতেই হয় (Apple, 2024)। প্রাথমিক স্তরের শব্দ সমস্যা নিয়ে শুধু সংখ্যা পরিবর্তন করুন: পরীক্ষিত প্রতিটি অত্যাধুনিক মডেলের ফলাফল খারাপ হয়েছে। একটি বিশ্বাসযোগ্য কিন্তু অপ্রাসঙ্গিক বাক্য যোগ করুন: নির্ভুলতা ৬৫% পর্যন্ত কমে যায়। এবং একই প্রশ্ন টেমপ্লেটের নতুন ইনস্ট্যান্সে নির্ভুলতা উল্লেখযোগ্যভাবে পরিবর্তিত হয় — একই সমস্যা, নতুন শব্দে, ভিন্ন বিতরণের উত্তর দেয়। এই শেষ আবিষ্কারটি ডেমোর সমস্যা ব্যাখ্যা করে। একটি ডেমো হলো বিতরণ থেকে একটি ড্র। একটি অডিট হলো বিতরণ।

লেখকদের রায় — "বর্তমান LLM-রা প্রকৃত যৌক্তিক তর্কে সক্ষম নয়" — একটি গবেষণাপত্রের জন্য অস্বাভাবিকভাবে স্পষ্ট। কেউ এটি প্রত্যাহার করেনি।

100 50 0 accuracy, % zero-shot scratchpad 59 92 3×3-digit 4 4×4-digit 0 5×5-digit
n-অঙ্ক × n-অঙ্ক গুণে GPT-4-এর নির্ভুলতা, জিরো-শট বনাম ধাপে-ধাপে স্ক্র্যাচপ্যাড। Faith and Fate, NeurIPS 2023।

স্পষ্ট সমাধানগুলো, পরিমাপ করা

এই ব্যর্থতার মুখোমুখি হওয়া প্রতিটি দল একই চারটি সমাধানের দিকে হাত বাড়ায়। প্রতিটি পরিমাপ করা হয়েছে।

রিট্রিভাল। FinanceBench GPT-4-Turbo-কে পাবলিক আর্থিক ফাইলিং সম্পর্কে ১৫০টি প্রশ্ন করেছিল, একটি রিট্রিভাল সিস্টেম নথি সরবরাহ করেছিল। এটি ৮১% প্রশ্নের ভুল উত্তর দিয়েছে বা প্রত্যাখ্যান করেছে (Patronus AI, 2023)। ষোলটি কনফিগারেশন — GPT-4-Turbo, Llama 2, Claude 2, ভেক্টর স্টোর, লং কনটেক্সট — ২,৪০০ ম্যানুয়ালি পর্যালোচনা করা উত্তরে দুর্বলতা দেখিয়েছে, এবং প্রমাণের পৃষ্ঠাগুলো নিখুঁতভাবে সরবরাহ না করা হলে মডেলগুলো সংখ্যা হ্যালুসিনেট করেছে। রিট্রিভাল নথি আনে। মডেল তবুও সংখ্যা ভুল করে।

গ্রাউন্ডিং। BBC ChatGPT, Copilot, Gemini এবং Perplexity-কে তার নিজস্ব নিবন্ধে সরাসরি অ্যাক্সেস দিয়ে সংবাদ সম্পর্কে প্রশ্ন করেছিল। ৫১% উত্তরে উল্লেখযোগ্য সমস্যা ছিল; ৯১%-এ অন্তত কিছু সমস্যা ছিল। BBC কন্টেন্ট উদ্ধৃত করা ১৯% উত্তরে তথ্যগত ত্রুটি ছিল — ভুল বিবৃতি, ভুল সংখ্যা, ভুল তারিখ — এবং BBC নিবন্ধে দায়ী করা ১৩% উদ্ধৃতি পরিবর্তিত বা কখনো বিদ্যমান ছিল না (BBC, 2025)। উৎস হাতে ছিল। সংখ্যা তবুও বাঁকল।

আরও উন্নত মডেল। OpenAI-এর নিজস্ব সিস্টেম কার্ড রিপোর্ট করে যে o3 PersonQA প্রম্পটের ৩৩%-এ এবং o4-mini ৪৮%-এ হ্যালুসিনেট করে — পুরনো o1-এর ১৬%-এর বিপরীতে (OpenAI, 2025)। বিক্রেতার নিজস্ব পরিমাপে, নতুন রিজনিং মডেলগুলো তাদের পূর্বসূরির চেয়ে দুই থেকে তিনগুণ বেশি হ্যালুসিনেট করে। o3 কেবল বেশি দাবি করে — বেশি সঠিক এবং বেশি বানোয়াট, একই তাপমাত্রার নিশ্চয়তায় পরিবেশিত।

উন্নত প্রম্পটিং। ধাপে-ধাপে স্ক্র্যাচপ্যাড প্রম্পটিং GPT-4-এর তিন-অঙ্কের গুণকে ৫৯% থেকে ৯২%-এ নিয়ে যায় (arXiv, 2023)। উন্নত — এবং তবুও বারোটিতে একটি ভুল গুণফল। এমনকি চার-অঙ্কের গুণে GPT-3-কে নিবিড়ভাবে ফাইন-টিউন করেও অদেখা চার-অঙ্কের সমস্যায় প্রায় ৪০% এবং পাঁচ অঙ্কে ০% পাওয়া গেছে। সীমাটি প্রক্রিয়ার, প্রম্পটের নয়।

প্রতিটি সমাধান সম্ভাবনা বাড়ায়। কিন্তু কেউ পরিবর্তন করে না যে গণিতটি কে করছে। উত্তরটি এখনো সম্ভাব্য সংখ্যার বিতরণ থেকে নমুনা করা হয়, এবং সেই বিতরণের ঠিক একটি সদস্যই যোগফল।

0 50 100 % RETRIEVAL · FINANCEBENCH 2023 wrong or refused 81% GROUNDING · BBC 2025 significant issues 51% factual errors introduced 19% REASONING · PERSONQA, OPENAI 2025 o1 (predecessor) 16% o3 33% o4-mini 48%
সমাধানের পরে ব্যর্থতার হার। FinanceBench 2023 · BBC 2025 · OpenAI o3 / o4-mini সিস্টেম কার্ড 2025।

গণিতটি কে করবে তা পরিবর্তন করুন

কাঠামোগত উত্তর হলো দক্ষতার রেখা বরাবর শ্রম বিভাজন। ভাষা মডেল ভাষায় অসাধারণ এবং হিসাবে অবিশ্বস্ত, তাই মডেল কখনো গণনাকারী হওয়া উচিত নয়।

SQAI সেই বিভাজনের উপর নির্মিত। মডেল একটি টাইপড ইন্টেন্ট রচনা করে — sum amount where region = "east" — এবং একটি SQAI runtime এটি কম্পাইল করা কোড হিসেবে কার্যকর করে: হ্যাশ-পিন করা চুক্তির বিপরীতে যাচাই করা, নীতির বিপরীতে পরীক্ষা করা, একটি থ্রেডে float64-এ গণনা করা, প্রভেন্যান্সসহ ফেরত দেওয়া।

{
  "status": "ok",
  "value": 2130.5,
  "rows_matched": 5
}

সেই 2130.5 একটি সম্ভাব্য টোকেন নয়। এটি যোগফল, ৪৪৫টি মডিউল জুড়ে ৪,৫৭৪টি রিড-অনলি ক্যাপাবিলিটির পৃষ্ঠ থেকে একটি নির্ধারণবাদী কার্নেল দ্বারা উৎপাদিত — তার মধ্যে ৪,৫৬৪টি সম্পূর্ণ নির্ধারণবাদী — ০.৮৩–০.৯৩ ms ওয়ার্মে উত্তর দেয়।

নির্ধারণবাদী মানে যাচাইযোগ্য। finance.npv(0.1, [-1000, 300, 420, 560, 680]) কম্পিউটেশন হ্যাশ b74f67d0…-এর অধীনে 505.020148896933 ফেরত দেয় — TypeScript বা Python থেকে কল করা হোক না কেন একই মান এবং একই হ্যাশ, কারণ ফলাফলগুলো একটি ক্যানোনিকাল JSON ফর্মে হ্যাশ করা হয়। দাবিটি সৎভাবে সীমাবদ্ধ: ঘোষিত এক্সিকিউশন স্কোপের মধ্যে নির্ধারণবাদী, রানটাইম সংস্করণ, প্ল্যাটফর্ম, প্রিসিশন মোড এবং থ্রেড কাউন্ট রেকর্ড করা একটি এনভেলপ সহ — অতিরিক্ত দাবি না করে। একই প্রম্পটে একটি মডেলের উত্তর পরের রানে নিজের সাথে মিলবে বলে প্রতিশ্রুতি দিতে পারে না। এটি মাসের পর মাস পরে, যেকোনো ভাষায়, বাইট-অভিন্নভাবে রিপ্লে করে।

একটি দ্বিতীয় ফাঁক আছে, এবং বেশিরভাগ স্ট্যাক এটি খোলা রাখে। একটি কম্পিউট ইঞ্জিন সংযুক্ত করুন, তারপর "সারসংক্ষেপের জন্য" কাঁচা কোয়েরি সারিগুলো কনটেক্সটে ঢেলে দিন — এবং মডেল নিঃশব্দে সারি থেকে সংখ্যা পুনরায় উদ্ভূত করে এবং পুনরায় উদ্ভাবন করে। SQAI কনটেক্সটকে একটি পরিচালিত সীমানা হিসেবে বিবেচনা করে: সর্বোচ্চ ২৫ সারি, ২৫০ সেল এবং ৩২,০০০ বাইট মডেলে পৌঁছায়, ১০০ সারির ডিফল্ট সীমা এবং ১,০০০-এর হার্ড এক্সিকিউশন সিলিং সহ। ট্রাংকেশন সর্বদা ঘোষিত হয়, তাই মডেল সৎভাবে দাবি করতে পারে না যে সে যা দেখেছে তা যোগ করেছে। আংশিক সারি কখনো দেখানো হয় না, তাই কোনো অর্ধ-রেকর্ড কল্পনা থেকে সম্পূর্ণ করতে প্রলুব্ধ করে না। অ্যাগ্রিগেটগুলো সীমানার আগে গণনা করা হয়। মডেল উত্তর পায়, হোমওয়ার্ক নয়।

এবং নীতিটি একটি প্রম্পট নয়। অনুমোদিত উৎস, ফিল্ড এবং ফাংশনগুলো createSQAI() সময়ে কোডে স্থির করা হয় এবং এক্সিকিউশনের আগে ইন-প্রসেসে পরীক্ষা করা হয়; মডেলের টুল ইনপুটে কোনো নীতি ফিল্ড নেই, তাই এটি প্রসারিত করার কিছু নেই। নীতির বাইরে একটি ক্যাপাবিলিটি চাওয়া সৃজনশীল সমাধান তৈরি করে না — এটি policy_denied_function তৈরি করে। যুক্তিটি এজেন্টদের SQL লিখতে না দেওয়ার পেছনের যুক্তির মতোই: উৎপন্ন টেক্সটকে সর্বোত্তম-প্রচেষ্টার নির্দেশনা দিয়ে পরিচালনা করবেন না; এক্সিকিউশনকে অ্যালো-লিস্ট দিয়ে পরিচালনা করুন যা টেক্সট স্পর্শ করতে পারে না।

GOVERNED BOUNDARY MODEL language in, language out sum(amount) · region = "east" typed intent — never a SQL string ENGINE contract → policy → execute float64 · 1 thread · sub-ms warm value 2130.5 · rows 5 plan_hash f87610d8afeb… byte-identical replay · TS ≡ PY answer, not rows ≤ 25 rows · ≤ 250 cells · ≤ 32,000 B truncation always declared
শ্রম বিভাজন: মডেল একটি টাইপড ইন্টেন্ট রচনা করে; একটি float64 কার্নেল গণনা করে; সারি ক্যাপ কাঁচা ডেটা কনটেক্সটের বাইরে রাখে।

গণিতটি কে করেছে?

পরের বার যখন একটি AI সিস্টেম আপনাকে একটি রাজস্ব সংখ্যা দেবে, একটি প্রশ্ন বাজারের প্রতিটি আর্কিটেকচার বাছাই করে: গণিতটি কে করেছে?

যদি উত্তর হয় "মডেল," আপনার কাছে চমৎকার ভঙ্গির এবং অজানা উৎসের একটি সংখ্যা আছে, এবং একমাত্র যাচাইয়ের পথ হলো একজন মানুষ কাজটি পুনরায় করা — যে জিনিসটি আপনি স্বয়ংক্রিয় করার চেষ্টা করছিলেন। Deloitte-এর বানোয়াট তথ্য ধরা পড়েছিল কারণ প্রক্রিয়ার বাইরের একজন একাডেমিক যাচাই করার সিদ্ধান্ত নিয়েছিলেন। এটি একটি নিয়ন্ত্রণ নয়। এটি ভাগ্য।

যদি উত্তর হয় "একটি SQAI runtime, এবং এখানে হ্যাশ আছে," যাচাই হলো একটি রিপ্লে: একই ইন্টেন্ট, একই রানটাইম, একই বাইট। ব্যর্থতা আরও সূক্ষ্ম — এবং আরও নীরব — হয়ে যায় যখন ভুল সংখ্যা ভুল যোগের পরিবর্তে একটি ফ্যান-আউট জয়েন থেকে আসে, যা নিজেই আলাদা একটি গল্প। কিন্তু নীতিটি একটি বাক্যে ধরা যায়: মডেল প্রশ্ন লেখে, কখনো উত্তর নয়।

ভুল রাজস্ব সংখ্যা নিজেকে ঘোষণা করে না। এটি ফরম্যাট করা, উদ্ধৃত এবং আত্মবিশ্বাসী হয়ে আসে — এবং পাঁচ অঙ্কের গুণে, কখনো সঠিক নয়। পাইপলাইন তৈরি করুন যাতে এটি প্রবেশ করতে না পারে।