২০২৫ সালের অক্টোবরে Deloitte অস্ট্রেলিয়ান সরকারকে অর্থ ফেরত দেয়। প্রতিষ্ঠানটি Department of Employment and Workplace Relations-এ AU$৪,৪০,০০০-এর একটি পর্যালোচনা জমা দিয়েছিল; প্রকাশিত প্রতিবেদনে একটি ফেডারেল আদালতের রায় থেকে বানোয়াট উদ্ধৃতি এবং অস্তিত্বহীন একাডেমিক পেপারের রেফারেন্স ছিল (The Guardian, 2025)। একটি সংশোধিত সংস্করণে স্বীকার করা হয় যে খসড়া তৈরিতে GPT-4o ব্যবহার করা হয়েছিল। পরবর্তী প্রতিবেদনে ফেরতের পরিমাণ প্রায় AU$৯৭,০০০ বলে জানা যায় — চুক্তির শেষ কিস্তি।
একটি বিষয় অর্থের চেয়ে বেশি গুরুত্বপূর্ণ। বানোয়াট তথ্যগুলো প্রতিষ্ঠানের নিজস্ব পর্যালোচনায় বা ক্লায়েন্টের পর্যালোচনায় ধরা পড়েনি। ধরা পড়েছিল একজন বাইরের গবেষকের কাছে, যিনি রেফারেন্সগুলো যাচাই করেছিলেন। ডেলিভারেবলটি যে স্তরের যাচাই-বাছাইয়ের জন্য ডিজাইন করা হয়েছিল, সেগুলো সব পার করে গিয়েছিল — কারণ এতে কিছুই ভুল দেখাচ্ছিল না।
এটাই সেই বিভাগ: যে মডেল ব্যর্থ হয় না, বরং উত্তর দিয়ে ফেরে। একটি ভাষা মডেলকে দুইশো সারি জুড়ে রাজস্ব যোগ করতে বললে আপনি পাবেন সঠিক মাত্রার, সঠিক মুদ্রা চিহ্নের এবং আত্মবিশ্বাসী বাক্যে মোড়া একটি উত্তর। কিন্তু যোগফলটি নির্ভরযোগ্যভাবে পাবেন না। একটি অনুপস্থিত উত্তর ধরা পড়ে। ভালো ভঙ্গিতে আসা একটি ভুল উত্তর বোর্ডে পাঠিয়ে দেওয়া হয়।
এবং ভঙ্গি কখনো ভাঙে না, কারণ আত্মবিশ্বাসটিও তৈরি করা টেক্সট। মডেল জানে না যে সে ভুল; দমন করার মতো কোনো অভ্যন্তরীণ সংকেত নেই। সংখ্যাটি দাবি করা বাক্য এবং সংখ্যাটি নিজে একই জায়গা থেকে আসে — পরবর্তী সম্ভাব্য টোকেন।
বিশ্বাসযোগ্য মানে গণনা করা নয়
স্বাভাবিক প্রবণতা হলো ভুল সংখ্যাকে মডেলের পরিপক্বতার সমস্যা হিসেবে দেখা: নিশ্চয়ই পরের সংস্করণ সঠিকভাবে যোগ করবে। গবেষণা বলছে এই ব্যর্থতা কাঠামোগত, এবং কারণ সম্পর্কে এটি অস্বাভাবিকভাবে সামঞ্জস্যপূর্ণ।
GPT-4-কে দুটি তিন-অঙ্কের সংখ্যা গুণ করতে বললে জিরো-শটে ৫৯% সঠিক পাওয়া গেছে; ChatGPT-তে ৫৫% (arXiv, 2023)। চার অঙ্কে GPT-4 নেমে আসে ৩%-এ। পাঁচ অঙ্কে, ০%। Faith and Fate-এর লেখকরা প্রক্রিয়াটি চিহ্নিত করেছেন: ট্রান্সফর্মার যৌগিক সমস্যাগুলো সমাধান করে দেখা রৈখিক খণ্ডগুলো মিলিয়ে — পদ্ধতি নয়, প্যাটার্ন অনুসন্ধান। প্যাটার্ন যেখানে শেষ হয়, সেখানেই খাড়া পতন।
যোগও নিরাপদ নয়। ২০২৫ সালের একটি বিশ্লেষণে দেখা গেছে যে LLM-রা অ্যালগরিদমের পরিবর্তে এক-অঙ্কের লুকঅহেড হিউরিস্টিক দিয়ে যোগ করে: প্রম্পটিং বা টোকেনাইজেশন নির্বিশেষে, ক্যারি এক অঙ্কের বেশি ছড়িয়ে পড়লেই নির্ভুলতা ভেঙে পড়ে, এবং ব্যর্থতাগুলো শুধু ক্যারি কাঠামো থেকেই পূর্বানুমানযোগ্য (arXiv, 2025)। পদ্ধতিগত, এলোমেলো নয়। মডেলটি প্রায়-গণনা করছে না। এটি অন্য কিছু করছে যা প্রায়ই গণনার সাথে মিলে যায়।
Apple-এর GSM-Symbolic শেষ ফাঁকফোকরটি বন্ধ করে দিয়েছে — হয়তো এটি শুধু কঠিন গণিতেই হয় (Apple, 2024)। প্রাথমিক স্তরের শব্দ সমস্যা নিয়ে শুধু সংখ্যা পরিবর্তন করুন: পরীক্ষিত প্রতিটি অত্যাধুনিক মডেলের ফলাফল খারাপ হয়েছে। একটি বিশ্বাসযোগ্য কিন্তু অপ্রাসঙ্গিক বাক্য যোগ করুন: নির্ভুলতা ৬৫% পর্যন্ত কমে যায়। এবং একই প্রশ্ন টেমপ্লেটের নতুন উদাহরণে নির্ভুলতা লক্ষণীয়ভাবে পরিবর্তিত হয় — একই সমস্যা, নতুন শব্দে, ভিন্ন বিতরণের উত্তর দেয়। এই শেষ আবিষ্কারটি ডেমোর সমস্যা ব্যাখ্যা করে। একটি ডেমো হলো বিতরণ থেকে একটি নমুনা। একটি অডিট হলো বিতরণ।
লেখকদের রায় — "বর্তমান LLM-রা প্রকৃত যৌক্তিক অনুমানে সক্ষম নয়" — একটি গবেষণাপত্রের জন্য অস্বাভাবিকভাবে স্পষ্ট। কেউ এটি প্রত্যাহার করেনি।
স্পষ্ট সমাধানগুলো, পরিমাপ করা
এই ব্যর্থতার মুখোমুখি হওয়া প্রতিটি দল একই চারটি সমাধানের দিকে হাত বাড়ায়। প্রতিটি পরিমাপ করা হয়েছে।
রিট্রিভাল। FinanceBench GPT-4-Turbo-কে পাবলিক আর্থিক ফাইলিং সম্পর্কে ১৫০টি প্রশ্ন করেছিল, একটি রিট্রিভাল সিস্টেম নথি সরবরাহ করেছিল। এটি ৮১% ক্ষেত্রে ভুল উত্তর দিয়েছে বা প্রত্যাখ্যান করেছে (Patronus AI, 2023)। ষোলটি কনফিগারেশন — GPT-4-Turbo, Llama 2, Claude 2, ভেক্টর স্টোর, লং কনটেক্সট — ২,৪০০টি ম্যানুয়ালি পর্যালোচনা করা উত্তরে দুর্বলতা দেখিয়েছে, এবং প্রমাণের পৃষ্ঠাগুলো নিখুঁতভাবে সরবরাহ না করা হলে মডেলগুলো সংখ্যা হ্যালুসিনেট করেছে। রিট্রিভাল নথি আনে। মডেল তবুও সংখ্যা ভুল করে।
গ্রাউন্ডিং। BBC ChatGPT, Copilot, Gemini এবং Perplexity-কে তার নিজস্ব নিবন্ধে সরাসরি অ্যাক্সেস দিয়ে সংবাদ সম্পর্কে প্রশ্ন করেছিল। ৫১% উত্তরে উল্লেখযোগ্য সমস্যা ছিল; ৯১%-এ অন্তত কিছু সমস্যা ছিল। BBC কন্টেন্ট উদ্ধৃত করা ১৯% উত্তরে তথ্যগত ত্রুটি ছিল — ভুল বিবৃতি, ভুল সংখ্যা, ভুল তারিখ — এবং BBC নিবন্ধে দায়ী করা ১৩% উদ্ধৃতি পরিবর্তিত বা কখনো অস্তিত্বহীন ছিল (BBC, 2025)। উৎস হাতে ছিল। সংখ্যা তবুও বাঁকল।
আরও উন্নত মডেল। OpenAI-এর নিজস্ব সিস্টেম কার্ড রিপোর্ট করে যে o3 PersonQA প্রম্পটের ৩৩%-এ এবং o4-mini ৪৮%-এ হ্যালুসিনেট করে — পুরনো o1-এর ১৬%-এর বিপরীতে (OpenAI, 2025)। বিক্রেতার নিজস্ব পরিমাপে, নতুন রিজনিং মডেলগুলো তাদের পূর্বসূরির চেয়ে দুই থেকে তিনগুণ বেশি হ্যালুসিনেট করে। o3 কেবল বেশি দাবি করে — বেশি সঠিক এবং বেশি বানোয়াট, একই তাপমাত্রার নিশ্চয়তায়।
উন্নত প্রম্পটিং। ধাপে-ধাপে স্ক্র্যাচপ্যাড প্রম্পটিং GPT-4-এর তিন-অঙ্কের গুণকে ৫৯% থেকে ৯২%-এ নিয়ে যায় (arXiv, 2023)। উন্নত — এবং তবুও বারোটির মধ্যে একটি ভুল গুণফল। এমনকি চার-অঙ্কের গুণে GPT-3-কে নিবিড়ভাবে ফাইন-টিউন করেও অদেখা চার-অঙ্কের সমস্যায় প্রায় ৪০% এবং পাঁচ অঙ্কে ০% পাওয়া গেছে। সীমাটি প্রক্রিয়ার, প্রম্পটের নয়।
প্রতিটি সমাধান সম্ভাবনা বাড়ায়। কিন্তু কেউই পরিবর্তন করে না যে গণিতটি কে করছে। উত্তর এখনো সম্ভাব্য সংখ্যার একটি বিতরণ থেকে নমুনা করা হয়, এবং সেই বিতরণের ঠিক একটি সদস্যই যোগফল।
গণিতটি কে করবে তা পরিবর্তন করুন
কাঠামোগত উত্তর হলো দক্ষতার রেখা বরাবর শ্রম বিভাজন। ভাষা মডেল ভাষায় অসাধারণ এবং হিসাবে অবিশ্বস্ত, তাই মডেল কখনো গণনাকারী হওয়া উচিত নয়।
SQAI সেই বিভাজনের উপর নির্মিত। মডেল একটি টাইপড ইন্টেন্ট রচনা করে — sum amount where region = "east" — এবং একটি নির্ধারণবাদী ইঞ্জিন এটি কম্পাইল করা কোড হিসেবে চালায়: হ্যাশ-পিন করা চুক্তির বিপরীতে যাচাই করা, নীতির বিপরীতে পরীক্ষা করা, একটি থ্রেডে float64-এ গণনা করা, প্রোভেন্যান্সসহ ফেরত দেওয়া।
{
"status": "ok",
"value": 2130.5,
"rows_matched": 5
}
সেই 2130.5 একটি সম্ভাব্য টোকেন নয়। এটি যোগফল, ৪৪৫টি মডিউল জুড়ে ৪,৫৭৪টি রিড-অনলি ক্যাপাবিলিটির একটি পৃষ্ঠ থেকে একটি নির্ধারণবাদী কার্নেল দ্বারা উৎপাদিত — তার মধ্যে ৪,৫৬৪টি সম্পূর্ণ নির্ধারণবাদী — ওয়ার্ম অবস্থায় ০.৮৩–০.৯৩ ms-এ উত্তর দেয়।
নির্ধারণবাদী মানে যাচাইযোগ্য। finance.npv(0.1, [-1000, 300, 420, 560, 680]) কম্পিউটেশন হ্যাশ b74f67d0…-এর অধীনে 505.020148896933 ফেরত দেয় — TypeScript বা Python থেকে কল করা হোক না কেন একই মান এবং একই হ্যাশ, কারণ ফলাফলগুলো একটি canonical JSON ফর্মে হ্যাশ করা হয়। দাবিটি সৎভাবে সীমাবদ্ধ: ঘোষিত এক্সিকিউশন স্কোপের মধ্যে নির্ধারণবাদী, রানটাইম সংস্করণ, প্ল্যাটফর্ম, প্রিসিশন মোড এবং থ্রেড কাউন্ট রেকর্ড করা একটি এনভেলপ সহ — অতিরিক্ত দাবি না করে। একই প্রম্পটে একটি মডেলের উত্তর পরের রানে নিজের সাথে মিলবে বলে প্রতিশ্রুতি দিতে পারে না। এটি মাসের পর মাস পরে, যেকোনো ভাষায়, বাইট-অভিন্নভাবে পুনরায় চালানো যায়।
একটি দ্বিতীয় ফাঁক আছে, এবং বেশিরভাগ স্ট্যাক এটি খোলা রাখে। একটি কম্পিউট ইঞ্জিন সংযুক্ত করুন, তারপর "সারসংক্ষেপের জন্য" কাঁচা কোয়েরি সারিগুলো কনটেক্সটে ঢেলে দিন — এবং মডেল নিঃশব্দে সারি থেকে সংখ্যা পুনরায় উদ্ভব করে এবং পুনরায় উদ্ভাবন করে। SQAI কনটেক্সটকে একটি নিয়ন্ত্রিত সীমানা হিসেবে বিবেচনা করে: সর্বোচ্চ ২৫ সারি, ২৫০ সেল এবং ৩২,০০০ বাইট মডেলে পৌঁছায়, ১০০ সারির ডিফল্ট সীমা এবং ১,০০০-এর কঠোর এক্সিকিউশন সীলিং সহ। ট্রাংকেশন সর্বদা ঘোষণা করা হয়, তাই মডেল সৎভাবে দাবি করতে পারে না যে সে যা দেখেছে তা যোগ করেছে। আংশিক সারি কখনো দেখানো হয় না, তাই কোনো অর্ধ-রেকর্ড কল্পনা থেকে সম্পূর্ণ করার প্রলোভন দেয় না। সমষ্টিগুলো সীমানার আগে গণনা করা হয়। মডেল উত্তর পায়, হোমওয়ার্ক নয়।
এবং নীতিটি একটি প্রম্পট নয়। অনুমোদিত উৎস, ক্ষেত্র এবং ফাংশনগুলো createSQAI() সময়ে কোডে স্থির করা হয় এবং এক্সিকিউশনের আগে ইন-প্রসেসে পরীক্ষা করা হয়; মডেলের টুল ইনপুটে কোনো নীতি ক্ষেত্র নেই, তাই এটি প্রসারিত করার কিছু নেই। নীতির বাইরে একটি ক্যাপাবিলিটি চাওয়া সৃজনশীল সমাধান তৈরি করে না — এটি policy_denied_function তৈরি করে। যুক্তিটি এজেন্টদের SQL লিখতে না দেওয়ার পেছনের যুক্তির মতোই: তৈরি করা টেক্সটকে সর্বোত্তম-প্রচেষ্টার নির্দেশনা দিয়ে নিয়ন্ত্রণ করবেন না; টেক্সট স্পর্শ করতে পারে না এমন অনুমতি তালিকা দিয়ে এক্সিকিউশন নিয়ন্ত্রণ করুন।
গণিতটি কে করেছে?
পরের বার যখন কোনো AI সিস্টেম আপনাকে একটি রাজস্ব সংখ্যা দেবে, একটি প্রশ্ন বাজারের প্রতিটি আর্কিটেকচার বাছাই করে: গণিতটি কে করেছে?
যদি উত্তর হয় "মডেল," আপনার কাছে চমৎকার ভঙ্গির এবং অজানা উৎসের একটি সংখ্যা আছে, এবং একমাত্র যাচাইয়ের পথ হলো একজন মানুষ কাজটি পুনরায় করা — যে জিনিসটি আপনি স্বয়ংক্রিয় করার চেষ্টা করছিলেন। Deloitte-এর বানোয়াট তথ্য ধরা পড়েছিল কারণ প্রক্রিয়ার বাইরের একজন গবেষক যাচাই করার সিদ্ধান্ত নিয়েছিলেন। এটি নিয়ন্ত্রণ নয়। এটি ভাগ্য।
যদি উত্তর হয় "একটি নির্ধারণবাদী ইঞ্জিন, এবং এখানে হ্যাশ আছে," যাচাই হলো একটি রিপ্লে: একই ইন্টেন্ট, একই ইঞ্জিন, একই বাইট। ব্যর্থতা আরও সূক্ষ্ম — এবং আরও নীরব — হয়ে যায় যখন ভুল সংখ্যা ভুল যোগের পরিবর্তে একটি ফ্যান-আউট জয়েন থেকে আসে, যা নিজেই আলাদা গল্প। কিন্তু নীতিটি একটি বাক্যে ধরা যায়: মডেল প্রশ্ন লেখে, কখনো উত্তর নয়।
ভুল রাজস্ব সংখ্যা নিজেকে ঘোষণা করে না। এটি ফরম্যাট করা, উদ্ধৃত এবং আত্মবিশ্বাসী হয়ে আসে — এবং পাঁচ অঙ্কের গুণে, কখনো সঠিক নয়। পাইপলাইন তৈরি করুন যাতে এটি প্রবেশ করতে না পারে।