২০২৫ সালের অক্টোবরে Deloitte অস্ট্রেলিয়ান সরকারকে অর্থ ফেরত দেয়। প্রতিষ্ঠানটি Department of Employment and Workplace Relations-এর জন্য AU$৪,৪০,০০০-এর একটি পর্যালোচনা সম্পন্ন করেছিল; প্রকাশিত প্রতিবেদনে একটি ফেডারেল আদালতের রায় থেকে বানোয়াট উদ্ধৃতি এবং অস্তিত্বহীন একাডেমিক পেপারের রেফারেন্স ছিল (The Guardian, 2025)। একটি সংশোধিত সংস্করণে প্রকাশ করা হয় যে খসড়া তৈরিতে GPT-4o ব্যবহার করা হয়েছিল। পরবর্তী প্রতিবেদনে ফেরতের পরিমাণ প্রায় AU$৯৭,০০০ বলে জানা যায় — চুক্তির শেষ কিস্তি।
একটি বিষয় অর্থের চেয়ে বেশি গুরুত্বপূর্ণ। বানোয়াট তথ্যগুলো প্রতিষ্ঠানের নিজস্ব পর্যালোচনায় বা ক্লায়েন্টের পর্যালোচনায় ধরা পড়েনি। ধরা পড়েছিল একজন বাইরের একাডেমিকের কাছে, যিনি রেফারেন্সগুলো যাচাই করেছিলেন। ডেলিভারেবলটি যে স্তরের যাচাই-বাছাইয়ের জন্য ডিজাইন করা হয়েছিল, সেগুলো সব পার করে গিয়েছিল — কারণ এতে কিছুই ভুল দেখাচ্ছিল না।
এটাই সেই বিভাগ: যে মডেল ব্যর্থ হয় না, বরং উত্তর দিয়ে ফেরে। একটি ভাষা মডেলকে দুইশো সারি জুড়ে রাজস্ব যোগ করতে বললে আপনি পাবেন সঠিক মাত্রার, সঠিক মুদ্রা চিহ্নের এবং আত্মবিশ্বাসী বাক্যে মোড়া একটি উত্তর। কিন্তু যোগফলটি নির্ভরযোগ্যভাবে পাবেন না। একটি অনুপস্থিত উত্তর ধরা পড়ে। ভালো ভঙ্গিতে আসা একটি ভুল উত্তর বোর্ডে পাঠিয়ে দেওয়া হয়।
এবং ভঙ্গি কখনো ভাঙে না, কারণ আত্মবিশ্বাসটিও উৎপন্ন টেক্সট। মডেল জানে না যে সে ভুল; দমন করার মতো কোনো অভ্যন্তরীণ সংকেত নেই। সংখ্যাটি দাবি করা বাক্য এবং সংখ্যাটি নিজে একই জায়গা থেকে আসে — পরবর্তী সম্ভাব্য টোকেন।
বিশ্বাসযোগ্য মানে গণনা করা নয়
স্বাভাবিক প্রবণতা হলো ভুল সংখ্যাকে মডেলের পরিপক্কতার সমস্যা হিসেবে দেখা: নিশ্চয়ই পরবর্তী সংস্করণ সঠিকভাবে যোগ করবে। গবেষণা বলছে এই ব্যর্থতা কাঠামোগত, এবং কারণ সম্পর্কে এটি অস্বাভাবিকভাবে সামঞ্জস্যপূর্ণ।
GPT-4-কে দুটি তিন-অঙ্কের সংখ্যা গুণ করতে বললে জিরো-শটে ৫৯% সঠিক পাওয়া গেছে; ChatGPT-তে ৫৫% (arXiv, 2023)। চার অঙ্কে GPT-4 নেমে আসে ৩%-এ। পাঁচ অঙ্কে, ০%। Faith and Fate-এর লেখকরা প্রক্রিয়াটি চিহ্নিত করেছেন: ট্রান্সফর্মার কম্পোজিশনাল সমস্যাগুলো সমাধান করে তারা যা দেখেছে তার রৈখিক খণ্ডগুলো মিলিয়ে — প্যাটার্ন অনুসন্ধান, পদ্ধতি নয়। ধস ঠিক সেখানেই শুরু হয় যেখানে প্যাটার্ন শেষ হয়।
যোগও নিরাপদ নয়। ২০২৫ সালের একটি বিশ্লেষণে দেখা গেছে যে LLM-রা অ্যালগরিদমের পরিবর্তে এক-অঙ্কের লুকঅ্যাহেড হিউরিস্টিক দিয়ে যোগ করে: প্রম্পটিং বা টোকেনাইজেশন নির্বিশেষে, ক্যারি এক অঙ্কের বেশি ছড়িয়ে পড়লেই নির্ভুলতা ভেঙে পড়ে, এবং ব্যর্থতাগুলো শুধু ক্যারি কাঠামো থেকেই পূর্বানুমানযোগ্য (arXiv, 2025)। পদ্ধতিগত, এলোমেলো নয়। মডেলটি প্রায়-গণনা করছে না। এটি অন্য কিছু করছে যা প্রায়ই গণনার সাথে মিলে যায়।
Apple-এর GSM-Symbolic শেষ ফাঁকফোকরটি বন্ধ করে দিয়েছে — হয়তো এটি শুধু কঠিন গণিতেই হয় (Apple, 2024)। প্রাথমিক স্তরের শব্দ সমস্যা নিয়ে শুধু সংখ্যা পরিবর্তন করুন: পরীক্ষিত প্রতিটি অত্যাধুনিক মডেলের ফলাফল খারাপ হয়েছে। একটি বিশ্বাসযোগ্য কিন্তু অপ্রাসঙ্গিক বাক্য যোগ করুন: নির্ভুলতা ৬৫% পর্যন্ত কমে যায়। এবং একই প্রশ্ন টেমপ্লেটের নতুন ইনস্ট্যান্সে নির্ভুলতা উল্লেখযোগ্যভাবে পরিবর্তিত হয় — একই সমস্যা, নতুন শব্দে, ভিন্ন বিতরণের উত্তর দেয়। এই শেষ আবিষ্কারটি ডেমোর সমস্যা ব্যাখ্যা করে। একটি ডেমো হলো বিতরণ থেকে একটি ড্র। একটি অডিট হলো বিতরণ।
লেখকদের রায় — "বর্তমান LLM-রা প্রকৃত যৌক্তিক তর্কে সক্ষম নয়" — একটি গবেষণাপত্রের জন্য অস্বাভাবিকভাবে স্পষ্ট। কেউ এটি প্রত্যাহার করেনি।
স্পষ্ট সমাধানগুলো, পরিমাপ করা
এই ব্যর্থতার মুখোমুখি হওয়া প্রতিটি দল একই চারটি সমাধানের দিকে হাত বাড়ায়। প্রতিটি পরিমাপ করা হয়েছে।
রিট্রিভাল। FinanceBench GPT-4-Turbo-কে পাবলিক আর্থিক ফাইলিং সম্পর্কে ১৫০টি প্রশ্ন করেছিল, একটি রিট্রিভাল সিস্টেম নথি সরবরাহ করেছিল। এটি ৮১% প্রশ্নের ভুল উত্তর দিয়েছে বা প্রত্যাখ্যান করেছে (Patronus AI, 2023)। ষোলটি কনফিগারেশন — GPT-4-Turbo, Llama 2, Claude 2, ভেক্টর স্টোর, লং কনটেক্সট — ২,৪০০ ম্যানুয়ালি পর্যালোচনা করা উত্তরে দুর্বলতা দেখিয়েছে, এবং প্রমাণের পৃষ্ঠাগুলো নিখুঁতভাবে সরবরাহ না করা হলে মডেলগুলো সংখ্যা হ্যালুসিনেট করেছে। রিট্রিভাল নথি আনে। মডেল তবুও সংখ্যা ভুল করে।
গ্রাউন্ডিং। BBC ChatGPT, Copilot, Gemini এবং Perplexity-কে তার নিজস্ব নিবন্ধে সরাসরি অ্যাক্সেস দিয়ে সংবাদ সম্পর্কে প্রশ্ন করেছিল। ৫১% উত্তরে উল্লেখযোগ্য সমস্যা ছিল; ৯১%-এ অন্তত কিছু সমস্যা ছিল। BBC কন্টেন্ট উদ্ধৃত করা ১৯% উত্তরে তথ্যগত ত্রুটি ছিল — ভুল বিবৃতি, ভুল সংখ্যা, ভুল তারিখ — এবং BBC নিবন্ধে দায়ী করা ১৩% উদ্ধৃতি পরিবর্তিত বা কখনো বিদ্যমান ছিল না (BBC, 2025)। উৎস হাতে ছিল। সংখ্যা তবুও বাঁকল।
আরও উন্নত মডেল। OpenAI-এর নিজস্ব সিস্টেম কার্ড রিপোর্ট করে যে o3 PersonQA প্রম্পটের ৩৩%-এ এবং o4-mini ৪৮%-এ হ্যালুসিনেট করে — পুরনো o1-এর ১৬%-এর বিপরীতে (OpenAI, 2025)। বিক্রেতার নিজস্ব পরিমাপে, নতুন রিজনিং মডেলগুলো তাদের পূর্বসূরির চেয়ে দুই থেকে তিনগুণ বেশি হ্যালুসিনেট করে। o3 কেবল বেশি দাবি করে — বেশি সঠিক এবং বেশি বানোয়াট, একই তাপমাত্রার নিশ্চয়তায় পরিবেশিত।
উন্নত প্রম্পটিং। ধাপে-ধাপে স্ক্র্যাচপ্যাড প্রম্পটিং GPT-4-এর তিন-অঙ্কের গুণকে ৫৯% থেকে ৯২%-এ নিয়ে যায় (arXiv, 2023)। উন্নত — এবং তবুও বারোটিতে একটি ভুল গুণফল। এমনকি চার-অঙ্কের গুণে GPT-3-কে নিবিড়ভাবে ফাইন-টিউন করেও অদেখা চার-অঙ্কের সমস্যায় প্রায় ৪০% এবং পাঁচ অঙ্কে ০% পাওয়া গেছে। সীমাটি প্রক্রিয়ার, প্রম্পটের নয়।
প্রতিটি সমাধান সম্ভাবনা বাড়ায়। কিন্তু কেউ পরিবর্তন করে না যে গণিতটি কে করছে। উত্তরটি এখনো সম্ভাব্য সংখ্যার বিতরণ থেকে নমুনা করা হয়, এবং সেই বিতরণের ঠিক একটি সদস্যই যোগফল।
গণিতটি কে করবে তা পরিবর্তন করুন
কাঠামোগত উত্তর হলো দক্ষতার রেখা বরাবর শ্রম বিভাজন। ভাষা মডেল ভাষায় অসাধারণ এবং হিসাবে অবিশ্বস্ত, তাই মডেল কখনো গণনাকারী হওয়া উচিত নয়।
SQAI সেই বিভাজনের উপর নির্মিত। মডেল একটি টাইপড ইন্টেন্ট রচনা করে — sum amount where region = "east" — এবং একটি SQAI runtime এটি কম্পাইল করা কোড হিসেবে কার্যকর করে: হ্যাশ-পিন করা চুক্তির বিপরীতে যাচাই করা, নীতির বিপরীতে পরীক্ষা করা, একটি থ্রেডে float64-এ গণনা করা, প্রভেন্যান্সসহ ফেরত দেওয়া।
{
"status": "ok",
"value": 2130.5,
"rows_matched": 5
}
সেই 2130.5 একটি সম্ভাব্য টোকেন নয়। এটি যোগফল, ৪৪৫টি মডিউল জুড়ে ৪,৫৭৪টি রিড-অনলি ক্যাপাবিলিটির পৃষ্ঠ থেকে একটি নির্ধারণবাদী কার্নেল দ্বারা উৎপাদিত — তার মধ্যে ৪,৫৬৪টি সম্পূর্ণ নির্ধারণবাদী — ০.৮৩–০.৯৩ ms ওয়ার্মে উত্তর দেয়।
নির্ধারণবাদী মানে যাচাইযোগ্য। finance.npv(0.1, [-1000, 300, 420, 560, 680]) কম্পিউটেশন হ্যাশ b74f67d0…-এর অধীনে 505.020148896933 ফেরত দেয় — TypeScript বা Python থেকে কল করা হোক না কেন একই মান এবং একই হ্যাশ, কারণ ফলাফলগুলো একটি ক্যানোনিকাল JSON ফর্মে হ্যাশ করা হয়। দাবিটি সৎভাবে সীমাবদ্ধ: ঘোষিত এক্সিকিউশন স্কোপের মধ্যে নির্ধারণবাদী, রানটাইম সংস্করণ, প্ল্যাটফর্ম, প্রিসিশন মোড এবং থ্রেড কাউন্ট রেকর্ড করা একটি এনভেলপ সহ — অতিরিক্ত দাবি না করে। একই প্রম্পটে একটি মডেলের উত্তর পরের রানে নিজের সাথে মিলবে বলে প্রতিশ্রুতি দিতে পারে না। এটি মাসের পর মাস পরে, যেকোনো ভাষায়, বাইট-অভিন্নভাবে রিপ্লে করে।
একটি দ্বিতীয় ফাঁক আছে, এবং বেশিরভাগ স্ট্যাক এটি খোলা রাখে। একটি কম্পিউট ইঞ্জিন সংযুক্ত করুন, তারপর "সারসংক্ষেপের জন্য" কাঁচা কোয়েরি সারিগুলো কনটেক্সটে ঢেলে দিন — এবং মডেল নিঃশব্দে সারি থেকে সংখ্যা পুনরায় উদ্ভূত করে এবং পুনরায় উদ্ভাবন করে। SQAI কনটেক্সটকে একটি পরিচালিত সীমানা হিসেবে বিবেচনা করে: সর্বোচ্চ ২৫ সারি, ২৫০ সেল এবং ৩২,০০০ বাইট মডেলে পৌঁছায়, ১০০ সারির ডিফল্ট সীমা এবং ১,০০০-এর হার্ড এক্সিকিউশন সিলিং সহ। ট্রাংকেশন সর্বদা ঘোষিত হয়, তাই মডেল সৎভাবে দাবি করতে পারে না যে সে যা দেখেছে তা যোগ করেছে। আংশিক সারি কখনো দেখানো হয় না, তাই কোনো অর্ধ-রেকর্ড কল্পনা থেকে সম্পূর্ণ করতে প্রলুব্ধ করে না। অ্যাগ্রিগেটগুলো সীমানার আগে গণনা করা হয়। মডেল উত্তর পায়, হোমওয়ার্ক নয়।
এবং নীতিটি একটি প্রম্পট নয়। অনুমোদিত উৎস, ফিল্ড এবং ফাংশনগুলো createSQAI() সময়ে কোডে স্থির করা হয় এবং এক্সিকিউশনের আগে ইন-প্রসেসে পরীক্ষা করা হয়; মডেলের টুল ইনপুটে কোনো নীতি ফিল্ড নেই, তাই এটি প্রসারিত করার কিছু নেই। নীতির বাইরে একটি ক্যাপাবিলিটি চাওয়া সৃজনশীল সমাধান তৈরি করে না — এটি policy_denied_function তৈরি করে। যুক্তিটি এজেন্টদের SQL লিখতে না দেওয়ার পেছনের যুক্তির মতোই: উৎপন্ন টেক্সটকে সর্বোত্তম-প্রচেষ্টার নির্দেশনা দিয়ে পরিচালনা করবেন না; এক্সিকিউশনকে অ্যালো-লিস্ট দিয়ে পরিচালনা করুন যা টেক্সট স্পর্শ করতে পারে না।
গণিতটি কে করেছে?
পরের বার যখন একটি AI সিস্টেম আপনাকে একটি রাজস্ব সংখ্যা দেবে, একটি প্রশ্ন বাজারের প্রতিটি আর্কিটেকচার বাছাই করে: গণিতটি কে করেছে?
যদি উত্তর হয় "মডেল," আপনার কাছে চমৎকার ভঙ্গির এবং অজানা উৎসের একটি সংখ্যা আছে, এবং একমাত্র যাচাইয়ের পথ হলো একজন মানুষ কাজটি পুনরায় করা — যে জিনিসটি আপনি স্বয়ংক্রিয় করার চেষ্টা করছিলেন। Deloitte-এর বানোয়াট তথ্য ধরা পড়েছিল কারণ প্রক্রিয়ার বাইরের একজন একাডেমিক যাচাই করার সিদ্ধান্ত নিয়েছিলেন। এটি একটি নিয়ন্ত্রণ নয়। এটি ভাগ্য।
যদি উত্তর হয় "একটি SQAI runtime, এবং এখানে হ্যাশ আছে," যাচাই হলো একটি রিপ্লে: একই ইন্টেন্ট, একই রানটাইম, একই বাইট। ব্যর্থতা আরও সূক্ষ্ম — এবং আরও নীরব — হয়ে যায় যখন ভুল সংখ্যা ভুল যোগের পরিবর্তে একটি ফ্যান-আউট জয়েন থেকে আসে, যা নিজেই আলাদা একটি গল্প। কিন্তু নীতিটি একটি বাক্যে ধরা যায়: মডেল প্রশ্ন লেখে, কখনো উত্তর নয়।
ভুল রাজস্ব সংখ্যা নিজেকে ঘোষণা করে না। এটি ফরম্যাট করা, উদ্ধৃত এবং আত্মবিশ্বাসী হয়ে আসে — এবং পাঁচ অঙ্কের গুণে, কখনো সঠিক নয়। পাইপলাইন তৈরি করুন যাতে এটি প্রবেশ করতে না পারে।