No. 003الحتمية7 د قراءة

رقم الإيرادات الخاطئ بثقة: لماذا لا تُحسب نماذج اللغة الكبيرة

يُسلّمك النموذج رقم إيرادات بهيئة مثالية ولا حساب خلفه. تقول الأبحاث إن الإخفاق بنيوي — وكذلك الحل.

في أكتوبر 2025، أعادت شركة Deloitte أموالًا إلى الحكومة الأسترالية. كانت الشركة قد سلّمت مراجعةً بقيمة 440,000 دولار أسترالي إلى وزارة العمل وعلاقات مكان العمل؛ احتوى التقرير المنشور على اقتباس مختلق من حكم قضائي فيدرالي وإشارات إلى أوراق أكاديمية غير موجودة (The Guardian, 2025). كشفت نسخة معدّلة أن GPT-4o استُخدم في الصياغة. وأشارت تقارير لاحقة إلى أن المبلغ المُستردّ بلغ نحو 97,000 دولار أسترالي — الدفعة الأخيرة من العقد.

ثمة تفصيل أهم من المال. لم تكتشف الشركة المختلقات في مراجعتها، ولا اكتشفها العميل في مراجعته. اكتشفها أكاديمي خارجي تحقّق من المراجع. اجتاز التسليم كل طبقات التدقيق المصمَّمة له، لأن شيئًا فيه لم يبدُ خاطئًا.

هذه هي الفئة: ليس النموذج الذي يُخفق، بل النموذج الذي يُعيد. اطلب من نموذج لغوي جمع الإيرادات عبر مئتي صف وستحصل على إجابة بالحجم الصحيح ورمز العملة الصحيح وجملة واثقة حولها. ما لن تحصل عليه بشكل موثوق هو المجموع. الإجابة الغائبة تُكتشف. الإجابة الخاطئة ذات الهيئة الجيدة تُحال إلى مجلس الإدارة.

والهيئة لا تنكسر أبدًا، لأن الثقة هي أيضًا نص مُولَّد. النموذج لا يعلم أنه مخطئ؛ لا يوجد إنذار داخلي يكبته. الجملة التي تؤكد الرقم والرقم نفسه يأتيان من المكان ذاته — الرمز التالي الأكثر احتمالًا.

المعقول ليس محسوبًا

الغريزة تدفع إلى تصنيف الأرقام الخاطئة تحت نضج النموذج: بالتأكيد الإصدار التالي يجمع بشكل صحيح. تقول الأبحاث إن الإخفاق بنيوي، وهي متسقة بشكل غير معتاد في تفسير السبب.

GPT-4، حين طُلب منه ضرب عددين من ثلاثة أرقام، أصاب في 59% من الحالات بدون توجيه؛ وChatGPT في 55% (arXiv, 2023). عند أربعة أرقام، انخفض GPT-4 إلى 3%. وعند خمسة، 0%. تتبّع مؤلفو Faith and Fate الآلية: تعالج المحوّلات المسائل التركيبية بمطابقة أجزاء خطية مما رأته — بحث عن أنماط، لا إجراء. يقع الانهيار تمامًا حيث تنتهي الأنماط.

الجمع ليس أكثر أمانًا. وجد تحليل عام 2025 أن نماذج اللغة الكبيرة تجمع باستخدام إرشادية نظرة مسبقة بمقدار رقم واحد بدلًا من خوارزمية: تنهار الدقة تمامًا حيث تتتالى الحملات بعد رقم واحد، بصرف النظر عن التوجيه أو الترميز، والإخفاقات قابلة للتنبؤ من بنية الحمل وحدها (arXiv, 2025). منهجي، لا عشوائي. النموذج لا يكاد يحسب. إنه يفعل شيئًا آخر كثيرًا ما يتفق مع الحساب.

أغلق GSM-Symbolic من Apple الثغرة المتبقية — ربما يقتصر هذا على الحساب الصعب (Apple, 2024). خذ مسائل كلامية من المرحلة الابتدائية وغيّر الأرقام فحسب: كل نموذج متطور اختُبر أدّى أسوأ. أضف جملة واحدة معقولة الصياغة لكنها غير ذات صلة: انخفضت الدقة بنسبة تصل إلى 65%. وتفاوتت الدقة بشكل ملحوظ عبر تجسيدات جديدة لقالب السؤال ذاته — المسألة نفسها، بصياغة مختلفة، تُعيد توزيعًا مختلفًا من الإجابات. هذه النتيجة الأخيرة تفسّر مشكلة العرض التوضيحي. العرض التوضيحي سحبة واحدة من التوزيع. التدقيق هو التوزيع.

حكم المؤلفين — "نماذج اللغة الكبيرة الحالية غير قادرة على الاستدلال المنطقي الحقيقي" — صريح بشكل غير معتاد لورقة بحثية. لم يتراجع عنه أحد.

100 50 0 accuracy, % zero-shot scratchpad 59 92 3×3-digit 4 4×4-digit 0 5×5-digit
دقة GPT-4 في ضرب n رقم × n رقم، بدون توجيه مقابل خطوة بخطوة. Faith and Fate، NeurIPS 2023.

الحلول الواضحة، مقيسةً

كل فريق يواجه هذا الإخفاق يلجأ إلى الحلول الأربعة ذاتها. وقد قِيس كل منها.

الاسترجاع. طرح FinanceBench على GPT-4-Turbo 150 سؤالًا حول الإيداعات المالية العامة، مع نظام استرجاع يُمدّه بالوثائق. أجاب بشكل خاطئ أو رفض الإجابة في 81% منها (Patronus AI, 2023). كشفت ستة عشر تكوينًا — GPT-4-Turbo وLlama 2 وClaude 2 ومخازن المتجهات والسياق الطويل — عن نقاط ضعف عبر 2,400 إجابة راجعها بشر، وهلوست النماذج بأرقام كلما لم تُمدَّ بصفحات الأدلة بشكل مثالي. الاسترجاع يجلب الوثيقة. النموذج لا يزال يُخطئ في الرقم.

التأريض. منحت BBC نماذج ChatGPT وCopilot وGemini وPerplexity وصولًا مباشرًا إلى مقالاتها وسألتها عن الأخبار. 51% من الإجابات فيها مشكلات جوهرية؛ 91% فيها مشكلات على الأقل. 19% من الإجابات التي استشهدت بمحتوى BBC أدخلت أخطاء واقعية — عبارات خاطئة وأرقام خاطئة وتواريخ خاطئة — و13% من الاقتباسات المنسوبة إلى مقالات BBC كانت مُعدَّلة أو غير موجودة أصلًا (BBC, 2025). المصدر كان في متناول اليد. الأرقام انحرفت رغم ذلك.

نموذج أذكى. تُفيد بطاقة النظام الخاصة بـ OpenAI بأن o3 يهلوس في 33% من مطالبات PersonQA وo4-mini في 48% — مقابل 16% للنموذج الأقدم o1 (OpenAI, 2025). وفق قياس المورّد نفسه، تهلوس نماذج الاستدلال الأحدث بمعدل ضعفين إلى ثلاثة أضعاف سابقتها. o3 يُصدر ادعاءات أكثر فحسب — صحيحة أكثر ومختلقة أكثر، بالدرجة ذاتها من اليقين.

توجيه أفضل. يرفع التوجيه خطوة بخطوة دقة GPT-4 في ضرب ثلاثة أرقام من 59% إلى 92% (arXiv, 2023). أفضل — ومع ذلك ناتج خاطئ واحد من كل اثني عشر. حتى الضبط الدقيق المكثّف لـ GPT-3 على ضرب أربعة أرقام أنتج نحو 40% على مسائل أربعة أرقام غير مرئية، و0% عند خمسة أرقام. السقف هو الآلية، لا التوجيه.

كل حل يُحسّن الاحتمالات. لا أحد منها يُغيّر من يُجري الحساب. الإجابة لا تزال مُستقاة من توزيع أرقام معقولة، وعضو واحد فقط من ذلك التوزيع هو المجموع.

0 50 100 % RETRIEVAL · FINANCEBENCH 2023 wrong or refused 81% GROUNDING · BBC 2025 significant issues 51% factual errors introduced 19% REASONING · PERSONQA, OPENAI 2025 o1 (predecessor) 16% o3 33% o4-mini 48%
معدلات الإخفاق بعد الحل. FinanceBench 2023 · BBC 2025 · OpenAI o3 / o4-mini system card 2025.

غيّر من يُجري الحساب

الإجابة البنيوية هي تقسيم عمل مرسوم بدقة على خط الكفاءة. نماذج اللغة بارعة في اللغة وغير موثوقة في الأرقام، لذا يجب ألا يكون النموذج هو من يحسب.

SQAI مبني على هذا الفصل. يُؤلّف النموذج نيةً مكتوبة — sum amount where region = "east" — ويُنفّذها SQAI runtime كرمز مُصرَّف: مُتحقَّق منه مقابل عقد مثبَّت بالتجزئة، مُفحوص مقابل السياسة، محسوب بـ float64 على خيط واحد، مُعاد مع سند الإثبات.

{
  "status": "ok",
  "value": 2130.5,
  "rows_matched": 5
}

هذا الـ 2130.5 ليس رمزًا محتملًا. إنه المجموع، مُنتَج بواسطة نواة حتمية من سطح مؤلَّف من 4,574 قدرة للقراءة فقط عبر 445 وحدة — 4,564 منها حتمية بالكامل — تُجيب في 0.83–0.93 مللي ثانية دافئًا.

الحتمي يعني قابلًا للتحقق. finance.npv(0.1, [-1000, 300, 420, 560, 680]) يُعيد 505.020148896933 تحت تجزئة الحساب b74f67d0… — القيمة ذاتها والتجزئة ذاتها سواء أُجري الاستدعاء من TypeScript أو Python، لأن النتائج تُجزَّأ على شكل JSON قانوني واحد. الادعاء محدود بأمانة: حتمي ضمن نطاق التنفيذ المُعلَن، مع غلاف يُسجّل إصدار وقت التشغيل والمنصة ووضع الدقة وعدد الخيوط بدلًا من الادعاء المبالغ فيه. إجابة النموذج على المطالبة ذاتها لا تستطيع أن تعد بمطابقة نفسها في التشغيل التالي. هذه تُعاد بايت بايت، بعد أشهر، في أي من اللغتين.

ثمة تسرّب ثانٍ، وأغلب الأنظمة تتركه مفتوحًا. أرفق محرك حساب، ثم صبّ صفوف الاستعلام الخام في السياق "للتلخيص" — وسيُعيد النموذج بهدوء اشتقاق الأرقام واختراعها من الصفوف. يعامل SQAI السياق كـ حدود محكومة: لا يصل إلى النموذج أكثر من 25 صفًا و250 خلية و32,000 بايت، خلف حد افتراضي قدره 100 صف وسقف تنفيذ صارم قدره 1,000. الاقتطاع مُعلَن دائمًا، فلا يستطيع النموذج بصدق أن يدّعي أنه جمع ما رآه. الصفوف الجزئية لا تُعرض أبدًا، فلا يُغريه نصف سجل على الإكمال من الخيال. التجميعات تُحسب قبل الحد. النموذج يتلقى الإجابة، لا الواجب المنزلي.

والسياسة ليست توجيهًا. المصادر والحقول والدوال المسموح بها مُثبَّتة في الرمز عند createSQAI() ومُفحوصة داخل العملية قبل التنفيذ؛ مدخل أداة النموذج لا يحمل حقول سياسة على الإطلاق، فلا شيء يمكنه توسيعه. طلب قدرة خارج السياسة لا يُنتج حلًا إبداعيًا — يُنتج policy_denied_function. الحجة هي ذاتها الداعية إلى عدم السماح للوكلاء بكتابة SQL: لا تحكم النص المُولَّد بتعليمات بالغة الجهد؛ احكم التنفيذ بقوائم سماح لا يستطيع النص لمسها.

GOVERNED BOUNDARY MODEL language in, language out sum(amount) · region = "east" typed intent — never a SQL string ENGINE contract → policy → execute float64 · 1 thread · sub-ms warm value 2130.5 · rows 5 plan_hash f87610d8afeb… byte-identical replay · TS ≡ PY answer, not rows ≤ 25 rows · ≤ 250 cells · ≤ 32,000 B truncation always declared
تقسيم العمل: النموذج يُؤلّف نيةً مكتوبة؛ نواة float64 تحسب؛ حدود الصفوف تُبقي البيانات الخام خارج السياق.

من أجرى الحساب؟

في المرة القادمة التي يُسلّمك فيها نظام ذكاء اصطناعي رقم إيرادات، سؤال واحد يُصنّف كل بنية في السوق: من أجرى الحساب؟

إن كانت الإجابة "النموذج"، فأنت تحمل رقمًا بهيئة ممتازة ومصدر مجهول، والمسار الوحيد للتحقق هو إعادة الإنسان للعمل — الشيء الذي كنت تسعى إلى أتمتته. اكتُشفت مختلقات Deloitte لأن أكاديميًا خارج العملية قرر التحقق. هذا ليس ضبطًا. هذا حظ.

إن كانت الإجابة "SQAI runtime، وهذه هي التجزئة"، فالتحقق هو إعادة التشغيل: النية ذاتها، وقت التشغيل ذاته، البايتات ذاتها. يصبح الإخفاق أدق — وأهدأ — حين يأتي الرقم الخاطئ من ربط متشعّب لا من جمع خاطئ، وهذه قصة أخرى. لكن الانضباط يتسع لجملة واحدة: النموذج يكتب السؤال، لا الإجابة.

رقم الإيرادات الخاطئ لا يُعلن عن نفسه. يصل منسَّقًا، مُستشهَدًا به، واثقًا — وعند خمسة أرقام من الضرب، لا يكون صحيحًا أبدًا. ابنِ المسار بحيث لا يستطيع الدخول.