هلأ صار أسبوع وأنت حاسس إنو GPT-5.5 Codex بيرد أغبى من قبل؟ مو بإمكانياتو، لحسن الحظ. المشكلة إنو هالنموذج الذكي عم يقطع تفكيره قبل ما يخلّص، وع رقمن محدّدة بالضبط. وهاي مش قناعة، هاد تحليل 390 ألف رد منشور ع GitHub.
القصة بلشت يوم 27 حزيران 2026، لما مطوّر فتح issue رقم 30364 ع repo تابع لـ OpenAI اسمو codex. الموضوع تصدّر ع Hacker News، وسبب تصدّر بسيط: هاد أول مرة فينا نشوف بالأرقام ليش نموذج غالي ومتقدّم بيتصرّف غبي أحياناً.
خلّينا نفصّح شو بيصير فعلاً، وليش بيفيدك تعرفو حتى لو ما بتبرمج.
شو اللي اكتشفوه بالأرقام
المطوّر جمع 390 ألف رد من GPT-5.5 Codex، وبعدين رسم كم مرة النموذج بيقف عند كل رقم توكن من سلسلة الاستدلال (reasoning tokens). النتيجة كانت صادمة.
عند الرقم 516 بالضبط، في ارتقاء حادّ — يعني النموذج بيقطع تفكيره ع هاد الرقم بشكل غير طبيعي. ونفس الشي صار ع 1034 و1552. يعني في حدود ثابتة عم توقف التفكير، مش عشوائي.
الأرقام بتنحكي واضحة: عند GPT-5.5، حوالي 44% من الردود اللي وصلت 516 توكن أو أكتر بتنقطع عند هاد الرقم تحديداً. بالمقابل، GPT-5.2 (الإصدار السابق) الرقم عندو كان بس 0.34%. الفرق هائل — يعني GPT-5.2 كان عم يفكّر بشكل طبيعي لحد ما يخلّص، أما GPT-5.5 فكتير بيقف عند نفس النقطة.
وكمان في تطوّر بالوقت. بشهر شباط (فبراير)، هاد التجمّع ع 516 كان 0.11% بس. هلأ صار أعلى بكثير. يعني المشكلة مو قديمة — هي عم تكبر.
ليش هاد مشكلة حقيقية
لاول وهلة ممكن تقول: "طيب شو يعني؟ فيو يقطع تفكيرو، المهم الجواب النهائي". بس الفكرة عميقة أكتر.
النماذج المتقدّمة متل GPT-5.5 بتشتغل بطريقتين:
- تفكير (reasoning): النموذج بيحلّل المشكلة خطوة خطوة لحاله قبل ما يجاوب. هاد الشي يلي بياخد وقت، وبالتالي بياكل توكنات.
- جواب (answer): بعد ما يخلّص تفكير، بيطلّع النتيجة النهائية.
المشكلة إنو إذا النموذج بيقطع تفكيرو ع رقم ثابت، معناه إنو ما عم يحلّل كل الخطوات لآخرها. ببساطة، وصل ع حدّ معيّن وقال "خلص، طلّع جواب". ع المهام السهلة، ما رح تلاحظ فرق. بس ع المهام الصعبة — مشكلة برمجة معقّدة، تحليل قانوني طويل، قرار بيدخل فيه متغيّرات كثيرة — هاد البيقطاع بيسبّب أخطاء ما كانت لازم تصير.
يعني ممكن يكون عندك إحساس "النموذج صار غبي"، والواقع إنو نفس النموذج عم يفكّر نص وقت اللي كان بيفكّر في قبل. ما خرب، بس **انقطع".
شو يعني "threshold" و"budget" بالـ AI
هون لازم نوضّح مصطلحين لأنهم مفتاح فهم المشكلة:
Threshold (عتبة): رقم محدّد برمجياً بيفصل بين حالتين. متل إنو تقول "إذا وصلت 100 كلمة، وقّف". الـ 516 و1034 و1552 هي thresholds — يعني OpenAI حطّت هاد الأرقام بالنظام، والنموذج بيتوقّف عندها.
Budget (ميزانية): كل تكلفة بتفكير. كل توكن استدلال = تكلفة حسابية. الشركات بتحطّ "ميزانية تفكير" لكل رد لتتحكّم بالتكلفة. من غير ما تقول للمستخدم، بتاخد قرار: "هاد الرد ما في يستاهل أكتر من 516 توكن تفكير".
يعني لما GPT-5.5 يقف عند 516 بشكل متكرّر، في احتمالين:
- إمّا OpenAI عم تحطّ حدود أوطأ ع ميزانية التفكير لتوفّر تكلفة الخوادم.
- أو في bug حقيقي بالنظام عم يقطع التفكير بطريقة غلط.
بالطبقتين، النتيجة ع المستخدم نفسها: جواب أسوأ ع المهام الصعبة.
كيف بتتأثّر فيك أنت
إذا بتستخدم Codex (نسخة OpenAI للبرمجة) أو حتى GPT-5.5 بحساب ChatGPT، فيك تشوف هاد الشي بحياتك اليومية:
- بالكود: بتطلب منو يصلح bug معقّد، وبيطلعلك حلّ نصّ نص — يعمل تعديل بس ما بيشوف السبب الجذري.
- بالتحليل: بتعطيه تقرير طويل وتطلب منو يلخّص، وبيطلع لك تلخيص سطحي فاتو تفاصيل مهمة.
- بالقرارات: بتسألو "أي خيار أحسن: A ولا B؟"، وبيجاووب بسرعة بدون ما يزن كل الجوانب.
مو دايماً. بس أكتر من قبل. والسبب مو إنو النموذج نسي، إنو **ما خلّص يفكّر".
ليش OpenAI ممكن تكون عاملة هيك
قبل ما نحكم، في سبب منطقي لحدود التفكير. التفكير بالـ AI مكلف كتير — كل ثانية تفكير بياكل طاقة خوادم وتكلّف OpenAI فلوس. إذا خلّوا كل رد يفكّر لحد آخره، التكلفة بتطلع، والسرعة بتنزل، والمستخدم العادي رح يتذمّر إنو الجواب بياخذ دقيقة.
فتحطّ threshold متل 516 = حل وسط. سريع كفاية، رخيص كفاية، و"بالغالب" كافي. المشكلة إنو هاد الحل الوسط بيضرّ بحالات الاستخدام الصعبة، وهي بالضبط الحالات اللي بدفع الناس تنتقل من الـ chatbot المجاني للاشتراك المدفوع.
يعني في تناقض: الناس اللي بتدفع أكتر، هي اللي بتحتاج تفكير أعمق، وهي اللي بتتأذى أكتر من هاد الحدّ.
🔧 كيف تجرّبها هلّق
إذا بدّك تتأكّد بنفسك إنو المشكلة موجودة، فيك تعمل تجربة بسيطة:
- افتح issue 30364 ع GitHub واقرأ التحليل الأصلي بنفسك.
- ع GPT-5.5 Codex أو ChatGPT، اعطيه مهمة برمجية معقّدة (متل: "راجع هاد الكود وليّن المشاكل المنطقية واقترح بنية أحسن").
- بعدها، شوف عدد توكنات التفكير (بالنسخة المدفوعة بتشوفها بـ "Show reasoning"). شوف إذا النموذج بيقف عند 516 أو 1034 بدل ما يكمّل.
- جرّب نفس المهمة ع GPT-5.2 إذا عندك وصول، وقارن العمق.
إذا لاحظت إنو GPT-5.5 بيعطي جواب سطحي ع مهام صعبة، فهمت ليش — مش غباء، هاد حدّ مبرمج. الحل العملي: قسّم المهمة الكبيرة لخطوات صغيرة، لأنو كل خطية لحالها رح تاخد ميزانية كاملة من التفكير.
الخلاصة
GPT-5.5 Codex ما صار غبي. صار مقيّد. والفرق بين الاثنين مهم: الغباء مشكلة بالنموذج، التقييد قرار بالـ OpenAI.
تحليل 390 ألف رد ما بيكذب. الأرقام واضحة: النموذج بيتوقّف ع حدود ثابتة، وهاد التوقّف بيأثّر ع المهام الصعبة. إذا حسّيت إنو الذكاء الاصطناعي صار أقل ذكاءً بشهر، مو خيالك. هو فعلاً بيتفكّر أقل.
المرة الجاية لما تحسّ بجواب سطحي، سأل حالك: هل النموذج ما عرف، ولا ما خلّص يفكّر؟