Back to blog

GPT-5.5 Codex is cutting its own thinking short at 516 tokens

A GitHub analysis of 390k Codex responses finds GPT-5.5 disproportionately ends reasoning at exactly 516/1034/1552 tokens. Here's why that happens and what to do about it.

What the analysis found

On June 27, 2026, a developer filed issue #30364 on OpenAI's Codex repository. It trended on Hacker News because it offered the first hard numbers explaining why a frontier model sometimes behaves dumb.

The author collected 390,000 Codex responses and plotted how often the model ended reasoning at each token count. The result was striking: there are sharp spikes at exactly 516, 1034, and 1552 tokens — fixed cutoffs, not random.

About 44% of GPT-5.5 responses that reach 516 tokens end there, versus just 0.34% for GPT-5.2. In February, the same clustering stood at only 0.11%. So this is getting worse over time, not better.

Why this matters

Reasoning models work in two phases: thinking, then answering. If the model is cut off mid-thought at a fixed token limit, it skips the rest of its analysis. On easy tasks you never notice. On hard tasks — complex code, legal review, multi-variable decisions — those skipped steps become real errors.

The model isn't dumber. It's being stopped early.

Thresholds and budgets

A threshold is a hardcoded number where behaviour changes. A budget caps how much reasoning a response can spend. The 516/1034/1552 pattern suggests OpenAI has either lowered the reasoning budget to control compute cost, or there's a real bug cutting thinking short.

Either way, the user pays for it on hard tasks.

How it affects you

On Codex or ChatGPT with GPT-5.5 you may see shallow fixes, summaries that miss key points, or rushed recommendations. Not always — but more than before. The cause isn't the model forgetting, it's the model not finishing its thought.

🔧 Try it yourself

  1. Read the original issue #30364 on GitHub.
  2. Give GPT-5.5 Codex a genuinely complex task (review messy code, refactor a god node).
  3. Watch the reasoning token count — does it stop at 516 or 1034?
  4. Split the big task into smaller steps so each one gets a full reasoning budget.

Takeaway

GPT-5.5 Codex isn't dumber — it's throttled. The numbers don't lie: the model stops at fixed limits, and those stops hurt the hardest tasks most. Next time an answer feels shallow, ask: did the model not know, or did it not finish thinking?

Sources

Arabic version

GPT-5.5 Codex عم يقطع تفكيره ع 516 توكن — وليش بيتصرّف أغبى

تحليل 390 ألف رد من Codex بيلاقي GPT-5.5 كتير بيقف عند أرقام محدّدة من التوكنات. فصّلنا شو يعني هاد وليش ممكن يفسّر ليش حسّيتو صار أغبى.

هلأ صار أسبوع وأنت حاسس إنو GPT-5.5 Codex بيرد أغبى من قبل؟ مو بإمكانياتو، لحسن الحظ. المشكلة إنو هالنموذج الذكي عم يقطع تفكيره قبل ما يخلّص، وع رقمن محدّدة بالضبط. وهاي مش قناعة، هاد تحليل 390 ألف رد منشور ع GitHub.

القصة بلشت يوم 27 حزيران 2026، لما مطوّر فتح issue رقم 30364 ع repo تابع لـ OpenAI اسمو codex. الموضوع تصدّر ع Hacker News، وسبب تصدّر بسيط: هاد أول مرة فينا نشوف بالأرقام ليش نموذج غالي ومتقدّم بيتصرّف غبي أحياناً.

خلّينا نفصّح شو بيصير فعلاً، وليش بيفيدك تعرفو حتى لو ما بتبرمج.

شو اللي اكتشفوه بالأرقام

المطوّر جمع 390 ألف رد من GPT-5.5 Codex، وبعدين رسم كم مرة النموذج بيقف عند كل رقم توكن من سلسلة الاستدلال (reasoning tokens). النتيجة كانت صادمة.

عند الرقم 516 بالضبط، في ارتقاء حادّ — يعني النموذج بيقطع تفكيره ع هاد الرقم بشكل غير طبيعي. ونفس الشي صار ع 1034 و1552. يعني في حدود ثابتة عم توقف التفكير، مش عشوائي.

الأرقام بتنحكي واضحة: عند GPT-5.5، حوالي 44% من الردود اللي وصلت 516 توكن أو أكتر بتنقطع عند هاد الرقم تحديداً. بالمقابل، GPT-5.2 (الإصدار السابق) الرقم عندو كان بس 0.34%. الفرق هائل — يعني GPT-5.2 كان عم يفكّر بشكل طبيعي لحد ما يخلّص، أما GPT-5.5 فكتير بيقف عند نفس النقطة.

وكمان في تطوّر بالوقت. بشهر شباط (فبراير)، هاد التجمّع ع 516 كان 0.11% بس. هلأ صار أعلى بكثير. يعني المشكلة مو قديمة — هي عم تكبر.

ليش هاد مشكلة حقيقية

لاول وهلة ممكن تقول: "طيب شو يعني؟ فيو يقطع تفكيرو، المهم الجواب النهائي". بس الفكرة عميقة أكتر.

النماذج المتقدّمة متل GPT-5.5 بتشتغل بطريقتين:

  1. تفكير (reasoning): النموذج بيحلّل المشكلة خطوة خطوة لحاله قبل ما يجاوب. هاد الشي يلي بياخد وقت، وبالتالي بياكل توكنات.
  2. جواب (answer): بعد ما يخلّص تفكير، بيطلّع النتيجة النهائية.

المشكلة إنو إذا النموذج بيقطع تفكيرو ع رقم ثابت، معناه إنو ما عم يحلّل كل الخطوات لآخرها. ببساطة، وصل ع حدّ معيّن وقال "خلص، طلّع جواب". ع المهام السهلة، ما رح تلاحظ فرق. بس ع المهام الصعبة — مشكلة برمجة معقّدة، تحليل قانوني طويل، قرار بيدخل فيه متغيّرات كثيرة — هاد البيقطاع بيسبّب أخطاء ما كانت لازم تصير.

يعني ممكن يكون عندك إحساس "النموذج صار غبي"، والواقع إنو نفس النموذج عم يفكّر نص وقت اللي كان بيفكّر في قبل. ما خرب، بس **انقطع".

شو يعني "threshold" و"budget" بالـ AI

هون لازم نوضّح مصطلحين لأنهم مفتاح فهم المشكلة:

Threshold (عتبة): رقم محدّد برمجياً بيفصل بين حالتين. متل إنو تقول "إذا وصلت 100 كلمة، وقّف". الـ 516 و1034 و1552 هي thresholds — يعني OpenAI حطّت هاد الأرقام بالنظام، والنموذج بيتوقّف عندها.

Budget (ميزانية): كل تكلفة بتفكير. كل توكن استدلال = تكلفة حسابية. الشركات بتحطّ "ميزانية تفكير" لكل رد لتتحكّم بالتكلفة. من غير ما تقول للمستخدم، بتاخد قرار: "هاد الرد ما في يستاهل أكتر من 516 توكن تفكير".

يعني لما GPT-5.5 يقف عند 516 بشكل متكرّر، في احتمالين:

  • إمّا OpenAI عم تحطّ حدود أوطأ ع ميزانية التفكير لتوفّر تكلفة الخوادم.
  • أو في bug حقيقي بالنظام عم يقطع التفكير بطريقة غلط.

بالطبقتين، النتيجة ع المستخدم نفسها: جواب أسوأ ع المهام الصعبة.

كيف بتتأثّر فيك أنت

إذا بتستخدم Codex (نسخة OpenAI للبرمجة) أو حتى GPT-5.5 بحساب ChatGPT، فيك تشوف هاد الشي بحياتك اليومية:

  • بالكود: بتطلب منو يصلح bug معقّد، وبيطلعلك حلّ نصّ نص — يعمل تعديل بس ما بيشوف السبب الجذري.
  • بالتحليل: بتعطيه تقرير طويل وتطلب منو يلخّص، وبيطلع لك تلخيص سطحي فاتو تفاصيل مهمة.
  • بالقرارات: بتسألو "أي خيار أحسن: A ولا B؟"، وبيجاووب بسرعة بدون ما يزن كل الجوانب.

مو دايماً. بس أكتر من قبل. والسبب مو إنو النموذج نسي، إنو **ما خلّص يفكّر".

ليش OpenAI ممكن تكون عاملة هيك

قبل ما نحكم، في سبب منطقي لحدود التفكير. التفكير بالـ AI مكلف كتير — كل ثانية تفكير بياكل طاقة خوادم وتكلّف OpenAI فلوس. إذا خلّوا كل رد يفكّر لحد آخره، التكلفة بتطلع، والسرعة بتنزل، والمستخدم العادي رح يتذمّر إنو الجواب بياخذ دقيقة.

فتحطّ threshold متل 516 = حل وسط. سريع كفاية، رخيص كفاية، و"بالغالب" كافي. المشكلة إنو هاد الحل الوسط بيضرّ بحالات الاستخدام الصعبة، وهي بالضبط الحالات اللي بدفع الناس تنتقل من الـ chatbot المجاني للاشتراك المدفوع.

يعني في تناقض: الناس اللي بتدفع أكتر، هي اللي بتحتاج تفكير أعمق، وهي اللي بتتأذى أكتر من هاد الحدّ.

🔧 كيف تجرّبها هلّق

إذا بدّك تتأكّد بنفسك إنو المشكلة موجودة، فيك تعمل تجربة بسيطة:

  1. افتح issue 30364 ع GitHub واقرأ التحليل الأصلي بنفسك.
  2. ع GPT-5.5 Codex أو ChatGPT، اعطيه مهمة برمجية معقّدة (متل: "راجع هاد الكود وليّن المشاكل المنطقية واقترح بنية أحسن").
  3. بعدها، شوف عدد توكنات التفكير (بالنسخة المدفوعة بتشوفها بـ "Show reasoning"). شوف إذا النموذج بيقف عند 516 أو 1034 بدل ما يكمّل.
  4. جرّب نفس المهمة ع GPT-5.2 إذا عندك وصول، وقارن العمق.

إذا لاحظت إنو GPT-5.5 بيعطي جواب سطحي ع مهام صعبة، فهمت ليش — مش غباء، هاد حدّ مبرمج. الحل العملي: قسّم المهمة الكبيرة لخطوات صغيرة، لأنو كل خطية لحالها رح تاخد ميزانية كاملة من التفكير.

الخلاصة

GPT-5.5 Codex ما صار غبي. صار مقيّد. والفرق بين الاثنين مهم: الغباء مشكلة بالنموذج، التقييد قرار بالـ OpenAI.

تحليل 390 ألف رد ما بيكذب. الأرقام واضحة: النموذج بيتوقّف ع حدود ثابتة، وهاد التوقّف بيأثّر ع المهام الصعبة. إذا حسّيت إنو الذكاء الاصطناعي صار أقل ذكاءً بشهر، مو خيالك. هو فعلاً بيتفكّر أقل.

المرة الجاية لما تحسّ بجواب سطحي، سأل حالك: هل النموذج ما عرف، ولا ما خلّص يفكّر؟

Back to all articles