Back to blog

GPT-5.5 Codex cuts its own thinking short — proof inside

A new telemetry analysis of 390k Codex replies shows GPT-5.5 stops reasoning at the same token counts over and over. If your tasks feel dumber, this is probably why.

What the data shows

A long GitHub thread analyzed 390 thousand Codex replies and found something weird: GPT-5.5 disproportionately stops its reasoning at exactly 516 tokens. Not 514, not 518. Exactly 516. And again at 1034. And again at 1552.

The clustering went from 0.11% in February to a much higher share today. The pattern looks like the model is hitting an internal reasoning budget and cutting its own thinking short, right at the boundary.

Why this matters for everyday use

If you use GPT-5.5 Codex for real coding work — refactoring, debugging a tangled file, writing tests — and you feel like it gets stuck or gives a half-baked answer, the model is not just lazy. The telemetry suggests it literally stops thinking at a fixed point, even when the task isn't done.

This shows up most on hard multi-step problems where the model needs to chain several ideas together. On simple one-shot questions you won't notice anything.

The good news: you can work around it

A few small habits help a lot:

  • Break the task into smaller pieces. Ask for plan first, then code. Don't dump a giant prompt.
  • Tell the model to keep going. A simple "continue" or "keep going, you stopped early" often gets the missing piece.
  • For genuinely hard refactors, switch to a model that doesn't have the same cap. The community is testing alternatives right now.

⚡ Try it yourself

Open your Codex or ChatGPT coding task. Send a long, messy prompt and watch the response. If it ends abruptly on a clean sentence, you may have hit the 516-token wall. Reply with "keep going" and see if a second chunk arrives. That's the same behavior the telemetry is measuring.

📚 Sources

  1. GitHub issue with full telemetry — openai/codex#30364
  2. Hacker News discussion thread

Sources

Arabic version

GPT-5.5 Codex عم يقطع تفكيره بنفسه — وهاد الدليل

تحليل جديد لـ 390 ألف رد بـ Codex بيبيّن إنو GPT-5.5 عم يوقف استدلالو عند نفس أرقام التوكنات. إذا حسّيتو إنو عم يعطي نتائج أضعف، هاد غالباً السبب.

شو بيبيّن البحث

تحليل طويل نزل ع GitHub يوم 4 تموز، فحص 390 ألف رد من Codex ولاحظ شي غريب: GPT-5.5 بيوقف استدلالو عند 516 توكن بالضبط. لا 514 ولا 518. بالضبط 516. وبيعيد نفس الشي عند 1034. وكمان عند 1552. الناس عم تحكي عن الموضوع ع Hacker News وهو متصدر ع الصفحة الرئيسية.

الرقم 44% من ردود GPT-5.5 يلي وصلت أو تجاوزت 516 توكن بيوقّف تفكيره عند 516. بالمقابل، GPT-5.2 (النسخة الأقدم) بيوقّف عند نفس الرقم بـ 0.34% بس من ردوده. يعني الفرق ضخم. ببلش شهر 2، النسبة كانت 0.11%. هلأ طلعوا بشكل ملحوظ.

كل شي بيشير إنو النموذج عم يوصل لـ"ميزانية استدلال" داخلية، وبيقطع تفكيره عند الحد، حتى لو المهمة ما خلصت. متل طالب يلازم يسلّم ورقته حتى لو ما خلص — بيقطع من نص الجملة.

ليش هاد بيهمك إنت

إذا بتستخدم GPT-5.5 Codex بشغل برمجة حقيقي — إعادة هيكلة، ديباغ لملف معقّد، كتابة اختبارات — وحسّيت إنو عم يعلق أو بيدّيك إجابة ناقصة، النموذج مو بس كسلان. التيليمتري بيقول إنو حرفياً بيوقف التفكير عند نقطة ثابتة، حتى لو المهمة لسا ما خلصت.

الشي بيبيّن أكتر ع المشاكل الصعبة يلي بتحتاج النموذج يربط عدة أفكار ورا بعض. ع الأسئلة البسيطة يلي جوابها بجملة وحدة، ما رح تلاحظ شي. بس لمّا تطلب إعادة هيكلة ملف 500 سطر، أو حل خطأ منطقي بسلسلة استدلالات، ممكن يطلعلك جواب ناقص أو منقطع من نص السياق.

شو يعني هاد لغير المبرمجين

حتى لو ما بتستخدم Codex أصلاً، القصة أهم مما تتصوّر. السبب: نفس النماذج (GPT-5.5 وعيلة) عم تُستخدم خلف الكواليس بأدوات كتير بتشوفها كل يوم — من ملحقات المتصفح لـمساعدات البريد لـمساعدات الجداول. إذا هي عندها"حدود تفكير" خفية، هاد ممكن يأثر على جودة كل شي بيوصلّك من خلال هالأدوات.

كمان، النقطة الأعمق: الشركات صارت تحط قيود تكلفة بالسر ع النماذج. إذا شركة بتدفع للنموذج يفكّر طويل، بتفضّل تقصّر. بس القصير بيطلعلك نتائج أقصر. يعني في تضارب مصالح ما بتشوفه.

الحل: في عادات صغيرة بتفرق كتير

في كم عادة بسيطة بتساعد كتير:

  • قسّم المهمة لقطع صغيرة. اطلب خطة أول، وبعدين الكود. لا ترمي برومبت ضخم دفعة وحدة فيه 5 أسئلة متداخلة. كل ما خلّيت النموذج يركّز ع شي واحد، قلّ احتمال يوصل للحد.
  • قول للنموذج يكمل. جملة بسيطة متل "كمّل" أو "كمّل، وقفت بدري" كتير بتجيب القطعة الناقصة. النموذج رح يكمل من وين وقف بالضبط.
  • لمهام إعادة الهيكلة الصعبة فعلاً، بدّل لنموذج ما عندو نفس الحد. المجتمع عم يختبر نماذج بديلة هلأ، وفي مؤشرات إنو الإصدارات الأقدم من نفس العائلة ما عندها هالقيد.
  • انتبه للبرومبت. إذا حسّيت إنو ردّ النموذج قصير بشكل غريب، ممكن يكون قطع ع 516. جرّب تطلب منو يفصّل أكتر أو يشرحلك شو عمل.

متل ما حسّيت، هلأ في إثبات

اللي حلو بالقصة إنو الموضوع مو تخمين. في أرقام حقيقية من 390 ألف رد، وتراكمت مع بعض، والنمط واضح لدرجة إنو أي حدا عم يحلّل البيانات بيقدر يشوفو. ما في حدا بيقول "حسّيت كذا" — في ملف JSON ع GitHub بيقول "شوف 516 ظهرت X مرة و516+1 ظهرت Y مرة، والفرق 44 ضعط".

هاد النوع من البقّات (إذا صح إنو بقّ) بيصير أكتر كل ما النماذج صارت "أذكى". لمّا تضيف استدلال معقّد (chain-of-thought)، النموذج بيقرّر بنفسه قديش يفكّر. إذا في سقف مخفي، بيقطع بدون ما يعلمك.

🔧 كيف تجرّبها هلّق

افتح مهمة Codex أو ChatGPT برمجية عندك. ابعث برومبت طويل ومعقّد وراقب الرد. إذا خلص فجأة ع جملة نظيفة، وحسّيت إنو ما كمّل كل اللي طلبتو، ممكن تكون وصلت لجدار الـ 516 توكن.

ردّ عليه بـ"كمّل" وشوف إذا عم يوصل جزء ثاني. هاد نفس السلوك يلي التيليمتري عم تقيسو. إذا وصل جزء ثاني وكمّل منطقته، فقد حسمت.

لمستخدمين أكثر تقدماً: جرّب تقارن بين GPT-5.5 وGPT-5.2 (إذا متاح) ع نفس المهمة الصعبة. الفرق رح يكون ملحوظ ع المهام متعددة الخطوات، وأقل وضوحاً ع البسيطة.

📚 المصادر

  1. قضية GitHub بالتيليمتري الكامل — openai/codex#30364
  2. نقاش Hacker News
Back to all articles