شو بيبيّن البحث
تحليل طويل نزل ع GitHub يوم 4 تموز، فحص 390 ألف رد من Codex ولاحظ شي غريب: GPT-5.5 بيوقف استدلالو عند 516 توكن بالضبط. لا 514 ولا 518. بالضبط 516. وبيعيد نفس الشي عند 1034. وكمان عند 1552. الناس عم تحكي عن الموضوع ع Hacker News وهو متصدر ع الصفحة الرئيسية.
الرقم 44% من ردود GPT-5.5 يلي وصلت أو تجاوزت 516 توكن بيوقّف تفكيره عند 516. بالمقابل، GPT-5.2 (النسخة الأقدم) بيوقّف عند نفس الرقم بـ 0.34% بس من ردوده. يعني الفرق ضخم. ببلش شهر 2، النسبة كانت 0.11%. هلأ طلعوا بشكل ملحوظ.
كل شي بيشير إنو النموذج عم يوصل لـ"ميزانية استدلال" داخلية، وبيقطع تفكيره عند الحد، حتى لو المهمة ما خلصت. متل طالب يلازم يسلّم ورقته حتى لو ما خلص — بيقطع من نص الجملة.
ليش هاد بيهمك إنت
إذا بتستخدم GPT-5.5 Codex بشغل برمجة حقيقي — إعادة هيكلة، ديباغ لملف معقّد، كتابة اختبارات — وحسّيت إنو عم يعلق أو بيدّيك إجابة ناقصة، النموذج مو بس كسلان. التيليمتري بيقول إنو حرفياً بيوقف التفكير عند نقطة ثابتة، حتى لو المهمة لسا ما خلصت.
الشي بيبيّن أكتر ع المشاكل الصعبة يلي بتحتاج النموذج يربط عدة أفكار ورا بعض. ع الأسئلة البسيطة يلي جوابها بجملة وحدة، ما رح تلاحظ شي. بس لمّا تطلب إعادة هيكلة ملف 500 سطر، أو حل خطأ منطقي بسلسلة استدلالات، ممكن يطلعلك جواب ناقص أو منقطع من نص السياق.
شو يعني هاد لغير المبرمجين
حتى لو ما بتستخدم Codex أصلاً، القصة أهم مما تتصوّر. السبب: نفس النماذج (GPT-5.5 وعيلة) عم تُستخدم خلف الكواليس بأدوات كتير بتشوفها كل يوم — من ملحقات المتصفح لـمساعدات البريد لـمساعدات الجداول. إذا هي عندها"حدود تفكير" خفية، هاد ممكن يأثر على جودة كل شي بيوصلّك من خلال هالأدوات.
كمان، النقطة الأعمق: الشركات صارت تحط قيود تكلفة بالسر ع النماذج. إذا شركة بتدفع للنموذج يفكّر طويل، بتفضّل تقصّر. بس القصير بيطلعلك نتائج أقصر. يعني في تضارب مصالح ما بتشوفه.
الحل: في عادات صغيرة بتفرق كتير
في كم عادة بسيطة بتساعد كتير:
- قسّم المهمة لقطع صغيرة. اطلب خطة أول، وبعدين الكود. لا ترمي برومبت ضخم دفعة وحدة فيه 5 أسئلة متداخلة. كل ما خلّيت النموذج يركّز ع شي واحد، قلّ احتمال يوصل للحد.
- قول للنموذج يكمل. جملة بسيطة متل "كمّل" أو "كمّل، وقفت بدري" كتير بتجيب القطعة الناقصة. النموذج رح يكمل من وين وقف بالضبط.
- لمهام إعادة الهيكلة الصعبة فعلاً، بدّل لنموذج ما عندو نفس الحد. المجتمع عم يختبر نماذج بديلة هلأ، وفي مؤشرات إنو الإصدارات الأقدم من نفس العائلة ما عندها هالقيد.
- انتبه للبرومبت. إذا حسّيت إنو ردّ النموذج قصير بشكل غريب، ممكن يكون قطع ع 516. جرّب تطلب منو يفصّل أكتر أو يشرحلك شو عمل.
متل ما حسّيت، هلأ في إثبات
اللي حلو بالقصة إنو الموضوع مو تخمين. في أرقام حقيقية من 390 ألف رد، وتراكمت مع بعض، والنمط واضح لدرجة إنو أي حدا عم يحلّل البيانات بيقدر يشوفو. ما في حدا بيقول "حسّيت كذا" — في ملف JSON ع GitHub بيقول "شوف 516 ظهرت X مرة و516+1 ظهرت Y مرة، والفرق 44 ضعط".
هاد النوع من البقّات (إذا صح إنو بقّ) بيصير أكتر كل ما النماذج صارت "أذكى". لمّا تضيف استدلال معقّد (chain-of-thought)، النموذج بيقرّر بنفسه قديش يفكّر. إذا في سقف مخفي، بيقطع بدون ما يعلمك.
🔧 كيف تجرّبها هلّق
افتح مهمة Codex أو ChatGPT برمجية عندك. ابعث برومبت طويل ومعقّد وراقب الرد. إذا خلص فجأة ع جملة نظيفة، وحسّيت إنو ما كمّل كل اللي طلبتو، ممكن تكون وصلت لجدار الـ 516 توكن.
ردّ عليه بـ"كمّل" وشوف إذا عم يوصل جزء ثاني. هاد نفس السلوك يلي التيليمتري عم تقيسو. إذا وصل جزء ثاني وكمّل منطقته، فقد حسمت.
لمستخدمين أكثر تقدماً: جرّب تقارن بين GPT-5.5 وGPT-5.2 (إذا متاح) ع نفس المهمة الصعبة. الفرق رح يكون ملحوظ ع المهام متعددة الخطوات، وأقل وضوحاً ع البسيطة.