شو لقى Armin Ronacher فعلياً
Armin Ronacher مش مستخدم AI عادي. هو مبتكر Flask وSentry، وواحد من أكتر باني الأدوات المحترمين بعالم Python. لمّا بيكتب عن تراجع، يستاهل القراءة.
يوم 4 تموز 2026، نشر بوست عنوانه "Better Models: Worse Tools". الفكرة الرئيسية: نماذج Claude الأحدث — Opus 4.8 وSonnet 5 — صاروا يطلّعوا استدعاءات أدوات معطوبة أكتر من النماذج الأقدم. مش أقل. أكتر. وبيدعم هاد بلوغات إنتاج من أنظمة تبعه هو.
النمط بيبيّن بوضوح. كل ما كان النموذج أحدث، كل ما صار يخترع حقول ما إياها بالمخطط، يبعت JSON ناقص ما بيقبل parse، أو يلف استدعاء الأداة بصياغة مختلفة شوي عن المتوقع. سمّاه "تراجع مُضايق" — وأي حدا بيشغّل loop وكيل رح يتعرّف ع هالإحساس.
ليش هاد بيهمك إذا بتبني وكلاء
إذا بتكتب كود بينادي Claude عبر API وبيرجّع نتائج الأدوات، كل استدعاء معطوب هو فشل لازم تتعامل معه. النموذج مو دايماً صح لأنه أحدث. دقة استدعاء الأدوات محور منفصل عن جودة الاستدلال، وع هالمحور، النماذج الأحدث عم تسوء.
لـ chatbot هاد بيكون مخفي. تسأل سؤال، بتاخد جواب، بتكمّل تتصفّح. لـ loop وكيل بينادي الأدوات عشرات المرات بكل مهمة، التراجع بيبيّن بكل مكان: أكتر محاولات إعادة، أكتر أخطاء تحقق، أكتر توكنات ضايعة، أكتر وقت محسوب ع شغل النموذج عمل نصّو. المستخدم بيحسّها متل "الوكيل اليوم مش مستقر".
لشركة عم تطلق منتجات AI، الوضع أسوأ. معدّل الخطأ ما بينزل لمّا بترقّي للنموذج الأحدث — بيطلع. وعد "الأحدث = الأفضل" بينكسر بهدوء بلحظة ما يكون عندك مخططات وكلاؤك معتمدين إلها.
شو بيفسّر Ronacher (الجزء التقني)
أهم قسم بالبوست هو التفسير التقني. استدعاءات الأدوات بـ Claude مو قناة بروتوكول منفصلة — هي نصّ عادي داخل الرد مع علامات ANTML. النموذج بيكتب لغة طبيعية، بيضرب علامة، بيكتب JSON، بيضرب علامة ثانية. إذا النموذج بيعرف المخطط منيح، بيطلع JSON نظيف. إذا المخطط غريب أو غير مألوف، النموذج لازم يجتهد — وجودة هالاجتهاد بتعتمد ع التدريب، مو ع الذكاء الخام.
Ronacher بيقول إن نماذج Claude الأحدث يبدو إنها صرفت وقت تدريب أكتر ع الاستدلال طويل الشكل وأقل ع انضباط المخرجات المنظمة. النتيجة: مقالات أحسن، انضباط مخططات أضعف. خسارة صافية لأي حدا بيبني وكلاء.
وكمان بيعرض أمثلة ملموسة. بمثال واحد، Opus 4.8 بينادي أداة بكائن JSON فيه اسم حقل مختلف شوي عن المخطط الموثّق — قريب للدرجة يلي بيبيّن صحيح، بس مختلف للدرجة يلي بيكسر المحقق. بمثال ثاني، Sonnet 5 بيحذف حقل مطلوب بالكامل، وكودك ما بيلحق يكتشف الخطأ إلا بعد ما استدعاء الدالة بلّش ينفّذ.
شو يعني هاد إذا إنت مش مطوّر
حتى لو ما بتكتب وكيل أبداً، هاد بيأثّر عليك. نفس النماذج بتشغّل أغلب أدوات AI يلي بتستخدمها — ملحقات المتصفح، مساعدات البريد، مساعدات الجداول، مساعدات البرمجة. إذا هالأدوات عندها تكلفة مخفية من استدعاءات معطوبة، هالتكلفة بتبيّن متل ردود أبطأ، خلل متفرّق، أو ميزات بتشتغل نهار وبتنكسر نهار ثاني.
وفي نقطة أعمق عن الحوافز. مختبرات AI عم تتسابق تطلق نماذج "أذكى" ع المعايير. بس المعايير ما بتقيس انضباط المخططات. بتقيس الاستدلال. يعني نموذج يقدر يصعّد ليدربورد وبنفس الوقت يسوء بالشغل المنظّم يلي التطبيقات الحقيقية معتمدة عليه. المستخدمين بيدفعوا ع البريق، الشركات بتدفع ع الاحتكاك.
⚡ شو تعمل هلأ
ما لازم تستنى Anthropic تطلق إصلاح. في كم خطوة عملية بتساعد فوراً:
- ضيف محقق JSON صارم قبل ما تبعت استدعاءات الأدوات لكودك. ارفض أي شي ما بيتماشى مع المخطط، واطلب من النموذج يعيد المحاولة مع تذكير صريح بالمخطط.
- احتفظ بقائمة "أنماط معطوبة معروفة" وتحقق منها قبل التنفيذ. هاد بيمسك الأنماط الشائعة قبل ما توصل لـ function عندك.
- ثبّت نسخة النموذج حسب الاستخدام. استخدم Sonnet 5 للدردشة والتلخيص، بس خلّي نموذج Claude أقدم (أو عائلة مختلفة) لـ loops الوكلاء الكتيرة بالأدوات، لحتى يتحسّن التراجع.
- سجّل كل فشل بأداة مع اسم النموذج والنص المعطوب. بعد أسبوع رح تشوف أي نموذج فعلاً الأنسب لـ stack تبعك — وأي نموذج الأكتر تكلفة للتشغيل.
- إذا عم تختار نموذج لمنتج جديد، اعمل benchmark صغير للوكيل قبل ما تلتزم. عشرين دقيقة اختبار بتوفّرك شهرين ديباغ بالإنتاج.
🔧 جرّبها بنفسك
اختار وكيل أو workflow بيستخدم أدوات عم تشغّله اليوم. بدّل نموذجه لأي شي عندك لـ Opus 4.8 أو Sonnet 5 لساعة وحدة. عدّ الاستدعاءات المعطوبة بالمهمة. من بعدها ارجّع للنموذج الأصلي. إذا لاحظت قفزة واضحة بالأخطاء، عندك نقطة بيانات خاصة فيك — وبتقدر تقرر أي نسخة نموذج بأي جزء من نظامك. تجربة بعشر دقائق ممكن توفّرلك ربع ديباغ.