ليش هاد الخبر بيهمّك
لو بتقرأ ألماني أو بتدير فريق بشركة بدها نموذج لغة محلي بدون ما تبعت بياناتها لشركة أمريكية — اهتمّ. هاد الأسبوع فريق Soofi نزّل على arXiv ورقة بحثية لنموذج اسمه Soofi S 30B-A3B، وهو نموذج مفتوح المصدر بالكامل، مصمّم خصّيصاً للألماني والإنجليزي معاً.
النقطة اللي لازم تفهمها من البداية: مو نموذج صغير "بيجرّب" يفهم ألماني. بحسب الورقة، النموذج بيتفوّق على Olmo 3 32B وعلى Apertus 70B بمعايير التقييم الإنجليزية والألمانية — وهاد بين النماذج المفتوحة اللي نزّلوا أوزانهم وبياناتهم بشكل كامل. يعني القفزة مو تجريبية، هي نتيجة فعلية.
شو يعني "30 مليار بس بيفعّل 3 مليار"؟
هاد النموذج من نوع Mixture-of-Experts، يعني من الـ30 مليار معامل، بس 3 مليار بينشطوا بكل توكن. الباقي موجود بس ما اشتغل بهيك لحظة.
شو الفايدة العملية؟ لما النموذج يخدم طلبات كتير بنفس الوقت، استهلاك الذاكرة ما بيكبر مع طول السياق بشكل كبير. يعني لو عندك تطبيق بيوصل لـ50 ألف مستخدم بنفس الوقت وكل واحد عم يحكي مع النموذج بنص طويل — التكلفة والأداء بيفضلوا ثابتين تقريباً. هاد شي النماذج الكلاسيكية (dense) بتعجز تعمله.
إضافة لهيك، التصميم هجين Mamba + Transformer. هاد بيسمحللنموذج يركّز على السياق الطويل بدون ما يضرب سقف الذاكرة بشكل دراماتيكي، وهاد عملي مهم لـRAG على وثائق طويلة أو لتحليل عقود أو لتفريغ مكالمات خدمة عملاء بطول ساعة كاملة.
ليش "سيادي" كلمة مفتاح
النموذج اتدرّب بالكامل على بنية تحتية اسمها German Industrial AI Cloud، مملوكة لشركة Deutsche Telekom في ميونخ. هاد يعني:
- البيانات ما طلعت من ألمانيا أبداً.
- التدريب كله صار على أجهزة أوروبية.
- الأوزان والكود ومحاسبة البيانات رح تنزل بشكل كامل تحت رخصة مفتوحة.
لشركات DACH — ألمانيا، النمسا، سويسرا — هاد شي ضخم. كتير منهن ممنوع قانونياً (GDPR، أو سياسات داخلية) يبعتوا بيانات عملائهم لـOpenAI أو لـAnthropic. الحل الوحيد اللي كان عندهم هو Llama من Meta (مش سيادي أوروبي) أو نماذج مغلقة من OpenAI/Anthropic (بتخرق قوانينهم). هلّق عندهم خيار ثالث حقيقي.
القصة مو بس قانونية. كتير شركات أوروبية — خاصة بالمصارف، التأمين، الصحة — بدها نموذج بيتفهّم ألماني محكي مو بس فصحى معقّمة. Soofi S متدرّب على بيانات فيها ألماني مرفوع الأوزان عمداً، وهاد بيساعده يمسك التعابير المحكية واللهجات المحلية اللي النماذج العامة بتضيع فيها.
شو الفرق بينه وبين النماذج المفتوحة الثانية؟
كتير نماذج "مفتوحة" بتنزّل أوزانها بس. ما بتقولك كيف اتدربت، على أي بيانات، أو بأي بنية تحتية. Soofi Team قرّر يفتح كل شي:
- الأوزان النهائية.
- شيك بوينتس مختارة من مراحل التدريب.
- محاسبة كاملة لكل مصدر بيانات: شو حجمه، شو نسبته، كيف انفلتر.
- هايبر بارامترات التدريب.
- كود التدريب وكود التقييم.
لو أنت باحث أو مهندس ومحتاج تعيد إنتاج النموذج أو تدرّبه أكتر على بياناتك — هاد شي عملياً ممكن لأول مرة بنموذج بهاد الحجم من أوروبا.
حدود النموذج اللي لازم تعرفها
قبل ما تحمس حالك: الورقة بتقول كل شي بصراحة، وهاد بحد ذاتو شي نادر.
- 27 تريليون توكن كتير، بس Llama 3 متدرّب على أكتر. لو بدك نموذج يغطّي لغات ثانية (فرنسي، عربي)، رح تدرّبه أكتر بنفسك.
- MoE أصعب بالتوليف (fine-tuning) من dense. بتحتاج خبرا معينة إذا بدك تحسّن أداءه لمجال محدد.
- لسا ما نزّل رسمياً للناس. الفريق وعد بنزول وشيك، بس ما حدد تاريخ.
🔧 كيف تجرّبها هلّق
قبل ما النموذج ينزل رسمياً (الفريق وعد بنزوله بشروط مفتوحة قريباً)، فيك تعمل التالي:
- اقرأ الورقة الأصلية على arXiv عشان تشوف تفاصيل البنية — هي مكتوبة بشكل واضح، مو معقّد أكتر من اللازم.
- جرّب النماذج المفتوحة الموجودة (Olmo 3 32B مثلاً) على مهام ألمانية حقيقية من شغلك: ردود عملاء، تلخيص عقود، تفريغ مقابلات. شوف الفرق بأدائك الفعلي، وهيك بتعرف وين رح يضيف Soofi S لمّا ينزل.
- إذا فريقك أوروبي وعم تشتغلوا على بيانات حسّاسة، ابدأوا من هلّق بتحضير بيئة استضافة محلية (Hetzner أو حاسوبك الخاص ببطاقة رسومية كافية). حتى لو النموذج لسا ما نزل، التجهيزة بتوفر عليكم شهور لما ينزل.
- تابع حساب الفريق على GitHub أو Hugging Face — ولما ينزل أول شي، نزّل الأوزان وجرّبها على شغلك الحقيقي قبل ما تبنيلها.