SLATEMOTH / نشر النماذج
Kolibri: المعلمات النشطة ليست سوى جزء من ميزانية النشر
يفعّل Kolibri من Aleph Alpha عددًا قدره 3.46B من المعلمات لكل توكن، لكن إجمالي معلماته يبلغ 78B. ينبغي تقييم الحساب والأوزان المقيمة في الذاكرة والسياق وبرمجيات الاستدلال كلًّا على حدة.
ثلاثة أرقام تصف أشياء مختلفة
في 3 أكتوبر، أصدرت Aleph Alpha نموذج Kolibri، وهو نموذج مزيج خبراء ذو أوزان مفتوحة يركز على الألمانية والإنجليزية، بموجب ترخيص Apache 2.0. تسرد بطاقة النموذج إجماليًا قدره 78B من المعلمات، منها 3.46B نشطة لكل توكن. يصف الرقمان جانبين مختلفين من النموذج نفسه؛ فالرقم الأصغر لا يعني أن النموذج الذي يُنزَّل أو يُنشر لا يحتوي إلا على 3.46B من المعلمات. [1] [2]
يتضمن النقاش العام على Reddit أسئلة عن الأجهزة الشخصية وعن الادعاء بإتاحة سياق من مليون توكن. وتثير هذه الأسئلة مسألة مفيدة قبل الشراء: أي مورد يصفه الرقم البارز فعلًا؟ نرى أن قرار النشر يحتاج إلى ميزانيات منفصلة للحساب لكل توكن، وللأوزان المقيمة في الذاكرة، ولحالة الطلبات. ولا يمكن لأي منها أن يحل محل الاثنين الآخرين.
الحساب المتناثر لا يلغي الحاجة إلى مكان لحفظ الأوزان
تذكر بطاقة نموذج FP8 أن الأوزان تشغل نحو 78 GB. أما نسخة BF16 الصادرة بصورة منفصلة فتذكر نحو 156 GB. هذه تقديرات الناشر للأوزان، وليست وعدًا بأن جهازًا يملك هذا القدر من الذاكرة بالضبط يستطيع خدمة عبء العمل المطلوب. تغيّر دقة التمثيل ميزانية التخزين، بينما يتعلق التناثر بالحسابات المختارة لكل توكن. [2] [3]
توضح البطاقة صراحة أن النموذج بأكمله يجب أن يبقى في الذاكرة، رغم أن جزءًا منه فقط ينشط في كل مرة. فالخبير الذي لا يُستخدم لتوكن ما قد يُحتاج إليه للتوكن التالي. لذلك تشمل خطة السعة المفيدة الأوزان، وذاكرات التخزين المؤقت للطلبات، ومخازن التشغيل، وهامشًا للتشغيل. ولا يصح تقدير الذاكرة المطلوبة بتخفيض إجمالي المعلمات وفق نسبة الجزء النشط. [2]
قد يتيح نقل بعض الأوزان إلى ذاكرة أخرى أو زيادة التكميم خيارات إضافية للنشر، لكن الخيار المعقول ليس إعدادًا مختبرًا. يمكن لعمليات النقل وتغييرات الدقة واختلاف النوى الحسابية أن تؤثر في زمن الاستجابة أو الجودة. تعامل مع أي إعداد مقترح على جهاز استهلاكي بوصفه تجربة لها معايير قبول خاصة، بدل استنتاج التوافق من عدد المعلمات النشطة.
حد السياق هو أيضًا قرار بشأن الطلبات المتزامنة
تميّز بطاقة Kolibri بين طول سياق أصلي دُرّب عليه النموذج يبلغ 262,144 توكنًا، والتحقق من توسيعه إلى 1,048,576. وتوصي بألا يتجاوز السياق 262,144 في المهام المعقدة أو خدمات الاستدلال الحساسة لزمن الاستجابة ومعدل المعالجة. ويصف قسم السياق الطويل في التقرير أيضًا تراجعًا يعتمد على المهمة عند تجاوز طول التدريب. ينبغي النظر إلى الحد الموسع والتوصية والأدلة الخاصة بعبء العمل معًا. [2] [4]
لنفترض أن فريقًا يريد أن يتيح لعدة أشخاص الاستعلام عن مستندات طويلة في الوقت نفسه. القدرة على قبول طلب واحد طويل جدًا لا تثبت عدد الطلبات المماثلة التي يستطيع الخادم معالجتها جيدًا بالتزامن. تتنافس حالات الطلبات على الذاكرة، وتتطلب معالجة المدخلات موارد حسابية مشتركة. قِس زمن انتظار أول إجابة، ووقت إتمام المهمة، والطلب المتزامن باستخدام المستندات الفعلية، بدل تحويل الحد الأقصى للسياق إلى وعد بمستوى الخدمة.
هذا لا يلغي فائدة السياق الطويل. فقد يقلل جمع الأدلة المرتبطة معًا من خسائر تجزئة المعلومات. والسؤال هو ما إذا كانت المواد الإضافية المحتفظ بها تحسّن المهمة بما يكفي لتبرير كلفتها من الموارد. قارن مدخلًا موجزًا ذا صلة بالمستند الكامل، وتحقق من صحة الإجابة والمقاطع التي تدعمها.
رسم معدل المعالجة يقيس تجربة محددة
يقيس تقرير Aleph Alpha معدل خدمة الاستدلال على عقدة تضم ثماني وحدات B200، باستخدام مطالبات اصطناعية. ويبحث في ترتيبات التوازي الملائمة، ويجري القياس قرب حد التزامن الذي تتيحه ذاكرة KV المؤقتة، ثم يعرض أسرع ترتيب مقاس لفك الترميز. كما يقدّر معدل النص الناتج اعتمادًا على عدد البايتات لكل توكن، الذي يختلف باختلاف أداة تقسيم النص إلى توكنات. هذه الشروط أساسية لفهم المقارنة بين الجودة والكلفة. [4]
قد يكون معدل فك الترميز عند تزامن عدد كبير من الطلبات مهمًا لخدمة مزدحمة أو لمعالجة تتطلب توليدًا كثيفًا. لكنه لا يخبر مستخدمًا واحدًا مباشرة بالوقت الذي سيستغرقه الاستعلام عن مستند. فمعالجة المدخلات والانتظار وطول الاستدلال وفحص المخرجات تؤثر جميعًا في التجربة. ويشير التقرير أيضًا إلى افتراض أن الخدمة بدقة FP8 تحافظ على درجات الاختبارات المعيارية المرجعية؛ فلا ينبغي التعامل مع هذا الافتراض بوصفه نتيجة عامة تثبت تكافؤ مستويات الدقة. [4]
والاستنتاج العكسي غير مفيد أيضًا: زيادة حجم الأوزان لا تثبت ضعف الجدوى الاقتصادية. يمكن للنموذج المتناثر أن يستفيد بكفاءة من السعة المشغولة في الذاكرة عندما يتوفر عمل ملائم يكفي لإبقائه مشغولًا. قارن عدد المهام المكتملة المقبولة لكل وحدة كلفة في ظل الحمل المتوقع، مع احتساب فترات انخفاض النشاط، بدل إعلان الأفضل بناءً على أحد رقمي المعلمات وحده.
برمجيات الاستدلال جزء من مواصفات النشر
يوفر مستودع الاستدلال المنشور إضافة لـ vLLM تتضمن بنية خاصة بـ Kolibri، ومحللات للاستدلال واستدعاءات الأدوات. يذكر README أن كل إصدار يدعم إصدارًا فرعيًا واحدًا من vLLM؛ وكان الإصدار المدعوم وقت هذه المراجعة هو 0.29. تتيح الأوزان المفتوحة الوصول إلى النموذج، لكنها لا تثبت التوافق مع كل تطبيق للاستدلال أو مع نسخته المثبتة. [5]
سجّل مراجعة النموذج ودقته وإصدارات الإضافة وبيئة التشغيل وحد السياق وإعدادات المحللات معًا. اختبر فصل الاستدلال عن النص النهائي، وتحليل معاملات الأدوات، والتعامل مع المدخلات الطويلة، والطلب الذي انقطع. قبول العميل لتنسيق الاستجابة ليس سوى جزء من تكامل يعمل فعلًا. وتسهّل هذه المواصفات أيضًا تقييم الترقية اللاحقة أو العودة إلى إصدار سابق.
اختر عبء العمل قبل اختيار الجهاز
على الفريق الذي يعمل بمستندات ألمانية أو إنجليزية أن يبدأ بطلبات ممثلة لعمله، ثم يتحقق بصورة مستقلة من الإجابات بالرجوع إلى الأدلة المقدمة. وعلى فريق التطوير أن يضمّن مخططات الأدوات الفعلية والمخرجات التي يجب أن يتعامل معها التطبيق. أما مسؤولو البنية التحتية فعليهم مقارنة فترات النشاط المرتفع والمنخفض المتوقعة. التركيز على لغتين سبب لتقييم المهام المرتبطة بهما، وليس دليلًا على التفوق في كل مهمة بأي منهما.
ينبغي أن تجيب تجربة صغيرة عن ثلاثة أسئلة: هل تحقق المخرجات مستوى الجودة المطلوب؟ هل يستطيع الجهاز المقصود تحمل عبء العمل المطلوب باستمرار؟ وهل يستطيع الفريق صيانة برمجيات الاستدلال؟ استخدم المستندات نفسها ومتطلبات المخرجات وقواعد القبول نفسها عند مقارنة البدائل. واحتسب المحاولات المتكررة والنتائج المرفوضة ضمن الكلفة.
يمثل Kolibri خيارًا جديدًا مفيدًا لأن مواده المنشورة تتيح للفرق فحص هذه المفاضلات. يصف عدد المعلمات النشطة، 3.46B، الحساب المتناثر؛ أما الأوزان الأكبر وحالة الطلبات فتظل متطلبات فعلية للنشر. التقدم العملي هو وجود نموذج آخر يمكن اختباره لمهمة محددة، وليس دليلًا على اختفاء قيود الذاكرة أو أعمال التشغيل أو الحاجة إلى فحص المخرجات بصورة مستقلة.
المصادر ونطاق التحقق
- Aleph Alpha · إعلان إصدار Kolibri، 3 أكتوبر 2026
- Aleph Alpha · بطاقة نموذج Kolibri-1 FP8 ونطاق النشر
- Aleph Alpha · بطاقة نموذج Kolibri-1 BF16 وحجم الأوزان
- Aleph Alpha · التقرير التقني لـ Kolibri: السياق الطويل ومنهجية الجودة والكلفة في الملحق A
- Aleph Alpha · README لإضافة الاستدلال وبيئة التشغيل المدعومة