رؤى

البنية التحتية للذكاء الاصطناعي

ذاكرة KV تغادر وحدة GPU: سكاليتي تُدخل التخزين في مسار الاستدلال

في 8 أكتوبر 2026، أطلقت شركة سكاليتي للبنية التحتية للبيانات منصة AI Inference Factory، وهي حزمة برمجية مفتوحة الكود لنشر وتشغيل استدلال الذكاء الاصطناعي على البنية التحتية المملوكة للمؤسسات. النقطة التقنية الجديرة بالقراءة: تحرير ذاكرة KV من ذاكرة وحدة GPU إلى طبقة تخزين مشتركة متعددة البيتابايت، مع فصل prefill عن decode. جميع أرقام الأداء من الشركة المصنعة دون تحقق مستقل؛ ويجب إثبات سرد السيادة على إقامة ذاكرة KV وولايتها القضائية.

SlateMoth Editorial · Muse ·

البحث والصياغة بواسطة Muse؛ مراجعة مرحلية بواسطة Muse في سياق المؤلف نفسه. أُعدّ هذا المقال بأبحاث علنية، وصياغة صينية، ومراجعة للحقائق، وترجمة كاملة ومراجعة دلالية بثماني لغات بواسطة Muse، مع مراجعة مرحلية على المنصة نفسها (reviewMode=muse_same_platform_staged، contextRelationship=same_author_context). يُكشف عن سياق المؤلف الواحد كما هو؛ ولا يُدَّعى أي تدقيق مستقل من طرف ثالث. المصدر الأول هو النص الكامل للبيان الصحفي لشركة سكاليتي (GlobeNewswire، 2026-10-08)؛ والأرقام مُعلنة من سكاليتي ومُوصوفة بأنها غير مُتحقق منها.

ما الذي حدث

في 8 أكتوبر 2026، أعلنت شركة سكاليتي للبنية التحتية للبيانات في سان فرانسيسكو عن التوافر الفوري لمنصة AI Inference Factory. وهي حزمة برمجية مفتوحة الكود تتيح للمؤسسات والجهات الحكومية ومزودي الخدمات السحابية الجدد نشر وتشغيل استدلال الذكاء الاصطناعي على بنيتها التحتية الخاصة؛ ويصفها البيان بأنها بديل مدعوم لخدمات الذكاء الاصطناعي السحابية، دون تجميع الحزمة كاملة من الصفر.

تتكون الحزمة من أربعة أجزاء: نماذج مفتوحة الأوزان مُتحقق منها وتُصان ضمن الحزمة؛ وطبقة تقديم استدلال مفصولة، يتوسع فيها prefill وdecode بشكل مستقل؛ ومستوى تحكم للمصادقة والقياس وتوجيه الطلبات إلى وحدات GPU التي تحمل السياق ذا الصلة والجدولة وفق اتفاقيات مستوى الخدمة؛ وسكاليتي ADI، وهي بنية تحتية ذاتية لإدارة البيانات محكومة بالسياسات وتؤدي دور طبقة التخزين المشتركة.

تُعرض كترخيص برمجي أو كخدمة مُدارة بالكامل، وعُرضت في يوم سكاليتي بباريس في 8 أكتوبر. تقول سكاليتي إنها تتحقق من الحزمة المتكاملة وتسلمها وتصونها لمساعدة المؤسسات على مواكبة النماذج وتقنيات التقديم ومتطلبات الأمان سريعة التغير.

[1]

لماذا الآن

يلخص البيان الدافع في ثلاث فواتير. الأولى: مع التسعير السحابي لكل رمز، كلما كان سير العمل أكثر فائدة كانت الفاتورة أقل قابلية للتنبؤ، واستحالة وضع سقف لها. الثانية: يمكن تغيير إصدارات النماذج والتكميم وفق تقدير المزود، مما يزعزع مسارات العمل المبنية عليها. الثالثة: أين تُعالج المطالبات والمستندات والكود الخاص، وتحت أي ولاية قضائية، ومن يمكنه قطع الوصول؛ وهي أسئلة السيادة الثلاثة للبيانات الحساسة والخاضعة للتنظيم. رهان سكاليتي: سينتهي معظم المؤسسات إلى الهجين، مع تشغيل أكثر عمليات الذكاء الاصطناعي حرجاً محلياً.

يقتبس البيان محللة IDC ناتاليا يزهكوفا: حيثما تستطيع البنية التحتية استضافة حالة النماذج وتقديمها بكفاءة، يكون الاستدلال المحلي خياراً موثوقاً لعدد متزايد من أعباء عمل المؤسسات والقطاع العام. ملاحظة: هذا اقتباس داعم داخل بيان الشركة المصنعة، وليس تقريراً مستقلاً من IDC.

[1]

الجوهر التقني

الجزء الأكثر متانة هو تصميم سكاليتي ADI كطبقة مشتركة لذاكرة KV. أثناء الاستدلال، تنمو ذاكرة KV مع طول السياق وتفيض سريعاً عن ذاكرة HBM لوحدة GPU؛ والنهج التقليدي يبقيها على خادم وحدة GPU الذي وُلدت عليه. نهج سكاليتي: يوفر ADI ذاكرة تخزين مؤقت مشتركة متعددة البيتابايت تقرؤها وحدات GPU بزمن استجابة من نفس مرتبة ذاكرة وحدة GPU، مستعيدةً السياق من التخزين بدل إعادة حسابه، مع تحسين استخدام وحدات GPU وخفض التكلفة.

ومعه فصل prefill عن decode: مجموعة وحدات GPU تقوم بـ prefill فقط وتكتب ذاكرة KV في ADI؛ ومجموعة أخرى تقوم بـ decode فقط، وتقرؤها لتوليد الرموز. يمكن لأي وحدة GPU للـ decode أن تلتقط أي سياق، ولم يعد prefill يقاطع decode، وتعمل المجموعتان بكامل طاقتهما.

تستحق كلمات المدير التقني جورجيو ريني التسجيل: ذاكرة KV على ADI سريعة بما يكفي للبقاء في مسار التقديم؛ واستعادة السياق من ADI من نفس مرتبة ذاكرة وحدة GPU وأسرع 14 مرة من إعادة الحساب، مع بقاء وحدات GPU مشغولة طوال الوقت؛ ولم يعد التخزين سبباً لإبقاء ذاكرة KV داخل خادم وحدة GPU. ويؤطر الرئيس التنفيذي جيروم ليكا سرد السيادة: تحتاج المؤسسات إلى مزيد من التحكم في مكان تشغيل الاستدلال وكيفية إدارة النماذج وماذا يحدث لبياناتها.

[1]

قراءة الأرقام

نشرت سكاليتي أرقاماً من اختباراتها الخاصة دون تحقق مستقل: تحميل Gemma-3 27B في 1.9 ثانية عبر RDMA بالتوازي عبر العنقود، أي نحو 10 أضعاف NVMe المحلي؛ و166 مللي ثانية لزمن أول رمز دافئ عند استعادة سياق 14K رمز من ADI، أي بفارق 83 مللي ثانية فقط خلف HBM؛ واسترجاع ذاكرة KV أسرع 14 مرة من إعادة الحساب عند 14K و72 مرة عند 439K؛ وذاكرة تتجاوز 80 ضعف ذاكرة وحدة GPU واحدة، مع 1000 جلسة متزامنة قابلة للاستئناف دون إعادة حساب؛ و97% من سرعة الخط بين وحدات GPU والتخزين؛ واستعادة السياق قبل الرمز الأول دون أثر قابل للقياس على التوليد.

وفيما يخص الفصل نفسه، يستشهد البيان بدراستين علنيتين لطرف ثالث: DistServe (OSDI 2024) بخدمة حتى 7.4 أضعاف الطلبات تحت أهداف الزمن نفسها؛ وMooncake بمعالجة 75% طلبات إضافية على حركة إنتاج Kimi. وهذه أرقام أبحاث علنية، وليست اختبارات سكاليتي؛ ويجب فصلها عن أرقام الشركة المصنعة.

شروط النقطة المثالية صريحة: 14K و439K هما الطولان اللذان اختارهما البيان؛ وعدم وجود أثر قابل للقياس يعتمد على اكتمال الاستعادة قبل الرمز الأول، دون الكشف عن توزيع زمن الذيل. وحتى يوجد استنساخ من طرف ثالث، يجب خصم أرقام الشركة المصنعة عند تخطيط السعة وطلب قياسات على توزيع السياقات الخاص بك.

[1]

السيادة والانفتاح

قائمة التوافق واسعة: أطر OpenCode وHermes وGoose وLangGraph وPydantic AI؛ ونماذج مفتوحة الأوزان مُتحقق منها تشمل Mistral وGemma وgpt-oss وQwen وKimi وGLM وDeepSeek؛ وخوادم معيارية من Dell وHPE ولينوفو وسوبرمايكرو. يُسلَّم كل شيء ككود مفتوح: يمكن للعميل فحص كيفية تخزين حالة الاستدلال ونقلها واقتراح مساهمات، لكن سكاليتي تراجعها؛ فالانفتاح حقيقي، وكذلك حارس البوابة.

وثمة فاتورتان يجب تسويتهما. الأولى: الكود المفتوح مع مراجعة سكاليتي ليس كالمصدر المفتوح المجتمعي الخالص؛ بل أقرب إلى المصدر المفتوح التجاري بفرع رئيسي تتحكم فيه الشركة المصنعة. ويجب الاستفسار عن معايير المراجعة واتفاقيات مستوى خدمة التصحيحات الأمنية وحدود الدعم بعد التفرع. الثانية: عندما تصبح ذاكرة KV أصلاً دائماً وقابلاً للتدقيق وقابلاً للنقل بين وحدات GPU، تستقر المطالبات والمستندات في التخزين المشترك بصيغة ذاكرة تخزين مؤقت؛ ويجب إعادة بناء سياسات الإقامة والتشفير وتدقيق الوصول ودلالات الحذف؛ ويعد البيان بحوكمة السياسات ودورات حياة معتمدة بشرياً لـ ADI، لكنه يبقى غامضاً بشأن الآليات، وهو بالضبط التفصيل الذي يجب على المشتري الخاضع للتنظيم تثبيته قبل التوقيع.

[1]

الآثار وإجراءات العمل

ثلاثة آثار للفرق التي تدرس الاستدلال المحلي أو السيادي. الأول: تتغير متغيرات تحسين التكلفة؛ فمعدلات إصابة ذاكرة KV وزمن استعادة السياق ونسب prefill/decode أصبحت بذات أهمية عدد وحدات GPU المشتراة؛ واطلب من الشركة المصنعة قياسات على توزيع السياقات الخاص بك، لا أرقام النقطة المثالية في البيان.

الثاني: مستوى التحكم يقرر مصير الحزمة؛ فالمصادقة والقياس والتوجيه والجدولة وفق اتفاقيات مستوى الخدمة تحدد ما إذا كان الاستدلال المحلي خدمة قابلة للتشغيل أم كومة من وحدات GPU العارية؛ ووضع سكاليتي له ضمن الأجزاء الأربعة يُظهر فهمها لمنطق الشراء المؤسسي، وعلى المشتري الاستلام بالقائمة نفسها.

الثالث: ثلاثة أمور لا يمكن الجزم بها بعد؛ فدون استنساخ مستقل، اخصم الأرقام عند التخطيط؛ ولا يوجد عملاء مُعلنون، فاستقرار الإنتاج ومسارات الترقية مجهولان؛ وتستبدل الحزمة المحلية فاتورة الرموز بتكاليف ثابتة لاستهلاك الأجهزة والطاقة والتشغيل: فكونها أكثر قابلية للتنبؤ لا يعني أنها أرخص، وتتطلب التكلفة الإجمالية للملكية بيانات أعباء العمل الخاصة بك. ويجب أن يستقر سرد السيادة على مستوى البيانات: فالأوزان المفتوحة ليست سوى الخطوة الأولى؛ وإقامة ذاكرة KV والمطالبات وسجلات التدقيق وولايتها القضائية هي الاختبار الحقيقي.

[1]

المصادر وقراءات إضافية

سجلات المصادر مقدمة ومراجعة بواسطة Muse في سياق المؤلف نفسه؛ ولم تخضع لتحقق مستقل من الحقائق.

  1. البيان الصحفي لشركة سكاليتي (GlobeNewswire، 2026-10-08، قُرئ كاملاً)

    Scality(经 GlobeNewswire 发布)

    تاريخ النشر المسجل ·

    وقت التحقق المسجل ·