Инфраструктура ИИ
KV-cache покидает GPU: Scality встраивает хранилище в тракт инференса
8 октября 2026 года компания Scality, специализирующаяся на инфраструктуре данных, выпустила AI Inference Factory — программный стек открытого кода для развёртывания и эксплуатации инференса ИИ на собственной инфраструктуре предприятий. Технически интересно следующее: освобождение KV-cache из памяти GPU в общий многопетабайтный слой хранения с разделением prefill и decode. Все показатели производительности — заявления производителя без независимой проверки; нарратив суверенитета в итоге должен подтверждаться резидентностью и юрисдикцией KV-cache.
Исследование и подготовка текста Muse; поэтапная проверка Muse в том же авторском контексте. Статья подготовлена Muse: открытое исследование, черновик на китайском, проверка фактов, полный перевод и пословная семантическая проверка на восьми языках; поэтапная проверка на той же платформе (reviewMode=muse_same_platform_staged, contextRelationship=same_author_context). Контекст единого автора раскрыт как есть; независимый аудит третьей стороны не заявляется. Первоисточник — полный текст пресс-релиза Scality (GlobeNewswire, 2026-10-08); цифры — заявления Scality, каждая помечена как непроверенная.
Что произошло
8 октября 2026 года компания Scality, специализирующаяся на инфраструктуре данных, объявила в Сан-Франциско о доступности AI Inference Factory. Это программный стек открытого кода, позволяющий предприятиям, госструктурам и neo-cloud провайдерам развёртывать и эксплуатировать инференс ИИ на собственной инфраструктуре; в релизе он назван поддерживаемой альтернативой облачным ИИ-сервисам без сборки всего стека с нуля.
Стек состоит из четырёх частей: проверенные открытые модели, поддерживаемые в составе стека; разделённый слой обслуживания инференса с независимым масштабированием prefill и decode; плоскость управления с аутентификацией, учётом, маршрутизацией запросов на GPU с нужным контекстом и планированием по SLA; и Scality ADI — инфраструктура автономного управления данными с политическим governance, играющая роль общего слоя хранения.
Поставляется как лицензия на ПО или полностью управляемый сервис; демонстрация прошла 8 октября на Scality Day в Париже. Scality заявляет, что проверяет, поставляет и поддерживает интегрированный стек, помогая организациям поспевать за быстро меняющимися моделями, технологиями обслуживания и требованиями безопасности.
Почему сейчас
В релизе мотивация сведена к трём счетам. Первый: при облачной оплате за токен чем полезнее рабочий процесс, тем непредсказуемее счёт, и ограничить его невозможно. Второй: версии моделей и квантование могут меняться по усмотрению провайдера, расшатывая построенные поверх процессы. Третий: где обрабатываются промпты, документы и проприетарный код, под чьей юрисдикцией и кто может отключить доступ, — три вопроса суверенитета для чувствительных и регулируемых данных. Ставка Scality: большинство в итоге придёт к гибриду, а критичные ИИ-процессы будут работать локально.
В релизе приведена цитата аналитика IDC Наталии Ежковой: там, где инфраструктура способна эффективно хранить и обслуживать состояние моделей, локальный инференс — достоверный вариант для растущего числа корпоративных и госзадач. Примечание: это цитата поддержки внутри релиза производителя, а не независимый отчёт IDC.
Техническая суть
Самое содержательное — проект Scality ADI как общего слоя KV-cache. При инференсе KV-cache растёт с длиной контекста и быстро переполняет HBM графических процессоров; обычно его оставляют на том GPU-сервере, где он родился. Подход Scality: ADI даёт общий многопетабайтный кэш, который GPU читают с задержкой того же порядка, что и память GPU, восстанавливая контекст из хранилища вместо пересчёта, — с ростом утилизации GPU и снижением стоимости инференса.
В паре — разделение prefill и decode: один пул GPU делает только prefill и пишет KV-cache в ADI; другой — только decode, читая кэш для генерации токенов. Любой decode-GPU может подхватить любой контекст, prefill больше не прерывает decode, оба пула загружены полностью.
Стоит привести слова CTO Джорджо Реньи: KV-cache на ADI достаточно быстр, чтобы находиться в тракте обслуживания; восстановление контекста из ADI — того же порядка, что и память GPU, и в 14 раз быстрее пересчёта, при полной загрузке GPU; хранилище больше не причина держать KV-cache внутри GPU-сервера. CEO Жером Лека обрамляет нарратив суверенитета: организациям нужно больше контроля над тем, где работает инференс, как управляются модели и что происходит с их данными.
Читаем цифры
Scality опубликовала цифры собственных тестов без независимой проверки: загрузка Gemma-3 27B за 1,9 секунды по RDMA параллельно по кластеру — примерно в 10 раз быстрее локального NVMe; 166 мс warm time-to-first-token при восстановлении контекста 14K токенов из ADI — всего на 83 мс медленнее HBM; извлечение KV-cache в 14 раз быстрее пересчёта на 14K и в 72 раза на 439K; кэш более чем в 80 раз больше памяти одного GPU, 1000 параллельных сессий возобновляемы без пересчёта; 97% пропускной способности линии между GPU и хранилищем; контекст восстанавливается до первого токена без измеримого влияния на генерацию.
Для самого разделения в релизе приведены два сторонних открытых исследования: DistServe (OSDI 2024) — до 7,4 раза больше запросов при тех же целевых задержках; Mooncake — на 75% больше запросов на производственном трафике Kimi. Это цифры открытых исследований, а не тесты Scality; их следует отделять от цифр производителя.
Условия идеальной точки оговорены явно: 14K и 439K — выбранные в релизе длины контекста; отсутствие измеримого влияния зависит от завершения восстановления до первого токена, распределение хвостовых задержек не раскрыто. До независимого воспроизведения планирование мощностей должно дисконтировать заявления производителя и требовать замеров на собственном распределении контекстов.
Суверенитет и открытость
Список совместимости широк: фреймворки OpenCode, Hermes, Goose, LangGraph и Pydantic AI; проверенные открытые модели, включая Mistral, Gemma, gpt-oss, Qwen, Kimi, GLM и DeepSeek; стандартные серверы Dell, HPE, Lenovo и Supermicro. Всё поставляется как открытый код: клиент может инспектировать хранение и перемещение состояния инференса и предлагать contributions, но их рецензирует Scality; открытость реальна, как и привратник.
Два счёта к сведению. Первый: открытый код с рецензией Scality — не то же самое, что чисто community open source; ближе к коммерческому open source с контролируемой производителем главной веткой. Следует выяснить критерии рецензии, SLA патчей безопасности и границы поддержки после форка. Второй: когда KV-cache становится персистентным, аудируемым, переносимым между GPU активом, промпты и документы лежат в общем хранилище в виде кэша; политики резидентности, шифрование, аудит доступа и семантика удаления — всё нужно строить заново; в релизе заявлены политический governance и утверждаемые человеком жизненные циклы ADI, но механика не раскрыта, а это именно та деталь, которую регулируемый покупатель обязан зафиксировать до подписания.
Выводы и действия
Три вывода для команд, рассматривающих локальный или суверенный инференс. Первый: меняются переменные оптимизации стоимости; hit rate KV-cache, задержка восстановления контекста и пропорции prefill/decode уже так же важны, как число покупаемых GPU; требуйте от производителя замеров на собственном распределении контекстов, а не цифр идеальной точки из релиза.
Второй: плоскость управления решает судьбу стека; аутентификация, учёт, маршрутизация и планирование по SLA определяют, будет ли локальный инференс эксплуатируемым сервисом или грудой голых GPU; включение её в четыре части стека показывает, что Scality понимает логику enterprise-закупок, и покупателю следует принимать по тому же чек-листу.
Третий: три вещи пока утверждать нельзя; без независимого воспроизведения дисконтируйте цифры при планировании; ноль раскрытых клиентов — стабильность в проде и пути обновлений неизвестны; локальный стек меняет счёт за токены на фиксированные расходы на амортизацию железа, электричество и эксплуатацию: предсказуемее не значит дешевле, а TCO требует собственных данных о нагрузке. Нарратив суверенитета должен приземляться на уровень данных: открытые веса — лишь первый шаг; резидентность и юрисдикция KV-cache, промптов и журналов аудита — настоящее испытание.
Источники и дополнительные материалы
Записи источников предоставлены и проверены Muse в том же авторском контексте; независимая проверка фактов не проводилась.
- Пресс-релиз Scality (GlobeNewswire, 2026-10-08, прочитан полностью)
Scality(经 GlobeNewswire 发布)
Записанная дата публикации ·
Записанное время проверки ·