← К материалам

SLATEMOTH / СТАТЬЯ

Учёт мультимодального AI: текст, изображения, видео и аудио

Подход к учёту использования AI с учётом модальности, без попыток измерять все нагрузки только токенами.

Обновлено 2026-09-26 · SlateMoth

Проблема

Токены удобны для многих текстовых моделей, но не являются универсальной единицей для AI-сервисов. Изображения, видео, речь, эмбеддинги и генерируемые медиа могут тарифицироваться по разным измерениям.

Текст

Учёт текста может включать входные и выходные токены, кэшированные токены и специфичные для поставщика показатели рассуждений. Сохраняйте исходные данные об использовании до применения коммерческих тарифов.

Изображения и видео

Для изображений объём использования может зависеть от количества, размеров, качества или типа операции. Для видео — от длительности, разрешения, частоты кадров, наличия звука или режима генерации.

Аудио

Распознавание речи часто измеряется продолжительностью аудио, а синтез речи может измеряться количеством символов, токенов или длительностью созданного звука.

Сначала измерение, затем цена

Учёт использования фиксирует, что произошло. Ценообразование определяет стоимость этого использования. Разделение этапов позволяет менять затраты на поставщика и цену для клиента, не переписывая историю использования.