← 返回洞察

SLATEMOTH / 观点

多模态 AI 计量:文本、图像、视频与音频

根据不同模态衡量 AI 使用量,而非将所有工作负载都强行归入仅按 token 计量的模型。

更新于 2026-09-26 · SlateMoth

问题所在

Token 适用于衡量许多文本模型,但不是所有 AI 服务的通用单位。图像、视频、语音、向量嵌入和生成式媒体可能采用不同的计费维度。

文本

文本使用量可能包括输入 token、输出 token、缓存 token,以及供应商特有的推理维度。在应用商业定价前,应保留原始使用量事实。

图像与视频

图像工作负载的计量可能取决于图像数量、尺寸、质量或操作类型。视频则可能取决于时长、分辨率、帧率、是否含音频或生成模式。

音频

语音转文字通常按音频时长计量,文字转语音则可能按字符、token 或生成时长计量。

先测量,后定价

计量记录发生了什么,定价决定使用量对应的费用。将两者分开,才能让供应商成本和客户价格演进,而无需改写历史使用量。