SLATEMOTH / 观点
多模态 AI 计量:文本、图像、视频与音频
根据不同模态衡量 AI 使用量,而非将所有工作负载都强行归入仅按 token 计量的模型。
问题所在
Token 适用于衡量许多文本模型,但不是所有 AI 服务的通用单位。图像、视频、语音、向量嵌入和生成式媒体可能采用不同的计费维度。
文本
文本使用量可能包括输入 token、输出 token、缓存 token,以及供应商特有的推理维度。在应用商业定价前,应保留原始使用量事实。
图像与视频
图像工作负载的计量可能取决于图像数量、尺寸、质量或操作类型。视频则可能取决于时长、分辨率、帧率、是否含音频或生成模式。
音频
语音转文字通常按音频时长计量,文字转语音则可能按字符、token 或生成时长计量。
先测量,后定价
计量记录发生了什么,定价决定使用量对应的费用。将两者分开,才能让供应商成本和客户价格演进,而无需改写历史使用量。