SLATEMOTH / ARTÍCULO
Medición del uso de IA multimodal: texto, imagen, vídeo y audio
Un enfoque de medición adaptado a cada modalidad, sin reducir todas las cargas de trabajo a un modelo basado únicamente en tokens.
El problema
Los tokens son útiles para muchos modelos de texto, pero no constituyen una unidad universal para los servicios de IA. Las imágenes, el vídeo, la voz, las incrustaciones vectoriales y los contenidos generados pueden tener distintas dimensiones facturables.
Texto
El uso de texto puede incluir tokens de entrada, de salida, almacenados en caché y dimensiones de razonamiento específicas del proveedor. Conserva los datos originales de uso antes de aplicar los precios comerciales.
Imagen y vídeo
Las cargas de trabajo de imagen pueden depender del número de imágenes, sus dimensiones, la calidad o el tipo de operación. Las de vídeo pueden depender de la duración, la resolución, la frecuencia de fotogramas, la inclusión de audio o el modo de generación.
Audio
La conversión de voz a texto suele medirse por duración del audio, mientras que la conversión de texto a voz puede medirse por caracteres, tokens o duración generada.
Medición antes de fijar precios
La medición registra lo sucedido. La fijación de precios determina cuánto cuesta ese uso. Separar ambas etapas permite que el coste del proveedor y el precio para el cliente evolucionen sin reescribir los registros históricos de uso.