← Perspectivas

SLATEMOTH / ARTÍCULO

Medición del uso de IA multimodal: texto, imagen, vídeo y audio

Un enfoque de medición adaptado a cada modalidad, sin reducir todas las cargas de trabajo a un modelo basado únicamente en tokens.

Actualizado el 2026-09-26 · SlateMoth

El problema

Los tokens son útiles para muchos modelos de texto, pero no constituyen una unidad universal para los servicios de IA. Las imágenes, el vídeo, la voz, las incrustaciones vectoriales y los contenidos generados pueden tener distintas dimensiones facturables.

Texto

El uso de texto puede incluir tokens de entrada, de salida, almacenados en caché y dimensiones de razonamiento específicas del proveedor. Conserva los datos originales de uso antes de aplicar los precios comerciales.

Imagen y vídeo

Las cargas de trabajo de imagen pueden depender del número de imágenes, sus dimensiones, la calidad o el tipo de operación. Las de vídeo pueden depender de la duración, la resolución, la frecuencia de fotogramas, la inclusión de audio o el modo de generación.

Audio

La conversión de voz a texto suele medirse por duración del audio, mientras que la conversión de texto a voz puede medirse por caracteres, tokens o duración generada.

Medición antes de fijar precios

La medición registra lo sucedido. La fijación de precios determina cuánto cuesta ese uso. Separar ambas etapas permite que el coste del proveedor y el precio para el cliente evolucionen sin reescribir los registros históricos de uso.