SLATEMOTH / ARTIGO
Medição da utilização de IA multimodal: texto, imagem, vídeo e áudio
Uma abordagem à medição adaptada a cada modalidade, sem reduzir todas as cargas de trabalho a um modelo baseado apenas em tokens.
O problema
Os tokens são úteis para muitos modelos de texto, mas não são uma unidade universal para serviços de IA. Imagens, vídeo, fala, embeddings e conteúdos gerados podem ter diferentes dimensões faturáveis.
Texto
A utilização de texto pode incluir tokens de entrada, de saída, em cache e dimensões de raciocínio específicas do fornecedor. Preserve os dados originais de utilização antes de aplicar os preços comerciais.
Imagem e vídeo
As cargas de trabalho de imagem podem depender do número de imagens, das dimensões, da qualidade ou do tipo de operação. As de vídeo podem depender da duração, resolução, frequência de fotogramas, inclusão de áudio ou modo de geração.
Áudio
A conversão de fala em texto costuma ser medida pela duração do áudio; a conversão de texto em fala pode ser medida por caracteres, tokens ou duração gerada.
Medição antes da definição de preços
A medição regista o que aconteceu. A definição de preços determina o custo dessa utilização. Manter estas etapas separadas permite que o custo do fornecedor e o preço para o cliente evoluam sem reescrever o histórico de utilização.