SLATEMOTH / ANALYSE
Mesurer l'utilisation de l'IA multimodale : texte, image, vidéo et audio
Une approche de la mesure adaptée à chaque modalité, sans ramener toutes les charges de travail à un modèle fondé uniquement sur les tokens.
Le problème
Les tokens sont utiles pour de nombreux modèles textuels, mais ils ne sont pas une unité universelle pour les services d'IA. Images, vidéos, parole, embeddings et médias générés peuvent avoir différentes unités de facturation.
Texte
L'utilisation textuelle peut comprendre des tokens d'entrée, de sortie, mis en cache et des unités de raisonnement propres au fournisseur. Préservez les données d'utilisation d'origine avant d'appliquer la tarification commerciale.
Image et vidéo
Les traitements d'images peuvent dépendre du nombre d'images, de leurs dimensions, de leur qualité ou du type d'opération. La vidéo peut dépendre de la durée, de la résolution, de la fréquence d'images, de la présence d'audio ou du mode de génération.
Audio
La transcription vocale est souvent mesurée par la durée de l'audio, tandis que la synthèse vocale peut être mesurée en caractères, en tokens ou en durée générée.
Mesurer avant de fixer les prix
La mesure enregistre ce qui s'est produit. La tarification détermine le coût de cette utilisation. En séparant ces étapes, le coût du fournisseur et le prix facturé au client peuvent évoluer sans réécrire l'historique d'utilisation.