SLATEMOTH / EINBLICK
Multimodale KI-Nutzung erfassen: Text, Bild, Video und Audio
Ein modalitätsspezifischer Ansatz zur Nutzungserfassung, ohne jede Workload auf ein reines Token-Modell zu reduzieren.
Das Problem
Tokens sind für viele Textmodelle nützlich, aber keine universelle Einheit für KI-Dienste. Bilder, Videos, Sprache, Embeddings und generierte Medien können unterschiedliche abrechenbare Größen haben.
Text
Die Textnutzung kann Eingabe-, Ausgabe- und zwischengespeicherte Tokens sowie anbieterspezifische Recheneinheiten umfassen. Bewahren Sie die ursprünglichen Nutzungsdaten auf, bevor kommerzielle Preise angewendet werden.
Bild und Video
Bild-Workloads können von der Zahl der Bilder, ihren Abmessungen, der Qualität oder der Art des Vorgangs abhängen. Bei Videos können Dauer, Auflösung, Bildrate, enthaltenes Audio oder Generierungsmodus relevant sein.
Audio
Spracherkennung wird häufig nach Audiodauer gemessen; Sprachsynthese kann nach Zeichen, Tokens oder erzeugter Dauer gemessen werden.
Messung vor Preisbildung
Die Nutzungserfassung hält fest, was geschehen ist. Die Preisbildung bestimmt, was diese Nutzung kostet. Durch die Trennung können sich Anbieterkosten und Kundenpreise ändern, ohne historische Nutzungsdaten umzuschreiben.