Mesurer la requête qui atteint le modèle
Les jetons d'entrée incluent le matériel envoyé par votre application : instructions, historique des conversations, passages récupérés et résultats de l'outil. Une courte question d'utilisateur peut donc générer une contribution beaucoup plus importante.
Les jetons de sortie varient en fonction de la réponse demandée et des paramètres du modèle. Mesurez les deux côtés sur un échantillon représentatif au lieu de prévoir à partir d’une seule invite.
Compter les tentatives infructueuses
Une extraction mal formée, un timeout ou une réponse rejetée par votre validateur peut conduire à une autre demande. Incluez ces tentatives dans votre calcul du coût par résultat.
Définissez une stratégie de nouvelle tentative limitée. Réessayer immédiatement chaque échec peut augmenter à la fois les dépenses et la charge sans améliorer le résultat, surtout si le problème est une demande non valide.
Comparez les modèles en utilisant la même tâche
Utilisez l'API TextCortex pour exécuter le même ensemble de requêtes approuvées sur des modèles candidats.
- Gardez la tâche et les critères de réussite constants.
- Enregistrez la version du modèle et les paramètres de génération.
- Capturez l’utilisation facturée et les tarifs actuels.
- Comptez les résultats valides, les tentatives répétées et les échecs.
- Comparez le temps de bout en bout et le coût.
Construire la prévision mensuelle
Multipliez le coût mesuré par tâche terminée par le volume de tâche attendu. Conservez des estimations distinctes pour les fonctionnalités qui utilisent différents modèles ou formes de requête.
Utilisez le calculateur de jetons pour l’arithmétique de base. Ajoutez des frais en dehors de cette estimation en fonction des règles de facturation du modèle sélectionné, puis examinez les prévisions à mesure que le trafic réel arrive.
