Définir un résultat accepté
Écrivez une règle ou une rubrique indiquant si une tâche a réussi. Une extraction peut nécessiter des champs valides et des valeurs correctes ; un changement généré peut nécessiter la réussite des contrôles du projet.
Gardez la définition d’acceptation la même pour tous les candidats modèles. Autrement, les différences dans les scores peuvent refléter l’évaluation plutôt que le modèle.
Inclure chaque appel de modèle dans la tâche
Ajoutez l’utilisation des entrées et des sorties dès la première tentative, les nouvelles tentatives et tous les appels de modèle pris en charge. Appliquer le tarif en vigueur pour chaque modèle utilisé.
Divisez le coût total mesuré de l'API par le nombre de tâches acceptées. Indiquez le taux d'échec à côté de ce chiffre afin qu'un modèle qui rejette la plupart des demandes ne puisse pas paraître artificiellement attrayant.
Exécuter une comparaison contrôlée
Utilisez TextCortex pour maintenir la cohérence de la connexion tout en testant différentes familles de modèles.
- Utilisez le même ensemble de tâches représentatif.
- Enregistrez les identifiants du modèle et les paramètres de demande.
- Appliquez la même validation de sortie.
- Mesurez l’utilisation totale, les résultats acceptés et la latence.
- Répétez l'opération lorsque l'invite ou la version du modèle change.
Itinéraire où le résultat le justifie
Un modèle plus performant peut être intéressant pour les demandes difficiles, même si son taux de jetons est plus élevé. Une option plus petite ou plus rapide peut bien fonctionner pour une fonctionnalité plus simple.
Utilisez le Calculateur de coût API pour l'arithmétique des jetons et le guide d'itinéraire pour que les choix du modèle de production restent explicites.
