Définir le succès avant de choisir un modèle
Pour l'extraction, définissez les champs obligatoires et comment gérer les valeurs manquantes. Pour le codage, définissez les contrôles auxquels une modification proposée doit passer. Pour la conversation, définissez l’utilité, le support factuel et le comportement d’escalade.
Utilisez un ensemble d’entrées représentatif avec des cas ordinaires et des cas difficiles. Gardez l'ensemble de test séparé des exemples utilisés pour régler les invites.
Filtrer le catalogue par exigences
Choisissez des modèles avec les types d'entrée, le comportement de sortie et les outils dont votre fonctionnalité a besoin. Appliquez les exigences de la région de traitement avant de tester les performances.
Obtenez les identifiants du catalogue de modèles TextCortex. Conservez les détails de la version et de l'itinéraire dans l'expérience afin que les résultats ne soient pas accidentellement attribués à un déploiement différent.
Mesurer plus qu'un score global
Exécutez la même tâche sur tous les modèles candidats en utilisant les paramètres appropriés pour chacun.
- Évaluez les résultats valides et utiles par rapport à une rubrique écrite.
- Enregistrez la latence du premier jeton et de la réponse terminée.
- Mesurez l’utilisation des jetons et les tentatives répétées.
- Inspectez les arguments de l’outil et les échecs d’analyse des résultats.
- Évaluez l’itinéraire choisi hébergé dans l’UE, le cas échéant.
Attribuez des modèles aux fonctionnalités, puis revoyez le choix
Différentes caractéristiques peuvent justifier différents modèles. Conservez le mappage tâche-modèle dans la configuration et surveillez les résultats après le déploiement.
Réévaluez lorsque les invites, le trafic ou les versions du modèle changent. Utilisez le guide d'itinéraire pour garder la sélection gérable et le calculateur de prix pour estimer l'utilisation.
