Établir une limite d'API côté serveur
Conservez la clé TextCortex dans l'environnement du serveur et authentifiez les utilisateurs de votre propre application avant de faire des demandes de modèle. Limitez la taille d’entrée et les paramètres que les clients peuvent soumettre.
Conservez les identifiants de modèle approuvés et les paramètres par défaut dans la configuration. Utilisez une configuration distincte pour les charges de travail qui nécessitent une inférence hébergée dans l’UE.
Valider avant d'envoyer le trafic de production
Créez un ensemble de requêtes qui couvre les entrées normales, le contenu mal formé, le contexte manquant et les fonctionnalités du modèle que vous utilisez. Vérifiez l'analyse de la sortie, les outils, le streaming et l'annulation.
Exercez le comportement de l'application en matière de délais d'attente, d'informations d'identification non valides, de modèles inconnus et de limites de débit. Limitez les tentatives et évitez de répéter des actions externes.
Introduire le trafic progressivement
Commencez avec une petite charge de travail éligible. Comparez le taux de réussite, la latence et l'utilisation des jetons par rapport à vos critères d'acceptation et à votre configuration précédente.
Enregistrez quel modèle a répondu à chaque demande. Conservez suffisamment d’informations pour diagnostiquer les régressions tout en minimisant le contenu sensible conservé dans les journaux.
Développez avec un processus de publication
L'ajout d'un modèle constitue un changement de produit lorsqu'il peut modifier les réponses, le coût ou le lieu de traitement.
- Évaluez le nouveau modèle sur l’ensemble de requêtes établi.
- Examiner les capacités et les exigences régionales.
- Faites la promotion de la configuration avec un chemin de restauration explicite.
- Surveillez les résultats des tâches après la publication.
