Establecer un límite de API del lado del servidor
Mantenga la clave TextCortex en el entorno del servidor y autentique a los usuarios de su propia aplicación antes de realizar solicitudes de modelo. Limite el tamaño de entrada y los parámetros que los clientes pueden enviar.
Mantenga identificadores de modelo aprobados y configuraciones predeterminadas en la configuración. Utilice una configuración independiente para cargas de trabajo que requieran inferencia alojada en la UE.
Validar antes de enviar tráfico de producción
Cree un conjunto de solicitudes que cubra entradas normales, contenido con formato incorrecto, contexto faltante y las capacidades del modelo que utiliza. Verifique el análisis de salida, las herramientas, la transmisión y la cancelación.
Ejercite el comportamiento de la aplicación en caso de tiempos de espera, credenciales no válidas, modelos desconocidos y límites de velocidad. Mantenga los reintentos limitados y evite repetir acciones externas.
Introducir el tráfico gradualmente
Comience con una pequeña carga de trabajo elegible. Compare la tasa de éxito, la latencia y el uso de tokens con sus criterios de aceptación y configuración anterior.
Registre qué modelo atendió cada solicitud. Mantenga suficiente información para diagnosticar regresiones y al mismo tiempo minimice el contenido confidencial retenido en los registros.
Ampliar con un proceso de lanzamiento
Agregar un modelo es un cambio de producto cuando puede alterar las respuestas, el costo o la ubicación de procesamiento.
- Evaluar el nuevo modelo sobre el conjunto de solicitudes establecido.
- Revisar capacidades y requisitos regionales.
- Promocione la configuración con una ruta de reversión explícita.
- Supervise los resultados de las tareas después del lanzamiento.
