Stabilire un limite API lato server
Conserva la chiave TextCortex nell'ambiente server e autentica gli utenti della tua applicazione prima di effettuare richieste di modello. Limita la dimensione dell'input e i parametri che i client possono inviare.
Mantieni gli identificatori del modello approvati e le impostazioni predefinite nella configurazione. Utilizza una configurazione separata per i carichi di lavoro che richiedono l'inferenza ospitata nell'UE.
Convalidare prima di inviare traffico di produzione
Crea un set di richieste che copra input normali, contenuti non corretti, contesto mancante e le funzionalità del modello che utilizzi. Controlla l'analisi dell'output, gli strumenti, lo streaming e la cancellazione.
Esercita il comportamento dell'applicazione in caso di timeout, credenziali non valide, modelli sconosciuti e limiti di velocità. Limita i tentativi ed evita di ripetere azioni esterne.
Introdurre il traffico gradualmente
Inizia con un piccolo carico di lavoro idoneo. Confronta la percentuale di successo, la latenza e l'utilizzo dei token con i criteri di accettazione e la configurazione precedente.
Registra quale modello ha servito ciascuna richiesta. Conserva informazioni sufficienti per diagnosticare le regressioni riducendo al minimo i contenuti sensibili conservati nei log.
Espandersi con un processo di rilascio
L'aggiunta di un modello è una modifica del prodotto quando può alterare le risposte, i costi o il luogo di elaborazione.
- Valutare il nuovo modello sul set di richieste stabilito.
- Esaminare le capacità e i requisiti regionali.
- Promuovere la configurazione con un percorso di rollback esplicito.
- Monitorare i risultati delle attività dopo il rilascio.
