Richten Sie eine serverseitige API-Grenze ein
Behalten Sie den TextCortex-Schlüssel in der Serverumgebung und authentifizieren Sie die Benutzer Ihrer eigenen Anwendung, bevor Sie Modellanforderungen stellen. Begrenzen Sie die Eingabegröße und Parameter, die Clients übermitteln können.
Behalten Sie genehmigte Modellkennungen und Standardeinstellungen in der Konfiguration bei. Verwenden Sie eine separate Konfiguration für Workloads, die eine in der EU gehostete Inferenz erfordern.
Überprüfen Sie, bevor Sie Produktionsdatenverkehr senden
Erstellen Sie einen Anforderungssatz, der normale Eingaben, fehlerhafte Inhalte, fehlenden Kontext und die von Ihnen verwendeten Modellfunktionen abdeckt. Überprüfen Sie Ausgabeparsing, Tools, Streaming und Stornierung.
Üben Sie das Anwendungsverhalten bei Zeitüberschreitungen, ungültigen Anmeldeinformationen, unbekannten Modellen und Ratenbeschränkungen aus. Halten Sie die Anzahl der Wiederholungsversuche begrenzt und vermeiden Sie die Wiederholung externer Aktionen.
Führen Sie den Verkehr schrittweise ein
Beginnen Sie mit einem kleinen zulässigen Arbeitspensum. Vergleichen Sie Erfolgsrate, Latenz und Token-Nutzung mit Ihren Akzeptanzkriterien und der vorherigen Konfiguration.
Notieren Sie, welches Modell die jeweilige Anfrage bedient hat. Bewahren Sie genügend Informationen auf, um Regressionen zu diagnostizieren, und minimieren Sie gleichzeitig den vertraulichen Inhalt, der in Protokollen gespeichert wird.
Erweitern Sie mit einem Release-Prozess
Das Hinzufügen eines Modells ist eine Produktänderung, wenn dadurch Antworten, Kosten oder Verarbeitungsort geändert werden können.
- Bewerten Sie das neue Modell anhand des etablierten Anforderungssatzes.
- Überprüfen Sie die Fähigkeiten und regionalen Anforderungen.
- Fördern Sie die Konfiguration mit einem expliziten Rollback-Pfad.
- Überwachen Sie die Aufgabenergebnisse nach der Veröffentlichung.
