サーバー側の API 境界を確立する
TextCortex キーをサーバー環境に保持し、モデルをリクエストする前に独自のアプリケーションのユーザーを認証します。クライアントが送信できる入力サイズとパラメータを制限します。
承認されたモデル識別子とデフォルト設定を構成で維持します。 EU域内でホストされる推論を必要とするワークロードには別の構成を使用します。
運用トラフィックを送信する前に検証する
通常の入力、不正な形式のコンテンツ、欠落しているコンテキスト、および使用するモデル機能をカバーするリクエスト セットを作成します。出力の解析、ツール、ストリーミング、キャンセルを確認します。
タイムアウト、無効な資格情報、不明なモデル、およびレート制限に対するアプリケーションの動作を実行します。再試行を制限し、外部アクションを繰り返さないようにします。
トラフィックを段階的に導入する
対象となる小規模なワークロードから始めます。成功率、レイテンシー、トークンの使用状況を受け入れ基準および以前の構成と比較します。
どのモデルが各リクエストを処理したかを記録します。ログに保持される機密コンテンツを最小限に抑えながら、回帰を診断するのに十分な情報を保持します。
リリースプロセスで拡張する
モデルの追加は、回答、コスト、または処理場所を変更する可能性がある場合、製品の変更となります。
- 確立されたリクエスト セットに基づいて新しいモデルを評価します。
- 機能と地域の要件を確認します。
- 明示的なロールバック パスを使用して構成をプロモートします。
- リリース後にタスクの結果を監視します。
