1. 現在の統合のインベントリを作成する
Lyceum は、コンピューティング ワークロードと推論を組み合わせます。何を移行するかを選択する前に、GPU インスタンス、コンテナー、ストレージ、専用エンドポイントからのモデル API 呼び出しを分離します。
アプリケーションが依存するモデル識別子、リクエスト パラメーター、ツール、ストリーミング動作、および出力形式を記録します。ロールバック用に既存のクライアント構成のコピーを保持します。
2. 宛先モデル識別子のマッピング
GET /models を使用して、TextCortex カタログを取得します。各アプリケーション タスクを、必要に応じて EU域内でホストされるルートなど、利用可能なモデルと照合します。
プロバイダー固有の識別子は、デフォルトでは移植可能ではありません。宛先識別子を明示的に設定し、モデル固有の推論または生成設定を確認します。
3. TextCortex クライアントを構成する
TextCortexアカウント を作成し、アカウント設定で API キーを生成します。 OpenAI Python パッケージをサーバーにインストールします。キーを TEXTCORTEX_API_KEY に保存し、TEXTCORTEX_MODEL を GET /models によって返された識別子に設定します。
この例では、資格情報を環境変数に保持します。別のサポートされているモデルを選択した場合でも、同じクライアント構成が機能します。エンドポイント固有のパラメータについては、APIリファレンス を参照してください。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["TEXTCORTEX_API_KEY"],
base_url="https://api.textcortex.com/v1",
)
for model in client.models.list():
print(model.id)
response = client.chat.completions.create(
model=os.environ["TEXTCORTEX_MODEL"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)
4. 代表的なリクエストセットを再生する
両方の統合を通じて合成または承認されたテスト入力を実行します。テスト中は電子メールや購入などの外部アクションを無効にしてください。
- 回答の質と構造化された出力の妥当性を比較します。
- ストリーミング チャンク、ツール引数、キャンセルを確認します。
- 認証エラー、レート制限、タイムアウトを実行します。
- 予想される同時実行性の下で使用量とレイテンシを測定します。
5. 徐々に切り替えて前のルートを保持します
受け入れチェックに合格した後、対象となるトラフィックの一部を導入します。ルートごとに障害とモデルの使用状況を追跡することで、回帰を迅速に特定できます。
監視期間が完了するまでロールバック設定を保持します。使用されなくなった認証情報とサービスのみを削除してください。 ルーティングガイド を使用して、将来のモデルの選択を整理します。
