モデルを選択する前に成功を定義する
抽出の場合は、必須フィールドと欠損値の処理方法を定義します。コーディングでは、提案された変更が通過する必要があるチェックを定義します。会話については、有用性、事実のサポート、エスカレーション動作を定義します。
一般的なケースと困難なケースを含む代表的な入力セットを使用します。テスト セットは、プロンプトの調整に使用されるサンプルとは別にしてください。
要件によってカタログをフィルタリングする
機能に必要な入力タイプ、出力動作、ツールを備えたモデルを選択してください。パフォーマンスをテストする前に、処理領域の要件を適用します。
TextCortex モデル カタログから識別子を取得します。結果が誤って別のデプロイメントに起因することがないように、実験のバージョンとルートの詳細を保持してください。
ヘッドラインスコア以上のものを測定する
それぞれに適切な設定を使用して、候補モデル間で同じタスクを実行します。
- 書かれたルーブリックと照らし合わせて、有効かつ有用な結果を評価します。
- 最初のトークンと完了した応答の待ち時間を記録します。
- トークンの使用量と反復試行を測定します。
- ツールの引数を検査し、解析エラーを出力します。
- 必要に応じて、選択した EU域内ホストのルートを評価します。
モデルを機能に割り当ててから、選択を再検討します
異なる機能が異なるモデルを正当化することができます。タスクとモデルのマッピングを構成に保持し、ロールアウト後の結果を監視します。
プロンプト、トラフィック、モデルのバージョンが変更された場合は再評価します。選択を管理しやすい状態に保つには ルーティングガイド を使用し、使用量を見積もるには 価格計算ツール を使用します。
