受け入れられた結果を定義する
タスクが成功したかどうかについてのルールまたはルーブリックを書きます。抽出には有効なフィールドと正しい値が必要な場合があります。生成された変更には、プロジェクト チェックに合格することが必要な場合があります。
モデル候補間で受け入れ定義を同じに保ちます。そうしないと、スコアの差がモデルではなく評価を反映する可能性があります。
すべてのモデル呼び出しをタスクに含める
最初の試行、再試行、およびサポートされているモデル呼び出しからの入出力の使用法を追加します。使用する各モデルの現在のレートを適用します。
測定された API コストの合計を、受け入れられたタスクの数で割ります。ほとんどのリクエストを拒否するモデルが人為的に魅力的に見えないように、その数値とともに失敗率をレポートします。
制御された比較を実行する
TextCortex を使用して、さまざまなモデル ファミリをテストする際に接続の一貫性を維持します。
- 同じ代表的なタスク セットを使用します。
- モデル識別子とリクエスト設定を記録します。
- 同じ出力検証を適用します。
- 合計使用量、受け入れられた結果、待ち時間を測定します。
- プロンプトまたはモデルのバージョンが変更された場合は、この手順を繰り返します。
結果がそれを正当化するルート
トークン レートが高くても、より有能なモデルは、困難なリクエストに対して価値がある場合があります。より単純な機能には、より小さいまたは高速なオプションが適切に機能する可能性があります。
トークンの演算には APIコスト計算ツール を使用し、運用モデルの選択を明示的に保つために ルーティングガイド を使用します。
