モデルに届くリクエストを計測する
入力トークンには、アプリケーションが送信する内容 (命令、会話履歴、取得された文章、ツールの結果) が含まれます。したがって、短いユーザーの質問によって、はるかに大きな入力が生成される可能性があります。
出力トークンは、要求された回答とモデル設定によって異なります。単一のプロンプトから予測するのではなく、代表的なサンプルの両側を測定します。
失敗した試行をカウントする
不正な抽出、タイムアウト、またはバリデーターによって拒否された回答により、別のリクエストが発生する可能性があります。結果あたりのコストの計算には、それらの試行も含めてください。
制限付き再試行ポリシーを設定します。失敗するたびにすぐに再試行すると、特に問題が無効なリクエストである場合、結果が改善されずに費用と負荷の両方が増加する可能性があります。
同じタスクを使用してモデルを比較する
TextCortex API を使用して、同じ承認されたリクエスト セットを候補モデルに対して実行します。
- タスクと成功基準を一定に保ちます。
- モデルのバージョンと世代の設定を記録します。
- 請求された使用量と現在の料金を把握します。
- 有効な結果、繰り返された試行と失敗をカウントします。
- エンドツーエンドの時間をコストと比較します。
毎月の予測を立てる
完了したタスクごとに測定されたコストに、予想されるタスクの量を掛けます。異なるモデルを使用する機能や形状を要求する機能については、別途見積もりを作成してください。
基本的な演算には トークン計算機 を使用します。選択したモデルの請求ルールに従って見積もり外の料金を追加し、実際のトラフィックが到着したときに予測を確認します。
