Definieren Sie ein akzeptiertes Ergebnis
Schreiben Sie eine Regel oder Rubrik dafür, ob eine Aufgabe erfolgreich war. Für eine Extraktion können gültige Felder und korrekte Werte erforderlich sein. Eine generierte Änderung kann das Bestehen von Projektprüfungen erfordern.
Halten Sie die Akzeptanzdefinition für alle Modellkandidaten gleich. Andernfalls können Unterschiede in der Bewertung eher auf die Bewertung als auf das Modell zurückzuführen sein.
Beziehen Sie jeden Modellaufruf in die Aufgabe ein
Fügen Sie die Eingabe- und Ausgabenutzung beim ersten Versuch, bei Wiederholungsversuchen und bei allen unterstützenden Modellaufrufen hinzu. Wenden Sie für jedes verwendete Modell den aktuellen Tarif an.
Teilen Sie die gesamten gemessenen API-Kosten durch die Anzahl der akzeptierten Aufgaben. Geben Sie neben dieser Zahl auch die Fehlerquote an, damit ein Modell, das die meisten Anfragen ablehnt, nicht künstlich attraktiv erscheint.
Führen Sie einen kontrollierten Vergleich durch
Verwenden Sie TextCortex, um die Verbindung beim Testen verschiedener Modellfamilien konsistent zu halten.
- Verwenden Sie denselben repräsentativen Aufgabensatz.
- Zeichnen Sie Modellkennungen auf und fordern Sie Einstellungen an.
- Wenden Sie dieselbe Ausgabevalidierung an.
- Messen Sie die Gesamtnutzung, akzeptierte Ergebnisse und Latenz.
- Wiederholen Sie diesen Vorgang, wenn sich die Eingabeaufforderung oder die Modellversion ändert.
Route dorthin, wo das Ergebnis es rechtfertigt
Bei schwierigen Anfragen kann sich ein leistungsfähigeres Modell lohnen, auch wenn die Token-Rate höher ist. Für eine einfachere Funktion eignet sich möglicherweise eine kleinere oder schnellere Option.
Verwenden Sie API-Kostenrechner für die Token-Arithmetik und Routenplaner, um die Auswahl des Produktionsmodells explizit zu halten.
