Messen Sie die Anfrage, die das Modell erreicht
Eingabe-Tokens umfassen das Material, das Ihre Anwendung sendet: Anweisungen, Gesprächsverlauf, abgerufene Passagen und Tool-Ergebnisse. Eine kurze Benutzerfrage kann daher einen viel größeren Input generieren.
Ausgabetoken variieren je nach angeforderter Antwort und Modelleinstellungen. Messen Sie beide Seiten anhand einer repräsentativen Stichprobe, anstatt Prognosen anhand einer einzigen Eingabeaufforderung zu erstellen.
Zählen Sie erfolglose Versuche
Eine fehlerhafte Extraktion, eine Zeitüberschreitung oder eine von Ihrem Validator abgelehnte Antwort kann zu einer weiteren Anfrage führen. Beziehen Sie diese Versuche in Ihre Kosten-pro-Ergebnis-Berechnung ein.
Legen Sie eine Richtlinie für begrenzte Wiederholungen fest. Das sofortige Wiederholen jedes Fehlers kann sowohl die Ausgaben als auch die Auslastung erhöhen, ohne das Ergebnis zu verbessern, insbesondere wenn das Problem eine ungültige Anfrage ist.
Vergleichen Sie Modelle mit derselben Aufgabe
Verwenden Sie die TextCortex-API, um denselben genehmigten Anforderungssatz für Kandidatenmodelle auszuführen.
- Halten Sie die Aufgaben- und Erfolgskriterien konstant.
- Notieren Sie die Modellversion und die Generierungseinstellungen.
- Erfassen Sie die abgerechnete Nutzung und die aktuellen Tarife.
- Zählen Sie gültige Ergebnisse, wiederholte Versuche und Misserfolge.
- Vergleichen Sie die End-to-End-Zeit mit den Kosten.
Erstellen Sie die monatliche Prognose
Multiplizieren Sie die gemessenen Kosten pro erledigter Aufgabe mit dem erwarteten Aufgabenvolumen. Behalten Sie separate Schätzungen für Features bei, die unterschiedliche Modelle verwenden oder Formen anfordern.
Verwenden Sie Token-Rechner für die Grundrechenarten. Fügen Sie gemäß den Abrechnungsregeln des ausgewählten Modells Gebühren hinzu, die außerhalb dieser Schätzung liegen, und überprüfen Sie dann die Prognose, sobald der tatsächliche Datenverkehr eintrifft.
