Definire un risultato accettato
Scrivi una regola o una rubrica per stabilire se un'attività ha avuto successo. Un'estrazione può richiedere campi validi e valori corretti; una modifica generata può richiedere il superamento dei controlli di progetto.
Mantenere la stessa definizione di accettazione per tutti i candidati modello. Altrimenti le differenze nel punteggio potrebbero riflettere la valutazione piuttosto che il modello.
Includere ogni chiamata del modello nell'attività
Aggiungi l'utilizzo di input e output dal primo tentativo, dai tentativi e da eventuali chiamate al modello di supporto. Applicare la tariffa attuale per ciascun modello utilizzato.
Dividere il costo totale misurato dell'API per il numero di attività accettate. Riporta il tasso di fallimento insieme a quella cifra in modo che un modello che rifiuta la maggior parte delle richieste non possa sembrare artificialmente attraente.
Esegui un confronto controllato
Utilizza TextCortex per mantenere la connessione coerente durante il test di diverse famiglie di modelli.
- Utilizzare lo stesso insieme di attività rappresentativo.
- Registra gli identificatori del modello e le impostazioni della richiesta.
- Applicare la stessa convalida dell'output.
- Misura l'utilizzo totale, i risultati accettati e la latenza.
- Ripetere quando cambia la versione del prompt o del modello.
Percorso dove il risultato lo giustifica
Un modello più capace può essere utile per richieste difficili anche se il suo tasso di token è più alto. Un'opzione più piccola o più veloce potrebbe funzionare bene per una funzionalità più semplice.
Utilizzare Calcolatore dei costi API per l'aritmetica dei token e guida al percorso per mantenere esplicite le scelte del modello di produzione.
