Misurare la richiesta che arriva al modello
I token di input includono il materiale inviato dall'applicazione: istruzioni, cronologia delle conversazioni, passaggi recuperati e risultati dello strumento. Una breve domanda dell’utente può quindi generare un input molto più ampio.
I token di output variano in base alla risposta richiesta e alle impostazioni del modello. Misura entrambi i lati su un campione rappresentativo invece di fare previsioni da un unico prompt.
Contare i tentativi falliti
Un'estrazione non corretta, un timeout o una risposta rifiutata dal validatore possono portare a un'altra richiesta. Includi questi tentativi nel calcolo del costo per risultato.
Imposta una politica di tentativi limitati. Riprovare immediatamente ogni errore può aumentare sia la spesa che il carico senza migliorare il risultato, soprattutto se il problema è una richiesta non valida.
Confronta i modelli utilizzando la stessa attività
Utilizza l'API TextCortex per eseguire la stessa richiesta approvata impostata sui modelli candidati.
- Mantenere costanti il compito e i criteri di successo.
- Registra la versione del modello e le impostazioni di generazione.
- Acquisisci l'utilizzo fatturato e le tariffe attuali.
- Conta risultati validi, tentativi ripetuti e fallimenti.
- Confronta i tempi end-to-end con i costi.
Costruisci la previsione mensile
Moltiplicare il costo misurato per attività completata per il volume di attività previsto. Mantieni stime separate per le funzionalità che utilizzano modelli o forme di richiesta diversi.
Utilizzare calcolatore di gettoni per l'aritmetica di base. Aggiungi costi fuori stima in base alle regole di fatturazione del modello selezionato, quindi rivedi la previsione man mano che arriva il traffico effettivo.
