Definire il successo prima di scegliere un modello
Per l'estrazione, definire i campi obbligatori e come gestire i valori mancanti. Per la codifica, definire i controlli che una proposta di modifica deve superare. Per la conversazione, definire l'utilità, il supporto fattuale e il comportamento di escalation.
Utilizzare un set di input rappresentativo con casi ordinari e difficili. Mantenere il set di test separato dagli esempi utilizzati per ottimizzare i prompt.
Filtra il catalogo per requisiti
Scegli i modelli con i tipi di input, il comportamento di output e gli strumenti di cui la tua funzionalità ha bisogno. Applicare i requisiti della regione di elaborazione prima di testare le prestazioni.
Ottieni identificatori dal catalogo dei modelli TextCortex. Mantieni i dettagli della versione e del percorso nell'esperimento in modo che i risultati non vengano attribuiti accidentalmente a una distribuzione diversa.
Misura più di un punteggio principale
Esegui la stessa attività su tutti i modelli candidati utilizzando le impostazioni appropriate per ciascuno.
- Valuta i risultati validi e utili rispetto a una rubrica scritta.
- Registra la latenza del primo token e della risposta completata.
- Misura l'utilizzo dei token e i tentativi ripetuti.
- Esamina gli argomenti dello strumento e gli errori di analisi dell'output.
- Valutare il percorso scelto ospitato nell'UE, ove richiesto.
Assegna i modelli alle funzionalità, quindi rivisita la scelta
Caratteristiche diverse possono giustificare modelli diversi. Mantieni la mappatura tra attività e modello nella configurazione e monitora i risultati dopo l'implementazione.
Rivalutare quando cambiano le richieste, il traffico o le versioni del modello. Utilizza guida al percorso per mantenere la selezione gestibile e calcolatore dei prezzi per stimare l'utilizzo.
