Defina um resultado aceito
Escreva uma regra ou rubrica para saber se uma tarefa foi bem-sucedida. Uma extração pode exigir campos válidos e valores corretos; uma mudança gerada pode exigir a aprovação nas verificações do projeto.
Mantenha a definição de aceitação igual entre os candidatos modelo. Caso contrário, as diferenças na pontuação poderão reflectir a avaliação e não o modelo.
Incluir todas as chamadas de modelo na tarefa
Adicione o uso de entrada e saída desde a primeira tentativa, novas tentativas e quaisquer chamadas de modelo de suporte. Aplique a taxa atual para cada modelo utilizado.
Divida o custo total medido da API pelo número de tarefas aceitas. Relate a taxa de falha junto com esse número para que um modelo que rejeite a maioria das solicitações não possa parecer artificialmente atraente.
Execute uma comparação controlada
Use TextCortex para manter a conexão consistente enquanto testa diferentes famílias de modelos.
- Use o mesmo conjunto de tarefas representativo.
- Registre identificadores de modelo e configurações de solicitação.
- Aplique a mesma validação de saída.
- Meça o uso total, os resultados aceitos e a latência.
- Repita quando o prompt ou a versão do modelo mudar.
Rota onde o resultado o justifica
Um modelo mais capaz pode valer a pena para solicitações difíceis, mesmo que sua taxa de token seja maior. Uma opção menor ou mais rápida pode funcionar bem para um recurso mais simples.
Use Calculadora de custos de API para aritmética de token e guia de roteamento para manter explícitas as escolhas do modelo de produção.
