Defina o sucesso antes de escolher um modelo
Para extração, defina os campos obrigatórios e como lidar com os valores ausentes. Para codificação, defina as verificações que uma mudança proposta deve passar. Para conversação, defina utilidade, suporte factual e comportamento de escalonamento.
Use um conjunto de entradas representativo com casos comuns e difíceis. Mantenha o conjunto de testes separado dos exemplos usados para ajustar os prompts.
Filtre o catálogo por requisitos
Escolha modelos com os tipos de entrada, comportamento de saída e ferramentas que seu recurso precisa. Aplique os requisitos da região de processamento antes de testar o desempenho.
Obtenha identificadores do catálogo de modelos TextCortex. Mantenha os detalhes da versão e da rota no experimento para que os resultados não sejam atribuídos acidentalmente a uma implantação diferente.
Avalie mais do que uma pontuação de título
Execute a mesma tarefa em modelos candidatos usando configurações apropriadas para cada um.
- Avalie resultados válidos e úteis em relação a uma rubrica escrita.
- Registre a latência do primeiro token e da resposta concluída.
- Meça o uso de tokens e tentativas repetidas.
- Inspecione os argumentos da ferramenta e as falhas de análise de saída.
- Avalie a rota escolhida hospedada na UE, quando necessário.
Atribua modelos a recursos e revise a escolha
Diferentes características podem justificar diferentes modelos. Mantenha o mapeamento tarefa-modelo configurado e monitore os resultados após a implementação.
Reavalie quando os prompts, o tráfego ou as versões do modelo mudarem. Use guia de roteamento para manter a seleção gerenciável e calculadora de preços para estimar o uso.
