Meça a solicitação que chega ao modelo
Os tokens de entrada incluem o material que seu aplicativo envia: instruções, histórico de conversas, passagens recuperadas e resultados da ferramenta. Uma pergunta curta do usuário pode, portanto, gerar uma contribuição muito maior.
Os tokens de saída variam de acordo com a resposta solicitada e as configurações do modelo. Meça ambos os lados em uma amostra representativa em vez de fazer previsões a partir de um único prompt.
Contar tentativas malsucedidas
Uma extração malformada, tempo limite ou resposta rejeitada pelo seu validador pode levar a outra solicitação. Inclua essas tentativas em seu cálculo de custo por resultado.
Defina uma política de repetição limitada. Tentar novamente todas as falhas imediatamente pode aumentar o gasto e a carga sem melhorar o resultado, especialmente se o problema for uma solicitação inválida.
Compare modelos usando a mesma tarefa
Use a API TextCortex para executar a mesma solicitação aprovada definida em modelos candidatos.
- Mantenha constantes os critérios de tarefa e sucesso.
- Registre a versão do modelo e as configurações de geração.
- Capture o uso faturado e as taxas atuais.
- Conte resultados válidos, tentativas repetidas e falhas.
- Compare o tempo de ponta a ponta com o custo.
Construa a previsão mensal
Multiplique o custo medido por tarefa concluída pelo volume de tarefas esperado. Mantenha estimativas separadas para recursos que usam modelos ou formatos de solicitação diferentes.
Use calculadora de tokens para a aritmética básica. Adicione cobranças fora dessa estimativa de acordo com as regras de cobrança do modelo selecionado e revise a previsão conforme o tráfego real chega.
