Estabeleça um limite de API do lado do servidor
Mantenha a chave TextCortex no ambiente do servidor e autentique os usuários da sua própria aplicação antes de fazer solicitações de modelo. Limite o tamanho da entrada e os parâmetros que os clientes podem enviar.
Mantenha identificadores de modelo aprovados e configurações padrão na configuração. Use configuração separada para cargas de trabalho que exigem inferência hospedada na UE.
Valide antes de enviar tráfego de produção
Crie um conjunto de solicitações que cubra entradas normais, conteúdo malformado, contexto ausente e os recursos de modelo que você usa. Verifique análise de saída, ferramentas, streaming e cancelamento.
Exercite o comportamento do aplicativo em relação a tempos limite, credenciais inválidas, modelos desconhecidos e limites de taxa. Mantenha as tentativas limitadas e evite repetir ações externas.
Introduza o tráfego gradualmente
Comece com uma pequena carga de trabalho qualificada. Compare a taxa de sucesso, a latência e o uso de tokens com seus critérios de aceitação e configuração anterior.
Registre qual modelo atendeu cada solicitação. Mantenha informações suficientes para diagnosticar regressões e, ao mesmo tempo, minimizar o conteúdo confidencial retido nos logs.
Expanda com um processo de lançamento
Adicionar um modelo é uma mudança de produto quando pode alterar respostas, custos ou local de processamento.
- Avalie o novo modelo no conjunto de solicitações estabelecido.
- Revise as capacidades e os requisitos regionais.
- Promova a configuração com um caminho de reversão explícito.
- Monitore os resultados das tarefas após o lançamento.
