1. Faça um inventário da integração atual
Inceptron publica configurações de modelo e opções de veiculação. Compare a configuração exata que sua carga de trabalho usa, incluindo quantização e versão do modelo, em vez de combinar apenas um nome de família.
Registre os identificadores de modelo, parâmetros de solicitação, ferramentas, comportamento de streaming e formatos de saída dos quais seu aplicativo depende. Mantenha uma cópia da configuração do cliente existente para reversão.
2. Mapear identificadores do modelo de destino
Recupere o catálogo TextCortex usando GET /models. Combine cada tarefa de aplicação com um modelo disponível, incluindo a rota hospedada na UE, quando necessário.
Um identificador específico do provedor não é portátil por padrão. Defina explicitamente o identificador de destino e revise qualquer raciocínio específico do modelo ou configurações de geração.
3. Configure o cliente TextCortex
Crie um Conta TextCortex e gere uma chave API nas configurações da conta. Instale o pacote OpenAI Python em seu servidor. Armazene a chave em TEXTCORTEX_API_KEY e defina TEXTCORTEX_MODEL para um identificador retornado por GET /models.
Este exemplo mantém credenciais em variáveis de ambiente. A mesma configuração do cliente funciona quando você escolhe outro modelo compatível. Leia o Referência da API para parâmetros específicos do endpoint.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["TEXTCORTEX_API_KEY"],
base_url="https://api.textcortex.com/v1",
)
for model in client.models.list():
print(model.id)
response = client.chat.completions.create(
model=os.environ["TEXTCORTEX_MODEL"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)
4. Reproduza um conjunto de solicitações de representante
Execute entradas de teste sintéticas ou aprovadas por meio de ambas as integrações. Mantenha ações externas como e-mails ou compras desativadas durante o teste.
- Compare a qualidade da resposta e a validade da saída estruturada.
- Verifique pedaços de streaming, argumentos de ferramentas e cancelamento.
- Exercite erros de autenticação, limites de taxa e tempos limite.
- Meça o uso e a latência sob a simultaneidade esperada.
5. Mude gradualmente e mantenha a rota anterior
Introduza uma pequena parcela do tráfego qualificado após a aprovação nas verificações de aceitação. Rastreie falhas e modele o uso por rota para identificar regressões rapidamente.
Mantenha uma configuração de reversão até que o período de monitoramento seja concluído. Remova apenas credenciais e serviços que não são mais usados. Use o guia de roteamento para organizar futuras escolhas de modelos.
