1. 현재 통합 목록 작성
서버리스 추론 요청을 전용 배포 또는 사용자 지정 모델 종속성과 분리하세요. 공통 모델 API로 이동해도 배포가 자동으로 전송되지 않습니다.
애플리케이션이 의존하는 모델 식별자, 요청 매개변수, 도구, 스트리밍 동작 및 출력 형식을 기록합니다. 롤백을 위해 기존 클라이언트 구성의 복사본을 보관하세요.
2. 대상 모델 식별자 매핑
GET /models를 사용하여 TextCortex 카탈로그를 검색합니다. 필요한 경우 EU에서 호스팅하는 경로를 포함하여 각 애플리케이션 작업을 사용 가능한 모델에 연결합니다.
공급자별 식별자는 기본적으로 이식 가능하지 않습니다. 대상 식별자를 명시적으로 설정하고 모델별 추론 또는 생성 설정을 검토합니다.
3. TextCortex 클라이언트 구성
TextCortex 계정를 생성하고 계정 설정에서 API 키를 생성하세요. 서버에 OpenAI Python 패키지를 설치합니다. 키를 TEXTCORTEX_API_KEY에 저장하고 TEXTCORTEX_MODEL를 GET /models에서 반환된 식별자로 설정합니다.
이 예에서는 환경 변수에 자격 증명을 유지합니다. 지원되는 다른 모델을 선택해도 동일한 클라이언트 구성이 작동합니다. 엔드포인트별 매개변수에 대해서는 API 참조를 읽어보세요.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["TEXTCORTEX_API_KEY"],
base_url="https://api.textcortex.com/v1",
)
for model in client.models.list():
print(model.id)
response = client.chat.completions.create(
model=os.environ["TEXTCORTEX_MODEL"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)
4. 대표 요청 세트 재생
두 통합을 통해 합성 또는 승인된 테스트 입력을 실행합니다. 테스트 중에는 이메일이나 구매 등의 외부 작업을 비활성화하세요.
- 답변 품질과 구조화된 출력 타당성을 비교합니다.
- 스트리밍 청크, 도구 인수 및 취소를 확인하세요.
- 인증 오류, 속도 제한 및 시간 초과를 실행합니다.
- 예상되는 동시성에서 사용량과 대기 시간을 측정합니다.
5. 점진적으로 전환하고 이전 경로를 유지합니다.
승인 확인이 통과된 후 적격 트래픽의 일부를 소개합니다. 회귀를 신속하게 식별할 수 있도록 경로별로 실패 및 모델 사용을 추적합니다.
모니터링 기간이 완료될 때까지 롤백 구성을 유지합니다. 더 이상 사용하지 않는 자격 증명과 서비스만 제거하세요. 라우팅 가이드를 사용하여 향후 모델 선택을 구성하세요.
