모델을 선택하기 전에 성공을 정의하세요
추출을 위해 필수 필드와 누락된 값을 처리하는 방법을 정의합니다. 코딩을 위해 제안된 변경 사항이 통과해야 하는 검사를 정의합니다. 대화를 위해 유용성, 사실적 지원 및 에스컬레이션 행동을 정의합니다.
일반적인 경우와 어려운 경우에는 대표 입력 세트를 사용합니다. 프롬프트를 조정하는 데 사용되는 예제와 별도로 테스트 세트를 유지하십시오.
요구 사항별로 카탈로그 필터링
기능에 필요한 입력 유형, 출력 동작 및 도구를 갖춘 모델을 선택하세요. 성능을 테스트하기 전에 처리 지역 요구 사항을 적용하세요.
TextCortex 모델 카탈로그에서 식별자를 가져옵니다. 결과가 실수로 다른 배포로 인해 발생하지 않도록 실험에 버전 및 경로 세부 정보를 유지하세요.
헤드라인 점수 그 이상을 측정하세요
각 후보 모델에 대해 적절한 설정을 사용하여 동일한 작업을 실행합니다.
- 작성된 기준표를 기준으로 유효하고 유용한 결과를 평가하세요.
- 첫 번째 토큰 및 응답 완료 대기 시간을 기록합니다.
- 토큰 사용량과 반복 시도를 측정합니다.
- 도구 인수 및 출력 구문 분석 오류를 검사합니다.
- 필요한 경우 선택한 EU 호스팅 경로를 평가합니다.
모델을 기능에 할당한 다음 선택 항목을 다시 살펴보세요.
다양한 기능이 다양한 모델을 정당화할 수 있습니다. 구성에서 작업-모델 매핑을 유지하고 롤아웃 후 결과를 모니터링합니다.
프롬프트, 트래픽 또는 모델 버전이 변경되면 재평가하세요. 라우팅 가이드를 사용하여 선택 항목을 관리 가능하게 유지하고 가격 계산기를 사용하여 사용량을 추정합니다.
