허용된 결과 정의
작업 성공 여부에 대한 규칙이나 루브릭을 작성합니다. 추출에는 유효한 필드와 올바른 값이 필요할 수 있습니다. 생성된 변경 사항에는 프로젝트 검사를 통과해야 할 수도 있습니다.
모델 후보 전체에 걸쳐 수용 정의를 동일하게 유지합니다. 그렇지 않으면 점수의 차이가 모델이 아닌 평가를 반영할 수 있습니다.
작업에 모든 모델 호출을 포함합니다.
첫 번째 시도, 재시도 및 지원 모델 호출의 입력 및 출력 사용량을 추가합니다. 사용된 각 모델에 현재 요율을 적용합니다.
측정된 총 API 비용을 허용된 작업 수로 나눕니다. 대부분의 요청을 거부하는 모델이 인위적으로 매력적으로 보이지 않도록 해당 수치와 함께 실패율을 보고합니다.
통제된 비교 실행
다양한 모델군을 테스트하는 동안 연결의 일관성을 유지하려면 TextCortex를 사용하세요.
- 동일한 대표 작업 세트를 사용합니다.
- 모델 식별자와 요청 설정을 기록합니다.
- 동일한 출력 유효성 검사를 적용합니다.
- 총 사용량, 허용된 결과 및 대기 시간을 측정합니다.
- 프롬프트 또는 모델 버전이 변경되면 반복합니다.
결과가 정당한 경로
토큰 비율이 더 높더라도 어려운 요청에는 더 유능한 모델이 가치가 있을 수 있습니다. 더 간단한 기능에는 더 작거나 더 빠른 옵션이 적합할 수 있습니다.
토큰 산술에는 API 비용 계산기를 사용하고 생산 모델 선택을 명시적으로 유지하려면 라우팅 가이드를 사용합니다.
