모델에 도달하는 요청 측정
입력 토큰에는 지침, 대화 기록, 검색된 구절 및 도구 결과 등 애플리케이션이 보내는 자료가 포함됩니다. 따라서 짧은 사용자 질문으로 인해 훨씬 더 많은 입력이 생성될 수 있습니다.
출력 토큰은 요청된 답변 및 모델 설정에 따라 다릅니다. 단일 프롬프트에서 예측하는 대신 대표 표본을 통해 양측을 측정합니다.
실패한 시도 횟수 계산
잘못된 형식의 추출, 시간 초과 또는 유효성 검사기가 거부한 답변으로 인해 다른 요청이 발생할 수 있습니다. 결과당 비용 계산에 이러한 시도를 포함하십시오.
제한된 재시도 정책을 설정합니다. 모든 실패를 즉시 재시도하면 결과를 개선하지 못한 채 지출과 부하가 모두 증가할 수 있습니다. 특히 문제가 잘못된 요청인 경우 더욱 그렇습니다.
동일한 작업을 사용하는 모델 비교
TextCortex API를 사용하여 후보 모델에 대해 승인된 동일한 요청 세트를 실행하세요.
- 작업과 성공 기준을 일정하게 유지하세요.
- 모델 버전 및 세대 설정을 기록합니다.
- 청구된 사용량과 현재 요금을 파악하세요.
- 유효한 결과, 반복된 시도 및 실패를 계산합니다.
- 비용과 함께 전체 시간을 비교하세요.
월간 예측 구축
완료된 작업당 측정된 비용에 예상 작업량을 곱합니다. 다양한 모델을 사용하거나 형태를 요청하는 기능에 대해서는 별도의 추정치를 유지하세요.
기본 연산에는 토큰 계산기를 사용합니다. 선택한 모델의 과금 규칙에 따라 예상 범위를 벗어나는 요금을 추가한 후 실제 트래픽이 발생하면 예측을 검토하세요.
