Medir la solicitud que llega al modelo
Los tokens de entrada incluyen el material que envía su aplicación: instrucciones, historial de conversaciones, pasajes recuperados y resultados de herramientas. Por lo tanto, una pregunta breve de un usuario puede generar una entrada mucho mayor.
Los tokens de salida varían según la respuesta solicitada y la configuración del modelo. Mida ambos lados sobre una muestra representativa en lugar de realizar pronósticos a partir de un solo mensaje.
Contar intentos fallidos
Una extracción mal formada, un tiempo de espera o una respuesta rechazada por su validador pueden dar lugar a otra solicitud. Incluya esos intentos en su cálculo de costo por resultado.
Establezca una política de reintento limitada. Reintentar cada error inmediatamente puede aumentar tanto el gasto como la carga sin mejorar el resultado, especialmente si el problema es una solicitud no válida.
Comparar modelos usando la misma tarea
Utilice la API TextCortex para ejecutar el mismo conjunto de solicitudes aprobadas en modelos candidatos.
- Mantenga constantes la tarea y los criterios de éxito.
- Registre la versión del modelo y la configuración de generación.
- Capture el uso facturado y las tarifas actuales.
- Cuente resultados válidos, intentos repetidos y fracasos.
- Compare el tiempo de un extremo a otro con el costo.
Construya el pronóstico mensual
Multiplique el costo medido por tarea completada por el volumen de tarea esperado. Mantenga estimaciones separadas para las funciones que utilizan diferentes modelos o solicitan formas.
Utilice el calculadora de fichas para la aritmética básica. Agregue cargos fuera de esa estimación de acuerdo con las reglas de facturación del modelo seleccionado y luego revise el pronóstico a medida que llegue el tráfico real.
