Definir un resultado aceptado
Escribe una regla o rúbrica para determinar si una tarea se realizó correctamente. Una extracción puede requerir campos válidos y valores correctos; un cambio generado puede requerir pasar controles del proyecto.
Mantenga la misma definición de aceptación en todos los modelos candidatos. De lo contrario, las diferencias en la puntuación pueden reflejar la evaluación más que el modelo.
Incluir cada llamada de modelo en la tarea.
Agregue el uso de entrada y salida desde el primer intento, los reintentos y cualquier llamada de modelo de soporte. Aplicar la tarifa vigente para cada modelo utilizado.
Divida el costo total de API medido por la cantidad de tareas aceptadas. Informe la tasa de fracaso junto con esa cifra para que un modelo que rechace la mayoría de las solicitudes no parezca artificialmente atractivo.
Realizar una comparación controlada
Utilice TextCortex para mantener la conexión constante mientras prueba diferentes familias de modelos.
- Utilice el mismo conjunto de tareas representativo.
- Registre identificadores de modelo y solicite configuraciones.
- Aplique la misma validación de salida.
- Mida el uso total, los resultados aceptados y la latencia.
- Repita cuando cambie el mensaje o la versión del modelo.
Ruta donde el resultado lo justifica
Un modelo más capaz puede valer la pena para solicitudes difíciles incluso si su tasa de token es mayor. Una opción más pequeña o más rápida puede funcionar bien para una función más sencilla.
Utilice el Calculadora de costos API para aritmética de tokens y el guía de ruta para mantener explícitas las opciones del modelo de producción.
