Defina el éxito antes de elegir un modelo
Para la extracción, defina los campos obligatorios y cómo manejar los valores faltantes. Para la codificación, defina las comprobaciones que debe pasar un cambio propuesto. Para la conversación, defina la ayuda, el apoyo factual y el comportamiento de escalada.
Utilice un conjunto de aportes representativo con casos comunes y difíciles. Mantenga el conjunto de prueba separado de los ejemplos utilizados para ajustar las indicaciones.
Filtrar el catálogo por requisitos
Elija modelos con los tipos de entrada, comportamiento de salida y herramientas que su función necesita. Aplique los requisitos de la región de procesamiento antes de probar el rendimiento.
Obtenga identificadores del catálogo de modelos TextCortex. Mantenga los detalles de la versión y la ruta en el experimento para que los resultados no se atribuyan accidentalmente a una implementación diferente.
Mida más que la puntuación de un titular
Ejecute la misma tarea en todos los modelos candidatos utilizando la configuración adecuada para cada uno.
- Califique resultados válidos y útiles comparándolos con una rúbrica escrita.
- Registre la latencia del primer token y de la respuesta completa.
- Mida el uso de tokens y los intentos repetidos.
- Inspeccione los argumentos de la herramienta y los errores de análisis de resultados.
- Evaluar la ruta elegida alojada en la UE cuando sea necesario.
Asigne modelos a funciones y luego revise la elección
Diferentes características pueden justificar diferentes modelos. Mantenga configurada la asignación de tarea a modelo y supervise los resultados después de la implementación.
Vuelva a evaluar cuando cambien las indicaciones, el tráfico o las versiones del modelo. Utilice el guía de ruta para mantener la selección manejable y el calculadora de precios para estimar el uso.
