Definieer succes voordat u een model kiest
Definieer voor extractie de vereiste velden en hoe u met ontbrekende waarden omgaat. Definieer voor het coderen de controles die een voorgestelde wijziging moet doorstaan. Definieer voor gesprekken behulpzaamheid, feitelijke ondersteuning en escalatiegedrag.
Gebruik een representatieve invoerset met gewone en moeilijke gevallen. Houd de testset gescheiden van voorbeelden die worden gebruikt om aanwijzingen af te stemmen.
Filter de catalogus op vereisten
Kies modellen met de invoertypen, het uitvoergedrag en de tools die uw functie nodig heeft. Pas de vereisten voor de verwerkingsregio toe voordat u de prestaties test.
Haal identificatiegegevens op uit de TextCortex-modelcatalogus. Bewaar versie- en routegegevens in het experiment, zodat de resultaten niet per ongeluk worden toegeschreven aan een andere implementatie.
Meet meer dan een kopscore
Voer dezelfde taak uit op kandidaat-modellen en gebruik voor elk de juiste instellingen.
- Beoordeel geldige en bruikbare resultaten aan de hand van een geschreven rubriek.
- Registreer de latentie van het eerste token en het voltooide antwoord.
- Meet tokengebruik en herhaalde pogingen.
- Inspecteer toolargumenten en uitvoerparseerfouten.
- Evalueer waar nodig de gekozen in de EU gehoste route.
Wijs modellen toe aan functies en bekijk de keuze opnieuw
Verschillende kenmerken kunnen verschillende modellen rechtvaardigen. Houd de taak-naar-model-toewijzing in de configuratie en bewaak de resultaten na de implementatie.
Evalueer opnieuw wanneer aanwijzingen, verkeer of modelversies veranderen. Gebruik de routebeschrijving om de selectie beheersbaar te houden en de prijscalculator om het verbruik in te schatten.
