Definiera framgång innan du väljer en modell
För extraktion, definiera obligatoriska fält och hur man hanterar saknade värden. För kodning, definiera kontrollerna som en föreslagen ändring måste klara. För samtal, definiera hjälpsamhet, faktastöd och eskaleringsbeteende.
Använd en representativ ingångsuppsättning med vanliga fall och svåra. Håll testsetet åtskilt från exempel som används för att ställa in uppmaningar.
Filtrera katalogen efter krav
Välj modeller med de inmatningstyper, utdatabeteende och verktyg som din funktion behöver. Tillämpa krav på bearbetningsregion innan du testar prestanda.
Få identifierare från TextCortex modellkatalog. Behåll versions- och ruttinformation i experimentet så att resultaten inte av misstag tillskrivs en annan implementering.
Mät mer än en rubrikpoäng
Kör samma uppgift över kandidatmodeller med lämpliga inställningar för var och en.
- Betygsätt giltiga och användbara resultat mot en skriftlig rubrik.
- Spela in första token och slutfört svarsfördröjning.
- Mät tokenanvändning och upprepade försök.
- Inspektera verktygsargument och utdataanalysfel.
- Utvärdera den valda EU-värdade rutten vid behov.
Tilldela modeller till funktioner och se sedan om valet
Olika funktioner kan motivera olika modeller. Behåll kartläggningen från uppgift till modell i konfigurationen och övervaka resultaten efter lanseringen.
Omvärdera när uppmaningar, trafik eller modellversioner ändras. Använd vägledning för att hålla urvalet hanterbart och priskalkylator för att uppskatta användningen.
