Mät begäran som når modellen
Inmatningstokens inkluderar det material som din ansökan skickar: instruktioner, konversationshistorik, hämtade stycken och verktygsresultat. En kort användarfråga kan därför generera en mycket större input.
Utdatatokens varierar med det begärda svaret och modellinställningarna. Mät båda sidor över ett representativt urval istället för att prognostisera från en enda prompt.
Räkna misslyckade försök
Ett felaktigt utdrag, timeout eller svar som avvisats av din validerare kan leda till en annan begäran. Inkludera dessa försök i din kostnad per resultat-beräkning.
Ställ in en policy för begränsat försök igen. Om du omedelbart försöker igen varje misslyckande kan det öka både utgifterna och belastningen utan att resultatet förbättras, särskilt om problemet är en ogiltig begäran.
Jämför modeller med samma uppgift
Använd TextCortex API för att köra samma godkända begäran mot kandidatmodeller.
- Håll uppgiften och framgångskriterierna konstanta.
- Spela in modellversion och generationsinställningar.
- Fånga fakturerad användning och aktuella priser.
- Räkna giltiga resultat, upprepade försök och misslyckanden.
- Jämför slut-till-änd-tid tillsammans med kostnad.
Bygg månadsprognosen
Multiplicera den uppmätta kostnaden per utförd uppgift med förväntad uppgiftsvolym. Håll separata uppskattningar för funktioner som använder olika modeller eller begär former.
Använd token-kalkylator för den grundläggande aritmetiken. Lägg till avgifter utanför den uppskattningen enligt den valda modellens faktureringsregler och granska sedan prognosen när den faktiska trafiken kommer.
