Meet het verzoek dat het model bereikt
Invoertokens omvatten het materiaal dat uw applicatie verzendt: instructies, gespreksgeschiedenis, opgehaalde passages en toolresultaten. Een korte gebruikersvraag kan dus een veel grotere input genereren.
Uitvoertokens variëren afhankelijk van de gevraagde antwoord- en modelinstellingen. Meet beide zijden over een representatief monster in plaats van te voorspellen op basis van één enkele aanwijzing.
Tel mislukte pogingen
Een verkeerd opgemaakte extractie, time-out of afgewezen antwoord door uw validator kan leiden tot een nieuw verzoek. Neem deze pogingen mee in uw berekening van de kosten per resultaat.
Stel een beleid voor beperkt opnieuw proberen in. Als u elke fout onmiddellijk opnieuw probeert, kunnen zowel de uitgaven als de belasting toenemen zonder dat het resultaat verbetert, vooral als het probleem een ongeldig verzoek is.
Vergelijk modellen met dezelfde taak
Gebruik de TextCortex API om hetzelfde goedgekeurde verzoek uit te voeren voor kandidaatmodellen.
- Houd de taak- en succescriteria constant.
- Registreer de modelversie en generatie-instellingen.
- Leg het gefactureerde gebruik en de huidige tarieven vast.
- Tel geldige resultaten, herhaalde pogingen en mislukkingen.
- Vergelijk de end-to-end-tijd en de kosten.
Stel de maandelijkse prognose op
Vermenigvuldig de gemeten kosten per voltooide taak met het verwachte taakvolume. Houd afzonderlijke schattingen bij voor functies die verschillende modellen gebruiken of vormen aanvragen.
Gebruik de token rekenmachine voor de basisrekenkunde. Voeg kosten toe buiten deze schatting volgens de factureringsregels van het geselecteerde model en bekijk vervolgens de prognose zodra er daadwerkelijk verkeer binnenkomt.
