Betaal de volle prijs één keer. Hergebruik tegen het cachetarief.
Herhaalde prompttokens worden gefactureerd tegen het cachetarief van de provider — vaak een fractie van de invoerprijs — en de besparing staat op het ontvangstbewijs in plaats van in een prognose.
- Cacheable prefixen worden gefactureerd tegen het cachetarief van de provider, over tijdvensters van 5 minuten en 1 uur.
- cached_tokens verschijnt op elk ontvangstbewijs, zodat de besparing controleerbaar is in plaats van aangenomen.
- Niets te configureren in uw client — cache_control wordt rechtstreeks doorgegeven aan de provider die dit ondersteunt.
Het grootste deel van je prompt verandert nooit.
De systeemprompt, het schema, de few-shot-voorbeelden, het document waarover je een vraag stelt — dezelfde tokens, keer op keer opnieuw verzonden. In de cache worden ze gefactureerd tegen het cachetarief van de aanbieder, wat doorgaans een tiende is van de normale invoerprijs.
En je kunt de berekening zelf controleren.
cached_tokens staat op elke factuur, naast de tokens waarvoor je de volledige prijs hebt betaald. De besparing is een bedrag dat je aan het einde van de maand kunt optellen — geen percentage in een verkooppraatje.