Payez le prix plein une fois. Réutilisez au tarif du cache.
Les jetons de prompt répétés sont facturés au tarif cache du fournisseur — souvent une fraction du prix d'entrée — et l'économie apparaît sur le reçu plutôt que dans une projection.
- Les préfixes éligibles à la mise en cache sont facturés au tarif cache du fournisseur sur des fenêtres éphémères de 5 minutes et 1 heure.
- cached_tokens apparaît sur chaque reçu, de sorte que l'économie est vérifiable plutôt qu'affirmée.
- Rien à configurer côté client — cache_control est transmis directement au fournisseur qui le prend en charge.
La majeure partie de votre prompt ne change jamais.
Le prompt système, le schéma, les exemples en quelques coups, le document sur lequel vous travaillez — les mêmes tokens, envoyés encore et encore. Mis en cache, ils sont facturés au tarif cache du fournisseur, généralement un dixième du prix d'entrée standard.
Et vous pouvez vérifier le calcul.
cached_tokens figure sur chaque reçu, à côté des tokens facturés au plein tarif. L'économie réalisée est un chiffre que vous pouvez additionner en fin de mois, pas un pourcentage dans un argumentaire commercial.