Zapłać pełną cenę raz. Używaj ponownie po stawce z pamięci podręcznej.
Powtarzające się tokeny promptów są rozliczane według stawki cache dostawcy — często ułamek ceny wejściowej — a oszczędności trafiają na rachunek, a nie do prognoz.
- Prefiksy kwalifikujące się do buforowania są rozliczane według stawki cache dostawcy w oknach efemerycznych 5-minutowych i 1-godzinnych.
- cached_tokens pojawia się na każdym rachunku, więc oszczędności są weryfikowalne, a nie jedynie deklarowane.
- Nic nie trzeba konfigurować po stronie klienta — cache_control jest przekazywany bezpośrednio do obsługującego go dostawcy.
Większość Twojego promptu nigdy się nie zmienia.
Prompt systemowy, schemat, przykłady few-shot, analizowany dokument — te same tokeny wysyłane wciąż od nowa. Po zapisaniu w pamięci podręcznej są rozliczane według stawki cache dostawcy, która wynosi zazwyczaj jedną dziesiątą ceny wejściowej.
I możesz sprawdzić rachunki.
cached_tokens widnieje na każdym paragonie obok tokenów rozliczonych w pełnej cenie. Oszczędność to liczba, którą możesz zsumować na koniec miesiąca — nie procent z prezentacji sprzedażowej.