Trả giá đầy đủ một lần. Tái sử dụng với mức giá bộ nhớ đệm.
Các token prompt lặp lại được tính theo giá bộ nhớ đệm của nhà cung cấp — thường chỉ bằng một phần nhỏ giá đầu vào — và khoản tiết kiệm hiển thị ngay trên hóa đơn thay vì chỉ trong dự báo.
- Các tiền tố đủ điều kiện lưu đệm được tính theo giá bộ nhớ đệm của nhà cung cấp trong các cửa sổ tạm thời 5 phút và 1 giờ.
- cached_tokens xuất hiện trên mỗi hóa đơn, nên khoản tiết kiệm có thể kiểm chứng chứ không chỉ là con số ước tính.
- Không cần cấu hình gì ở phía client — cache_control được chuyển thẳng đến nhà cung cấp hỗ trợ tính năng này.
Phần lớn prompt của bạn không bao giờ thay đổi.
System prompt, schema, các ví dụ few-shot, tài liệu bạn đang truy vấn — những token giống nhau, được gửi đi lặp đi lặp lại. Khi được lưu cache, chúng được tính theo mức giá cache của nhà cung cấp, thường chỉ bằng một phần mười giá đầu vào thông thường.
Và bạn hoàn toàn có thể tự kiểm tra phép tính đó.
cached_tokens xuất hiện trên mỗi hóa đơn bên cạnh số token bạn trả giá đầy đủ. Khoản tiết kiệm là một con số bạn có thể cộng lại vào cuối tháng, không phải một tỷ lệ phần trăm trong bài thuyết trình.