
หน้าต่างบริบท GPT-6.1 Sol: 1,050,000 โทเค็น, เส้น 922,000 และหน้าผา 272,000
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
หน้าเพจโมเดลของผู้จำหน่ายสำหรับGPT-6.1 Sol ซึ่งอ่านเมื่อวันที่ 7 ตุลาคม 2026 ระบุหน้าต่างบริบท 1,050,000 โทเคน และเอาต์พุตสูงสุด 128,000 โทเคน หน้าเดียวกันนี้ ในรูปแบบที่เครื่องอ่านได้ซึ่งคุณได้จากการต่อ.md เข้ากับ URL ของมัน มีตัวเลขตัวที่สามที่หน้าเวอร์ชันเรนเดอร์ไม่เคยแสดง: อินพุตสูงสุด 922,000 โทเคน GPT-6 Sol โมเดลที่เวอร์ชัน 6.1 เปิดตัวมาเพื่อสืบทอดเมื่อวันที่ 2026-09-29 เผยแพร่ตัวเลขเพดานคู่ที่เหมือนกันบนหน้าเพจของตัวเอง และบรรทัด 922,000 เดียวกันในรูปแบบ markdown ของตัวเอง การ์ดโมเดลของเราสำหรับopenai/gpt-6-sol รายงานหน้าต่างเป็น 1,050,000 โทเคน และขีดจำกัดเอาต์พุตเป็น 128,000 แสดงค่าแรกเป็น "1M" ในแถบข้อมูลจำเพาะ และพิมพ์ "1.1M" สำหรับโมเดลเดียวกันในตารางเปรียบเทียบที่อยู่ถัดลงไปในหน้าเดียวกัน
ดังนั้น หน้าเหล่านี้จึงขัดแย้งกันจริง และคุ้มค่าที่จะระบุให้ชัดเจนว่าขัดแย้งกันอย่างไร แถบสเปกที่ผู้ขายแสดงผลให้หน้าต่างและเพดานเอาต์พุต แต่ไม่มีเพดานอินพุต เอกสาร Markdown ของผู้ขายสำหรับโมเดลเดียวกันให้มาครบทั้งสามค่า ใครก็ตามที่กะขนาดคำขอจากหน้าที่แสดงผลกำลังทำงานโดยมีข้อจำกัดน้อยกว่าที่ผู้ขายเผยแพร่ไปหนึ่งข้อ และข้อที่หายไปคือตัวเลขที่ตัดสินว่าคำขอจะพอดีหรือไม่
สามตัวเลข สามแหล่งที่มา และการลบหนึ่งครั้งที่ไม่มีใครเขียนลงไป
นี่คือแต่ละหมายเลขพร้อมเอกสารที่มา ทั้งหมดอ่านเมื่อวันที่ 7 ตุลาคม 2026
• หน้าต่างบริบท 1,050,000 — หน้าของแบบจำลองของผู้จำหน่ายสำหรับ gpt-6.1-sol ทั้งในแถบข้อมูลจำเพาะที่แสดงผลและในรูปแบบ markdown และเป็นตัวเลขเดียวกันกับที่ปรากฏบนหน้าสำหรับ gpt-6-sol อีกทั้งยังเป็นค่าที่แคตตาล็อกของเราส่งคืนสำหรับ openai/gpt-6-sol และ openai/gpt-6-luna ซึ่งฟิลด์ดังกล่าวถูกระบุเป็น 1,050,000 แทนที่จะเป็นการปัดเศษ
• โทเค็นเอาต์พุตสูงสุด 128,000 หน้าเดียวกัน ฟอร์มสองแบบเดียวกัน สำหรับทั้งสองเจเนอเรชัน ฟิลด์บนการ์ดของเราระบุ 128,000; ส่วนที่แสดงผลปัดเป็น "128K"
• โทเค็นอินพุตสูงสุด 922,000 — รูปแบบ Markdown ของหน้าของโมเดล gpt-6-sol ของผู้จำหน่าย และของหน้า gpt-6.1-sol ของโมเดลนั้น มันไม่ได้อยู่ในแถบที่แสดงผลของหน้าใดหน้าหนึ่ง และไม่ได้อยู่ในฟิลด์แค็ตตาล็อกของเราสำหรับโมเดลนี้ ซึ่งหยุดอยู่ที่หน้าต่างบริบทและขีดจำกัดเอาต์พุต
ตัวเลขทั้งสามสอดคล้องกันทางคณิตศาสตร์: 922,000 บวก 128,000 เท่ากับ 1,050,000 พอดี คู่มือการให้เหตุผลของผู้ขายเองอธิบายกลไกที่ทำให้ความเท่ากันนี้มีความหมาย โดยไม่เคยคำนวณผลรวมบนหน้าโมเดลเลย — โทเคนการให้เหตุผลนั้น ตามที่คู่มือกล่าว "ยังคงใช้พื้นที่ในหน้าต่างบริบทของโมเดล" และหากโทเคนที่สร้างขึ้น "ถึงขีดจำกัดของหน้าต่างบริบทหรือค่า max_output_tokens ที่คุณตั้งไว้" คำตอบที่ส่งกลับจะถูกทำเครื่องหมายว่าไม่สมบูรณ์ หน้าต่างที่ใช้ร่วมกันระหว่างสิ่งที่ป้อนเข้าและสิ่งที่ส่งออกคือหน้าต่างซึ่งเพดานอินพุตเท่ากับหน้าต่างลบส่วนที่สงวนไว้สำหรับเอาต์พุต
การตีความนั้นได้รับการสนับสนุน ไม่ใช่พิสูจน์แล้ว และควรแยกสองสิ่งนี้ออกจากกัน สิ่งที่ได้รับการบันทึกไว้คือหน้าต่าง 1,050,000 เพดานเอาต์พุต 128,000 และอินพุตสูงสุด 922,000 สิ่งที่อนุมานได้คือตัวใดในจำนวนเหล่านั้นเป็นข้อจำกัดที่เกิดผลก่อน การอนุมานนี้ใช้ได้กับทุกคำขอที่จองสิทธิ์เอาต์พุตเต็มจำนวน และใช้ไม่ได้กับคำขอใด ๆ ที่ไม่ได้จอง — ตั้ง max_output_tokens เป็น 4,000 แล้วอินพุต 1,046,000 โทเคนจะไม่ถูกปฏิเสธอย่างชัดเจน จนกว่าผู้ให้บริการจะเขียนการลบนั้นลงในหน้าที่มีตัวเลขเหล่านี้อยู่ ให้ถือว่าการจับคู่นั้นเป็นลักษณะของงบประมาณ มากกว่าจะเป็นกฎการรับเข้าที่ตายตัว และให้ตรวจสอบกับ endpoint สำหรับการนับ มากกว่าจะตรวจสอบกับบล็อกโพสต์
บริบทไม่ใช่ราคา: ก้าว 272,000 โทเคน
หน้าต่างที่ใหญ่ขึ้นเป็นการอ้างถึงความจุ ไม่ใช่การอ้างถึงค่าใช้จ่าย และในตระกูลนี้ ทั้งสองอย่างแยกออกจากกัน ณ เส้นที่ระบุไว้ในเอกสาร หน้าค่าบริการของผู้ขายระบุกฎนี้ในหนึ่งประโยค: พรอมต์ที่มีโทเค็นอินพุตมากกว่า 272K จะคิดราคาที่อัตราอินพุตและแคช 2 เท่า และเอาต์พุต 1.5 เท่า สำหรับคำขอทั้งหมด คำจำกัดความของสองคอลัมน์บนหน้าเดียวกันนั้นเองคือ "บริบทสั้น: ≤272K โทเค็นอินพุต บริบทยาว: >272K โทเค็นอินพุต"
อ่านคำว่า full อย่างละเอียด ระดับนี้ไม่ได้เก็บภาษีจากโทเค็นที่เกินเส้น — มันคิดราคาทุกอย่างใหม่ รวมถึงโทเค็นแรกด้วย และนี่ไม่ใช่การเปลี่ยนแปลงใน 6.1: กฎเดียวกันทุกประการ พร้อมเกณฑ์เดียวกันทุกประการ ใช้กับ GPT-6 Sol ซึ่งเป็นเหตุผลว่าทำไมหน้าผานี้จึงต้องถูกโยงกับระดับ ไม่ใช่กับการเปิดตัว
ทำงาน long-context หนึ่งงานผ่านทั้งสองฝั่ง โดยใช้อัตราที่เผยแพร่ของ GPT-6.1 Sol โดยที่ prefix อยู่ในแคชแล้ว เพื่อให้ค่าใช้จ่ายในการเขียนแคชไม่ทำให้การเปรียบเทียบคลุมเครือ:
• โทเค็นอินพุต 240,000 (แคชไว้ 200,000, ใหม่ 40,000), เอาต์พุต 6,000 — อินพุตใหม่ 40,000 ที่ $2.00 ต่อล้านเป็น $0.080; อินพุตแคช 200,000 ที่ $0.10 เป็น $0.020; เอาต์พุต 6,000 ที่ $10.00 เป็น $0.060 รวม $0.160
โทเค็นอินพุต 300,000 (แคช 260,000, ใหม่ 40,000), เอาต์พุต 6,000 — ตอนนี้คำขอเกินเส้นแล้ว อัตราทุกอย่างจึงเปลี่ยนไป: อินพุตใหม่ 40,000 ที่ $4.00 เป็น $0.160; อินพุตแคช 260,000 ที่ $0.20 เป็น $0.052; เอาต์พุต 6,000 ที่ $15.00 เป็น $0.090 รวม $0.302.
โทเค็นอินพุตที่เพิ่มขึ้น 25 เปอร์เซ็นต์นำมาซึ่งบิลที่ใหญ่ขึ้น 89 เปอร์เซ็นต์ ลองใช้คู่เดียวกันบน GPT-6 Sol แล้วรูปแบบยังคงเดิมโดยมีความชันที่สูงขึ้น — $0.180 ใต้เส้น เทียบกับ $0.354 เหนือเส้น เพราะอัตราแคช $0.20 ของการ์ดรุ่นเก่าอยู่ในตำแหน่งเดียวกับที่อัตราแคชบริบทแบบยาวของ 6.1 อยู่ จุดตัดเป็นขั้นบันได ไม่ใช่ความชัน และวิธีที่ถูกที่สุดที่จะเห็นสิ่งนั้นคือข้ามมันไปเพียงนิดเดียว คำขอ 271,000 โทเค็นที่ไม่ใช้แคชเลยพร้อมโทเค็นเอาต์พุต 1,000 โทเค็นมีค่าใช้จ่าย $0.552; ที่ 273,000 มีค่าใช้จ่าย $1.107 โทเค็นอินพุตเพิ่มขึ้นเจ็ดในสิบของหนึ่งเปอร์เซ็นต์ แต่เงินเพิ่มเป็น 2.01 เท่า ตัด 2,000 โทเค็นออกจากคำขอนั้น แล้วบิลลดจาก $1.107 เหลือ $0.552 — ไม่ถึงหนึ่งเปอร์เซ็นต์ของอินพุตเพื่อแลกกับค่าใช้จ่ายครึ่งเดียว
ไม่มีสิ่งใดในส่วนนี้ที่เกี่ยวกับการที่หน้าต่างของ GPT-6.1 Sol มีขนาดใหญ่ แต่เป็นเรื่องเกี่ยวกับการที่หน้าต่างมีขนาดใหญ่พอที่จะไปถึงขอบเขตหนึ่งซึ่งมีต้นทุนสูงกว่าสิ่งที่ขนาดของหน้าต่างซื้อมาได้

อะไรกันแน่ที่เติมเต็ม 1,050,000 โทเคน
งบประมาณบริบทประกอบด้วยหกสิ่ง และสิ่งเหล่านี้สามารถแคชได้ไม่เท่ากัน สัดส่วนโดยประมาณของคำขอแบบเอเจนต์ขนาด 240,000 โทเคนที่เป็นตัวอย่างประกอบ สัดส่วนเหล่านี้เป็นของเราเอง ส่วนกฎการแคชเป็นของผู้ให้บริการ ซึ่งมาจากคู่มือการแคชพรอมป์ต์ของผู้ให้บริการที่อ่านในวันเดียวกัน
• เนื้อหาระบบที่ผู้ให้บริการแทรกเข้ามาและการจัดรูปแบบคำขอ — ถูกเรนเดอร์ไว้ก่อนข้อความของคุณ คิดค่าบริการเป็นอินพุต และถูกยกเว้นอย่างชัดเจนจากความยาวขั้นต่ำที่แคชได้ ไม่ใช่สิ่งที่คุณควบคุม และไม่ใช่สิ่งที่คุณตัดทอนได้
• คำสั่งสำหรับนักพัฒนาและคำสั่งระบบของคุณ ประมาณ 6,000 โทเคน แคชได้ นี่คือส่วนหน้าของคำนำหน้า ดังนั้นการเปลี่ยนแปลงตรงนี้จะทำให้ทุกอย่างที่อยู่ข้างหลังเป็นโมฆะ
• คำจำกัดความและสคีมาของเครื่องมือ ประมาณ 14,000 โทเค็นสำหรับชุดเครื่องมือที่โฮสต์ไว้บวกกับฟังก์ชันของคุณ สามารถแคชได้ และเป็นส่วนที่เปราะบางที่สุดของพรีฟิกซ์: คู่มือระบุชื่อเครื่องมือ คำอธิบาย สคีมา ลำดับ และคำสั่งเฉพาะของเครื่องมือว่าเป็นสิ่งที่เลื่อนขอบเขตของพรีฟิกซ์
• คลังข้อมูลที่ดึงมา ประมาณ 180,000 โทเคน สามารถแคชได้ และเป็นบรรทัดที่ใหญ่ที่สุดอย่างมากเมื่อเทียบกับบรรทัดอื่น คุ้มค่าที่จะแคชก็ต่อเมื่อมันมีไบต์ที่คงที่ระหว่างการเรียกใช้ — คลังข้อมูลที่ประกอบใหม่ทุกคำขอคือคลังข้อมูลราคาเต็ม
• บันทึกบทสนทนาที่สะสมไว้ — เทิร์นก่อนหน้าและผลลัพธ์ของเครื่องมือ — ประมาณ 30,000 โทเคนและเพิ่มขึ้นเรื่อย ๆ สามารถแคชได้จนถึงการเปลี่ยนแปลงล่าสุด ส่วนผลลัพธ์ของเครื่องมือที่เข้ามาในเทิร์นนี้เป็นอินพุตใหม่ในอัตราเต็ม
• โทเคนการให้เหตุผล — ถูกสร้างขึ้น ไม่ถูกแคช และถูกคิดค่าบริการเป็นเอาต์พุต โทเคนเหล่านี้ใช้พื้นที่หน้าต่าง และไม่ปรากฏให้เห็นในเนื้อความตอบกลับ
มีหมายเหตุเชิงปฏิบัติสองข้อที่ได้จากรายการนั้นโดยตรง ข้อแรก รายการแคชถูกเก็บไว้บนเครื่องแต่ละเครื่อง: คู่มือระบุว่าคำขอสามารถใช้คำนำหน้าซ้ำได้ "เฉพาะเมื่อมันไปถึงเครื่องที่มีรายการที่ตรงกันและยังไม่หมดอายุ" และการจัดเส้นทางแบบโอเวอร์โฟลว์จะเริ่มต้นเมื่อมีคำขอเกินประมาณ 15 ครั้งต่อนาที คำนำหน้าที่คงที่ในโค้ดของคุณก็ยังอาจพลาดในโปรดักชันได้ ข้อสอง คำนำหน้าขั้นต่ำที่แคชได้คือ 1,024 โทเคนอินพุตที่มองเห็นได้ และโทเคนระบบที่ซ่อนอยู่จะไม่นับรวมด้วย — ดังนั้นพรอมป์ต์ระบบขนาดเล็กจึงไม่ใช่คำนำหน้าที่แคชได้ ไม่ว่าคำขอที่อยู่รอบๆ จะใหญ่เพียงใด
เพดานเอาต์พุตเป็นงบประมาณแยกต่างหาก ไม่ใช่การตักเพิ่มอีกจาน
การที่โทเคนเอาต์พุตสูงสุดคือ 128,000 ไม่ได้หมายความว่าจะได้คำตอบ 128,000 โทเคน คู่มือการให้เหตุผลระบุไว้อย่างชัดเจนว่า max_output_tokens กำหนดเพดานจำนวนรวมที่โมเดลสร้างขึ้น "รวมถึงโทเคนการให้เหตุผล โทเคนเอาต์พุตที่มองเห็นได้ และโทเคนการจัดรูปแบบที่มองไม่เห็น" และโทเคนการให้เหตุผลจะถูกคิดค่าใช้จ่ายเป็นเอาต์พุตในขณะที่กินพื้นที่ในหน้าต่าง
การตัดทอนจึงกลายเป็นการตัดสินใจเชิงออกแบบมากกว่ากรณีขอบ เนื่องจากลักษณะการล้มเหลวของมัน เมื่อการสร้างถึงขีดจำกัด คำตอบจะถูกส่งกลับด้วยสถานะ incomplete และเหตุผล max_output_tokens — และคู่มือเตือนว่า "อาจเกิดขึ้นก่อนที่โทเคนเอาต์พุตที่มองเห็นได้จะถูกสร้างขึ้น ซึ่งหมายความว่าคุณอาจเสียค่าใช้จ่ายสำหรับโทเคนอินพุตและโทเคนการให้เหตุผลโดยไม่ได้รับคำตอบที่มองเห็นได้" งบที่ใช้หน้าต่างทั้งหมดไปกับอินพุตและปล่อยให้การจองเอาต์พุตเป็นเรื่องของโอกาสนั้น เป็นงบที่สามารถเรียกเก็บเงินสำหรับคำขอ long-context เต็มรูปแบบและไม่คืนสิ่งใดที่ผู้เรียกสามารถแยกวิเคราะห์ได้ คำแนะนำเริ่มต้นของผู้ให้บริการเองคือให้จองอย่างน้อย 25,000 โทเคนสำหรับการให้เหตุผลและเอาต์พุต ขณะที่คุณยังคงวัดว่าพรอมต์ต้องการจริงเท่าใด
GPT-6.1 Sol ทำให้เรื่องนี้ชัดเจนขึ้น และเป็นหนึ่งในไม่กี่บรรทัดที่เฉพาะเจาะจงกับ 6.1 อย่างแท้จริงในรีลีสนี้ ระดับความพยายามในการใช้เหตุผลของมันมีตั้งแต่ low, medium, high, xhigh และ max และไม่รองรับการตั้งค่า none และ minimal GPT-6 Sol รองรับทั้งหกค่า ดังนั้นจึงไม่มีการตั้งค่าบน 6.1 ที่ปิดการใช้จ่ายในการใช้เหตุผล ค่าเริ่มต้นคือ medium และด้านเอาต์พุตของงบประมาณนั้นไม่มีวันฟรี
การแบ่งครึ่งอินพุตที่แคชไว้ อ่าน ณ จุดที่หน้าต่างกว้างที่สุด
อัตราเดียวบนการ์ด GPT-6.1 Sol ที่ปรับเปลี่ยนสวนทางกับ GPT-6 Sol คืออินพุตแบบแคช: จาก $0.20 ลดลงเหลือ $0.10 ต่อล้านโทเค็น ซึ่งหน้ารุ่นแสดงเป็น 5% ของอัตราอินพุตที่ไม่ได้แคช และคู่มือการแคชของผู้ขายระบุไว้อย่างชัดเจนว่าเป็นกรณี 0.05x เทียบกับ 0.1x ซึ่งเป็นอัตราที่โมเดล GPT-5.6-and-later ส่วนใหญ่ใช้ อินพุต การเขียนแคช และเอาต์พุตเหมือนกันบนการ์ดทั้งสอง และตัวคูณบริบทแบบยาวก็เหมือนกันด้วย
สำหรับปริมาณงานที่หน้านี้กล่าวถึงโดยตรง นั่นคือมิเตอร์ที่ถูกต้องที่ควรย้าย และเหตุผลก็คือองค์ประกอบของคำขอแบบยาว ไม่ใช่ขนาดของมัน ในงาน 300,000 โทเคนข้างต้น 260,000 ของโทเคนอินพุตเป็นคำนำหน้าที่แคชไว้ — 87 เปอร์เซ็นต์ของทุกอย่างที่คำขอส่งไป บรรทัดที่แคชไว้จึงเป็นมิเตอร์อินพุตเดี่ยวที่ใหญ่ที่สุดในบิล ซึ่งเป็นคุณสมบัติทั่วไปของงานที่ใช้บริบทยาว ยิ่งหน้าต่างที่คุณใช้ยาวขึ้นเท่าไร ก็ยิ่งมีสัดส่วนที่เป็นคำนำหน้าที่คุณส่งไปแล้วมากขึ้นเท่านั้น การลดมิเตอร์นั้นลงครึ่งหนึ่งมีมูลค่า $0.052 สำหรับคำขอนั้น
และหน้าผาเก็บคืนมากกว่าที่การลดครึ่งหนึ่งให้ ในคำขอเดียวกัน งาน 300,000 โทเคนเดียวกันบน GPT-6.1 Sol หากคิดราคาด้วยอัตราบริบทสั้นที่มันจะได้จ่ายเมื่ออยู่ใต้เส้น จะมีค่าใช้จ่าย $0.166 แทนที่จะเป็น $0.302 — ค่าข้ามเส้น $0.136 หรือประมาณ 2.6 เท่าของมูลค่ามิเตอร์ที่เปลี่ยนแปลงเพียงหนึ่งเดียวในรีลีสนี้ เหนือเส้นขึ้นไป อัตราแคชแสดงเป็น $0.20 ซึ่งไม่ใช่ตัวเลขใหม่ในตระกูลนี้: มันเป็นสองเท่าของราคาพาดหัวบนการ์ด 6.1 และเป็นอัตราที่ GPT-6 Sol เคยคิดสำหรับการอ่านจากแคชใต้เส้นก่อนรีลีสนี้พอดี เวิร์กโหลดแคชแบบบริบทยาวเก็บการเปลี่ยนแปลงที่พาดหัวไว้ แล้วคืนมันกลับที่เส้นแบ่ง และเส้นแบ่ง — ไม่ใช่โมเดล — คือสาเหตุ

วิธีกำหนดขนาดงบประมาณบริบท
ในเชิงกระบวนการ โดยเรียงตามลำดับที่ข้อจำกัดมีผลผูกพัน:
• นับคำขอ อย่าประมาณเอา ส่ง POST เพย์โหลดที่แน่นอน — ทั้งเครื่องมือ รูปภาพ ไฟล์ และทุกอย่าง — ไปยัง endpoint สำหรับนับจำนวนโทเค็นอินพุตบน Responses API คู่มือพูดตรง ๆ ถึงเหตุผลว่า: การนับนี้รวมโทเค็นการจัดรูปแบบสำหรับบทบาทและขอบเขตของข้อความ ซึ่งไม่เคยปรากฏในข้อความที่คุณแตกโทเค็นได้ในเครื่อง และการประมาณในเครื่อง เช่น จำนวนอักขระหารด้วยสี่ ก็ไม่แม่นยำสำหรับรูปภาพ ไฟล์ และสคีมา
• จองฝั่งเอาต์พุตไว้ก่อน เลือก max_output_tokens โดยคำนึงว่ามันครอบคลุมทั้งการให้เหตุผล เอาต์พุตที่มองเห็น และการจัดรูปแบบไว้ด้วยกัน และเริ่มจากบัฟเฟอร์ 25,000 โทเค็นของผู้ให้บริการ แทนที่จะเริ่มจากศูนย์ งบประมาณอินพุตของคุณคือหน้าต่างลบด้วยการจองนั้น และตัวเลขเก้าร้อยยี่สิบสองคือเวอร์ชันของผู้ให้บริการของการลบแบบเดียวกัน
• กำหนดราคาคำขอทั้งสองฝั่งของ 272,000 ก่อนที่คุณจะส่งมัน ขั้นนี้ใหญ่พอที่คำขอซึ่งออกแบบให้ลงต่ำกว่าเส้นเพียงเล็กน้อย กับคำขอซึ่งออกแบบให้ลงสูงกว่าเส้นนั้นเพียงเล็กน้อย จะเป็นผลิตภัณฑ์ที่แตกต่างกัน
• จัดเรียงส่วนนำหน้าตามความเสถียร คำสั่ง จากนั้นสคีมาของเครื่องมือ จากนั้นคลังข้อมูล จากนั้นบทถอดเสียง สิ่งใดก็ตามที่เปลี่ยนแปลงไประหว่างการเรียก ควรวางไว้ท้ายสุด ซึ่งจะเสียเพียงการจับคู่ส่วนนำหน้า แทนที่จะเสียแคชทั้งหมด
• ผ่าน 1,024 โทเค็นอินพุตที่มองเห็นได้ก่อนจึงจะคาดหวังแคชได้ ต่ำกว่าขั้นต่ำนั้นจะไม่มีอะไรถูกแคช และโทเค็นที่ซ่อนอยู่ของผู้ให้บริการจะไม่นับรวมด้วย
• ตรวจสอบว่าการนำกลับมาใช้ซ้ำเป็นไปได้ คำนำหน้าต้องถูกนำกลับมาใช้ซ้ำภายในอายุการใช้งานของแคช 30 นาที และต้องไปอยู่บนเครื่องที่เก็บรายการนั้นไว้ ทั้งสองข้อนี้มีอธิบายไว้ในคู่มือ และไม่ใช่คุณสมบัติของโค้ดของคุณ
• วัดใหม่หลังจากการเปลี่ยนแปลงโมเดลหรือการตั้งค่าใด ๆการย้ายไปใช้ GPT-6.1 Sol จะลบตัวเลือกปิดการให้เหตุผลออก ซึ่งเปลี่ยนจำนวนโทเคนการให้เหตุผล และด้วยเหตุนี้จึงเปลี่ยนฝั่งเอาต์พุตของงบประมาณ — และการเปลี่ยนแปลงระดับความพยายามในการให้เหตุผล เครื่องมือ สคีมาของเอาต์พุตแบบมีโครงสร้าง หรือการจัดการบริบท ก็อาจเลื่อนขอบเขตคำนำหน้าและทำให้คุณสูญเสียอัตราค่าใช้จ่ายแบบแคชไปทั้งหมดได้เช่นกัน
• ตัดสินใจว่าจะเกิดอะไรขึ้นเมื่องานไม่ยอมลดขนาดลง คอมแพกชันคือทางออกที่ระบุไว้ในเอกสาร: คำขอ Responses สามารถตั้งค่า context_management พร้อมเกณฑ์ compact ได้ และเซิร์ฟเวอร์จะแทนที่เนื้อหาบทสนทนาก่อนหน้าด้วยไอเทมคอมแพกชันแบบทึบที่นำสถานะสำคัญส่งต่อไปข้างหน้าด้วยโทเคนที่น้อยลง นี่เป็นการตัดสินใจเรื่องงบประมาณมากกว่าการตัดทิ้งแบบฟรี เพราะคู่มือระบุว่าคอมแพกชัน "สามารถป้องกันการนำกลับมาใช้ซ้ำได้นับจากโทเคนที่เปลี่ยนแปลงตัวแรกเป็นต้นไป" — การทำคอมแพกชันหนึ่งรอบจะทำให้คำนำหน้าที่อยู่ข้างหลังใช้ไม่ได้

การคำนวณทางคณิตศาสตร์บนหน้านี้เริ่มจากรุ่นที่ GPT-6.1 Sol เข้ามาแทนที่ และขั้นนั้นคือขั้นที่เรียกใช้ได้ในวันนี้: การ์ดของเราสำหรับ openai/gpt-6-sol รายงานหน้าต่างบริบท 1,050,000 โทเคน โดยมีเอาต์พุตสูงสุด 128,000 โทเคน ที่ราคาตามรายการของ OpenAI โดยมีมาร์กอัป 0% — ราคาของผู้ขายคือราคาที่แสดงบนหน้าเว็บ และการปรับราคาของผู้ขายจะปรากฏที่นั่นในวันเดียวกันแทนที่จะเป็นตอนต่ออายุ การ์ดของเราไม่มีฟิลด์อินพุตสูงสุดของตัวเอง ดังนั้นตัวเลข 922,000 โทเคนสำหรับโมเดลดังกล่าวจึงต้องมาจากเอกสารของผู้ขายเอง ซึ่งเป็นสิ่งที่หน้านี้ใช้มาตลอด สิ่งที่การ์ดนี้มีประโยชน์คือการกำหนดขนาด: หน้าต่างและเพดานเอาต์พุตที่มันเผยแพร่คือตัวเลขสองตัวที่ขั้นตอนงบประมาณด้านบนนำมาลบกัน และขั้นที่ต่ำกว่าคือขั้นที่คุณสามารถรันขั้นตอนนั้นได้จริงในขณะที่ 6.1 ยังใหม่ อยู่ที่ https://www.orcarouter.ai/models/openai/gpt-6-sol
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
