การ์ดชื่อที่สร้างขึ้นซึ่งมีข้อความว่า 'GPT-6.1 Sol Context Window' พร้อมคำบรรยายย่อยว่า '1,050,000 โทเค็น, เส้น 922,000 และหน้าผา 272,000' แผงโค้งมนสามแผงวางอยู่ด้านล่าง: 1,050,000 ติดป้ายว่า 'หน้าต่างบริบท บนหน้าผู้ขาย', 922,000 ติดป้ายว่า 'อินพุตสูงสุด ในฟอร์มเอกสาร' และ 272,000 ติดป้ายว่า 'เส้นอินพุตที่กำหนดราคาคำขอทั้งหมดใหม่' โลโก้ OrcaRouter ปรากฏที่มุมขวาล่าง
Guides & Insights

หน้าต่างบริบท GPT-6.1 Sol: 1,050,000 โทเค็น, เส้น 922,000 และหน้าผา 272,000

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

หน้าเพจโมเดลของผู้จำหน่ายสำหรับGPT-6.1 Sol ซึ่งอ่านเมื่อวันที่ 7 ตุลาคม 2026 ระบุหน้าต่างบริบท 1,050,000 โทเคน และเอาต์พุตสูงสุด 128,000 โทเคน หน้าเดียวกันนี้ ในรูปแบบที่เครื่องอ่านได้ซึ่งคุณได้จากการต่อ.md เข้ากับ URL ของมัน มีตัวเลขตัวที่สามที่หน้าเวอร์ชันเรนเดอร์ไม่เคยแสดง: อินพุตสูงสุด 922,000 โทเคน GPT-6 Sol โมเดลที่เวอร์ชัน 6.1 เปิดตัวมาเพื่อสืบทอดเมื่อวันที่ 2026-09-29 เผยแพร่ตัวเลขเพดานคู่ที่เหมือนกันบนหน้าเพจของตัวเอง และบรรทัด 922,000 เดียวกันในรูปแบบ markdown ของตัวเอง การ์ดโมเดลของเราสำหรับopenai/gpt-6-sol รายงานหน้าต่างเป็น 1,050,000 โทเคน และขีดจำกัดเอาต์พุตเป็น 128,000 แสดงค่าแรกเป็น "1M" ในแถบข้อมูลจำเพาะ และพิมพ์ "1.1M" สำหรับโมเดลเดียวกันในตารางเปรียบเทียบที่อยู่ถัดลงไปในหน้าเดียวกัน

ดังนั้น หน้าเหล่านี้จึงขัดแย้งกันจริง และคุ้มค่าที่จะระบุให้ชัดเจนว่าขัดแย้งกันอย่างไร แถบสเปกที่ผู้ขายแสดงผลให้หน้าต่างและเพดานเอาต์พุต แต่ไม่มีเพดานอินพุต เอกสาร Markdown ของผู้ขายสำหรับโมเดลเดียวกันให้มาครบทั้งสามค่า ใครก็ตามที่กะขนาดคำขอจากหน้าที่แสดงผลกำลังทำงานโดยมีข้อจำกัดน้อยกว่าที่ผู้ขายเผยแพร่ไปหนึ่งข้อ และข้อที่หายไปคือตัวเลขที่ตัดสินว่าคำขอจะพอดีหรือไม่

สามตัวเลข สามแหล่งที่มา และการลบหนึ่งครั้งที่ไม่มีใครเขียนลงไป

นี่คือแต่ละหมายเลขพร้อมเอกสารที่มา ทั้งหมดอ่านเมื่อวันที่ 7 ตุลาคม 2026

• หน้าต่างบริบท 1,050,000 — หน้าของแบบจำลองของผู้จำหน่ายสำหรับ gpt-6.1-sol ทั้งในแถบข้อมูลจำเพาะที่แสดงผลและในรูปแบบ markdown และเป็นตัวเลขเดียวกันกับที่ปรากฏบนหน้าสำหรับ gpt-6-sol อีกทั้งยังเป็นค่าที่แคตตาล็อกของเราส่งคืนสำหรับ openai/gpt-6-sol และ openai/gpt-6-luna ซึ่งฟิลด์ดังกล่าวถูกระบุเป็น 1,050,000 แทนที่จะเป็นการปัดเศษ

• โทเค็นเอาต์พุตสูงสุด 128,000 หน้าเดียวกัน ฟอร์มสองแบบเดียวกัน สำหรับทั้งสองเจเนอเรชัน ฟิลด์บนการ์ดของเราระบุ 128,000; ส่วนที่แสดงผลปัดเป็น "128K"

• โทเค็นอินพุตสูงสุด 922,000 — รูปแบบ Markdown ของหน้าของโมเดล gpt-6-sol ของผู้จำหน่าย และของหน้า gpt-6.1-sol ของโมเดลนั้น มันไม่ได้อยู่ในแถบที่แสดงผลของหน้าใดหน้าหนึ่ง และไม่ได้อยู่ในฟิลด์แค็ตตาล็อกของเราสำหรับโมเดลนี้ ซึ่งหยุดอยู่ที่หน้าต่างบริบทและขีดจำกัดเอาต์พุต

ตัวเลขทั้งสามสอดคล้องกันทางคณิตศาสตร์: 922,000 บวก 128,000 เท่ากับ 1,050,000 พอดี คู่มือการให้เหตุผลของผู้ขายเองอธิบายกลไกที่ทำให้ความเท่ากันนี้มีความหมาย โดยไม่เคยคำนวณผลรวมบนหน้าโมเดลเลย — โทเคนการให้เหตุผลนั้น ตามที่คู่มือกล่าว "ยังคงใช้พื้นที่ในหน้าต่างบริบทของโมเดล" และหากโทเคนที่สร้างขึ้น "ถึงขีดจำกัดของหน้าต่างบริบทหรือค่า max_output_tokens ที่คุณตั้งไว้" คำตอบที่ส่งกลับจะถูกทำเครื่องหมายว่าไม่สมบูรณ์ หน้าต่างที่ใช้ร่วมกันระหว่างสิ่งที่ป้อนเข้าและสิ่งที่ส่งออกคือหน้าต่างซึ่งเพดานอินพุตเท่ากับหน้าต่างลบส่วนที่สงวนไว้สำหรับเอาต์พุต

การตีความนั้นได้รับการสนับสนุน ไม่ใช่พิสูจน์แล้ว และควรแยกสองสิ่งนี้ออกจากกัน สิ่งที่ได้รับการบันทึกไว้คือหน้าต่าง 1,050,000 เพดานเอาต์พุต 128,000 และอินพุตสูงสุด 922,000 สิ่งที่อนุมานได้คือตัวใดในจำนวนเหล่านั้นเป็นข้อจำกัดที่เกิดผลก่อน การอนุมานนี้ใช้ได้กับทุกคำขอที่จองสิทธิ์เอาต์พุตเต็มจำนวน และใช้ไม่ได้กับคำขอใด ๆ ที่ไม่ได้จอง — ตั้ง max_output_tokens เป็น 4,000 แล้วอินพุต 1,046,000 โทเคนจะไม่ถูกปฏิเสธอย่างชัดเจน จนกว่าผู้ให้บริการจะเขียนการลบนั้นลงในหน้าที่มีตัวเลขเหล่านี้อยู่ ให้ถือว่าการจับคู่นั้นเป็นลักษณะของงบประมาณ มากกว่าจะเป็นกฎการรับเข้าที่ตายตัว และให้ตรวจสอบกับ endpoint สำหรับการนับ มากกว่าจะตรวจสอบกับบล็อกโพสต์

บริบทไม่ใช่ราคา: ก้าว 272,000 โทเคน

หน้าต่างที่ใหญ่ขึ้นเป็นการอ้างถึงความจุ ไม่ใช่การอ้างถึงค่าใช้จ่าย และในตระกูลนี้ ทั้งสองอย่างแยกออกจากกัน ณ เส้นที่ระบุไว้ในเอกสาร หน้าค่าบริการของผู้ขายระบุกฎนี้ในหนึ่งประโยค: พรอมต์ที่มีโทเค็นอินพุตมากกว่า 272K จะคิดราคาที่อัตราอินพุตและแคช 2 เท่า และเอาต์พุต 1.5 เท่า สำหรับคำขอทั้งหมด คำจำกัดความของสองคอลัมน์บนหน้าเดียวกันนั้นเองคือ "บริบทสั้น: ≤272K โทเค็นอินพุต บริบทยาว: >272K โทเค็นอินพุต"

อ่านคำว่า full อย่างละเอียด ระดับนี้ไม่ได้เก็บภาษีจากโทเค็นที่เกินเส้น — มันคิดราคาทุกอย่างใหม่ รวมถึงโทเค็นแรกด้วย และนี่ไม่ใช่การเปลี่ยนแปลงใน 6.1: กฎเดียวกันทุกประการ พร้อมเกณฑ์เดียวกันทุกประการ ใช้กับ GPT-6 Sol ซึ่งเป็นเหตุผลว่าทำไมหน้าผานี้จึงต้องถูกโยงกับระดับ ไม่ใช่กับการเปิดตัว

ทำงาน long-context หนึ่งงานผ่านทั้งสองฝั่ง โดยใช้อัตราที่เผยแพร่ของ GPT-6.1 Sol โดยที่ prefix อยู่ในแคชแล้ว เพื่อให้ค่าใช้จ่ายในการเขียนแคชไม่ทำให้การเปรียบเทียบคลุมเครือ:

• โทเค็นอินพุต 240,000 (แคชไว้ 200,000, ใหม่ 40,000), เอาต์พุต 6,000 — อินพุตใหม่ 40,000 ที่ $2.00 ต่อล้านเป็น $0.080; อินพุตแคช 200,000 ที่ $0.10 เป็น $0.020; เอาต์พุต 6,000 ที่ $10.00 เป็น $0.060 รวม $0.160

โทเค็นอินพุต 300,000 (แคช 260,000, ใหม่ 40,000), เอาต์พุต 6,000 — ตอนนี้คำขอเกินเส้นแล้ว อัตราทุกอย่างจึงเปลี่ยนไป: อินพุตใหม่ 40,000 ที่ $4.00 เป็น $0.160; อินพุตแคช 260,000 ที่ $0.20 เป็น $0.052; เอาต์พุต 6,000 ที่ $15.00 เป็น $0.090 รวม $0.302.

โทเค็นอินพุตที่เพิ่มขึ้น 25 เปอร์เซ็นต์นำมาซึ่งบิลที่ใหญ่ขึ้น 89 เปอร์เซ็นต์ ลองใช้คู่เดียวกันบน GPT-6 Sol แล้วรูปแบบยังคงเดิมโดยมีความชันที่สูงขึ้น — $0.180 ใต้เส้น เทียบกับ $0.354 เหนือเส้น เพราะอัตราแคช $0.20 ของการ์ดรุ่นเก่าอยู่ในตำแหน่งเดียวกับที่อัตราแคชบริบทแบบยาวของ 6.1 อยู่ จุดตัดเป็นขั้นบันได ไม่ใช่ความชัน และวิธีที่ถูกที่สุดที่จะเห็นสิ่งนั้นคือข้ามมันไปเพียงนิดเดียว คำขอ 271,000 โทเค็นที่ไม่ใช้แคชเลยพร้อมโทเค็นเอาต์พุต 1,000 โทเค็นมีค่าใช้จ่าย $0.552; ที่ 273,000 มีค่าใช้จ่าย $1.107 โทเค็นอินพุตเพิ่มขึ้นเจ็ดในสิบของหนึ่งเปอร์เซ็นต์ แต่เงินเพิ่มเป็น 2.01 เท่า ตัด 2,000 โทเค็นออกจากคำขอนั้น แล้วบิลลดจาก $1.107 เหลือ $0.552 — ไม่ถึงหนึ่งเปอร์เซ็นต์ของอินพุตเพื่อแลกกับค่าใช้จ่ายครึ่งเดียว

ไม่มีสิ่งใดในส่วนนี้ที่เกี่ยวกับการที่หน้าต่างของ GPT-6.1 Sol มีขนาดใหญ่ แต่เป็นเรื่องเกี่ยวกับการที่หน้าต่างมีขนาดใหญ่พอที่จะไปถึงขอบเขตหนึ่งซึ่งมีต้นทุนสูงกว่าสิ่งที่ขนาดของหน้าต่างซื้อมาได้

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol - the scoreboard'. Both columns carry the same six rows. GPT-6.1 Sol reads: context window 1,050,000 tokens; max input 922,000 tokens (docs form); max output 128,000 tokens; input price $2.00 / $4.00 per M; cached input $0.10 / $0.20 per M; output price $10.00 / $15.00 per M. GPT-6 Sol reads the same on every row except cached input, which is $0.20 / $0.20 per M. A footer line credits OpenAI's model and pricing docs read Oct 7 2026 and explains that the second figure in each price row is the long-context rate above 272,000 input tokens. The OrcaRouter logo appears in the bottom-right corner.

อะไรกันแน่ที่เติมเต็ม 1,050,000 โทเคน

งบประมาณบริบทประกอบด้วยหกสิ่ง และสิ่งเหล่านี้สามารถแคชได้ไม่เท่ากัน สัดส่วนโดยประมาณของคำขอแบบเอเจนต์ขนาด 240,000 โทเคนที่เป็นตัวอย่างประกอบ สัดส่วนเหล่านี้เป็นของเราเอง ส่วนกฎการแคชเป็นของผู้ให้บริการ ซึ่งมาจากคู่มือการแคชพรอมป์ต์ของผู้ให้บริการที่อ่านในวันเดียวกัน

• เนื้อหาระบบที่ผู้ให้บริการแทรกเข้ามาและการจัดรูปแบบคำขอ — ถูกเรนเดอร์ไว้ก่อนข้อความของคุณ คิดค่าบริการเป็นอินพุต และถูกยกเว้นอย่างชัดเจนจากความยาวขั้นต่ำที่แคชได้ ไม่ใช่สิ่งที่คุณควบคุม และไม่ใช่สิ่งที่คุณตัดทอนได้

• คำสั่งสำหรับนักพัฒนาและคำสั่งระบบของคุณ ประมาณ 6,000 โทเคน แคชได้ นี่คือส่วนหน้าของคำนำหน้า ดังนั้นการเปลี่ยนแปลงตรงนี้จะทำให้ทุกอย่างที่อยู่ข้างหลังเป็นโมฆะ

• คำจำกัดความและสคีมาของเครื่องมือ ประมาณ 14,000 โทเค็นสำหรับชุดเครื่องมือที่โฮสต์ไว้บวกกับฟังก์ชันของคุณ สามารถแคชได้ และเป็นส่วนที่เปราะบางที่สุดของพรีฟิกซ์: คู่มือระบุชื่อเครื่องมือ คำอธิบาย สคีมา ลำดับ และคำสั่งเฉพาะของเครื่องมือว่าเป็นสิ่งที่เลื่อนขอบเขตของพรีฟิกซ์

• คลังข้อมูลที่ดึงมา ประมาณ 180,000 โทเคน สามารถแคชได้ และเป็นบรรทัดที่ใหญ่ที่สุดอย่างมากเมื่อเทียบกับบรรทัดอื่น คุ้มค่าที่จะแคชก็ต่อเมื่อมันมีไบต์ที่คงที่ระหว่างการเรียกใช้ — คลังข้อมูลที่ประกอบใหม่ทุกคำขอคือคลังข้อมูลราคาเต็ม

• บันทึกบทสนทนาที่สะสมไว้ — เทิร์นก่อนหน้าและผลลัพธ์ของเครื่องมือ — ประมาณ 30,000 โทเคนและเพิ่มขึ้นเรื่อย ๆ สามารถแคชได้จนถึงการเปลี่ยนแปลงล่าสุด ส่วนผลลัพธ์ของเครื่องมือที่เข้ามาในเทิร์นนี้เป็นอินพุตใหม่ในอัตราเต็ม

• โทเคนการให้เหตุผล — ถูกสร้างขึ้น ไม่ถูกแคช และถูกคิดค่าบริการเป็นเอาต์พุต โทเคนเหล่านี้ใช้พื้นที่หน้าต่าง และไม่ปรากฏให้เห็นในเนื้อความตอบกลับ

มีหมายเหตุเชิงปฏิบัติสองข้อที่ได้จากรายการนั้นโดยตรง ข้อแรก รายการแคชถูกเก็บไว้บนเครื่องแต่ละเครื่อง: คู่มือระบุว่าคำขอสามารถใช้คำนำหน้าซ้ำได้ "เฉพาะเมื่อมันไปถึงเครื่องที่มีรายการที่ตรงกันและยังไม่หมดอายุ" และการจัดเส้นทางแบบโอเวอร์โฟลว์จะเริ่มต้นเมื่อมีคำขอเกินประมาณ 15 ครั้งต่อนาที คำนำหน้าที่คงที่ในโค้ดของคุณก็ยังอาจพลาดในโปรดักชันได้ ข้อสอง คำนำหน้าขั้นต่ำที่แคชได้คือ 1,024 โทเคนอินพุตที่มองเห็นได้ และโทเคนระบบที่ซ่อนอยู่จะไม่นับรวมด้วย — ดังนั้นพรอมป์ต์ระบบขนาดเล็กจึงไม่ใช่คำนำหน้าที่แคชได้ ไม่ว่าคำขอที่อยู่รอบๆ จะใหญ่เพียงใด

เพดานเอาต์พุตเป็นงบประมาณแยกต่างหาก ไม่ใช่การตักเพิ่มอีกจาน

การที่โทเคนเอาต์พุตสูงสุดคือ 128,000 ไม่ได้หมายความว่าจะได้คำตอบ 128,000 โทเคน คู่มือการให้เหตุผลระบุไว้อย่างชัดเจนว่า max_output_tokens กำหนดเพดานจำนวนรวมที่โมเดลสร้างขึ้น "รวมถึงโทเคนการให้เหตุผล โทเคนเอาต์พุตที่มองเห็นได้ และโทเคนการจัดรูปแบบที่มองไม่เห็น" และโทเคนการให้เหตุผลจะถูกคิดค่าใช้จ่ายเป็นเอาต์พุตในขณะที่กินพื้นที่ในหน้าต่าง

การตัดทอนจึงกลายเป็นการตัดสินใจเชิงออกแบบมากกว่ากรณีขอบ เนื่องจากลักษณะการล้มเหลวของมัน เมื่อการสร้างถึงขีดจำกัด คำตอบจะถูกส่งกลับด้วยสถานะ incomplete และเหตุผล max_output_tokens — และคู่มือเตือนว่า "อาจเกิดขึ้นก่อนที่โทเคนเอาต์พุตที่มองเห็นได้จะถูกสร้างขึ้น ซึ่งหมายความว่าคุณอาจเสียค่าใช้จ่ายสำหรับโทเคนอินพุตและโทเคนการให้เหตุผลโดยไม่ได้รับคำตอบที่มองเห็นได้" งบที่ใช้หน้าต่างทั้งหมดไปกับอินพุตและปล่อยให้การจองเอาต์พุตเป็นเรื่องของโอกาสนั้น เป็นงบที่สามารถเรียกเก็บเงินสำหรับคำขอ long-context เต็มรูปแบบและไม่คืนสิ่งใดที่ผู้เรียกสามารถแยกวิเคราะห์ได้ คำแนะนำเริ่มต้นของผู้ให้บริการเองคือให้จองอย่างน้อย 25,000 โทเคนสำหรับการให้เหตุผลและเอาต์พุต ขณะที่คุณยังคงวัดว่าพรอมต์ต้องการจริงเท่าใด

GPT-6.1 Sol ทำให้เรื่องนี้ชัดเจนขึ้น และเป็นหนึ่งในไม่กี่บรรทัดที่เฉพาะเจาะจงกับ 6.1 อย่างแท้จริงในรีลีสนี้ ระดับความพยายามในการใช้เหตุผลของมันมีตั้งแต่ low, medium, high, xhigh และ max และไม่รองรับการตั้งค่า none และ minimal GPT-6 Sol รองรับทั้งหกค่า ดังนั้นจึงไม่มีการตั้งค่าบน 6.1 ที่ปิดการใช้จ่ายในการใช้เหตุผล ค่าเริ่มต้นคือ medium และด้านเอาต์พุตของงบประมาณนั้นไม่มีวันฟรี

การแบ่งครึ่งอินพุตที่แคชไว้ อ่าน ณ จุดที่หน้าต่างกว้างที่สุด

อัตราเดียวบนการ์ด GPT-6.1 Sol ที่ปรับเปลี่ยนสวนทางกับ GPT-6 Sol คืออินพุตแบบแคช: จาก $0.20 ลดลงเหลือ $0.10 ต่อล้านโทเค็น ซึ่งหน้ารุ่นแสดงเป็น 5% ของอัตราอินพุตที่ไม่ได้แคช และคู่มือการแคชของผู้ขายระบุไว้อย่างชัดเจนว่าเป็นกรณี 0.05x เทียบกับ 0.1x ซึ่งเป็นอัตราที่โมเดล GPT-5.6-and-later ส่วนใหญ่ใช้ อินพุต การเขียนแคช และเอาต์พุตเหมือนกันบนการ์ดทั้งสอง และตัวคูณบริบทแบบยาวก็เหมือนกันด้วย

สำหรับปริมาณงานที่หน้านี้กล่าวถึงโดยตรง นั่นคือมิเตอร์ที่ถูกต้องที่ควรย้าย และเหตุผลก็คือองค์ประกอบของคำขอแบบยาว ไม่ใช่ขนาดของมัน ในงาน 300,000 โทเคนข้างต้น 260,000 ของโทเคนอินพุตเป็นคำนำหน้าที่แคชไว้ — 87 เปอร์เซ็นต์ของทุกอย่างที่คำขอส่งไป บรรทัดที่แคชไว้จึงเป็นมิเตอร์อินพุตเดี่ยวที่ใหญ่ที่สุดในบิล ซึ่งเป็นคุณสมบัติทั่วไปของงานที่ใช้บริบทยาว ยิ่งหน้าต่างที่คุณใช้ยาวขึ้นเท่าไร ก็ยิ่งมีสัดส่วนที่เป็นคำนำหน้าที่คุณส่งไปแล้วมากขึ้นเท่านั้น การลดมิเตอร์นั้นลงครึ่งหนึ่งมีมูลค่า $0.052 สำหรับคำขอนั้น

และหน้าผาเก็บคืนมากกว่าที่การลดครึ่งหนึ่งให้ ในคำขอเดียวกัน งาน 300,000 โทเคนเดียวกันบน GPT-6.1 Sol หากคิดราคาด้วยอัตราบริบทสั้นที่มันจะได้จ่ายเมื่ออยู่ใต้เส้น จะมีค่าใช้จ่าย $0.166 แทนที่จะเป็น $0.302 — ค่าข้ามเส้น $0.136 หรือประมาณ 2.6 เท่าของมูลค่ามิเตอร์ที่เปลี่ยนแปลงเพียงหนึ่งเดียวในรีลีสนี้ เหนือเส้นขึ้นไป อัตราแคชแสดงเป็น $0.20 ซึ่งไม่ใช่ตัวเลขใหม่ในตระกูลนี้: มันเป็นสองเท่าของราคาพาดหัวบนการ์ด 6.1 และเป็นอัตราที่ GPT-6 Sol เคยคิดสำหรับการอ่านจากแคชใต้เส้นก่อนรีลีสนี้พอดี เวิร์กโหลดแคชแบบบริบทยาวเก็บการเปลี่ยนแปลงที่พาดหัวไว้ แล้วคืนมันกลับที่เส้นแบ่ง และเส้นแบ่ง — ไม่ใช่โมเดล — คือสาเหตุ

A screenshot of the machine-readable markdown form of OpenAI's GPT-6.1 Sol model documentation, captured October 7 2026, showing the Model details block with the three figures on consecutive lines — 1,050,000 context window, Maximum input tokens: 922,000, and 128,000 max output tokens — above the Text tokens pricing table listing Input $2, Cached input $0.1, Cache writes $2.5 and Output $10 per 1M tokens, the note that cached input tokens are priced at 5% of the uncached input rate, and the sentence 'Prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request.'

วิธีกำหนดขนาดงบประมาณบริบท

ในเชิงกระบวนการ โดยเรียงตามลำดับที่ข้อจำกัดมีผลผูกพัน:

• นับคำขอ อย่าประมาณเอา ส่ง POST เพย์โหลดที่แน่นอน — ทั้งเครื่องมือ รูปภาพ ไฟล์ และทุกอย่าง — ไปยัง endpoint สำหรับนับจำนวนโทเค็นอินพุตบน Responses API คู่มือพูดตรง ๆ ถึงเหตุผลว่า: การนับนี้รวมโทเค็นการจัดรูปแบบสำหรับบทบาทและขอบเขตของข้อความ ซึ่งไม่เคยปรากฏในข้อความที่คุณแตกโทเค็นได้ในเครื่อง และการประมาณในเครื่อง เช่น จำนวนอักขระหารด้วยสี่ ก็ไม่แม่นยำสำหรับรูปภาพ ไฟล์ และสคีมา

• จองฝั่งเอาต์พุตไว้ก่อน เลือก max_output_tokens โดยคำนึงว่ามันครอบคลุมทั้งการให้เหตุผล เอาต์พุตที่มองเห็น และการจัดรูปแบบไว้ด้วยกัน และเริ่มจากบัฟเฟอร์ 25,000 โทเค็นของผู้ให้บริการ แทนที่จะเริ่มจากศูนย์ งบประมาณอินพุตของคุณคือหน้าต่างลบด้วยการจองนั้น และตัวเลขเก้าร้อยยี่สิบสองคือเวอร์ชันของผู้ให้บริการของการลบแบบเดียวกัน

• กำหนดราคาคำขอทั้งสองฝั่งของ 272,000 ก่อนที่คุณจะส่งมัน ขั้นนี้ใหญ่พอที่คำขอซึ่งออกแบบให้ลงต่ำกว่าเส้นเพียงเล็กน้อย กับคำขอซึ่งออกแบบให้ลงสูงกว่าเส้นนั้นเพียงเล็กน้อย จะเป็นผลิตภัณฑ์ที่แตกต่างกัน

• จัดเรียงส่วนนำหน้าตามความเสถียร คำสั่ง จากนั้นสคีมาของเครื่องมือ จากนั้นคลังข้อมูล จากนั้นบทถอดเสียง สิ่งใดก็ตามที่เปลี่ยนแปลงไประหว่างการเรียก ควรวางไว้ท้ายสุด ซึ่งจะเสียเพียงการจับคู่ส่วนนำหน้า แทนที่จะเสียแคชทั้งหมด

• ผ่าน 1,024 โทเค็นอินพุตที่มองเห็นได้ก่อนจึงจะคาดหวังแคชได้ ต่ำกว่าขั้นต่ำนั้นจะไม่มีอะไรถูกแคช และโทเค็นที่ซ่อนอยู่ของผู้ให้บริการจะไม่นับรวมด้วย

• ตรวจสอบว่าการนำกลับมาใช้ซ้ำเป็นไปได้ คำนำหน้าต้องถูกนำกลับมาใช้ซ้ำภายในอายุการใช้งานของแคช 30 นาที และต้องไปอยู่บนเครื่องที่เก็บรายการนั้นไว้ ทั้งสองข้อนี้มีอธิบายไว้ในคู่มือ และไม่ใช่คุณสมบัติของโค้ดของคุณ

• วัดใหม่หลังจากการเปลี่ยนแปลงโมเดลหรือการตั้งค่าใด ๆการย้ายไปใช้ GPT-6.1 Sol จะลบตัวเลือกปิดการให้เหตุผลออก ซึ่งเปลี่ยนจำนวนโทเคนการให้เหตุผล และด้วยเหตุนี้จึงเปลี่ยนฝั่งเอาต์พุตของงบประมาณ — และการเปลี่ยนแปลงระดับความพยายามในการให้เหตุผล เครื่องมือ สคีมาของเอาต์พุตแบบมีโครงสร้าง หรือการจัดการบริบท ก็อาจเลื่อนขอบเขตคำนำหน้าและทำให้คุณสูญเสียอัตราค่าใช้จ่ายแบบแคชไปทั้งหมดได้เช่นกัน

• ตัดสินใจว่าจะเกิดอะไรขึ้นเมื่องานไม่ยอมลดขนาดลง คอมแพกชันคือทางออกที่ระบุไว้ในเอกสาร: คำขอ Responses สามารถตั้งค่า context_management พร้อมเกณฑ์ compact ได้ และเซิร์ฟเวอร์จะแทนที่เนื้อหาบทสนทนาก่อนหน้าด้วยไอเทมคอมแพกชันแบบทึบที่นำสถานะสำคัญส่งต่อไปข้างหน้าด้วยโทเคนที่น้อยลง นี่เป็นการตัดสินใจเรื่องงบประมาณมากกว่าการตัดทิ้งแบบฟรี เพราะคู่มือระบุว่าคอมแพกชัน "สามารถป้องกันการนำกลับมาใช้ซ้ำได้นับจากโทเคนที่เปลี่ยนแปลงตัวแรกเป็นต้นไป" — การทำคอมแพกชันหนึ่งรอบจะทำให้คำนำหน้าที่อยู่ข้างหลังใช้ไม่ได้

A screenshot of the OrcaRouter model page at www.orcarouter.ai/models/openai/gpt-6-sol, captured October 7 2026, showing the OrcaRouter nav bar, the breadcrumb Home -> Models -> OpenAI, the model identifier openai/gpt-6-sol attributed to OpenAI with the date 2026-09-22, the Vision, Tools, JSON and Reasoning capability badges, the spec tiles reading Max output 128K, input text + image + file, output text and a p50 TTFT of 1.44 s, the description stating a 1.05M-token context, and the /v1/chat/completions rate row of $2.00 in and $10.00 out per 1M tokens.

การคำนวณทางคณิตศาสตร์บนหน้านี้เริ่มจากรุ่นที่ GPT-6.1 Sol เข้ามาแทนที่ และขั้นนั้นคือขั้นที่เรียกใช้ได้ในวันนี้: การ์ดของเราสำหรับ openai/gpt-6-sol รายงานหน้าต่างบริบท 1,050,000 โทเคน โดยมีเอาต์พุตสูงสุด 128,000 โทเคน ที่ราคาตามรายการของ OpenAI โดยมีมาร์กอัป 0% — ราคาของผู้ขายคือราคาที่แสดงบนหน้าเว็บ และการปรับราคาของผู้ขายจะปรากฏที่นั่นในวันเดียวกันแทนที่จะเป็นตอนต่ออายุ การ์ดของเราไม่มีฟิลด์อินพุตสูงสุดของตัวเอง ดังนั้นตัวเลข 922,000 โทเคนสำหรับโมเดลดังกล่าวจึงต้องมาจากเอกสารของผู้ขายเอง ซึ่งเป็นสิ่งที่หน้านี้ใช้มาตลอด สิ่งที่การ์ดนี้มีประโยชน์คือการกำหนดขนาด: หน้าต่างและเพดานเอาต์พุตที่มันเผยแพร่คือตัวเลขสองตัวที่ขั้นตอนงบประมาณด้านบนนำมาลบกัน และขั้นที่ต่ำกว่าคือขั้นที่คุณสามารถรันขั้นตอนนั้นได้จริงในขณะที่ 6.1 ยังใหม่ อยู่ที่ https://www.orcarouter.ai/models/openai/gpt-6-sol

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube