กระดานคะแนนเปรียบเทียบสองคอลัมน์ที่สร้างขึ้นชื่อ 'GPT-6.1 Sol vs GPT-5.6 Sol - กระดานคะแนน' คอลัมน์ซ้าย 'GPT-6.1 Sol': แถวที่อ่านว่า 'ดัชนีความฉลาด: 51.8', 'ค่าใช้จ่ายต่องานดัชนี: $0.72', 'อินพุต / เอาต์พุต: $2.00 / $10.00', 'อินพุตแคช: $0.10', 'โทเค็นเอาต์พุตในการรันดัชนี: 67M', 'พื้นความพยายาม: ต่ำ' คอลัมน์ขวา 'GPT-5.6 Sol': แถวที่อ่านว่า 'ดัชนีความฉลาด: 47.0', 'ค่าใช้จ่ายต่องานดัชนี: $1.99', 'อินพุต / เอาต์พุต: $4.00 / $20.00', 'อินพุตแคช: $0.40', 'โทเค็นเอาต์พุตในการรันดัชนี: 90M', 'พื้นความพยายาม: ไม่มี' ส่วนท้ายอ่านว่า 'ตัวเลขอิสระตาม Artificial Analysis v4.3.2 ที่ความพยายามสูงสุด; ราคาตามรายการของผู้ขาย'
Guides & Insights

GPT-6.1 Sol กับ GPT-5.6 Sol: คะแนนดัชนีสี่จุดครึ่ง ค่าใช้จ่ายครึ่งเดียว การถดถอยสองรายการ

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

OpenAI เปิดตัว GPT-6.1 Sol เมื่อวันที่ 29 กันยายน 2026 ซึ่งเป็นสิบเอ็ดสัปดาห์หลังจาก GPT-5.6 Sol ซึ่งเปิดตัวเมื่อวันที่ 9 กรกฎาคม 2026 ในฐานะเรือธงของรุ่นก่อนหน้า ทั้งสองยังคงวางจำหน่ายอยู่ ทั้งสองยังคงเรียกใช้งานได้ และความแตกต่างระหว่างทั้งสองบนบอร์ดกลางคือ 4.8 คะแนน — 51.8 เทียบกับ 47.0 บน Intelligence Index ของ Artificial Analysis โดยทั้งคู่วัดที่ความพยายามในการให้เหตุผลสูงสุดบนชุดการประเมินสิบรายการเดียวกัน ความแตกต่างด้านราคาใหญ่กว่าความแตกต่างด้านคะแนนมาก: $0.72 ต่องานดัชนีที่เสร็จสมบูรณ์ เทียบกับ $1.99 และ $2.00/$10.00 ต่อล้านโทเค็น เทียบกับ $4.00/$20.00 นั่นคือเวอร์ชันสั้น เวอร์ชันยาวคือการอัปเกรดไม่สม่ำเสมอ และการประเมินสองรายการถอยหลัง

แต่ละโมเดลคืออะไร และอะไรเข้ามาแทนที่อะไร

GPT-5.6 Sol เป็นรุ่นสูงสุดในสาย 5.6 — โมเดลแบบปิดที่ให้บริการผ่าน API เท่านั้น มีหน้าต่างบริบทขนาด 1,050,000 โทเคน เพดานเอาต์พุต 128,000 โทเคน รองรับอินพุตแบบข้อความ รูปภาพ และไฟล์ และมีระดับการให้เหตุผลไล่ตั้งแต่ none ไปจนถึง max ซึ่ง Open​AI อธิบายว่าเป็นระดับที่สร้างขึ้นสำหรับงานที่ยากที่สุด ทั้งเวิร์กโฟลว์แบบเอเจนต์ที่ต้องทำงานระยะยาว วิศวกรรมซอฟต์แวร์ระดับหลายไฟล์ และการให้เหตุผลเชิงลึก โดยกำหนดราคาไว้ที่ 4.00 และ 20.00 ดอลลาร์ต่อล้านโทเคน อินพุตแบบแคชอยู่ที่ 0.40 ดอลลาร์ และการเขียนแคชอยู่ที่ 5.00 ดอลลาร์ เมื่ออินพุตเกิน 272,000 โทเคน ราคาจะปรับเป็น 8.00 และ 30.00 ดอลลาร์ และมีระดับ Batch ที่ 2.50 และ 15.00 ดอลลาร์

GPT-6.1 Sol เป็นรุ่นระดับกลางของเจเนอเรชันที่ตามหลังมา: อยู่ต่ำกว่า GPT-6 Astra อยู่เหนือ GPT-6 Luna และตอนนี้เป็นโมเดลที่ OpenAI ชี้แนะให้นักพัฒนาที่คำนึงถึงต้นทุนหันมาใช้ โดยยังคงหน้าต่าง 1,050,000 โทเคน และเพดานเอาต์พุต 128,000 โทเคนไว้ ขยายวันตัดข้อมูลความรู้จาก 20 เมษายนเป็น 30 เมษายน 2026 และลดขั้นบันไดระดับความพยายามจากหกขั้นเหลือห้าขั้น — low, medium (ค่าเริ่มต้น), high, xhigh, max ค่า none ที่ GPT-5.6 Sol เคยรองรับ ตอนนี้จะส่งคืนข้อผิดพลาด และคำแนะนำการย้ายรุ่นของ OpenAI ระบุชัดเจนว่าค่าที่ใช้แทนคือ low ไม่ใช่การอัปเกรดแบบเงียบ ๆ

เรื่องนี้ควรหยุดคิดสักหน่อย เพราะเป็นความเปลี่ยนแปลงเพียงอย่างเดียวในรีลีสนี้ที่ต้องเสียเงินเพิ่มแทนที่จะประหยัด noneพายป์ไลน์ที่เรียกใช้ค่านี้เพื่อให้ได้การเรียกแบบราคาถูก รวดเร็ว และไม่ใช้การให้เหตุผล จะไม่มีคอนฟิกูเรชันนั้นอีกต่อไปแล้ว ไม่ว่าจะเป็นโมเดลตระกูลไหนก็ตาม ขั้นที่ถูกที่สุดบน GPT-6.1 Sol คือขั้นที่ใช้การให้เหตุผล และโทเคนการให้เหตุผลถูกคิดค่าใช้จ่ายเป็นโทเคนเอาต์พุต ไม่ว่าคุณจะมองเห็นมันหรือไม่

บันได ทีละขั้น

คณะกรรมการอิสระเผยแพร่คะแนนและต้นทุนการรันสำหรับทุกการตั้งค่าระดับความพยายามบนทั้งสองโมเดล ซึ่งทำให้การเปรียบเทียบแบบตัวต่อตัวกลายเป็นสิ่งที่มีประโยชน์มากกว่าการเปรียบเทียบเพียงครั้งเดียว เมื่อจัดเทียบกันที่การตั้งค่าที่เทียบเท่ากัน:

• ระดับความพยายาม, GPT-6.1 Sol — สูงสุด 51.8 ที่ $0.72 ต่องานดัชนี; xhigh 51.0 ที่ $0.39; สูง 50.2 ที่ $0.32; ปานกลาง (ค่าเริ่มต้น) 47.8 ที่ $0.21 • ความเร็วเอาต์พุต — 59.7 โทเค็นต่อวินาทีสำหรับ GPT-6.1 Sol เทียบกับ 87.8 สำหรับ GPT-5.6 Sol
• เวลาถึงชังก์แรก — 332 วินาทีสำหรับ GPT-6.1 Sol เทียบกับค่าที่เร็วกว่าสำหรับ GPT-5.6 Sol เมื่อเทียบกับค่ามัธยฐานของบอร์ดที่ประมาณ 4 วินาที
• โทเค็นเอาต์พุตในการรันดัชนี — 67.2 ล้านสำหรับ GPT-6.1 Sol เทียบกับ 90.0 ล้านสำหรับ GPT-5.6 Sol
• ราคาอินพุต / เอาต์พุต — $2.00 / $10.00 เทียบกับ $4.00 / $20.00
• อินพุตที่แคชไว้ — $0.10 เทียบกับ $0.40; การเขียนแคช $2.50 เทียบกับ $5.00
• อัตราแบตช์ — ไม่ได้เผยแพร่สำหรับ GPT-6.1 Sol เทียบกับ $2.50 / $15.00 สำหรับ GPT-5.6 Sol
• ขั้นบริบทแบบยาว — เมื่อเกิน 272,000 โทเค็นอินพุต GPT-6.1 Sol จะคิดราคาใหม่เป็น $4.00 / $15.00 สำหรับทั้งคำขอ เทียบกับ $8.00 / $30.00 ของ GPT-5.6 Sol
• ระดับความพยายามขั้นต่ำ — ต่ำ เทียบกับ ไม่มี

จากรายการนั้นมีสองประเด็นที่ตามออกมา ประการแรกคือการลดราคาเป็นเรื่องเชิงโครงสร้าง而非 promotional: อัตรามาตรฐานของ GPT-6.1 Sol ที่ 2.00 และ 10.00 ดอลลาร์ ต่ำกว่าอัตราแบบเป็นชุดของ GPT-5.6 Sol ที่ 2.50 และ 15.00 ดอลลาร์ ดังนั้นแม้แต่ระดับที่ได้ส่วนลดของโมเดลเก่าก็ยังแพงกว่าราคาปกติของโมเดลใหม่ ประการที่สองคือการอัปเกรดนี้ไม่ได้เป็นเส้นตรงในแง่ความหน่วง GPT-6.1 Sol สร้างเอาต์พุตช้าลงประมาณหนึ่งในสาม และใช้เวลา 332 วินาทีถึง chunk แรกในการทดสอบพรอมป์ยาวของบอร์ด — อยู่ในลำดับขนาดเดียวกันกับ 107 วินาทีของ GPT-6 Sol และประมาณแปดสิบเท่าของค่ามัธยฐานของบอร์ด หากคุณสร้างผลิตภัณฑ์เชิงโต้ตอบบน GPT-5.6 Sol นี่คือการถดถอยเชิงฟังก์ชันที่ไม่ขึ้นกับเกณฑ์มาตรฐานใด ๆ และการแก้ไขต้องเป็นเชิงสถาปัตยกรรม ไม่ใช่พารามิเตอร์

A generated hero card for a GPT-6.1 Sol versus GPT-5.6 Sol comparison, headed 'Four and a half index points, half the bill', with two badges reading 'GPT-6.1 Sol: $0.72 per index task' and 'GPT-5.6 Sol: $1.99 per index task', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

การประเมินสองรายการเคลื่อนไปในทางที่ผิด

ผลได้แบบรวมอยู่ที่ 4.8 คะแนน องค์ประกอบต่างๆ ไม่ได้เป็นบวกอย่างสม่ำเสมอ และคะแนนการประเมินแต่ละครั้งของคณะกรรมการก็บ่งชี้เช่นนั้น

• SciCode — GPT-6.1 Sol 0.542 เทียบกับ GPT-5.6 Sol 0.571 การถดถอย 2.9 จุดในการเขียนโค้ดเชิงวิทยาศาสตร์
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575.1 เทียบกับ GPT-5.6 Sol Elo 1611.3 การถดถอย 36 จุดใน Elo สำหรับงานความรู้ที่มีคุณค่าทางเศรษฐกิจ
• Humanity's Last Exam — GPT-6.1 Sol 0.529 เทียบกับ GPT-5.6 Sol 0.495 เพิ่มขึ้น 3.4 จุด
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.561 เทียบกับ GPT-5.6 Sol 0.399 เพิ่มขึ้น 16 จุด ซึ่งเป็นการเปลี่ยนแปลงครั้งใหญ่ที่สุดในคู่นี้
• AA-Omniscience — GPT-6.1 Sol 41.5 เทียบกับ GPT-5.6 Sol 22.0 ซึ่งเกี่ยวกับความน่าเชื่อถือของความรู้และการหลอนมากกว่าการเรียกคืนข้อมูลดิบ
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — ห้าตัวที่เหลือ ซึ่งเติมเต็มคะแนนรวมและเป็นจุดที่ได้รับกำไรส่วนที่เหลือจาก 4.8 จุด

โมเดลที่ทำงานบนเทอร์มินัลได้ดีขึ้นอย่างมีความหมาย เชื่อถือได้ด้านข้อเท็จจริงดีขึ้นอย่างมาก และแย่ลงอย่างวัดได้ในงานเขียนโค้ดเชิงวิทยาศาสตร์และใน Elo ด้านงานวิชาชีพ ไม่ใช่โมเดลที่ดีกว่าโดยสิ้นเชิง มันเป็นจุดที่ต่างออกไปบนพรมแดน และถูกวางไว้ตรงนั้นอย่างจงใจ: กรอบการเปิดตัวของ Open​AI เองสำหรับ GPT-6.1 Sol คือต้นทุนต่องานที่ทำสำเร็จที่คุณภาพใกล้ระดับเรือธง ไม่ใช่คะแนนสูงสุด หากภาระงานของคุณมีรูปทรงแบบ SciCode หรือแบบ GDPval ตัวเลขคอมโพสิตไม่ใช่ตัวที่ใช้กับคุณ แต่การถดถอยต่างหากที่ใช้

GPT-5.6 Sol ยังคงมีผลลัพธ์ long-context ที่เผยแพร่แล้ว

จุดเดียวที่โมเดลรุ่นเก่ามีตัวเลขแต่รุ่นใหม่ไม่มี คือความแม่นยำในการดึงข้อมูลในช่วงบริบทที่เรตการ์ดของ GPT-6.1 Sol เปลี่ยนแปลง GPT-5.6 Sol มีผลลัพธ์ MRCR v2 แบบ eight-needle ที่เผยแพร่แล้วอยู่ที่ 91.5% ในช่วง 256,000 ถึง 512,000 โทเคน GPT-6.1 Sol ไม่มีผลลัพธ์ที่เผยแพร่เทียบเคียง และเมื่อมีโทเคนอินพุตเกิน 272,000 คำขอทั้งหมดจะถูกคิดราคาใหม่ที่ 2 เท่าสำหรับอินพุตและแคช และ 1.5 เท่าสำหรับเอาต์พุต

นำข้อเท็จจริงสองข้อนี้มารวมกัน แล้วส่วนที่เศรษฐศาสตร์ของโมเดลใหม่อ่อนแอที่สุดก็คือส่วนเดียวกับที่โมเดลเก่ามีจุดแข็งเพียงหนึ่งเดียวที่มีการบันทึกไว้พอดี การประหยัดไม่ได้หายไป — $4.00 และ $15.00 บนระดับราคาที่ตั้งใหม่ เทียบกับ $8.00 และ $30.00 บนระดับ long-context ของ GPT-5.6 Sol เอง ก็ยังเป็นการลดลงครึ่งหนึ่งอยู่ดี — แต่เรื่องราวราคาครึ่งเดียวเป็นเรื่องราวของงานทั่วไป และไปป์ไลน์การค้นคืนแบบ long-context ไม่ใช่แบบนั้น ถ้าเวิร์กโหลดของคุณเป็นแบบนั้น GPT-5.6 Sol ที่ราคา $4.00 และ $20.00 พร้อมตัวเลข 91.5% ที่เปิดเผยไว้ ก็เป็นจุดที่ยืนหยัดได้อย่างสมเหตุสมผล

ผลลัพธ์อื่นๆ ที่เผยแพร่ของ GPT-5.6 Sol ยังคงเดิม และนี่คือเหตุผลที่บางทีมจะไม่ย้ายไปใช้: BrowseComp 90.4 สำหรับเอเจนต์วิจัยเว็บ, Terminal-Bench 2.1 ที่ 88.8 และ 88.0, SWE-Bench Pro 64.6, Agents' Last Exam 53.6, OSWorld 2.0 ที่ 62.6 เหล่านี้เป็นผลที่ OpenAI รายงาน บนฮาร์เนสของ OpenAI และถูกรายงานในเดือนกรกฎาคม สิ่งที่เปลี่ยนไปตั้งแต่นั้นคือคณะกรรมการตอนนี้ให้คะแนนทั้งสองโมเดลบนชุดทดสอบเดียวภายใต้การตั้งค่าชุดเดียว และโมเดลที่เก่ากว่าจะแพ้ในคะแนนรวมและด้านต้นทุน

การย้ายข้อมูลเองเป็นการเปลี่ยนแปลงสตริง โดยมีข้อยกเว้นหนึ่งประการ

ผู้ให้บริการรายเดียวกัน ขอบเขต API เดียวกัน อยู่ในอันดับติดกัน หน้าต่างและเพดานเอาต์พุตเดียวกัน — ดังนั้นสำหรับสแตกส่วนใหญ่ นี่จึงเป็นตัวระบุโมเดลและราคาที่ลดลงครึ่งหนึ่ง ข้อยกเว้นนั้นเฉพาะเจาะจงและควรค่าแก่การกล่าวถึงก่อนที่คุณจะสลับสวิตช์

หากโค้ดของคุณตั้งค่า reasoning.effort เป็น none หรือ minimal มันจะล้มเหลวแทนที่จะลดระดับลง และ low คือค่าทดแทนที่ระบุไว้ในเอกสาร หากทราฟฟิกของคุณมีจำนวนโทเคนอินพุตเกิน 272,000 ให้ตรวจสอบระดับราคาที่ปรับใหม่ก่อนที่คุณจะคำนวณความประหยัด หากผลิตภัณฑ์ของคุณขึ้นอยู่กับ time to first token ให้วัดก่อนที่จะปล่อย เพราะตัวเลข 332 วินาทีของบอร์ดไม่ใช่ความคลาดเคลื่อนจากการปัดเศษ และหากการประเมินของคุณมีส่วนที่เป็นรูปทรงแบบ SciCode หรือ GDPval อยู่ ให้รันส่วนนั้นบนทั้งสองโมเดลแทนที่จะเชื่อคะแนนรวม

ทั้งสองโมเดลอยู่บน OrcaRouter ในราคาตามรายการของ OpenAI เอง — GPT-6.1 Sol ที่ $2.00 และ $10.00 โดยอินพุตแบบแคชที่ $0.10, GPT-5.6 Sol ที่ $4.00 และ $20.00 โดยอินพุตแบบแคชที่ $0.40 — ภายใต้โมเดลแบบ pass-through ที่ทำให้การเปลี่ยนแปลงราคาของ OpenAI มาอยู่ฝั่งเราในวันเดียวกับที่ประกาศใช้ แทนที่จะเป็นหลังผู้ขายต่อเจรจาใหม่ เพราะรายการราคาถูกส่งผ่านโดยไม่เปลี่ยนแปลงแทนที่จะบวกเพิ่ม การคำนวณในบทความนี้จึงเป็นการคำนวณที่คุณได้รับจริง: โมเดล $0.72 ต่องานแบบเดียวกัน การลดครึ่งแบบเดียวกัน และไม่มีค่าพรีเมียมของแพลตฟอร์มมาเพิ่มในฝั่งใดฝั่งหนึ่ง

A screenshot of the OrcaRouter model page for openai/gpt-5.6-sol, showing the listing dated 2026-07-09, the model described as the flagship of OpenAI's GPT-5.6 series for deep multi-step reasoning and long-horizon agentic workflows, a 1.05M-token context with 128K maximum output, text, image and file input, and the list price of $4.00 input and $20.00 output per million tokens.

ประโยชน์ในทางปฏิบัติของการมีทั้งสองอยู่หลังเอนด์พอยต์เดียวคือการเปรียบเทียบยังคงดำเนินอยู่ ส่งทราฟฟิกใหม่ไปที่ GPT-6.1 Sol เก็บ GPT-5.6 Sol ไว้ห่างจากการเปลี่ยนแปลงการกำหนดค่าเพียงครั้งเดียวในฐานะตัวสำรองและในฐานะเส้นทางบริบทยาว และให้ automatic failover ครอบคลุมช่วงเวลาที่ความพร้อมใช้งานของเรือธงอายุสองเดือนและการเปิดใช้งาน Enterprise ยังคงเข้าที่ การโยกย้ายที่ลดค่าใช้จ่ายลงครึ่งหนึ่งและทำให้ sub-benchmarks สองรายการถอยหลัง ไม่ใช่การตัดสินใจที่ทำครั้งเดียวแล้วลืม แต่เป็นการตัดสินใจที่ต้องทำแยกตามเส้นทาง และเลเยอร์การจัดเส้นทางคือสิ่งที่ทำให้มันมีต้นทุนต่ำ

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

ที่ที่แต่ละรายการอยู่

• งานเอเจนต์และงานเทอร์มินัลทั่วไป — GPT-6.1 Sol สิบหกคะแนนบน Terminal-Bench 4.0 บวกกับราคาเพียงครึ่งเดียว ไม่ใช่การตัดสินใจที่สูสี
• ความน่าเชื่อถือด้านข้อเท็จจริง ผลิตภัณฑ์ที่ตอบโดยอ้างอิงข้อมูลที่ดึงมา — GPT-6.1 Sol โดยมีช่องว่างบน AA-Omniscience เกือบยี่สิบคะแนน
• การเขียนโค้ดเชิงวิทยาศาสตร์ — ตรวจสอบการประเมินของคุณเองก่อน กระดานคะแนนแสดงการถดถอย 2.9 คะแนน และคะแนนรวมจะไม่เปิดเผยสิ่งนั้น
• งานความรู้ที่มีคุณค่าทางเศรษฐกิจ — ข้อควรระวังเดียวกัน การถดถอย Elo ของ GDPval-AA อยู่ที่ 36 คะแนน
• การค้นคืนบริบทขนาดยาวที่เกิน 272,000 โทเคน — GPT-5.6 Sol จนกว่า GPT-6.1 Sol จะมีตัวเลขที่เผยแพร่ในช่วงดังกล่าว
• ส่วนติดต่อแบบอินเทอร์แอกทีฟที่ไวต่อความหน่วง — วัดผลก่อนย้ายระบบ เอาต์พุตเร็วขึ้น แต่โทเคนแรกช้าลงมาก
• การเรียกแบบไม่ใช้การให้เหตุผลที่ถูกที่สุด — ไม่ใช่ทั้งสอง การตั้งค่านั้นไม่มีอยู่ในตระกูลนี้แล้ว

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube