ตารางเปรียบเทียบสองคอลัมน์ที่สร้างขึ้น หัวข้อ 'GPT-6.1 Sol กับ GPT-6 Luna - กระดานคะแนน' คอลัมน์ซ้าย 'GPT-6.1 Sol': แถวที่อ่านว่า 'ดัชนีความฉลาด: 51.8', 'ค่าใช้จ่ายต่องานดัชนี: $0.72', 'ราคาต่อ 1 ล้าน: $2.00 / $10.00', 'โทเคนเอาต์พุตในการรันดัชนี: 67M', 'Terminal-Bench 4.0: 56.1%', 'พื้นความพยายาม: ต่ำ' คอลัมน์ขวา 'GPT-6 Luna': แถวที่อ่านว่า 'ดัชนีความฉลาด: 38.1', 'ค่าใช้จ่ายต่องานดัชนี: $0.07', 'ราคาต่อ 1 ล้าน: $0.10 / $0.50', 'โทเคนเอาต์พุตในการรันดัชนี: 144M', 'Terminal-Bench 4.0: 12.6%', 'พื้นความพยายาม: ไม่มี' ส่วนท้ายอ่านว่า 'ตัวเลขอิสระตาม Artificial Analysis v4.3.2 ที่ความพยายามสูงสุด; ราคาตามที่ผู้ขายประกาศ'
Guides & Insights

GPT-6.1 Sol กับ GPT-6 Luna: สิบสามคะแนนดัชนี ราคาสิบเท่า และสองการทดสอบที่มันไม่เป็นจริง

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

OpenAI เปิดตัว GPT-6.1 Sol เมื่อวันที่ 29 กันยายน 2026 หนึ่งสัปดาห์หลังจากที่ GPT-6 Luna เปิดตัวเมื่อวันที่ 22 กันยายน ในรอบงานเปิดตัวเดียวกัน ทั้งสองคือสองปลายสุดของเจเนอเรชันเดียวกัน: Luna คือระดับราคาถูก Sol คือระดับกลางที่อยู่เหนือขึ้นไป และ GPT-6 Astra อยู่เหนือทั้งสอง ความต่างของราคาระหว่างสองรุ่นอยู่ที่หนึ่งหลัก — 0.10 และ 0.50 ดอลลาร์ต่อล้านโทเคน เทียบกับ 2.00 และ 10.00 ดอลลาร์ อินพุตแบบแคช 0.01 เทียบกับ 0.10 — และความต่างของขีดความสามารถบนบอร์ดทดสอบอิสระคือ 13.7 คะแนน Intelligence Index, 51.8 เทียบกับ 38.1 ที่ความพยายามในการใช้เหตุผลสูงสุด จ่ายเงินสิบคูณเพื่อสิบสามคะแนนนั้นถือเป็นอัตราแลกเปลี่ยนที่แย่ที่สุดในไลน์อัป OpenAI ปัจจุบัน สิ่งที่ทำให้การเปรียบเทียบนี้คุ้มค่าแก่การเขียนถึงคือคำถามสี่สิบดอลลาร์ที่ตามมา: สิบสามคะแนนไหน?

สองโมเดล และหนึ่งสัปดาห์ที่คั่นระหว่างทั้งสอง

GPT-6 Luna เป็นโมเดลขนาดเล็กในตระกูล GPT-6 — รุ่นที่ Open​AI อธิบายว่าสร้างขึ้นสำหรับงานปริมาณมากที่ไวต่อความหน่วง เช่น การจำแนกประเภท การสกัดข้อมูล การจัดเส้นทาง การสรุปแบบจำนวนมาก และลูปภายในของเอเจนต์ โดยมีหน้าต่างบริบท 1,050,000 โทเคน และเพดานเอาต์พุต 128,000 โทเคน รับข้อความ รูปภาพ และไฟล์เป็นอินพุต และคงบันไดระดับความพยายามหกขั้นเต็มรูปแบบ รวมถึง ไม่มี ซึ่งระดับ 6.1 ตัดออกไป ตารางราคาคือเหตุผลที่มันมีอยู่: $0.10 ขาเข้าและ $0.50 ขาออกต่อล้านโทเคน อินพุตแคชที่ $0.01 และการเขียนแคชที่ $0.125 โดยมีขั้นบริบทยาวเมื่ออินพุตเกิน 272,000 โทเคน เป็น $0.20, $0.75 และ $0.02 สำหรับแคช

GPT-6.1 Sol เป็นการรีเฟรชระดับกลางที่เปิดตัวในอีกหนึ่งสัปดาห์ต่อมา หน้าต่างเดียวกัน เพดานเอาต์พุตเดียวกัน รูปแบบอินพุตเดียวกัน วันตัดความรู้ 30 เมษายน 2026 เทียบกับของ Luna และบันไดความพยายามที่เริ่มต้นที่ ต่ำ เนื่องจาก ไม่มี และ น้อยที่สุด ถูกปฏิเสธโดยสิ้นเชิง ราคาของมันอยู่ที่ $2.00 และ $10.00 โดยมีอินพุตแบบแคชที่ $0.10 — เป็นยี่สิบเท่าของอัตราอินพุตของ Luna และยี่สิบเท่าของอัตราเอาต์พุตของ Luna โดยมีบรรทัดแคชที่แพงกว่าสิบเท่าต่อการเข้าถึง

ทั้งคู่เปิดให้ใช้งานแล้ว ทั้งคู่มีอยู่ใน ChatGPT Work และ Codex รวมถึง API และทั้งคู่สามารถเรียกใช้ได้ผ่านคีย์เดียวกันในฝั่งของเรา ไม่มีอะไรเกี่ยวกับการจับคู่นี้ที่ต้องเลือกเลย

สิ่งที่จุดดัชนี 13 จุดซื้อได้จริง

คะแนนรวมเป็นตัวเลขที่ให้ข้อมูลน้อยที่สุดในการเปรียบเทียบ เพราะมันเฉลี่ยข้ามงานที่มีพฤติกรรมแตกต่างกันมาก เมื่อให้คะแนนทีละการประเมินที่ความพยายามในการใช้เหตุผลสูงสุดบน Artificial Analysis v4.3.2 ลักษณะที่ได้คือการแยกออกจากกัน มากกว่าที่จะเป็นแนวโน้มแบบลาดชัน:

• AA-LCR v1.1 การให้เหตุผลแบบบริบทยาว — GPT-6 Luna 0.833 เทียบกับ GPT-6.1 Sol 0.830 โดย Luna นำอยู่เล็กน้อย

• SciCode — GPT-6 Luna 0.546 กับ GPT-6.1 Sol 0.542 อีกครั้งที่เรียกได้ว่าอยู่ในระดับเดียวกัน และอีกครั้งที่โมเดลที่ถูกกว่านำอยู่เพียงในนาม

• Terminal-Bench 4.0 — GPT-6 Luna 0.126 เทียบกับ GPT-6.1 Sol 0.561 ห่างกัน 43 คะแนน; สองโมเดลนี้อยู่คนละลีกกันในงานเทอร์มินัล

• Humanity's Last Exam — GPT-6 Luna 0.385 เทียบกับ GPT-6.1 Sol 0.529

• AutomationBench-AA — GPT-6 Luna 0.532 เทียบกับ GPT-6.1 Sol 0.649

• GDPval-AA v2.1 — GPT-6 Luna Elo 1437.1 เทียบกับ GPT-6.1 Sol Elo 1575.1 ส่วนต่าง Elo 138 คะแนนในงานความรู้ระดับมืออาชีพ

• GDP.pdf — GPT-6 Luna 0.228 เทียบกับ GPT-6.1 Sol 0.310.

• CritPt — GPT-6 Luna 0.194 เทียบกับ GPT-6.1 Sol 0.317

• AA-Omniscience — GPT-6 Luna 0.65 เทียบกับ GPT-6.1 Sol 41.5 บนสเกลที่ค่าศูนย์หมายถึงมีคำตอบที่ถูกต้องเท่ากับคำตอบที่ผิด Luna อยู่ที่ระดับเส้นน้ำ ส่วน Sol อยู่สูงกว่านั้นอย่างมีนัยสำคัญ

MM-Pro — GPT-6 Luna 0.797 เทียบกับ GPT-6.1 Sol 0.860

• ต้นทุนต่องานจัดทำดัชนี โดยไม่ขึ้นกับสิ่งอื่น — GPT-6 Luna $0.068 เทียบกับ GPT-6.1 Sol $0.72; ช่องว่างราวสิบเท่าซึ่งได้เปรียบโมเดลราคาถูก

• จำนวนโทเคนเอาต์พุตในการรันดัชนี — GPT-6 Luna 144 ล้าน เทียบกับ GPT-6.1 Sol 67 ล้าน เมื่อเทียบกับค่ามัธยฐานของคลาสที่ 100 ล้านสำหรับ Luna และประมาณ 81 ล้านสำหรับ Sol

จากการประเมินสิบครั้ง มีสองครั้งที่เสมอโดยเป็นผลดีต่อโมเดลราคาถูก แปดครั้งเป็นของตัวที่แพง และในหกจากแปดครั้งนั้น ส่วนต่างไม่ใช่แค่เล็กน้อย นั่นคือการตีความสิบสามจุดอย่างตรงไปตรงมา: มันไม่ใช่การไล่ระดับคุณภาพแบบสม่ำเสมอ หากเป็นสองความสามารถ — การดำเนินการแบบเอเจนต์อย่างต่อเนื่องและความน่าเชื่อถือด้านข้อเท็จจริง — ที่ Luna ไม่ได้อยู่ในระดับเดียวกับโมเดลนั้นเลย และเป็นช่วงกลางกว้าง ๆ ที่ความแตกต่างมีจริง แต่เล็กพอที่จะมองไม่เห็นในชุดการประเมินของคุณเอง

ผลลัพธ์ AA-LCR ควรมีข้อแม้หนึ่งข้อ เพราะมันเป็นตัวเลขที่ทำให้ Luna ดูดีที่สุด การให้เหตุผลกับบริบทยาวที่ 0.833 เป็นคะแนนที่แข็งแกร่ง และสองโมเดลห่างกันไม่ถึงครึ่งคะแนน แต่เบนช์มาร์กนี้วัดการค้นคืนและการให้เหตุผลบนอินพุตยาว ไม่ใช่ความสามารถในการลงมือทำตลอดเซสชันยาว ช่องว่างบน Terminal-Bench 4.0 คือสิ่งที่ "ลงมือทำตลอดเซสชันยาว" ดูเหมือนเมื่อถูกให้คะแนน และมันกว้างถึง 43 จุด

A generated hero card for a GPT-6.1 Sol versus GPT-6 Luna comparison, headed 'Thirteen index points, ten times the money', with two badges reading 'GPT-6.1 Sol: 51.8 at $2.00 / $10.00 per 1M' and 'GPT-6 Luna: 38.1 at $0.10 / $0.50 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

การคำนวณต้นทุนต่องาน และจุดที่มันไม่เป็นจริงอีกต่อไป

Artificial Analysis คิดราคาการรันแต่ละดัชนีจากปริมาณโทเคนที่วัดได้จริง ดังนั้นตัวเลขค่าใช้จ่ายจึงไม่ใช่การอนุมานจากอัตราตามราคาที่ประกาศไว้ การรันของ GPT-6 Luna มีค่าใช้จ่าย $0.068 ต่องาน ส่วนของ GPT-6.1 Sol อยู่ที่ $0.72 อัตราส่วนคือ 10.7× ซึ่งแย่กว่าอัตราส่วนราคาตามชื่อที่ 20 เท่าเพียงเล็กน้อย เพราะ Luna สร้างโทเคนเอาต์พุต 144 ล้านโทเคนในการรัน เทียบกับ 67 ล้านของ Sol — โมเดลราคาถูกช่างพูดมากกว่าสองเท่า และสิ่งนี้กัดกร่อนข้อได้เปรียบของตัวเอง ถึงกระนั้น ลำดับก็ไม่ได้สูสีกันเลย และในงานที่คำตอบสั้น ช่องว่างจะกว้างขึ้น: ปริมาณเอาต์พุตที่น้อยลงหมายถึงบทลงโทษจากความช่างพูดของ Luna ลดลง ขณะที่ข้อได้เปรียบด้านราคายังคงเดิม

จุดที่การคำนวณนี้ใช้ไม่ได้ผลคือภาระงานใด ๆ ที่ดัชนีไม่ได้มีลักษณะใกล้เคียงกัน ถ้างานของคุณคือการแก้ไขในระดับรีโพซิทอรีที่ต้องเรียกใช้เครื่องมือยี่สิบครั้งให้สอดประสานกันเป็นชิ้นเดียว โมเดลราคา $0.07 ที่ทำงานล้มเหลวจะทำให้คุณต้องเสียทั้งลูปการลองใหม่ทั้งหมดบวกกับเวลานาฬิกาจริง และโมเดลราคา $0.72 ที่ทำสำเร็จในครั้งเดียวกลับถูกกว่า กรอบการเปิดตัวของ GPT-6.1 Sol เองก็สร้างขึ้นบนแนวคิดนี้ทั้งหมด — ต้นทุนต่องานที่สำเร็จ — และมันคือกรอบที่ถูกต้อง: การเปรียบเทียบที่เกี่ยวข้องไม่ใช่อัตราค่าโทเคน แต่เป็นต้นทุนคาดหวังต่อผลลัพธ์ และสำหรับงานที่ Luna ไม่สามารถทำสำเร็จได้ ต้นทุนคาดหวังนั้นไม่มีขอบเขตจำกัด

รายละเอียดเชิงโครงสร้างสองข้อทำให้เส้นแบ่งนี้คมชัดยิ่งขึ้น ข้อแรก ขั้นบันไดบริบทขนาดยาว: โมเดลทั้งสองปรับราคาใหม่เมื่ออินพุตเกิน 272,000 โทเคน โดย Luna อยู่ที่ $0.20 และ $0.75 ส่วน Sol อยู่ที่ $4.00 และ $15.00 ดังนั้นช่องว่างสัมบูรณ์จึงกว้างขึ้นที่เส้นแบ่งแทนที่จะแคบลง แต่อัตราที่ปรับราคาใหม่ของ Luna ก็ยังต่ำกว่าอัตรามาตรฐานของ Sol ราวหนึ่งอันดับขนาด ข้อที่สอง ซึ่งเป็นสิ่งที่มองข้ามได้ง่าย: บันไดระดับความพยายาม (effort ladder) มีรูปร่างไม่เหมือนกัน Luna ยอมรับ none แต่ Sol ไม่ยอมรับ แคสเคดที่จัดเส้นทางไปที่ Sol ก่อนแล้ว fallback มาที่ Luna เมื่อเกิดข้อผิดพลาดหรือหมดเวลา ต้องไม่ส่งค่า reasoning.effort ของคำขอต่อไปโดยไม่เปลี่ยนแปลง เพราะคอนฟิกที่ถูกต้องบนโมเดลหนึ่งจะคืนข้อผิดพลาดบนอีกโมเดลหนึ่ง นี่เป็นเรื่องของเลเยอร์การจัดเส้นทาง ไม่ใช่เรื่องของคุณภาพโมเดล และเป็นเรื่องแบบที่เอนด์พอยต์เดียวซึ่งมีกฎการจัดเส้นทางควรรับไว้ได้พอดี

การทำทั้งสองอย่างคือประเด็นสำคัญ ไม่ใช่การป้องกันความเสี่ยง

โมเดลทั้งสองอยู่บน OrcaRouter ในราคาตามรายการของ OpenAI เองโดยไม่มีอะไรเพิ่ม: GPT-6 Luna ที่ $0.10 และ $0.50 โดยมีอินพุตแคชที่ $0.01, GPT-6.1 Sol ที่ $2.00 และ $10.00 โดยมีอินพุตแคชที่ $0.10, และขั้น 272,000 โทเค็นในแต่ละตัวถูกส่งผ่านตรงตามที่ผู้ขายระบุไว้ เนื่องจากแพลตฟอร์มส่งผ่านราคาตามรายการของผู้ให้บริการแทนที่จะบวกกำไร อัตราส่วนยี่สิบเท่าในบทความนี้จึงเป็นอัตราส่วนที่คุณจ่ายจริงทั้งสองด้าน

A screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the listing dated 2026-09-22, the model described as the fast, cost-efficient tier of OpenAI's GPT-6 series for high-volume and latency-sensitive workloads, a 1M-token context with 128K maximum output, text, image and file input, and the list price of $0.10 input and $0.50 output per million tokens with a 1.45 s median time to first token.

เหตุผลที่สำคัญโดยเฉพาะในกรณีนี้คือ คู่นี้เป็นแคสเคดที่รอการเขียนขึ้นมา ตัวจำแนกประเภท ตัวจัดเส้นทาง งานสกัดข้อมูลจำนวนมาก และเอเจนต์เขียนโค้ดระดับรีโพ ไม่ควรอยู่บนโมเดลเดียวกัน และช่องว่างราคาก็กว้างพอที่การเลือกผิดในทิศทางใดทิศทางหนึ่งจะมีค่าใช้จ่ายสูง — แพงเกินไปถึงยี่สิบเท่าต่อการเรียกหนึ่งครั้งในทิศทางหนึ่ง งานล้มเหลวในอีกทิศทางหนึ่ง คีย์เดียว สองโมเดล และกฎที่ส่งทราฟฟิกง่ายไปยัง Luna และยกระดับไปยัง Sol เมื่อประเภทงานเปลี่ยน หรือเมื่อเอาต์พุตของ Luna ไม่ผ่านการตรวจสอบ เป็นเพียงการเปลี่ยนแปลงการตั้งค่าฝั่งเรา ไม่ใช่สัญญาผู้ขายรายที่สอง การสลับสำรองอัตโนมัติครอบคลุมกรณีที่หนึ่งในสองมีประสิทธิภาพลดลง ซึ่งสำหรับโมเดลที่เพิ่งเปิดตัวเมื่อแปดวันก่อนยังเป็นความเป็นไปได้ที่ยังมีอยู่

A screenshot of OpenAI's GPT-6 Luna documentation page, showing the model ID gpt-6-luna, the effort ladder supporting none, low, medium, high, xhigh and max, a 1,050,000-token context window with 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and the pricing table listing input at $0.10, cached input at $0.01, cache writes at $0.125 and output at $0.50 per million tokens.

การตัดสินใจในครั้งเดียว

• การจำแนกประเภท การสกัดข้อมูล การกำหนดเส้นทาง การสรุปข้อมูลจำนวนมาก ลูปภายในของเอเจนต์ — GPT-6 Luna และหยุดอ่านตรงนี้ ที่ราคา $0.10/$0.50 ด้วยการอ่านจากแคชราคาหนึ่งเซนต์ สิบสามคะแนนดัชนีความสามารถทั่วไปไม่คุ้มค่ากับบิลที่แพงกว่าสิบเท่าในงานที่คำตอบสั้นและตรวจสอบได้

• การเขียนโค้ดระดับทั้งรีโป, เอเจนต์ในเทอร์มินัล, การรันหลายขั้นตอน — GPT-6.1 Sol ช่องว่าง 43 คะแนนใน Terminal-Bench 4.0 คือข้อโต้แย้งทั้งหมด นี่คือความสามารถที่ราคานี้กำลังจ่ายเพื่อซื้อ

• คำถามในงานองค์ความรู้ที่คำตอบผิดมีต้นทุนสูง — GPT-6.1 Sol เกี่ยวกับช่องว่างของ AA-Omniscience และ GDPval-AA คะแนนความน่าเชื่อถือเชิงข้อเท็จจริงของ Luna อยู่ที่ระดับน้ำ

• อินพุตยาวพร้อมคำตอบที่สร้างขึ้นแบบสั้น — GPT-6 Luna มันให้เหตุผลกับบริบทยาวได้ทัดเทียมกับโมเดลที่มีราคาแพงกว่ายี่สิบเท่า และบทลงโทษความละเอียดสูง 144 ล้านโทเคนของมันก็ไม่มีโอกาสได้ใช้เลย

• อะไรก็ตามที่ตั้งค่าเป็นnoneอยู่แล้ว — ใช้ Luna ต่อไป หรือเผื่องบไว้สำหรับการเปลี่ยนแปลง ขั้นนั้นไม่มีอยู่ใน GPT-6.1 Sol

• พื้นผิวที่ไวต่อความหน่วง — GPT-6 Luna จากผลการวัดของบอร์ดเอง: 129.4 โทเค็นเอาต์พุตต่อวินาที และ 100 วินาทีถึงชังก์แรก เทียบกับ 59.7 และ 332 ของ Sol

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube