
GPT-6.1 Sol กับ GPT-6 Luna: สิบสามคะแนนดัชนี ราคาสิบเท่า และสองการทดสอบที่มันไม่เป็นจริง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
OpenAI เปิดตัว GPT-6.1 Sol เมื่อวันที่ 29 กันยายน 2026 หนึ่งสัปดาห์หลังจากที่ GPT-6 Luna เปิดตัวเมื่อวันที่ 22 กันยายน ในรอบงานเปิดตัวเดียวกัน ทั้งสองคือสองปลายสุดของเจเนอเรชันเดียวกัน: Luna คือระดับราคาถูก Sol คือระดับกลางที่อยู่เหนือขึ้นไป และ GPT-6 Astra อยู่เหนือทั้งสอง ความต่างของราคาระหว่างสองรุ่นอยู่ที่หนึ่งหลัก — 0.10 และ 0.50 ดอลลาร์ต่อล้านโทเคน เทียบกับ 2.00 และ 10.00 ดอลลาร์ อินพุตแบบแคช 0.01 เทียบกับ 0.10 — และความต่างของขีดความสามารถบนบอร์ดทดสอบอิสระคือ 13.7 คะแนน Intelligence Index, 51.8 เทียบกับ 38.1 ที่ความพยายามในการใช้เหตุผลสูงสุด จ่ายเงินสิบคูณเพื่อสิบสามคะแนนนั้นถือเป็นอัตราแลกเปลี่ยนที่แย่ที่สุดในไลน์อัป OpenAI ปัจจุบัน สิ่งที่ทำให้การเปรียบเทียบนี้คุ้มค่าแก่การเขียนถึงคือคำถามสี่สิบดอลลาร์ที่ตามมา: สิบสามคะแนนไหน?
สองโมเดล และหนึ่งสัปดาห์ที่คั่นระหว่างทั้งสอง
GPT-6 Luna เป็นโมเดลขนาดเล็กในตระกูล GPT-6 — รุ่นที่ OpenAI อธิบายว่าสร้างขึ้นสำหรับงานปริมาณมากที่ไวต่อความหน่วง เช่น การจำแนกประเภท การสกัดข้อมูล การจัดเส้นทาง การสรุปแบบจำนวนมาก และลูปภายในของเอเจนต์ โดยมีหน้าต่างบริบท 1,050,000 โทเคน และเพดานเอาต์พุต 128,000 โทเคน รับข้อความ รูปภาพ และไฟล์เป็นอินพุต และคงบันไดระดับความพยายามหกขั้นเต็มรูปแบบ รวมถึง ไม่มี ซึ่งระดับ 6.1 ตัดออกไป ตารางราคาคือเหตุผลที่มันมีอยู่: $0.10 ขาเข้าและ $0.50 ขาออกต่อล้านโทเคน อินพุตแคชที่ $0.01 และการเขียนแคชที่ $0.125 โดยมีขั้นบริบทยาวเมื่ออินพุตเกิน 272,000 โทเคน เป็น $0.20, $0.75 และ $0.02 สำหรับแคช
GPT-6.1 Sol เป็นการรีเฟรชระดับกลางที่เปิดตัวในอีกหนึ่งสัปดาห์ต่อมา หน้าต่างเดียวกัน เพดานเอาต์พุตเดียวกัน รูปแบบอินพุตเดียวกัน วันตัดความรู้ 30 เมษายน 2026 เทียบกับของ Luna และบันไดความพยายามที่เริ่มต้นที่ ต่ำ เนื่องจาก ไม่มี และ น้อยที่สุด ถูกปฏิเสธโดยสิ้นเชิง ราคาของมันอยู่ที่ $2.00 และ $10.00 โดยมีอินพุตแบบแคชที่ $0.10 — เป็นยี่สิบเท่าของอัตราอินพุตของ Luna และยี่สิบเท่าของอัตราเอาต์พุตของ Luna โดยมีบรรทัดแคชที่แพงกว่าสิบเท่าต่อการเข้าถึง
ทั้งคู่เปิดให้ใช้งานแล้ว ทั้งคู่มีอยู่ใน ChatGPT Work และ Codex รวมถึง API และทั้งคู่สามารถเรียกใช้ได้ผ่านคีย์เดียวกันในฝั่งของเรา ไม่มีอะไรเกี่ยวกับการจับคู่นี้ที่ต้องเลือกเลย
สิ่งที่จุดดัชนี 13 จุดซื้อได้จริง
คะแนนรวมเป็นตัวเลขที่ให้ข้อมูลน้อยที่สุดในการเปรียบเทียบ เพราะมันเฉลี่ยข้ามงานที่มีพฤติกรรมแตกต่างกันมาก เมื่อให้คะแนนทีละการประเมินที่ความพยายามในการใช้เหตุผลสูงสุดบน Artificial Analysis v4.3.2 ลักษณะที่ได้คือการแยกออกจากกัน มากกว่าที่จะเป็นแนวโน้มแบบลาดชัน:
• AA-LCR v1.1 การให้เหตุผลแบบบริบทยาว — GPT-6 Luna 0.833 เทียบกับ GPT-6.1 Sol 0.830 โดย Luna นำอยู่เล็กน้อย
• SciCode — GPT-6 Luna 0.546 กับ GPT-6.1 Sol 0.542 อีกครั้งที่เรียกได้ว่าอยู่ในระดับเดียวกัน และอีกครั้งที่โมเดลที่ถูกกว่านำอยู่เพียงในนาม
• Terminal-Bench 4.0 — GPT-6 Luna 0.126 เทียบกับ GPT-6.1 Sol 0.561 ห่างกัน 43 คะแนน; สองโมเดลนี้อยู่คนละลีกกันในงานเทอร์มินัล
• Humanity's Last Exam — GPT-6 Luna 0.385 เทียบกับ GPT-6.1 Sol 0.529
• AutomationBench-AA — GPT-6 Luna 0.532 เทียบกับ GPT-6.1 Sol 0.649
• GDPval-AA v2.1 — GPT-6 Luna Elo 1437.1 เทียบกับ GPT-6.1 Sol Elo 1575.1 ส่วนต่าง Elo 138 คะแนนในงานความรู้ระดับมืออาชีพ
• GDP.pdf — GPT-6 Luna 0.228 เทียบกับ GPT-6.1 Sol 0.310.
• CritPt — GPT-6 Luna 0.194 เทียบกับ GPT-6.1 Sol 0.317
• AA-Omniscience — GPT-6 Luna 0.65 เทียบกับ GPT-6.1 Sol 41.5 บนสเกลที่ค่าศูนย์หมายถึงมีคำตอบที่ถูกต้องเท่ากับคำตอบที่ผิด Luna อยู่ที่ระดับเส้นน้ำ ส่วน Sol อยู่สูงกว่านั้นอย่างมีนัยสำคัญ
MM-Pro — GPT-6 Luna 0.797 เทียบกับ GPT-6.1 Sol 0.860
• ต้นทุนต่องานจัดทำดัชนี โดยไม่ขึ้นกับสิ่งอื่น — GPT-6 Luna $0.068 เทียบกับ GPT-6.1 Sol $0.72; ช่องว่างราวสิบเท่าซึ่งได้เปรียบโมเดลราคาถูก
• จำนวนโทเคนเอาต์พุตในการรันดัชนี — GPT-6 Luna 144 ล้าน เทียบกับ GPT-6.1 Sol 67 ล้าน เมื่อเทียบกับค่ามัธยฐานของคลาสที่ 100 ล้านสำหรับ Luna และประมาณ 81 ล้านสำหรับ Sol
จากการประเมินสิบครั้ง มีสองครั้งที่เสมอโดยเป็นผลดีต่อโมเดลราคาถูก แปดครั้งเป็นของตัวที่แพง และในหกจากแปดครั้งนั้น ส่วนต่างไม่ใช่แค่เล็กน้อย นั่นคือการตีความสิบสามจุดอย่างตรงไปตรงมา: มันไม่ใช่การไล่ระดับคุณภาพแบบสม่ำเสมอ หากเป็นสองความสามารถ — การดำเนินการแบบเอเจนต์อย่างต่อเนื่องและความน่าเชื่อถือด้านข้อเท็จจริง — ที่ Luna ไม่ได้อยู่ในระดับเดียวกับโมเดลนั้นเลย และเป็นช่วงกลางกว้าง ๆ ที่ความแตกต่างมีจริง แต่เล็กพอที่จะมองไม่เห็นในชุดการประเมินของคุณเอง
ผลลัพธ์ AA-LCR ควรมีข้อแม้หนึ่งข้อ เพราะมันเป็นตัวเลขที่ทำให้ Luna ดูดีที่สุด การให้เหตุผลกับบริบทยาวที่ 0.833 เป็นคะแนนที่แข็งแกร่ง และสองโมเดลห่างกันไม่ถึงครึ่งคะแนน แต่เบนช์มาร์กนี้วัดการค้นคืนและการให้เหตุผลบนอินพุตยาว ไม่ใช่ความสามารถในการลงมือทำตลอดเซสชันยาว ช่องว่างบน Terminal-Bench 4.0 คือสิ่งที่ "ลงมือทำตลอดเซสชันยาว" ดูเหมือนเมื่อถูกให้คะแนน และมันกว้างถึง 43 จุด

การคำนวณต้นทุนต่องาน และจุดที่มันไม่เป็นจริงอีกต่อไป
Artificial Analysis คิดราคาการรันแต่ละดัชนีจากปริมาณโทเคนที่วัดได้จริง ดังนั้นตัวเลขค่าใช้จ่ายจึงไม่ใช่การอนุมานจากอัตราตามราคาที่ประกาศไว้ การรันของ GPT-6 Luna มีค่าใช้จ่าย $0.068 ต่องาน ส่วนของ GPT-6.1 Sol อยู่ที่ $0.72 อัตราส่วนคือ 10.7× ซึ่งแย่กว่าอัตราส่วนราคาตามชื่อที่ 20 เท่าเพียงเล็กน้อย เพราะ Luna สร้างโทเคนเอาต์พุต 144 ล้านโทเคนในการรัน เทียบกับ 67 ล้านของ Sol — โมเดลราคาถูกช่างพูดมากกว่าสองเท่า และสิ่งนี้กัดกร่อนข้อได้เปรียบของตัวเอง ถึงกระนั้น ลำดับก็ไม่ได้สูสีกันเลย และในงานที่คำตอบสั้น ช่องว่างจะกว้างขึ้น: ปริมาณเอาต์พุตที่น้อยลงหมายถึงบทลงโทษจากความช่างพูดของ Luna ลดลง ขณะที่ข้อได้เปรียบด้านราคายังคงเดิม
จุดที่การคำนวณนี้ใช้ไม่ได้ผลคือภาระงานใด ๆ ที่ดัชนีไม่ได้มีลักษณะใกล้เคียงกัน ถ้างานของคุณคือการแก้ไขในระดับรีโพซิทอรีที่ต้องเรียกใช้เครื่องมือยี่สิบครั้งให้สอดประสานกันเป็นชิ้นเดียว โมเดลราคา $0.07 ที่ทำงานล้มเหลวจะทำให้คุณต้องเสียทั้งลูปการลองใหม่ทั้งหมดบวกกับเวลานาฬิกาจริง และโมเดลราคา $0.72 ที่ทำสำเร็จในครั้งเดียวกลับถูกกว่า กรอบการเปิดตัวของ GPT-6.1 Sol เองก็สร้างขึ้นบนแนวคิดนี้ทั้งหมด — ต้นทุนต่องานที่สำเร็จ — และมันคือกรอบที่ถูกต้อง: การเปรียบเทียบที่เกี่ยวข้องไม่ใช่อัตราค่าโทเคน แต่เป็นต้นทุนคาดหวังต่อผลลัพธ์ และสำหรับงานที่ Luna ไม่สามารถทำสำเร็จได้ ต้นทุนคาดหวังนั้นไม่มีขอบเขตจำกัด
รายละเอียดเชิงโครงสร้างสองข้อทำให้เส้นแบ่งนี้คมชัดยิ่งขึ้น ข้อแรก ขั้นบันไดบริบทขนาดยาว: โมเดลทั้งสองปรับราคาใหม่เมื่ออินพุตเกิน 272,000 โทเคน โดย Luna อยู่ที่ $0.20 และ $0.75 ส่วน Sol อยู่ที่ $4.00 และ $15.00 ดังนั้นช่องว่างสัมบูรณ์จึงกว้างขึ้นที่เส้นแบ่งแทนที่จะแคบลง แต่อัตราที่ปรับราคาใหม่ของ Luna ก็ยังต่ำกว่าอัตรามาตรฐานของ Sol ราวหนึ่งอันดับขนาด ข้อที่สอง ซึ่งเป็นสิ่งที่มองข้ามได้ง่าย: บันไดระดับความพยายาม (effort ladder) มีรูปร่างไม่เหมือนกัน Luna ยอมรับ none แต่ Sol ไม่ยอมรับ แคสเคดที่จัดเส้นทางไปที่ Sol ก่อนแล้ว fallback มาที่ Luna เมื่อเกิดข้อผิดพลาดหรือหมดเวลา ต้องไม่ส่งค่า reasoning.effort ของคำขอต่อไปโดยไม่เปลี่ยนแปลง เพราะคอนฟิกที่ถูกต้องบนโมเดลหนึ่งจะคืนข้อผิดพลาดบนอีกโมเดลหนึ่ง นี่เป็นเรื่องของเลเยอร์การจัดเส้นทาง ไม่ใช่เรื่องของคุณภาพโมเดล และเป็นเรื่องแบบที่เอนด์พอยต์เดียวซึ่งมีกฎการจัดเส้นทางควรรับไว้ได้พอดี
การทำทั้งสองอย่างคือประเด็นสำคัญ ไม่ใช่การป้องกันความเสี่ยง
โมเดลทั้งสองอยู่บน OrcaRouter ในราคาตามรายการของ OpenAI เองโดยไม่มีอะไรเพิ่ม: GPT-6 Luna ที่ $0.10 และ $0.50 โดยมีอินพุตแคชที่ $0.01, GPT-6.1 Sol ที่ $2.00 และ $10.00 โดยมีอินพุตแคชที่ $0.10, และขั้น 272,000 โทเค็นในแต่ละตัวถูกส่งผ่านตรงตามที่ผู้ขายระบุไว้ เนื่องจากแพลตฟอร์มส่งผ่านราคาตามรายการของผู้ให้บริการแทนที่จะบวกกำไร อัตราส่วนยี่สิบเท่าในบทความนี้จึงเป็นอัตราส่วนที่คุณจ่ายจริงทั้งสองด้าน

เหตุผลที่สำคัญโดยเฉพาะในกรณีนี้คือ คู่นี้เป็นแคสเคดที่รอการเขียนขึ้นมา ตัวจำแนกประเภท ตัวจัดเส้นทาง งานสกัดข้อมูลจำนวนมาก และเอเจนต์เขียนโค้ดระดับรีโพ ไม่ควรอยู่บนโมเดลเดียวกัน และช่องว่างราคาก็กว้างพอที่การเลือกผิดในทิศทางใดทิศทางหนึ่งจะมีค่าใช้จ่ายสูง — แพงเกินไปถึงยี่สิบเท่าต่อการเรียกหนึ่งครั้งในทิศทางหนึ่ง งานล้มเหลวในอีกทิศทางหนึ่ง คีย์เดียว สองโมเดล และกฎที่ส่งทราฟฟิกง่ายไปยัง Luna และยกระดับไปยัง Sol เมื่อประเภทงานเปลี่ยน หรือเมื่อเอาต์พุตของ Luna ไม่ผ่านการตรวจสอบ เป็นเพียงการเปลี่ยนแปลงการตั้งค่าฝั่งเรา ไม่ใช่สัญญาผู้ขายรายที่สอง การสลับสำรองอัตโนมัติครอบคลุมกรณีที่หนึ่งในสองมีประสิทธิภาพลดลง ซึ่งสำหรับโมเดลที่เพิ่งเปิดตัวเมื่อแปดวันก่อนยังเป็นความเป็นไปได้ที่ยังมีอยู่

การตัดสินใจในครั้งเดียว
• การจำแนกประเภท การสกัดข้อมูล การกำหนดเส้นทาง การสรุปข้อมูลจำนวนมาก ลูปภายในของเอเจนต์ — GPT-6 Luna และหยุดอ่านตรงนี้ ที่ราคา $0.10/$0.50 ด้วยการอ่านจากแคชราคาหนึ่งเซนต์ สิบสามคะแนนดัชนีความสามารถทั่วไปไม่คุ้มค่ากับบิลที่แพงกว่าสิบเท่าในงานที่คำตอบสั้นและตรวจสอบได้
• การเขียนโค้ดระดับทั้งรีโป, เอเจนต์ในเทอร์มินัล, การรันหลายขั้นตอน — GPT-6.1 Sol ช่องว่าง 43 คะแนนใน Terminal-Bench 4.0 คือข้อโต้แย้งทั้งหมด นี่คือความสามารถที่ราคานี้กำลังจ่ายเพื่อซื้อ
• คำถามในงานองค์ความรู้ที่คำตอบผิดมีต้นทุนสูง — GPT-6.1 Sol เกี่ยวกับช่องว่างของ AA-Omniscience และ GDPval-AA คะแนนความน่าเชื่อถือเชิงข้อเท็จจริงของ Luna อยู่ที่ระดับน้ำ
• อินพุตยาวพร้อมคำตอบที่สร้างขึ้นแบบสั้น — GPT-6 Luna มันให้เหตุผลกับบริบทยาวได้ทัดเทียมกับโมเดลที่มีราคาแพงกว่ายี่สิบเท่า และบทลงโทษความละเอียดสูง 144 ล้านโทเคนของมันก็ไม่มีโอกาสได้ใช้เลย
• อะไรก็ตามที่ตั้งค่าเป็นnoneอยู่แล้ว — ใช้ Luna ต่อไป หรือเผื่องบไว้สำหรับการเปลี่ยนแปลง ขั้นนั้นไม่มีอยู่ใน GPT-6.1 Sol
• พื้นผิวที่ไวต่อความหน่วง — GPT-6 Luna จากผลการวัดของบอร์ดเอง: 129.4 โทเค็นเอาต์พุตต่อวินาที และ 100 วินาทีถึงชังก์แรก เทียบกับ 59.7 และ 332 ของ Sol
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
