
GPT-6.1 Sol กับ GPT-6 Astra: ดัชนีต่างกันหนึ่งจุด แต่เรตการ์ดห้าเท่า
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 397 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
GPT-6.1 Sol และ GPT-6 Astra เป็นรุ่นระดับกลางและรุ่นเรือธงของตระกูลเดียวกัน เปิดตัวห่างกันสี่สัปดาห์ — Sol เปิดตัววันที่ 29 กันยายน 2026 ส่วน Astra วันที่ 3 กันยายน 2026 — และจนถึงสัปดาห์นี้ การเปรียบเทียบระหว่างทั้งสองก็อาศัยเพียงตัวเลขของ OpenAI เองเท่านั้น ตอนนี้ไม่เป็นเช่นนั้นอีกต่อไปแล้ว Artificial Analysis ได้ประเมินทั้งสองรุ่นที่ระดับความพยายามในการใช้เหตุผลสูงสุดบนดัชนีเวอร์ชันเดียวกัน และผลลัพธ์คือช่องว่าง 0.84 จุดที่ได้เปรียบเป็นของ Astra ซึ่งอยู่เคียงข้างกับช่องว่างของต้นทุนต่อการรันการประเมินหนึ่งครั้งที่ GPT-6.1 Sol ได้เปรียบถึง 4.5 เท่า บนตารางราคา อัตราส่วนยิ่งชัดเจนกว่านั้นอีก: Astra สูงกว่า GPT-6.1 Sol 5 เท่าสำหรับอินพุตและเอาต์พุต และ 10 เท่าสำหรับอินพุตแบบแคช คำถามที่หน้านี้ตอบก็คือ เงินส่วนเกินนั้นซื้อสิ่งที่คุณชี้ให้เห็นได้จริงตรงไหน และตรงไหนที่มันเป็นเพียงราคาของชื่อเสียง
โมเดลทั้งสองคืออะไร และบอร์ดวัดอะไร
ทั้งสองเป็นแบบรับข้อความและรูปภาพเข้า ส่งข้อความออก มีหน้าต่างบริบทขนาด 1,050,000 โทเค็น และโทเค็นเอาต์พุตสูงสุด 128,000 โทเค็น ทั้งคู่มีระดับความพยายาม 5 ขั้น ได้แก่ low, medium, high, xhigh และ max โดยได้ตัดการตั้งค่าnoneที่ GPT-6 Sol ยังคงรองรับออกไป ทั้งสองไม่รองรับการปรับแต่งละเอียด (fine-tuning) ความแตกต่างที่สำคัญคือสิ่งที่ตารางราคาระบุไว้: Astra เป็นระดับเรือธง GPT-6.1 Sol เป็นการรีเฟรชของระดับที่ต่ำลงมา และประโยคกำหนดจุดยืนของ OpenAI เองสำหรับโมเดลที่ใหม่กว่าคือ "ประสิทธิภาพใกล้เคียง Astra สำหรับงานซับซ้อนในต้นทุนที่ต่ำกว่า"
Artificial Analysis ให้คะแนนข้อกล่าวอ้างนั้นบน Intelligence Index ของตน — การประเมินสิบรายการในเวอร์ชัน v4.3.2 ซึ่งเป็นเวอร์ชันเดียวกันสำหรับทั้งสองโมเดล — และบันทึกวันที่เปิดตัวที่ตนถืออยู่สำหรับแต่ละโมเดล ระบบประเมินทั้งสองโมเดลในการตั้งค่าความพยายามสูงสุดที่หน้าโมเดลระบุไว้ในหัวเรื่อง สิ่งที่ตามมาคือการเปรียบเทียบนั้น พร้อมกับการคำนวณต้นทุนที่ดัชนีไม่ได้คำนวณให้คุณ
• GPT-6.1 Sol — เปิดตัวเมื่อ 2026-09-29, Intelligence Index 51.8 ที่ความพยายามสูงสุด, $2.00 อินพุต / $0.10 แคช / $2.50 เขียนแคช / $10.00 เอาต์พุต ต่อล้านโทเค็น
• GPT-6 Astra — เปิดตัวเมื่อ 2026-09-03, Intelligence Index 52.7 ที่ความพยายามสูงสุด, $10.00 อินพุต / $1.00 แคช / $12.50 เขียนแคช / $50.00 เอาต์พุต ต่อล้านโทเค็น
• ไม่มีรุ่นใดเลย — ไม่รองรับระดับความพยายามในการใช้เหตุผลแบบ none; ทั้งสองรุ่นคิดราคาคำขอใหม่ทั้งรายการที่อัตราอินพุตและแคช 2 เท่า และเอาต์พุต 1.5 เท่า เมื่ออินพุตเกิน 272,000 โทเค็น ระดับบริบทแบบยาวของ Astra คือ $20.00 อินพุต / $2.00 แคช / $75.00 เอาต์พุต; ของ GPT-6.1 Sol คือ $4.00 / $0.20 / $15.00
• ทั้งสองรุ่น — รองรับการค้นหาเว็บ การค้นหาไฟล์ การสร้างภาพ ตัวแปลโค้ด เชลล์แบบโฮสต์ apply patch สกิล computer use MCP และ tool search ผ่าน Responses API
0.84 จุดดัชนี, 4.5 เท่าของบิลการประเมิน

ตัวเลขสองตัววางเคียงข้างกันบนบอร์ด และเมื่อรวมกันแล้วพวกมันคือข้อโต้แย้งทั้งหมด GPT-6 Astra ที่ความพยายามสูงสุดได้คะแนน 52.7 GPT-6.1 Sol ที่ความพยายามสูงสุดได้คะแนน 51.8 ข้าง ๆ คะแนนแต่ละตัว บอร์ดเผยแพร่ค่าใช้จ่ายในการรันดัชนีที่อยู่เบื้องหลัง: $3.26 ต่องานสำหรับ Astra, $0.72 สำหรับ GPT-6.1 Sol เมื่ออ่านเป็นประโยคเดียว — 0.84 คะแนนแลกมาด้วยเงิน 4.5 เท่า — มันเป็นตัวเลขที่เกี่ยวข้องกับการตัดสินใจมากที่สุดที่บริษัทใดในสองแห่งนี้เคยเผยแพร่เกี่ยวกับโมเดลสองตัวนี้
ทั้งสองโมเดลยังเผยแพร่คะแนนสำหรับแต่ละจุดบนบันไดความพยายาม ซึ่งช่วยให้สามารถเปรียบเทียบได้ที่การใช้จ่ายเท่ากันแทนที่จะเป็นที่การตั้งค่าเท่ากัน:
• ความพยายามสูงสุด — GPT-6.1 Sol 51.8 ที่ $0.72 ต่อการรัน เทียบกับ GPT-6 Astra 52.7 ที่ $3.26
• สูงมาก — 51.0 ที่ $0.39 เทียบกับ 52.4 ที่ $2.31
• สูง — 50.2 ที่ $0.32 เทียบกับ 50.9 ที่ $1.73
• ปานกลาง — 47.8 ที่ $0.21 เทียบกับ 49.6 ที่ $1.54
• ต่ำ — 42.1 ที่ $0.13 เทียบกับ 45.8 ที่ $0.82

เมื่อเรียงระดับต่าง ๆ ของโมเดลเข้าด้วยกัน จะพบข้อเท็จจริงหนึ่งที่ทั้งสองผู้ขายไม่ได้โฆษณา: ช่วงห่างจาก high ถึง max ของ Astra เองอยู่ที่ 1.8 คะแนนดัชนี ซึ่งมากกว่าช่องว่างทั้งหมดระหว่าง Astra ที่ max กับ GPT-6.1 Sol ที่ max ถึงสองเท่า กล่าวอีกนัยหนึ่ง การเลือก Astra แทน GPT-6.1 Sol ให้คะแนนที่ได้น้อยกว่าการเลือก max effort ของ Astra แทน high effort ของ Astra — และตัวเลือกอย่างหลังมีค่าใช้จ่ายเพียงเศษเสี้ยวของตัวเลือกแรก ใครก็ตามที่ปริมาณงานของตนไวต่อ 1.8 คะแนนนั้นอย่างแท้จริง ควรตรวจสอบการตั้งค่า effort ก่อนที่จะตรวจสอบคอลัมน์โมเดล
ที่ที่ความพรีเมียมของ Astra ยังคงให้อะไรบางอย่างได้
คะแนนรวมนั้นใกล้เคียงกัน แต่ผลการประเมินรายบุคคลไม่ใช่เช่นนั้น เมื่อให้คะแนนทีละรายการด้วยความพยายามเต็มที่ GPT-6 Astra ได้เปรียบในหกจากสิบรายการ และรายการที่ได้เปรียบนั้นล้วนเป็นรายการที่เกี่ยวข้องกับการลงมือทำมากกว่าการตอบคำถาม
• AutomationBench-AA ซึ่งเป็นเวิร์กโฟลว์หลายขั้นตอนข้ามเครื่องมือ — 0.685 สำหรับ Astra เทียบกับ 0.649 สำหรับ GPT-6.1 Sol Astra นำ 3.6 คะแนน
• Terminal-Bench 4.0 ซึ่งเป็นงานเทอร์มินัลในสภาพแวดล้อมจริง — 0.591 เทียบกับ 0.561 Astra นำ 3.0 คะแนน
• SciCode — 0.565 เทียบกับ 0.542 Astra นำ 2.3 คะแนน
• Humanity's Last Exam — 0.547 เทียบกับ 0.529 Astra นำ 1.8 คะแนน
• AA-Omniscience — 43.4 เทียบกับ 41.5 และบนชุดเดียวกัน อัตราการหลอนของ Astra อยู่ที่ 0.513 เทียบกับ 0.543 ของ GPT-6.1 Sol Astra ทั้งแม่นยำกว่าและพร้อมกว่าที่จะบอกว่าไม่รู้
• AA-Briefcase v1.1 ซึ่งเป็นผลงานส่งมอบระดับมืออาชีพ — Elo 1568.9 เทียบกับ 1564.2 Astra นำ 4.7
รูปแบบนี้สม่ำเสมอพอที่จะใช้ในการวางแผนได้: เมื่อโจทย์ต้องการให้โมเดลลำดับการกระทำที่ยาวต่อเนื่องได้อย่างถูกต้อง — ควบคุมเทอร์มินัล รันเวิร์กโฟลว์ที่ใช้หลายเครื่องมือ และสร้างผลงานส่งมอบในรูปแบบเอกสาร — ความได้เปรียบของ Astra นั้นเป็นของจริงและทำซ้ำได้ในฮาร์เนสต่างๆ เมื่อโจทย์เป็นคำถามความรู้ที่ตอบในเทิร์นเดียว ความได้เปรียบนั้นก็หายไปเกือบหมด
ในจุดที่โมเดลที่ถูกกว่าชนะ รวมถึงแคชไลน์
GPT-6.1 Sol ไม่ใช่ Astra ที่ด้อยกว่าเล็กน้อยในทุกด้าน บนการประเมินที่ให้รางวัลกับการอ่านและการให้เหตุผลกับเนื้อหายาว ๆ มันนำอยู่ และบนตารางราคา มันนำด้วยส่วนต่างที่ดัชนีนั้นมองไม่เห็นเลย
• GDPval-AA งานระดับมืออาชีพที่ให้คะแนนเทียบกับผลงานของผู้เชี่ยวชาญ — Elo 1575.1 สำหรับ GPT-6.1 Sol เทียบกับ 1541.9 ของ Astra นำอยู่ 33 คะแนนสำหรับโมเดลที่มีค่าใช้จ่ายเพียงหนึ่งในห้า และเป็นชัยชนะจากแหล่งอิสระที่มากที่สุดเพียงหนึ่งเดียวในแถวนี้
• AA-LCR v1.1 การให้เหตุผลกับบริบท longue — 0.830 เทียบกับ 0.807 GPT-6.1 Sol นำอยู่
• GDP.pdf — เสมอกันที่ 0.310 เช่นเดียวกับ CritPt ที่ 0.317
• อินพุตแบบแคช — $0.10 ต่อล้านโทเค็น เทียบกับ $1.00 ของ Astra นี่คือแถวที่ตัดสินเศรษฐศาสตร์ของเอเจนต์ และมันไม่ได้ปรากฏอยู่ในดัชนีเลย
• ความเร็วเอาต์พุต — 66.8 โทเค็นต่อวินาที เทียบกับ 56.95 ในการรันประเมินเดียวกัน โดยใช้โทเค็นเอาต์พุต 67.2 ล้านโทเค็น เทียบกับ 60.0 ล้านของ Astra ทั้งสองโมเดลไม่ถือว่าเร็ว GPT-6.1 Sol เร็วกว่าในสองตัวนี้
หนึ่งเดือนของเอเจนต์ โดยคิดราคาตามเรตการ์ดทั้งสอง
ลองพิจารณาภาระงานที่ส่งคำนำหน้าที่เสถียรซ้ำ: โทเค็นอินพุต 40 ล้านโทเค็นต่อเดือน โดย 85% ของโทเค็นเหล่านั้นให้บริการจากแคช บวกกับโทเค็นเอาต์พุต 4 ล้านโทเค็น บนเรตการ์ดของ GPT-6.1 Sol นั่นคิดเป็น $3.40 สำหรับการอ่านจากแคช, $12.00 สำหรับอินพุตที่ไม่ได้แคช และ $40.00 สำหรับเอาต์พุต — $55.40 สำหรับเดือนนั้น บนเรตการ์ดของ GPT-6 Astra ทราฟฟิกเดียวกันคิดเป็น $34.00 สำหรับการอ่านจากแคช, $60.00 สำหรับอินพุตที่ไม่ได้แคช และ $200.00 สำหรับเอาต์พุต — $294.00 ภาระงานเหมือนกันทุกประการ แต่บิลกลับสูงกว่า 5.3 เท่า
มีเกณฑ์สองข้อที่ทำให้การคำนวณนั้นเปลี่ยนไป และทั้งสองข้อควรถูกประเมินต้นทุนก่อนการตัดสินใจย้ายระบบ ไม่ใช่หลังจากนั้น เกณฑ์แรกคือ 272,000 โทเค็นอินพุตในคำขอเดียว หากข้ามเกินไป คำขอทั้งหมดจะถูกคิดราคาใหม่ที่อัตราอินพุตและแคชเป็นสองเท่า และอัตราเอาต์พุต 1.5 เท่า ซึ่งทำให้ GPT-6.1 Sol เปลี่ยนเป็น $4.00 / $0.20 / $15.00 และ Astra เป็น $20.00 / $2.00 / $75.00 เกณฑ์ที่สองคือตัวบันไดระดับ effort เอง การลด GPT-6.1 Sol จาก max ลงมาเป็น xhigh ตัดต้นทุนการรันดัชนีจาก $0.72 เหลือ $0.39 โดยแลกกับคะแนน 0.8 จุด และการลด Astra จาก max ลงมาเป็น high ตัดจาก $3.26 เหลือ $1 โดยแลกกับคะแนน 1.8 จุด ในลูปเอเจนต์ที่ใช้แคชหนัก การตั้งค่าระดับ effort เป็นคันโยกด้านต้นทุนที่ใหญ่กว่าคอลัมน์โมเดล ซึ่งตรงกันข้ามกับวิธีที่สองโมเดลนี้มักถูกนำมาเปรียบเทียบกัน
จะรันตัวไหน และสิ่งที่คุณเรียกได้จริง
จากหลักฐานที่มี การแบ่งแบบนี้ชัดเจนกว่าที่การตลาดสื่อ ส่งงานที่ต้องผ่านห่วงโซ่การดำเนินการยาว ๆ — เซสชันเทอร์มินัล ระบบอัตโนมัติที่ใช้เครื่องมือหนาแน่น เอกสารส่งมอบที่การมีหนึ่งย่อหน้าซึ่งโมเดลหลอนขึ้นมานั้นมีต้นทุนสูง — ไปที่ GPT-6 Astra และลองพิจารณาใช้งานที่ระดับ high แทนที่จะเป็น max เว้นแต่คุณจะวัดได้ว่า 1.8 คะแนนที่เพิ่มขึ้นนั้นเกิดกับงานของคุณจริง ส่งทุกอย่างที่เน้นความรู้ ใช้แคชหนัก หรืออ่านเป็นหลัก ไปที่ GPT-6.1 Sol: มันเก่งกว่าในการประเมินงานระดับมืออาชีพ เก่งกว่าในการให้เหตุผลกับบริบทขนาดยาว เร็วกว่า และถูกกว่า 5 ถึง 10 เท่าในรายการที่ครองบิลจริง

สิ่งที่คุณเรียกใช้ได้ในวันนี้คือส่วนที่พูดกันตรง ๆ OrcaRouter ให้บริการ GPT-6 Astra ในราคาตามที่ OpenAI ประกาศเอง — อัตราอินพุต $10.00 เอาต์พุต $50.00 อ่านแคช $1.00 และเขียนแคช $12.50 โดยส่งต่อกฎปรับราคาที่ 272K ตามที่ผู้ให้บริการเผยแพร่อย่างตรงทุกประการ — พร้อมด้วย GPT-6 Sol และ GPT-6 Luna แต่ไม่ได้ให้บริการ GPT-6.1 Sol: แค็ตตาล็อกสาธารณะ จะคืนค่า "model not found" สำหรับ openai/gpt-6.1-sol และเราจะไม่อธิบายโมเดลที่เราไม่สามารถจัดเส้นทางได้ เพราะราคาตามประกาศของผู้ให้บริการถูกส่งต่อโดยไม่บวกเพิ่ม วันที่โมเดลนั้นพร้อมให้บริการ ฝั่งเราจะคิดในอัตราของ OpenAI โดยไม่ต้องมีขั้นตอนปรับราคา วันนี้ครึ่งที่ใช้งานได้ของการเทียบครั้งนี้คือเรือธง อยู่หลังคีย์ API เดียว โดยมี DSL สำหรับการจัดเส้นทาง ให้ใช้ได้ หากคุณต้องการประกอบโมเดลราคาถูกและโมเดลราคาแพงเข้าเป็นการเรียกครั้งเดียว แทนที่จะต้องเลือกระหว่างสองตัวต่อคำขอ
สิ่งเดียวที่ต้องระวังคือแถวที่การเปรียบเทียบนี้ยังขาดอยู่ ทั้งตัวเลขจากผู้ขายและดัชนีอิสระต่างไม่ได้บอกว่าทราฟฟิกของคุณเองจะทำอย่างไรบนสองขั้นนี้ และวิธีเดียวที่ประหยัดในการหาคำตอบคือรันชุดงานเดียวกันผ่านทั้งสอง โดยให้ failover เป็นฝ่ายครองสิทธิ์ทำงาน นั่นคือการทดลองแบบกดปุ่มเดียวเมื่อทั้งสองครึ่งเรียกใช้ได้ และเป็นการทดลองแค่ครึ่งเดียวจนกว่าจะเรียกใช้ได้ทั้งคู่
