
คะแนนอิสระครั้งแรกของ GPT-6.1 Sol ออกแล้ว: ตามหลัง Astra 0.84 คะแนน ด้วยต้นทุนงานไม่ถึงหนึ่งในสี่
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 397 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
ทุกบทความเกี่ยวกับ GPT-6.1 Sol ที่ตีพิมพ์ในช่วงวันหลังจากงาน DevDay วันที่ 29 กันยายน 2026 ของ OpenAI — รวมถึงบล็อกนี้ด้วย — ต่างก็มีข้อแม้เดียวกัน: ตัวเลขความสามารถเป็นของผู้ขาย และยังไม่มีบุคคลที่สามให้คะแนนโมเดลนี้ ข้อแม้นั้นล้าสมัยไปแล้ว Artificial Analysis มีแถว GPT-6.1 Sol ใน Intelligence Index ของตน ซึ่งรันที่ความพยายามในการใช้เหตุผลสูงสุด และเป็นตัวเลขแรกในชีวิตอันสั้นของโมเดลนี้ที่ OpenAI ไม่ได้ผลิต ค่าที่อ่านได้คือ 51.8 เทียบกับ 52.7 สำหรับ GPT-6 Astra และ 47.5 สำหรับ GPT-6 Sol — ช่องว่างน้อยกว่าหนึ่งจุดถึงเรือธงราคา $10/$50 และเป็นการเพิ่มขึ้น 4.3 จุดจากโมเดลที่ GPT-6.1 Sol เข้าแทนที่ ตัวเลขที่ทำให้แถวนั้นน่าสนใจคือตัวเลขที่อยู่ข้างๆ: คณะกรรมการกำหนดราคาการรันประเมินผลเบื้องหลังแต่ละคะแนน และการรันดัชนีของ GPT-6.1 Sol มีค่าใช้จ่าย $0.72 ต่องาน ในขณะที่ของ Astra มีค่าใช้จ่าย $3.26 เงินสี่เท่าครึ่งสำหรับ 0.84 คะแนนคือการเปรียบเทียบทั้งหมดในบรรทัดเดียว และตอนนี้มันเป็นบรรทัดที่วัดได้จริง ไม่ใช่การนำเสนอของผู้ขาย
ตัวแถวเอง และสิ่งที่มันถูกรันบน

Artificial Analysis เผยแพร่ Intelligence Index ของตนในรูปแบบคะแนนรวมจากการประเมิน 10 รายการ และเวอร์ชันที่ใช้งานเมื่อวันที่ 30 กันยายน 2026 คือ v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience และ AA-LCR v1.1 โมเดล OpenAI ทั้งสามรุ่นในบทความนี้ใช้เวอร์ชันเดียวกัน ดังนั้นการเปรียบเทียบด้านล่างจึงเป็นการเทียบแบบเดียวกันในลักษณะที่ตารางเปิดตัวของผู้ขายเองไม่เคยทำได้ บอร์ดยังบันทึกวันที่เปิดตัวที่ตนมีสำหรับโมเดลนี้ — 2026-09-29 ซึ่งเป็นวัน DevDay — และประเมินโมเดลในการกำหนดค่า max-effort ซึ่งเป็นค่าที่หน้าดังกล่าวระบุในหัวข้อของตัวเอง
• Intelligence Index — 51.8 for GPT-6.1 Sol (max), 52.7 for GPT-6 Astra (max), 47.5 for GPT-6 Sol (max).
• Cost per index task — $0.72 for GPT-6.1 Sol, $3.26 for Astra, $1.05 for GPT-6 Sol. This is the board's own figure for what one full index evaluation cost to run, not a rate card.
• Output tokens spent on the run — 67.2 million for GPT-6.1 Sol, 60.0 million for Astra, 76.8 million for GPT-6 Sol. AA's own commentary calls 67 million "fairly concise" against a board median of 82 million, which is a second, quieter win over the model it replaces.
• Output speed — 66.8 tokens per second for GPT-6.1 Sol, 57.0 for Astra, 76.2 for GPT-6 Sol.
• Prices as the board lists them — $2.00 input and $10.00 output per million tokens for GPT-6.1 Sol, with cached input at $0.10 and cache writes at $2.50. Those four numbers match the vendor's pricing page exactly, which is the least dramatic and most useful thing about the row: an independent list of the rates we already quoted.
หมายเหตุเชิงกรอบหนึ่งข้อก่อนที่ตัวเลขจะถูกใช้เป็นกระสุน ดัชนีของ AA คือการประเมินสิบรายการ และการประเมินที่ OpenAI ยกมาเป็นประเด็นนำในประกาศของตัวเอง — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — ไม่ได้อยู่ในสิบรายการนั้น AA ใช้ AutomationBench ชนิดดัดแปลงของตัวเอง ซึ่งไม่ใช่ฮาร์เนสชุดเดียวกับเวอร์ชัน AutomationBench ที่ผู้ขายอ้างถึง ดังนั้นบันทึกอิสระจึงไม่ได้ยืนยันหรือหักล้างข้ออ้างสำคัญสี่ข้อจากโพสต์เปิดตัว มันวัดชุดงานที่แตกต่างออกไปอย่างมาก และควรอ่านเป็นความเห็นที่สองเกี่ยวกับลักษณะของโมเดล มากกว่าจะเป็นคำตัดสินต่อประโยคเฉพาะเหล่านั้น
Astra ยังคงชนะ โดยห่างกันไม่ถึงหนึ่งคะแนน ด้วยงบประมาณที่มากกว่า 4.5 เท่า

ทั้งสองโมเดลเปิดเผยบันไดระดับความพยายาม และบอร์ดได้เผยแพร่คะแนนและค่าใช้จ่ายในการรันสำหรับทุกขั้นของทั้งสองแล้ว เมื่อนำมาเรียงเทียบกัน บันไดเหล่านี้บอกสิ่งที่การเปรียบเทียบแบบพาดหัวเดียวบอกไม่ได้: การตั้งค่าที่ดีที่สุดของ GPT-6.1 Sol ไม่ได้กำลังแข่งกับตัวที่ดีที่สุดของ Astra แต่กำลังแข่งกับตัวที่ดีเป็นอันดับสองของ Astra
• GPT-6.1 Sol, สูงสุด — 51.8, $0.72 ต่องานดัชนี. GPT-6 Astra, สูงสุด — 52.7, $3.26.
• GPT-6.1 Sol, สูงมาก — 51.0, $0.39. GPT-6 Astra, สูงมาก — 52.4, $2.31.
• GPT-6.1 Sol, สูง — 50.2, $0.32. GPT-6 Astra, สูง — 50.9, $1.73.
• GPT-6.1 Sol, ปานกลาง — 47.8, $0.21. GPT-6 Astra, ปานกลาง — 49.6, $1.54.
• GPT-6.1 Sol, ต่ำ — 42.1, $0.13. GPT-6 Astra, ต่ำ — 45.8, $0.82.
Astra เป็นผู้นำในทุกขั้น ซึ่งเป็นบทสรุปที่ตรงไปตรงมาของการแข่งขันครั้งนี้ และยังเป็นส่วนที่น่าสนใจน้อยที่สุดของมันด้วย ส่วนที่น่าสนใจคืออัตราแลกเปลี่ยน ถ้าคุณต้องการการกำหนดค่า Astra ที่ถูกที่สุดซึ่งเอาชนะค่าที่ดีที่สุดของ GPT-6.1 Sol ได้ นั่นคือ Astra ที่ xhigh: 52.4 เทียบกับ 51.8 ในราคา $2.31 เทียบกับ $0.72 นั่นคือ 0.56 ของจุดดัชนี โดยจ่ายเพิ่ม $1.59 ต่อการรันประเมินหนึ่งครั้ง — คิดเป็นต้นทุนราว 3.2 เท่า เพื่อคะแนนที่เพิ่มขึ้นไม่ถึงหนึ่งเปอร์เซ็นต์ กลับกัน ถ้าลด GPT-6.1 Sol ลงมาเป็น xhigh คุณจะเสียคะแนน 0.8 จุด ขณะที่ค่าใช้จ่ายลดลงเหลือ $0.39 ซึ่งถูกกว่าการใช้ Astra ที่ xhigh ถึง 5.9 เท่า และเป็นหนึ่งในเก้าของการรันที่ใช้ความพยายามสูงสุดของ Astra
มีการตีความบันไดเดียวกันอีกรอบหนึ่งที่โต้แย้งการซื้อ Astra ที่ระดับ max effort สี่ขั้นที่ต่ำกว่าของ Astra ล้วนถูกกว่าระดับ max ของมัน และ xhigh ของมันต่ำกว่า max อยู่ 0.29 คะแนน — คิดเป็นคะแนนเพียงกว่าครึ่งเปอร์เซ็นต์เล็กน้อย เพื่อแลกกับการลดต้นทุนการรันลง 29% การสนทนาเรื่องการจัดซื้อใด ๆ เกี่ยวกับคู่นี้ที่เริ่มจาก "Astra ที่ max" และจบที่ "Astra แพงกว่า 4.5 เท่า" กำลังตัดขั้นที่ถูกกว่าของ Astra เองออกจากการเปรียบเทียบ
ผลการประเมินหกครั้งตกเป็นของ Astra สองครั้งตกเป็นของ GPT-6.1 Sol และอีกสองครั้งเสมอกัน
คะแนนรวมซ่อนความแตกต่างไว้ เมื่อให้คะแนนทีละการประเมินด้วยความพยายามสูงสุด GPT-6.1 Sol ไม่ใช่ Astra ที่ด้อยกว่าเล็กน้อยอย่างสม่ำเสมอ — มันทำได้ดีกว่าในสองเรื่อง และแย่กว่าในหกเรื่อง
• GDPval-AA — Elo 1575.1 สำหรับ GPT-6.1 Sol เทียบกับ 1541.9 สำหรับ Astra เป็นความได้เปรียบ 33 คะแนนในงานระดับวิชาชีพ นี่คือชัยชนะเดี่ยวที่เป็นอิสระครั้งใหญ่ที่สุดของโมเดลที่ราคาถูกกว่า
• AA-LCR v1.1 การใช้เหตุผลบริบทยาว — 0.830 เทียบกับ 0.807 GPT-6.1 Sol นำอยู่
• AA-Briefcase v1.1 — Elo 1564.2 เทียบกับ 1568.9 Astra นำอยู่ 4.7
• AutomationBench-AA — 0.649 เทียบกับ 0.685 Astra นำอยู่ 3.6 คะแนน
• Terminal-Bench 4.0 — 0.561 เทียบกับ 0.591 Astra นำอยู่ 3.0 คะแนน
• SciCode — 0.542 เทียบกับ 0.565 Astra นำอยู่ 2.3 คะแนน
• Humanity's Last Exam — 0.529 เทียบกับ 0.547 Astra นำอยู่ 1.8 คะแนน
• AA-Omniscience — 41.5 เทียบกับ 43.4 Astra นำอยู่ 1.9 คะแนน
• GDP.pdf และ CritPt — เสมอกันสนิทที่ 0.310 และ 0.317 ตามลำดับ สำหรับทั้งสองโมเดล
สองแถวในนั้นมีค่ามากกว่าตำแหน่งของมันในรายการ ช่องว่าง GDPval-AA เป็นจุดเดียวที่ความได้เปรียบของโมเดลที่ถูกกว่ามากพอจะอยู่รอดเมื่อเปลี่ยนฮาร์เนส และมันตกไปที่ภาระงานที่ตรงกับคำโปรยวางตำแหน่งของเจ้าของผลิตภัณฑ์พอดี — งานระดับมืออาชีพที่เน้นเอกสารเป็นหลัก และผลเสมอแบบเท่ากันเป๊ะสองรายการอยู่บนการประเมินที่มีช่วงห่างแคบที่สุด ซึ่งเป็นเครื่องเตือนใจว่าส่วนต่างคะแนนรวม 0.84 จุดกำลังถูกประกอบขึ้นจากแถวที่แต่ละแถวมีตั้งแต่ชนะ 33 จุดไปจนถึงแพ้ 3.6 จุด
เมื่อเทียบกับรุ่นที่มันเข้ามาแทนที่ การเพิ่มขึ้นนั้นมีจริงแต่ไม่สม่ำเสมอ
การเปรียบเทียบที่สำคัญสำหรับใครก็ตามที่รัน GPT-6 Sol อยู่บนเส้นทางโปรดักชันแล้ว คือการเปรียบเทียบที่ 6.1 Sol ทำกับรุ่นก่อนหน้าของตัวเอง และบันทึกอิสระก็ชี้ชัดในเรื่องนั้นมากกว่าโพสต์ของผู้ขาย การประเมินสิบรายการมีแปดรายการที่ดีขึ้น สองรายการถอยหลัง
• SciCode — GPT-6.1 Sol ทำได้ 0.542 ขณะที่ GPT-6 Sol ทำได้ 0.576 โมเดลที่ใหม่กว่าแย่ลงในงานโค้ดวิทยาศาสตร์ 3.5 คะแนน
• AA-LCR v1.1 — 0.830 สำหรับ 6.1 Sol เทียบกับ 0.837 สำหรับ GPT-6 Sol ห่างกันแค่นิดเดียว แต่ไปในทิศทางที่ผิด ในการประเมินบริบทแบบยาว
• AA-Omniscience — 41.5 เทียบกับ 27.1 นี่คือการเปลี่ยนแปลงที่ใหญ่ที่สุดในแถวนี้: เพิ่มขึ้น 14.4 คะแนนในการประเมินความรู้ และความแม่นยำในชุดนั้นเพิ่มจาก 0.545 เป็น 0.621
• อัตราการหลอนในชุดเดียวกัน — 0.543 สำหรับ GPT-6.1 Sol ลดลงจาก 0.601 สำหรับ GPT-6 Sol และยังสูงกว่า 0.513 ของ GPT-6 Astra AA-Omniscience แยกคะแนนออกเป็น "ตอบถูก" และ "ผิดอย่างมั่นใจ" และการแยกนี้คือจุดที่รุ่นรีเฟรช 6.1 คุ้มค่า: มันเป็นโมเดลที่ไม่ซื่อสัตย์น้อยลงอย่างมีนัยสำคัญเมื่อเทียบกับ Sol และยังคงเป็นตัวที่ไม่ซื่อสัตย์ที่สุดในสามตัว
• Terminal-Bench 4.0 — 0.561 เทียบกับ 0.439 เพิ่มขึ้น 12.2 คะแนน AA-Briefcase — 1482.8 ถึง 1564.2 Elo GDP.pdf — 0.248 ถึง 0.310
การตีความคือว่านี่เป็นการรีเฟรชด้านความรู้และเครื่องมือมากกว่าการรีเฟรชด้านการให้เหตุผล การประเมินที่ขยับมากที่สุดคือการประเมินที่ให้รางวัลกับการรู้ข้อเท็จจริง ไม่ใช่การคิดสิ่งเหล่านั้นขึ้นมาเอง ส่วนการประเมินที่ตกลงไปเป็นแบบเฉพาะทางแคบ ๆ ใครก็ตามที่ย้ายไป 6.1 Sol เพื่อประหยัดแคชจะได้ประโยชน์ด้านความรู้เป็นโบนัส และไม่ควรสันนิษฐานว่ามันจะครอบคลุมถึงทุกฮาร์เนสที่รัน
อันดับที่บอร์ดจัดให้ และสิ่งที่อยู่เหนือขึ้นไป

ในการจัดลำดับตาม Intelligence Index เริ่มต้นของลีดเดอร์บอร์ด GPT-6 Astra ที่ความพยายามสูงสุดอยู่อันดับ 7 และ GPT-6.1 Sol ที่ความพยายามสูงสุดอยู่อันดับ 10 โดย GPT-6 Sol ที่ความพยายามสูงสุดอยู่อันดับ 20 เก้าแถวที่อยู่เหนือ GPT-6.1 Sol ได้แก่ การกำหนดค่า Astra สองแบบ, การกำหนดค่า Claude Opus 5.5 สามแบบ, การกำหนดค่า Claude Sonnet 5.5 หนึ่งแบบ และการกำหนดค่า Claude Fable 5.1 สองแบบ — ดังนั้นโมเดลที่ GPT-6.1 Sol อยู่ใกล้ที่สุดคือเรือธงของตระกูลตัวเอง และโมเดลที่มันแทนที่จริง ๆ ในการจัดลำดับนั้นคือรุ่นก่อนหน้าของมันเอง ซึ่งอยู่ต่ำลงไปสิบสามอันดับ
เมื่อตัดการตั้งค่าระดับความพยายามออก การจัดลำดับจะบีบอัดลงในลักษณะที่สำคัญต่อการวางแผนต้นทุน: GPT-6.1 Sol ที่ xhigh อยู่อันดับ 13, ที่ high อยู่อันดับ 15, ที่ medium อยู่อันดับ 19 และที่ low อยู่อันดับ 35 ขณะที่ Astra อยู่อันดับ 14 ที่ high, 16 ที่ medium และ 26 ที่ low พูดอีกอย่างคือ GPT-6.1 Sol ที่ xhigh อยู่อันดับสูงกว่า Astra ที่ high บนลีดเดอร์บอร์ด และ GPT-6.1 Sol ที่ medium อยู่อันดับสูงกว่า Astra ที่ low ระดับความพยายามเป็นปัจจัยที่ทรงพลังกว่าการเลือกโมเดลตรงนี้ อย่างน้อยก็ในสองตัวนี้
จะทำยังไงกับตัวเลขนี้ดี พูดตามตรง
คำกล่าวอ้างของผู้ขายที่แถวนี้ทดสอบคือ GPT-6.1 Sol เกือบเทียบเท่ารุ่นเรือธงในราคาประมาณหนึ่งในห้า ฉบับที่เป็นอิสระของประโยคนั้นคือ: มันห่างจากรุ่นเรือธงเพียง 0.84 จุดดัชนี และรอบการประเมินที่อยู่เบื้องหลังคะแนนของมันมีต้นทุนคิดเป็น 22% ของต้นทุนรุ่นเรือธง นั่นใกล้เคียงกับคำกล่าวอ้างมากพอที่ไม่มีใครควรรู้สึกว่าถูกทำให้เข้าใจผิดเพราะสิ่งนี้ และมันเป็นข้อความที่หนักแน่นกว่า "ยังไม่ได้รับการยืนยัน" ในทุกแง่มุมที่สำคัญต่อผู้ซื้อ
สิ่งที่แถวนี้ไม่ได้ทำคือการกำหนดราคาเวิร์กโหลดของคุณ การรันดัชนีคือส่วนผสมเฉพาะของงาน และตัวเลขที่ตัดสินบิลจริงคือเรตการ์ดเมื่อเทียบกับโปรไฟล์โทเค็นของคุณเอง — ซึ่งเป็นเหตุผลว่าทำไมบรรทัดแคชจึงยังคงเป็นบรรทัดที่ต้องจำลอง: อินพุตแคชของ GPT-6.1 Sol ที่ราคา $0.10 เทียบกับ $1.00 ของ Astra คือความต่างสิบเท่าที่ไม่มีคะแนนดัชนีใดเข้ามาแตะต้อง ฝั่งเราเองก็ใช้การส่งผ่านแบบเดียวกัน: OrcaRouter ให้บริการ GPT-6 Astra, GPT-6 Sol และ GPT-6 Luna ในราคาลิสต์ของ OpenAI เองโดยไม่บวกเพิ่ม ดังนั้นเมื่อวันที่อัตราของผู้ให้บริการเปลี่ยน อัตราฝั่งเราก็เปลี่ยนตามไปด้วย แทนที่จะต้องรอสัญญาฉบับที่สอง GPT-6.1 Sol ไม่ได้อยู่ในเส้นทางของเรา — แค็ตตาล็อกสาธารณะ ส่งคืน "model not found" สำหรับ openai/gpt-6.1-sol ในวันนี้ และไม่มีวิธีที่ซื่อสัตย์ใด ๆ ในการอธิบายโมเดลที่เราไม่สามารถให้บริการได้ สิ่งที่คีย์ API เดียวซื้อให้คุณได้จริงในตอนนี้คือคู่ที่เบนช์มาร์กโต้แย้งกันจริง ๆ — Astra สำหรับงานที่ยากที่สุด, Sol สำหรับปริมาณมาก — โดยราคาลิสต์ของผู้ให้บริการถูกส่งผ่านโดยไม่บวกเพิ่ม และมีการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อรายใดรายหนึ่งเกิดข้อผิดพลาด
สองสิ่งนี้จะทำให้เรื่องนี้คมชัดยิ่งขึ้น การทดสอบอิสระชุดที่สองบนโมเดลเดียวกันจะบอกเราว่าความได้เปรียบของ GDPval-AA เป็นคุณสมบัติของโมเดลหรือของการประเมินนั้น และมันเป็นจุดข้อมูลที่ขาดหายไปซึ่งมีประโยชน์ที่สุดเพียงจุดเดียวในแถวนั้น และการวัดอิสระของระดับบริบทยาว 272,000 โทเคนจะสำคัญยิ่งกว่าคะแนนคอมโพสิตอีกจุดหนึ่ง เพราะนั่นคือจุดที่ราคาของตระกูลนี้เริ่มไม่ถูกอีกต่อไป
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
