การ์ดฮีโร่ที่สร้างขึ้นสำหรับ GPT-6.1 Sol มีหัวข้อว่า 'คะแนนอิสระมาถึงแล้ว' พร้อมป้ายข้อความว่า 'เปิดตัว: 29 กันยายน 2026', 'ดัชนีความฉลาด: 52 ที่ความพยายามสูงสุด' และ 'ค่าใช้จ่ายต่องานในดัชนี: $0.72' ส่วนท้ายระบุว่า 'ตัวเลขอิสระจาก Artificial Analysis, index v4.3.2, อ่านข้อมูลเมื่อวันที่ 30 กันยายน 2026' และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

คะแนนอิสระครั้งแรกของ GPT-6.1 Sol ออกแล้ว: ตามหลัง Astra 0.84 คะแนน ด้วยต้นทุนงานไม่ถึงหนึ่งในสี่

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ทุกบทความเกี่ยวกับ GPT-6.1 Sol ที่ตีพิมพ์ในช่วงวันหลังจากงาน DevDay วันที่ 29 กันยายน 2026 ของ Ope​nAI — รวมถึงบล็อกนี้ด้วย — ต่างก็มีข้อแม้เดียวกัน: ตัวเลขความสามารถเป็นของผู้ขาย และยังไม่มีบุคคลที่สามให้คะแนนโมเดลนี้ ข้อแม้นั้นล้าสมัยไปแล้ว Artificial Analysis มีแถว GPT-6.1 Sol ใน Intelligence Index ของตน ซึ่งรันที่ความพยายามในการใช้เหตุผลสูงสุด และเป็นตัวเลขแรกในชีวิตอันสั้นของโมเดลนี้ที่ Ope​nAI ไม่ได้ผลิต ค่าที่อ่านได้คือ 51.8 เทียบกับ 52.7 สำหรับ GPT-6 Astra และ 47.5 สำหรับ GPT-6 Sol — ช่องว่างน้อยกว่าหนึ่งจุดถึงเรือธงราคา $10/$50 และเป็นการเพิ่มขึ้น 4.3 จุดจากโมเดลที่ GPT-6.1 Sol เข้าแทนที่ ตัวเลขที่ทำให้แถวนั้นน่าสนใจคือตัวเลขที่อยู่ข้างๆ: คณะกรรมการกำหนดราคาการรันประเมินผลเบื้องหลังแต่ละคะแนน และการรันดัชนีของ GPT-6.1 Sol มีค่าใช้จ่าย $0.72 ต่องาน ในขณะที่ของ Astra มีค่าใช้จ่าย $3.26 เงินสี่เท่าครึ่งสำหรับ 0.84 คะแนนคือการเปรียบเทียบทั้งหมดในบรรทัดเดียว และตอนนี้มันเป็นบรรทัดที่วัดได้จริง ไม่ใช่การนำเสนอของผู้ขาย

ตัวแถวเอง และสิ่งที่มันถูกรันบน

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis เผยแพร่ Intelligence Index ของตนในรูปแบบคะแนนรวมจากการประเมิน 10 รายการ และเวอร์ชันที่ใช้งานเมื่อวันที่ 30 กันยายน 2026 คือ v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience และ AA-LCR v1.1 โมเดล OpenAI ทั้งสามรุ่นในบทความนี้ใช้เวอร์ชันเดียวกัน ดังนั้นการเปรียบเทียบด้านล่างจึงเป็นการเทียบแบบเดียวกันในลักษณะที่ตารางเปิดตัวของผู้ขายเองไม่เคยทำได้ บอร์ดยังบันทึกวันที่เปิดตัวที่ตนมีสำหรับโมเดลนี้ — 2026-09-29 ซึ่งเป็นวัน DevDay — และประเมินโมเดลในการกำหนดค่า max-effort ซึ่งเป็นค่าที่หน้าดังกล่าวระบุในหัวข้อของตัวเอง

• Intelligence Index — 51.8 for GPT-6.1 Sol (max), 52.7 for GPT-6 Astra (max), 47.5 for GPT-6 Sol (max).
• Cost per index task — $0.72 for GPT-6.1 Sol, $3.26 for Astra, $1.05 for GPT-6 Sol. This is the board's own figure for what one full index evaluation cost to run, not a rate card.
• Output tokens spent on the run — 67.2 million for GPT-6.1 Sol, 60.0 million for Astra, 76.8 million for GPT-6 Sol. AA's own commentary calls 67 million "fairly concise" against a board median of 82 million, which is a second, quieter win over the model it replaces.
• Output speed — 66.8 tokens per second for GPT-6.1 Sol, 57.0 for Astra, 76.2 for GPT-6 Sol.
• Prices as the board lists them — $2.00 input and $10.00 output per million tokens for GPT-6.1 Sol, with cached input at $0.10 and cache writes at $2.50. Those four numbers match the vendor's pricing page exactly, which is the least dramatic and most useful thing about the row: an independent list of the rates we already quoted.

หมายเหตุเชิงกรอบหนึ่งข้อก่อนที่ตัวเลขจะถูกใช้เป็นกระสุน ดัชนีของ AA คือการประเมินสิบรายการ และการประเมินที่ OpenAI ยกมาเป็นประเด็นนำในประกาศของตัวเอง — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — ไม่ได้อยู่ในสิบรายการนั้น AA ใช้ AutomationBench ชนิดดัดแปลงของตัวเอง ซึ่งไม่ใช่ฮาร์เนสชุดเดียวกับเวอร์ชัน AutomationBench ที่ผู้ขายอ้างถึง ดังนั้นบันทึกอิสระจึงไม่ได้ยืนยันหรือหักล้างข้ออ้างสำคัญสี่ข้อจากโพสต์เปิดตัว มันวัดชุดงานที่แตกต่างออกไปอย่างมาก และควรอ่านเป็นความเห็นที่สองเกี่ยวกับลักษณะของโมเดล มากกว่าจะเป็นคำตัดสินต่อประโยคเฉพาะเหล่านั้น

Astra ยังคงชนะ โดยห่างกันไม่ถึงหนึ่งคะแนน ด้วยงบประมาณที่มากกว่า 4.5 เท่า

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

ทั้งสองโมเดลเปิดเผยบันไดระดับความพยายาม และบอร์ดได้เผยแพร่คะแนนและค่าใช้จ่ายในการรันสำหรับทุกขั้นของทั้งสองแล้ว เมื่อนำมาเรียงเทียบกัน บันไดเหล่านี้บอกสิ่งที่การเปรียบเทียบแบบพาดหัวเดียวบอกไม่ได้: การตั้งค่าที่ดีที่สุดของ GPT-6.1 Sol ไม่ได้กำลังแข่งกับตัวที่ดีที่สุดของ Astra แต่กำลังแข่งกับตัวที่ดีเป็นอันดับสองของ Astra

• GPT-6.1 Sol, สูงสุด — 51.8, $0.72 ต่องานดัชนี. GPT-6 Astra, สูงสุด — 52.7, $3.26.
• GPT-6.1 Sol, สูงมาก — 51.0, $0.39. GPT-6 Astra, สูงมาก — 52.4, $2.31.
• GPT-6.1 Sol, สูง — 50.2, $0.32. GPT-6 Astra, สูง — 50.9, $1.73.
• GPT-6.1 Sol, ปานกลาง — 47.8, $0.21. GPT-6 Astra, ปานกลาง — 49.6, $1.54.
• GPT-6.1 Sol, ต่ำ — 42.1, $0.13. GPT-6 Astra, ต่ำ — 45.8, $0.82.

Astra เป็นผู้นำในทุกขั้น ซึ่งเป็นบทสรุปที่ตรงไปตรงมาของการแข่งขันครั้งนี้ และยังเป็นส่วนที่น่าสนใจน้อยที่สุดของมันด้วย ส่วนที่น่าสนใจคืออัตราแลกเปลี่ยน ถ้าคุณต้องการการกำหนดค่า Astra ที่ถูกที่สุดซึ่งเอาชนะค่าที่ดีที่สุดของ GPT-6.1 Sol ได้ นั่นคือ Astra ที่ xhigh: 52.4 เทียบกับ 51.8 ในราคา $2.31 เทียบกับ $0.72 นั่นคือ 0.56 ของจุดดัชนี โดยจ่ายเพิ่ม $1.59 ต่อการรันประเมินหนึ่งครั้ง — คิดเป็นต้นทุนราว 3.2 เท่า เพื่อคะแนนที่เพิ่มขึ้นไม่ถึงหนึ่งเปอร์เซ็นต์ กลับกัน ถ้าลด GPT-6.1 Sol ลงมาเป็น xhigh คุณจะเสียคะแนน 0.8 จุด ขณะที่ค่าใช้จ่ายลดลงเหลือ $0.39 ซึ่งถูกกว่าการใช้ Astra ที่ xhigh ถึง 5.9 เท่า และเป็นหนึ่งในเก้าของการรันที่ใช้ความพยายามสูงสุดของ Astra

มีการตีความบันไดเดียวกันอีกรอบหนึ่งที่โต้แย้งการซื้อ Astra ที่ระดับ max effort สี่ขั้นที่ต่ำกว่าของ Astra ล้วนถูกกว่าระดับ max ของมัน และ xhigh ของมันต่ำกว่า max อยู่ 0.29 คะแนน — คิดเป็นคะแนนเพียงกว่าครึ่งเปอร์เซ็นต์เล็กน้อย เพื่อแลกกับการลดต้นทุนการรันลง 29% การสนทนาเรื่องการจัดซื้อใด ๆ เกี่ยวกับคู่นี้ที่เริ่มจาก "Astra ที่ max" และจบที่ "Astra แพงกว่า 4.5 เท่า" กำลังตัดขั้นที่ถูกกว่าของ Astra เองออกจากการเปรียบเทียบ

ผลการประเมินหกครั้งตกเป็นของ Astra สองครั้งตกเป็นของ GPT-6.1 Sol และอีกสองครั้งเสมอกัน

คะแนนรวมซ่อนความแตกต่างไว้ เมื่อให้คะแนนทีละการประเมินด้วยความพยายามสูงสุด GPT-6.1 Sol ไม่ใช่ Astra ที่ด้อยกว่าเล็กน้อยอย่างสม่ำเสมอ — มันทำได้ดีกว่าในสองเรื่อง และแย่กว่าในหกเรื่อง

• GDPval-AA — Elo 1575.1 สำหรับ GPT-6.1 Sol เทียบกับ 1541.9 สำหรับ Astra เป็นความได้เปรียบ 33 คะแนนในงานระดับวิชาชีพ นี่คือชัยชนะเดี่ยวที่เป็นอิสระครั้งใหญ่ที่สุดของโมเดลที่ราคาถูกกว่า
• AA-LCR v1.1 การใช้เหตุผลบริบทยาว — 0.830 เทียบกับ 0.807 GPT-6.1 Sol นำอยู่
• AA-Briefcase v1.1 — Elo 1564.2 เทียบกับ 1568.9 Astra นำอยู่ 4.7
• AutomationBench-AA — 0.649 เทียบกับ 0.685 Astra นำอยู่ 3.6 คะแนน
• Terminal-Bench 4.0 — 0.561 เทียบกับ 0.591 Astra นำอยู่ 3.0 คะแนน
• SciCode — 0.542 เทียบกับ 0.565 Astra นำอยู่ 2.3 คะแนน
• Humanity's Last Exam — 0.529 เทียบกับ 0.547 Astra นำอยู่ 1.8 คะแนน
• AA-Omniscience — 41.5 เทียบกับ 43.4 Astra นำอยู่ 1.9 คะแนน
• GDP.pdf และ CritPt — เสมอกันสนิทที่ 0.310 และ 0.317 ตามลำดับ สำหรับทั้งสองโมเดล

สองแถวในนั้นมีค่ามากกว่าตำแหน่งของมันในรายการ ช่องว่าง GDPval-AA เป็นจุดเดียวที่ความได้เปรียบของโมเดลที่ถูกกว่ามากพอจะอยู่รอดเมื่อเปลี่ยนฮาร์เนส และมันตกไปที่ภาระงานที่ตรงกับคำโปรยวางตำแหน่งของเจ้าของผลิตภัณฑ์พอดี — งานระดับมืออาชีพที่เน้นเอกสารเป็นหลัก และผลเสมอแบบเท่ากันเป๊ะสองรายการอยู่บนการประเมินที่มีช่วงห่างแคบที่สุด ซึ่งเป็นเครื่องเตือนใจว่าส่วนต่างคะแนนรวม 0.84 จุดกำลังถูกประกอบขึ้นจากแถวที่แต่ละแถวมีตั้งแต่ชนะ 33 จุดไปจนถึงแพ้ 3.6 จุด

เมื่อเทียบกับรุ่นที่มันเข้ามาแทนที่ การเพิ่มขึ้นนั้นมีจริงแต่ไม่สม่ำเสมอ

การเปรียบเทียบที่สำคัญสำหรับใครก็ตามที่รัน GPT-6 Sol อยู่บนเส้นทางโปรดักชันแล้ว คือการเปรียบเทียบที่ 6.1 Sol ทำกับรุ่นก่อนหน้าของตัวเอง และบันทึกอิสระก็ชี้ชัดในเรื่องนั้นมากกว่าโพสต์ของผู้ขาย การประเมินสิบรายการมีแปดรายการที่ดีขึ้น สองรายการถอยหลัง

• SciCode — GPT-6.1 Sol ทำได้ 0.542 ขณะที่ GPT-6 Sol ทำได้ 0.576 โมเดลที่ใหม่กว่าแย่ลงในงานโค้ดวิทยาศาสตร์ 3.5 คะแนน
• AA-LCR v1.1 — 0.830 สำหรับ 6.1 Sol เทียบกับ 0.837 สำหรับ GPT-6 Sol ห่างกันแค่นิดเดียว แต่ไปในทิศทางที่ผิด ในการประเมินบริบทแบบยาว
• AA-Omniscience — 41.5 เทียบกับ 27.1 นี่คือการเปลี่ยนแปลงที่ใหญ่ที่สุดในแถวนี้: เพิ่มขึ้น 14.4 คะแนนในการประเมินความรู้ และความแม่นยำในชุดนั้นเพิ่มจาก 0.545 เป็น 0.621
• อัตราการหลอนในชุดเดียวกัน — 0.543 สำหรับ GPT-6.1 Sol ลดลงจาก 0.601 สำหรับ GPT-6 Sol และยังสูงกว่า 0.513 ของ GPT-6 Astra AA-Omniscience แยกคะแนนออกเป็น "ตอบถูก" และ "ผิดอย่างมั่นใจ" และการแยกนี้คือจุดที่รุ่นรีเฟรช 6.1 คุ้มค่า: มันเป็นโมเดลที่ไม่ซื่อสัตย์น้อยลงอย่างมีนัยสำคัญเมื่อเทียบกับ Sol และยังคงเป็นตัวที่ไม่ซื่อสัตย์ที่สุดในสามตัว
• Terminal-Bench 4.0 — 0.561 เทียบกับ 0.439 เพิ่มขึ้น 12.2 คะแนน AA-Briefcase — 1482.8 ถึง 1564.2 Elo GDP.pdf — 0.248 ถึง 0.310

การตีความคือว่านี่เป็นการรีเฟรชด้านความรู้และเครื่องมือมากกว่าการรีเฟรชด้านการให้เหตุผล การประเมินที่ขยับมากที่สุดคือการประเมินที่ให้รางวัลกับการรู้ข้อเท็จจริง ไม่ใช่การคิดสิ่งเหล่านั้นขึ้นมาเอง ส่วนการประเมินที่ตกลงไปเป็นแบบเฉพาะทางแคบ ๆ ใครก็ตามที่ย้ายไป 6.1 Sol เพื่อประหยัดแคชจะได้ประโยชน์ด้านความรู้เป็นโบนัส และไม่ควรสันนิษฐานว่ามันจะครอบคลุมถึงทุกฮาร์เนสที่รัน

อันดับที่บอร์ดจัดให้ และสิ่งที่อยู่เหนือขึ้นไป

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

ในการจัดลำดับตาม Intelligence Index เริ่มต้นของลีดเดอร์บอร์ด GPT-6 Astra ที่ความพยายามสูงสุดอยู่อันดับ 7 และ GPT-6.1 Sol ที่ความพยายามสูงสุดอยู่อันดับ 10 โดย GPT-6 Sol ที่ความพยายามสูงสุดอยู่อันดับ 20 เก้าแถวที่อยู่เหนือ GPT-6.1 Sol ได้แก่ การกำหนดค่า Astra สองแบบ, การกำหนดค่า Claude Opus 5.5 สามแบบ, การกำหนดค่า Claude Sonnet 5.5 หนึ่งแบบ และการกำหนดค่า Claude Fable 5.1 สองแบบ — ดังนั้นโมเดลที่ GPT-6.1 Sol อยู่ใกล้ที่สุดคือเรือธงของตระกูลตัวเอง และโมเดลที่มันแทนที่จริง ๆ ในการจัดลำดับนั้นคือรุ่นก่อนหน้าของมันเอง ซึ่งอยู่ต่ำลงไปสิบสามอันดับ

เมื่อตัดการตั้งค่าระดับความพยายามออก การจัดลำดับจะบีบอัดลงในลักษณะที่สำคัญต่อการวางแผนต้นทุน: GPT-6.1 Sol ที่ xhigh อยู่อันดับ 13, ที่ high อยู่อันดับ 15, ที่ medium อยู่อันดับ 19 และที่ low อยู่อันดับ 35 ขณะที่ Astra อยู่อันดับ 14 ที่ high, 16 ที่ medium และ 26 ที่ low พูดอีกอย่างคือ GPT-6.1 Sol ที่ xhigh อยู่อันดับสูงกว่า Astra ที่ high บนลีดเดอร์บอร์ด และ GPT-6.1 Sol ที่ medium อยู่อันดับสูงกว่า Astra ที่ low ระดับความพยายามเป็นปัจจัยที่ทรงพลังกว่าการเลือกโมเดลตรงนี้ อย่างน้อยก็ในสองตัวนี้

จะทำยังไงกับตัวเลขนี้ดี พูดตามตรง

คำกล่าวอ้างของผู้ขายที่แถวนี้ทดสอบคือ GPT-6.1 Sol เกือบเทียบเท่ารุ่นเรือธงในราคาประมาณหนึ่งในห้า ฉบับที่เป็นอิสระของประโยคนั้นคือ: มันห่างจากรุ่นเรือธงเพียง 0.84 จุดดัชนี และรอบการประเมินที่อยู่เบื้องหลังคะแนนของมันมีต้นทุนคิดเป็น 22% ของต้นทุนรุ่นเรือธง นั่นใกล้เคียงกับคำกล่าวอ้างมากพอที่ไม่มีใครควรรู้สึกว่าถูกทำให้เข้าใจผิดเพราะสิ่งนี้ และมันเป็นข้อความที่หนักแน่นกว่า "ยังไม่ได้รับการยืนยัน" ในทุกแง่มุมที่สำคัญต่อผู้ซื้อ

สิ่งที่แถวนี้ไม่ได้ทำคือการกำหนดราคาเวิร์กโหลดของคุณ การรันดัชนีคือส่วนผสมเฉพาะของงาน และตัวเลขที่ตัดสินบิลจริงคือเรตการ์ดเมื่อเทียบกับโปรไฟล์โทเค็นของคุณเอง — ซึ่งเป็นเหตุผลว่าทำไมบรรทัดแคชจึงยังคงเป็นบรรทัดที่ต้องจำลอง: อินพุตแคชของ GPT-6.1 Sol ที่ราคา $0.10 เทียบกับ $1.00 ของ Astra คือความต่างสิบเท่าที่ไม่มีคะแนนดัชนีใดเข้ามาแตะต้อง ฝั่งเราเองก็ใช้การส่งผ่านแบบเดียวกัน: OrcaRouter ให้บริการ GPT-6 Astra, GPT-6 Sol และ GPT-6 Luna ในราคาลิสต์ของ OpenAI เองโดยไม่บวกเพิ่ม ดังนั้นเมื่อวันที่อัตราของผู้ให้บริการเปลี่ยน อัตราฝั่งเราก็เปลี่ยนตามไปด้วย แทนที่จะต้องรอสัญญาฉบับที่สอง GPT-6.1 Sol ไม่ได้อยู่ในเส้นทางของเรา — แค็ตตาล็อกสาธารณะ ส่งคืน "model not found" สำหรับ openai/gpt-6.1-sol ในวันนี้ และไม่มีวิธีที่ซื่อสัตย์ใด ๆ ในการอธิบายโมเดลที่เราไม่สามารถให้บริการได้ สิ่งที่คีย์ API เดียวซื้อให้คุณได้จริงในตอนนี้คือคู่ที่เบนช์มาร์กโต้แย้งกันจริง ๆ — Astra สำหรับงานที่ยากที่สุด, Sol สำหรับปริมาณมาก — โดยราคาลิสต์ของผู้ให้บริการถูกส่งผ่านโดยไม่บวกเพิ่ม และมีการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อรายใดรายหนึ่งเกิดข้อผิดพลาด

สองสิ่งนี้จะทำให้เรื่องนี้คมชัดยิ่งขึ้น การทดสอบอิสระชุดที่สองบนโมเดลเดียวกันจะบอกเราว่าความได้เปรียบของ GDPval-AA เป็นคุณสมบัติของโมเดลหรือของการประเมินนั้น และมันเป็นจุดข้อมูลที่ขาดหายไปซึ่งมีประโยชน์ที่สุดเพียงจุดเดียวในแถวนั้น และการวัดอิสระของระดับบริบทยาว 272,000 โทเคนจะสำคัญยิ่งกว่าคะแนนคอมโพสิตอีกจุดหนึ่ง เพราะนั่นคือจุดที่ราคาของตระกูลนี้เริ่มไม่ถูกอีกต่อไป

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube