
Nex-N2.5 Pro เทียบกับ GPT-5.6 Sol: หมายเลขจากผู้จำหน่ายของผู้มาใหม่ยังตามหลังหมายเลขอิสระของผู้ครองตลาดเดิม
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0455ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0247ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0247ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0157ความฉลาด82การเขียนโค้ด
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2646ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1849ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1541ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1251ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0547ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0347ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2140ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128ความฉลาด49การเขียนโค้ด
วางเกณฑ์ชี้วัดหนึ่งเดียวที่ทั้งคู่มีตัวเลขอยู่เคียงข้างกัน แล้วลำดับการดำเนินการก็ผิดพลาดสำหรับการเปิดตัว การ์ดข้อมูลของ Nex-AGI ให้ Nex-N2.5 Pro ได้ 56.4 บน OSWorld-2 ซึ่งวัดด้วยชุดทดสอบ NexCUA ของพันธมิตรเองที่สาธารณชนไม่เคยเห็น ลีดเดอร์บอร์ด OSWorld 2.0 ของ BenchLM ซึ่งอัปเดตเมื่อวันที่ 29 สิงหาคม ระบุให้ GPT-5.6 Sol อยู่ที่ 62.6 — ตัวเลขจากแหล่งอิสระที่เอาชนะตัวเลขจากผู้ผลิตรายใหม่อย่างขาดลอย บนถิ่นของโมเดลที่เพิ่งเปิดตัวได้วันเดียว ซึ่งก็คือการใช้งานคอมพิวเตอร์ด้วยการอ่านหน้าจอ สิ่งเดียวที่มันถูกสร้างมาเพื่อสิ่งนี้โดยเฉพาะ — โมเดลเอนกประสงค์ที่โตเต็มที่ซึ่งถูกนำมาเทียบด้วยนั้นไม่จำเป็นต้องมีเชิงอรรถดอกจันก็ยังออกหน้าเหนือกว่า Nex-N2.5 Pro ปะทะ GPT-5.6 Sol ไม่ใช่การแข่งขันที่สูสีในมิติใดๆ ที่ถูกวัดโดยใครอื่นนอกจากผู้สร้างโมเดลรายใหม่ มันคือกรณีศึกษาว่าบันทึกผลจากระบบผลิตจริงมีคุณค่าเพียงใด และด้วยเหตุผลข้อนั้นเพียงอย่างเดียวก็คุ้มค่าที่จะอ่าน
ทั้งสองโมเดลแทบไม่ใช่คู่แข่งกันในเชิงจุดประสงค์ Nex-N2.5 Pro ที่ประกาศเมื่อวันที่ 8 กันยายน 2026 เป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์ 397 พันล้านตัว โดยมีพารามิเตอร์ที่ทำงานจริงประมาณ 17 พันล้านตัว รองรับ multimodal (รับข้อความและรูปภาพเข้า ส่งข้อความออก) ผ่านการ post-train ต่อจากตระกูล Qwen3.5 และถูกสร้างมาเพื่อควบคุมคอมพิวเตอร์และเบราว์เซอร์ผ่านวงจรป้อนกลับทางภาพ น้ำหนักโมเดลภายใต้สัญญา Apache-2.0 ยังถูกระบุว่า "coming soon" บน Hugging Face และบิลด์ที่ใช้งานได้จริงเพียงอย่างเดียวคือเอนด์พอยต์ฟรีที่โฮสต์ไว้โดยลิงก์จากการ์ดโมเดลของ Nex-AGI GPT-5.6 Sol คือโมเดลเรือธงของ OpenAI สำหรับ "งานที่ยากที่สุด" — การให้เหตุผลหลายขั้นตอนเชิงลึก วิศวกรรมซอฟต์แวร์ขนาดใหญ่ และเวิร์กโฟลว์แบบ agentic ระยะยาว — ซึ่งอยู่ใน API ตั้งแต่วันที่ 9 กรกฎาคม เป็นโมเดล closed-weights และตอนนี้แบกรับน้ำหนักของการเป็นจุดอ้างอิงระดับแนวหน้าจนกว่า OpenAI จะเปิดตัว GPT-6 Astra ในวันที่ 3 กันยายน ในขณะที่ Nex-N2.5 Pro เป็นโมเดลเฉพาะทางที่ยังไม่ได้เปิดตัวน้ำหนักโมเดลของตัวเอง GPT-5.6 Sol เป็นโมเดลทั่วไปที่ผ่านการพิสูจน์แล้ว ซึ่งเปิดตัวให้บริการกับทราฟฟิกการใช้งานจริงที่มีความต้องการสูงที่สุดในอุตสาหกรรมมาเป็นเวลาสองเดือนแล้ว
GPT-5.6 Sol เป็นโมเดลที่มีไฟล์
เริ่มจากสิ่งที่ Sol มี แต่ Nex-N2.5 Pro ไม่มี: นั่นคือบันทึกผลลัพธ์ ตั้งแต่วันที่ 9 กรกฎาคม GPT-5.6 Sol ถูกทดสอบผ่านชุดทดสอบอิสระ ถูกถล่มโดยนักวิจัยด้านความมั่นคงปลอดภัย และถูกผนวกเข้ากับเฟรมเวิร์กเอเจนต์และเวิร์กโฟลว์ของ Codex การวัดผลแบบอิสระของมันนั้นละเอียดและเปิดเผยต่อสาธารณะ: 61 คะแนนบน Artificial Analysis Intelligence Index ที่ระดับการใช้เหตุผลสูงสุด, 88.0 บน Terminal-Bench 2.1 และ 73.0 บน DeepSWE ซึ่งวัดด้วยชุดทดสอบอิสระเดียวกัน และวัดความเร็วเอาต์พุตได้ประมาณ 71 โทเคนต่อวินาที ด้วยต้นทุนราว 0.95 ดอลลาร์ต่องาน Intelligence Index ไม่มีสิ่งใดที่กล่าวมาทำให้มันไร้เทียมทาน — OpenAI ได้วางตำแหน่ง GPT-6 Astra ไว้เหนือมันแล้ว — แต่ตัวเลขทุกตัวเหล่านั้นคือการวัดผลที่ใครบางคนนอกเหนือจาก OpenAI เป็นผู้ผลิต ส่วน Nex-N2.5 Pro ไม่มีการวัดผลอิสระที่ใดเลย ด้วยเหตุผลเชิงโครงสร้าง: ไม่มีใครนอกกลุ่มพันธมิตรสามารถรันมันได้
เกณฑ์มาตรฐานเดียวที่ทั้งคู่มีตัวเลข
การเปรียบเทียบ OSWorld เป็นข้อมูลที่อ่านแล้วเข้าใจได้ชัดเจนที่สุดที่มีอยู่ จึงสมควรระบุข้อควรระวังไว้ก่อนที่จะนำไปใช้ คะแนน 56.4 ของ Nex-N2.5 Pro เป็นค่าที่วัดโดย Nex-AGI เองบน OSWorld-2 ผ่านฮาร์เนส (harness) NexCUA ของบริษัท คะแนน 62.6 ของ GPT-5.6 Sol มาจากลีดเดอร์บอร์ด OSWorld 2.0 ของ BenchLM ซึ่งเป็นข้อมูลสแนปชอตจากบุคคลที่สามลงวันที่ 29 สิงหาคม 2026 โดยลีดเดอร์บอร์ดดังกล่าวแสดงโมเดลทั้งหมดสิบห้ารุ่น และจัดอันดับให้ Claude Opus 5 อยู่อันดับหนึ่งที่ 70.6 ส่วน GPT-5.6 Sol อยู่อันดับสองที่ 62.6 และ GPT-5.6 Terra อยู่อันดับสามที่ 50.2 "OSWorld-2" และ "OSWorld 2.0" เป็นเวอร์ชันที่ใกล้เคียงกันมากแต่ยังไม่ได้รับการพิสูจน์ว่าเหมือนกันทุกประการ ดังนั้นช่องว่างคะแนนสี่ถึงหกจุดที่เห็นจึงควรอ่านเป็นแนวโน้มเชิงทิศทางมากกว่าค่าที่แม่นยำ สิ่งที่ยังคงเป็นจริงแม้จะมีข้อควรระวังเหล่านี้คือลำดับผลคะแนน: เมื่อดูตัวเลขที่ดีที่สุดที่แต่ละฝ่ายสามารถนำเสนอได้ คะแนนของ Sol ที่วัดโดยหน่วยงานอิสระสูงกว่าคะแนนของ Nex ที่วัดโดยผู้พัฒนาบนเบนช์มาร์กที่ Nex เลือกเผยแพร่เอง ผู้มาใหม่ที่ผลคะแนนของตัวเองต่ำกว่าผลคะแนนอิสระของผู้เล่นรายเดิม ยังไม่มีข้อชักชวนที่น่าเชื่อถือพอให้ผู้ใช้เปลี่ยนใจมาใช้

ซองจดหมายตามสเปก
สเปกชีตที่เหลือก็ดำเนินไปในทิศทางเดียวกัน:
• เผยแพร่แล้ว — Nex-N2.5 Pro: 8 กันยายน 2026 (โฮสต์เอนด์พอยต์พร้อมใช้งาน รอการเผยแพร่น้ำหนักโมเดล) GPT-5.6 Sol: 9 กรกฎาคม 2026 เปิดให้บริการทั่วไป
• ขนาด — Nex-N2.5 Pro: รวม 397B / MoE ที่ใช้งาน ~17B. GPT-5.6 Sol: ไม่เปิดเผยจำนวนพารามิเตอร์
• โมดาลิตี้ — Nex-N2.5 Pro: รับอินพุตข้อความและรูปภาพ ส่งออกข้อความ มีลูปการมองเห็นสำหรับการใช้งานคอมพิวเตอร์ ส่วน GPT-5.6 Sol: รับอินพุตข้อความ รูปภาพ และไฟล์ ส่งออกข้อความ พร้อมการเรียกใช้เครื่องมือและโหมด JSON.
• Context / output — Nex-N2.5 Pro: 262,144-token context. GPT-5.6 Sol: ~1.05M-token context, 128K output ceiling.
• การควบคุมการให้เหตุผล — Nex-N2.5 Pro: ไม่มี / ปานกลาง (ปรับอัตโนมัติ, ค่าเริ่มต้น) / สูง. GPT-5.6 Sol: ใช้ความพยายามในการให้เหตุผลได้สูงสุด พร้อมระดับการประมวลผลเร็วแยกต่างหาก.
• น้ำหนัก — Nex-N2.5 Pro: Apache-2.0 เร็วๆ นี้ GPT-5.6 Sol: ไม่เปิดเผย
• ราคาต่อ 1M โทเคน — Nex-N2.5 Pro: ระดับโฮสต์ฟรี ไม่มีราคาที่ระบุ GPT-5.6 Sol: $4.00 / $20.00 ราคาโปรโมชันตั้งแต่วันที่ 21 สิงหาคม, $0.40 สำหรับอินพุตแคช, และจะปรับระดับเป็น $8.00 / $30.00 เมื่ออินพุตเกิน 272K โทเคน
บริบทขนาด ~1.05M โทเคนและเพดานเอาต์พุต 128K ของ Sol ทำให้หน้าต่างบริบท 262K ของ Nex-N2.5 Pro ดูเล็กมากสำหรับงานระยะยาว ส่วนราคาของ Sol แม้จะห่างไกลจากความถูก แต่ก็เป็นตัวเลขที่คงที่ซึ่งใช้งบประมาณวางแผนได้ ระดับฟรีของ Nex-N2.5 Pro คือตัวเลขเดียวที่เข้าข้างมัน และมันไม่ใช่ราคา
คะแนนอายุหนึ่งวันมีค่าเท่าใด

ข้อกล่าวอ้างผลการทดสอบมาตรฐานทุกข้อที่มาพร้อมกับ Nex-N2.5 Pro — OSWorld-2 ที่ 56.4, Terminal-Bench 2.1 ที่ 82.7, SWE-Bench Pro ที่ 61.2, BrowseComp ที่ 89.7 — มีคุณสมบัติร่วมกันหนึ่งประการ: Nex-AGI เป็นผู้สร้างมันขึ้นมาผ่านชุดทดสอบที่กลุ่มพันธมิตรบอกว่าจะเปิดซอร์สโค้ดแต่ยังไม่ได้เปิด ไม่มีตัวเลขใดในนั้นที่ถูกผลิตซ้ำโดยหน่วยงานอิสระ เพราะไม่มีตัวเลขใดทำได้ น้ำหนักโมเดลไม่สามารถดาวน์โหลดได้ และไม่มีวันที่ระบุไว้บนป้าย "เร็วๆ นี้" ประเด็นนี้สำคัญในการประจันหน้าครั้งนี้มากกว่ากรณีส่วนใหญ่ เพราะโมเดลที่ Nex-N2.5 Pro ถูกนำมาเทียบด้วยนั้นมีประวัติการประเมินอิสระยาวนานที่สุดในอุตสาหกรรม เมื่อฐานหลักฐานทั้งหมดของผู้ท้าชิงมาจากการรายงานตนเอง ขณะที่ของผู้ครองตำแหน่งไม่เป็นเช่นนั้น ภาระการพิสูจน์จึงตกอยู่ที่ผู้ท้าชิงแต่เพียงฝ่ายเดียว และการเปิดจุดเชื่อมต่อให้ใช้ฟรีก็ไม่ได้ช่วยปลดภาระนั้น ทันทีที่ชิ้นส่วนทั้งหลายถูกปล่อยออกมาและห้องแล็บอิสระได้รัน Nex-N2.5 Pro ตัวเลขในบทความนี้ก็จะสามารถตรวจสอบได้และการเปรียบเทียบก็จะกลายเป็นเรื่องจริง จนกว่าจะถึงตอนนั้น "คะแนนที่เก่าไปหนึ่งวัน" คือวลีที่แม่นยำ — คะแนนที่ไม่สามารถตรวจสอบได้บนโมเดลที่ไม่สามารถรันได้
ราคา เส้นทาง และรูปแบบของการตัดสินใจ
ในเรื่องต้นทุน สองฝ่ายแทบจะเทียบกันได้ยากที่สุด เพราะมีเพียงฝ่ายเดียวเท่านั้นที่มีต้นทุน อัตรา $4.00 / $20.00 ของ GPT-5.6 Sol คือราคารายการส่งเสริมการขายของ OpenAI ซึ่งมีผลตั้งแต่วันที่ 21 สิงหาคม และระบุว่าจะคงอยู่อย่างน้อยจนถึงวันที่ 21 พฤศจิกายน โดยลดลงจาก $5.00 / $30.00 ซึ่งเป็นการปรับลดที่ทำให้รุ่นเรือธงมีราคาที่เอื้อมถึงได้มากขึ้นอย่างมีนัยสำคัญสำหรับงานเอเจนต์ที่มีปริมาณมาก และเราเตอร์แบบ pass-through จะสะท้อนการเปลี่ยนแปลงนี้ในวันเดียวกับที่ OpenAI ประกาศ Sol อยู่บน OrcaRouter ในราคารายการนั้นโดยไม่มีมาร์กอัป โดยมี batch tier และ fast tier ให้ใช้ภายใต้คีย์ API เดียวกันกับโมเดลอื่นๆ กว่า 200 รุ่น ทีมจึงสามารถกำหนดเส้นทางคำขอที่ต้องใช้ความสามารถเชิงลึกของ OpenAI ไปที่ Sol และส่งโมเดลที่ถูกกว่าไปจัดการกับงานอื่นๆ Nex-N2.5 Pro ไม่มีราคารายการ มีเพียงปลายทางโฮสต์ฟรี ซึ่งเป็นวิธีที่ดีในการประเมินโมเดล แต่เป็นพื้นฐานที่ย่ำแย่สำหรับงบประมาณการผลิต คุณไม่สามารถวางแผนการใช้จ่ายจากตัวเลขที่ไม่มีอยู่จริง และไม่สามารถวางแผนสถาปัตยกรรมจากน้ำหนักที่ยังไม่ถูกเผยแพร่ได้

การตัดสินใจที่การเทียบกันครั้งนี้บีบให้ต้องทำจริงๆ คือเรื่องความเสี่ยง ไม่ใช่ขีดความสามารถ หากคุณต้องการโมเดลที่จะยังอยู่ให้ใช้ในไตรมาสหน้า มีราคาที่รู้แน่นอน มีรูปแบบความล้มเหลวที่รู้แน่นอน และผ่านการทดสอบเชิง adversarial มาแล้วหลายเดือน GPT-5.6 Sol คือตัวเลือกที่สมเหตุสมผล — และการที่ OpenAI เปิดตัว GPT-6 Astra ซึ่งอยู่เหนือขึ้นไปก็ยิ่งหนุนให้เหตุผลนี้แข็งแกร่ง เพราะตอนนี้ Sol คือม้าศึกที่ผ่านการพิสูจน์แล้ว พร้อมการลดราคาที่เล็งตรงไปที่ปริมาณการใช้งานระดับ production หากคุณกำลังสร้างเอเยนต์ใช้งานคอมพิวเตอร์บน open weights และพอจะรอสิ่งที่ตรวจสอบยืนยันได้จริง Nex-N2.5 Pro ก็น่าจับตามอง — โมเดล multimodal เฉพาะทางแบบ 17B-active คือรูปแบบโมเดลที่กดต้นทุนให้ต่ำกว่าโมเดลปิดชั้นแนวหน้าได้ซ้ำแล้วซ้ำเล่า แต่คำสำคัญคือ “จับตามอง” ในทุกมิติที่ใครก็ตามนอกจากผู้สร้างเป็นคนวัด Nex-N2.5 Pro ยังตามหลังโมเดลที่มีไฟล์ให้ใช้งาน และจนกว่าน้ำหนักจะถูกปล่อยออกมา การเปรียบเทียบก็สิ้นสุดลงเพียงเท่านี้
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
