
Grok 4.7 vs Qwen 3.8 Max: ราคาเท่ากัน ต่างกันแค่หนึ่งคะแนน รูปทรงตรงกันข้าม
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
โมเดลเรือธงแบบปิดสองรุ่น ทั้งคู่ราคา 2 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 6 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน ทั้งคู่ได้คะแนนห่างกันไม่เกินหนึ่งจุดบนเกณฑ์มาตรฐานอิสระชุดเดียวกัน เปิดตัวห่างกันสิบเก้าวัน Grok 4.7 เปิดตัวเมื่อวันที่ 21 กันยายน 2026 จาก SpaceXAI; Qwen 3.8 Max เปิดตัวโดยผู้พัฒนาเมื่อวันที่ 3 สิงหาคม 2026 และรีเฟรชอีกครั้งเมื่อวันที่ 2 กันยายน 2026 บนดัชนี Artificial Analysis Intelligence Index ฉบับปัจจุบัน เวอร์ชัน v4.3.2 Grok 4.7 ได้คะแนน 46 และ Qwen 3.8 Max ได้คะแนน 45 ในแง่ราคาและความสามารถที่วัดได้ สองโมเดลนี้เป็นการซื้อแบบเดียวกัน ในทุกเรื่องอื่น — บริบท โมดัลลิตี ความเร็วในการให้บริการ ความเปิด และสิ่งที่ผู้พัฒนาแต่ละรายเลือกจะปรับให้เหมาะสม — ทั้งคู่แตกต่างกันอย่างสิ้นเชิง และนั่นคือสิ่งที่ทำให้การเปรียบเทียบนี้คุ้มค่าที่จะทำมากกว่าจะข้ามไป
ก่อนอื่น ไทม์ไลน์ เพราะ Qwen 3.8 Max มีสองวันที่
เรื่องนี้ทำให้การรายงานข่าวหลายแห่งสับสน จึงควรทำให้กระจ่างตั้งแต่ต้น Qwen 3.8 Max เปิดตัวเมื่อวันที่ 3 สิงหาคม 2026 ในฐานะโมเดลที่ใหญ่ที่สุดและมีความสามารถมากที่สุดของ Alibaba สร้างขึ้นจากสถาปัตยกรรม vision-language ของ Qwen 3.5 บนการออกแบบ sparse mixture-of-experts ที่มีรายงานว่ามีพารามิเตอร์รวม 2.4 ล้านล้านตัว โดยมี 95 พันล้านตัวที่ทำงานต่อโทเคน เมื่อวันที่ 2 กันยายน 2026 Alibaba ได้ปล่อยบิลด์ปรับปรุงใหม่ — รีวิชัน 0902 ซึ่งเป็นเวอร์ชันที่ใช้ model IDs ปัจจุบัน และเป็นเวอร์ชันที่ Artificial Analysis ระบุวันที่ในหน้าเพจของตน หากคุณเคยเห็นทั้งวันที่ในเดือนสิงหาคมและกันยายนสำหรับ Qwen 3.8 Max นั่นคือสาเหตุ: หนึ่งคือการเปิดตัว อีกหนึ่งคือรีวิชันที่คนส่วนใหญ่เรียกกันจริงในตอนนี้
Grok 4.7 มีประวัติที่เรียบร้อยกว่า และมีอีกประวัติที่ยุ่งเหยิงกว่าอยู่เบื้องหลัง SpaceXAI เปิดตัวมันเมื่อวันที่ 21 กันยายน 2026 หลังกำหนดเปิดตัวที่เลื่อนออกไปซ้ำแล้วซ้ำเล่า — มัสก์เคยชี้ไปที่กรอบเวลาในช่วงปลายเดือนสิงหาคม ต้นเดือนกันยายน และกลางเดือนกันยายน ก่อนที่โมเดลจะถูกปล่อยจริง การเปิดตัวครั้งนี้เองมีขอบเขตแคบ: โมเดลฐานที่ใหญ่กว่า Grok 4.6, การรัน reinforcement learning ที่ยาวนานขึ้นซึ่งมุ่งเป้าไปที่งานที่ใช้เวลาหลายชั่วโมง และไม่มีการเปลี่ยนแปลงเรตการ์ด $2/$6 ที่ Grok 4.6 ใช้มาตั้งแต่วันที่ 12 สิงหาคม
ผู้ให้บริการแต่ละรายปรับให้เหมาะกับอะไร
อ่านประกาศเปิดตัวทั้งสองฉบับควบเป็นคู่ แล้วจะเห็นว่าการเดิมพันด้านการออกแบบแทบจะตรงข้ามกันอย่างสมบูรณ์
SpaceXAI ถูกปรับให้เหมาะกับการทำงานแบบเอเจนต์ ตัวเลขที่ผู้ขายรายงานของ Grok 4.7 กระจุกตัวอยู่ในงานเทอร์มินัลและงานในที่เก็บโค้ด: Terminal-Bench 4.0 อยู่ที่ 38.0% เทียบกับ 20.3% ของ Grok 4.6, CursorBench 4.0 อยู่ที่ 46.3%, DeepSWE v1.1 อยู่ที่ 71.0% เมื่อใช้ความพยายามในการให้เหตุผลระดับสูง, EEBench อยู่ที่ 64.0% คำอธิบายการเปิดตัวของบริษัทเองระบุเป้าหมายว่าเป็นการตรวจสอบตนเองและการจัดการบริบทแบบยาวภายในสภาพแวดล้อม Grok Bot Grok 4.7 ให้หน้าต่างบริบท 500,000 โทเค็น รับข้อความและรูปภาพเข้า ส่งออกเป็นข้อความ และเปิดให้ปรับระดับความพยายามในการให้เหตุผลตั้งแต่ low ถึง xhigh มันเป็นโมเดลที่สร้างมาเพื่อทำงานให้เสร็จ
Alibaba ปรับแต่งมาเพื่อความครอบคลุม Qwen 3.8 Max มีหน้าต่างบริบท (context window) ประมาณ 984,000 โทเคน — เท่ากับหนึ่งล้านโดยพฤตินัย — และจุดแข็งที่เปิดเผยนั้นเป็นความกว้างมากกว่าความลึกในด้านใดด้านหนึ่ง: คะแนน Terminal Bench 2.1 ที่ 86.6, SWE-bench Pro ที่ 67.7, PaperBench ที่ 93.0, GPQA Diamond ที่ 92.6, MMMU-Pro ที่ 82.3, OSWorld-Verified ที่ 86.1 รองรับอินพุตทั้งข้อความ รูปภาพ และวิดีโอ แล้วส่งคืนเป็นข้อความ รองรับระดับความพยายามในการคิด (reasoning effort) โดยมี xhigh เป็นค่าเริ่มต้น และจุดที่อ่อนกว่าตามข้อมูลที่เปิดเผยคือ Humanity's Last Exam ที่ 43.6 มันเป็นโมเดลที่สร้างขึ้นมาเพื่อจัดการกับทุกสิ่งทุกอย่างที่คุณป้อนให้
ทุกตัวเลขในย่อหน้านั้นเป็นข้อมูลที่ผู้ขายรายงานเอง ทั้งสองชุดยังไม่ได้รับการทำซ้ำอย่างอิสระ และทั้งสองชุดก็ไม่สามารถนำมาเปรียบเทียบกันโดยตรงได้อยู่แล้ว เพราะ Terminal-Bench 2.1 และ Terminal-Bench 4.0 เป็นเบนช์มาร์กที่แตกต่างกัน ดังนั้น 86.6 ของ Qwen และ 38.0 ของ Grok จึงต้องไม่ถูกนำมาวางเคียงข้างกันเลย
• คะแนนรวมอิสระ — Grok 4.7 ได้ 46 บน AA Intelligence Index v4.3.2 เทียบกับ Qwen 3.8 Max ได้ 45 บนเวอร์ชันเดียวกัน ถือว่าเสมอกันทางสถิติ
• ราคาต่อล้านโทเคน — $2.00 ขาเข้า / $6.00 ขาออก ทั้งสองตัว ส่วนลดแคชของ Qwen ระบุไว้ที่ 88% ทำให้ได้อัตราเฉลี่ยรวม $1.18 ต่อล้านโทเคน ส่วนเงื่อนไขแคชของ Grok 4.7 ไม่ได้เผยแพร่บนพื้นฐานเดียวกัน
• หน้าต่างบริบท — Grok 4.7 500,000 โทเค็น เทียบกับ Qwen 3.8 Max ประมาณ 984,000 โทเค็น Qwen ชนะเกือบสองเท่า และนี่คือความแตกต่างด้านสเปกที่ใหญ่ที่สุดเพียงข้อเดียวระหว่างทั้งสอง
• รูปแบบอินพุต — Grok 4.7 ข้อความและรูปภาพ เทียบกับ Qwen 3.8 Max ข้อความ รูปภาพ และวิดีโอ
• ค่าน้ำหนัก — ทั้งคู่เป็นกรรมสิทธิ์เฉพาะ ไม่มีโมเดลใดสามารถดาวน์โหลดได้ ซึ่งตัดข้อโต้แย้งเรื่องน้ำหนักแบบเปิด (open-weights) ที่มักมีออกไปจากการเปรียบเทียบนี้โดยสิ้นเชิง
• พารามิเตอร์ — Grok 4.7 ไม่ถูกเปิดเผยในเอกสารสเปกของ SpaceXAI ฉบับใด (ตัวเลข ~2.1T เป็นคำกล่าวอ้างของมัสก์) เทียบกับ Qwen 3.8 Max ที่มีรายงานว่าอยู่ที่ 2.4T ทั้งหมด โดยมี 95B ที่ active ซึ่ง Alibaba ก็ยังไม่ได้ยืนยันในเอกสารสเปกเช่นกัน
• ความเร็วในการให้บริการ — Qwen 3.8 Max ที่ 38.8 โทเค็นเอาต์พุตต่อวินาที โดยใช้เวลา 3.08 วินาทีถึงโทเค็นแรก ตามข้อมูลของ Artificial Analysis; Grok 4.7 ถูกวางตำแหน่งโดย SpaceXAI ว่าเร็วกว่าโมเดลที่เทียบเคียงได้ประมาณสองเท่า ซึ่งเป็นข้อมูลที่ผู้ขายรายงาน โดยยังไม่มีตัวเลขปริมาณงานที่เป็นอิสระเผยแพร่ออกมา

ความแตกต่างของบริบทคือการตัดสินใจที่แท้จริง
เมื่อราคาและความสามารถเท่ากัน การตัดสินใจจะขึ้นอยู่กับสิ่งอื่นที่แตกต่างออกไป และในกรณีนี้ก็คือบริบท การเพิ่มหน้าต่างจาก 500,000 เป็นประมาณ 984,000 โทเคนไม่ใช่แค่รายละเอียดสวยหรูบนสเปกชีต — มันคือความต่างระหว่างการแบ่งรีโพซิทอรีออกเป็นชิ้นกับการถือมันไว้ทั้งหมด
หน้าต่างที่ยาวขึ้นของ Qwen 3.8 Max มาพร้อมข้อควรระวังที่ระบุไว้ในเอกสาร ซึ่งสำคัญสำหรับผู้ซื้อ: เวอร์ชัน open-weights ที่ Alibaba ประกาศสำหรับสัปดาห์ของวันที่ 10 สิงหาคม 2026 เป็นแบบข้อความล้วน และไม่ได้รวมบริบทขนาดหนึ่งล้านโทเคนเต็มรูปแบบ นั่นไม่ส่งผลกระทบต่อเอนด์พอยต์แบบโฮสต์ที่การเปรียบเทียบนี้กล่าวถึง แต่ก็ควรทราบไว้หากคุณกำลังวางแผนโดยอิงกับการเปิดตัวแบบเปิด
มีข้อควรพิจารณาประการที่สองในฝั่งของ Grok ตระกูล Grok ในอดีตเคยใช้โครงสร้างราคาแบบหน้าผาที่ 200,000 โทเคนอินพุต โดยคำขอที่ข้ามเกณฑ์ดังกล่าวจะถูกคิดราคาทั้งคำขอใหม่ในอัตราสองเท่า — ขาเข้า $4 และขาออก $12 ด้วยหน้าต่าง 500,000 โทเคน เกณฑ์นั้นจึงอยู่ลึกภายในช่วงการทำงานของโมเดลอย่างมาก ก่อนกำหนดเส้นทางงานบริบทขนาดยาวไปยัง Grok 4.7 โปรดตรวจสอบตารางราคาปัจจุบันของโมเดลที่ติดตั้งใช้งาน เพราะปฏิสัมพันธ์ระหว่างหน้าต่างขนาดใหญ่กับหน้าผาการคิดราคาใหม่คือจุดที่ค่าใช้จ่ายสำหรับบริบทขนาดยาวมักผิดพลาด
ค่าใช้จ่ายสำหรับงานหนึ่งเดือนในแต่ละแห่ง
เนื่องจากอัตราที่ประกาศนั้นเท่ากัน การเปรียบเทียบต้นทุนจึงต้องสร้างจากพฤติกรรมการใช้โทเคน แทนที่จะสร้างจากตารางอัตราค่าใช้จ่าย และตรงจุดนั้นโมเดลทั้งสองแตกต่างกันในลักษณะที่วัดได้
Artificial Analysis วัดได้ว่า Grok 4.7 สร้างโทเคนเอาต์พุต 240 ล้านโทเคนขณะรัน Intelligence Index เทียบกับค่ามัธยฐานที่ 92 ล้านโทเคนในบรรดาโมเดลบนบอร์ด — มันเป็นโมเดลให้เหตุผลที่ช่างพูด Qwen 3.8 Max สร้างโทเคนเอาต์พุต 190 ล้านโทเคนในดัชนีเดียวกัน โดยมีต้นทุนการประเมินรวม $4,934.79 และวัดความเร็วได้ 38.8 โทเคนต่อวินาที ทั้งสองสูงกว่าค่ามัธยฐานด้านความช่างพูดอย่างมาก และ Grok 4.7 ช่างพูดมากกว่าในสองตัวนี้
ดังนั้น ด้วยราคา $6 ต่อล้านโทเค็นเอาต์พุตที่เท่ากัน โมเดลที่ปล่อยโทเค็นต่องานมากกว่าจะมีต้นทุนต่องานสูงกว่า ตัวเลขความยืดยาวของคำตอบ (verbosity) ที่เผยแพร่ชี้ว่า Grok 4.7 จะใช้โทเค็นเอาต์พุตมากขึ้นสำหรับงาน index ที่เทียบเท่ากัน ซึ่งหมายความว่าการเสมอกันด้านราคาจริง ๆ แล้วเป็นชัยชนะเล็ก ๆ ของ Qwen 3.8 Max ในด้านต้นทุนต่องาน — ถูกชดเชยด้วยข้อได้เปรียบด้านความเร็วที่ Grok 4.7 อ้าง ซึ่งย่นเวลาตามนาฬิกา (wall-clock time) และดังนั้นจึงลดต้นทุนมนุษย์ในการรอการรันเอเจนต์ ไม่มีปัจจัยชดเชยใดในสองอย่างนี้ที่มองเห็นได้บนตารางราคา และทั้งคู่ควรค่าแก่การวัดจากทราฟฟิกของคุณเองแทนที่จะสันนิษฐานเอา
ความไม่สมมาตรเพียงอย่างเดียวที่ไม่มีข้อโต้แย้งคือการแคช Qwen 3.8 Max ประกาศส่วนลดแคช 88% และอัตราเฉลี่ยถ่วงน้ำหนัก 1.18 ดอลลาร์ ที่สัดส่วนการใช้งานแคชฮิต/อินพุต/เอาต์พุต 7:2:1 สำหรับเวิร์กโหลดที่มีคำนำหน้าที่คงที่ขนาดใหญ่ เช่น พรอมป์ระบบ ส่วนหัวของโค้ดเบส ชุดเอกสาร ส่วนลดนั้นคือที่ที่ความประหยัดจริงอยู่ และควรตรวจสอบว่าเงื่อนไขแคชของ Grok 4.7 เปรียบเทียบกันอย่างไรก่อนที่คุณจะตัดสินใจใช้ปริมาณมาก

การเลือก เมื่อตัวเลขไม่ยอมเลือกแทนคุณ
คะแนน 46 กับ 45 บนดัชนีเดียวกัน ในราคาเดียวกัน ถือว่าใกล้เคียงกับการเสมอกันอย่างแท้จริงมากที่สุดเท่าที่บล็อกนี้มีโอกาสจะเผยแพร่ นั่นหมายความว่าการตัดสินใจควรอิงจากแกนที่โมเดลทั้งสองแตกต่างกันจริง ๆ และมีอยู่สี่แกน
เลือก Grok 4.7 หากงานของคุณคือการเขียนโค้ดแบบเอเจนต์และการรันคำสั่งบนเทอร์มินัล หากความเร็วตามเวลาจริงในการรันงานยาว ๆ สำคัญกว่าพื้นที่ context ที่มีให้ใช้ และหากคุณต้องการตัวปรับระดับการให้เหตุผลต่อคำขอเพื่อให้ทราฟฟิกที่ง่ายมีต้นทุนต่ำ เลือก Qwen 3.8 Max หากคุณต้องจัดการอินพุตที่ใหญ่กว่าครึ่งล้านโทเคนเป็นประจำ หากอินพุตวิดีโออยู่ในแผนงานของคุณ หากคุณต้องการส่วนลดแคช 88% สำหรับงานที่มี prefix จำนวนมาก หรือหากคุณต้องการโมเดลที่ผู้จำหน่ายเผยแพร่เมทริกซ์การประเมินที่กว้าง แทนที่จะกระจุกตัวอยู่ในด้านใดด้านหนึ่งเพียงด้านเดียว
ถ้าคำตอบที่ตรงไปตรงมาคือ "อย่างละครึ่ง" นั่นคือคำตอบปกติ และนั่นคือกรณีที่คู่นี้ถูกสร้างขึ้นมาเพื่อรองรับ Qwen 3.8 Max อยู่บน OrcaRouter ในราคาตามที่ Alibaba ประกาศ และ OrcaRouter ส่งต่อราคาตามที่ผู้ให้บริการประกาศโดยไม่บวกเพิ่ม 0% ดังนั้น $2/$6 ข้างต้นคือราคาที่คุณจ่ายจริง และการเปลี่ยนแปลงอัตราค่าบริการของผู้ให้บริการจะมีผลที่นี่ภายในวันเดียวกัน แทนที่จะรอถึงรอบต่ออายุ สัญญา API คีย์เดียวครอบคลุม Qwen 3.8 Max รวมถึงโมเดลอื่นอีกกว่า 200 รายการ ซึ่งหมายความว่าการตัดสินใจเรื่องคอนเท็กซ์กลายเป็นกฎการกำหนดเส้นทางต่อคำขอ แทนที่จะเป็นการผูกมัดกับแพลตฟอร์ม: ส่งอินพุตที่มีขนาดใหญ่เกินไปไปยังหน้าต่าง 984k และเก็บทุกอย่างที่เหลือไว้บนปลายทางใดก็ตามที่เร็วและถูกที่สุดสำหรับงานนั้น พร้อมการสลับสำรองอัตโนมัติหากผู้ให้บริการมีประสิทธิภาพลดลง ในกรณีที่งานจำเป็นต้องใช้ทั้งสองรูปแบบจริง ๆ — การอ่านคอนเท็กซ์ยาวตามด้วยรอบการทำงานแบบเอเจนต์ — DSL การกำหนดเส้นทางจะประกอบโมเดลเข้าด้วยกันเป็นคำขอเดียว แทนที่จะบังคับให้คุณเลือกข้างใดข้างหนึ่ง
มีข้อชี้แจงหนึ่งที่ควรกล่าวถึง เนื่องจากทั้งสองโมเดลไม่ได้เป็นแบบเปิด: ไม่มีส่วนใดในการเปรียบเทียบนี้ที่เกี่ยวข้องกับเวตที่สามารถดาวน์โหลดได้ ทั้งสองเป็นเอนด์พอยต์ที่โฮสต์ไว้ และการโฮสต์เองไม่ใช่ตัวเลือกสำหรับทั้งคู่
ตัวเลขหนึ่งเดียวที่ต้องจำไว้
สี่สิบหกต่อสี่สิบห้าไม่ใช่เหตุผลในการเลือกโมเดล และก็ไม่ควรเป็นเช่นนั้น สิ่งที่ตัดสินการเปรียบเทียบนี้คือหน้าต่างบริบท — 500,000 โทเค็น ต่อประมาณ 984,000 — และรูปแบบที่ผู้ขายแต่ละรายเลือก: Grok 4.7 ปรับให้เหมาะสมกับการทำงานแบบเอเจนต์ที่ยากให้เสร็จเร็ว ส่วน Qwen 3.8 Max ปรับให้เหมาะสมกับการจัดการกับอะไรก็ตามที่คุณมอบให้ ราคาเท่ากัน ความสามารถที่วัดได้เท่ากัน งานที่แตกต่างกัน นั่นคือการตัดสินใจด้านการจัดเส้นทาง และเป็นประเภทของการตัดสินใจที่ควรใช้เวลาหนึ่งบ่ายในการทดสอบ มากกว่าหนึ่งไตรมาสในการจัดซื้อ

การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
