การ์ดชื่อเรื่องหลักที่สร้างขึ้นสำหรับบทความชื่อ 'Grok 4.7 vs Qwen 3.8 Max — การโยนเหรียญบนกระดาษ' พร้อมคำโปรย 'ราคาเท่ากัน ห่างกันเพียงหนึ่งจุดดัชนี รูปร่างตรงกันข้าม' และชิปสถิติที่ระบุว่า AA Index 46 ต่อ 45 ราคา $2/$6 ทั้งคู่ และบริบท 500K ต่อ 984K
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max: ราคาเท่ากัน ต่างกันแค่หนึ่งคะแนน รูปทรงตรงกันข้าม

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

โมเดลเรือธงแบบปิดสองรุ่น ทั้งคู่ราคา 2 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 6 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน ทั้งคู่ได้คะแนนห่างกันไม่เกินหนึ่งจุดบนเกณฑ์มาตรฐานอิสระชุดเดียวกัน เปิดตัวห่างกันสิบเก้าวัน Grok 4.7 เปิดตัวเมื่อวันที่ 21 กันยายน 2026 จาก SpaceXAI; Qwen 3.8 Max เปิดตัวโดยผู้พัฒนาเมื่อวันที่ 3 สิงหาคม 2026 และรีเฟรชอีกครั้งเมื่อวันที่ 2 กันยายน 2026 บนดัชนี Artificial Analysis Intelligence Index ฉบับปัจจุบัน เวอร์ชัน v4.3.2 Grok 4.7 ได้คะแนน 46 และ Qwen 3.8 Max ได้คะแนน 45 ในแง่ราคาและความสามารถที่วัดได้ สองโมเดลนี้เป็นการซื้อแบบเดียวกัน ในทุกเรื่องอื่น — บริบท โมดัลลิตี ความเร็วในการให้บริการ ความเปิด และสิ่งที่ผู้พัฒนาแต่ละรายเลือกจะปรับให้เหมาะสม — ทั้งคู่แตกต่างกันอย่างสิ้นเชิง และนั่นคือสิ่งที่ทำให้การเปรียบเทียบนี้คุ้มค่าที่จะทำมากกว่าจะข้ามไป

ก่อนอื่น ไทม์ไลน์ เพราะ Qwen 3.8 Max มีสองวันที่

เรื่องนี้ทำให้การรายงานข่าวหลายแห่งสับสน จึงควรทำให้กระจ่างตั้งแต่ต้น Qwen 3.8 Max เปิดตัวเมื่อวันที่ 3 สิงหาคม 2026 ในฐานะโมเดลที่ใหญ่ที่สุดและมีความสามารถมากที่สุดของ Alibaba สร้างขึ้นจากสถาปัตยกรรม vision-language ของ Qwen 3.5 บนการออกแบบ sparse mixture-of-experts ที่มีรายงานว่ามีพารามิเตอร์รวม 2.4 ล้านล้านตัว โดยมี 95 พันล้านตัวที่ทำงานต่อโทเคน เมื่อวันที่ 2 กันยายน 2026 Alibaba ได้ปล่อยบิลด์ปรับปรุงใหม่ — รีวิชัน 0902 ซึ่งเป็นเวอร์ชันที่ใช้ model IDs ปัจจุบัน และเป็นเวอร์ชันที่ Artificial Analysis ระบุวันที่ในหน้าเพจของตน หากคุณเคยเห็นทั้งวันที่ในเดือนสิงหาคมและกันยายนสำหรับ Qwen 3.8 Max นั่นคือสาเหตุ: หนึ่งคือการเปิดตัว อีกหนึ่งคือรีวิชันที่คนส่วนใหญ่เรียกกันจริงในตอนนี้

Grok 4.7 มีประวัติที่เรียบร้อยกว่า และมีอีกประวัติที่ยุ่งเหยิงกว่าอยู่เบื้องหลัง SpaceXAI เปิดตัวมันเมื่อวันที่ 21 กันยายน 2026 หลังกำหนดเปิดตัวที่เลื่อนออกไปซ้ำแล้วซ้ำเล่า — มัสก์เคยชี้ไปที่กรอบเวลาในช่วงปลายเดือนสิงหาคม ต้นเดือนกันยายน และกลางเดือนกันยายน ก่อนที่โมเดลจะถูกปล่อยจริง การเปิดตัวครั้งนี้เองมีขอบเขตแคบ: โมเดลฐานที่ใหญ่กว่า Grok 4.6, การรัน reinforcement learning ที่ยาวนานขึ้นซึ่งมุ่งเป้าไปที่งานที่ใช้เวลาหลายชั่วโมง และไม่มีการเปลี่ยนแปลงเรตการ์ด $2/$6 ที่ Grok 4.6 ใช้มาตั้งแต่วันที่ 12 สิงหาคม

ผู้ให้บริการแต่ละรายปรับให้เหมาะกับอะไร

อ่านประกาศเปิดตัวทั้งสองฉบับควบเป็นคู่ แล้วจะเห็นว่าการเดิมพันด้านการออกแบบแทบจะตรงข้ามกันอย่างสมบูรณ์

SpaceXAI ถูกปรับให้เหมาะกับการทำงานแบบเอเจนต์ ตัวเลขที่ผู้ขายรายงานของ Grok 4.7 กระจุกตัวอยู่ในงานเทอร์มินัลและงานในที่เก็บโค้ด: Terminal-Bench 4.0 อยู่ที่ 38.0% เทียบกับ 20.3% ของ Grok 4.6, CursorBench 4.0 อยู่ที่ 46.3%, DeepSWE v1.1 อยู่ที่ 71.0% เมื่อใช้ความพยายามในการให้เหตุผลระดับสูง, EEBench อยู่ที่ 64.0% คำอธิบายการเปิดตัวของบริษัทเองระบุเป้าหมายว่าเป็นการตรวจสอบตนเองและการจัดการบริบทแบบยาวภายในสภาพแวดล้อม Grok Bot Grok 4.7 ให้หน้าต่างบริบท 500,000 โทเค็น รับข้อความและรูปภาพเข้า ส่งออกเป็นข้อความ และเปิดให้ปรับระดับความพยายามในการให้เหตุผลตั้งแต่ low ถึง xhigh มันเป็นโมเดลที่สร้างมาเพื่อทำงานให้เสร็จ

Alibaba ปรับแต่งมาเพื่อความครอบคลุม Qwen 3.8 Max มีหน้าต่างบริบท (context window) ประมาณ 984,000 โทเคน — เท่ากับหนึ่งล้านโดยพฤตินัย — และจุดแข็งที่เปิดเผยนั้นเป็นความกว้างมากกว่าความลึกในด้านใดด้านหนึ่ง: คะแนน Terminal Bench 2.1 ที่ 86.6, SWE-bench Pro ที่ 67.7, PaperBench ที่ 93.0, GPQA Diamond ที่ 92.6, MMMU-Pro ที่ 82.3, OSWorld-Verified ที่ 86.1 รองรับอินพุตทั้งข้อความ รูปภาพ และวิดีโอ แล้วส่งคืนเป็นข้อความ รองรับระดับความพยายามในการคิด (reasoning effort) โดยมี xhigh เป็นค่าเริ่มต้น และจุดที่อ่อนกว่าตามข้อมูลที่เปิดเผยคือ Humanity's Last Exam ที่ 43.6 มันเป็นโมเดลที่สร้างขึ้นมาเพื่อจัดการกับทุกสิ่งทุกอย่างที่คุณป้อนให้

ทุกตัวเลขในย่อหน้านั้นเป็นข้อมูลที่ผู้ขายรายงานเอง ทั้งสองชุดยังไม่ได้รับการทำซ้ำอย่างอิสระ และทั้งสองชุดก็ไม่สามารถนำมาเปรียบเทียบกันโดยตรงได้อยู่แล้ว เพราะ Terminal-Bench 2.1 และ Terminal-Bench 4.0 เป็นเบนช์มาร์กที่แตกต่างกัน ดังนั้น 86.6 ของ Qwen และ 38.0 ของ Grok จึงต้องไม่ถูกนำมาวางเคียงข้างกันเลย

• คะแนนรวมอิสระ — Grok 4.7 ได้ 46 บน AA Intelligence Index v4.3.2 เทียบกับ Qwen 3.8 Max ได้ 45 บนเวอร์ชันเดียวกัน ถือว่าเสมอกันทางสถิติ

• ราคาต่อล้านโทเคน — $2.00 ขาเข้า / $6.00 ขาออก ทั้งสองตัว ส่วนลดแคชของ Qwen ระบุไว้ที่ 88% ทำให้ได้อัตราเฉลี่ยรวม $1.18 ต่อล้านโทเคน ส่วนเงื่อนไขแคชของ Grok 4.7 ไม่ได้เผยแพร่บนพื้นฐานเดียวกัน

• หน้าต่างบริบท — Grok 4.7 500,000 โทเค็น เทียบกับ Qwen 3.8 Max ประมาณ 984,000 โทเค็น Qwen ชนะเกือบสองเท่า และนี่คือความแตกต่างด้านสเปกที่ใหญ่ที่สุดเพียงข้อเดียวระหว่างทั้งสอง

• รูปแบบอินพุต — Grok 4.7 ข้อความและรูปภาพ เทียบกับ Qwen 3.8 Max ข้อความ รูปภาพ และวิดีโอ

• ค่าน้ำหนัก — ทั้งคู่เป็นกรรมสิทธิ์เฉพาะ ไม่มีโมเดลใดสามารถดาวน์โหลดได้ ซึ่งตัดข้อโต้แย้งเรื่องน้ำหนักแบบเปิด (open-weights) ที่มักมีออกไปจากการเปรียบเทียบนี้โดยสิ้นเชิง

• พารามิเตอร์ — Grok 4.7 ไม่ถูกเปิดเผยในเอกสารสเปกของ SpaceXAI ฉบับใด (ตัวเลข ~2.1T เป็นคำกล่าวอ้างของมัสก์) เทียบกับ Qwen 3.8 Max ที่มีรายงานว่าอยู่ที่ 2.4T ทั้งหมด โดยมี 95B ที่ active ซึ่ง Alibaba ก็ยังไม่ได้ยืนยันในเอกสารสเปกเช่นกัน

• ความเร็วในการให้บริการ — Qwen 3.8 Max ที่ 38.8 โทเค็นเอาต์พุตต่อวินาที โดยใช้เวลา 3.08 วินาทีถึงโทเค็นแรก ตามข้อมูลของ Artificial Analysis; Grok 4.7 ถูกวางตำแหน่งโดย SpaceXAI ว่าเร็วกว่าโมเดลที่เทียบเคียงได้ประมาณสองเท่า ซึ่งเป็นข้อมูลที่ผู้ขายรายงาน โดยยังไม่มีตัวเลขปริมาณงานที่เป็นอิสระเผยแพร่ออกมา

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

ความแตกต่างของบริบทคือการตัดสินใจที่แท้จริง

เมื่อราคาและความสามารถเท่ากัน การตัดสินใจจะขึ้นอยู่กับสิ่งอื่นที่แตกต่างออกไป และในกรณีนี้ก็คือบริบท การเพิ่มหน้าต่างจาก 500,000 เป็นประมาณ 984,000 โทเคนไม่ใช่แค่รายละเอียดสวยหรูบนสเปกชีต — มันคือความต่างระหว่างการแบ่งรีโพซิทอรีออกเป็นชิ้นกับการถือมันไว้ทั้งหมด

หน้าต่างที่ยาวขึ้นของ Qwen 3.8 Max มาพร้อมข้อควรระวังที่ระบุไว้ในเอกสาร ซึ่งสำคัญสำหรับผู้ซื้อ: เวอร์ชัน open-weights ที่ Alibaba ประกาศสำหรับสัปดาห์ของวันที่ 10 สิงหาคม 2026 เป็นแบบข้อความล้วน และไม่ได้รวมบริบทขนาดหนึ่งล้านโทเคนเต็มรูปแบบ นั่นไม่ส่งผลกระทบต่อเอนด์พอยต์แบบโฮสต์ที่การเปรียบเทียบนี้กล่าวถึง แต่ก็ควรทราบไว้หากคุณกำลังวางแผนโดยอิงกับการเปิดตัวแบบเปิด

มีข้อควรพิจารณาประการที่สองในฝั่งของ Grok ตระกูล Grok ในอดีตเคยใช้โครงสร้างราคาแบบหน้าผาที่ 200,000 โทเคนอินพุต โดยคำขอที่ข้ามเกณฑ์ดังกล่าวจะถูกคิดราคาทั้งคำขอใหม่ในอัตราสองเท่า — ขาเข้า $4 และขาออก $12 ด้วยหน้าต่าง 500,000 โทเคน เกณฑ์นั้นจึงอยู่ลึกภายในช่วงการทำงานของโมเดลอย่างมาก ก่อนกำหนดเส้นทางงานบริบทขนาดยาวไปยัง Grok 4.7 โปรดตรวจสอบตารางราคาปัจจุบันของโมเดลที่ติดตั้งใช้งาน เพราะปฏิสัมพันธ์ระหว่างหน้าต่างขนาดใหญ่กับหน้าผาการคิดราคาใหม่คือจุดที่ค่าใช้จ่ายสำหรับบริบทขนาดยาวมักผิดพลาด

ค่าใช้จ่ายสำหรับงานหนึ่งเดือนในแต่ละแห่ง

เนื่องจากอัตราที่ประกาศนั้นเท่ากัน การเปรียบเทียบต้นทุนจึงต้องสร้างจากพฤติกรรมการใช้โทเคน แทนที่จะสร้างจากตารางอัตราค่าใช้จ่าย และตรงจุดนั้นโมเดลทั้งสองแตกต่างกันในลักษณะที่วัดได้

Artificial Analysis วัดได้ว่า Grok 4.7 สร้างโทเคนเอาต์พุต 240 ล้านโทเคนขณะรัน Intelligence Index เทียบกับค่ามัธยฐานที่ 92 ล้านโทเคนในบรรดาโมเดลบนบอร์ด — มันเป็นโมเดลให้เหตุผลที่ช่างพูด Qwen 3.8 Max สร้างโทเคนเอาต์พุต 190 ล้านโทเคนในดัชนีเดียวกัน โดยมีต้นทุนการประเมินรวม $4,934.79 และวัดความเร็วได้ 38.8 โทเคนต่อวินาที ทั้งสองสูงกว่าค่ามัธยฐานด้านความช่างพูดอย่างมาก และ Grok 4.7 ช่างพูดมากกว่าในสองตัวนี้

ดังนั้น ด้วยราคา $6 ต่อล้านโทเค็นเอาต์พุตที่เท่ากัน โมเดลที่ปล่อยโทเค็นต่องานมากกว่าจะมีต้นทุนต่องานสูงกว่า ตัวเลขความยืดยาวของคำตอบ (verbosity) ที่เผยแพร่ชี้ว่า Grok 4.7 จะใช้โทเค็นเอาต์พุตมากขึ้นสำหรับงาน index ที่เทียบเท่ากัน ซึ่งหมายความว่าการเสมอกันด้านราคาจริง ๆ แล้วเป็นชัยชนะเล็ก ๆ ของ Qwen 3.8 Max ในด้านต้นทุนต่องาน — ถูกชดเชยด้วยข้อได้เปรียบด้านความเร็วที่ Grok 4.7 อ้าง ซึ่งย่นเวลาตามนาฬิกา (wall-clock time) และดังนั้นจึงลดต้นทุนมนุษย์ในการรอการรันเอเจนต์ ไม่มีปัจจัยชดเชยใดในสองอย่างนี้ที่มองเห็นได้บนตารางราคา และทั้งคู่ควรค่าแก่การวัดจากทราฟฟิกของคุณเองแทนที่จะสันนิษฐานเอา

ความไม่สมมาตรเพียงอย่างเดียวที่ไม่มีข้อโต้แย้งคือการแคช Qwen 3.8 Max ประกาศส่วนลดแคช 88% และอัตราเฉลี่ยถ่วงน้ำหนัก 1.18 ดอลลาร์ ที่สัดส่วนการใช้งานแคชฮิต/อินพุต/เอาต์พุต 7:2:1 สำหรับเวิร์กโหลดที่มีคำนำหน้าที่คงที่ขนาดใหญ่ เช่น พรอมป์ระบบ ส่วนหัวของโค้ดเบส ชุดเอกสาร ส่วนลดนั้นคือที่ที่ความประหยัดจริงอยู่ และควรตรวจสอบว่าเงื่อนไขแคชของ Grok 4.7 เปรียบเทียบกันอย่างไรก่อนที่คุณจะตัดสินใจใช้ปริมาณมาก

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

การเลือก เมื่อตัวเลขไม่ยอมเลือกแทนคุณ

คะแนน 46 กับ 45 บนดัชนีเดียวกัน ในราคาเดียวกัน ถือว่าใกล้เคียงกับการเสมอกันอย่างแท้จริงมากที่สุดเท่าที่บล็อกนี้มีโอกาสจะเผยแพร่ นั่นหมายความว่าการตัดสินใจควรอิงจากแกนที่โมเดลทั้งสองแตกต่างกันจริง ๆ และมีอยู่สี่แกน

เลือก Grok 4.7 หากงานของคุณคือการเขียนโค้ดแบบเอเจนต์และการรันคำสั่งบนเทอร์มินัล หากความเร็วตามเวลาจริงในการรันงานยาว ๆ สำคัญกว่าพื้นที่ context ที่มีให้ใช้ และหากคุณต้องการตัวปรับระดับการให้เหตุผลต่อคำขอเพื่อให้ทราฟฟิกที่ง่ายมีต้นทุนต่ำ เลือก Qwen 3.8 Max หากคุณต้องจัดการอินพุตที่ใหญ่กว่าครึ่งล้านโทเคนเป็นประจำ หากอินพุตวิดีโออยู่ในแผนงานของคุณ หากคุณต้องการส่วนลดแคช 88% สำหรับงานที่มี prefix จำนวนมาก หรือหากคุณต้องการโมเดลที่ผู้จำหน่ายเผยแพร่เมทริกซ์การประเมินที่กว้าง แทนที่จะกระจุกตัวอยู่ในด้านใดด้านหนึ่งเพียงด้านเดียว

ถ้าคำตอบที่ตรงไปตรงมาคือ "อย่างละครึ่ง" นั่นคือคำตอบปกติ และนั่นคือกรณีที่คู่นี้ถูกสร้างขึ้นมาเพื่อรองรับ Qwen 3.8 Max อยู่บน OrcaRouter ในราคาตามที่ Alibaba ประกาศ และ OrcaRouter ส่งต่อราคาตามที่ผู้ให้บริการประกาศโดยไม่บวกเพิ่ม 0% ดังนั้น $2/$6 ข้างต้นคือราคาที่คุณจ่ายจริง และการเปลี่ยนแปลงอัตราค่าบริการของผู้ให้บริการจะมีผลที่นี่ภายในวันเดียวกัน แทนที่จะรอถึงรอบต่ออายุ สัญญา API คีย์เดียวครอบคลุม Qwen 3.8 Max รวมถึงโมเดลอื่นอีกกว่า 200 รายการ ซึ่งหมายความว่าการตัดสินใจเรื่องคอนเท็กซ์กลายเป็นกฎการกำหนดเส้นทางต่อคำขอ แทนที่จะเป็นการผูกมัดกับแพลตฟอร์ม: ส่งอินพุตที่มีขนาดใหญ่เกินไปไปยังหน้าต่าง 984k และเก็บทุกอย่างที่เหลือไว้บนปลายทางใดก็ตามที่เร็วและถูกที่สุดสำหรับงานนั้น พร้อมการสลับสำรองอัตโนมัติหากผู้ให้บริการมีประสิทธิภาพลดลง ในกรณีที่งานจำเป็นต้องใช้ทั้งสองรูปแบบจริง ๆ — การอ่านคอนเท็กซ์ยาวตามด้วยรอบการทำงานแบบเอเจนต์ — DSL การกำหนดเส้นทางจะประกอบโมเดลเข้าด้วยกันเป็นคำขอเดียว แทนที่จะบังคับให้คุณเลือกข้างใดข้างหนึ่ง

มีข้อชี้แจงหนึ่งที่ควรกล่าวถึง เนื่องจากทั้งสองโมเดลไม่ได้เป็นแบบเปิด: ไม่มีส่วนใดในการเปรียบเทียบนี้ที่เกี่ยวข้องกับเวตที่สามารถดาวน์โหลดได้ ทั้งสองเป็นเอนด์พอยต์ที่โฮสต์ไว้ และการโฮสต์เองไม่ใช่ตัวเลือกสำหรับทั้งคู่

ตัวเลขหนึ่งเดียวที่ต้องจำไว้

สี่สิบหกต่อสี่สิบห้าไม่ใช่เหตุผลในการเลือกโมเดล และก็ไม่ควรเป็นเช่นนั้น สิ่งที่ตัดสินการเปรียบเทียบนี้คือหน้าต่างบริบท — 500,000 โทเค็น ต่อประมาณ 984,000 — และรูปแบบที่ผู้ขายแต่ละรายเลือก: Grok 4.7 ปรับให้เหมาะสมกับการทำงานแบบเอเจนต์ที่ยากให้เสร็จเร็ว ส่วน Qwen 3.8 Max ปรับให้เหมาะสมกับการจัดการกับอะไรก็ตามที่คุณมอบให้ ราคาเท่ากัน ความสามารถที่วัดได้เท่ากัน งานที่แตกต่างกัน นั่นคือการตัดสินใจด้านการจัดเส้นทาง และเป็นประเภทของการตัดสินใจที่ควรใช้เวลาหนึ่งบ่ายในการทดสอบ มากกว่าหนึ่งไตรมาสในการจัดซื้อ

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

การเปรียบเทียบในบทความนี้3

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube