การ์ดหัวเรื่องแบบฮีโร่สำหรับ 'Qwen3.8-Max vs Qwen 3.8' พร้อมคำบรรยาย 'คอร์เดี่ยว 2.4T — API เช่าหรือน้ำหนักโมเดลแบบเปิด' มีแบดจ์สำหรับการรีเฟรช 0902 เมื่อวันที่ 2 กันยายน 2026, API แบบโฮสต์ในราคา $2/$6 ต่อ 1M โทเคน และน้ำหนักโมเดลแบบเปิดเมื่อวันที่ 12 สิงหาคม และส่วนท้ายระบุว่า Code Arena WebDev #1 แบบประเมินอิสระที่ 1,691 สำหรับบิลด์ 0902 ขณะที่เช็คพอยต์แบบเปิดยังไม่มีคะแนนประเมินอิสระ
Guides & Insights

Qwen3.8-Max เทียบกับ Qwen 3.8: คอร์ 2.4T หนึ่งตัว เช่าหรือรัน — หลังการรีเฟรช 0902

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 2 กันยายน 2026 Alibaba ได้ปล่อยรุ่นรีเฟรชแบบระบุวันที่ของ Qwen3.8-Max — ซึ่งเป็นบิลด์ที่มันกำหนดให้เป็น Qwen3.8-Max-0902 — และในสัปดาห์เดียวกัน ลีดเดอร์บอร์ดอิสระด้านการเขียนโค้ดก็จัดให้สแนปชอตใหม่อยู่ที่อันดับ 1 เวอร์ชันที่ดาวน์โหลดได้ของแกนหลักขนาด 2.4 ล้านล้านพารามิเตอร์เดียวกันนี้ ซึ่งเป็นโมเดลที่คนส่วนใหญ่หมายถึงเมื่อเขียนว่า "Qwen 3.8" โดยไม่มีคำต่อท้าย ยังคงหยุดอยู่ที่เช็กพอยต์วันที่ 12 สิงหาคม: รองรับเฉพาะข้อความ โหมด reasoning ถูกล็อกให้เปิดอยู่ และยังใหญ่เกินกว่าจะรันบนอะไรก็ตามที่เล็กกว่าแร็ก GPU ได้อยู่หลายร้อยกิกะไบต์ ช่องว่างดังกล่าวระหว่างรุ่นเรือธงแบบโฮสต์กับรุ่น open weights ไม่ได้มีอยู่จริงในเดือนสิงหาคม แต่ตอนนี้มันกลายเป็นแก่นของการเปรียบเทียบทั้งหมด และเป็นเหตุผลที่โมเดลตัวเดียวกันนี้ยังคงถูกขายให้คุณภายใต้สองชื่อ

Qwen3.8-Max คือเรือธงที่ Alibaba ให้บริการแบบโฮสต์: โมเดล sparse mixture-of-experts ที่มีพารามิเตอร์ 2.4 ล้านล้านตัว โดยมีพารามิเตอร์ประมาณ 95 พันล้านตัวทำงานต่อโทเคน ให้บริการผ่าน API แบบคิดค่าบริการตั้งแต่วันที่ 3 สิงหาคม และมาพร้อมหน้าต่างบริบทมัลติโมดัลขนาด 1 ล้านโทเคน Qwen 3.8 เมื่อมองในฐานะชื่อเดี่ยว ๆ คือเวอร์ชันเปิดเผยของเจเนอเรชันเดียวกัน ซึ่งที่มีนัยสำคัญที่สุดคือ Qwen3.8-2.4T-A95B ซึ่งเป็นชุดน้ำหนักที่ Alibaba เผยแพร่เมื่อวันที่ 12 สิงหาคมภายใต้ไลเซนส์แบบกำหนดเอง พวกมันไม่ใช่รุ่นที่ถูกกว่าและรุ่นที่แพงกว่า พวกมันคือสมองเดียวกันที่ขายผ่านสองรูปแบบ และการปรับหลังการเทรนรอบเดือนกันยายนได้เริ่มทำให้สองรูปแบบการส่งมอบนี้แยกออกจากกัน บทความนี้จะช่วยจัดระเบียบว่าคุณกำลังมอง "Qwen 3.8" แบบใดอยู่จริง อัปเดต 0902 เปลี่ยนอะไรบ้าง และวันนี้คุณควรใช้เส้นทางไหน—เช่า API หรือรันน้ำหนักโมเดลเอง

การจับคู่ที่ไม่ใช่การแข่งขัน

ก่อนที่จะพูดถึงวันที่และตารางอัตราค่าบริการ ขอพูดถึงสถาปัตยกรรมก่อน: Qwen3.8-Max และ Qwen3.8-2.4T-A95B ใช้การออกแบบ MoE แบบละเอียดร่วมกัน โดยมี 512 เอ็กซ์เพิร์ตต่อเลเยอร์ (10 routed บวก 1 shared ต่อเลเยอร์), 92 เลเยอร์ และสแตกแบบไฮบริดที่ 69 จาก 92 เลเยอร์ใช้ linear attention — Gated DeltaNet รวมกับ gated attention — โดยมี full attention แทรกอยู่เป็นระยะเพื่อรองรับงานที่ต้องใช้บริบทยาว นี่คือเหตุผลที่การ์ดโมเดลสามารถอ้างบริบทล้านโทเค็นบน API และเหตุผลที่บิลด์แบบเปิดเข้าถึง 262K ในตัว ซึ่งขยายไปถึงล้านได้ด้วยคอนฟิกการเซิร์ฟที่เหมาะสม ความแตกต่างระหว่างสองชื่อนี้ไม่ได้อยู่ที่สถาปัตยกรรมของน้ำหนัก แต่อยู่ที่ขอบ และขอบเหล่านั้นก็ขยับไปแล้วตั้งแต่วันที่ 2 กันยายน

พารามิเตอร์ — {{1}}Qwen3.8-Max: รวม 2.4T / แอ็กทีฟ ~95B{{/1}}, {{2}}MoE{{/2}}. Qwen3.8-2.4T-A95B: แกนหลักเดียวกัน จำนวนแอ็กทีฟเท่ากัน

• การส่งมอบ — {{1}}Qwen3.8-Max{{/1}}: API แบบโฮสต์ เปิดให้บริการตั้งแต่วันที่ 3 สิงหาคม อัปเดตเป็น {{2}}Qwen3.8-Max-0902{{/2}} เมื่อวันที่ 2 กันยายน {{3}}Qwen3.8-2.4T-A95B{{/3}}: น้ำหนักที่ดาวน์โหลดได้ เผยแพร่ครั้งแรกเมื่อวันที่ 12 สิงหาคม ไม่มี checkpoint ที่ใหม่กว่านี้ตั้งแต่นั้นมา

• โมดาลิตี้ — Qwen3.8-Max: รองรับอินพุตข้อความ รูปภาพ และวิดีโอ Qwen3.8-2.4T-A95B: รองรับเฉพาะข้อความ

• การควบคุมการใช้เหตุผล — Qwen3.8-Max: สามารถสลับโหมดการคิดได้ รวมถึงโหมดที่ไม่คิด Qwen3.8-2.4T-A95B: เปิดใช้การคิดตลอดเวลา โดยมีเพียงแค่ตัวปรับระดับความพยายามในการใช้เหตุผล (ต่ำ / สูง / สูงเป็นพิเศษ)

เครื่องมือ — Qwen3.8-Max: รองรับการเรียกใช้ฟังก์ชันแบบเนทีฟ เครื่องมือในตัวห้าชนิด และเอาต์พุตแบบมีโครงสร้าง ส่วน Qwen3.8-2.4T-A95B: ไม่มีเลเยอร์เครื่องมือแบบเนทีฟ สิ่งที่คุณจะได้ขึ้นอยู่กับเฟรมเวิร์กการอนุมานที่คุณใช้ให้บริการ

การรีเฟรชวันที่ 2 กันยายนเปลี่ยนแปลงอะไร

บิลด์ 0902 เป็นการฝึกหลังการเทรนเพิ่มเติมรอบหนึ่ง ไม่ใช่สถาปัตยกรรมใหม่ อาลีบาบามุ่งเป้าไปที่สองสิ่งที่ Qwen3.8-Max ขึ้นชื่ออยู่แล้ว นั่นคือการเขียนโค้ดและ "cowork" ซึ่งเป็นชื่อที่ใช้เรียกงานแบบเอเจนต์ที่กินระยะเวลายาวและงานสำนักงาน และตัวเลขที่รายล้อมบิลด์นี้ก็คือเหตุผลว่าทำไมการรีเฟรชครั้งนี้ถึงสำคัญ บนกระดานผู้นำ Code Arena: WebDev ซึ่งเป็นแพลตฟอร์มอิสระ Qwen3.8-Max-0902 ประเดิมที่ Elo 1,691 เพิ่มขึ้น 22 จุดจากบิลด์ก่อนหน้า และมากพอจะคว้าอันดับหนึ่งได้ตั้งแต่เปิดตัว อาลีบาบายังนำเสนอบิลด์นี้ว่าเป็นโมเดลที่ได้คะแนนสูงสุดบนเส้นพาเรโตด้านต้นทุน-ประสิทธิภาพของกระดานนั้น ที่อัตราผสมประมาณ 5 ดอลลาร์ต่อล้านโทเคน โดยถ่วงน้ำหนักจากราคาป้าย 2 และ 6 ดอลลาร์ด้วยทราฟฟิกแบบเอเจนต์ที่เน้นเอาต์พุตหนัก ซึ่งคิดเป็นประมาณหนึ่งในสี่ของต้นทุนการเรียกใช้โมเดลระดับแนวหน้าที่เทียบเคียงได้ในที่อื่น ตัวเลขเหล่านี้เป็นข้อมูลผสมที่ผู้อ่านควรแยกแยะให้ถูกต้อง: ค่า Elo 1,691 เป็นผลจากอารีนาอิสระ ส่วนการนำเสนอในกรอบเส้นพาเรโตนั้นเป็นการตีความของอาลีบาบาเองต่อกระดานอิสระดังกล่าว

ผลการประเมินภายในของ Alibaba สำหรับรอบ 0902 ซึ่งรายงานโดยผู้ขายและยังไม่ถูกจำลองซ้ำ แสดงแนวโน้มเดียวกัน: Terminal-Bench 3.0 เพิ่มขึ้นจาก 11.3 เป็น 29.0, ProgramBench จาก 10.5 เป็น 28.0, JobBench จาก 53.4 เป็น 64.0 และ WorkArena Elo จาก 1,348 เป็น 1,468 อ่านตัวเลขเหล่านั้นว่า "การรีเฟรชครั้งนี้ขยับแกน agentic และ coding" ไม่ใช่ในฐานะคะแนนที่ได้รับการยืนยันแล้ว ในด้านความฉลาดทั่วไป ดัชนี Intelligence Index ของ Artificial Analysis ให้ Qwen3.8-Max อยู่ที่ 56 — แข่งขันได้ แต่ไม่ใช่เหตุผลที่จะเลือกใช้มัน; ผลลัพธ์ด้าน coding และ agentic ต่างหากที่เป็นเหตุผล

ส่วนที่บทความส่วนใหญ่พลาดไปคือ การ post-training ของรุ่น 0902 นั้น ในขณะที่เขียนข้อความนี้ ใช้งานได้ผ่าน API เท่านั้น Alibaba ยังไม่ได้เผยแพร่ checkpoint แบบเปิดของโมเดลที่รีเฟรชใหม่ — น้ำหนัก Qwen3.8-2.4T-A95B บน Hugging Face ยังคงย้อนไปถึงรุ่นที่เผยแพร่เมื่อวันที่ 12 สิงหาคม นั่นหมายความว่า Qwen3.8-Max ที่โฮสต์ไว้กับโมเดลหลักที่ดาวน์โหลดได้นั้นไม่ใช่โมเดลเดียวกันอีกต่อไปในแบบที่เคยเป็นช่วงกลางเดือนสิงหาคม API มี post-training ของเดือนกันยายน แต่น้ำหนักไม่มี หากเหตุผลทั้งหมดของคุณที่ใช้รุ่นเปิดเผยคือเพื่อจำลองสิ่งที่รุ่นเรือธงทำได้อย่างแม่นยำ สมมติฐานนั้นก็ไม่เป็นความจริงอีกต่อไปอย่างเงียบ ๆ ตั้งแต่วันที่ 2 กันยายน

A comparison scoreboard for Qwen3.8-Max (0902) and Qwen 3.8 (2.4T-A95B open): left column shows Hosted API with a Sep-2 build tag, Text + image + video, 1M native context, a thinking toggle including off, native tools and JSON, and $2/$6 per 1M with a $0.25 cache tag; right column shows Open weights with an Aug-12 tag, Text only, 262K native context, thinking always on, framework-level tools and JSON, and weights plus your own GPUs; the footer notes independent Code Arena WebDev 1,691 and AA Index 56 for the Max, and that the open checkpoint has no independent scores yet.

ห้าจุดที่พวกเขาแตกต่างกันอย่างแท้จริง

เมื่อมองข้ามสถาปัตยกรรมที่ใช้ร่วมกันไป ความแตกต่างในทางปฏิบัติก็เรียงลำดับได้อย่างชัดเจน ตัวกรองแรกคือ modality: หากเวิร์กโหลดของคุณมีรูปภาพหรือวิดีโอ เช่น ภาพหน้าจอ แผนภูมิ เอกสารที่มีภาพประกอบ หรือเฟรมวิดีโอ มีเพียง Qwen3.8-Max เท่านั้นที่รองรับข้อมูลเหล่านี้ และหน้าต่างบริบทขนาด 1M โทเคนของมันเป็นแบบเนทีฟ (native) ไม่ใช่ส่วนขยาย ส่วนโมเดลแบบ open weights รองรับเฉพาะข้อความเท่านั้น ตัวกรองที่สองคือการควบคุมการใช้เหตุผล (reasoning): API แบบโฮสต์สามารถรันโดยปิดการคิดได้ ซึ่งสำคัญต่องานสกัดข้อมูลที่ไวต่อความหน่วงและมีปริมาณมาก เพราะการคิดเป็นขั้นตอน (chain of thought) ถือเป็นค่าใช้จ่ายที่เกินจำเป็นโดยสิ้นเชิง ส่วนโมเดลแบบ open build ไม่สามารถปิดการคิดนี้ได้ ตัวกรองที่สามคือชุดเครื่องมือ (tooling): function calling เครื่องมือในตัวห้าอย่าง และโหมด JSON ล้วนเป็นส่วนหนึ่งของผลิตภัณฑ์แบบโฮสต์ ขณะที่ open build ต้องพึ่งพาสิ่งที่เลเยอร์ serving ของคุณมีให้

บริบทมีความละเอียดอ่อนกว่าที่สเปกชีตระบุไว้ ทั้งสองฝั่งรองรับได้ประมาณหนึ่งล้านโทเคน แต่โมเดลแบบโฮสต์ทำได้ในตัวด้วยอินพุตมัลติโมดัล ในขณะที่บริทดั้งเดิม 262K ของเวอร์ชันโอเพนต้องถูกขยายผ่านการตั้งค่า และทุกโทเคนในหน้าต่างที่ขยายออกไปนั้นเป็นข้อความล้วน ขีดจำกัดเอาต์พุตก็ต่างกันด้วย — API อนุญาตให้ส่งออกได้สูงสุดประมาณ 131K โทเคน และเวอร์ชันโอเพนโดยทั่วไปถูกตั้งค่าให้มีเพดานใกล้เคียงกัน แต่เพดานที่ใช้งานได้จริงในฝั่งโอเพนนั้นถูกกำหนดโดย serving stack ของคุณ ไม่ใช่โดยตัวโมเดล

แต่ละเส้นทางมีค่าใช้จ่ายจริงเท่าไร

ณ จุดนี้เองที่การส่งมอบทั้งสองแบบไม่สามารถเทียบกันได้อีกต่อไป Qwen3.8-Max มีราคาตามประกาศ (list price) คือ $2.00 ต่อโทเคนอินพุตหนึ่งล้านตัว, $6.00 ต่อโทเคนเอาต์พุตหนึ่งล้านตัว และ $0.25 ต่อโทเคนอินพุตที่ถูกแคชหนึ่งล้านตัว เนื่องจาก OrcaRouter ส่งผ่านราคาตามประกาศของผู้ให้บริการโดยไม่บวกเพิ่ม (0% markup) คุณจึงจ่ายในอัตรานี้ที่นี่ และเมื่อ Alibaba เปลี่ยนราคา ตัวเลขใหม่ก็จะมีผลจริงในวันเดียวกัน สแนปช็อต 0902 ถูกตรึงแยกไว้ในชื่อ qwen/qwen3.8-max-0902 สำหรับทีมที่ต้องการให้พฤติกรรมของโมเดลสามารถทำซ้ำได้ โดยยังคงราคาและความสามารถเท่าเดิม แต่เป็น checkpoint แบบคงที่ แทนที่จะเป็นโมเดลที่อัปเดตไปเรื่อย ๆ จากทราฟฟิกบน OrcaRouter ค่ามัธยฐานของ time-to-first-token ในช่วง 7 วันที่ผ่านมาสำหรับ Qwen3.8-Max อยู่ที่ประมาณ 2–4 วินาที ส่วน Artificial Analysis วัดอัตราการสร้างโทเคนเอาต์พุตได้ราว 45–48 โทเคนต่อวินาที ซึ่งไม่จัดว่าช้า แต่ให้คำตอบที่เยิ่นเย้อ (verbose) จึงไม่น่าแปลกใจที่งานแบบ agentic บนโมเดลนี้จะเผาผลาญโทเคนไปจำนวนมากอย่างน่าประหลาดใจ แม้อัตราค่าบริการต่อโทเคนจะถูกก็ตาม

A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the flagship description, the price card at $2.00 per 1M input and $6.00 per 1M output tokens, a 1,000,000-token context window, and 7-day median time-to-first-token and traffic figures.

Qwen3.8-2.4T-A95B ไม่มีการกำหนดราคาไว้ เพราะราคาที่แท้จริงคือโครงสร้างพื้นฐานของคุณเอง น้ำหนักแบบ BF16 มีขนาดรวมราว 4.9 TB และแม้แต่บิลด์ FP8 อย่างเป็นทางการก็ยังมีขนาดราว 2.4 TB ดังนั้นมันจึงเป็นฮาร์ดแวร์ระดับแร็ค กล่าวคือ การกำหนดค่าการให้บริการที่เล็กที่สุดตามที่บันทึกไว้ต้องเริ่มต้นที่ GPU B300 หรือ GB300 ราว 8 ตัว และชุดแร็ค GB300 NVL72 ทั้งชุดคือการติดตั้งอ้างอิง การควอนไทซ์แบบเข้มข้นจะลดระดับขั้นต่ำลง — บิลด์ NVFP4 ใช้พื้นที่ราว 1.3 TB และการควอนไทซ์แบบแบ่งชั้น 1 บิตของ Unsloth บีบอัดโมเดลเหลือราว 397 GB ซึ่งทำให้การใช้งานบนโหนดเดียวที่จัดเตรียมทรัพยากรไว้อย่างดีเป็นไปได้จริงในที่สุด — แต่ทุกเส้นทางเหล่านี้ล้วนตั้งอยู่บนสมมติฐานที่ว่าคุณใช้งาน GPU ในระดับศูนย์ข้อมูล ขณะที่ผู้ให้บริการภายนอกที่ให้บริการเช็คพอยต์โอเพนซอร์สนี้จะขายโทเคนให้ต่ำกว่าราคาต่อโทเคนของ Max แต่คุณจะต้องยอมสละอินพุตมัลติโมดัล โหมดไม่คิด เครื่องมือเนทีฟ และการ post-training แบบ 0902 ไป และยังไม่มีการเผยแพร่ benchmark อิสระใดๆ ของเช็คพอยต์ที่ดาวน์โหลดได้นั้นออกมาเลย การ์ดโมเดลของ Alibaba เองก็เปิดเผยอย่างตรงไปตรงมาเกี่ยวกับความสัมพันธ์นี้ โดยอธิบายว่า Qwen3.8-Max เป็นเวอร์ชันทางการที่สร้างบน Qwen3.8-2.4T-A95B ซึ่งเพิ่มอินพุตภาพ การรองรับโหมดไม่คิด คอนเทกซ์เริ่มต้น 1M และเครื่องมือในตัว ลงบนแกนกลางโอเพนซอร์ส

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-2.4T-A95B, showing the Text Generation and Transformers tags and the card text explaining that Qwen3.8-Max is the official version built on Qwen3.8-2.4T-A95B with vision input, non-thinking support, a 1M default context, and built-in tools.

ตัวเลขจากแหล่งอิสระเทียบกับข้อกล่าวอ้างของผู้จำหน่าย

ความซื่อตรงของแหล่งข้อมูลอ้างอิงสำคัญกว่าในการเปรียบเทียบนี้มากกว่ากรณีทั่วไป เพราะทั้งสองฝ่ายมีหลักฐานที่เกิดขึ้นคนละยุคสมัยกัน Qwen3.8-Max ได้รับการวัดคะแนนโดยอิสระแล้ว: ผลลัพธ์ Code Arena: WebDev 1,691 สำหรับบิลด์ 0902 และ Intelligence Index ที่ 56 จาก Artificial Analysis ต่างเป็นการวัดจากบุคคลที่สาม และตัวเลขราคาที่ทำให้ข้อกล่าวอ้างเรื่อง Pareto-frontier น่าสนใจก็มาจากเรตการ์ดที่เผยแพร่ต่อสาธารณะ ส่วน Qwen3.8-2.4T-A95B ยังไม่มีสิ่งเหล่านั้น — ตารางเบนช์มาร์กที่ Alibaba เผยแพร่นั้นกล่าวถึงคอร์ระดับ Max-class ไม่ใช่การทดสอบโดยอิสระของ checkpoint ที่ดาวน์โหลดได้ ดังนั้นด้านโอเพนของการเปรียบเทียบนี้จึงยังคงเป็นเพียง "ผู้จำหน่ายบอกว่าคอร์ให้คะแนนแบบนี้" เป็นส่วนใหญ่ หากคุณต้องตัดสินใจเลือกระหว่างสองรุ่นนี้โดยพิจารณาจากความสามารถ ขอให้ถือว่าตัวเลขโปรยของ open weights เป็นเพียงข้อกล่าวอ้าง จนกว่าบุคคลที่สามจะนำไปทดสอบจริง

ใครควรเลือกอันไหน

การตัดสินใจนั้นหลุดออกจากรายการข้างต้น เลือกใช้ Qwen3.8-Max แบบโฮสต์ — วันนี้โดยเฉพาะบิลด์ 0902 — เมื่อคุณต้องการ post-training ของเดือนกันยายน อินพุตรูปภาพหรือวิดีโอ โหมดแบบไม่ต้องคิด เครื่องมือเนทีฟและเอาต์พุตแบบมีโครงสร้าง หรือหน้าต่างหนึ่งล้านโทเค็นโดยไม่ต้องตั้งโครงสร้างพื้นฐานขึ้นมา นั่นคือตำแหน่งแนวหน้าของการเขียนโค้ดและเอเจนต์ และที่ราคา $2/$6 พร้อม cached input $0.25 ถือว่าแพงแบบสมเหตุสมผลกับสิ่งที่มันเป็น

เลือก Qwen3.8-2.4T-A95B เมื่อการควบคุมสำคัญกว่าความสะดวก: คุณต้องการน้ำหนักโมเดลบนฮาร์ดแวร์ของคุณเองหรือผู้ให้บริการที่คุณดำเนินการอยู่แล้ว คุณต้องการ checkpoint แบบตายตัวซึ่งคุณสามารถตรวจสอบและทำซ้ำได้ หรือปริมาณการใช้งานต่อเนื่องของคุณทำให้ต้นทุนต่อโทเคนเป็นปัจจัยหลัก และคุณพร้อมที่จะรัน MoE ขนาด 2.4T ยอมรับรายการข้อแลกเปลี่ยน — รองรับเฉพาะข้อความ, เปิดโหมดคิดเสมอ, ไม่มีเครื่องมือพื้นฐาน, ยังไม่มีการ post-training 0902 — และตรวจสอบเงื่อนไขใบอนุญาตตามช่วงรายได้ของคุณ เพราะใบอนุญาต Qwen3.8-Max แบบกำหนดเองไม่ใช่ Apache 2.0 และเพิ่มเงื่อนไขสำหรับผู้ประกอบการเชิงพาณิชย์รายใหญ่

หากเวิร์กโหลดของคุณมีปริมาณสูง ใช้ GPU เพียงตัวเดียว หรือไวต่อความหน่วง ทั้งสองรุ่นนี้อาจไม่ใช่แนวทางที่เหมาะสม — Qwen3.8-27B รุ่นพี่น้องในเจนเนอเรชันเดียวกันที่มีขนาด 27 พันล้านพารามิเตอร์ ต่างหากที่เป็นรุ่นที่เหมาะกับงานแบบนั้น และเราได้กล่าวถึงแยกต่างหากไว้แล้วในการเปรียบเทียบ Qwen3.8-27B กับ Qwen3.8-Max ของเรา

วิธีลองทั้งสองอย่างโดยไม่ทุ่มหมดหน้าตัก

วิธีที่สะอาดในการตัดสินใจครั้งนี้คือการทดสอบทั้งสองฝั่งบนพรอมป์ตของคุณเอง และนี่คือจุดที่เลเยอร์การจัดเส้นทางแสดงคุณค่าที่แท้จริงของมัน แทนที่จะถูกต่อพ่วงเข้ามาทีหลัง Qwen3.8-Max และสแนปช็อต Qwen3.8-Max-0902 ที่ถูกตรึงไว้ ต่างอยู่เบื้องหลังเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงตัวเดียวบน OrcaRouter ดังนั้นการสลับระหว่างโมเดลเรือธงที่อัปเดตต่อเนื่องกับเช็คพอยต์ที่สร้างซ้ำได้จึงเป็นเพียงการเปลี่ยน model-id ไม่ใช่การดีพลอยใหม่ เมื่อทีมตัดสินใจนำ open weights เข้ามาใช้งานในองค์กร routing DSL สามารถวางไว้ด้านหน้าเอนด์พอยต์ vLLM หรือ SGLang ที่โฮสต์เองซึ่งให้บริการ Qwen3.8-2.4T-A95B และจัดให้อยู่ใน call graph เดียวกัน — ทราฟฟิกปริมาณมากส่งไปยังดีพลอยเมนต์ของคุณเอง ส่วนพรอมป์ตที่ยากและคำขอ multimodal ไหลไปยัง Qwen3.8-Max ที่โฮสต์ไว้ พร้อมการเฟลโอเวอร์อัตโนมัติระหว่างทั้งสอง การลองเช็คพอยต์ใหม่ด้วยวิธีนี้มีค่าใช้จ่ายเพียงการเปลี่ยนคอนฟิก ไม่ใช่การโยกย้ายระบบ ซึ่งเป็นสิ่งที่คุณต้องการเมื่อทั้งสองฝั่งของการเปรียบเทียบนี้ยังเคลื่อนที่ด้วยความเร็วที่ต่างกัน

สรุป

Qwen3.8-Max และ Qwen 3.8 ไม่ใช่สองโมเดลที่มาแย่งงานเดียวกัน แต่เป็นแกนหลักขนาด 2.4 ล้านล้านพารามิเตอร์เพียงชุดเดียวที่ส่งมอบในสองรูปแบบ ได้แก่ API แบบเช่าและน้ำหนักโมเดล (weights) ที่ดาวน์โหลดได้ และการรีเฟรชเมื่อวันที่ 2 กันยายนทำให้การส่งมอบทั้งสองรูปแบบนี้มีความหมายที่ต่างกัน ถ้าเช่า API คุณจะได้ post-training รุ่น 0902 ที่ครองตำแหน่งนำใน Code Arena: WebDev พร้อมทั้งระบบ vision โหมดไม่คิด (non-thinking) เครื่องมือแบบเนทีฟ และหน้าต่างบริบทหนึ่งล้านโทเคนแบบเนทีฟ ในราคา $2/$6 โดยอินพุตแบบแคชอยู่ที่ $0.25 ส่วนการรันน้ำหนักโมเดลแบบเปิด คุณจะได้สถาปัตยกรรมเดียวกันที่ถูกแช่แข็งไว้ ณ สถานะวันที่ 12 สิงหาคม ซึ่งรองรับเฉพาะข้อความและเปิดโหมด reasoning ค้างไว้ตลอด ยังไม่มีคะแนนทดสอบแบบอิสระ และมีบิลค่าฮาร์ดแวร์ระดับศูนย์ข้อมูลตามมา ถ้าสิ่งที่ได้เพิ่มในเดือนกันยายนด้านการเขียนโค้ดและความสามารถแบบเอเจนต์สำคัญสำหรับคุณ วันนี้มีเพียงหนึ่งในสองชื่อเท่านั้นที่มีสิ่งเหล่านี้ แต่ถ้าการควบคุมที่ทำซ้ำได้สำคัญมากกว่า ก็มีเพียงหนึ่งในสองชื่อเท่านั้นที่คุณจะเก็บไว้เป็นเจ้าของได้

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube