การ์ดชื่อเรื่องแบบฮีโร่สำหรับการเปรียบเทียบ Qwen3.8-27B กับ Qwen 3.8 โดยแสดงการ์ดชิปมุมโค้งสองใบ — โมเดลแบบเดนส์ 27B ที่มีคอนเท็กซ์ 262K และใบอนุญาต Apache 2.0 เทียบกับแกน MoE ขนาด 2.4T / 95B-active ที่มีใบอนุญาตแบบกำหนดเอง — และโลโก้ OrcaRouter ที่มุมล่างขวา
Guides & Insights

Qwen3.8-27B กับ Qwen 3.8: เจเนอเรชันเดียวกัน GPU หนึ่งตัวเทียบกับแร็กหนึ่งตู้

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สัปดาห์นี้ Alibaba นำ Qwen3.8-27B ไปวางบนช่องทางอนุมานความเร็วสูงของ Cerebras — เป็นครั้งแรกที่โมเดล dense 27B มีตัวเลือกแบบโฮสต์ที่เร็วจริง ๆ — และ Artificial Analysis ก็จัดทำดัชนีทั้งสองฝั่งของการจับคู่นี้เป็นครั้งแรกในที่สุด Qwen3.8-27B ได้ 34 คะแนนบน AA Intelligence Index ส่วน Qwen 3.8 ซึ่งหมายถึงแกนเปิดที่คนส่วนใหญ่หมายถึงเมื่อเขียนชื่อโดยไม่มีคำต่อท้าย ได้ 40 คะแนน สองตัวเลขนี้รีเซ็ตการเปรียบเทียบที่การรายงานข่าวเปิดตัวในเดือนสิงหาคมต้องพึ่งคำกล่าวอ้างของผู้ขายเพียงอย่างเดียว

โมเดลที่อยู่เบื้องหลังชื่อที่ใช้เดี่ยว ๆ อย่าง “Qwen 3.8” คือ Qwen3.8-2.4T-A95B: น้ำหนักแบบ mixture-of-experts ขนาด 2.4 ล้านล้านพารามิเตอร์ที่ Alibaba เผยแพร่ภายใต้สัญญาอนุญาตแบบกำหนดเอง Qwen3.8-27B คือสมาชิกแบบ dense ของเจเนอเรชันเดียวกัน — มีประมาณ 27 พันล้านพารามิเตอร์ ใช้ Apache 2.0 และมีขนาดเหมาะกับ GPU เพียงตัวเดียว ทั้งสองใช้ชื่อตระกูลเดียวกัน มีความยาว context แบบเนทีฟ 262K และอยู่ในช่วงเวลาเปิดตัวเดียวกัน ส่วนทุกอย่างที่เหลือเกี่ยวกับสองรุ่นนี้เป็นบทเรียนเรื่องความตรงกันข้าม: รุ่นหนึ่งคุณเป็นเจ้าของได้ อีกรุ่นคุณทำได้แค่เช่าใช้ นี่คือสิ่งที่แต่ละรุ่นมีไว้ใช้จริง ๆ ตอนนี้ที่ทั้งคู่มีตัวเลขของตัวเองแล้ว

รุ่นเดียวกัน แต่รูปทรงตรงกันข้าม

Qwen3.8-27B เป็นโมเดลแบบ dense — พารามิเตอร์ 27B (นับรวมตัวเข้ารหัสภาพแล้วเป็น 28B) มี 64 เลเยอร์ เป็นสแต็กแอตเทนชันแบบไฮบริดที่ประกอบด้วยเลเยอร์ความสนใจเชิงเส้น Gated DeltaNet 48 เลเยอร์ เทียบกับเลเยอร์ full attention 16 เลเยอร์ ความเป็นไฮบริดนี้เองคือเหตุผลที่โมเดลขนาด 27B สามารถรองรับคอนเท็กซ์เนทีฟได้ 262,144 โทเคน Qwen3.8-2.4T-A95B คือสถาปัตยกรรมเรือธง: พารามิเตอร์รวม 2.4T, เปิดใช้งานประมาณ 95B ต่อโทเคน, 92 เลเยอร์ โดยมี 512 ผู้เชี่ยวชาญต่อเลเยอร์ และใน 92 เลเยอร์นั้นมี 69 เลเยอร์ที่ใช้ linear attention กลเม็ดเดียวกัน แต่ใหญ่กว่าเก้าสิบเท่า

• สถาปัตยกรรม — Qwen3.8-27B: แบบ dense 27B ทุกโทเคนจะเปิดใช้งานทั้งโมเดล Qwen3.8-2.4T-A95B: MoE รวม 2.4T / ใช้งานจริง ~95B

• คอนเท็กซ์ — ทั้งคู่มี 262K แบบเนทีฟ; ส่วนขยาย 1M ของ 27B ให้บริการผ่านโฮสต์เท่านั้น ส่วน 2.4T วัดได้ถึง ~984K

• อินพุต — Qwen3.8-27B: ข้อความ รูปภาพ และวิดีโอ. Qwen3.8-2.4T-A95B: ข้อความเท่านั้น, โหมดคิดถูกล็อกให้เปิดอยู่

• สัญญาอนุญาต — Qwen3.8-27B: Apache 2.0 Qwen3.8-2.4T-A95B: สัญญาอนุญาต Qwen3.8-Max แบบกำหนดเอง

• เวต — Qwen3.8-27B: 55.6GB BF16 ควอนไทซ์แล้วได้เป็นบิลด์ Q4 ขนาด ~16GB ส่วน Qwen3.8-2.4T-A95B: ~2.4TB BF16 เป็นแร็ค GPU ไม่ใช่เดสก์ท็อป

• ที่ที่คุณจะได้พบ它們 — Qwen3.8-27B: โฮสต์เองหรือเช่าแบบถูก ๆ Qwen3.8-2.4T-A95B: เช่า เพราะไม่มีใครที่สติดีพอจะไปเป็นเจ้าของแร็กเอง

ตัวเลขอิสระ ในที่สุด

บทความแนว vs ทุกชิ้นในเดือนสิงหาคมเกี่ยวกับ Qwen3.8-27B ต่างมีข้อแม้เดียวกันว่า “ยังไม่มีคะแนนจากแหล่งอิสระ” ตอนนี้ไม่เป็นความจริงอีกต่อไปแล้ว Artificial Analysis ได้วัดทั้งสองโมเดลแล้วเมื่อสัปดาห์นี้ และรูปร่างของข้อมูลก็น่าสนใจอย่างแท้จริง

บน Intelligence Index, Qwen3.8-2.4T-A95B ได้คะแนน 40 อยู่อันดับ 4 จาก 113 ในคลาสของตัวเอง Qwen3.8-27B ได้คะแนน 34 — ซึ่งทำให้มันเป็นอันดับ 1 จาก 140 โมเดลในคลาสขนาด 4–40B แบบเปิดน้ำหนักของมัน เป็นผลงานที่แข็งแกร่งจริง ๆ สำหรับโมเดล dense ขนาด 27B ทั้งคู่ช้าเมื่อวัดโดยอิสระ: 39.0 โทเคนเอาต์พุตต่อวินาทีสำหรับ 27B และ 38.1 สำหรับ 2.4T เทียบกับค่ามัธยฐานของคลาสที่ราว 90 ทั้งคู่มีเอาต์พุตเยิ่นเย้อ โดย 27B สร้างเอาต์พุตประมาณ 200M โทเคนในการรันดัชนีทั้งหมด เทียบกับค่ามัธยฐานของคลาสที่ 68M ไม่มีตัวไหนเป็นโมเดล frontier ระดับพาดหัวข่าว; ทั้งคู่เป็น workhorse และดัชนีบอกว่า 2.4T เป็น workhorse ที่แข็งแกร่งกว่าอย่างชัดเจน

A three-lane infographic titled 'Qwen3.8-27B — three ways to rent it': self-hosted lane on OrcaRouter at $0.33/$2.40 per 1M tokens with 262K context, vendor lane on Qwen Cloud at $0.50/$3.00 with 1M context and a 90% cache discount, and the fast lane on Cerebras PayGo at $0.99/$1.49 with rapid inference, plus the OrcaRouter logo in the bottom-right corner.

ราคาในฝั่งอิสระเล่าเรื่องเดียวกันออกมาเป็นดอลลาร์ Artificial Analysis กำหนดราคาของ 27B ไว้ที่ $0.50 ต่ออินพุตหนึ่งล้านโทเคน และ $3.00 ต่อเอาต์พุตหนึ่งล้านโทเคน บนบิลด์โฮสต์ของ Qwen Cloud (ส่วนลดแคช 90%) และกำหนดราคาของ 2.4T ไว้ที่ $2.00 / $6.00 (ส่วนลดแคช 88%) ต้นทุนต่องาน Intelligence Index: $0.82 สำหรับ 27B เทียบกับ $2.16 สำหรับ 2.4T โมเดลที่เล็กกว่านั้นมีต้นทุนการรันต่อหน่วยความฉลาดที่ถูกกว่า — และทั้งคู่ก็แพงเมื่อเทียบกับคลาสความเร็วของตน เพราะทั้งคู่เป็นโมเดล reasoning ที่เผาผลาญโทเคนเอาต์พุต

ทุกอย่างที่เหลือ — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3 สำหรับรุ่น 27B; ส่วน 86.6 Terminal-Bench 2.1 และ 67.7 SWE-bench Pro ของรุ่น 2.4T — ยังคงเป็นข้อมูลที่ผู้ขายรายงาน ยังไม่ได้จำลองซ้ำ และถูกระบุว่าเป็นเช่นนั้นตลอดบทความนี้ ดัชนี AA ข้างต้นคือระดับพื้นฐานอิสระที่รองรับทั้งหมดนั้น

การเข้าจดทะเบียนของ Cerebras เปลี่ยนแปลงอะไรบ้าง

เมื่อวันที่ 12 กันยายน 2026 บัญชี Qwen ได้ประกาศว่า Qwen3.8-27B ทำงานบน Cerebras แล้ว โดยรายการในแค็ตตาล็อกเปิดให้ใช้งานภายใต้แบนเนอร์ "Qwen 3.8 27B พร้อมให้บริการแล้วบน Cerebras PayGo" Cerebras ระบุราคาไว้ที่ 0.99 ดอลลาร์ต่ออินพุต 1 ล้านโทเคน และ 1.49 ดอลลาร์ต่อเอาต์พุต 1 ล้านโทเคน บนฮาร์ดแวร์ระดับ WSE ที่สร้างชื่อเสียงด้านความเร็วให้กับบริษัท นั่นทำให้ 27B มีสิ่งที่แกน 2.4T ไม่เคยมี นั่นคือช่องทางด่วน

A comparison scoreboard titled 'Qwen3.8-27B vs Qwen 3.8 — the matchup': the 27B shows 27B dense architecture, 262K native context, text/image/video input, Apache 2.0, AA Intelligence 34, and $0.33/$2.40 per 1M tokens; the 2.4T core shows 2.4T / 95B-active MoE, 984K measured context, text-only input, the Qwen3.8-Max custom license, AA Intelligence 40, and $2.00/$6.00 per 1M tokens, with a footer labeling the 27B price as the OrcaRouter self-hosted rate, the 2.4T price as the Qwen3.8-Max API rate, and the AA figures as of September 2026, plus the OrcaRouter logo in the bottom-right corner.

เรื่องนี้สำคัญเพราะความช้าและเยิ่นเย้อเป็นข้อเสียจริงเพียงข้อเดียวของ 27B มาตั้งแต่วันแรก บนฮาร์เนสทดสอบอิสระ มันทำได้ 39 t/s; บนเทเลเมทรีการเสิร์ฟของเราเอง มันทำได้ประมาณ ~154 โทเคนเอาต์พุตต่อวินาที โดยมีความหน่วงของโทเคนแรกที่ p50 อยู่ที่ 4.48 วินาที — และตอนนี้ผู้ให้บริการรายที่สองกำลังแข่งขันบนแกนเดียวกันนี้ ส่วน 2.4T ตรงกันข้าม ไม่มีเลนเร็วเลย: ที่ 38 t/s คุณกำลังจ่ายราคาระดับแนวหน้าเพื่อแลกกับความเร็วระดับกลาง ๆ และทางเดียวที่จะหลีกเลี่ยงได้คือเช่าคลัสเตอร์ GPU มารันเวตเปิดด้วยตัวเอง

สามเลนสำหรับ 27B, หนึ่งเลนสำหรับ 2.4T

ณ วันนี้ dense 27B ให้เช่าได้ 3 รูปแบบ และส่วนต่างราคานั้นน่าอ่านก่อนคุณจะเลือก:

• ช่องทางโฮสต์เอง — Qwen3.8-27B เปิดให้ใช้งานแล้วบน OrcaRouter ในราคา $0.33 / $2.40 ต่อล้าน รันบนโครงสร้างพื้นฐานของเราเอง ราคาอินพุตถูกที่สุดในตลาดสำหรับรุ่นนี้ เอาต์พุต ~154 tok/s บริบท 262K

• เส้นทางผู้ให้บริการ — บิลด์แบบโฮสต์ของ Qwen Cloud ราคา $0.50 / $3.00 ต่อล้านโทเคน พร้อมบริบท 1M โทเคน และส่วนลดแคช 90%

• เลนด่วน — Cerebras PayGo, $0.99 / $1.49 ต่อล้าน วางตำแหน่งโดยเน้นความเร็วมากกว่าราคา

A screenshot of the OrcaRouter model page for Qwen3.8 27B (captured September 12, 2026) showing the input price of $0.33 per 1M tokens, output price of $2.40 per 1M tokens, a 262K token context window, text/image/video input support, and a p50 first-token latency of 4.48 seconds.

โอเพนคอร์ 2.4T ไม่มีสเปรดที่เทียบเท่าได้ API เรือธงที่ให้บริการสถาปัตยกรรมเดียวกัน — Qwen3.8-Max — ราคา $2.00 / $6.00 ต่อล้าน และนั่นคือตัวเลขที่คงเดิมไม่ว่าคุณจะเรียกมันว่า Max หรือโอเพนคอร์ หากหันไปรันเวตแทน เศรษฐศาสตร์ก็พลิกไปที่ฮาร์ดแวร์: 2.4T ต้องใช้เวต BF16 ราว ~2.4TB และโหนดหลาย GPU ซึ่งเป็นการตัดสินใจลงทุนที่ไม่มีใครทำกันแบบชิล ๆ ส่วน GPU 24GB รันบิลด์ Q4 ของ 27B ด้วยต้นทุนส่วนเพิ่มที่แทบจะปัดเป็นศูนย์

ตัวอย่างการใช้งานจริงที่ทำให้ทีมส่วนใหญ่ตัดสินใจ: อินพุต 100M และเอาต์พุต 20M โทเคนต่อวัน ด้วยอัตรา $2/$6 ของ 2.4T คิดเป็นประมาณ $320 ต่อวัน หรือราว $117,000 ต่อปี สำหรับ 27B ในราคา $0.33/$2.40 ของเรา คิดเป็นประมาณ $81 ต่อวัน — และสำหรับเวอร์ชันที่โฮสต์เอง มันมีค่าใช้จ่ายเท่าค่าไฟฟ้า 2.4T ให้ข้อได้เปรียบด้านคุณภาพจริง ๆ คือ AA 40 เทียบกับ 34 ประเด็นทั้งหมดที่การจับคู่นี้ถามก็คือ ข้อได้เปรียบนั้นคุ้มกับบิลรายเดือนหลักหมื่นหรือไม่

ในจุดที่พวกมันแตกต่างกันอย่างแท้จริง

นอกเหนือจากดัชนีแล้ว ความแตกต่างในทางปฏิบัติสามประการเป็นตัวกำหนดว่าตัวใดเหมาะกับปริมาณงานที่กำหนด

อินพุตแบบมัลติโมดัลคือฟิลเตอร์ที่สะอาดที่สุด Qwen3.8-27B อ่านข้อความ รูปภาพ และวิดีโอ — ภาพหน้าจอ แผนภูมิ เอกสารที่มีรูปประกอบ เฟรมวิดีโอ ทั้งหมดล้วนเข้าสู่หน้าต่าง 262K เดียวกัน Qwen3.8-2.4T-A95B เป็นแบบข้อความล้วนอย่างเคร่งครัด หากอินพุตของคุณมีอะไรที่เป็นภาพรวมอยู่ด้วย 2.4T ก็ถูกตัดสิทธิ์ทันที ไม่ว่าดัชนีของมันจะสูงกว่าก็ตาม

การควบคุมการคิดเป็นอันดับสอง โหมดการให้เหตุผลของ 27B สามารถปิดได้ต่อคำขอ ซึ่งสำคัญสำหรับการสกัดข้อมูลที่ไวต่อเวลาแฝง โดยที่ลูกโซ่ความคิดเป็นภาระส่วนเกินล้วน ๆ; มันยังเปิดเผย reasoning_effort ด้วย คอร์ 2.4T ไม่สามารถปิดการคิดได้ — ทุกคำตอบจะเปิดด้วย think> บล็อก และคุณต้องจ่ายสำหรับโทเค็นเหล่านั้นไม่ว่าคุณจะต้องการหรือไม่ก็ตาม API เรือธงแก้ปัญหานี้ แต่คอร์แบบเปิดไม่ทำเช่นนั้น

การออกใบอนุญาตมาเป็นอันดับสาม และมันมีความสำคัญอย่างเงียบ ๆ ในระดับสเกล Apache 2.0 บน 27B คือมาตรฐานแบบเปิดกว้าง: ดัดแปลง แจกจ่ายต่อ นำไปใช้เชิงพาณิชย์ รวมถึงการให้สิทธิ์ในสิทธิบัตร ส่วน 2.4T ถูกปล่อยภายใต้ใบอนุญาต Qwen3.8-Max แบบกำหนดเอง — ซึ่งเปิดกว้างในเจตนารมณ์ แต่เป็นข้อกำหนดของ Alibaba ไม่ใช่มาตรฐานของชุมชน และควรอ่านไฟล์ก่อนที่คุณจะสร้างผลิตภัณฑ์บนพื้นฐานของมัน

การกำหนดเส้นทางการตัดสินใจ

ทั้งสองฝั่งของการจับคู่นี้เข้าถึงได้ผ่านคีย์ OrcaRouter คีย์เดียว ซึ่งเป็นสิ่งที่ทำให้คำถามว่า "ฉันควรเลือกอันไหน" ตอบได้ด้วยข้อมูลเชิงประจักษ์อย่างประหยัด Qwen3.8-27B เปิดให้ใช้งานแล้วในชื่อ qwen/qwen3.8-27b ในราคาตามที่ผู้ให้บริการประกาศ โดยไม่บวกเพิ่ม, และ API เรือธงที่สร้างบนแกน 2.4T เดียวกันเปิดให้ใช้งานแล้วในชื่อ qwen/qwen3.8-max ในราคา $2.00 / $6.00 ต่อล้าน — อัตราของ Alibaba เองที่ส่งต่อมาโดยตรง ดังนั้นการเปลี่ยนแปลงราคาของผู้ขายรายใดก็ตามจะอัปเดตที่นี่ในวันเดียวกัน

สถาปัตยกรรม 2.4T แบบเดียวกันในรูปเวทที่ดาวน์โหลดได้ไม่ใช่สิ่งที่เราให้บริการ — หากคุณต้องการแกนเปิดผ่าน API ในวันนี้ เส้นทางเรือธงคือวิธีปฏิบัติจริงที่จะเข้าถึงมัน และ qwen/qwen3.8 ถูกตั้งค่าไว้ล่วงหน้าให้เปิดใช้งานทันทีที่ผู้ให้บริการรายใดเสิร์ฟเวทแบบเปิด กฎการจัดเส้นทางที่ส่งทราฟฟิกที่เน้นภาพและไวต่อความหน่วงไปยัง qwen/qwen3.8-27b และส่งงานส่วนท้ายที่ต้องใช้การให้เหตุผลหนักไปยัง qwen/qwen3.8-max ไม่มีค่าใช้จ่ายในการตั้งค่าและจะสลับสำรองอัตโนมัติระหว่างผู้ให้บริการ คีย์เดียว ไม่มีสัญญาที่สอง และการแยกนี้เป็นการเปลี่ยนแปลงการตั้งค่าแทนที่จะเป็นการรื้อสถาปัตยกรรมใหม่ — วิธีที่ถูกที่สุดในการทดสอบว่าคะแนนดัชนีที่เพิ่มมาอีกหกจุดของ 2.4T คุ้มค่าสำหรับคุณที่ $5.67 ต่อล้านโทเค็นเอาต์พุตหรือไม่

ใครควรเลือกอันไหน

• เลือก Qwen3.8-27B หากอินพุตของคุณมีรูปภาพหรือวิดีโอ หากคุณต้องการโหมดคิดวิเคราะห์ที่ปิดได้ หากคุณมี GPU 24GB หรือวางแผนจะมี หรือหากค่าใช้จ่ายต่อโทเค็นของคุณมีปริมาณมากพอจน $0.33/$2.40 เทียบกับ $2.00/$6.00 คือเหตุผลทั้งหมด

• เลือก Qwen 3.8 (แกน 2.4T) หากคุณใช้ข้อความเท่านั้น ต้องการคะแนนการให้เหตุผลอิสระที่แข็งแกร่งที่สุดในตระกูล (AA 40) และอัตรา $2/$6 — หรือค่าใช้จ่ายในการรันโหนด GPU — อยู่ในงบประมาณของคุณอย่างสบาย

• เลือกทั้งสองแบบหากทราฟฟิกของคุณครอบคลุมทั้งสองโปรไฟล์: ส่งเส้นทางผ่านเกตเวย์ ให้เราเตอร์แยกตามโมดาลิตีและระดับความยาก และเปลี่ยนใจได้เมื่อเช็กพอยต์ถัดไปหรือราคาของโมเดลใดโมเดลหนึ่งออกมา

คำตัดสิน

ชื่อ Qwen 3.8 แท้จริงเป็นผลิตภัณฑ์สองอย่างที่แสร้งทำเป็นตระกูลเดียวกันมาตลอด และตอนนี้ทั้งคู่ก็มีตัวเลขแยกกันให้ถกเถียงกันแล้ว Qwen3.8-2.4T-A95B เป็นสมองที่แข็งแกร่งกว่า รองรับข้อความเท่านั้น แพง และปฏิเสธไม่ได้ว่าสามารถให้เช่าใช้ได้ที่ราคา $2/$6 Qwen3.8-27B คือรุ่นที่นำไปติดตั้งใช้งานได้จริง — รองรับมัลติโหมด เป็น Apache 2.0 โฮสต์เองได้ และนับจากสัปดาห์นี้เป็นต้นไป มันก็มีช่องทางด่วนเป็นของตัวเองในที่สุด ส่วนต่างดัชนีมีอยู่จริง: 40 ต่อ 34 ส่วนต่างราคาก็เช่นกัน: ต้นทุนต่อโทเคนสูงกว่าราวห้าเท่าเมื่อคุณรัน 2.4T ในรูปแบบ API สำหรับทีมส่วนใหญ่ การตัดสินใจไม่ใช่เรื่องของหกคะแนนดัชนี แต่มันเป็นเรื่องของว่าคุณกำลังซื้อโทเคนหรือซื้อฮาร์ดแวร์ — และ 27B เป็นเพียงหนึ่งเดียวในสองรุ่นนี้ที่ให้คุณซื้อฮาร์ดแวร์ได้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube