Qwen 3.8 vs Kimi K3: สองยักษ์ใหญ่จากจีน และตอนนี้หนึ่งในนั้นถูกลง
Guides & Insights

Qwen 3.8 vs Kimi K3: สองยักษ์ใหญ่จากจีน และตอนนี้หนึ่งในนั้นถูกลง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

โมเดล frontier ของจีนที่สำคัญที่สุดสองตัวในปี 2026 และทั้งคู่ก็เป็นญาติสนิทกัน: ทั้งคู่เป็นระบบ Mixture-of-Experts แบบ sparse ขนาดมหึมา ทั้งคู่มีบริบท 1M token ทั้งคู่เป็น multimodal และทั้งคู่ให้คำมั่นเรื่อง open weights. Kimi K3 จาก Moonshot นั้นเป็นตัวที่ใหญ่กว่า ในสองตัวนี้ โดยมีพารามิเตอร์รวม 2.8T เทียบกับ 2.4T ของ Qwen — ซึ่งเป็นเครื่องเตือนใจที่ดีว่าจำนวนพารามิเตอร์ไม่ใช่การจัดอันดับ.

จนถึงวันที่ 3 สิงหาคม 2026 การเปรียบเทียบนี้ไม่สมดุลในลักษณะเฉพาะ: Kimi K3 มีดัชนี Artificial Analysis Intelligence Index ที่ผ่านการตรวจสอบอยู่ที่ 57.1, อันดับ #1 ในการจัดอันดับฟรอนต์เอนด์โค้ดของ LMArena, มีการเผยแพร่ราคา และมีน้ำหนักโมเดลที่จัดส่ง ในขณะที่ Qwen3.8-Maxมีเพียงพาดหัว 2.4T เท่านั้น และไม่มีอะไรอื่นเลย.GA เปลี่ยนสมการต้นทุนอย่างเด็ดขาด.ตอนนี้ Qwen เผยแพร่ราคา $2 / $6 ต่อล้านโทเค็น เทียบกับของ Kimi ที่ $3 / $15 — ซึ่งทำให้โมเดลที่ใหญ่กว่าและผ่านการพิสูจน์มาแล้วว่าดีกว่า กลับมีราคาแพงกว่าอย่างมาก

หมายเหตุสำหรับนักพัฒนา — วิธีที่เร็วที่สุดในการตัดสินเรื่องนี้คือการรันทั้งสองแบบบนพรอมพ์ของคุณเอง OrcaRouter ให้บริการโมเดลกว่า 200 รายการผ่านเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI ดังนั้นคุณจึงสามารถจับ Qwen 3.8 Max แข่งกับ Kimi K3 ในงานเดียวกันได้โดยไม่ต้องเชื่อม SDK สองชุด

สรุปแบบ TL;DR. Kimi K3 ยังชนะในด้านหลักฐาน: ผลการตรวจสอบ AA Intelligence Index ที่ 57.1 (อันดับ #3), ตำแหน่ง #1 ด้านโค้ด frontend ของ LMArena ที่ 1679, และ open weights ที่พร้อมใช้งานจริง Qwen3.8-Max ยังไม่ได้รับการให้คะแนนจากผู้ประเมินอิสระรายใดเลย แต่ GA มอบข้อได้เปรียบที่แท้จริงสองข้อให้ Qwen ในด้านราคา ตอนนี้มันถูกกว่าอย่างเห็นได้ชัด — $2 / $6 เทียบกับ $3 / $15, หมายความว่าถูกกว่า 2.5 เท่าในส่วน output และในการทดสอบแบบตัวต่อตัวโดยบุคคลที่สามเพียงรายการเดียวที่มีอยู่ Qwen แพ้คะแนนหลัก 80 ต่อ 83 ทั้งที่แสดงตัวเป็น agent ที่มีพฤติกรรมดีกว่าอย่างเห็นได้ชัด: การอ้างอิงใน repo 354 ครั้ง เทียบกับ 274, คำขอ gateway 22 ครั้ง เทียบกับ 53 และการเรียก tool ที่ล้มเหลว 0 ครั้ง เทียบกับ 2. Kimi สำหรับคุณภาพที่ผ่านการตรวจสอบ; Qwen สำหรับการทำงานแบบ agentic ที่ถูกกว่าและเป็นระเบียบกว่า

ประเด็นสำคัญ

Kimi K3 เป็นโมเดลที่ใหญ่กว่า — 2.8T MoE เทียบกับ 2.4T ของ Qwen ซึ่งมากกว่าราว 400B — ซึ่งเป็นข้อโต้แย้งที่ดีว่าการใช้จำนวนพารามิเตอร์เป็นตัวแทนของความสามารถนั้นไม่ถูกต้อง.

Qwen3.8-Max เปิดตัว GA ตั้งแต่วันที่ 3 สิงหาคม 2026 ที่ราคา $2 / $6 ต่อ 1M แบบ flat เทียบกับของ Kimi K3 $3 / $15 (AA blended ~$2.31). ตอนนี้ Qwen 2.5× ถูกกว่าในส่วน output.

Kimi K3 ครองอันดับที่ผ่านการตรวจสอบ: ดัชนีความฉลาด AA 57.1 (อันดับ 3), ตามหลังเพียง Fable 5 และ GPT-5.6 Sol รวมถึง LMArena frontend-code #1 (1679). Qwen3.8-Max ยังไม่ได้รับการจัดอันดับ.

ในการทดสอบโดยตรงเพียงครั้งเดียว (Trilogy AI) Kimi เอาชนะ Qwen 83 ต่อ 80 โดยรวม — แต่ Qwen ทำ การอ้างอิง repo มากกว่า (354 เทียบกับ 274), คำขอ gateway น้อยกว่า (22 เทียบกับ 53), และมี การเรียกใช้เครื่องมือที่ล้มเหลวเป็นศูนย์ (เทียบกับสองครั้ง), โดยมีคะแนนการใช้เครื่องมือ 9/10 เทียบกับ Kimi ที่ได้ 8/10.

Qwen รายงานตัวเลขด้านเอเจนต์และการเขียนโค้ด: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (จาก 40.7 ของรุ่นก่อนหน้า) — ทั้งหมดรายงานโดย Alibaba.

จังหวะเวลาของการเปิดเผยยังคงเป็นใจให้ Kimi: น้ำหนักโมเดลของมันพร้อมแล้วเป็นส่วนใหญ่; ส่วนของ Qwen ถูกสัญญาว่าจะปล่อยภายในสัปดาห์นี้ โดยยังไม่มีใบอนุญาตหรือที่เก็บโค้ด

หมายเหตุด้านความแม่นยำ: ตัวเลขคุณภาพทั้งหมดของ Qwen3.8-Max เป็นข้อมูลที่ Alibaba รายงานเองและยังไม่ผ่านการยืนยันจากบุคคลที่สาม ตัวเลขของ Kimi K3 มาจาก Artificial Analysis และ LMArena การเปรียบเทียบแบบตัวต่อตัวเป็นการทดสอบเพียงครั้งเดียวโดย Trilogy AI และควรถือเป็นเพียงข้อมูลจุดเดียว ไม่ใช่การจัดอันดับทั่วไป ราคาของ Qwen เป็นอัตราค่าใช้จ่าย GA และแทนที่ส่วนลดช่วงตัวอย่างของเดือนกรกฎาคม

สเปกและราคา เปรียบเทียบเคียงข้างกัน

นี่คือข้อมูลที่แท้จริง ซึ่งแต่ละตัวเลขมีการอ้างอิงแหล่งที่มา

• ผู้ผลิต / สถานะ — Qwen3.8-Max: Alibaba; GA (3 สิงหาคม 2026); Kimi K3: Moonshot; การปล่อย open-weight

• สถาปัตยกรรม — Qwen3.8-Max: รวม ~2.4T, sparse MoE (ยังไม่มีการเปิดเผยพารามิเตอร์ที่ใช้งานจริง); Kimi K3: 2.8T MoE, วิสัยทัศน์โดยกำเนิด (Artificial Analysis)

• หน้าต่างบริบท — Qwen3.8-Max: 1M โทเคน (983,616 โทเคนพร้อมการคิด; เอาต์พุตสูงสุด 131,072); Kimi K3: 1M โทเคน (Artificial Analysis)

• AA Intelligence Index — Qwen3.8-Max: ยังไม่ได้ให้คะแนน; Kimi K3: 57.1 — อันดับ 3 (Artificial Analysis)

• อารีนา / ลีดเดอร์บอร์ด — Qwen3.8-Max: ยังไม่มีการเปิดเผยคะแนนต่อสาธารณะ; Kimi K3: Frontend-code อันดับ 1, 1679 (LMArena)

• คะแนนที่ผู้จำหน่ายรายงาน — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (รายงานโดย Alibaba); Kimi K3: อันดับวัดโดยบุคคลที่สาม

• ราคา (ขาเข้า / ขาออก) — Qwen3.8-Max: $2.00 / $6.00 ต่อ 1M คงที่; อินพุตที่แคช $0.25; Kimi K3: $3 / $15 ต่อ 1M (AA แบบผสม ~$2.31), การชนแคช $0.30

• โอเพนเวต — Qwen3.8-Max: สัญญาว่าจะปล่อยภายในสัปดาห์นี้ (ยังไม่มีไลเซนส์); Kimi K3: โอเพนเวต; น้ำหนักพร้อมแล้ว

• ความเร็ว — Qwen3.8-Max: p50 TTFT 1.64s (เทเลเมทรี 7 วันของ OrcaRouter); Kimi K3: เยิ่นเย้อและช้า (~34s TTFT, ตาม AA)

มีสองสิ่งที่กำหนดกรอบการเปรียบเทียบนี้ และหนึ่งในนั้นได้พลิกผันโดยสิ้นเชิงในวันที่ 3 สิงหาคม

ประการแรก ความสัมพันธ์ของราคากลับด้าน. ตลอดเดือนกรกฎาคม Kimi K3 เป็นรุ่นที่มีราคาจริง และ Qwen เป็นรุ่นที่มีคูปองส่วนลด ตอนนี้ทั้งคู่ได้ประกาศอัตราค่าบริการแล้ว และโมเดลที่ใหญ่กว่าซึ่งได้รับการพิสูจน์ว่าดีกว่าก็มีราคาแพงกว่า: $3 / $15 เทียบกับ $2 / $6. ในด้านเอาต์พุต — ที่ซึ่งการใช้เหตุผลและการสร้างโค้ดใช้เงิน — Kimi แพงกว่า 2.5 เท่า นอกจากนี้ Qwen ยังคิดอัตราคงที่ตลอดบริบท 1M โทเคนทั้งหมด และอินพุตที่แคชไว้ที่ $0.25 ถูกกว่าอัตรา cache-hit ของ Kimi ที่ $0.30 เล็กน้อย สำหรับงานที่มีปริมาณมาก ความคุ้มค่าของ Qwen ดีกว่าอย่างชัดเจนในตอนนี้

ประการที่สอง ช่องว่างในการพิสูจน์ยังคงเท่าเดิม และนั่นคือเหตุผลที่ Kimi ยังคงชนะ ดัชนี Intelligence Index 57.1 ของ Kimi K3 ทำให้มันอยู่อันดับสามโดยรวม รองจาก Fable 5 และ GPT-5.6 Sol เท่านั้น — นั่นคือคำตัดสินของผู้ประเมินที่เป็นกลาง ผล LMArena frontend-code #1 ที่ 1679 ของมันเป็นผลจากการจัดอันดับแบบ crowd-sourced จากการเปรียบเทียบแบบ blind หลายครั้ง ค่า Terminal-Bench 86.6 และ GPQA Diamond 92.6 ของ Qwen เป็นตัวเลขจริง แต่เป็นของ Alibaba เอง บนชุดทดสอบที่ไม่มีใครอื่นได้รัน จุดยึดที่มีประโยชน์อย่างหนึ่ง: Qwen3.7-Max รุ่นก่อนหน้าได้คะแนน 46 บนดัชนี AA เทียบกับ 57.1 ของ Kimi ดังนั้น Qwen จำเป็นต้องมีการก้าวกระโดดข้ามรุ่นครั้งใหญ่เพียงเพื่อจะเสมอ

นอกจากนี้ยังมีเรื่องความหน่วงที่ควรสังเกตอีกประการหนึ่ง เพราะมันขัดกับเรื่องเล่าที่คุ้นเคย Artificial Analysis วัด Kimi K3 ได้ที่ประมาณ 34 วินาทีสำหรับ time-to-first-token ซึ่งช้าจริงๆ ส่วนเทเลเมทรีระดับ GA ของ OrcaRouter แสดง Qwen3.8-Max ที่ค่า p50 TTFT ประมาณ 1.64 วินาที การวัดเหล่านั้นมาจากแหล่งที่ต่างกันและไม่ใช่การเปรียบเทียบที่มีการควบคุม แต่ก็ทำให้ข้อสันนิษฐานในยุคพรีวิวที่ว่า Qwen เป็นตัวที่เชื่องช้ากว่าทั้งคู่นั้นซับซ้อนขึ้น

การทดสอบแบบตัวต่อตัวเพียงครั้งเดียว อ่านอย่างละเอียด

นี่คือการแข่งขันเดียวในซีรีส์ที่บุคคลที่สามได้นำทั้งสองโมเดลมาเปรียบเทียบกันในงานเดียวกัน ซึ่งทำให้ควรอ่านอย่างละเอียดมากกว่าจะสรุปว่าฝ่ายใดชนะ

Trilogy AI ได้ดำเนินงานทำความเข้าใจสถาปัตยกรรม — ทำความเข้าใจพื้นที่เก็บข้อมูลจริงและบรรลุข้อสรุปทางสถาปัตยกรรมที่ถูกต้อง — และให้คะแนนผลลัพธ์:

• คะแนนรวม — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100

• การอ้างอิงจากรีโพ — Qwen3.8-Max: 354; Kimi K3: 274

• คำขอเกตเวย์ — Qwen3.8-Max: 22; Kimi K3: 53

• การเรียกใช้เครื่องมือที่ล้มเหลว — Qwen3.8-Max: 0; Kimi K3: 2

• คะแนนการใช้เครื่องมือ — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10

• อัตราการค้นพบข้อมูลในแคช — Qwen3.8-Max: >90%; Kimi K3: >90%

Kimi ชนะในส่วน headline ด้วยสามคะแนน แต่ให้ดูคอลัมน์กระบวนการ เพราะสำหรับวิศวกรรมแบบ agentic พวกมันสำคัญกว่าคะแนน Qwen ได้ข้อสรุปทางสถาปัตยกรรมหลักเดียวกันโดยใช้ น้อยกว่าครึ่งหนึ่งของคำขอเกตเวย์ พร้อมทั้งสร้าง การอ้างอิงแบบ grounding เพิ่มขึ้น 29% และ — รายละเอียดที่ควรดึงดูดความสนใจของใครก็ตามที่กำลังสร้าง agent — การเรียกใช้เครื่องมือที่ล้มเหลวเป็นศูนย์ เทียบกับสองครั้งของ Kimi.

การเรียกใช้เครื่องมือที่ล้มเหลวคือสิ่งที่ทำให้เอเจนต์ในโปรดักชันพังจริงๆ มันส่งผลต่อเนื่องเป็นลูกโซ่: การเรียกที่ผิดรูปแบบก่อให้เกิดข้อผิดพลาดที่โมเดลต้องตีความ ซึ่งกินเทิร์นการทำงาน และเสี่ยงที่จะเกิดข้อผิดพลาดเพิ่มเติม โมเดลที่ทำการร้องขอ 22 ครั้งอย่างสมบูรณ์ ในขณะที่อีกโมเดลหนึ่งทำ 53 ครั้งแต่มี 2 ครั้งที่ล้มเหลว ย่อมมีต้นทุนการดำเนินงานที่ถูกกว่าและคาดเดาได้มากกว่า ถึงแม้จะได้คะแนนคำตอบต่ำกว่าสามคะแนนก็ตาม เมื่อรวมกับอัตราค่าบริการ output ที่ถูกกว่า 2.5 เท่าของ Qwen แล้ว เศรษฐศาสตร์การดำเนินงานของการรันครั้งนั้นก็เอื้อต่อ Qwen อย่างมีนัยสำคัญ

ข้อควรระวังก็คือนี่คือหนึ่งงาน หนึ่งผู้ประเมิน หนึ่งรอบมันไม่ใช่ชุดทดสอบมาตรฐาน และไม่สามารถขยายผลไปใช้ในกรณีอื่นได้ ค่าดัชนี 57.1 ของ Kimi และอันดับ #1 ด้านฟรอนต์เอนด์อาศัยหลักฐานที่มากกว่าการทดสอบเพียงครั้งเดียวนี้มาก ข้อสรุปที่ถูกต้องจึงอยู่ในวงแคบ: ในงานแบบเอเจนต์จริงอย่างน้อยหนึ่งงาน Qwen เป็นผู้ใช้เครื่องมือที่มีวินัยมากกว่า ขณะที่คุณภาพผลลัพธ์ด้อยกว่าเล็กน้อย

ต้นทุนในทางปฏิบัติ: การรันแบบเอเจนต์ในปริมาณมาก

ลองพิจารณาเอเจนต์วิเคราะห์ repository: บริบทโค้ด 250,000 โทเคนต่อการรันหนึ่งครั้ง, ผลลัพธ์ 12,000 โทเคน

Qwen3.8-Max: 0.25M × $2 = $0.50, บวก 0.012M × $6 = $0.072. ≈ $0.57 ต่อครั้ง.

Kimi K3: 0.25M × $3 = $0.75, บวก 0.012M × $15 = $0.18. ≈ $0.93 ต่อครั้ง.

• ที่ 1,500 รัน/วัน: Qwen ≈ $858/วัน; Kimi ≈ $1,395/วัน — ต่างกันประมาณ $16,000/เดือน.

• ด้วยการแคชบน repo ที่เสถียร: อินพุตที่แคชของ Qwen ที่ $0.25/1M ทำให้ต้นทุนการรันอยู่ที่ ≈ $0.14; อัตราการแคชฮิต $0.30 ของ Kimi ทำให้ต้นทุนอยู่ที่ ≈ $0.26.

ช่องว่างนั้นมีจริงทั้งสองด้าน และผลลัพธ์จาก Trilogy ยิ่งทำให้มันทวีความรุนแรงขึ้น: ถ้า Qwen ใช้คำขอเกตเวย์น้อยกว่าครึ่งหนึ่งจริงๆ เพื่อทำงานที่เทียบเคียงได้ ความแตกต่างด้านต้นทุนที่แท้จริงสำหรับงานแบบเอเจนต์ก็จะกว้างกว่าที่เรตการ์ดเพียงอย่างเดียวบอกไว้

ทั้งสองโมเดลเรียกเก็บค่าโทเค็นการคิดเป็นเอาต์พุต ดังนั้นการกำหนดค่าที่เน้นการใช้เหตุผลมากจึงมีค่าใช้จ่ายสูงกว่าการประมาณคร่าวๆ ในทั้งสองกรณี — แต่อัตรา $6 ของ Qwen ทำให้ค่าใช้จ่ายเพิ่มเติมนั้นเล็กลง 2.5 เท่า

ความเปิดกว้าง: ใกล้เคียงกัน แต่จังหวะเวลาแตกต่างกัน

นี่คือจุดที่ทั้งสองมีความคล้ายคลึงกันมากที่สุด และความแตกต่างเป็นเรื่องของความพร้อมล้วนๆ น้ำหนักของโมเดล Kimi K3 เปิดเผยและพร้อมใช้งานโดยพื้นฐานแล้ว ส่วนของ Qwen3.8-Max ถูกสัญญาว่าจะปล่อยภายในสัปดาห์นี้ โดยยังไม่มีข้อความใบอนุญาต โมเดลการ์ด หรือพื้นที่เก็บข้อมูลให้เห็น — และใบอนุญาตคือสิ่งที่กำหนดว่าคุณจะสามารถใช้โมเดลในเชิงพาณิชย์ได้หรือไม่เลย

ในทางปฏิบัติ เรือธงทั้งสองรุ่นไม่สามารถโฮสต์เองได้โดยทีมทั่วไป Qwen ที่ 2.4T มีขนาดประมาณ 1.2TB ในรูปแบบ 4-bit เทียบกับประมาณ 141GB ต่อ H200; ส่วน Kimi ที่ 2.8T ใหญ่กว่านั้นอีก ทั้งคู่ต้องใช้ตัวเร่งความเร็วระดับสูงสุดแปดตัวขึ้นไป และการที่ Alibaba ไม่เปิดเผยจำนวนพารามิเตอร์แอ็กทีฟ หมายความว่าคุณไม่สามารถแม้แต่จะจำลองปริมาณงานของ Qwen ได้

ซึ่งเป็นเหตุผลว่าทำไมสิ่งที่ประกาศพร้อมกันQwen3.8-27Bจึงมีความสำคัญที่นี่ อีกทั้งยังเปิดเป็น open-weights และรายงานว่าใช้ประมาณ17GB ของ VRAM, มันทำให้ตระกูล Qwen มีเรื่องราวการใช้งานภายในองค์กรที่แท้จริง ซึ่งเรือธง 2.4T หรือ 2.8T ต่างก็ไม่สามารถให้ได้ หากเหตุผลที่แท้จริงของคุณในการเลือกระหว่างสองตัวนี้คือการเปิดเผยน้ำหนัก (open weights) 27B จะเปลี่ยนสมการมากกว่ายักษ์ใหญ่ทั้งสองตัว

คำถามที่พบบ่อย

Qwen 3.8 ดีกว่า Kimi K3 หรือ?

ไม่ได้อยู่บนพื้นฐานของหลักฐานที่ผ่านการตรวจสอบ Kimi K3 มีดัชนีความฉลาด AA อิสระที่ 57.1 (อันดับ 3) และครองตำแหน่ง #1 ด้านโค้ดส่วนหน้าของ LMArena ขณะที่ Qwen3.8-Max ยังไม่ถูกให้คะแนนโดยผู้ประเมินภายนอกทุกราย ในการทดสอบโดยตรงเพียงครั้งเดียวที่มีอยู่ Kimi ชนะ 83 ต่อ 80 ข้อได้เปรียบของ Qwen คือราคา (ผลลัพธ์ที่ถูกกว่า 2.5 เท่า) และในการทดสอบเดียวกันนั้น การใช้เครื่องมือที่สะอาดกว่า

รุ่นไหนใหญ่กว่า?

Kimi K3 ที่มีพารามิเตอร์รวม 2.8T เทียบกับ Qwen3.8-Max ที่ 2.4T — มากกว่าประมาณ 400B อย่างไรก็ตาม ทั้งคู่ไม่ได้เปิดเผยข้อมูลเพียงพอที่จะทำให้ตัวเลขนี้มีความหมาย เพราะ Alibaba ไม่เคยเผยแพร่จำนวนพารามิเตอร์แอคทีฟของ Qwen ซึ่งเป็นตัวเลขที่กำหนดต้นทุนการให้บริการจริงในโมเดล Mixture-of-Experts

อันไหนถูกกว่า?

Qwen3.8-Max อย่างชัดเจน ตั้งแต่ GA โดยระบุราคา $2 / $6 ต่อ 1M เทียบกับ Kimi K3 ที่ $3 / $15 — น้อยกว่า 33% สำหรับ input และน้อยกว่า 2.5 เท่าสำหรับ output อัตราของ Qwen คงที่ตลอด context ขนาด 1M และ cached input ที่ราคา $0.25 นั้นต่ำกว่าราคา cache-hit ของ Kimi ที่ $0.30 เล็กน้อย

การทดสอบแบบตัวต่อตัวแสดงให้เห็นอะไรจริงๆ?

งานวัดความเข้าใจสถาปัตยกรรมของ Trilogy AI ให้คะแนน Kimi 83 และ Qwen 80 แต่ Qwen อ้างอิง repo 354 รายการ เทียบกับ Kimi ที่ 274 รายการ ใช้คำขอเกตเวย์ 22 ครั้ง เทียบกับ 53 ครั้ง ไม่มีความผิดพลาดของ tool call เลย เทียบกับสองครั้ง และได้คะแนนการใช้เครื่องมือ 9/10 เทียบกับ Kimi ที่ 8/10 Kimi ให้คำตอบที่ดีกว่า ส่วน Qwen เป็นเอเจนต์ที่มีวินัยมากกว่า เป็นเพียงงานเดียว ดังนั้นควรถือเป็นข้อมูลจุดหนึ่ง ไม่ใช่การจัดอันดับ

Qwen 3.8 Max ออกจากช่วงพรีวิวแล้วหรือยัง?

ใช่ ในวันที่ 3 สิงหาคม 2026 พร้อมด้วยอัตราค่าบริการที่เผยแพร่และปลายทาง (endpoint) ที่เข้ากันได้กับ OpenAI และ DashScope แคมเปญเครดิต Qoder ของเดือนกรกฎาคมไม่ได้อธิบายวิธีการจำหน่ายอีกต่อไป

อันไหนเร็วกว่ากัน?

อาจเป็น Qwen ในตอนนี้ ซึ่งพลิกสมมติฐานในยุคพรีวิว Artificial Analysis วัด Kimi K3 ได้ time-to-first-token (เวลาจนถึงโทเค็นแรก) ประมาณ 34 วินาที; telemetry ช่วง GA 7 วันของ OrcaRouter แสดง Qwen3.8-Max ที่ p50 TTFT 1.64 วินาที ข้อมูลจากแหล่งต่างกันและไม่ใช่การเปรียบเทียบแบบควบคุม แต่ทั้งสองโมเดลมีชื่อเสียงเรื่องความเยิ่นเย้อ และ TTFT ที่วัดได้ของ Kimi นั้นช้าจริงๆ

ฉันสามารถโฮสต์เองได้หรือไม่?

ไม่สมจริงในระดับเรือธง — โมเดล 2.4T และ 2.8T ต้องใช้ GPU ระดับ H200 จำนวนแปดตัวขึ้นไป น้ำหนักของ Kimi พร้อมใช้งานแล้ววันนี้ ส่วนของ Qwen สัญญาว่าจะมาภายในสัปดาห์นี้แต่ยังไม่มีใบอนุญาต สำหรับตัวเลือก on-premise ที่แท้จริง Qwen3.8-27B ที่ประกาศพร้อมกัน (รายงานว่าต้องใช้ VRAM ประมาณ 17GB) เป็นตัวเลือกที่ใช้งานได้จริงในตระกูล Qwen

บรรทัดล่าง

Qwen 3.8 เทียบกับ Kimi K3 เป็นคู่ที่สูสีที่สุดในซีรีส์นี้ และการเปิดให้ใช้งานทั่วไปก็แบ่งการเปรียบเทียบออกเป็นสองแกนอย่างชัดเจน Kimi K3 ยังครองมงกุฎด้านคุณภาพด้วยผลที่ผู้ตัดสินวัดไว้: 57.1 ใน Intelligence Index, อันดับสามโดยรวม และตำแหน่งสูงสุดในหมวดโค้ดฟรอนต์เอนด์ของ LMArena สิ่งเหล่านี้ไม่ใช่คำกล่าวอ้าง — แต่คือผลลัพธ์ และ Qwen ไม่มีสิ่งใดเทียบเท่าได้เลย

สิ่งที่ Qwen ชนะเมื่อวันที่ 3 สิงหาคมคือเรื่องเศรษฐศาสตร์ และมันชนะอย่างเด็ดขาด: $2 / $6 เทียบกับ $3 / $15 ซึ่งเป็นเรตคงที่ต่อล้านโทเค็น พร้อมแคชที่ถูกกว่าเล็กน้อย เพิ่มผลการค้นพบของ Trilogy ที่ว่า Qwen ทำงานแบบ agentic ที่เทียบเคียงได้สำเร็จโดยใช้คำขอเกตเวย์เพียงครึ่งเดียวและไม่มีการเรียกใช้เครื่องมือที่ล้มเหลวแม้แต่ครั้งเดียว Qwen จึงดูเหมือนโมเดลที่ดำเนินงานได้มีประสิทธิภาพมากกว่า แม้ในจุดที่มันแม่นยำน้อยกว่า จับตาสองเหตุการณ์: คะแนน Intelligence Index อิสระครั้งแรกสำหรับ Qwen3.8-Max และการปล่อยน้ำหนักพร้อมใบอนุญาต ถ้า Qwen ได้คะแนนใกล้เคียงกับ 57.1 ของ Kimi ช่องว่างราคาจะทำให้ยากมากที่จะเลือก Kimi สำหรับงานปริมาณมาก จนกว่าจะถึงเวลานั้น Kimi คือโมเดลที่คุณไว้ใจ และ Qwen คือโมเดลที่คุณพอจะจ่ายเพื่อรันได้ — และวิธีเลือกอย่างตรงไปตรงมาคือบนพื้นที่เก็บข้อมูลของคุณเอง

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube