
Gemini 3.5 Flash-Lite เทียบกับ Qwen 3.8: ม้าทำงานราคาถูก เทียบกับ เรือธง 2.4T
- qwenใหม่Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 ต่อ 1 ล้านโทเค็น · 56 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3150ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 200 tok/s
- orcaใหม่OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicใหม่Anthropic: Claude Opus 52026-07-2461ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2150ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1651ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1557ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0951ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0955ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0959ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0854ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0641ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3053ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1651ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242ความฉลาด61การเขียนโค้ด61คณิตศาสตร์
เมื่อการเปรียบเทียบนี้ถูกเขียนขึ้นครั้งแรก มันไม่สมดุลกันอย่างผิดปกติ: Gemini 3.5 Flash-Liteเป็นผลิตภัณฑ์จริงที่ซื้อได้ และQwen 3.8เป็นพรีวิวแบบจำกัดสิทธิ์ ไม่มีราคา ไม่มีผลการวัดประสิทธิภาพ และไม่มีน้ำหนักโมเดล แทบไม่มีอะไรให้เปรียบเทียบเลย
สถานการณ์เช่นนั้นไม่ได้เกิดขึ้นอีกต่อไปแล้ว Qwen3.8-Max เปิดให้บริการทั่วไปเมื่อวันที่ 3 สิงหาคม 2026 พร้อมกับตารางอัตราค่าบริการที่เผยแพร่ไว้ที่ $2 / $6 ต่อล้านโทเค็น เอนด์พอยต์ที่เข้ากันได้กับ OpenAI และ DashScope และตารางเกณฑ์มาตรฐานแบบเต็มรูปแบบ มันใช้งานได้ด้วยตัวเอง ควบคุมงบประมาณได้ และเปิดให้บริการจริง — รวมถึงบน OrcaRouter ด้วย ดังนั้นบทความนี้จึงถูกเขียนขึ้นใหม่ทั้งหมด เพราะการเปรียบเทียบอย่างตรงไปตรงมาในวันนี้ไม่ใช่ "โมเดลที่วางจำหน่ายเทียบกับสิ่งที่ยังเป็นเพียงแนวคิด" แต่เป็นการเปรียบเทียบระดับชั้นอย่างแท้จริง: ม้าศึกความจุสูงราคาถูกที่สุดของ Google เทียบกับเรือธงใหญ่ที่สุดของ Alibaba
หมายเหตุถึงผู้สร้าง — ทั้งสองตัวนี้อยู่คนละปลายสุดของเส้นโค้งต้นทุน ดังนั้นคำถามที่ถูกต้องคือปริมาณงานของคุณอยู่ในระดับใด OrcaRouter เชื่อมต่อโมเดล 200+ รายการไว้เบื้องหลังเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI คุณจึงทดสอบทั้งสองบนงานเดียวกันได้โดยไม่ต้องต่อ SDK สองตัว
TL;DR บทสรุป. โมเดลเหล่านี้ไม่ได้แข่งขันกันจริง ๆ — พวกมันคือคำตอบของคำถามที่แตกต่างกัน Flash-Lite เป็นโมเดลที่เน้นประสิทธิภาพ: Artificial Analysis Index 36, $0.30 / $2.50 ต่อ 1M, ประมาณ 490 tokens/sec, เปิดให้ใช้งานทั่วไป มันถูกออกแบบมาให้รันได้กับทุกคำขอด้วยต้นทุนที่แทบไม่มีเลย Qwen3.8-Max เป็นโมเดลเรือธง: พารามิเตอร์ ~2.4T, บริบทอัตราคงที่ 1M โทเคน, รองรับอินพุตรูปภาพและวิดีโอแบบเนทีฟ และคะแนนระดับแนวหน้าจากการรายงานตนเอง (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) — ที่ $2 / $6, ซึ่งคิดเป็น 6.7 เท่าของอัตราอินพุตของ Flash-Lite Flash-Lite เป็นตัวเลือกเริ่มต้นที่เหมาะสมสำหรับงานจำแนก, การกำหนดเส้นทาง, และการสกัดข้อมูลปริมาณมาก Qwen3.8-Max คือสิ่งที่คุณจะยกระดับไปใช้เมื่องานต้องการการให้เหตุผลระดับแนวหน้าอย่างแท้จริง, บริบทหนึ่งล้านโทเคน, หรืออินพุตที่ไม่ใช่ข้อความ ข้อแม้หนึ่งที่ไม่เปลี่ยนแปลง: Qwen ยังไม่มีคะแนนจากเกณฑ์วัดอิสระ
ประเด็นสำคัญ
• Qwen 3.8 พร้อมใช้งานทั่วไปแล้ว — ณ วันที่ 3 สิงหาคม 2026 ได้มีการเผยแพร่ราคา การเข้าถึงแบบบริการตนเอง และตาราง benchmark แล้ว กรอบแนวคิดก่อนหน้านี้ที่เกี่ยวกับการแสดงตัวอย่างแบบจำกัดสิทธิ์และไม่สามารถจัดสรรงบประมาณได้นั้นล้าสมัยแล้ว
• Flash-Lite ถูกกว่าอย่างมาก: $0.30 / $2.50 ต่อ 1M เทียบกับของ Qwen $2 / $6 — ประมาณ 6.7× สำหรับอินพุต และ 2.4× สำหรับเอาต์พุต.
• Flash-Lite เร็วกว่ามาก: ประมาณ 490 tokens/วินาที ซึ่งสร้างมาเพื่องานที่มีปริมาณการประมวลผลสูง. Qwen3.8-Max แสดงค่า p50 time-to-first-token ที่ 1.64 วินาที จากข้อมูลเทเลเมทรี 7 วันของ OrcaRouter แต่เป็นโมเดลที่ใหญ่และละเอียดรอบคอบ
• Flash-Lite เป็นเพียงรายเดียวที่มีคะแนนที่ผ่านการตรวจสอบ: Artificial Analysis Index 36. Qwen3.8-Max ยังคง ไม่ได้รับการประเมิน โดยผู้ประเมินอิสระทุกคน แม้ว่าตอนนี้ Alibaba จะเผยแพร่ตัวเลขของตัวเองแล้วก็ตาม
• Qwen ชนะอย่างเด็ดขาดในด้านความสามารถ:ซึ่งก็คือบริบท 1M-token ที่คิดค่าบริการแบบคงที่ โดยไม่มีค่าใช้จ่ายเพิ่มเติมสำหรับพรอมป์ยาว พร้อมทั้งรองรับอินพุตข้อความ/ภาพ/วิดีโอ และ OmniDocBench 1.5 92.1 สำหรับการแยกวิเคราะห์เอกสาร Flash-Lite เป็นโมเดลขนาดเล็กที่เน้นประสิทธิภาพ
• โอเพนเวต: ทาง Qwen สัญญาว่าจะปล่อยภายในสัปดาห์นี้ (ยังไม่มีใบอนุญาต) และยังมี Qwen3.8-27B ที่รายงานว่ารันใน VRAM ~17GB ส่วน Flash-Lite ถูกปิดถาวร
หมายเหตุด้านความถูกต้อง: ตัวเลขคุณภาพทั้งหมดของ Qwen3.8-Max เป็นข้อมูลที่รายงานโดย Alibaba เอง ยังไม่ผ่านการตรวจสอบจากบุคคลที่สาม ตัวเลขของ Gemini 3.5 Flash-Lite มาจาก Artificial Analysis ราคาของ Qwen เป็นอัตราค่าใช้บริการ GA จาก Alibaba Model Studio และใช้แทนการเข้าถึงในช่วงพรีวิวที่อธิบายไว้ในบทความเวอร์ชันก่อนหน้านี้
สเปกและราคา เปรียบเทียบเคียงข้างกัน
• ผู้ผลิต / สถานะ — Flash-Lite: Google; พร้อมใช้งานทั่วไป; Qwen3.8-Max: Alibaba; GA (3 สิงหาคม 2026)
• การวางตำแหน่ง — Flash-Lite: ระดับประสิทธิภาพที่ราคาถูกและปริมาณงานสูง; Qwen3.8-Max: เรือธง / ความทะเยอทะยานระดับแนวหน้า
• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: ยังไม่มีการให้คะแนน
• คะแนนที่รายงานโดยผู้ผลิต — Flash-Lite: ตัวเลขที่แสดงวัดโดยบุคคลที่สาม; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (ทั้งหมดรายงานโดย Alibaba)
• ราคา (ต่อ 1M, อินพุต / เอาต์พุต) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, คงที่ตลอดคอนเท็กซ์ 1M; อินพุตแคช $0.25
• ความเร็ว — Flash-Lite: ~490 โทเคน/วินาที (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1.64 วินาที (OrcaRouter ข้อมูลเทเลเมทรี 7 วัน)
• บริบท — Flash-Lite: บริบทระดับประสิทธิภาพ; Qwen3.8-Max: 1M โทเคน (983,616 เมื่อใช้โหมดคิด; เอาต์พุตสูงสุด 131,072)
• โมดาลิตี้ — Flash-Lite: โมเดลประสิทธิภาพที่เน้นข้อความ; Qwen3.8-Max: ข้อความ รูปภาพ วิดีโอเข้า → ข้อความออก
• น้ำหนักโมเดล — Flash-Lite: ปิดอยู่ ใช้ผ่าน API เท่านั้น; Qwen3.8-Max: สัญญาว่าจะปล่อยภายในสัปดาห์นี้ ยังไม่มีใบอนุญาต
• เข้าถึงได้วันนี้ — Flash-Lite: API มาตรฐาน, บริการด้วยตนเอง; Qwen3.8-Max: API มาตรฐาน, บริการด้วยตนเอง (Model Studio, DashScope, OrcaRouter)
เมื่อจัดวางแบบนี้ ผลลัพธ์ที่พบก็ต่างไปจากเดิมโดยสิ้นเชิง คอลัมน์ของ Qwen ไม่ได้ว่างเปล่าอีกต่อไป — มันเต็ม และในหลายแถวก็เป็นตัวเลือกที่แข็งแกร่งกว่า สิ่งที่มาแทนกรอบเดิมแบบ "สิ่งที่รู้จักเทียบกับคำมั่นสัญญา" คือช่องว่างของระดับชั้นที่ตรงไปตรงมา: Flash-Lite มีราคาถูกกว่าในส่วนอินพุตประมาณ 6.7 เท่า และเร็วกว่าในแง่ปริมาณงานประมาณ 13 เท่า ในขณะที่ Qwen นำเสนอบริบทมัลติโมดัลหนึ่งล้านโทเคนและความสามารถในการให้เหตุผลที่อ้างว่าอยู่ระดับแนวหน้าทั้งสองต่างเป็นผลิตภัณฑ์ที่ใช้งานได้จริง เพียงแต่ทำหน้าที่ต่างกัน
แถวเดียวที่คำเตือนเดิมยังคงใช้ได้คือแถวเกณฑ์มาตรฐาน ดัชนี 36 ของ Flash-Lite ถูกวัดโดย Artificial Analysis บนลีดเดอร์บอร์ดสาธารณะ ตัวเลขทุกรายการของ Qwen — GPQA Diamond 92.6, Terminal-Bench 86.6 และที่เหลือ — ถูกสร้างโดย Alibaba บนฮาร์เนสของตัวเอง นั่นคือการปรับปรุงที่แท้จริงเมื่อเทียบกับการไม่เผยแพร่อะไรเลย แต่ไม่ใช่การตรวจสอบโดยบุคคลที่สาม และห้องแล็บต่างก็เผยแพร่เกณฑ์มาตรฐานที่ตัวเองชนะ

Index 36 เทียบกับเรือธงที่ไม่ได้คะแนน: อ่านสิ่งนี้อย่างตรงไปตรงมา
เป็นเรื่องน่าดึงดูดที่จะนำ Index 36 ของ Flash-Lite ไปเทียบกับ GPQA Diamond 92.6 ของ Qwen แล้วประกาศว่าเป็นการชนะขาดลอย แต่นั่นจะเป็นความผิดพลาดเชิงหมวดหมู่ถึงสองเท่า
ประการแรก Artificial Analysis Intelligence Index เป็นค่าประกอบจากหลายภารกิจ; GPQA Diamond เป็นการทดสอบวิทยาศาสตร์ระดับบัณฑิตศึกษาเพียงรายการเดียว ทั้งสองไม่ได้อยู่ในมาตราส่วนเดียวกันและไม่สามารถนำมาลบออกจากกันได้
ประการที่สอง และที่สำคัญยิ่งกว่านั้น Flash-Lite ไม่เคยถูกออกแบบมาเพื่อให้ได้คะแนนสูง ดัชนี 36 คือสิ่งที่โมเดลที่เน้นประสิทธิภาพควรเป็น เป้าหมายทางวิศวกรรมของ Google คือการสร้างโมเดลที่ราคาถูกและเร็วพอที่จะวางไว้หน้าคำขอที่เข้ามาทุกรายการ ไม่ว่าจะเป็นการจัดเส้นทางตั๋ว การจำแนกประเภท การแยกข้อมูล หรือการสรุปเนื้อหาในปริมาณมาก ซึ่งโมเดลระดับแนวหน้าจะไม่คุ้มค่าทางเศรษฐกิจอย่างสิ้นเชิง การตัดสินมันเทียบกับโมเดลเรือธงขนาด 2.4T บนเพดานความสามารถด้านการใช้เหตุผลนั้น มองข้ามจุดประสงค์ที่แท้จริงของมันไป
สิ่งที่เราสามารถกล่าวได้นั้นแคบลงแต่มีประโยชน์มากขึ้น Qwen3.8-Max มีความเป็นไปได้สูงมากที่จะเป็นโมเดลที่มีความสามารถเหนือกว่าอย่างมีนัยสำคัญ — ตัวเลขที่รายงานด้วยตนเองของมันสูงกว่าที่โมเดล Index-36 จะทำได้มาก และการกระโดดของ FrontierSWE จาก 40.7 ของรุ่นก่อนหน้ามาเป็น 73.5 บ่งชี้ถึงความก้าวหน้าที่แท้จริง แต่ "มีความเป็นไปได้สูงมาก" ยังคงเป็นการอนุมาน เนื่องจากยังไม่มีผู้ประเมินอิสระให้คะแนนมัน เพื่อเป็นบริบท Qwen3.7-Max รุ่นก่อนหน้าได้คะแนน 46 บน AA Index — สูงกว่า Flash-Lite ที่ได้ 36 แต่ก็ยังห่างไกลจากระดับแนวหน้ามาก — ดังนั้นการก้าวกระโดดข้ามรุ่นที่ Alibaba สื่อเป็นนัยจึงมีขนาดใหญ่และยังไม่ได้รับการยืนยัน
ผลในทางปฏิบัติ: หากงานของคุณเป็นงานที่ Flash-Lite ทำสำเร็จอย่างถูกต้องอยู่แล้ว เพดานความสามารถที่สูงกว่าของ Qwen ก็ไม่มีค่าสำหรับคุณ และคุณจะต้องจ่ายถึง 6.7 เท่าสำหรับมัน เพดานความสามารถจะมีความสำคัญก็ต่อเมื่อ Flash-Lite กำลังล้มเหลวจริงๆ เท่านั้น
ต้นทุนในทางปฏิบัติ: ช่องว่างระหว่างระดับในตัวเลข
ลองพิจารณางานจำแนกประเภทที่มีปริมาณสูง: อินพุต 2,000 โทเคน เอาต์พุต 200 โทเคน รัน 500,000 ครั้งต่อวัน — ซึ่งเป็นรูปแบบการคัดแยกงานสนับสนุนหรือการจัดเส้นทางเนื้อหาที่สมจริง
• Flash-Lite: ต่อครั้ง, 0.002M × $0.30 = $0.0006, บวก 0.0002M × $2.50 = $0.0005. ≈ $0.0011 ต่อครั้ง → ~$550/วัน.
• Qwen3.8-Max: ต่อครั้ง, 0.002M × $2 = $0.004, บวก 0.0002M × $6 = $0.0012. ≈ $0.0052 ต่อครั้ง → ~$2,600/วัน.
• รายเดือน: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — ความแตกต่าง $61,500 สำหรับปริมาณงานที่เท่ากัน
ในขนาดนั้น การเลือกเทียร์เป็นรายการที่ใหญ่ที่สุดเพียงรายการเดียวในระบบ และยากมากที่จะให้เหตุผลในการใช้เรือธงสำหรับงานที่โมเดลประสิทธิภาพจัดการได้ นี่คือสถานการณ์ที่ Flash-Lite มีไว้โดยเฉพาะ
ทีนี้กลับด้านมัน ใช้โจทย์เอกสารยาว: บริบท 600,000 โทเคน, ผลลัพธ์ 5,000 โทเคน, 200 ครั้งต่อวัน
• Qwen3.8-Max: 0.6M × $2 = $1.20 บวก 0.005M × $6 = $0.03. ≈ $1.23 ต่อครั้ง โดยไม่มีค่าธรรมเนียมเพิ่มเติมสำหรับพรอมป์ต์ยาว — และประมาณ $0.18 หากบริบทถูกแคชที่ $0.25/1M.
• Flash-Liteไม่สามารถกำหนดราคาสำหรับรูปแบบนี้ได้เลย เนื่องจากบริบทการเรียกครั้งเดียวที่มี 600,000 โทเคนไม่ใช่สิ่งที่โมเดลระดับประสิทธิภาพถูกสร้างขึ้นมาเพื่อรองรับ
ดังนั้นคำตอบจึงพลิกกลับโดยสิ้นเชิงตามรูปร่างของเวิร์กโหลด ซึ่งเป็นบทเรียนที่แท้จริง Flash-Lite ชนะงานปริมาณสูงบริบทสั้นอย่างขาดลอย Qwen ชนะอะไรก็ตามที่ต้องใช้ล้านโทเคนหรืออินพุตที่ไม่ใช่ข้อความ ซึ่ง Flash-Lite ไม่ใช่ตัวเลือกที่ถูกกว่า แต่ไม่ใช่ตัวเลือกเลย

สถานการณ์: ระดับใดที่เหมาะสม
การคัดแยกและจัดเส้นทางการสนับสนุนในปริมาณมาก Flash-Lite ชัดเจน ดัชนี 36 เพียงพอสำหรับการจัดหมวดหมู่ และที่ราคาประมาณ $0.0011 ต่อการเรียกใช้ คุณสามารถรันกับทุกตั๋วได้ ส่งต่อเฉพาะกลุ่มส่วนน้อยที่คลุมเครือไปยังโมเดลขนาดใหญ่เท่านั้น
การวิเคราะห์สัญญาหรือเอกสารยื่นทั้งฉบับ Qwen3.8-Max บริบทอัตราคงที่ 1M หมายความว่าเอกสาร 400 หน้าสามารถประมวลผลได้ในการเรียกครั้งเดียวโดยไม่มีค่าธรรมเนียมเพิ่มเติมและไม่ต้องแบ่งส่วน และคะแนน OmniDocBench 1.5 92.1 ที่รายงานด้วยตนเองนั้นมุ่งเป้าไปที่งานนี้โดยเฉพาะ
ไปป์ไลน์สำหรับภาพหน้าจอ แผนภูมิ หรือวิดีโอ Qwen3.8-Max โดยค่าเริ่มต้น — รองรับอินพุตรูปภาพและวิดีโอ และรายงานผล OSWorld-Verified 86.1 ในการควบคุม GUI จริง Flash-Lite ไม่ใช่ตัวเลือกสำหรับอินพุตที่ไม่ใช่ข้อความ
การเขียนโค้ดแบบเอเจนต์. Qwen3.8-Max จากตัวเลขที่อ้างไว้ (Terminal-Bench 2.1 86.6, FrontierSWE 73.5) โดยมีข้อแม้ว่าไม่มีตัวเลขใดได้รับการตรวจสอบอย่างอิสระ และคะแนนที่รายงานด้วยตนเองต่ำที่สุดคือ IFBench 82.8 ในการทำตามคำสั่ง ซึ่งเป็นความเสี่ยงจริงสำหรับไปป์ไลน์ที่แยกวิเคราะห์ผลลัพธ์ของแต่ละขั้นตอน
สถาปัตยกรรมสองชั้น บ่อยครั้งคำตอบที่ถูกต้องคือทั้งคู่: Flash-Lite เป็นตัวผ่านแรกที่ราคาถูกในทุกคำขอ Qwen3.8-Max เป็นเส้นทางการยกระดับสำหรับส่วนน้อยที่ต้องการล้านโทเค็น รูปภาพ หรือการให้เหตุผลอย่างแท้จริง รูปแบบนั้นเก็บข้อได้เปรียบด้านต้นทุนของ Flash-Lite ไว้ได้เกือบทั้งหมด พร้อมคงตัวเลือกระดับแนวหน้าไว้ให้ใช้
การโฮสต์ด้วยตนเองและความเปิดกว้าง
Flash-Lite ถูกปิดและใช้งานผ่าน API เท่านั้นอย่างถาวร — ไม่มีเส้นทางสำหรับ self-host
น้ำหนักของ Qwen3.8-Max ถูกสัญญาว่าจะปล่อยภายในสัปดาห์นี้ แต่รุ่นเรือธงไม่ใช่เป้าหมายที่สมจริง: ประมาณ 1.2TB ที่ 4-bit เทียบกับประมาณ 141GB ต่อ H200 หมายความว่าต้องใช้ตัวเร่งความเร็วระดับสูงแปดตัวขึ้นไป และ Alibaba ยังไม่ได้เปิดเผยจำนวนพารามิเตอร์ที่ใช้งานจริง ดังนั้นปริมาณงานที่การลงทุนนั้นจะให้มาจึงไม่สามารถคำนวณแบบจำลองได้ นอกจากนี้ยังไม่มีข้อความใบอนุญาต ซึ่งหมายความว่าความสามารถในการใช้งานเชิงพาณิชย์ยังไม่ถูกกำหนดอย่างเป็นทางการ
ที่ประกาศออกมาพร้อมกัน Qwen3.8-27B คือรุ่นที่สำคัญจริงๆ สำหรับแผนการใช้งานภายในองค์กร อีกทั้งยังเปิดน้ำหนักโมเดล (open-weights) และมีรายงานว่าต้องใช้หน่วยความจำประมาณ 17GB VRAM ซึ่งเป็นตัวเลือกการโฮสต์ด้วยตนเองอย่างแท้จริง — และที่น่าสังเกตคือ เป็นคู่แข่งที่ใกล้เคียงกับกลุ่มเฉพาะด้านประสิทธิภาพของ Flash-Lite มากกว่าตัวเรือธงขนาด 2.4T มาก
คำถามที่พบบ่อย
วันนี้ฉันใช้ Qwen 3.8 ได้ไหม
ใช่ Qwen3.8-Max เปิดให้ใช้งานทั่วไปแล้วเมื่อวันที่ 3 สิงหาคม 2026 โดยมีราคาที่เผยแพร่ที่ $2 / $6 ต่อ 1M โทเค็น และมี endpoint ที่เข้ากันได้กับ OpenAI และ DashScope บริการนี้ใช้งานได้ด้วยตนเองผ่าน Alibaba Model Studio, DashScope และ OrcaRouter บทความเวอร์ชันก่อนหน้านี้ได้อธิบายถึงการแสดงตัวอย่างแบบมีการควบคุม (gated preview) ซึ่งข้อมูลนั้นล้าสมัยแล้ว
อันไหนถูกกว่า?
Gemini 3.5 Flash-Lite ชนะขาดลอย: $0.30 / $2.50 ต่อ 1M เทียบกับ $2 / $6 ของ Qwen3.8-Max — ถูกกว่าประมาณ 6.7 เท่าในส่วน input และ 2.4 เท่าในส่วน output สำหรับงานปริมาณมากที่มีบริบทสั้น ความแตกต่างนี้สำคัญเหนือปัจจัยอื่นๆ ทั้งหมด
อันไหนดีกว่ากัน?
พวกมันเป็นคนละระดับกัน Flash-Lite มีคะแนนที่ผ่านการตรวจสอบเพียงหนึ่งเดียว (AA Index 36) แต่มันถูกสร้างมาเพื่อปริมาณงานที่ต้นทุนต่ำ ไม่ใช่เพื่อการให้เหตุผล ส่วน Qwen3.8-Max มีแนวโน้มสูงมากที่จะมีความสามารถมากกว่าอย่างเห็นได้ชัด — คะแนนที่รายงานด้วยตนเองอย่าง GPQA Diamond 92.6 และ Terminal-Bench 2.1 86.6 เป็นตัวเลขระดับแนวหน้า — แต่มันไม่มีเกณฑ์วัดอิสระ ดังนั้นสิ่งนั้นจึงยังคงเป็นการคาดคะเน ไม่ใช่ผลลัพธ์ที่วัดได้จริง
อันไหนเร็วกว่า?
Flash-Lite อย่างชัดเจน Artificial Analysis วัดได้ประมาณ 490 โทเคน/วินาที ซึ่งเป็นจุดประสงค์ของการออกแบบระดับประสิทธิภาพ (efficiency tier) Qwen3.8-Max แสดงค่า p50 time-to-first-token ที่ 1.64 วินาทีจากเทเลเมทรี 7 วันของ OrcaRouter แต่มันเป็นโมเดลที่ใหญ่และละเอียดถี่ถ้วน และผู้วิจารณ์ในยุคนำร่องพบว่ามันช้าในงานสร้าง agentic ที่ยาวนาน
ตอนนี้ Qwen 3.8 มี open weights หรือยัง
ยัง อาลีบาบาระบุว่าน้ำหนักของโมเดลเรือธงจะมาถึงภายในสัปดาห์นี้ แต่ก็ยังไม่มีไลเซนส์ โมเดลการ์ด หรือรีโพซิทอรี ต่อให้ปล่อยตัวออกมาแล้ว โมเดลขนาด 2.4T ก็ยังต้องใช้ GPU ระดับ H200 อย่างน้อยแปดตัวขึ้นไป ส่วน Qwen3.8-27B ที่ประกาศออกมาพร้อมกัน ซึ่งรายงานว่าใช้ VRAM ประมาณ 17GB นั้นเป็นตัวเลือกที่ใช้งานได้จริงสำหรับการโฮสต์เอง
ฉันควรใช้ทั้งสองอย่างไหม?
ส่วนใหญ่แล้วก็ใช่ การตั้งค่าแบบสองชั้น — ใช้ Flash-Lite เป็นด่านแรกที่ประหยัดสำหรับทุกคำขอ และใช้ Qwen3.8-Max เป็นช่องทางรองรับงานบริบทยาว งานหลายรูปแบบ หรืองานที่ยากจริงๆ — ยังคงข้อได้เปรียบด้านต้นทุนของ Flash-Lite ไว้เป็นส่วนใหญ่ ขณะเดียวกันก็มอบตัวเลือกระดับแนวหน้าที่คุ้มค่ากับราคาให้คุณ
วันนี้ควรเลือกอันไหนสำหรับการผลิตดี?
Flash-Lite สำหรับงานที่ต้องการปริมาณมาก บริบทสั้น และข้อความเท่านั้น ซึ่ง Index 36 ก็เพียงพอ — มันถูก รวดเร็ว ผ่านการตรวจสอบ และพิสูจน์แล้ว ส่วน Qwen3.8-Max ใช้เมื่อปริมาณงานต้องการบริบทถึงล้านโทเคน การรับรูปภาพหรือวิดีโอ หรือการให้เหตุผลที่ Flash-Lite พิสูจน์ได้ว่าทำไม่ได้ ทั้งคู่ตอนนี้สามารถนำไปใช้งานได้จริง ซึ่งไม่เป็นความจริงเมื่อการเปรียบเทียบนี้ถูกเขียนขึ้นครั้งแรก
บรรทัดล่าง
Gemini 3.5 Flash-Lite เทียบกับ Qwen 3.8เคยเป็นการเปรียบเทียบระหว่างผลิตภัณฑ์กับประกาศ แต่ไม่ใช่อีกต่อไป ตั้งแต่วันที่ 3 สิงหาคม 2026 Qwen3.8-Max เปิดให้ใช้งานทั่วไป มีการกำหนดราคา ใช้บริการได้ด้วยตนเอง และมีเอกสารประกอบครบถ้วน — ดังนั้นการวางกรอบอย่างตรงไปตรงมาก็คือการตัดสินใจเลือกระดับ มากกว่าความพร้อมใช้งาน
Flash-Lite ยังคงเป็นตัวเลือกเริ่มต้นที่ถูกต้องสำหรับงานที่มันถูกสร้างขึ้นมา: ด้วยราคา $0.30 / $2.50 และความเร็วประมาณ 490 โทเคนต่อวินาที มันประมวลผลทุกคำขอได้ในต้นทุนที่แทบเป็นเศษเงิน และดัชนี Index 36 ที่ผ่านการตรวจสอบแล้วก็เพียงพออย่างยิ่งสำหรับการจำแนกประเภท การจัดเส้นทาง และการแยกข้อมูล Qwen3.8-Max คือระดับการยกระดับ — บริบทแบบเหมาจ่ายล้านโทเคน รองรับการป้อนภาพและวิดีโอโดยตรง และอ้างความสามารถด้านการให้เหตุผลระดับแนวหน้า — ด้วยต้นทุนการป้อนข้อมูลที่สูงขึ้นประมาณ 6.7 เท่า จุดอ่อนที่ยังไม่ได้รับการแก้ไขของมันก็เหมือนเดิม: ยังไม่มีผู้ประเมินอิสระรายใดให้คะแนนมัน ดังนั้นเรื่องคุณภาพจึงต้องอาศัยตารางข้อมูลของ Alibaba เอง จับตาดูคะแนน Intelligence Index อิสระครั้งแรกและน้ำหนักของ Qwen3.8-27B ซึ่งจะแข่งขันกับกลุ่มตลาดเฉพาะของ Flash-Lite ได้โดยตรงมากกว่า ในระหว่างนี้ ให้เลือกตามลักษณะของปริมาณงาน — และพิจารณารันทั้งสองตัว

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
