Gemini 3.5 Flash-Lite เทียบกับ Qwen 3.8: ม้าทำงานราคาถูก เทียบกับ เรือธง 2.4T
Guides & Insights

Gemini 3.5 Flash-Lite เทียบกับ Qwen 3.8: ม้าทำงานราคาถูก เทียบกับ เรือธง 2.4T

ผู้เขียน

Jim Song

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อการเปรียบเทียบนี้ถูกเขียนขึ้นครั้งแรก มันไม่สมดุลกันอย่างผิดปกติ: Gemini 3.5 Flash-Liteเป็นผลิตภัณฑ์จริงที่ซื้อได้ และQwen 3.8เป็นพรีวิวแบบจำกัดสิทธิ์ ไม่มีราคา ไม่มีผลการวัดประสิทธิภาพ และไม่มีน้ำหนักโมเดล แทบไม่มีอะไรให้เปรียบเทียบเลย

สถานการณ์เช่นนั้นไม่ได้เกิดขึ้นอีกต่อไปแล้ว Qwen3.8-Max เปิดให้บริการทั่วไปเมื่อวันที่ 3 สิงหาคม 2026 พร้อมกับตารางอัตราค่าบริการที่เผยแพร่ไว้ที่ $2 / $6 ต่อล้านโทเค็น เอนด์พอยต์ที่เข้ากันได้กับ OpenAI และ DashScope และตารางเกณฑ์มาตรฐานแบบเต็มรูปแบบ มันใช้งานได้ด้วยตัวเอง ควบคุมงบประมาณได้ และเปิดให้บริการจริง — รวมถึงบน OrcaRouter ด้วย ดังนั้นบทความนี้จึงถูกเขียนขึ้นใหม่ทั้งหมด เพราะการเปรียบเทียบอย่างตรงไปตรงมาในวันนี้ไม่ใช่ "โมเดลที่วางจำหน่ายเทียบกับสิ่งที่ยังเป็นเพียงแนวคิด" แต่เป็นการเปรียบเทียบระดับชั้นอย่างแท้จริง: ม้าศึกความจุสูงราคาถูกที่สุดของ Google เทียบกับเรือธงใหญ่ที่สุดของ Alibaba

หมายเหตุถึงผู้สร้าง — ทั้งสองตัวนี้อยู่คนละปลายสุดของเส้นโค้งต้นทุน ดังนั้นคำถามที่ถูกต้องคือปริมาณงานของคุณอยู่ในระดับใด OrcaRouter เชื่อมต่อโมเดล 200+ รายการไว้เบื้องหลังเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI คุณจึงทดสอบทั้งสองบนงานเดียวกันได้โดยไม่ต้องต่อ SDK สองตัว

TL;DR บทสรุป. โมเดลเหล่านี้ไม่ได้แข่งขันกันจริง ๆ — พวกมันคือคำตอบของคำถามที่แตกต่างกัน Flash-Lite เป็นโมเดลที่เน้นประสิทธิภาพ: Artificial Analysis Index 36, $0.30 / $2.50 ต่อ 1M, ประมาณ 490 tokens/sec, เปิดให้ใช้งานทั่วไป มันถูกออกแบบมาให้รันได้กับทุกคำขอด้วยต้นทุนที่แทบไม่มีเลย Qwen3.8-Max เป็นโมเดลเรือธง: พารามิเตอร์ ~2.4T, บริบทอัตราคงที่ 1M โทเคน, รองรับอินพุตรูปภาพและวิดีโอแบบเนทีฟ และคะแนนระดับแนวหน้าจากการรายงานตนเอง (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) — ที่ $2 / $6, ซึ่งคิดเป็น 6.7 เท่าของอัตราอินพุตของ Flash-Lite Flash-Lite เป็นตัวเลือกเริ่มต้นที่เหมาะสมสำหรับงานจำแนก, การกำหนดเส้นทาง, และการสกัดข้อมูลปริมาณมาก Qwen3.8-Max คือสิ่งที่คุณจะยกระดับไปใช้เมื่องานต้องการการให้เหตุผลระดับแนวหน้าอย่างแท้จริง, บริบทหนึ่งล้านโทเคน, หรืออินพุตที่ไม่ใช่ข้อความ ข้อแม้หนึ่งที่ไม่เปลี่ยนแปลง: Qwen ยังไม่มีคะแนนจากเกณฑ์วัดอิสระ

ประเด็นสำคัญ

Qwen 3.8 พร้อมใช้งานทั่วไปแล้ว — ณ วันที่ 3 สิงหาคม 2026 ได้มีการเผยแพร่ราคา การเข้าถึงแบบบริการตนเอง และตาราง benchmark แล้ว กรอบแนวคิดก่อนหน้านี้ที่เกี่ยวกับการแสดงตัวอย่างแบบจำกัดสิทธิ์และไม่สามารถจัดสรรงบประมาณได้นั้นล้าสมัยแล้ว

Flash-Lite ถูกกว่าอย่างมาก: $0.30 / $2.50 ต่อ 1M เทียบกับของ Qwen $2 / $6 — ประมาณ 6.7× สำหรับอินพุต และ 2.4× สำหรับเอาต์พุต.

Flash-Lite เร็วกว่ามาก: ประมาณ 490 tokens/วินาที ซึ่งสร้างมาเพื่องานที่มีปริมาณการประมวลผลสูง. Qwen3.8-Max แสดงค่า p50 time-to-first-token ที่ 1.64 วินาที จากข้อมูลเทเลเมทรี 7 วันของ OrcaRouter แต่เป็นโมเดลที่ใหญ่และละเอียดรอบคอบ

Flash-Lite เป็นเพียงรายเดียวที่มีคะแนนที่ผ่านการตรวจสอบ: Artificial Analysis Index 36. Qwen3.8-Max ยังคง ไม่ได้รับการประเมิน โดยผู้ประเมินอิสระทุกคน แม้ว่าตอนนี้ Alibaba จะเผยแพร่ตัวเลขของตัวเองแล้วก็ตาม

Qwen ชนะอย่างเด็ดขาดในด้านความสามารถ:ซึ่งก็คือบริบท 1M-token ที่คิดค่าบริการแบบคงที่ โดยไม่มีค่าใช้จ่ายเพิ่มเติมสำหรับพรอมป์ยาว พร้อมทั้งรองรับอินพุตข้อความ/ภาพ/วิดีโอ และ OmniDocBench 1.5 92.1 สำหรับการแยกวิเคราะห์เอกสาร Flash-Lite เป็นโมเดลขนาดเล็กที่เน้นประสิทธิภาพ

โอเพนเวต: ทาง Qwen สัญญาว่าจะปล่อยภายในสัปดาห์นี้ (ยังไม่มีใบอนุญาต) และยังมี Qwen3.8-27B ที่รายงานว่ารันใน VRAM ~17GB ส่วน Flash-Lite ถูกปิดถาวร

หมายเหตุด้านความถูกต้อง: ตัวเลขคุณภาพทั้งหมดของ Qwen3.8-Max เป็นข้อมูลที่รายงานโดย Alibaba เอง ยังไม่ผ่านการตรวจสอบจากบุคคลที่สาม ตัวเลขของ Gemini 3.5 Flash-Lite มาจาก Artificial Analysis ราคาของ Qwen เป็นอัตราค่าใช้บริการ GA จาก Alibaba Model Studio และใช้แทนการเข้าถึงในช่วงพรีวิวที่อธิบายไว้ในบทความเวอร์ชันก่อนหน้านี้

สเปกและราคา เปรียบเทียบเคียงข้างกัน

• ผู้ผลิต / สถานะ — Flash-Lite: Google; พร้อมใช้งานทั่วไป; Qwen3.8-Max: Alibaba; GA (3 สิงหาคม 2026)

• การวางตำแหน่ง — Flash-Lite: ระดับประสิทธิภาพที่ราคาถูกและปริมาณงานสูง; Qwen3.8-Max: เรือธง / ความทะเยอทะยานระดับแนวหน้า

• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: ยังไม่มีการให้คะแนน

• คะแนนที่รายงานโดยผู้ผลิต — Flash-Lite: ตัวเลขที่แสดงวัดโดยบุคคลที่สาม; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (ทั้งหมดรายงานโดย Alibaba)

• ราคา (ต่อ 1M, อินพุต / เอาต์พุต) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, คงที่ตลอดคอนเท็กซ์ 1M; อินพุตแคช $0.25

• ความเร็ว — Flash-Lite: ~490 โทเคน/วินาที (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1.64 วินาที (OrcaRouter ข้อมูลเทเลเมทรี 7 วัน)

• บริบท — Flash-Lite: บริบทระดับประสิทธิภาพ; Qwen3.8-Max: 1M โทเคน (983,616 เมื่อใช้โหมดคิด; เอาต์พุตสูงสุด 131,072)

• โมดาลิตี้ — Flash-Lite: โมเดลประสิทธิภาพที่เน้นข้อความ; Qwen3.8-Max: ข้อความ รูปภาพ วิดีโอเข้า → ข้อความออก

• น้ำหนักโมเดล — Flash-Lite: ปิดอยู่ ใช้ผ่าน API เท่านั้น; Qwen3.8-Max: สัญญาว่าจะปล่อยภายในสัปดาห์นี้ ยังไม่มีใบอนุญาต

• เข้าถึงได้วันนี้ — Flash-Lite: API มาตรฐาน, บริการด้วยตนเอง; Qwen3.8-Max: API มาตรฐาน, บริการด้วยตนเอง (Model Studio, DashScope, OrcaRouter)

เมื่อจัดวางแบบนี้ ผลลัพธ์ที่พบก็ต่างไปจากเดิมโดยสิ้นเชิง คอลัมน์ของ Qwen ไม่ได้ว่างเปล่าอีกต่อไป — มันเต็ม และในหลายแถวก็เป็นตัวเลือกที่แข็งแกร่งกว่า สิ่งที่มาแทนกรอบเดิมแบบ "สิ่งที่รู้จักเทียบกับคำมั่นสัญญา" คือช่องว่างของระดับชั้นที่ตรงไปตรงมา: Flash-Lite มีราคาถูกกว่าในส่วนอินพุตประมาณ 6.7 เท่า และเร็วกว่าในแง่ปริมาณงานประมาณ 13 เท่า ในขณะที่ Qwen นำเสนอบริบทมัลติโมดัลหนึ่งล้านโทเคนและความสามารถในการให้เหตุผลที่อ้างว่าอยู่ระดับแนวหน้าทั้งสองต่างเป็นผลิตภัณฑ์ที่ใช้งานได้จริง เพียงแต่ทำหน้าที่ต่างกัน

แถวเดียวที่คำเตือนเดิมยังคงใช้ได้คือแถวเกณฑ์มาตรฐาน ดัชนี 36 ของ Flash-Lite ถูกวัดโดย Artificial Analysis บนลีดเดอร์บอร์ดสาธารณะ ตัวเลขทุกรายการของ Qwen — GPQA Diamond 92.6, Terminal-Bench 86.6 และที่เหลือ — ถูกสร้างโดย Alibaba บนฮาร์เนสของตัวเอง นั่นคือการปรับปรุงที่แท้จริงเมื่อเทียบกับการไม่เผยแพร่อะไรเลย แต่ไม่ใช่การตรวจสอบโดยบุคคลที่สาม และห้องแล็บต่างก็เผยแพร่เกณฑ์มาตรฐานที่ตัวเองชนะ

Index 36 เทียบกับเรือธงที่ไม่ได้คะแนน: อ่านสิ่งนี้อย่างตรงไปตรงมา

เป็นเรื่องน่าดึงดูดที่จะนำ Index 36 ของ Flash-Lite ไปเทียบกับ GPQA Diamond 92.6 ของ Qwen แล้วประกาศว่าเป็นการชนะขาดลอย แต่นั่นจะเป็นความผิดพลาดเชิงหมวดหมู่ถึงสองเท่า

ประการแรก Artificial Analysis Intelligence Index เป็นค่าประกอบจากหลายภารกิจ; GPQA Diamond เป็นการทดสอบวิทยาศาสตร์ระดับบัณฑิตศึกษาเพียงรายการเดียว ทั้งสองไม่ได้อยู่ในมาตราส่วนเดียวกันและไม่สามารถนำมาลบออกจากกันได้

ประการที่สอง และที่สำคัญยิ่งกว่านั้น Flash-Lite ไม่เคยถูกออกแบบมาเพื่อให้ได้คะแนนสูง ดัชนี 36 คือสิ่งที่โมเดลที่เน้นประสิทธิภาพควรเป็น เป้าหมายทางวิศวกรรมของ Google คือการสร้างโมเดลที่ราคาถูกและเร็วพอที่จะวางไว้หน้าคำขอที่เข้ามาทุกรายการ ไม่ว่าจะเป็นการจัดเส้นทางตั๋ว การจำแนกประเภท การแยกข้อมูล หรือการสรุปเนื้อหาในปริมาณมาก ซึ่งโมเดลระดับแนวหน้าจะไม่คุ้มค่าทางเศรษฐกิจอย่างสิ้นเชิง การตัดสินมันเทียบกับโมเดลเรือธงขนาด 2.4T บนเพดานความสามารถด้านการใช้เหตุผลนั้น มองข้ามจุดประสงค์ที่แท้จริงของมันไป

สิ่งที่เราสามารถกล่าวได้นั้นแคบลงแต่มีประโยชน์มากขึ้น Qwen3.8-Max มีความเป็นไปได้สูงมากที่จะเป็นโมเดลที่มีความสามารถเหนือกว่าอย่างมีนัยสำคัญ — ตัวเลขที่รายงานด้วยตนเองของมันสูงกว่าที่โมเดล Index-36 จะทำได้มาก และการกระโดดของ FrontierSWE จาก 40.7 ของรุ่นก่อนหน้ามาเป็น 73.5 บ่งชี้ถึงความก้าวหน้าที่แท้จริง แต่ "มีความเป็นไปได้สูงมาก" ยังคงเป็นการอนุมาน เนื่องจากยังไม่มีผู้ประเมินอิสระให้คะแนนมัน เพื่อเป็นบริบท Qwen3.7-Max รุ่นก่อนหน้าได้คะแนน 46 บน AA Index — สูงกว่า Flash-Lite ที่ได้ 36 แต่ก็ยังห่างไกลจากระดับแนวหน้ามาก — ดังนั้นการก้าวกระโดดข้ามรุ่นที่ Alibaba สื่อเป็นนัยจึงมีขนาดใหญ่และยังไม่ได้รับการยืนยัน

ผลในทางปฏิบัติ: หากงานของคุณเป็นงานที่ Flash-Lite ทำสำเร็จอย่างถูกต้องอยู่แล้ว เพดานความสามารถที่สูงกว่าของ Qwen ก็ไม่มีค่าสำหรับคุณ และคุณจะต้องจ่ายถึง 6.7 เท่าสำหรับมัน เพดานความสามารถจะมีความสำคัญก็ต่อเมื่อ Flash-Lite กำลังล้มเหลวจริงๆ เท่านั้น

ต้นทุนในทางปฏิบัติ: ช่องว่างระหว่างระดับในตัวเลข

ลองพิจารณางานจำแนกประเภทที่มีปริมาณสูง: อินพุต 2,000 โทเคน เอาต์พุต 200 โทเคน รัน 500,000 ครั้งต่อวัน — ซึ่งเป็นรูปแบบการคัดแยกงานสนับสนุนหรือการจัดเส้นทางเนื้อหาที่สมจริง

Flash-Lite: ต่อครั้ง, 0.002M × $0.30 = $0.0006, บวก 0.0002M × $2.50 = $0.0005. ≈ $0.0011 ต่อครั้ง → ~$550/วัน.

Qwen3.8-Max: ต่อครั้ง, 0.002M × $2 = $0.004, บวก 0.0002M × $6 = $0.0012. ≈ $0.0052 ต่อครั้ง → ~$2,600/วัน.

• รายเดือน: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — ความแตกต่าง $61,500 สำหรับปริมาณงานที่เท่ากัน

ในขนาดนั้น การเลือกเทียร์เป็นรายการที่ใหญ่ที่สุดเพียงรายการเดียวในระบบ และยากมากที่จะให้เหตุผลในการใช้เรือธงสำหรับงานที่โมเดลประสิทธิภาพจัดการได้ นี่คือสถานการณ์ที่ Flash-Lite มีไว้โดยเฉพาะ

ทีนี้กลับด้านมัน ใช้โจทย์เอกสารยาว: บริบท 600,000 โทเคน, ผลลัพธ์ 5,000 โทเคน, 200 ครั้งต่อวัน

Qwen3.8-Max: 0.6M × $2 = $1.20 บวก 0.005M × $6 = $0.03. ≈ $1.23 ต่อครั้ง โดยไม่มีค่าธรรมเนียมเพิ่มเติมสำหรับพรอมป์ต์ยาว — และประมาณ $0.18 หากบริบทถูกแคชที่ $0.25/1M.

Flash-Liteไม่สามารถกำหนดราคาสำหรับรูปแบบนี้ได้เลย เนื่องจากบริบทการเรียกครั้งเดียวที่มี 600,000 โทเคนไม่ใช่สิ่งที่โมเดลระดับประสิทธิภาพถูกสร้างขึ้นมาเพื่อรองรับ

ดังนั้นคำตอบจึงพลิกกลับโดยสิ้นเชิงตามรูปร่างของเวิร์กโหลด ซึ่งเป็นบทเรียนที่แท้จริง Flash-Lite ชนะงานปริมาณสูงบริบทสั้นอย่างขาดลอย Qwen ชนะอะไรก็ตามที่ต้องใช้ล้านโทเคนหรืออินพุตที่ไม่ใช่ข้อความ ซึ่ง Flash-Lite ไม่ใช่ตัวเลือกที่ถูกกว่า แต่ไม่ใช่ตัวเลือกเลย

สถานการณ์: ระดับใดที่เหมาะสม

การคัดแยกและจัดเส้นทางการสนับสนุนในปริมาณมาก Flash-Lite ชัดเจน ดัชนี 36 เพียงพอสำหรับการจัดหมวดหมู่ และที่ราคาประมาณ $0.0011 ต่อการเรียกใช้ คุณสามารถรันกับทุกตั๋วได้ ส่งต่อเฉพาะกลุ่มส่วนน้อยที่คลุมเครือไปยังโมเดลขนาดใหญ่เท่านั้น

การวิเคราะห์สัญญาหรือเอกสารยื่นทั้งฉบับ Qwen3.8-Max บริบทอัตราคงที่ 1M หมายความว่าเอกสาร 400 หน้าสามารถประมวลผลได้ในการเรียกครั้งเดียวโดยไม่มีค่าธรรมเนียมเพิ่มเติมและไม่ต้องแบ่งส่วน และคะแนน OmniDocBench 1.5 92.1 ที่รายงานด้วยตนเองนั้นมุ่งเป้าไปที่งานนี้โดยเฉพาะ

ไปป์ไลน์สำหรับภาพหน้าจอ แผนภูมิ หรือวิดีโอ Qwen3.8-Max โดยค่าเริ่มต้น — รองรับอินพุตรูปภาพและวิดีโอ และรายงานผล OSWorld-Verified 86.1 ในการควบคุม GUI จริง Flash-Lite ไม่ใช่ตัวเลือกสำหรับอินพุตที่ไม่ใช่ข้อความ

การเขียนโค้ดแบบเอเจนต์. Qwen3.8-Max จากตัวเลขที่อ้างไว้ (Terminal-Bench 2.1 86.6, FrontierSWE 73.5) โดยมีข้อแม้ว่าไม่มีตัวเลขใดได้รับการตรวจสอบอย่างอิสระ และคะแนนที่รายงานด้วยตนเองต่ำที่สุดคือ IFBench 82.8 ในการทำตามคำสั่ง ซึ่งเป็นความเสี่ยงจริงสำหรับไปป์ไลน์ที่แยกวิเคราะห์ผลลัพธ์ของแต่ละขั้นตอน

สถาปัตยกรรมสองชั้น บ่อยครั้งคำตอบที่ถูกต้องคือทั้งคู่: Flash-Lite เป็นตัวผ่านแรกที่ราคาถูกในทุกคำขอ Qwen3.8-Max เป็นเส้นทางการยกระดับสำหรับส่วนน้อยที่ต้องการล้านโทเค็น รูปภาพ หรือการให้เหตุผลอย่างแท้จริง รูปแบบนั้นเก็บข้อได้เปรียบด้านต้นทุนของ Flash-Lite ไว้ได้เกือบทั้งหมด พร้อมคงตัวเลือกระดับแนวหน้าไว้ให้ใช้

การโฮสต์ด้วยตนเองและความเปิดกว้าง

Flash-Lite ถูกปิดและใช้งานผ่าน API เท่านั้นอย่างถาวร — ไม่มีเส้นทางสำหรับ self-host

น้ำหนักของ Qwen3.8-Max ถูกสัญญาว่าจะปล่อยภายในสัปดาห์นี้ แต่รุ่นเรือธงไม่ใช่เป้าหมายที่สมจริง: ประมาณ 1.2TB ที่ 4-bit เทียบกับประมาณ 141GB ต่อ H200 หมายความว่าต้องใช้ตัวเร่งความเร็วระดับสูงแปดตัวขึ้นไป และ Alibaba ยังไม่ได้เปิดเผยจำนวนพารามิเตอร์ที่ใช้งานจริง ดังนั้นปริมาณงานที่การลงทุนนั้นจะให้มาจึงไม่สามารถคำนวณแบบจำลองได้ นอกจากนี้ยังไม่มีข้อความใบอนุญาต ซึ่งหมายความว่าความสามารถในการใช้งานเชิงพาณิชย์ยังไม่ถูกกำหนดอย่างเป็นทางการ

ที่ประกาศออกมาพร้อมกัน Qwen3.8-27B คือรุ่นที่สำคัญจริงๆ สำหรับแผนการใช้งานภายในองค์กร อีกทั้งยังเปิดน้ำหนักโมเดล (open-weights) และมีรายงานว่าต้องใช้หน่วยความจำประมาณ 17GB VRAM ซึ่งเป็นตัวเลือกการโฮสต์ด้วยตนเองอย่างแท้จริง — และที่น่าสังเกตคือ เป็นคู่แข่งที่ใกล้เคียงกับกลุ่มเฉพาะด้านประสิทธิภาพของ Flash-Lite มากกว่าตัวเรือธงขนาด 2.4T มาก

คำถามที่พบบ่อย

วันนี้ฉันใช้ Qwen 3.8 ได้ไหม

ใช่ Qwen3.8-Max เปิดให้ใช้งานทั่วไปแล้วเมื่อวันที่ 3 สิงหาคม 2026 โดยมีราคาที่เผยแพร่ที่ $2 / $6 ต่อ 1M โทเค็น และมี endpoint ที่เข้ากันได้กับ OpenAI และ DashScope บริการนี้ใช้งานได้ด้วยตนเองผ่าน Alibaba Model Studio, DashScope และ OrcaRouter บทความเวอร์ชันก่อนหน้านี้ได้อธิบายถึงการแสดงตัวอย่างแบบมีการควบคุม (gated preview) ซึ่งข้อมูลนั้นล้าสมัยแล้ว

อันไหนถูกกว่า?

Gemini 3.5 Flash-Lite ชนะขาดลอย: $0.30 / $2.50 ต่อ 1M เทียบกับ $2 / $6 ของ Qwen3.8-Max — ถูกกว่าประมาณ 6.7 เท่าในส่วน input และ 2.4 เท่าในส่วน output สำหรับงานปริมาณมากที่มีบริบทสั้น ความแตกต่างนี้สำคัญเหนือปัจจัยอื่นๆ ทั้งหมด

อันไหนดีกว่ากัน?

พวกมันเป็นคนละระดับกัน Flash-Lite มีคะแนนที่ผ่านการตรวจสอบเพียงหนึ่งเดียว (AA Index 36) แต่มันถูกสร้างมาเพื่อปริมาณงานที่ต้นทุนต่ำ ไม่ใช่เพื่อการให้เหตุผล ส่วน Qwen3.8-Max มีแนวโน้มสูงมากที่จะมีความสามารถมากกว่าอย่างเห็นได้ชัด — คะแนนที่รายงานด้วยตนเองอย่าง GPQA Diamond 92.6 และ Terminal-Bench 2.1 86.6 เป็นตัวเลขระดับแนวหน้า — แต่มันไม่มีเกณฑ์วัดอิสระ ดังนั้นสิ่งนั้นจึงยังคงเป็นการคาดคะเน ไม่ใช่ผลลัพธ์ที่วัดได้จริง

อันไหนเร็วกว่า?

Flash-Lite อย่างชัดเจน Artificial Analysis วัดได้ประมาณ 490 โทเคน/วินาที ซึ่งเป็นจุดประสงค์ของการออกแบบระดับประสิทธิภาพ (efficiency tier) Qwen3.8-Max แสดงค่า p50 time-to-first-token ที่ 1.64 วินาทีจากเทเลเมทรี 7 วันของ OrcaRouter แต่มันเป็นโมเดลที่ใหญ่และละเอียดถี่ถ้วน และผู้วิจารณ์ในยุคนำร่องพบว่ามันช้าในงานสร้าง agentic ที่ยาวนาน

ตอนนี้ Qwen 3.8 มี open weights หรือยัง

ยัง อาลีบาบาระบุว่าน้ำหนักของโมเดลเรือธงจะมาถึงภายในสัปดาห์นี้ แต่ก็ยังไม่มีไลเซนส์ โมเดลการ์ด หรือรีโพซิทอรี ต่อให้ปล่อยตัวออกมาแล้ว โมเดลขนาด 2.4T ก็ยังต้องใช้ GPU ระดับ H200 อย่างน้อยแปดตัวขึ้นไป ส่วน Qwen3.8-27B ที่ประกาศออกมาพร้อมกัน ซึ่งรายงานว่าใช้ VRAM ประมาณ 17GB นั้นเป็นตัวเลือกที่ใช้งานได้จริงสำหรับการโฮสต์เอง

ฉันควรใช้ทั้งสองอย่างไหม?

ส่วนใหญ่แล้วก็ใช่ การตั้งค่าแบบสองชั้น — ใช้ Flash-Lite เป็นด่านแรกที่ประหยัดสำหรับทุกคำขอ และใช้ Qwen3.8-Max เป็นช่องทางรองรับงานบริบทยาว งานหลายรูปแบบ หรืองานที่ยากจริงๆ — ยังคงข้อได้เปรียบด้านต้นทุนของ Flash-Lite ไว้เป็นส่วนใหญ่ ขณะเดียวกันก็มอบตัวเลือกระดับแนวหน้าที่คุ้มค่ากับราคาให้คุณ

วันนี้ควรเลือกอันไหนสำหรับการผลิตดี?

Flash-Lite สำหรับงานที่ต้องการปริมาณมาก บริบทสั้น และข้อความเท่านั้น ซึ่ง Index 36 ก็เพียงพอ — มันถูก รวดเร็ว ผ่านการตรวจสอบ และพิสูจน์แล้ว ส่วน Qwen3.8-Max ใช้เมื่อปริมาณงานต้องการบริบทถึงล้านโทเคน การรับรูปภาพหรือวิดีโอ หรือการให้เหตุผลที่ Flash-Lite พิสูจน์ได้ว่าทำไม่ได้ ทั้งคู่ตอนนี้สามารถนำไปใช้งานได้จริง ซึ่งไม่เป็นความจริงเมื่อการเปรียบเทียบนี้ถูกเขียนขึ้นครั้งแรก

บรรทัดล่าง

Gemini 3.5 Flash-Lite เทียบกับ Qwen 3.8เคยเป็นการเปรียบเทียบระหว่างผลิตภัณฑ์กับประกาศ แต่ไม่ใช่อีกต่อไป ตั้งแต่วันที่ 3 สิงหาคม 2026 Qwen3.8-Max เปิดให้ใช้งานทั่วไป มีการกำหนดราคา ใช้บริการได้ด้วยตนเอง และมีเอกสารประกอบครบถ้วน — ดังนั้นการวางกรอบอย่างตรงไปตรงมาก็คือการตัดสินใจเลือกระดับ มากกว่าความพร้อมใช้งาน

Flash-Lite ยังคงเป็นตัวเลือกเริ่มต้นที่ถูกต้องสำหรับงานที่มันถูกสร้างขึ้นมา: ด้วยราคา $0.30 / $2.50 และความเร็วประมาณ 490 โทเคนต่อวินาที มันประมวลผลทุกคำขอได้ในต้นทุนที่แทบเป็นเศษเงิน และดัชนี Index 36 ที่ผ่านการตรวจสอบแล้วก็เพียงพออย่างยิ่งสำหรับการจำแนกประเภท การจัดเส้นทาง และการแยกข้อมูล Qwen3.8-Max คือระดับการยกระดับ — บริบทแบบเหมาจ่ายล้านโทเคน รองรับการป้อนภาพและวิดีโอโดยตรง และอ้างความสามารถด้านการให้เหตุผลระดับแนวหน้า — ด้วยต้นทุนการป้อนข้อมูลที่สูงขึ้นประมาณ 6.7 เท่า จุดอ่อนที่ยังไม่ได้รับการแก้ไขของมันก็เหมือนเดิม: ยังไม่มีผู้ประเมินอิสระรายใดให้คะแนนมัน ดังนั้นเรื่องคุณภาพจึงต้องอาศัยตารางข้อมูลของ Alibaba เอง จับตาดูคะแนน Intelligence Index อิสระครั้งแรกและน้ำหนักของ Qwen3.8-27B ซึ่งจะแข่งขันกับกลุ่มตลาดเฉพาะของ Flash-Lite ได้โดยตรงมากกว่า ในระหว่างนี้ ให้เลือกตามลักษณะของปริมาณงาน — และพิจารณารันทั้งสองตัว

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube