
Qwen 4.5 และ Qwen 5 ตั้งเป้า 5 ถึง 10 ล้านล้านพารามิเตอร์: Alibaba พูดอะไรและไม่ได้พูดอะไร
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ในการประชุม Apsara Conference ที่หางโจวเมื่อวันที่ 22 กันยายน 2026 บริษัทได้ระบุขนาดของเจนเนอเรชันถัดไปถัดไป Qwen 4.5 และ Qwen 5 ซีรีส์มี "คาดว่าจะขยายขนาดขึ้นเป็น 5 ถึง 10 ล้านล้านพารามิเตอร์" ตามถ้อยคำในข่าวประชาสัมพันธ์ภาษาอังกฤษของบริษัทเอง — เป็นข้อความในแผนงาน ไม่ใช่ข้อกำหนดสเปก ทั้งสองรุ่นไม่มีวันเปิดตัว ไม่มีโมเดลการ์ด ไม่มีตัวระบุ API ไม่มีราคา และไม่มีคะแนนเบนช์มาร์กที่เผยแพร่ ซึ่งหมายความว่าไม่มีสิ่งใดเกี่ยวกับทั้งสองรุ่นนี้ที่เรียกใช้งานได้ในวันนี้ เรือธงที่คุณซื้อได้จริงคือ Qwen3.8-Max ซึ่งวางจำหน่ายทั่วไปตั้งแต่ 3 สิงหาคม 2026 ที่ 2.4 ล้านล้านพารามิเตอร์ ในช่วงหลายวันนับจากงานประชุม ประโยคแผนงานนั้นได้ถูกปรับให้แบนราบในสื่อจำนวนมากจนกลายเป็นข้ออ้างว่ารุ่นขนาด 10 ล้านล้านพารามิเตอร์กำลังจะมา — ซึ่งเป็นข้ออ้างที่หนักแน่นและเรียบง่ายกว่าที่บริษัทได้กล่าวไว้ ระยะห่างระหว่างสองประโยคนั้นคือแผนงานราวหนึ่งปี
ข้อกล่าวอ้าง และเวอร์ชันของข้อกล่าวอ้างนั้นที่แพร่กระจายออกไป
มีสองเรื่องที่ถูกพูดบนเวที และทั้งสองเรื่องน่าจะแยกออกจากกัน เพราะมันมีปริมาณข้อมูลที่แตกต่างกันมาก เรื่องแรกคือการอัปเดตสถานะ: Qwen 4 กำลังอยู่ในระหว่างการฝึก ด้วยสถาปัตยกรรมใหม่ เรื่องที่สองคือแผนงาน: ซีรีส์ Qwen 4.5 และ Qwen 5 คาดว่าจะไปถึงช่วงพารามิเตอร์ที่ 5 ถึง 10 ล้านล้าน
ข่าวประชาสัมพันธ์ภาษาอังกฤษของ Alibaba ระบุว่าทั้งสองสิ่งเป็นของบริษัทมากกว่าจะเป็นของผู้บริหารที่ระบุชื่อ การรายงานข่าวจากงานประชุมที่ลงลึกกว่านั้นระบุว่าแผนงานนี้เป็นของ Liu Da Yiheng ผู้ดูแลโครงการแบบจำลองภาษาขนาดใหญ่ Qwen ที่ Alibaba Token Hub และรายงานกรอบความคิดของเขาว่าการขยายสเกลเป็นเส้นทางสำคัญสู่ปัญญาประดิษฐ์ขั้นสูงยิ่ง กรอบความคิดนั้นคือบริบทที่จำนวนพารามิเตอร์ถูกนำเสนอ และอธิบายว่าทำไมจำนวนดังกล่าวจึงเป็นช่วง ไม่ใช่เป้าหมาย
สิ่งที่ถูกเผยแพร่ออกไปในตอนนั้นคือขอบบนของช่วง พาดหัวข่าวภาษาอังกฤษที่ตามมามีอย่างน้อยหนึ่งชิ้นที่บรรยายถึงโมเดลขนาด 10 ล้านล้านพารามิเตอร์ที่ถูกใบ้ถึง และอีกหลายชิ้นที่บรรยายถึงแผนสำหรับโมเดลขนาด 5 ถึง 10 ล้านล้านพารามิเตอร์ ทั้งสองอย่างเป็นการตีความสไลด์ที่สมเหตุสมผล ไม่มีอันใดเป็นข้อกำหนด และความแตกต่างนี้สำคัญสำหรับใครก็ตามที่ต้องวางแผนโดยอ้างอิงกับมัน
5 ล้านล้านเป็นเป้าหมายของคนรุ่นหนึ่ง และ 10 ล้านล้านเป็นของอีกรุ่นหนึ่ง
สิ่งที่มีประโยชน์ที่สุดเพียงอย่างเดียวที่ควรทำความเข้าใจให้ถูกต้องเกี่ยวกับประกาศนี้ คือ 5 ถึง 10 ล้านล้านเป็นช่วงที่ครอบคลุมสองรุ่น ไม่ใช่โมเดลเดียวที่มีความคลาดเคลื่อนกว้าง ประโยคของ Alibaba เองผูกช่วงดังกล่าวเข้ากับ "ซีรีส์โมเดล Qwen 4.5 และ Qwen 5 ที่กำลังจะมาถึง" — คำว่า series ซึ่งเป็นพหูพจน์ เมื่อนำมารวมกัน
รายงานภาษาจีนจากการประชุมเดียวกันนั้นมีความแม่นยำในทิศทางที่แตกต่างออกไปอีกครั้ง โดยพาดหัวข่าวอธิบายถึงโมเดลหลัง Qwen 4.5 ที่ขยายไปสู่ช่วง 5 ถึง 10 ล้านล้าน การตีความนั้นทำให้ปลายด้าน 10 ล้านล้านอยู่เลย Qwen 4.5 ไปด้วย ข้อความเดียวที่ทุกแหล่งเห็นตรงกันคือช่วงดังกล่าวครอบคลุมช่วง Qwen 4.5 ถึง Qwen 5 การกำหนด 10 ล้านล้านให้กับ Qwen 5 โดยเฉพาะเป็นการอนุมานที่กลายเป็นพาดหัวข่าว ไม่ใช่คำพูด
เพื่อให้เห็นขนาด และนี่คือตัวเลขชุดเดียวในเรื่องนี้ที่เผยแพร่แล้ว ไม่ใช่การคาดการณ์:
• 5 ถึง 10 ล้านล้าน — ช่วงพารามิเตอร์ที่ข่าวประชาสัมพันธ์ของ Alibaba ระบุว่าเป็นของซีรีส์ Qwen 4.5 และ Qwen 5
• 2.4 ล้านล้าน — จำนวนพารามิเตอร์ทั้งหมดของ Qwen3.8-Max ซึ่งเป็นเรือธงที่วางจำหน่ายจริง ตามการ์ดโมเดลอย่างเป็นทางการของมัน
• 95 พันล้าน — จำนวนพารามิเตอร์ที่ใช้งานอยู่ต่อโทเค็นของ Qwen3.8-Max ซึ่งเป็นตัวเลขที่กำหนดต้นทุนในการให้บริการต่อโทเค็น
• 10 ล้านล้าน — จุดสูงสุดของช่วง และเป็นส่วนเดียวของมันที่ไปถึงพาดหัวข่าวภาษาอังกฤษส่วนใหญ่
• 0 — จำนวนข้อมูลจำเพาะที่เผยแพร่ วันที่เปิดตัว ราคา หน้าต่างบริบท หรือคะแนนเบนช์มาร์กสำหรับ Qwen 4.5 หรือ Qwen 5

หมายเลขพารามิเตอร์ที่สำคัญคือหมายเลขที่ไม่มีใครเคยเผยแพร่
พารามิเตอร์ทั้งหมดคือตัวเลขที่ห้องแล็บเลือกจะบอก พารามิเตอร์ที่ใช้งานอยู่คือจำนวนที่ผู้ซื้อต้องการ และแผนงานก็ไม่ได้รวมจำนวนนั้นไว้
Qwen3.8-Max เป็นโมเดลแบบผสมผู้เชี่ยวชาญ (mixture-of-experts) ที่มีพารามิเตอร์ทั้งหมด 2.4 ล้านล้านตัว และมีพารามิเตอร์ที่ใช้งาน 95 พันล้านตัวต่อโทเคน นั่นคืออัตราการเปิดใช้งานประมาณ 4 เปอร์เซ็นต์: โมเดลเก็บความรู้จำนวนมากไว้ในน้ำหนักที่มันไม่ได้อ่านเมื่อประมวลผลโทเคนใดโทเคนหนึ่ง และใช้พลังการประมวลผลเพียงส่วนเล็กๆ ของมัน พารามิเตอร์ทั้งหมดบอกคุณว่ามันใช้หน่วยความจำเท่าไหร่และคุณต้องใช้ฮาร์ดแวร์ขนาดใหญ่แค่ไหน พารามิเตอร์ที่ใช้งานบอกคุณถึงค่าใช้จ่ายที่คุณต้องจ่ายทุกครั้งที่มันตอบ
คำนวณอัตราส่วนนั้นต่อไป และรูปร่างของปัญหาก็จะปรากฏให้เห็น โมเดลขนาด 10 ล้านล้านพารามิเตอร์ที่สร้างด้วยอัตราการเปิดใช้งาน 4 เปอร์เซ็นต์เท่ากัน จะเปิดใช้งานพารามิเตอร์ในระดับ 4 แสนล้านตัวต่อโทเคน — มากกว่าที่ Qwen3.8-Max เปิดใช้งานอยู่ในตอนนี้ถึงสี่เท่า นั่นคือเลขคณิตบนสมมติฐานที่ระบุไว้ ไม่ใช่ข้อกล่าวอ้างเกี่ยวกับ Qwen 5: เพิ่มความเบาบางขึ้น จำนวนที่เปิดใช้งานก็ลดลง ลดความเบาบางลง จำนวนก็เพิ่มขึ้น แต่เป็นเลขคณิตที่ตัดสินว่าโมเดลขนาด 10 ล้านล้านพารามิเตอร์จะเป็นผลิตภัณฑ์ที่ให้บริการได้หรือเป็นเพียงชิ้นงานวิจัย และเป็นการคำนวณที่พาดหัวข่าวเรื่อง 5 ถึง 10 ล้านล้านชวนให้คิด แต่กลับปล่อยไว้ไม่ทำ
นี่ก็เป็นจุดที่เศรษฐศาสตร์ของการจัดเส้นทางเลิกเป็นเรื่องนามธรรมเช่นกัน บน OrcaRouter ราคาตามรายการของผู้ให้บริการถูกส่งผ่านมาพร้อมมาร์กอัป 0% ดังนั้นเมื่อผู้ขายลดราคาของระดับ Qwen ราคานั้นจะมีผลกับคีย์ของคุณในวันเดียวกัน แทนที่จะรอไปถึงตอนต่อสัญญา การสร้างผลลัพธ์ที่ต้นทุนการให้บริการไม่แน่นอนอย่างแท้จริงนั้น เป็นกรณีที่การส่งผ่านราคาแบบนี้มีค่ามากกว่าส่วนลดที่เจรจาไว้ล่วงหน้ากับตัวเลขที่ยังไม่มีใครประกาศออกมาเลย
การประกาศชิปต่างหากคือไทม์ไลน์ที่แท้จริง
Alibaba ประกาศโรดแมปโมเดลและตัวเร่งความเร็วใหม่ในข่าวประชาสัมพันธ์ฉบับเดียวกัน และทั้งสองสิ่งนี้เชื่อมโยงกันมากกว่าที่ข่าวประชาสัมพันธ์ระบุไว้
Zhenwu V900 ของ T-Head เป็นโปรเซสเซอร์สำหรับการฝึกและการอนุมาน ที่มีความจุหน่วยความจำ 216 GB และแบนด์วิดท์ระหว่างชิป 1,200 GB/s รองรับ FP8 และ FP4 โดยตรง และอ้างว่ามีประสิทธิภาพเป็นสามเท่าของรุ่นก่อนหน้าอย่าง Zhenwu M890 ที่เปิดตัวในเดือนพฤษภาคม การผลิตจำนวนมากและการวางจำหน่ายเชิงพาณิชย์มีกำหนดในไตรมาสแรกของปี 2027 เซิร์ฟเวอร์ซูเปอร์โหนดที่มาคู่กันรองรับคลัสเตอร์ได้ถึง 500,000 การ์ด และ T-Head กล่าวว่าสายผลิตภัณฑ์ Zhenwu ได้ให้บริการลูกค้ามากกว่า 650 ราย
อ่านประกาศทั้งสองฉบับประกอบกัน แล้วลำดับเหตุการณ์ก็อ่านออก การฝึกและการให้บริการโมเดล mixture-of-experts ในระดับ 10 ล้านล้านเป็นปัญหาการเชื่อมต่อระหว่างกันก่อนที่จะเป็นปัญหาการประมวลผล เพราะ expert parallelism หมายถึงการย้ายแอกติเวชันระหว่างชิปอยู่ตลอดเวลา และแบนด์วิดท์ระหว่างชิป 1,200 GB/s คือตัวเลขที่ตัดสินว่าสิ่งนั้นทำได้จริงหรือไม่ ซิลิคอนตามกำหนดการนั้นทำให้หน้าต่างที่เป็นไปได้เร็วที่สุดสำหรับการรันระดับแนวหน้าแบบนี้อยู่ในช่วงปี 2027 เป็นอย่างน้อย — และแม้ถึงตอนนั้น การที่ชิปออกวางจำหน่ายก็ไม่ได้บอกอะไรเลยเกี่ยวกับการฝึกที่จะเสร็จสิ้น อาลีบาบาเชื่อมโยงสองหัวข้อนี้เข้าด้วยกันโดยใส่ไว้ในข่าวเปิดตัวเดียวกัน; การเชื่อมโยงนั้นเองคือการตีความของเรา และเราได้ระบุว่าเป็นเช่นนั้น
กรอบเวลาของบริษัทเองก็สอดคล้องกับเรื่องนั้น เอ็ดดี อู๋ ประธานเจ้าหน้าที่บริหาร ตั้งเป้าหมายกำลังการผลิตของศูนย์ข้อมูล Alibaba Cloud ทั่วโลกไว้ที่มากกว่า 20 กิกะวัตต์ภายในปี 2032 — เป็นเป้าหมายด้านกำลังการผลิต ไม่ใช่กำลังการผลิตที่ติดตั้งใช้งานจริง และเป็นกรอบเวลาห้าปีขึ้นไป ไม่ใช่กรอบเวลาแบบไตรมาสถัดไป
คำกล่าวอ้างเรื่องการพัฒนาตนเองที่ค้ำโรดแมปไว้
เหตุผลที่แผนระดับ 5 ถึง 10 ล้านล้านพอจะถกเถียงกันได้เลย แทนที่จะเป็นเพียงเรื่องแพงมหาศาล คือการพัฒนาตนเองแบบวนซ้ำ: หากไปป์ไลน์การฝึกปรับปรุงตัวเองได้ พลังประมวลผลที่ต้องใช้ต่อรุ่นก็จะลดลง และพรมแดนความสามารถก็จะขยับเข้าใกล้ระดับที่จ่ายไหวมากขึ้น นั่นคือข้ออ้างที่ค้ำยันแผนโรดแมปนี้ไว้ และยังเป็นสิ่งที่ตรวจสอบได้ยากที่สุดในบรรดาสิ่งที่ Alibaba กล่าวด้วย
สิ่งที่บริษัทรายงาน: Qwen3.8-Max ทำงานแบบวนซ้ำครบ 33 รอบ ตลอดเวลาราวหนึ่งเดือนของการทำงานอัตโนมัติเต็มรูปแบบ ซึ่งครอบคลุมการออกแบบไปป์ไลน์ การตรวจสอบความถูกต้องของข้อมูล และการวินิจฉัยข้อผิดพลาด และเพิ่มคะแนน Artificial Analysis ของตนจาก 40 เป็น 45 ในการทดลองออกแบบชิป โมเดลใช้เวลามากกว่า 60 ชั่วโมงในการพัฒนาตนเองตลอดวงจรชีวิตการออกแบบ เรียกใช้เครื่องมือ electronic-design-automation มากกว่า 10,000 ครั้ง และลดพื้นที่ชิปได้ 42 เปอร์เซ็นต์โดยไม่สูญเสียประสิทธิภาพ รายงานฉบับหนึ่งจากการประชุมยังระบุถึงการปรับปรุงปริมาณงานการอนุมาน (inference throughput) 96 เปอร์เซ็นต์ จากการปรับแต่ง GPU T-Head รุ่นใหม่โดยอัตโนมัติ
สิ่งเหล่านี้เป็นรายงานจากผู้ขายและยังไม่ได้รับการทำซ้ำโดยอิสระ นี่ไม่ใช่ข้อเล็กน้อยทางเทคนิค — ลูปอัตโนมัติที่ให้คะแนนการทดลองของตัวเองกำลังวัดตัวเองเทียบกับตัวให้คะแนนของตัวเอง และโลกภายนอกไม่มีทางตรวจสอบเกณฑ์การให้คะแนนได้ การรายงานเกี่ยวกับการประชุมโดยทั่วไปได้กล่าวเช่นนี้ และผู้อ่านควรถือว่าเป็นเช่นนั้น
มีกับดักที่สองอยู่ในข้อกล่าวอ้างเดียวกัน และมันเกี่ยวกับป้ายกำกับมากกว่าความซื่อสัตย์ Alibaba ไม่ได้ระบุว่าการเคลื่อนจาก 40 ไป 45 นั้นวัดเทียบกับฉบับแก้ไขใดของ Artificial Analysis Intelligence Index และดัชนีนั้นถูกสร้างใหม่ตั้งแต่โมเดลนี้เปิดตัว หน้าปัจจุบันของ Artificial Analysis สำหรับ Qwen3.8 Max (0902) ระบุไว้ที่ 45 — เป็นตัวเลขอิสระ บนฉบับแก้ไขที่บังคับใช้อยู่ในปัจจุบัน ค่าที่บันทึกไว้สำหรับโมเดลเดียวกันในกลางเดือนสิงหาคม ภายใต้ฉบับแก้ไขที่บังคับใช้ตอนนั้น คือ 56. 45 กับ 56 ไม่ใช่การวัดเดียวกันในหน่วยเดียวกัน และการนำตัวหนึ่งไปลบออกจากอีกตัวหนึ่งให้ผลเป็นตัวเลขที่ไม่มีความหมาย สิ่งที่หน้าเว็บไม่ได้แสดงไว้คือ 40 ที่ Alibaba บอกว่าปรับปรุงมาจาก: จุดเริ่มต้นของผลต่างนั้นเป็นของบริษัทเอง และมีเพียงจุดสิ้นสุดเท่านั้นที่บังเอิญอยู่ตรงตำแหน่งที่ค่าอิสระระบุในตอนนี้ อ่านการเคลื่อนไหวนี้เป็นทิศทาง ไม่ใช่การวัด

สิ่งที่ Alibaba เปิดตัวจริง ๆ ในงานประชุมเดียวกัน
ตัดโรดแมปออกไป แล้วงานประชุมก็ยังคงมีการเปิดตัวจริง ซึ่งทั้งหมดเป็นแบบมัลติโหมด:
• Qwen3.8-LiveTranslate — การล่ามแบบพร้อมกัน โดยลดความหน่วง (LAAL) ลงเกือบ 20 เปอร์เซ็นต์ จาก 2.8 วินาที เหลือ 2.3 วินาที
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS และ Qwen-Audio-3.1-Realtime — ชุดซอฟต์แวร์ด้านเสียงพูดที่ได้รับการปรับปรุงใหม่
• Qwen-Audio-3.1-TTS-Next — ภูมิทัศน์เสียงสไตล์ภาพยนตร์ที่ผสมผสานบทสนทนาและเสียงบรรยากาศจากสคริปต์ข้อความ สำหรับหนังสือเสียง ภาพยนตร์และโทรทัศน์ พอดแคสต์ และเกม
• Qwen-Image 3.1 — การสร้างภาพที่ปรับแต่งมาสำหรับงานออกแบบเชิงสร้างสรรค์และการตลาดอีคอมเมิร์ซ มีกำหนดเปิดตัวภายในปลายปีนี้ พร้อมความสามารถในการสร้างพื้นหลังโปร่งใสแบบเนทีฟ
• Qwen Intelligence — แพลตฟอร์มเอเจนต์แบบฟูลสแต็กที่มุ่งเป้าไปยังผู้ผลิตสมาร์ทโฟน
ทุกอย่างในลิสต์นั้นคือผลิตภัณฑ์ที่มีกรอบเวลาการส่งมอบ คำกล่าวอ้างระดับฟรอนเทียร์คือรายการเดียวในวาระที่ไม่มีวันที่กำกับอยู่ และความต่างนี้ไม่ใช่เรื่องบังเอิญ: การส่งมอบระดับมัลติโหมดคือสิ่งที่ให้ทุนแก่หนึ่งปีของโรดแมป และโรดแมปคือสิ่งที่ทำให้รอบระดมทุนครั้งถัดไปหรือสัญญาคลาวด์ฉบับถัดไปกลายเป็นเรื่องเล่าแทนที่จะเป็นสเปรดชีต ทั้งสองอย่างเป็นของจริง มีเพียงอย่างเดียวเท่านั้นที่เป็นสิ่งที่คุณเรียกใช้ได้
วันนี้สิ่งที่เรียกใช้ได้คืออะไร และต้องเปลี่ยนอะไรเพื่อให้สิ่งนั้นเปลี่ยนไป
Qwen 3.8 เจเนอเรชันยังคงเป็นผลิตภัณฑ์ทั้งหมดที่หาซื้อได้ในไลน์นี้ Qwen3.8-Max เปิดให้ใช้บริการทั่วไปตั้งแต่ 3 สิงหาคม 2026 ในราคา 2.00 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 6.00 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน อัตราเดียวกันตลอดทั้งบริบทขนาด 1,000,000 โทเคน โดยไม่มีค่าธรรมเนียมเพิ่มสำหรับพรอมป์ต์ยาว เวตของมันถูกเผยแพร่เมื่อ 12 สิงหาคม 2026 ในชื่อ Qwen3.8-2.4T-A95B ทั้งรูปแบบ BF16 และ FP8 ภายใต้ลิขสิทธิ์ Qwen แบบกำหนดเอง ตารางเบนช์มาร์กของผู้จำหน่ายนั้นดูแข็งแกร่งและยังไม่ได้ผ่านการตรวจสอบ — Terminal-Bench 2.1 อยู่ที่ 86.6, GPQA Diamond ที่ 92.6, OSWorld-Verified ที่ 86.1 ซึ่งล้วนเป็นตัวเลขของ Alibaba เอง — ภาพจากมุมมองอิสระนั้นดูดีน้อยกว่าของผู้จำหน่าย: Artificial Analysis จัดให้ Qwen3.8 Max (0902) อยู่ที่ Intelligence Index 45 ซึ่งเป็นอันดับ 45 จาก 212 โมเดล ด้วยต้นทุนที่วัดได้ 5.41 ดอลลาร์ต่องาน Intelligence Index หนึ่งงาน และอัตราเอาต์พุต 39.2 โทเคนต่อวินาที — อยู่อันดับ 159 จาก 212 ใกล้เคียงกับปลายทางที่ช้าของวงการ หน้าเดียวกันนั้นระบุขนาดหน้าต่างบริบทไว้ที่ 984k เทียบกับ 1,000,000 บนหน้าโมเดลของเราเอง ซึ่งเป็นช่องว่างที่ควรรู้ไว้ก่อนจะกำหนดขนาดงานที่ใช้บริบทขนาดยาว คะแนนระดับพรมแดนใหม่ ความเร็วระดับกลางๆ นั่นคือบทสรุปที่ตรงไปตรงมาของเรือธงที่วางจำหน่ายอยู่ และเป็นเส้นฐานที่ Qwen 4.5 ใดๆ ต้องเอาชนะให้ได้ทั้งสองแกนพร้อมกัน

OrcaRouter ให้บริการตระกูล Qwen 3.8 — qwen/qwen3.8-max, qwen3.8-flash และ qwen3.8-27b — บน endpoint เดียวที่เข้ากันได้กับ OpenAI ควบคู่ไปกับ โมเดลอื่นอีกกว่า 200 รายการ ซึ่งหมายความว่าระดับ Qwen 4.5 จะเป็นการเปลี่ยน model-id บนคีย์ที่มีอยู่ แทนที่จะเป็นสัญญากับผู้ให้บริการรายใหม่ ใบเรียกเก็บเงินใหม่ และ SDK ใหม่ เมื่อมีรุ่นใดเปิดตัว แค็ตตาล็อกนั้นคือจุดที่มันจะปรากฏ วันนี้ ทั้ง Qwen 4.5 และ Qwen 5 ต่างไม่มีอยู่ในนั้น เพราะยังไม่มีการเปิดตัวทั้งคู่ — และไม่ว่าข่าวประชาสัมพันธ์ด้านโรดแมปจะมีมากเพียงใด ก็ไม่อาจเปลี่ยนข้อเท็จจริงนี้ได้
การใช้ประโยชน์จริงของโรดแมปแบบนี้ ตรงกันข้ามกับแผนการย้ายระบบ ถ้าสุดท้ายแล้วระดับ Qwen 4.5 ดูเป็นไปได้สำหรับภาระงานของคุณ วิธีที่ประหยัดในการทดลองคือการส่งทราฟฟิกจริงส่วนหนึ่งไปยังโมเดลนั้น โดยมีระบบสำรองอัตโนมัติรองรับ เพื่อให้โมเดลที่กลายเป็นว่าช้า แพง หรือแย่กว่าโมเดลเดิมที่ใช้อยู่ ทำให้คุณเสียค่าใช้จ่ายเพียงเปอร์เซ็นต์ของภาระงานหนึ่งรายการ แทนที่จะเป็นหนึ่งในสี่ นั่นคือจุดประสงค์ของ failover และโมเดลแนวหน้าที่เพิ่งเปิดตัวได้ไม่กี่วันและยังไม่ผ่านการพิสูจน์ คือกรณีที่ชัดเจนที่สุดในการใช้มัน
สิ่งที่ต้องจับตามอง และสิ่งที่ยังไม่ควรเชื่อในตอนนี้
บรรทัดบนโรดแมปจะกลายเป็นรีลีสเมื่อชุดของสิ่งที่เป็นรูปธรรมเพียงไม่กี่อย่างปรากฏขึ้น การ์ดโมเดลที่ระบุจำนวนพารามิเตอร์ทั้งหมด จำนวนพารามิเตอร์ที่ใช้งานอยู่ และหน้าต่างบริบท ตัวระบุ API ที่คุณส่งไปในคำขอได้ เวตบนฮับโมเดล รายการบนลีดเดอร์บอร์ดอิสระที่มีวันที่กำกับ ราคา สิ่งใดสิ่งหนึ่งในนั้นถือเป็นสัญญาณ; หากมีสิ่งเหล่านั้นรวมกันเป็นส่วนใหญ่ ก็คือการเปิดตัว
สิ่งที่ไม่ใช่การเปิดตัว ไม่ว่าจะดูเป็นเทคนิคแค่ไหน: การกล่าวถึงในงานประชุม; พูลรีเควสต์ของเฟรมเวิร์กสำหรับเสิร์ฟโมเดลที่เพิ่มสาขาสถาปัตยกรรมสำหรับบิลด์ Qwen เชิงทดลอง ซึ่งเป็นงานระดับเอนจินบนสแตกการอนุมานของใครบางคน มากกว่าจะเป็นโมเดลที่คุณเรียกใช้ได้; ไอดีสแนปช็อตที่ระบุวันที่สำหรับรุ่นที่วางจำหน่ายไปแล้ว; และโพสต์โซเชียลที่ถอดความคำพูดบนเวที สัญญาณที่ทำให้เกิดบทความนี้คือสิ่งสุดท้ายในนั้น และเหตุผลที่มันคุ้มค่าที่จะเขียนถึงคือข้อกล่าวอ้างเบื้องหลังนั้นตรวจสอบได้กับข่าวประชาสัมพันธ์ของ Alibaba เอง — ซึ่งเป็นที่มาของช่วง 5 ถึง 10 ล้านล้าน สถานะของ Qwen 4 และตัวเลข RSI ทั้งหมด สัญญาณชี้ไปที่เรื่องราว; มันไม่ใช่เรื่องราวเอง
คำถามระยะใกล้นี้แคบกว่าที่พาดหัวข่าวชวนให้คิด Alibaba ระบุว่า Qwen 4 อยู่ระหว่างการฝึกโมเดล ซึ่งทำให้ Qwen 4 อยู่ก่อนทั้ง 4.5 และ 5 ในลำดับ — ดังนั้นสิ่งถัดไปที่น่าจับตาจึงไม่ใช่โมเดลขนาด 10 ล้านล้านพารามิเตอร์ แต่เป็นว่า Qwen 4 จะเปิดตัวพร้อมการ์ดโมเดล ราคา และเอนด์พอยต์หรือไม่ และเมื่อใด จนกว่าจะมีอะไรบางอย่างในห่วงโซ่นั้นเกิดขึ้นจริง จุดยืนที่ซื่อตรงต่อช่วง 5 ถึง 10 ล้านล้านก็คือ มันเป็นทิศทางที่มุ่งไป ซึ่งเปิดเผยอย่างเป็นทางการ โดยไม่มีข้อกำหนดจำเพาะใด ๆ แนบมาด้วย และไม่มีกำหนดเวลา วางแผนสำหรับ Qwen3.8-Max จับตาช่วง 4.5 และ 5 ในฐานะข้อเสนอเชิงทฤษฎีว่าด้วยการขยายขนาดมากกว่าที่จะเป็นผลิตภัณฑ์ และมองจำนวนพารามิเตอร์ทุกตัวที่คุณเห็นสำหรับโมเดลที่ไม่มีการ์ดโมเดลว่าเป็นเพียงการคาดการณ์
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
