
Tencent HY4 Preview กับ Qwen3.8-Max: การประลอง Open-Weight เดือนสิงหาคม
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
Tencent HY4 Preview ปะทะ Qwen3.8-Max คือการปะทะที่ {{1}}เดือนนี้{{/1}} กำลังมุ่งหน้าไป Qwen3.8-Max ของ Alibaba เปิดให้ใช้งานทั่วไปเมื่อวันที่ 3 สิงหาคม และกลายเป็น Qwen ระดับ Max ตัวแรกที่เปิดเผยน้ำหนัก (open weights) เมื่อวันที่ 12 สิงหาคม; Tencent HY4 Preview เปิดตัวเมื่อเช้านี้ ซึ่งเป็น 25 วันถัดมา พร้อมการ์ดเปิดตัวที่เอ่ยชื่อ Qwen3.8-Max โดยตรง — Tencent รายงานว่า HY4 Preview ได้ 74.1 บน Toolathlon-Verified นำหน้า Qwen3.8-Max บนเกณฑ์ชี้วัดนั้น ทั้งคู่เป็นเรือธงจีนแบบเปิดเผยน้ำหนัก ทั้งคู่ตั้งราคาให้ขายไว และมีเพียงหนึ่งเดียวเท่านั้นที่มีคะแนนจากการวัดผลอิสระ
โมเดลทั้งสองตัวถูกแยกออกจากกันด้วยมากกว่าแค่สเกล — Qwen3.8-Max มีพารามิเตอร์ 2.4 ล้านล้านตัว เทียบกับ 770 พันล้านของ HY4 Preview — แต่ในเกณฑ์วัดด้านเอเจนต์ที่ผู้ซื้อให้ความสำคัญ พวกมันกลับเล็งเป้าเดียวกัน นั่นคืองานระยะยาวที่โมเดลต้องอ่านข้อมูล เรียกใช้เครื่องมือ และวนซ้ำโดยไม่มีมนุษย์อยู่ในวงจรการทำงาน นั่นคืออาณาเขตที่โมเดลโอเพนเวตรุ่นเดือนสิงหาคมกำลังพยายามพิสูจน์ว่าสามารถแทนที่โมเดลระดับแนวหน้าที่ปิดได้ และการเคลื่อนไหวแรกของเทนเซ็นต์คือการยิงใส่การปล่อยโอเพนซอร์สที่ใหญ่ที่สุดของเดือนนั้น
กระดานคะแนน

• ขนาด — HY4 Preview รวม 770B / แอ็กทีฟ 49B เทียบกับ Qwen3.8-Max รวม 2.4T / แอ็กทีฟ ~95B
• บริบท — HY4 Preview มากกว่า 1M โทเค็น เทียบกับ Qwen3.8-Max 1M โทเค็นบน API (262K ดั้งเดิมใน open weights ขยายได้ถึง ~1.01M)
• ราคาต่อ 1M — HY4 Preview ¥6 เข้า / ¥18 ออก (≈$0.85 / $2.50) เทียบกับ Qwen3.8-Max $2.00 เข้า / $6.00 ออก, อ่านแคช $0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (ตามที่ผู้จำหน่ายรายงาน) เทียบกับ Qwen3.8-Max 86.6
• โมดาลิตี้ — ทั้งสองรุ่นในรูปแบบ open-weight รองรับเฉพาะข้อความ; Qwen3.8-Max API เพิ่มการรับอินพุตรูปภาพและวิดีโอ ส่วน HY4 Preview ไม่รองรับ
• คะแนนอิสระ — HY4 Preview none เทียบกับ Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58
ไพ่สองใบเล่าเรื่องเดียวกันจากคนละมุมมอง บน Terminal-Bench 2.1 คะแนน 86.6 ของ Qwen3.8-Max และ 85.4 ของ HY4 Preview ห่างกันเพียงหนึ่งจุดครึ่ง — โดย Qwen นำอยู่หนึ่งจุด และตัวเลขของ HY4 ยังไม่ผ่านการตรวจสอบ ด้านราคา HY4 Preview ถูกกว่าทั้งอินพุตและเอาต์พุตต่อโทเคน ด้านการตรวจสอบ Qwen3.8-Max มี Intelligence Index อิสระที่ 58 และ Agentic Index ที่ 58 ส่วน HY4 Preview ไม่มีอะไรนอกจากข่าวประชาสัมพันธ์ของตัวเอง ช่องว่างดังกล่าวเป็นรูปแบบคลาสสิกของผู้ท้าชิงที่เข้ามาพร้อมราคาที่ดีกว่าและคำกล่าวอ้างที่ยังไม่ได้รับการพิสูจน์ ต่อกรกับผู้นำที่ผ่านการตรวจสอบแล้ว
การอ่านข้อกล่าวอ้าง Toolathlon
{{1}}Toolathlon-Verified{{/1}} วัดความน่าเชื่อถือของการใช้เครื่องมือแบบ agentic — ว่าตัวแบบจะใช้เครื่องมือทำงานจนจบกระบวนการได้อย่างสม่ำเสมอเพียงใด ทั้งเมื่อเจอข้อผิดพลาด การกู้คืน และการเรียกใช้งานหลายขั้นตอน คะแนน 74.1 ของ Tencent มุ่งตรงไปที่จุดแข็งที่สุดของ Qwen3.8-Max เนื่องจากค่า Agentic Index 58 ของ Qw{{2}}en{{/2}} และคะแนน OSWorld-Verified 86.1 คือตัวเลขที่ทำให้การนำเสนอเชิง agentic ของ Ali{{3}}baba{{/3}} ดูน่าเชื่อถือ Qwen3.8-Max ยังทำคะแนน 82.8 บน {{4}}IFBench{{/4}} (การทำตามคำสั่ง) และ 93.0 บน {{5}}PaperBench{{/5}} (งาน agentic ระดับงานวิจัย) ซึ่งสูงกว่าโมเดลอย่าง {{6}}GPT-5.6 Sol{{/6}} ในตารางของผู้จำหน่ายเอง ดังนั้น Tencent จึงเลือกเกณฑ์ชี้วัดเพียงหนึ่งเดียวที่ตนอ้างว่าชนะโมเดลโอเพนที่ใหญ่ที่สุดของเดือนนี้โดยตรง — และการอ้างสิทธิ์นี้ก็ตรวจสอบได้พอ ๆ กับตัวเลขในตารางที่ผู้จำหน่ายรายเดียวเป็นผู้รายงาน นั่นคือ ตรวจสอบไม่ได้เลย
ที่ยืนยันแล้วเทียบกับที่ผู้จำหน่ายรายงาน
นี่คือแกนที่การแข่งขันไม่ยุติธรรมที่สุด และความไม่สมดุลนี้สมควรได้รับการกล่าวถึงอย่างชัดเจน ดัชนีความฉลาด (Intelligence Index) ของ Qwen3.8-Max ที่ 58 มาจาก Artificial Analysis ดัชนีเชิงตัวแทน (Agentic Index) ที่ 58 ก็มาจาก Artificial Analysis เช่นกัน และชุดทดสอบอิสระชุดเดียวกันที่ให้คะแนนเหล่านี้ก็วัดจุดอ่อนของมันด้วย: อัตราการหลอน (hallucination) 40% บน AA-Omniscience เพิ่มขึ้นจาก 23% ในรุ่นก่อนหน้า และจำนวนรอบเชิงตัวแทน (agentic turns) มากถึง 64 รอบต่องาน ซึ่งถือว่ามหาศาล — โมเดลทำงานหนัก และคุณต้องจ่ายค่าทุกรอบ Tencent HY4 Preview ไม่มีเครื่องมือวัดเหล่านั้นเลย จุดแข็งของมันเป็นเพียงคำกล่าวอ้าง และรูปแบบความล้มเหลวของมัน — ซึ่ง Tencent เองก็ชี้ให้เห็นถึงการคิดที่ยาวเกินไปและการตรวจสอบตนเองมากเกินไป — เป็นการยอมรับ ไม่ใช่การวัดผล
สำหรับทีมที่ต้องเลือกระหว่างสองสิ่งนี้ ช่องว่างด้านการตรวจสอบไม่ใช่เรื่องนามธรรม พฤติกรรม 64 เทิร์นต่องานของ Qwen3.8-Max เป็นตัวขับเคลื่อนต้นทุนที่แท้จริงและวัดผลได้: ที่ราคา $2/$6 มันยังคงเป็นเอเจนต์ที่แพงที่สุดต่องานที่เสร็จสมบูรณ์ในการเปรียบเทียบของบุคคลที่สามบางรายการ และทีมต่าง ๆ รายงานว่าจำนวนเทิร์นกัดกร่อนความได้เปรียบด้านราคาของมัน พฤติกรรมที่เทียบเท่าของ HY4 Preview ยังไม่เป็นที่รู้จัก — มันอาจจะถูกกว่าต่องานกว่าที่ราคาต่อโทเค็นที่ต่ำอยู่แล้วแนะนำ หรือนิสัยการตรวจสอบตัวเองของมันอาจกินส่วนต่างนั้น ยังไม่มีใครบอกคุณได้ว่าอันไหน เพราะไม่มีใครนอก Tencent เคยรันมัน
ราคาและความเป็นจริงในทางปฏิบัติของโอเพนเวตส์
เมื่อคิดต่อโทเคน HY4 Preview ถูกกว่าทั้งสองด้าน: ¥6/¥18 เทียบกับราคา $2.00/$6.00 ของ Qwen3.8-Max และการเข้าถึงแคช (cache hit) อยู่ที่ ¥0.3 เทียบกับ $0.25 ทำให้ HY4 Preview เป็นโมเดลเรือธงแบบเปิดน้ำหนักที่ถูกที่สุดในฝั่งอินพุตหรือเอาต์พุต จบ แต่คำว่า "open weights" มาพร้อมกับข้อกำหนดปลีกย่อยที่แตกต่างกันสองชุด การปล่อยน้ำหนักแบบเปิดของ Qwen3.8-Max — รุ่น Qwen3.8-2.4T-A95B — เป็นแบบข้อความเท่านั้น บังคับให้เปิดโหมดคิด (thinking) มีบริบทดั้งเดิม 262K แทนที่จะเป็น 1M ของ API และมีสัญญาอนุญาตแบบกำหนดเองพร้อมเงื่อนไขตามระดับขนาด: ข้อกำหนดให้แสดงชื่อโมเดลเมื่อมีผู้ใช้เกิน 100 ล้านรายต่อเดือน และมีสัญญาอนุญาตแยกสำหรับธุรกิจ Model-as-a-Service ขนาดใหญ่ ส่วนน้ำหนักของ Tencent HY4 Preview อยู่บน HuggingFace, ModelScope และ GitHub ตั้งแต่เมื่อเช้านี้ แต่ข้อกำหนดสัญญาอนุญาตที่ชัดเจน และว่าน้ำหนักที่ปล่อยออกมานั้นตรงกับ API ที่ให้บริการหรือไม่ ยังไม่ได้ถูกระบุในระดับความชัดเจนแบบเดียวกัน ทั้งสองโมเดลดาวน์โหลดได้ แต่ก็ไม่มีตัวไหนที่เสียบเข้าใช้ได้แบบง่าย ๆ
สรุป
Qwen3.8-Max เป็นตัวเลือกที่ปลอดภัยกว่าในทุกด้านที่การตรวจสอบยืนยันสร้างความปลอดภัยได้: ถูกให้คะแนนอย่างอิสระทั้งด้านความชาญฉลาดและการทำงานแบบเอเจนต์ มีโหมดความล้มเหลวที่ทราบแล้ว มีไลเซนส์ที่ลงตัว และมีฟีดแบ็กจากโปรดักชันสามสัปดาห์ อีกทั้งยังเป็นตัวเลือกที่แพงกว่าต่อโทเคน และพฤติกรรมแบบเทิร์นเยอะที่วัดได้ของมันก็เป็นความเสี่ยงด้านต้นทุนที่ทราบกันดี Tencent HY4 Preview คือตัวเลือกที่คุ้มค่า: ถูกกว่าทั้งอินพุตและเอาต์พุต มีข้ออ้างด้าน Terminal-Bench ที่เทียบเคียงได้ และมีข้ออ้าง Toolathlon-Verified ที่เทียบตรงกับ Qwen — แต่ทั้งหมดยังไม่ผ่านการตรวจสอบในวันแรก หากคุณจะนำโมเดลโอเพนเวตขึ้นโปรดักชันในสัปดาห์นี้ Qwen3.8-Max คือตัวเลือกที่ให้เหตุผลได้ และมันเปิดใช้งานบน OrcaRouter แล้วในราคารายการของ Alibaba — $2.00/$6.00 ส่งผ่านโดยไม่บวกมาร์กอัป ส่วน HY4 Preview คือโปรเจกต์ประเมินผล: นำไปรันผ่าน API ของ Tencent เองกับงานสไตล์ Toolathlon ของคุณ ยังคงเส้นทางโปรดักชันไว้บนโมเดลที่ตรวจสอบแล้ว และเมื่อคะแนนอิสระออกมา — หรือเมื่อ HY4 Preview มาถึงเราเตอร์และอัตรา ¥6/¥18 กลายเป็นการส่งผ่านในวันเดียวกัน — การสลับก็คือกฎการจัดเส้นทาง ไม่ใช่การเขียนโค้ดใหม่


ดูอะไรดี
• การรันอิสระครั้งแรกของ HY4 Preview บนแฮร์เนสแบบเอเจนต์ คะแนน 74.1 ที่ Toolathlon รับรองคือตัวเลขที่ Tencent ต้องการเอาชนะ; ดัชนี Agentic จากบุคคลที่สามจะเป็นการยืนยัน
• จำนวนเทิร์นที่วัดได้ของ HY4 Preview 64 เทิร์นต่องานของ Qwen3.8-Max คือเรื่องเตือนใจ ไม่ว่า HY4 Preview จะถูกกว่าต่องานที่เสร็จสมบูรณ์หรือไม่ คือข้อโต้แย้งทางเศรษฐกิจทั้งหมด
• ข้อกำหนดสิทธิ์การใช้งานบนน้ำหนัก (weights) จะเป็นตัวกำหนดว่า "เปิด" หมายถึง "ใช้งานได้ในขนาดของคุณ" สำหรับ HY4 Preview เช่นเดียวกับเงื่อนไขสิทธิ์การใช้งาน Qwen3.8-Max ที่เคยกำหนดสำหรับโมเดลของ Alibaba
• ไม่ว่าผู้จำหน่ายรายใดจะลดราคาอีกครั้งหรือไม่ ในเดือนที่เรือธงแบบ open-weight สองรุ่นวางจำหน่ายพร้อมราคาเชิงรุก การส่งผ่านบนเราเตอร์ทำให้การลดราคาเพิ่มเติมใดๆ ปรากฏให้เห็นในวันเดียวกัน
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
