การ์ดชื่อเรื่องหลักสำหรับการเปรียบเทียบ 'Tencent HY4 Preview vs Qwen3.8-Max' แบนเนอร์ตรงกลางอ่านว่า 'การประลองโอเพนเวทแห่งเดือนสิงหาคม' พร้อมคำอธิบาย 'โมเดลเรือธงโอเพนเวทสองตัวที่ห่างกัน 25 วัน' การ์ดด้านซ้าย 'Tencent HY4 Preview' ระบุ '770B / 49B พารามิเตอร์ที่ใช้งานจริง เปิดตัว 28 ส.ค.' '¥6 / ¥18 ต่อ 1M' 'ไม่มีคะแนนประเมินอิสระ' การ์ดด้านขวา 'Qwen3.8-Max' ระบุ '2.4T / ~95B พารามิเตอร์ที่ใช้งานจริง เปิดตัว 3 ส.ค.' '$2.00 / $6.00 ต่อ 1M' 'AA Index 58' ส่วนท้ายอ่านว่า 'ตัวเลขของ HY4 Preview เป็นข้อมูลที่รายงานโดยผู้ผลิต; คะแนนของ Qwen3.8-Max อ้างอิงตาม Artificial Analysis' โลโก้ OrcaRouter ถูกวางรวมที่มุมขวาล่าง
Guides & Insights

Tencent HY4 Preview กับ Qwen3.8-Max: การประลอง Open-Weight เดือนสิงหาคม

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Tencent HY4 Preview ปะทะ Qwen3.8-Max คือการปะทะที่ {{1}}เดือนนี้{{/1}} กำลังมุ่งหน้าไป Qwen3.8-Max ของ Ali​baba เปิดให้ใช้งานทั่วไปเมื่อวันที่ 3 สิงหาคม และกลายเป็น Qw​en ระดับ Max ตัวแรกที่เปิดเผยน้ำหนัก (open weights) เมื่อวันที่ 12 สิงหาคม; Tencent HY4 Preview เปิดตัวเมื่อเช้านี้ ซึ่งเป็น 25 วันถัดมา พร้อมการ์ดเปิดตัวที่เอ่ยชื่อ Qwen3.8-Max โดยตรง — Tencent รายงานว่า HY4 Preview ได้ 74.1 บน Toolathlon-Verified นำหน้า Qwen3.8-Max บนเกณฑ์ชี้วัดนั้น ทั้งคู่เป็นเรือธงจีนแบบเปิดเผยน้ำหนัก ทั้งคู่ตั้งราคาให้ขายไว และมีเพียงหนึ่งเดียวเท่านั้นที่มีคะแนนจากการวัดผลอิสระ

โมเดลทั้งสองตัวถูกแยกออกจากกันด้วยมากกว่าแค่สเกล — Qwen3.8-Max มีพารามิเตอร์ 2.4 ล้านล้านตัว เทียบกับ 770 พันล้านของ HY4 Preview — แต่ในเกณฑ์วัดด้านเอเจนต์ที่ผู้ซื้อให้ความสำคัญ พวกมันกลับเล็งเป้าเดียวกัน นั่นคืองานระยะยาวที่โมเดลต้องอ่านข้อมูล เรียกใช้เครื่องมือ และวนซ้ำโดยไม่มีมนุษย์อยู่ในวงจรการทำงาน นั่นคืออาณาเขตที่โมเดลโอเพนเวตรุ่นเดือนสิงหาคมกำลังพยายามพิสูจน์ว่าสามารถแทนที่โมเดลระดับแนวหน้าที่ปิดได้ และการเคลื่อนไหวแรกของเทนเซ็นต์คือการยิงใส่การปล่อยโอเพนซอร์สที่ใหญ่ที่สุดของเดือนนั้น

กระดานคะแนน

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• ขนาด — HY4 Preview รวม 770B / แอ็กทีฟ 49B เทียบกับ Qwen3.8-Max รวม 2.4T / แอ็กทีฟ ~95B

• บริบท — HY4 Preview มากกว่า 1M โทเค็น เทียบกับ Qwen3.8-Max 1M โทเค็นบน API (262K ดั้งเดิมใน open weights ขยายได้ถึง ~1.01M)

• ราคาต่อ 1M — HY4 Preview ¥6 เข้า / ¥18 ออก (≈$0.85 / $2.50) เทียบกับ Qwen3.8-Max $2.00 เข้า / $6.00 ออก, อ่านแคช $0.25

• Terminal-Bench 2.1 — HY4 Preview 85.4 (ตามที่ผู้จำหน่ายรายงาน) เทียบกับ Qwen3.8-Max 86.6

• โมดาลิตี้ — ทั้งสองรุ่นในรูปแบบ open-weight รองรับเฉพาะข้อความ; Qwen3.8-Max API เพิ่มการรับอินพุตรูปภาพและวิดีโอ ส่วน HY4 Preview ไม่รองรับ

• คะแนนอิสระ — HY4 Preview none เทียบกับ Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58

ไพ่สองใบเล่าเรื่องเดียวกันจากคนละมุมมอง บน Terminal-Bench 2.1 คะแนน 86.6 ของ Qwen3.8-Max และ 85.4 ของ HY4 Preview ห่างกันเพียงหนึ่งจุดครึ่ง — โดย Qwen นำอยู่หนึ่งจุด และตัวเลขของ HY4 ยังไม่ผ่านการตรวจสอบ ด้านราคา HY4 Preview ถูกกว่าทั้งอินพุตและเอาต์พุตต่อโทเคน ด้านการตรวจสอบ Qwen3.8-Max มี Intelligence Index อิสระที่ 58 และ Agentic Index ที่ 58 ส่วน HY4 Preview ไม่มีอะไรนอกจากข่าวประชาสัมพันธ์ของตัวเอง ช่องว่างดังกล่าวเป็นรูปแบบคลาสสิกของผู้ท้าชิงที่เข้ามาพร้อมราคาที่ดีกว่าและคำกล่าวอ้างที่ยังไม่ได้รับการพิสูจน์ ต่อกรกับผู้นำที่ผ่านการตรวจสอบแล้ว

การอ่านข้อกล่าวอ้าง Toolathlon

{{1}}Toolathlon-Verified{{/1}} วัดความน่าเชื่อถือของการใช้เครื่องมือแบบ agentic — ว่าตัวแบบจะใช้เครื่องมือทำงานจนจบกระบวนการได้อย่างสม่ำเสมอเพียงใด ทั้งเมื่อเจอข้อผิดพลาด การกู้คืน และการเรียกใช้งานหลายขั้นตอน คะแนน 74.1 ของ Tencent มุ่งตรงไปที่จุดแข็งที่สุดของ Qwen3.8-Max เนื่องจากค่า Agentic Index 58 ของ Qw{{2}}en{{/2}} และคะแนน OSWorld-Verified 86.1 คือตัวเลขที่ทำให้การนำเสนอเชิง agentic ของ Ali{{3}}baba{{/3}} ดูน่าเชื่อถือ Qwen3.8-Max ยังทำคะแนน 82.8 บน {{4}}IFBench{{/4}} (การทำตามคำสั่ง) และ 93.0 บน {{5}}PaperBench{{/5}} (งาน agentic ระดับงานวิจัย) ซึ่งสูงกว่าโมเดลอย่าง {{6}}GPT-5.6 Sol{{/6}} ในตารางของผู้จำหน่ายเอง ดังนั้น Tencent จึงเลือกเกณฑ์ชี้วัดเพียงหนึ่งเดียวที่ตนอ้างว่าชนะโมเดลโอเพนที่ใหญ่ที่สุดของเดือนนี้โดยตรง — และการอ้างสิทธิ์นี้ก็ตรวจสอบได้พอ ๆ กับตัวเลขในตารางที่ผู้จำหน่ายรายเดียวเป็นผู้รายงาน นั่นคือ ตรวจสอบไม่ได้เลย

ที่ยืนยันแล้วเทียบกับที่ผู้จำหน่ายรายงาน

นี่คือแกนที่การแข่งขันไม่ยุติธรรมที่สุด และความไม่สมดุลนี้สมควรได้รับการกล่าวถึงอย่างชัดเจน ดัชนีความฉลาด (Intelligence Index) ของ Qwen3.8-Max ที่ 58 มาจาก Artificial Analysis ดัชนีเชิงตัวแทน (Agentic Index) ที่ 58 ก็มาจาก Artificial Analysis เช่นกัน และชุดทดสอบอิสระชุดเดียวกันที่ให้คะแนนเหล่านี้ก็วัดจุดอ่อนของมันด้วย: อัตราการหลอน (hallucination) 40% บน AA-Omniscience เพิ่มขึ้นจาก 23% ในรุ่นก่อนหน้า และจำนวนรอบเชิงตัวแทน (agentic turns) มากถึง 64 รอบต่องาน ซึ่งถือว่ามหาศาล — โมเดลทำงานหนัก และคุณต้องจ่ายค่าทุกรอบ Tencent HY4 Preview ไม่มีเครื่องมือวัดเหล่านั้นเลย จุดแข็งของมันเป็นเพียงคำกล่าวอ้าง และรูปแบบความล้มเหลวของมัน — ซึ่ง Tencent เองก็ชี้ให้เห็นถึงการคิดที่ยาวเกินไปและการตรวจสอบตนเองมากเกินไป — เป็นการยอมรับ ไม่ใช่การวัดผล

สำหรับทีมที่ต้องเลือกระหว่างสองสิ่งนี้ ช่องว่างด้านการตรวจสอบไม่ใช่เรื่องนามธรรม พฤติกรรม 64 เทิร์นต่องานของ Qwen3.8-Max เป็นตัวขับเคลื่อนต้นทุนที่แท้จริงและวัดผลได้: ที่ราคา $2/$6 มันยังคงเป็นเอเจนต์ที่แพงที่สุดต่องานที่เสร็จสมบูรณ์ในการเปรียบเทียบของบุคคลที่สามบางรายการ และทีมต่าง ๆ รายงานว่าจำนวนเทิร์นกัดกร่อนความได้เปรียบด้านราคาของมัน พฤติกรรมที่เทียบเท่าของ HY4 Preview ยังไม่เป็นที่รู้จัก — มันอาจจะถูกกว่าต่องานกว่าที่ราคาต่อโทเค็นที่ต่ำอยู่แล้วแนะนำ หรือนิสัยการตรวจสอบตัวเองของมันอาจกินส่วนต่างนั้น ยังไม่มีใครบอกคุณได้ว่าอันไหน เพราะไม่มีใครนอก Tencent เคยรันมัน

ราคาและความเป็นจริงในทางปฏิบัติของโอเพนเวตส์

เมื่อคิดต่อโทเคน HY4 Preview ถูกกว่าทั้งสองด้าน: ¥6/¥18 เทียบกับราคา $2.00/$6.00 ของ Qwen3.8-Max และการเข้าถึงแคช (cache hit) อยู่ที่ ¥0.3 เทียบกับ $0.25 ทำให้ HY4 Preview เป็นโมเดลเรือธงแบบเปิดน้ำหนักที่ถูกที่สุดในฝั่งอินพุตหรือเอาต์พุต จบ แต่คำว่า "open weights" มาพร้อมกับข้อกำหนดปลีกย่อยที่แตกต่างกันสองชุด การปล่อยน้ำหนักแบบเปิดของ Qwen3.8-Max — รุ่น Qwen3.8-2.4T-A95B — เป็นแบบข้อความเท่านั้น บังคับให้เปิดโหมดคิด (thinking) มีบริบทดั้งเดิม 262K แทนที่จะเป็น 1M ของ API และมีสัญญาอนุญาตแบบกำหนดเองพร้อมเงื่อนไขตามระดับขนาด: ข้อกำหนดให้แสดงชื่อโมเดลเมื่อมีผู้ใช้เกิน 100 ล้านรายต่อเดือน และมีสัญญาอนุญาตแยกสำหรับธุรกิจ Model-as-a-Service ขนาดใหญ่ ส่วนน้ำหนักของ Tencent HY4 Preview อยู่บน HuggingFace, ModelScope และ GitHub ตั้งแต่เมื่อเช้านี้ แต่ข้อกำหนดสัญญาอนุญาตที่ชัดเจน และว่าน้ำหนักที่ปล่อยออกมานั้นตรงกับ API ที่ให้บริการหรือไม่ ยังไม่ได้ถูกระบุในระดับความชัดเจนแบบเดียวกัน ทั้งสองโมเดลดาวน์โหลดได้ แต่ก็ไม่มีตัวไหนที่เสียบเข้าใช้ได้แบบง่าย ๆ

สรุป

Qwen3.8-Max เป็นตัวเลือกที่ปลอดภัยกว่าในทุกด้านที่การตรวจสอบยืนยันสร้างความปลอดภัยได้: ถูกให้คะแนนอย่างอิสระทั้งด้านความชาญฉลาดและการทำงานแบบเอเจนต์ มีโหมดความล้มเหลวที่ทราบแล้ว มีไลเซนส์ที่ลงตัว และมีฟีดแบ็กจากโปรดักชันสามสัปดาห์ อีกทั้งยังเป็นตัวเลือกที่แพงกว่าต่อโทเคน และพฤติกรรมแบบเทิร์นเยอะที่วัดได้ของมันก็เป็นความเสี่ยงด้านต้นทุนที่ทราบกันดี Tencent HY4 Preview คือตัวเลือกที่คุ้มค่า: ถูกกว่าทั้งอินพุตและเอาต์พุต มีข้ออ้างด้าน Terminal-Bench ที่เทียบเคียงได้ และมีข้ออ้าง Toolathlon-Verified ที่เทียบตรงกับ Qw​en — แต่ทั้งหมดยังไม่ผ่านการตรวจสอบในวันแรก หากคุณจะนำโมเดลโอเพนเวตขึ้นโปรดักชันในสัปดาห์นี้ Qwen3.8-Max คือตัวเลือกที่ให้เหตุผลได้ และมันเปิดใช้งานบน OrcaRouter แล้วในราคารายการของ Ali​baba — $2.00/$6.00 ส่งผ่านโดยไม่บวกมาร์กอัป ส่วน HY4 Preview คือโปรเจกต์ประเมินผล: นำไปรันผ่าน API ของ Tencent เองกับงานสไตล์ Toolathlon ของคุณ ยังคงเส้นทางโปรดักชันไว้บนโมเดลที่ตรวจสอบแล้ว และเมื่อคะแนนอิสระออกมา — หรือเมื่อ HY4 Preview มาถึงเราเตอร์และอัตรา ¥6/¥18 กลายเป็นการส่งผ่านในวันเดียวกัน — การสลับก็คือกฎการจัดเส้นทาง ไม่ใช่การเขียนโค้ดใหม่

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

ดูอะไรดี

• การรันอิสระครั้งแรกของ HY4 Preview บนแฮร์เนสแบบเอเจนต์ คะแนน 74.1 ที่ Toolathlon รับรองคือตัวเลขที่ Tencent ต้องการเอาชนะ; ดัชนี Agentic จากบุคคลที่สามจะเป็นการยืนยัน

• จำนวนเทิร์นที่วัดได้ของ HY4 Preview 64 เทิร์นต่องานของ Qwen3.8-Max คือเรื่องเตือนใจ ไม่ว่า HY4 Preview จะถูกกว่าต่องานที่เสร็จสมบูรณ์หรือไม่ คือข้อโต้แย้งทางเศรษฐกิจทั้งหมด

• ข้อกำหนดสิทธิ์การใช้งานบนน้ำหนัก (weights) จะเป็นตัวกำหนดว่า "เปิด" หมายถึง "ใช้งานได้ในขนาดของคุณ" สำหรับ HY4 Preview เช่นเดียวกับเงื่อนไขสิทธิ์การใช้งาน Qwen3.8-Max ที่เคยกำหนดสำหรับโมเดลของ Alibaba

• ไม่ว่าผู้จำหน่ายรายใดจะลดราคาอีกครั้งหรือไม่ ในเดือนที่เรือธงแบบ open-weight สองรุ่นวางจำหน่ายพร้อมราคาเชิงรุก การส่งผ่านบนเราเตอร์ทำให้การลดราคาเพิ่มเติมใดๆ ปรากฏให้เห็นในวันเดียวกัน

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube