
Tencent HY4 Preview เทียบกับ tencent-hy3: ราคาที่แพงกว่าหกเท่า และสิ่งที่การก้าวกระโดดนี้มอบให้จริง ๆ
- googleใหม่Google: Gemini 3.8 Flash2026-09-0259ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0258ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0166ความฉลาด82การเขียนโค้ด
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
Tencent HY4 Preview เป็นโมเดลแรกในตระกูล Hunyuan ที่ทำให้รุ่นก่อนหน้าของตัวเองดูราคาถูกอย่างจงใจ: Tencent ตั้งราคาอินพุตไว้ที่หกเท่าของ tencent-hy3 และราคาเอาต์พุตสี่เท่าครึ่ง และเอกสารเปิดตัวโต้ว่าราคาพรีเมียมนั้นคุ้มค่า เปิดตัวและเปิดซอร์สเมื่อวันที่ 28 สิงหาคม 2026 Tencent HY4 Preview รายงานคะแนนวิศวกรรมซอฟต์แวร์บน DeepSWE ที่มากกว่าสองเท่าของ 28.0 ของ Hy3 คะแนนการใช้งานเทอร์มินัล 85.4 บน Terminal-Bench 2.1 และหน้าต่างบริบทที่เพิ่มจาก 256K เป็นมากกว่าล้านโทเคน tencent-hy3 ซึ่งเปิดตัวอย่างเป็นทางการเมื่อวันที่ 6 กรกฎาคม เป็นตัวทำงานหลักที่โตเต็มที่ของตระกูล — พารามิเตอร์รวม 295B แอ็กทีฟ 21B บริบทหนึ่งในสี่ และราคาที่แทบจะเรียกว่าเป็นเศษเงิน นี่ไม่ใช่การแข่งขันที่สเปกชีตทำให้สูสี คำถามคือว่าช่องว่างนั้นคุ้มค่ากับเงินที่จ่ายสำหรับสิ่งที่คุณรันจริงหรือไม่ และคำตอบก็แยกตามลักษณะงาน
กระดานคะแนน: จุดที่ทั้งสองแตกต่างกันจริงๆ
เกณฑ์มาตรฐานทุกชุดในเอกสารของ Tencent เป็นข้อมูลที่รายงานโดยผู้จำหน่ายเอง — รันบนระบบประเมินของ Tencent เองในการเปิดตัวแต่ละรุ่น ไม่มีการตรวจสอบซ้ำโดยห้องปฏิบัติการอิสระ และสำหรับรุ่นเรือธง โมเดลถูกเปิดตัวสู่สาธารณะมาไม่ถึงหนึ่งวัน จงถือว่าคะแนนเหล่านี้เป็นเพดานที่ Tencent เชื่อว่าทำได้ และให้น้ำหนักกับรูปแบบโดยรวมมากกว่าตัวเลขใดตัวเลขหนึ่ง รูปแบบนั้นชัดเจนเกินจะปฏิเสธ และมันกระจุกตัวอยู่ที่งานวิศวกรรมเชิงตัวแทน (agentic engineering) มากกว่าความรู้ทั่วไป:
• DeepSWE — Tencent HY4 รุ่นตัวอย่าง: 64.3. tencent-hy3: 28.0. นี่คือการก้าวกระโดดครั้งใหญ่ที่สุดในการจับคู่ครั้งนี้ ด้วยการเพิ่มขึ้นมากกว่าสองเท่าในเกณฑ์ชี้วัดวิศวกรรมซอฟต์แวร์ระดับ repository และนี่คือตัวเลขที่แยกแยะโมเดลแชตออกจากโมเดลที่คุณมอบโค้ดเบสทั้งหมดให้
• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4 ซึ่ง Tencent กล่าวว่าเทียบเท่ากับ Claude Opus 5 และผ่าน DeepSeek V4 Pro ส่วน tencent-hy3: 71.7 ตามที่รายงานเมื่อเปิดตัวในเดือนกรกฎาคม การขับเคลื่อนเทอร์มินัลจริงให้ทำงานจนสำเร็จในงานหลายขั้นตอนคือประเภทของงานระยะยาวที่ Hy3 ทำได้แย่ที่สุด
• Toolathlon-Verified — Tencent HY4 Preview: 74.1 ซึ่ง Tencent กล่าวว่าเหนือกว่า Qwen 3.8 Max และ GPT-5.6 Sol โดยไม่มีการเผยแพร่ตัวเลข Hy3 ที่เทียบเคียงได้
• การทดสอบแบบปกปิดภายใน — ผู้เชี่ยวชาญ 163 คนให้คะแนนงานวิศวกรรม 203 งานที่ 2.99/4.00 สำหรับ Tencent HY4 Preview แซงหน้า GLM-5.3 (2.92) และ Kimi K3 (2.94) เล็กน้อย นี่คือผู้ตรวจสอบของ Tencent ที่ประเมินงานของ Tencent เอง ควรถือเป็นเพียงแนวโน้ม

เส้นด้ายที่สอดคล้องกัน: ผลลัพธ์ที่ได้อยู่ที่การขับเคลื่อนเทอร์มินัล การเรียกใช้เครื่องมือ และงานในระดับคลังโค้ด — จุดยืนเรื่องประสิทธิภาพการทำงานที่ Tencent ผลักดันมาตั้งแต่ Hy3 ตอนนี้มีพลังคำนวณรองรับแล้ว
ราคาพรีเมียม ทีละบรรทัด
นี่คือจุดที่การเปรียบเทียบเลิกเป็นเรื่องของการอวดอ้าง ราคาป้ายของ Tencent ต่อล้านโทเคน:
• อินพุต — Tencent HY4 Preview: 6 หยวน (~US$0.85). tencent-hy3: 1 หยวน (~US$0.14). หกเท่า
• ผลลัพธ์ — Tencent HY4 Preview: 18 หยวน (~US$2.50). tencent-hy3: 4 หยวน (~US$0.56). สี่เท่าครึ่ง
• แคชฮิต — Tencent HY4 Preview: 0.3 หยวน. tencent-hy3: 0.25 หยวน. เกือบจะเท่ากัน ซึ่งสำคัญกว่าที่เห็น เพราะลูปแบบ agentic ส่ง system prompt และคำนำหน้าบทสนทนาชุดเดิมซ้ำ ๆ อยู่ตลอดเวลา
รันปริมาณงานการเขียนโค้ดแบบเอเจนต์ที่สมจริงผ่านตัวเลขแบบผสม — เช่น โทเคนอินพุต 20 ล้านและเอาต์พุต 4 ล้านโทเคนต่อเดือน ซึ่งเป็นงบประมาณของนักพัฒนาเดี่ยวที่ยุ่ง ๆ Tencent HY4 Preview: 120 หยวนบวก 72 หยวน รวมประมาณ 192 หยวน (ประมาณ US$27) tencent-hy3: 20 หยวนบวก 16 หยวน รวมประมาณ 36 หยวน (ประมาณ US$5) รุ่นเรือธงมีค่าใช้จ่ายในการรันสูงกว่าถึงห้าเท่าหรือมากกว่า ด้วยส่วนผสมโทเคนเดียวกัน — และมันจะขอโทเคนเอาต์พุตต่องานมากขึ้น เพราะมันคิดนานกว่า
นั่นไม่ใช่เหตุผลที่จะหลีกเลี่ยง Tencent HY4 Preview; การก้าวกระโดดของ DeepSWE คือความสามารถแบบที่พรีเมียมมีไว้ให้ซื้ออย่างแท้จริง แต่มันเป็นเหตุผลที่จะต้องประเมินราคาเวิร์กโหลดก่อนที่จะจัดเส้นทางไปยังมัน และนี่คือจุดที่เลเยอร์การจัดเส้นทางแสดงคุณค่าของมัน: tencent-hy3 อยู่บน OrcaRouter แล้วในราคารายการของผู้ให้บริการ — มาร์กอัป 0% ดังนั้นตัวเลขที่คุณเห็นคือราคาของผู้ให้บริการจริง ไม่ใช่เวอร์ชันที่ถูกขายต่อและบวกมาร์กอัป — พร้อมการเฟลโอเวอร์อัตโนมัติข้ามผู้ให้บริการ และการเปลี่ยนแปลงราคาจากผู้ขายจะมีผลในฝั่งเราในวันเดียวกัน
บริบทสี่เท่า กำลังประมวลผลที่ใช้งานสองเท่า
• สถาปัตยกรรม — Tencent HY4 Preview: ทั้งหมด 770B, MoE แอกทีฟ 49B. tencent-hy3: ทั้งหมด 295B, แอกทีฟ 21B. รุ่นเรือธงใช้พลังการคำนวณต่อโทเคนประมาณ 2.3 เท่า
• หน้าต่างบริบท — Tencent HY4 Preview: มากกว่า 1M โทเคน tencent-hy3: 256K. รีโพสิทอรีทั้งหมดหรือชุดเอกสารทางการเงินสามารถใส่ลงในหน้าต่างของรุ่นเรือธงได้ในคำขอเดียว ส่วนบน Hy3 งานเดียวกันต้องมีการแบ่งส่วน chunking การดึงข้อมูล retrieval หรือลูปของเอเจนต์ agent loop
• การควบคุมการใช้เหตุผล — tencent-hy3 มาพร้อมการตั้งค่า reasoning_effort ต่อคำขอ (no_think, low, high) รวมถึงเลเยอร์ speculative-decoding ที่ช่วยให้มันทำงานเร็ว ส่วน Tencent HY4 Preview ตามที่ Tencent ยอมรับเอง มีแนวโน้มที่จะคิดนานก่อนให้ผลลัพธ์แรก และตรวจสอบตัวเองมากเกินไปในงานที่ซับซ้อน — ซึ่งเผาผลาญโทเคนเพื่อตรวจสอบงานที่ทำไปแล้วซ้ำแล้วซ้ำเล่า
ประโยคสุดท้ายนั้นคือความแตกต่างที่ซ่อนอยู่สำหรับการใช้งานที่ไวต่อความหน่วง Hy3 สามารถสั่งให้ตอบตรงๆ ได้ ในขณะที่ Tencent HY4 Preview อย่างน้อยในรูปแบบเริ่มต้นนี้ มักจะเลี่ยงไม่ได้ที่จะต้องคิด สำหรับแชทที่ต้องการความหน่วงต่ำหรือไปป์ไลน์การสกัดข้อมูลที่ต้องการปริมาณงานสูง ความสามารถพิเศษที่เพิ่มขึ้นของรุ่นเรือธงนั้นสูญเปล่า และการคิดเพิ่มเติมของมันก็เป็นภาษีที่ต้องจ่าย สำหรับงานวิศวกรรมแบบแบตช์ที่ประมวลผลออฟไลน์ ภาษีนั้นคือสิ่งที่ทำให้ได้คำตอบที่ดีกว่า
ภาษีตัวอย่าง: สิ่งที่ Hy3 ยังมี
"Preview" อยู่ในชื่อของ Tencent HY4 Preview และมันก็เป็นเช่นนั้นจริง ๆ ไม่มีการรับภาพหรืออินพุตแบบมัลติโมดัล — โมเดลนี้รองรับเฉพาะข้อความ ดังนั้นอะไรก็ตามที่เกี่ยวข้องกับรูปภาพหรือวิดีโอยังคงต้องใช้โมเดลเดิมที่คุณใช้สำหรับงานนั้นอยู่ การทดลองใช้ฟรีสองสัปดาห์บน WorkBuddy และ CodeBuddy เป็นเพียงการลิ้มลอง ไม่ใช่แผนการใช้งาน Tencent ได้ระบุชัดเจนว่านี่คือเวอร์ชันต้น ๆ ของ Hy4 โดยการปรับปรุงทั้ง pre-training และ post-training ยังจะตามมาในจังหวะที่เคยปล่อยเวอร์ชันหลักทุก ๆ ประมาณสองเดือนนับตั้งแต่เดือนกุมภาพันธ์ เกณฑ์มาตรฐานอิสระสำหรับรุ่นเรือธง: ยังไม่มีที่ไหนเลย
tencent-hy3 ตรงข้ามกับทั้งหมดนั้นโดยสิ้นเชิง มันคือเวอร์ชันอย่างเป็นทางการที่มีความเสถียร เปิดใช้งานในการผลิตจริงตั้งแต่เดือนกรกฎาคม ระดับฟรีใช้งานได้ถึงวันที่ 30 กันยายน ระดับการใช้เหตุผลของมันให้คุณปรับระดับได้แทนที่จะต้องเดาใจ และเลเยอร์ speculative-decoding กับพารามิเตอร์แอ็คทีฟ 21B ทำให้มันเป็นฝั่งที่ถูก รวดเร็ว และคาดเดาได้ของตระกูลนี้ — โมเดลที่คุณชี้ไปที่เส้นทางตั้งค่าเริ่มต้นแล้วลืมมันไปได้เลย

ใครควรเลือกอันไหน
เลือก Tencent HY4 Preview เมื่อคุณค่าอยู่ที่ผลงาน — งานวิศวกรรมซอฟต์แวร์ที่ยาก บริบทระดับ repository เวิร์กโฟลว์แบบ agentic ซึ่งคำตอบที่ดีกว่าคุ้มกับค่าใช้จ่าย token ที่สูงขึ้นห้าเท่า และคุณรับได้กับ latency ของโมเดลที่คิดก่อนพูด เลือก tencent-hy3 เมื่อข้อจำกัดคือตัวกำหนด — ปริมาณงานสูง latency ต่ำ งบประมาณจำกัด หรืองานใดๆ ที่คุณต้องการให้โมเดลตอบโดยไม่ต้องไตร่ตรอง
รูปแบบเชิงปฏิบัติสำหรับการจับคู่แบบนี้คือการยกระดับ: กำหนดเส้นทางไปยังโมเดลราคาถูกและควบคุมได้บนเส้นทางเริ่มต้น แล้วยกระดับไปยังโมเดลเรือธงเฉพาะเมื่องานต้องการเท่านั้น นี่คือสิ่งที่ routing DSL ของ OrcaRouter มีไว้สำหรับ — การรวมโมเดลหลายตัวไว้ในการเรียกครั้งเดียวเพื่อให้ policy เป็นการกำหนดค่ามากกว่าโค้ด — และการ failover อัตโนมัติหมายความว่าเส้นทางของ Hy3 ยังคงให้บริการต่อไปแม้ผู้ให้บริการรายหนึ่งจะประสิทธิภาพลดลง OrcaRouter ยังไม่ได้กำหนดเส้นทางให้ Tencent HY4 Preview; Tencent ยังไม่ได้เปิดโมเดลให้บริการ inference กับบุคคลที่สาม ดังนั้นในตอนนี้มันจึงทำงานบน endpoint ของ Tencent Cloud TokenHub ของผู้ให้บริการเอง และบนการปรับใช้แบบ self-hosted ของ open weights ในขณะเดียวกัน tencent-hy3 อยู่ในแคตตาล็อกแล้ววันนี้ในราคารายการของผู้ให้บริการ — และในวันที่โมเดลเรือธงเปิดให้บริการ มันจะเข้าไปในเลเยอร์การกำหนดเส้นทางเดียวกันในแบบเดียวกัน ทำให้การสลับจากโมเดลหนึ่งไปอีกโมเดลหนึ่งกลายเป็นการเปลี่ยนแปลงเพียงบรรทัดเดียว แทนที่จะต้องเขียนใหม่ทั้งหมด

คำตัดสินนี้ธรรมดาในทางที่ดีที่สุด: เรือธงคุ้มค่ากับราคาพรีเมียมสำหรับงานที่มันถูกตั้งราคาไว้ให้ทำพอดี และม้าศึกก็ยังเป็นตัวเลือกที่ถูกต้องสำหรับทุกอย่างที่แค่ต้องทำให้เสร็จ ช่องว่างราคาหกเท่านั้นมีจริง ช่องว่าง DeepSWE 28 ถึง 64 ก็มีจริง และทั้งสองไม่ได้หักล้างกัน — คุณแค่ต้องรู้ว่าคุณกำลังซื้อตัวไหน
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
