
Tencent Hy4 Preview รองรับการทำงานใน vLLM ตั้งแต่วันแรก: โมเดล MoE แบบ Open-Weight ขนาด 770B ที่คุณนำไปใช้งานจริงได้
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
เมื่อ Tencent Hy4 Preview เปิดตัวในวันที่ 28 สิงหาคม 2026 มันทำสิ่งที่โมเดลระดับแนวหน้าส่วนใหญ่ไม่ทำในวันแรก นั่นคือพร้อมใช้งานจริงทันที ควบคู่ไปกับ open weights ทีม Tencent และ vLLM ได้เผยแพร่ Docker image ที่ build ไว้ล่วงหน้า สูตรการ serving อย่างเป็นทางการ และรวมการสนับสนุนเฟรมเวิร์กไว้ในตัว vLLM เอง ดังนั้นโมเดล open-weight ที่ใหญ่ที่สุดที่ Hunyuan เคยสร้างมา — รวม 770 พันล้านพารามิเตอร์ โดยมี 49 พันล้านพารามิเตอร์ที่ทำงานต่อ token — จึงสามารถเข้าถึงได้ผ่าน endpoint ที่เข้ากันได้กับ OpenAI บน GPU ของคุณเองภายในไม่กี่ชั่วโมงหลังการประกาศ เรื่องราวของ runtime พร้อมใช้ตั้งแต่วันแรกคือประเด็นที่โพสต์นี้ต้องการพูดถึง เพราะคำว่า "รันบน vLLM ได้" ไม่ใช่แค่เชิงอรรถสำหรับโมเดลขนาดนี้ มันคือความแตกต่างระหว่างแถลงข่าวกับสิ่งที่คุณนำไปใช้จริงในโปรดักชันได้
การเปิดตัวที่เหลือเป็นแพ็คเกจรูปแบบพรีวิวตามปกติ และข้อควรระวังสำคัญพอๆ กับตัวเลข เทนเซ็นต์เรียก Tencent Hy4 Preview ว่าเป็นเวอร์ชันเริ่มต้น ระบุว่าการใช้เหตุผลที่ยาวเกินไปและการตรวจสอบตัวเองที่มากเกินไปเป็นพฤติกรรมที่ทราบกันดี และเผยแพร่ตารางเบนช์มาร์กที่รายงานด้วยตนเองทั้งหมด ยังไม่มีห้องแล็บอิสระแห่งใดให้คะแนน และโมเดลนี้เพิ่งเปิดตัวได้สองวัน ณ เวลาที่เขียนบทความนี้ ไม่มีสิ่งใดเปลี่ยนใจความสำคัญในทางปฏิบัติ: น้ำหนักโมเดลอยู่ภายใต้ Apache 2.0 หน้าต่างบริบทรองรับ 1 ล้านโทเคน และการรองรับ vLLM ตั้งแต่วันแรกหมายความว่าเส้นทางการโฮสต์ด้วยตนเองเป็นจริง ไม่ใช่เพียงความปรารถนา
Tencent Hy4 Preview แท้จริงแล้วคืออะไร
เทนเซ็นต์วางตำแหน่ง Tencent Hy4 Preview ให้เป็นรุ่นสืบต่อจาก Hy3 (พารามิเตอร์รวม 295B, บริบท 256K) โดยเพิ่มความจุแบบ active ขึ้นประมาณสองเท่า และขยายหน้าต่างบริบทเป็นสี่เท่า สถาปัตยกรรมนี้น่าอ่านทีละบรรทัด เพราะแต่ละบรรทัดเปลี่ยนสิ่งที่โมเดลแบบ open-weight สามารถทำได้บนฮาร์ดแวร์ของคุณ
• สถาปัตยกรรม — Mixture-of-Experts ที่มีพารามิเตอร์รวม 770B และพารามิเตอร์ที่ใช้งานต่อโทเคน 49B ใน 78 เลเยอร์ เลเยอร์แรกเป็นแบบ dense ส่วนอีก 77 เลเยอร์ที่เหลือจะส่งแต่ละโทเคนไปยัง routed experts จำนวน 256 ตัว บวกกับ shared expert อีก 1 ตัว โดยเปิดใช้งาน 8 อันดับแรก อัตราส่วนความเบาบางประมาณ 16:1 นี้เองที่ทำให้ต้นทุนการอนุมานอยู่ในระดับที่ทีมจริงจังสามารถรันได้จริง
• หน้าต่างบริบท — รองรับ 1,048,576 โทเคนโดยกำเนิด ถือเป็นหนึ่งในความกว้างที่สุดในบรรดาโมเดลโอเพนเวททั้งหมด คลังโค้ดทั้งชุด การรีแฟกเตอร์หลายไฟล์ หรือเอกสารยาวเป็นชุด: ปัญหาที่จัดการได้ในคำขอเดียว
• Attention — Gated DeepSeek Sparse Attention (Gated DSA) พร้อม IndexCache เป็นการออกแบบ sparse attention ที่คำนวณดัชนี sparse ใหม่บนเพียง 21 เลเยอร์จากทั้งหมด 78 เลเยอร์ และนำกลับมาใช้ซ้ำบนอีก 57 เลเยอร์ที่เหลือ นั่นคือเหตุผลที่การเสิร์ฟ (serving) มันไม่ใช่แค่ "vLLM ที่ใหญ่ขึ้น" — แต่ต้องมีแบ็กเอนด์ที่เข้าใจ sparse attention
การถอดรหัสแบบคาดการณ์ล่วงหน้า (speculative decoding) ในตัว — ชั้น MTP (multi-token prediction) ที่มีพารามิเตอร์รวมประมาณ 10B / พารามิเตอร์ที่ใช้งานจริง 0.7B อยู่ภายในโมเดล ทำให้ vLLM และ SGLang สามารถร่างโทเคนล่วงหน้าได้โดยไม่ต้องให้คุณโฮสต์โมเดล draft แยกต่างหาก
• น้ำหนัก — Apache 2.0 ในรูปแบบเช็คพอยต์ทั้ง BF16 และ FP8 เผยแพร่บน Hugging Face, ModelScope, GitCode และ CNB
"day-zero vLLM" จริงๆ แล้วหมายถึงอะไร
การสนับสนุนเฟรมเวิร์กแบบรวมในวันเปิดตัวคือเหตุการณ์รูปธรรมที่อยู่เบื้องหลังสัญญาณนี้ — การเปลี่ยนแปลง vLLM ที่เพิ่ม Tencent Hy4 Preview (PR #54160) มาถึงในช่วงเวลาเดียวกับการเผยแพร่ และสูตรอย่างเป็นทางการกำหนดเป้าหมาย vLLM 0.29.0 หรือใหม่กว่า ในทางปฏิบัติหมายความว่าเส้นทางการให้บริการเป็นเพียงคำสั่งเดียว ไม่ใช่การดีบักเคอร์เนลทั้งสัปดาห์
docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview
แฟล็กมีความสำคัญ และแต่ละแฟล็กแมปกับบางอย่างในโมเดล แทนที่จะเป็นเพียงข้อความมาตรฐาน:
• --attention-backend FLASHMLA_SPARSE — จำเป็น ไม่ใช่ตัวเลือกเสริม Gated DSA sparse attention ของ Tencent Hy4 Preview ไม่ทำงานอย่างถูกต้องบนแบ็กเอนด์แบบ dense เริ่มต้น และแฟล็กนี้คือสิ่งที่สูตรอย่างเป็นทางการกำหนดให้ตั้งค่า
• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — เปิดใช้งานเลเยอร์ MTP ในตัวของโมเดลสำหรับการถอดรหัสแบบ speculative โดยสร้างโทเคน draft ล่วงหน้าสามโทเคน ไม่ต้องปรับใช้โมเดล draft แยกต่างหาก
• --tool-call-parser hy_v4 และ --reasoning-parser hy_v4 — ตัวแยกวิเคราะห์ (parser) แบบกำหนดเองที่บอกเซิร์ฟเวอร์ว่า Tencent Hy4 Preview ปล่อยการเรียกใช้เครื่องมือ (tool calls) และสายการคิด (chain-of-thought) ของมันอย่างไร โดยที่ --enable-auto-tool-choice จะให้โมเดลเป็นผู้ตัดสินใจว่าจะเรียกใช้เครื่องมือเมื่อใด
Tencent แนะนำให้ใช้ temperature 0.9 และ top_p 1.0 สำหรับการสุ่มตัวอย่าง (sampling) โดยค่าเริ่มต้น Reasoning จะเป็น chain-of-thought ที่ใช้ความพยายามระดับ "สูง" ซึ่งมุ่งเน้นไปที่คณิตศาสตร์ การเขียนโค้ด และงานที่ซับซ้อน หากคุณต้องการคำตอบตรงไปตรงมาโดยไม่ต้องผ่านการคิดที่ยาวนาน คุณสามารถส่ง reasoning effort เป็น no_think ในคำขอ แทนที่จะเปลี่ยน weights

การสนับสนุนแบบ Day-zero ไม่ได้มีเฉพาะ vLLM เท่านั้น ซึ่งถือเป็นเรื่องน่าจับตามองสำหรับเวอร์ชันที่เพิ่งออกใหม่ขนาดนี้ SGLang ปล่อยอิมเมจแบบ multi-architecture ที่สร้างไว้ล่วงหน้า (lmsysorg/sglang:hy4-preview) พร้อม speculative decoding แบบ NEXTN ในวันเดียวกัน และระบบนิเวศ Ascend ก็มีการสนับสนุนแบบ 0-day ผ่าน vLLM-Ascend โดยใช้เวทเทนที่ถูก quantized แบบ W8A8 บน NPU Atlas 800I A3 จำนวน 16 ตัว โดยปกติแล้วการปล่อยโมเดลแบบ open-weight มักต้องใช้เวลาหลายสัปดาห์กว่าระบบนิเวศการ serve จะตามทัน แต่ครั้งนี้ใช้เวลาเพียงไม่กี่ชั่วโมง
คะแนนที่ควรค่าแก่การอ้างอิง
ทุกเกณฑ์มาตรฐานที่ Tencent เผยแพร่สำหรับ Tencent Hy4 Preview เป็นรายงานจากผู้พัฒนาระบบเอง ซึ่งดำเนินการบนชุดการประเมินของ Tencent เอง ยังไม่ได้รับการทำซ้ำโดยห้องปฏิบัติการอิสระใดๆ และโมเดลนี้เผยแพร่สู่สาธารณะเพียงสองวันแล้ว จงอ่านตัวเลขเหล่านี้ว่าเป็นเพดานสูงสุดที่ Tencent เชื่อว่าทำได้ ไม่ใช่ข้อเท็จจริงที่ได้รับการยืนยัน การตรวจสอบโดยอิสระจะยังไม่มีจนกว่าบุคคลที่สามจะทำการทดสอบ และยังไม่มีสิ่งใดบนลีดเดอร์บอร์ดสาธารณะที่สะท้อนถึงโมเดลนี้ในขณะนี้

ตัวเลขหลักคือ Terminal Bench 2.1 ซึ่งเป็นการทดสอบว่าโมเดลขับเคลื่อนเทอร์มินัลจริงได้ดีเพียงใดขณะเขียนโค้ด Tencent รายงานว่า Tencent Hy4 Preview ทำได้ 85.4 ซึ่งบริษัทอ้างว่าเสมอ Claude Opus 5 และผ่าน DeepSeek V4 Pro และทำได้ดีกว่ารุ่นก่อนหน้าอย่าง Hy3 อยู่ 14.6 คะแนน ตัวเลขเพียงตัวเดียวนั้นแบกทั้งการเปิดตัวครั้งนี้ นั่นคือข้ออ้างที่ทำให้โมเดลโอเพนเวทเทียบชั้นกับโมเดลเฟรนเทียร์แบบปิดที่แพงที่สุดในการทดสอบการเขียนโค้ดแบบเอเจนติกที่ยาก และเป็นข้ออ้างที่ต้องการการยืนยันจากหน่วยงานอิสระมากที่สุด
ส่วนที่เหลือของตารางภายใน ทั้งหมดเป็นตัวเลขของเทนเซนต์เอง: DeepSWE เกณฑ์มาตรฐานด้านวิศวกรรมซอฟต์แวร์ พุ่งจาก 28.0 บน Hy3 เป็น 64.3 SWE-bench Pro ได้ 65.7 และ SWE-bench Multilingual ได้ 82.9 ในการทดสอบ Toolathlon-Verified ซึ่งเป็นการทดสอบการเรียกใช้เครื่องมือ เทนเซนต์รายงาน 74.1 โดยระบุว่าเหนือกว่า Qwen 3.8 Max และ GPT-5.6 Sol และใกล้เคียงกับ Kimi K3 และ Claude Opus 5 ใน APEX-Agents pass@1 ได้ 37.1 ตามหลัง Kimi K3 ที่ 37.2 เพียงเล็กน้อย และในการประเมินแบบ blind ภายในซึ่งแยกต่างหาก ผู้เชี่ยวชาญ 163 คนที่เทนเซนต์คัดเลือกให้คะแนนงานวิศวกรรม 203 งานที่ 2.99 จาก 4.00 สูงกว่า GLM-5.3 ที่ 2.92 และ Kimi K3 ที่ 2.94 เล็กน้อย
รูปแบบสองแบบนี้น่าจดบันทึกไว้ ตัวเลขที่แข็งแกร่งทุกรายการล้วนเป็นงานวิศวกรรมเชิงเอเจนต์ — การขับเคลื่อนเทอร์มินัล การเรียกใช้เครื่องมือ งานระดับรีโพซิทอรี — และไม่มีรายการใดเป็นความรู้ทั่วไปหรือการใช้เหตุผล ซึ่งสอดคล้องกับตำแหน่งทางการตลาดที่เน้นประสิทธิภาพการทำงาน มิใช่เรื่องบังเอิญ และ Tencent อธิบายว่า DeepSWE และโมเดลอื่นๆ เป็นการลดช่องว่าง ไม่ใช่การปิดช่องว่าง ข้ออ้างเรื่องความเท่าเทียมที่ชัดเจนและขายได้จริงเพียงข้อเดียวคือการเสมอกันบน Terminal Bench 2.1 และนั่นคือข้ออ้างที่คุ้มค่าที่สุดที่จะทดสอบกับเวิร์กโหลดของคุณเอง
ค่าใช้จ่ายที่แท้จริงในการใช้งาน
คณิตศาสตร์การโฮสต์ด้วยตนเองเป็นสิ่งแรกที่ต้องพูดตรงๆ นี่ไม่ใช่โมเดลที่ใช้ GPU ตัวเดียว และไม่ใช่โมเดลสำหรับเดสก์ท็อป เช็คพอยต์ FP8 มีน้ำหนักเกือบเทราไบต์ และสูตรอย่างเป็นทางการกำหนดให้ใช้ tensor parallelism เท่ากับ 8 นั่นคือ GPU แบนด์วิดท์สูงแปดตัวพร้อมการเชื่อมต่อระหว่างกันที่รวดเร็ว (ฮาร์ดแวร์อ้างอิงของเทนเซนต์สำหรับ FP8 คือ 8×B300 ส่วน BF16 เต็มรูปแบบต้องใช้ 16×B200) หากคุณไม่มีทรัพยากรขนาดนั้น คุณจะไม่สามารถโฮสต์มันด้วยตนเองในราคาถูกได้ และแบ็กเอนด์แบบ sparse-attention หมายความว่าไม่มีทางลัดสำหรับหน่วยความจำของ KV cache ในบริบท 1M โทเคน
ส่วนเสริมหนึ่งในช่วงสัปดาห์เปิดตัวได้เปลี่ยนส่วนหนึ่งของสมการสำหรับทีมที่ต้องการ open weights โดยไม่ต้องแบกรับขนาดของโมเดลเรือธง ทีม Hy ของ Tencent เปิดตัวบิลด์ GGUF ที่บีบอัดของ Tencent Hy4 Preview โดยลดขนาดรีลีส BF16 ประมาณ 1.5 TB ลงเหลือราว 200 GiB ด้วยสคีมาการควอนไทซ์แบบผสมต่อเลเยอร์ที่เรียกว่า MIX-STQ1_0 — เทนเซอร์ expert จำนวนมากลดลงเหลือประมาณ 1.3 บิต ขณะที่เลเยอร์ที่สำคัญต่อ residual stream ยังคงความแม่นยำสูงกว่า ในการประเมินของ Tencent เอง ความแม่นยำเปลี่ยนแปลงเล็กน้อย — SWE-bench Multilingual 82.9 เป็น 81.3, MCP Atlas 83.7 เป็น 83.2, IFBench 73.5 เป็น 72.5 — ซึ่งเป็นข้อแลกเปลี่ยนที่ผู้จำหน่ายเรียกว่าแทบไม่สูญเสีย ตัวเลขเหล่านั้นเป็นตัวเลขของ Tencent บนชุดการตั้งค่าของ Tencent เอง ยังไม่มีการทำซ้ำผล โมเดลขนาด 200 GiB ยังไม่ใช่โมเดลที่รันบน GPU ตัวเดียว แต่ก็เป็นเดิมพันที่เล็กกว่าอย่างมีนัยสำคัญเมื่อเทียบกับ checkpoint FP8 เกือบเทราไบต์ และทำให้เส้นทาง open weights เข้าถึงได้ด้วยโหนด multi-GPU ที่เล็กกว่าที่สูตรแปด B300 กำหนด
เส้นทาง API คือจุดที่ราคาเริ่มน่าสนใจ บน TokenHub ของ Tencent Cloud นั้น Tencent Hy4 Preview ตั้งราคาไว้ที่ 6 หยวน (ประมาณ 0.83 ดอลลาร์สหรัฐ) ต่อล้าน input tokens, 18 หยวน (ประมาณ 2.50 ดอลลาร์สหรัฐ) ต่อล้าน output tokens และ 0.3 หยวน (ประมาณ 0.04 ดอลลาร์สหรัฐ) ต่อล้าน tokens สำหรับ cache hits ราคา output ที่ประมาณ 2.50 ดอลลาร์ต่อล้านนั้นต่ำกว่าราคา output 25 ดอลลาร์ต่อล้านของโมเดล frontier แบบปิดระดับแนวหน้ามาก และอัตราค่า cache-hit ที่ถูกนี้ทำให้ agentic loops แบบยาว — ซึ่ง system prompt และคำนำหน้าบทสนทนาชุดเดียวกันถูกส่งซ้ำอยู่ตลอด — มีต้นทุนต่ำอย่างผิดปกติ
Tencent ยังให้สิทธิ์เข้าถึง Tencent Hy4 Preview ฟรีเป็นเวลาสองสัปดาห์ภายใน WorkBuddy และ CodeBuddy ในขณะที่โมเดลยังใหม่อยู่ วิธีที่ถูกที่สุดในการลองใช้ในสัปดาห์นี้จึงเป็นฟรี — และ WorkBuddy คือจุดที่ตำแหน่งด้านประสิทธิภาพการทำงานมีความเป็นรูปธรรมจริง ในการสนทนาภายใน WorkBuddy ตัวเลือกโมเดลจะสลับระหว่าง Hy3 และ Hy4 preview ดังนั้นการแบ่งระหว่างงานออฟฟิศด้านประสิทธิภาพและการวิเคราะห์ในฝั่งหนึ่ง กับการเขียนโค้ดในอีกฝั่งหนึ่ง จึงเป็นการเลือกตามงานแต่ละชิ้น มากกว่าการตัดสินใจเกี่ยวกับการปรับใช้ การแบ่งเช่นนี้ตรงกับเป้าหมายที่ Tencent ตั้งไว้สำหรับโมเดล และการทดสอบภาคปฏิบัติใน WorkBuddy พบว่ามันสร้างผลงานที่ซับซ้อนได้ในครั้งเดียว ตั้งแต่ต้นแบบเกม low-poly ที่เล่นได้จากคำสั่งเดียว รายงานทบทวนธุรกิจรายไตรมาสฉบับเต็มที่ประกอบจากเอกสารแนบสิบไฟล์โดยไม่ต้องลงมือแก้ไขด้วยตนเองเลย และในการสาธิตของผู้ทดสอบที่แชร์กันในสัปดาห์นี้ก็คือการจำลองหลุมดำ สิ่งเหล่านี้เป็นข้อสังเกตจากชุมชนบนแอปของ Tencent เอง ไม่ใช่ benchmark จากทางผู้ผลิต แต่เป็นสัญญาณแรกจากการใช้งานจริงว่าโมเดลทำงานกับงานหลายขั้นตอนจริงได้อย่างไร และคุณสามารถทำซ้ำได้ฟรีก่อนที่จะเสียเงินอะไร
จุดที่ตัดสินใจเรื่องต้นทุนคือจุดที่เลเยอร์การจัดเส้นทางเปลี่ยนสมการพอดี และเราจะพูดตรงๆ ถึงบทบาทของเราเองในเรื่องนี้: OrcaRouter ยังไม่ได้จัดเส้นทางให้ Tencent Hy4 Preview เพราะ Tencent ยังไม่ได้เปิดโมเดลนี้ให้แพลตฟอร์มการอนุมานของบุคคลที่สาม — มันรันบน TokenHub endpoint บนคลาวด์ของ Tencent เอง และบนการติดตั้งแบบ self-hosted ของ open weights และเราไม่อ้างว่าให้บริการสิ่งที่เราไม่ได้ให้ บริบทที่เลเยอร์การจัดเส้นทางนำมาคือกรอบการตัดสินใจรอบๆ ตัวมัน หากคุณกำลังเลือกระหว่างโหนด 8-GPU กับ API วินัยการส่งผ่านราคาแบบเดียวกันที่แคตตาล็อกที่เหลือใช้อยู่จะมีผลในวันที่ Tencent เปิดสิ่งนี้: OrcaRouter ส่งผ่านราคารายการของผู้ให้บริการโดยไม่มีมาร์กอัป ดังนั้นการลดราคาของผู้ให้บริการจึงมีผลฝั่งเราในวันเดียวกันแทนที่จะถูกนำมาขายต่อและบวกมาร์กอัป และสำหรับโมเดลอายุแค่สองวันที่หลักฐานเดียวคือ benchmark ของผู้ให้บริการ การ failover อัตโนมัติคือวิธีที่ปลอดภัยในการทดสอบมัน — วางโมเดลที่พิสูจน์แล้วบนเส้นทางวิกฤตของคุณ แล้ววาง Tencent Hy4 Preview ไว้ข้างๆ กัน สลับเข้ามาในงานที่โปรไฟล์ต้นทุนของมันชนะ และ failback ทันทีเมื่อมันไม่ชนะ ทั้งหมดผ่าน API เดียวและคีย์เดียว

ข้อจำกัดที่ไม่อาจบรรจุลงในเอกสารข้อมูลจำเพาะได้
เทนเซนต์ระบุข้อจำกัดที่ทราบกันอย่างตรงไปตรงมา และข้อจำกัดเหล่านี้ควรเป็นปัจจัยในการตัดสินใจปรับใช้งานทุกครั้ง Tencent Hy4 Preview เป็นโมเดลข้อความเท่านั้น เต็มรูปแบบ — ไม่มีอินพุตภาพหรือมัลติโมดัล — ดังนั้นสิ่งใดก็ตามที่เกี่ยวข้องกับภาพหรือวิดีโอควรใช้กับโมเดลอื่น เทนเซนต์ยังชี้ให้เห็นพฤติกรรมการเริ่มต้นที่ช้าในงานที่ซับซ้อน (คิดนานก่อนผลลัพธ์แรก) และแนวโน้มที่จะตรวจสอบตัวเองมากเกินไป สิ้นเปลืองโทเคนในการตรวจสอบงานที่ทำไปแล้วซ้ำแล้วซ้ำเล่า การรวมกันเช่นนี้ผิดอย่างชัดเจนสำหรับแชทที่ไวต่อความหน่วง และพอทนได้สำหรับงานวิศวกรรมแบบแบตช์แบบออฟไลน์ ซึ่งบอกคุณได้ว่าเทนเซนต์คาดหวังให้คุณเรียกใช้มันที่ใด
ข้อกล่าวอ้างสองข้อในเอกสารเปิดตัวสมควรได้รับความสนใจเป็นพิเศษ เพราะเกี่ยวกับวิธีการสร้างโมเดล ไม่ใช่คะแนนที่ได้ เทนเซ็นต์กล่าวว่า Tencent Hy4 Preview มีส่วนร่วมในการพัฒนาตัวเอง — มันช่วยปรับวิธีการฝึกอบรม กลยุทธ์ข้อมูล กรอบการประเมิน และตัวดำเนินการระดับล่างที่สร้างมันขึ้นมา ซึ่งเป็นวงจรการพัฒนาตนเองแบบเวียนเกิดในระยะแรก — และมันปรับระบบการอนุมานของตัวเองอย่างอิสระ ทำให้ได้อัตราการประมวลผลแบบ end-to-end เพิ่มขึ้น 31.8% เมื่อเทียบกับฐานอ้างอิง ในด้านวิทยาศาสตร์ เทนเซ็นต์รายงานว่ามันพัฒนาขอบเขตล่างที่รู้จักของปัญหาบลาชเคอ–เลอเบกในเรขาคณิตนูนจาก 0.380799 เป็น 0.41104 และเพิ่มความเร็ว 2.0 เท่าในการจำลองฟอสโฟลิปิด bilayer ที่มี 32,512 อะตอม โดยลดลงเหลือ 54.9 มิลลิวินาทีต่อขั้น เช่นเดียวกับสิ่งอื่นๆ ในวันแรก นี่เป็นคำบอกเล่าของเทนเซ็นต์เอง
และสิ่งที่ขาดหายไปที่สำคัญที่สุดคือการตรวจสอบอิสระ ยังไม่มีคะแนนจากหน่วยงานภายนอกสำหรับ Tencent Hy4 Preview ที่ใดเลย — ทั้งบนลีดเดอร์บอร์ดสาธารณะ จากห้องปฏิบัติการประเมินผลบุคคลที่สาม หรือรายการใน Artificial Analysis โมเดลใหม่เกินกว่าจะมีสิ่งเหล่านี้ได้ การทดสอบแบบ blind test โดยผู้เชี่ยวชาญภายในเป็นสัญญาณที่มีประโยชน์ว่าเหล่าผู้ประเมินของ Tencent เองมองโมเดลนี้อย่างไรเมื่อเทียบกับ GLM-5.3 และ Kimi K3 แต่นั่นคือผู้ประเมินของ Tencent ที่ประเมินบนโจทย์ของ Tencent เอง ทุกอย่างที่อยู่เหนือกว่าเอกสารสเปกคือคำกล่าวอ้างที่รอการพิสูจน์
สัปดาห์นี้ใครควรดูแล Tencent Hy4 Preview
คำตอบที่ตรงไปตรงมาแบ่งออกเป็นสามกลุ่มในสัปดาห์นี้ และหนึ่งในนั้นไม่ต้องใช้ฮาร์ดแวร์เลย หากคุณแค่อยากรู้สึกว่า Tencent Hy4 Preview ทำอะไรได้ การเข้าถึง WorkBuddy ฟรีเป็นเส้นทางที่เร็วที่สุด — ไม่ต้องใช้ GPU ไม่ต้องมี API key เปิดบทสนทนา เปลี่ยนตัวเลือกโมเดลเป็น Hy4 preview แล้วส่งงานประเภท Work หรือ Coding ให้มัน หากคุณมี GPU และทำงานด้านวิศวกรรมเป็นชุด — งาน agentic ที่ใช้ขอบเขตยาว การวิเคราะห์ระดับ repository การประเมินแบบออฟไลน์ — โมเดลนี้คุ้มค่าที่จะทดสอบอย่างจริงจังในตอนนี้: น้ำหนักเปิดอยู่ หน้าต่างบริบทอยู่ในระดับ repository เส้นทาง vLLM เป็นคำสั่งเดียว และบิลด์ GGUF สัปดาห์เปิดตัวช่วยลดข้อจำกัดด้านฮาร์ดแวร์สำหรับการทดลองใช้ หากคุณกำลังรันแชตสำหรับการผลิตที่ไวต่อความหน่วง หรืออะไรก็ตามที่เป็น multimodal หรืออะไรก็ตามที่คุณไม่สามารถยอมรับโมเดลที่มีหลักฐานเพียงอย่างเดียวจากเบนช์มาร์กของผู้จำหน่ายเอง ให้รอ — Tencent ปรับปรุงโมเดลประมาณทุกสองเดือนตั้งแต่เดือนกุมภาพันธ์ และได้ประกาศแล้วว่า Hy4 รุ่นถัดไปกำลังจะมา ดังนั้นพรีวิวจึงเป็นเพียงการอัปเดตในช่วงต้นอย่างชัดเจน
สำหรับคนอื่นๆ แนวทางที่เป็นประโยชน์คือรูปแบบการกำหนดเส้นทาง: พิสูจน์มันควบคู่กับโมเดลที่คุณไว้วางใจอยู่แล้ว ด้วยต้นทุนที่คุณสามารถถอยออกมาได้ และขยายขนาดมันเฉพาะจุดที่ตัวเลขของมันใช้ได้กับงานจริงของคุณเอง นั่นคือสิ่งที่เราเตอร์มีไว้เพื่อ — ในวันที่ Tencent เปิดให้โมเดลนี้ใช้งานผ่านการอนุมานจากบุคคลที่สาม มันก็จะเข้าร่วมเป็นส่วนหนึ่งของแคตตาล็อก API เดียวที่มีโมเดลมากกว่า 200 รายการ พร้อมราคารายการแบบส่งผ่าน เช่นเดียวกับตัวอื่นๆ และเครื่องมือสำหรับ failover และการประกอบโมเดลก็จะพร้อมอยู่แล้ว จนกว่าจะถึงตอนนั้น น้ำหนักของโมเดลอยู่บน Hugging Face, API อยู่บน Tencent Cloud และทดลองใช้ฟรีอยู่ใน WorkBuddy — และข้อกล่าวอ้างที่ว่าโมเดลแบบเปิดน้ำหนักขึ้นถึงระดับสูงสุดของการเขียนโค้ดแบบเอเจนต์ก็มีตัวเลขเฉพาะติดอยู่กับมันในที่สุด ตัวเลขนั้นเป็นของ Tencent ส่วนการทดสอบเป็นของคุณ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
