
Tencent HY4 พรีวิว ปะทะ Kimi K3: การทดสอบแบบปกปิดที่ Tencent เลือกที่จะเผยแพร่
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
การเปรียบเทียบ Tencent HY4 Preview กับ Kimi K3 เป็นคู่แข่งเดียวในการเปิดตัวโมเดลนี้ที่ Tencent เลือกที่จะทดสอบด้วยตัวเอง ในการทดสอบแบบปกปิดภายในของบริษัท — วิศวกร 163 คน งานวิศวกรรม 203 งาน ให้คะแนนแบบ 4 ระดับ — HY4 Preview ได้ 2.99/4.00 ขณะที่ Kimi K3 ได้ 2.94 และ Tencent ประกาศว่าเป็นชัยชนะ รายละเอียดเล็ก ๆ ของชัยชนะครั้งนี้น่าอ่านอย่างถี่ถ้วน: HY4 Preview ชนะ Kimi K3 ใน 51.2% ของงาน เสมอ 7.9% และแพ้ 40.9% อัตราชนะสุทธิ 10 จุดนั้นมีอยู่จริง แต่มันคือความได้เปรียบที่บางเฉียบเมื่อเทียบกับโมเดลที่มีจำนวนพารามิเตอร์รวมเพียงหนึ่งในสาม และมีพารามิเตอร์ที่ใช้งานจริงน้อยกว่าครึ่งหนึ่ง — และการทดสอบทั้งหมดดำเนินการโดย Tencent
{{1}}Kimi K3 คือโมเดลเรือธง open-weight ขนาด 2.8 ล้านล้านพารามิเตอร์ของ Moonshot{{/1}} {{2}}เป็นโมเดล open ที่ใหญ่ที่สุดเท่าที่เคยเปิดตัวมา{{/2}} {{3}}และเป็นจุดอ้างอิงที่ทุกแล็บจีนใช้เทียบวัดตั้งแต่วันที่ 16 กรกฎาคม{{/3}} {{4}}Tencent เลือกให้มันเป็นคู่แข่งเพราะมันคือมาตรฐาน open-weight{{/4}} {{5}}ซึ่งทำให้ภารกิจของบทความนี้ชัดเจนเป็นพิเศษ{{/5}} {{6}}คือการอ่านการเปรียบเทียบแบบตัวต่อตัวที่ผู้ท้าชิงเลือกมา แล้วตัดสินใจว่ามันมีคุณค่าเพียงใด{{/6}}
เกณฑ์มาตรฐานที่ Tencent เลือกที่จะเผยแพร่
การทดสอบแบบปกปิดถูกให้คะแนนโดยวิศวกรของ Tencent เอง ในงานด้านวิศวกรรมของ Tencent เอง ซึ่งเป็นสิ่งแรกที่ต้องหักลบออกไป ชุดงานที่บริษัทคัดสรรมาเองคือสภาพแวดล้อมที่โมเดลใหม่จะแสดงผลได้ดีที่สุดพอดี แม้จะยอมรับข้อนั้น ผลลัพธ์ที่ออกมาก็ยังให้ข้อมูลสำคัญ: ชัยชนะ 51.2% เทียบกับความพ่ายแพ้ 40.9% เป็นส่วนต่างที่พอประมาณ และอัตราเสมอ 7.9% หมายความว่าโมเดลทั้งสองสูสีกันในงานส่วนใหญ่ ในงานที่ยาก ซึ่งเป็นจุดที่โมเดลระดับแนวหน้าแยกตัวออกจากคู่แข่ง ช่องว่างก็ยังอยู่ตรงที่มันเคยอยู่เสมอ — และพาดหัวของ Tencent ที่ว่า "นำหน้า Kimi K3 เล็กน้อย" ก็ใช้ถ้อยคำอย่างตรงไปตรงมา ซึ่งไม่ใช่สิ่งที่ทุกห้องแล็บจะตีพิมพ์
ขนาดไม่ได้กำหนดชะตากรรม
การเปรียบเทียบพารามิเตอร์ทำให้ผลลัพธ์ดูน่าประทับใจหรือน่าหวาดระแวงก็ได้ ขึ้นอยู่กับความเชื่อเดิมของคุณ Kimi K3 มีพารามิเตอร์รวม 2.8 ล้านล้านตัว ใช้งานจริง 1.04 แสนล้านตัว — มีผู้เชี่ยวชาญ 896 ตัว ใช้พร้อมกัน 16 ตัวต่อโทเคน — และถูกฝึกให้คิดหาเหตุผลตลอดเวลาแบบเปิดเผยขั้นตอนการคิด HY4 Preview มีพารามิเตอร์รวม 7.7 แสนล้าน ใช้งานจริง 4.9 หมื่นล้าน คิดเป็นหนึ่งในสามของขนาดทั้งหมด และไม่ถึงครึ่งของพลังคำนวณที่ใช้งานจริง โมเดลที่เล็กกว่าชนะโมเดลที่ใหญ่กว่าแบบฉิวเฉียดในการทดสอบแบบปกปิด ถือเป็นทิศทางที่วงการโมเดลโอเพนเวททั้งวงการมุ่งหน้าไป — Qwen3.8-Max ขนาด 2.4T กับ GLM-5.2 ขนาด 753B ผลัดกันชนะในเบนช์มาร์กด้านเอเจนต์มาหลายเดือน — ผลลัพธ์นี้จึงฟังดูเป็นไปได้ ไม่ออกจะเหลือเชื่อ อีกทั้งที่สำคัญคือ ยังไม่มีใครนอก Tencent ยืนยันผลดังกล่าว
กระดานคะแนน

• ขนาด — HY4 Preview 770B ทั้งหมด / 49B แอ็กทีฟ เทียบกับ Kimi K3 2.8T ทั้งหมด / 104B แอ็กทีฟ
บริบท — HY4 Preview >1M tokens เทียบกับ Kimi K3 1M tokens
• ราคาต่อ 1M — HY4 Preview ¥6 เข้า / ¥18 ออก (≈$0.85 / $2.50) เทียบกับ Kimi K3 $3.00 เข้า / $15.00 ออก, การตีแคช $0.30
• รูปแบบ — HY4 Preview รองรับเฉพาะข้อความ เทียบกับ Kimi K3 ที่รองรับอินพุตรูปภาพและวิดีโอแบบเนทีฟ
• การให้เหตุผล — HY4 Preview ไม่มีโหมดเผยแพร่ เทียบกับ Kimi K3 ที่ให้เหตุผลตลอดเวลาพร้อม chain-of-thought แบบสตรีม
• คะแนนอิสระ — HY4 Preview ไม่มี เทียบกับ Kimi K3 AA Intelligence Index 57, ติดอันดับสามแรกของโลกเมื่อเปิดตัว
ในแถวที่ทั้งสองฝ่ายรายงานตัวเลข โมเดลต่าง ๆ จะรวมกลุ่มกัน Tencent รายงาน HY4 Preview ที่ 37.1 บน APEX-Agents ซึ่งโดยหลักแล้วเท่ากับ 37.2 ของ Kimi K3 — เป็นผลเสมอที่ใกล้เคียงซึ่งกระดานคะแนนแบบ blind-test คาดการณ์ไว้ คะแนน Toolathlon-Verified 74.1 และ DeepSWE 64.3 ของ HY4 Preview ไม่มีค่าเทียบเท่ากับ Kimi K3 ในมือของฉัน และ FrontierSWE 81.2, ProgramBench 77.8 และ BrowseComp 91.2 ของ Kimi K3 ก็ไม่มีค่าเทียบเท่ากับ HY4 Preview เช่นกัน กระดานคะแนนแสดงอย่างตรงไปตรงมาว่าการ์ดทั้งสองแทบจะไม่ทับซ้อนกัน ซึ่งตัวมันเองเป็นคำเตือนว่าไม่ควรถือว่าแถวของผู้ขายรายใดรายหนึ่งเป็นคำอธิบายที่สมบูรณ์ของโมเดล
วิสัยทัศน์คือความแตกต่างที่แท้จริงที่ใหญ่ที่สุด
สำหรับนักพัฒนาที่ต้องเลือกระหว่างสองโมเดลนี้ในวันนี้ {{1}}ช่องว่างเชิงโครงสร้างไม่ใช่เรื่องความฉลาด — แต่เป็นเรื่องรูปแบบของอินพุต (input modality){{/1}} Kimi K3 เป็นโมเดลมัลติโมดัลโดยธรรมชาติ: รองรับอินพุตรูปภาพและวิดีโอผ่านตัวเข้ารหัส MoonViT-V2 และเป็นหนึ่งในโมเดลโอเพนซอร์สที่ดีที่สุดในงานด้านวิทัศน์คอมพิวเตอร์ โดยติดอันดับสองของโลกบน Vision Arena ส่วน Tencent HY4 Preview รองรับเฉพาะข้อความในเวอร์ชันพรีวิวนี้ {{2}}และ Tencent ระบุว่าความสามารถด้านวิทัศน์ต้องรอเวอร์ชันเต็ม{{/2}} เวิร์กโหลดใดก็ตามที่ต้องใช้ภาพหน้าจอ ความเข้าใจ UI หรือการอ้างอิงเชิงภาพ จะตกเป็นของ Kimi K3 โดยค่าเริ่มต้น {{3}}ไม่ว่าผลการทดสอบแบบ blind test จะพูดถึงงานด้านวิศวกรรมข้อความอย่างไรก็ตาม{{/3}} หากงานของคุณเป็นโค้ด เอกสาร และเอาต์พุตเทอร์มินัลล้วนๆ ช่องว่างนี้ก็ไม่สำคัญ {{4}}แต่ทันทีที่งานเกี่ยวข้องกับการมองเห็นบางสิ่ง มันจะตัดสินผลแพ้ชนะทันที{{/4}}
คำถามเรื่องค่าใช้จ่าย
ต่อโทเคน HY4 Preview มีราคาถูกกว่าอย่างมาก: ประมาณ $0.85/$2.50 เทียบกับ $3.00/$15.00 ของ Kimi K3 โดยการเข้าถึงแคช (cache hits) อยู่ที่ ¥0.3 (ประมาณสี่เซนต์) เทียบกับ $0.30 แต่ทั้งสองโมเดลมีพฤติกรรมด้านโทเคนที่ตรงข้ามกัน ซึ่งทำให้ช่องว่างแคบลง Kimi K3 ให้เหตุผลแบบเปิดตลอดเวลาและสตรีม chain-of-thought ซึ่งทำให้จำนวนโทเคนเอาต์พุตเพิ่มขึ้นในทุกคำขอ; ผู้รีวิวได้สังเกตว่าโมเดลนี้ช้ากว่า — ประมาณ 62 โทเคนต่อวินาที — และใช้โทเคนจำนวนมากสำหรับ agent loops HY4 Preview ตามบันทึกการเผยแพร่ของ Tencent เอง "มีแนวโน้มที่จะใช้ความคิดยาวเกินไปและตรวจสอบตัวเองมากเกินไป" ในงานที่ซับซ้อน ทั้งสองโมเดลใช้โทเคนเอาต์พุตเพิ่มขึ้น; HY4 Preview เพียงแต่คิดค่าบริการน้อยกว่า การเปรียบเทียบที่ยุติธรรมคือต้นทุนต่องานที่เสร็จสมบูรณ์ และยังไม่มีใครนอก Tencent วัดผลของ HY4 Preview ได้
คำตัดสิน
Tencent HY4 Preview คือคู่แข่งที่ถูกกว่า เล็กกว่า และยังไม่ผ่านการพิสูจน์ โดยอ้างว่ามีความได้เปรียบเล็กน้อยในการทดสอบแบบปกปิด (blind test) เหนือโมเดลมาตรฐานแบบเปิดน้ำหนัก (open-weight) ส่วน Kimi K3 คือผู้ครองตลาด (incumbent) ที่ใหญ่กว่า ผ่านการตรวจสอบแล้ว และรองรับภาพ (vision-capable) โดยมีต้นทุนต่อโทเคนสูงกว่าสี่ถึงห้าเท่า และมีดัชนีความฉลาดอิสระ (Intelligence Index) อยู่ที่ 57 การ์ด benchmark ของทั้งสองโมเดลไม่ได้เป็นอิสระอย่างสมบูรณ์ — คะแนนหลักของ Kimi K3 ก็รายงานโดย Moonshot เช่นกัน ถึงแม้ค่า Index 57 จะไม่ได้มาจากการรายงานของ Moonshot ก็ตาม หากเวิร์กโหลดของคุณเป็นแบบมัลติโมดัล Kimi K3 คือตัวเลือกเดียวในการเปรียบเทียบครั้งนี้ หากเป็นงานด้านข้อความและวิศวกรรม HY4 Preview คือตัวเลือกที่คุ้มค่า ด้วยการเปรียบเทียบตัวต่อตัวที่เป็นจริง แม้จะดำเนินการโดยผู้จำหน่ายเองก็ตาม และเส้นทางประหยัดคือการกำหนดเส้นทาง (route) Kimi K3 ผ่านคีย์โปรดักชัน — ซึ่งใช้งานจริงบน OrcaRouter ในราคารายการของ Moonshot ที่ $3.00/$15.00 โดยส่งผ่านโดยไม่มีมาร์กอัป — ขณะที่คุณรัน HY4 Preview ผ่าน API ของ Tencent สำหรับเวิร์กโหลดเงา (shadow workloads) เมื่อ HY4 Preview เข้าสู่เราเตอร์ คีย์เดียวกันและกฎ failover ชุดเดียวกันจะรองรับทั้งสองโมเดล และอัตรา ¥6/¥18 ของ Tencent จะถูกส่งผ่านโดยไม่มีการเปลี่ยนแปลง


ดูอะไรดี
• การรันซ้ำอย่างอิสระของงานทดสอบแบบปกปิด อัตราการชนะ 51.2% คือข้อกล่าวอ้างที่ทดสอบได้มากที่สุดเพียงหนึ่งเดียวในการเปิดตัวครั้งนี้ และเครื่องมือทดสอบจากบุคคลที่สามจะทำให้เรื่องนี้ยุติลงได้ภายในหนึ่งสัปดาห์
• ไม่ว่า HY4 Preview จะมาพร้อม vision ก่อนการเปิดตัว Hy4 เวอร์ชันเต็มหรือไม่ นั่นคือสิ่งที่จะเปลี่ยนจากการชิงชัยด้านคุณค่าบนกระดาษ ไปสู่การต่อสู้ระดับเรือธงอย่างแท้จริง
• ต้นทุนต่องานที่สำเร็จบนแฮร์เนสแบบเอเจนต์มาตรฐาน ทั้งสองโมเดลใช้โทเคนจำนวนมาก ใครที่ถูกกว่าต่องานที่เสร็จสมบูรณ์จะเป็นฝ่ายชนะในเชิงการใช้งานจริง
• การตอบสนองของ Kimi K3 ต่อแรงกดดันด้านราคา หาก Moonshot ลดอัตราเอาต์พุตที่ 15 ดอลลาร์ กรอบ "ผู้ท้าชิงราคาถูก vs มาตรฐานราคาแพง" จะกลับด้าน
