การ์ดไตเติลแบบฮีโร่สำหรับการเปรียบเทียบ 'Tencent HY4 Preview vs Kimi K3' การ์ดตรงกลางแบบสกอร์บอร์ดแสดงข้อความ 'การทดสอบแบบปกปิดภายใน ระดับ 4 คะแนน' โดยด้านซ้ายคือ 'Tencent HY4 Preview 2.99' และด้านขวาคือ 'Kimi K3 2.94' การ์ดด้านซ้าย 'Tencent HY4 Preview' ระบุ '770B / 49B แอกทีฟ, โอเพนเวต', '¥6 / ¥18 ต่อ 1M', 'พรีวิวข้อความเท่านั้น' การ์ดด้านขวา 'Kimi K3' ระบุ '2.8T / 104B แอกทีฟ, โอเพนเวต', '$3.00 / $15.00 ต่อ 1M', 'วิชันแบบเนทีฟ, AA Index 57' ส่วนท้ายอ่านว่า 'การทดสอบแบบปกปิดดำเนินการโดย Tencent กับวิศวกร 163 คนจาก 203 งาน; ผลลัพธ์รายงานโดยผู้ให้บริการ' โลโก้ OrcaRouter ถูกประกอบอยู่ที่มุมขวาล่าง
Guides & Insights

Tencent HY4 พรีวิว ปะทะ Kimi K3: การทดสอบแบบปกปิดที่ Tencent เลือกที่จะเผยแพร่

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การเปรียบเทียบ Tencent HY4 Preview กับ Kimi K3 เป็นคู่แข่งเดียวในการเปิดตัวโมเดลนี้ที่ Tencent เลือกที่จะทดสอบด้วยตัวเอง ในการทดสอบแบบปกปิดภายในของบริษัท — วิศวกร 163 คน งานวิศวกรรม 203 งาน ให้คะแนนแบบ 4 ระดับ — HY4 Preview ได้ 2.99/4.00 ขณะที่ Kimi K3 ได้ 2.94 และ Tencent ประกาศว่าเป็นชัยชนะ รายละเอียดเล็ก ๆ ของชัยชนะครั้งนี้น่าอ่านอย่างถี่ถ้วน: HY4 Preview ชนะ Kimi K3 ใน 51.2% ของงาน เสมอ 7.9% และแพ้ 40.9% อัตราชนะสุทธิ 10 จุดนั้นมีอยู่จริง แต่มันคือความได้เปรียบที่บางเฉียบเมื่อเทียบกับโมเดลที่มีจำนวนพารามิเตอร์รวมเพียงหนึ่งในสาม และมีพารามิเตอร์ที่ใช้งานจริงน้อยกว่าครึ่งหนึ่ง — และการทดสอบทั้งหมดดำเนินการโดย Tencent

{{1}}Kimi K3 คือโมเดลเรือธง open-weight ขนาด 2.8 ล้านล้านพารามิเตอร์ของ Moonshot{{/1}} {{2}}เป็นโมเดล open ที่ใหญ่ที่สุดเท่าที่เคยเปิดตัวมา{{/2}} {{3}}และเป็นจุดอ้างอิงที่ทุกแล็บจีนใช้เทียบวัดตั้งแต่วันที่ 16 กรกฎาคม{{/3}} {{4}}Tencent เลือกให้มันเป็นคู่แข่งเพราะมันคือมาตรฐาน open-weight{{/4}} {{5}}ซึ่งทำให้ภารกิจของบทความนี้ชัดเจนเป็นพิเศษ{{/5}} {{6}}คือการอ่านการเปรียบเทียบแบบตัวต่อตัวที่ผู้ท้าชิงเลือกมา แล้วตัดสินใจว่ามันมีคุณค่าเพียงใด{{/6}}

เกณฑ์มาตรฐานที่ Tencent เลือกที่จะเผยแพร่

การทดสอบแบบปกปิดถูกให้คะแนนโดยวิศวกรของ Tencent เอง ในงานด้านวิศวกรรมของ Tencent เอง ซึ่งเป็นสิ่งแรกที่ต้องหักลบออกไป ชุดงานที่บริษัทคัดสรรมาเองคือสภาพแวดล้อมที่โมเดลใหม่จะแสดงผลได้ดีที่สุดพอดี แม้จะยอมรับข้อนั้น ผลลัพธ์ที่ออกมาก็ยังให้ข้อมูลสำคัญ: ชัยชนะ 51.2% เทียบกับความพ่ายแพ้ 40.9% เป็นส่วนต่างที่พอประมาณ และอัตราเสมอ 7.9% หมายความว่าโมเดลทั้งสองสูสีกันในงานส่วนใหญ่ ในงานที่ยาก ซึ่งเป็นจุดที่โมเดลระดับแนวหน้าแยกตัวออกจากคู่แข่ง ช่องว่างก็ยังอยู่ตรงที่มันเคยอยู่เสมอ — และพาดหัวของ Tencent ที่ว่า "นำหน้า Kimi K3 เล็กน้อย" ก็ใช้ถ้อยคำอย่างตรงไปตรงมา ซึ่งไม่ใช่สิ่งที่ทุกห้องแล็บจะตีพิมพ์

ขนาดไม่ได้กำหนดชะตากรรม

การเปรียบเทียบพารามิเตอร์ทำให้ผลลัพธ์ดูน่าประทับใจหรือน่าหวาดระแวงก็ได้ ขึ้นอยู่กับความเชื่อเดิมของคุณ Kimi K3 มีพารามิเตอร์รวม 2.8 ล้านล้านตัว ใช้งานจริง 1.04 แสนล้านตัว — มีผู้เชี่ยวชาญ 896 ตัว ใช้พร้อมกัน 16 ตัวต่อโทเคน — และถูกฝึกให้คิดหาเหตุผลตลอดเวลาแบบเปิดเผยขั้นตอนการคิด HY4 Preview มีพารามิเตอร์รวม 7.7 แสนล้าน ใช้งานจริง 4.9 หมื่นล้าน คิดเป็นหนึ่งในสามของขนาดทั้งหมด และไม่ถึงครึ่งของพลังคำนวณที่ใช้งานจริง โมเดลที่เล็กกว่าชนะโมเดลที่ใหญ่กว่าแบบฉิวเฉียดในการทดสอบแบบปกปิด ถือเป็นทิศทางที่วงการโมเดลโอเพนเวททั้งวงการมุ่งหน้าไป — Qwen3.8-Max ขนาด 2.4T กับ GLM-5.2 ขนาด 753B ผลัดกันชนะในเบนช์มาร์กด้านเอเจนต์มาหลายเดือน — ผลลัพธ์นี้จึงฟังดูเป็นไปได้ ไม่ออกจะเหลือเชื่อ อีกทั้งที่สำคัญคือ ยังไม่มีใครนอก Tencent ยืนยันผลดังกล่าว

กระดานคะแนน

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• ขนาด — HY4 Preview 770B ทั้งหมด / 49B แอ็กทีฟ เทียบกับ Kimi K3 2.8T ทั้งหมด / 104B แอ็กทีฟ

บริบท — HY4 Preview >1M tokens เทียบกับ Kimi K3 1M tokens

• ราคาต่อ 1M — HY4 Preview ¥6 เข้า / ¥18 ออก (≈$0.85 / $2.50) เทียบกับ Kimi K3 $3.00 เข้า / $15.00 ออก, การตีแคช $0.30

• รูปแบบ — HY4 Preview รองรับเฉพาะข้อความ เทียบกับ Kimi K3 ที่รองรับอินพุตรูปภาพและวิดีโอแบบเนทีฟ

• การให้เหตุผล — HY4 Preview ไม่มีโหมดเผยแพร่ เทียบกับ Kimi K3 ที่ให้เหตุผลตลอดเวลาพร้อม chain-of-thought แบบสตรีม

• คะแนนอิสระ — HY4 Preview ไม่มี เทียบกับ Kimi K3 AA Intelligence Index 57, ติดอันดับสามแรกของโลกเมื่อเปิดตัว

ในแถวที่ทั้งสองฝ่ายรายงานตัวเลข โมเดลต่าง ๆ จะรวมกลุ่มกัน Tencent รายงาน HY4 Preview ที่ 37.1 บน APEX-Agents ซึ่งโดยหลักแล้วเท่ากับ 37.2 ของ Kimi K3 — เป็นผลเสมอที่ใกล้เคียงซึ่งกระดานคะแนนแบบ blind-test คาดการณ์ไว้ คะแนน Toolathlon-Verified 74.1 และ DeepSWE 64.3 ของ HY4 Preview ไม่มีค่าเทียบเท่ากับ Kimi K3 ในมือของฉัน และ FrontierSWE 81.2, ProgramBench 77.8 และ BrowseComp 91.2 ของ Kimi K3 ก็ไม่มีค่าเทียบเท่ากับ HY4 Preview เช่นกัน กระดานคะแนนแสดงอย่างตรงไปตรงมาว่าการ์ดทั้งสองแทบจะไม่ทับซ้อนกัน ซึ่งตัวมันเองเป็นคำเตือนว่าไม่ควรถือว่าแถวของผู้ขายรายใดรายหนึ่งเป็นคำอธิบายที่สมบูรณ์ของโมเดล

วิสัยทัศน์คือความแตกต่างที่แท้จริงที่ใหญ่ที่สุด

สำหรับนักพัฒนาที่ต้องเลือกระหว่างสองโมเดลนี้ในวันนี้ {{1}}ช่องว่างเชิงโครงสร้างไม่ใช่เรื่องความฉลาด — แต่เป็นเรื่องรูปแบบของอินพุต (input modality){{/1}} Kimi K3 เป็นโมเดลมัลติโมดัลโดยธรรมชาติ: รองรับอินพุตรูปภาพและวิดีโอผ่านตัวเข้ารหัส MoonViT-V2 และเป็นหนึ่งในโมเดลโอเพนซอร์สที่ดีที่สุดในงานด้านวิทัศน์คอมพิวเตอร์ โดยติดอันดับสองของโลกบน Vision Arena ส่วน Tencent HY4 Preview รองรับเฉพาะข้อความในเวอร์ชันพรีวิวนี้ {{2}}และ Tencent ระบุว่าความสามารถด้านวิทัศน์ต้องรอเวอร์ชันเต็ม{{/2}} เวิร์กโหลดใดก็ตามที่ต้องใช้ภาพหน้าจอ ความเข้าใจ UI หรือการอ้างอิงเชิงภาพ จะตกเป็นของ Kimi K3 โดยค่าเริ่มต้น {{3}}ไม่ว่าผลการทดสอบแบบ blind test จะพูดถึงงานด้านวิศวกรรมข้อความอย่างไรก็ตาม{{/3}} หากงานของคุณเป็นโค้ด เอกสาร และเอาต์พุตเทอร์มินัลล้วนๆ ช่องว่างนี้ก็ไม่สำคัญ {{4}}แต่ทันทีที่งานเกี่ยวข้องกับการมองเห็นบางสิ่ง มันจะตัดสินผลแพ้ชนะทันที{{/4}}

คำถามเรื่องค่าใช้จ่าย

ต่อโทเคน HY4 Preview มีราคาถูกกว่าอย่างมาก: ประมาณ $0.85/$2.50 เทียบกับ $3.00/$15.00 ของ Kimi K3 โดยการเข้าถึงแคช (cache hits) อยู่ที่ ¥0.3 (ประมาณสี่เซนต์) เทียบกับ $0.30 แต่ทั้งสองโมเดลมีพฤติกรรมด้านโทเคนที่ตรงข้ามกัน ซึ่งทำให้ช่องว่างแคบลง Kimi K3 ให้เหตุผลแบบเปิดตลอดเวลาและสตรีม chain-of-thought ซึ่งทำให้จำนวนโทเคนเอาต์พุตเพิ่มขึ้นในทุกคำขอ; ผู้รีวิวได้สังเกตว่าโมเดลนี้ช้ากว่า — ประมาณ 62 โทเคนต่อวินาที — และใช้โทเคนจำนวนมากสำหรับ agent loops HY4 Preview ตามบันทึกการเผยแพร่ของ Tencent เอง "มีแนวโน้มที่จะใช้ความคิดยาวเกินไปและตรวจสอบตัวเองมากเกินไป" ในงานที่ซับซ้อน ทั้งสองโมเดลใช้โทเคนเอาต์พุตเพิ่มขึ้น; HY4 Preview เพียงแต่คิดค่าบริการน้อยกว่า การเปรียบเทียบที่ยุติธรรมคือต้นทุนต่องานที่เสร็จสมบูรณ์ และยังไม่มีใครนอก Tencent วัดผลของ HY4 Preview ได้

คำตัดสิน

Tencent HY4 Preview คือคู่แข่งที่ถูกกว่า เล็กกว่า และยังไม่ผ่านการพิสูจน์ โดยอ้างว่ามีความได้เปรียบเล็กน้อยในการทดสอบแบบปกปิด (blind test) เหนือโมเดลมาตรฐานแบบเปิดน้ำหนัก (open-weight) ส่วน Kimi K3 คือผู้ครองตลาด (incumbent) ที่ใหญ่กว่า ผ่านการตรวจสอบแล้ว และรองรับภาพ (vision-capable) โดยมีต้นทุนต่อโทเคนสูงกว่าสี่ถึงห้าเท่า และมีดัชนีความฉลาดอิสระ (Intelligence Index) อยู่ที่ 57 การ์ด benchmark ของทั้งสองโมเดลไม่ได้เป็นอิสระอย่างสมบูรณ์ — คะแนนหลักของ Kimi K3 ก็รายงานโดย Moonshot เช่นกัน ถึงแม้ค่า Index 57 จะไม่ได้มาจากการรายงานของ Moonshot ก็ตาม หากเวิร์กโหลดของคุณเป็นแบบมัลติโมดัล Kimi K3 คือตัวเลือกเดียวในการเปรียบเทียบครั้งนี้ หากเป็นงานด้านข้อความและวิศวกรรม HY4 Preview คือตัวเลือกที่คุ้มค่า ด้วยการเปรียบเทียบตัวต่อตัวที่เป็นจริง แม้จะดำเนินการโดยผู้จำหน่ายเองก็ตาม และเส้นทางประหยัดคือการกำหนดเส้นทาง (route) Kimi K3 ผ่านคีย์โปรดักชัน — ซึ่งใช้งานจริงบน OrcaRouter ในราคารายการของ Moonshot ที่ $3.00/$15.00 โดยส่งผ่านโดยไม่มีมาร์กอัป — ขณะที่คุณรัน HY4 Preview ผ่าน API ของ Tencent สำหรับเวิร์กโหลดเงา (shadow workloads) เมื่อ HY4 Preview เข้าสู่เราเตอร์ คีย์เดียวกันและกฎ failover ชุดเดียวกันจะรองรับทั้งสองโมเดล และอัตรา ¥6/¥18 ของ Tencent จะถูกส่งผ่านโดยไม่มีการเปลี่ยนแปลง

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

ดูอะไรดี

• การรันซ้ำอย่างอิสระของงานทดสอบแบบปกปิด อัตราการชนะ 51.2% คือข้อกล่าวอ้างที่ทดสอบได้มากที่สุดเพียงหนึ่งเดียวในการเปิดตัวครั้งนี้ และเครื่องมือทดสอบจากบุคคลที่สามจะทำให้เรื่องนี้ยุติลงได้ภายในหนึ่งสัปดาห์

• ไม่ว่า HY4 Preview จะมาพร้อม vision ก่อนการเปิดตัว Hy4 เวอร์ชันเต็มหรือไม่ นั่นคือสิ่งที่จะเปลี่ยนจากการชิงชัยด้านคุณค่าบนกระดาษ ไปสู่การต่อสู้ระดับเรือธงอย่างแท้จริง

• ต้นทุนต่องานที่สำเร็จบนแฮร์เนสแบบเอเจนต์มาตรฐาน ทั้งสองโมเดลใช้โทเคนจำนวนมาก ใครที่ถูกกว่าต่องานที่เสร็จสมบูรณ์จะเป็นฝ่ายชนะในเชิงการใช้งานจริง

• การตอบสนองของ Kimi K3 ต่อแรงกดดันด้านราคา หาก Moonshot ลดอัตราเอาต์พุตที่ 15 ดอลลาร์ กรอบ "ผู้ท้าชิงราคาถูก vs มาตรฐานราคาแพง" จะกลับด้าน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube