
Tencent HY4 Preview ปะทะ GPT-5.6 Sol: ข้อกล่าวอ้างด้านการเรียกใช้เครื่องมือที่ทำให้โมเดลโอเพนเวตส์ต้องแข่งกับโมเดลระดับแนวหน้า
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
Tencent HY4 Preview เป็นโมเดล open-weight ตัวแรกในรอบหลายเดือนที่การ์ดเปิดตัวระบุชัดเจนว่าชนะ GPT-5.6 Sol ตัวเลขที่กล่าวถึงคือ Toolathlon-Verified ซึ่งเป็น benchmark สำหรับการเรียกใช้เครื่องมือแบบ agentic โดย Tencent รายงานว่า HY4 Preview ได้ 74.1 — นำหน้า Qwen3.8-Max และตามการเปรียบเทียบของ Tencent เอง ก็สูงกว่า GPT-5.6 Sol ในทุกมิติอื่น ๆ โมเดลทั้งสองไม่ได้เป็นคู่แข่งในระดับเดียวกันจริง ๆ: GPT-5.6 Sol คือโมเดล frontier แบบปิด ระดับเรือธง และผ่านการวัดผลโดยอิสระของ OpenAI ส่วน Tencent HY4 Preview คือพรีวิว open-weight ที่มีพารามิเตอร์ 770,000 ล้านตัว เปิดตัวเมื่อเช้านี้พร้อมสกอร์การ์ดที่รายงานโดยผู้ผลิต และไม่มีการตรวจสอบจากบุคคลที่สาม
ดังนั้น คำถามที่น่าสนใจไม่ใช่ว่า "โมเดลไหนฉลาดกว่า" — แต่เป็นว่าผู้ท้าชิงแบบ open-weight ที่มีราคาอินพุตประมาณหนึ่งในหกของ Sol จะสามารถอ้างสิทธิ์ในส่วนหนึ่งของระดับแนวหน้าได้อย่างน่าเชื่อถือหรือไม่ และทีมควรทำอย่างไรกับคำกล่าวอ้างที่ยังไม่สามารถยืนยันได้ในตอนนี้
ข้อกล่าวอ้างที่ทำให้การแข่งขันครั้งนี้เป็นการแข่งขันที่แท้จริง
Toolathlon-Verified วัดความน่าเชื่อถือของโมเดลในการขับเคลื่อนเครื่องมือตลอดงานเชิงเอเจนต์เต็มรูปแบบ — ตั้งแต่การอ่านผลลัพธ์ การตัดสินใจเลือกการเรียกครั้งถัดไป ไปจนถึงการกู้คืนจากข้อผิดพลาด — มากกว่าที่จะวัดว่าเขียนฟังก์ชันเดี่ยวได้ดีเพียงใด เรื่องนี้สำคัญเพราะค่าใช้จ่าย API จริงส่วนใหญ่บนโมเดลระดับแนวหน้าไปกับลูปของเอเจนต์ ไม่ใช่การตอบสนองแบบครั้งเดียวจบ คะแนน 74.1 ของ Tencent บนเกณฑ์ชี้วัดดังกล่าวคือข้ออ้างเฉพาะที่ทำให้ HY4 Preview ถูกนำเข้าสู่บทสนทนาของ GPT-5.6 Sol และมันควรค่าแก่การใคร่ครวญสักครู่ คือมันเป็นตัวเลขประเภทที่ว่า หากยืนยันได้ภายใต้การทำซ้ำอย่างอิสระ จะทำให้การพูดคุยเรื่องต้นทุนระหว่างโมเดลน้ำหนักเปิดกับโมเดลระดับแนวหน้าแบบปิดกลายเป็นเรื่องจริง หากยืนยันไม่ได้ มันก็จะกลายเป็นสกอร์การ์ดของเวนเดอร์อีกรายที่สลายหายไปเมื่อถูกประเมินด้วยเครื่องมือของบุคคลที่สาม
สองวิธีในการซื้อความฉลาด

• พารามิเตอร์ — HY4 Preview ทั้งหมด 770B / ใช้งานจริง 49B, น้ำหนักแบบเปิด เทียบกับ GPT-5.6 Sol ที่ไม่เปิดเผยจำนวนพารามิเตอร์, API แบบปิด
• บริบท — HY4 Preview มากกว่า 1M tokens เทียบกับ GPT-5.6 Sol 1.05M tokens, เอาต์พุตสูงสุด 128K
• ราคาต่อ 1M — HY4 Preview ¥6 ขาเข้า / ¥18 ขาออก (≈$0.85 / $2.50) เทียบกับ GPT-5.6 Sol $4.00 / $20.00 ในระดับฐาน เพิ่มขึ้นเป็น $8.00 / $30.00 สำหรับคำขอที่มีบริบทขนาดใหญ่ การอ่านแคช $0.40
• รูปแบบอินพุต — HY4 Preview ข้อความเท่านั้นในพรีวิวนี้ เทียบกับ GPT-5.6 Sol ที่รับอินพุตทั้งข้อความและรูปภาพ
• โหมดการให้เหตุผล — HY4 Preview ไม่มีคุณสมบัติเทียบเท่าที่เปิดเผย ในขณะที่ GPT-5.6 Sol มี Ultra mode (รองรับ subagents แบบขนานสูงสุด 16 ตัว) และ Max reasoning effort
• การตรวจสอบอย่างอิสระ — HY4 Preview ยังไม่มีผล ขณะที่ GPT-5.6 Sol ปรากฏบนกระดานผู้นำหลักทุกแห่ง โดยมีอันดับบริบท 1.05M อยู่ในระดับสูงสุดของการทดสอบรวมบริบทยาว
คอลัมน์ราคาคือจุดที่การเปรียบเทียบทั้งหมดเกิดขึ้น ในระดับพื้นฐาน GPT-5.6 Sol มีราคา 4.00 ดอลลาร์ต่อล้านโทเคนอินพุต และ 20.00 ดอลลาร์ต่อล้านโทเคนเอาต์พุต ส่วน Tencent HY4 Preview มีราคาประมาณ 0.85 ดอลลาร์และ 2.50 ดอลลาร์ตามอัตราแลกเปลี่ยนปัจจุบัน สำหรับงานที่ต้องใช้โทเคนเอาต์พุตจำนวนมาก อย่างการเขียนโค้ดแบบเอเจนต์ โมเดลแบบเปิดน้ำหนักมีราคาอยู่ที่ประมาณหนึ่งในแปดของโมเดลแบบปิด และช่องว่างนั้นยังคงอยู่แม้จะมีข้อแม้ว่าตัวเลขของ Sol ผ่านการตรวจสอบที่มากกว่ามากก็ตาม
ที่ GPT-5.6 Sol ยังคงได้เปรียบ
การตรวจสอบคือจุดได้เปรียบประการแรก GPT-5.6 Sol เปิดให้ใช้งานทั่วไปตั้งแต่วันที่ 9 กรกฎาคม และถูกวัดผลอย่างเป็นอิสระตั้งแต่นั้นมา: 88.8 ใน Terminal-Bench 2.1 ที่ระดับการใช้เหตุผลพื้นฐาน, 91.9 ในโหมด Ultra, 53.6 ใน Agents' Last Exam (ซึ่งเป็นสถิติสูงสุดในตอนที่เปิดตัว), 94.6 ใน GPQA Diamond และ 64.6 ใน SWE-bench Pro OpenAI ยังรายงานการปรับปรุงประสิทธิภาพการใช้โทเค็น 54% ในงานเขียนโปรแกรมแบบเอเจนต์ เมื่อเทียบกับรุ่นเรือธงก่อนหน้าของตนเอง ตัวเลขเหล่านี้เป็นตัวเลขที่คุณสามารถค้นหาได้จากแหล่งอื่นนอกเหนือจากเอกสารของ OpenAI เอง ซึ่งเป็นคุณสมบัติที่ Tencent HY4 Preview ยังขาดในปัจจุบัน
ความสามารถคือข้อได้เปรียบประการที่สอง และเป็นเชิงโครงสร้างมากกว่าเชิงส่วนเพิ่ม GPT-5.6 Sol รองรับการรับข้อมูลรูปภาพ ส่วน HY4 Preview ในพรีวิวนี้รองรับเฉพาะข้อความ โดย Tencent ยอมรับว่าความสามารถด้านภาพจะต้องรอจนกว่าจะมีการเปิดตัวเต็มรูปแบบ GPT-5.6 Sol มาพร้อมโหมด Ultra ซึ่งเป็นการกำหนดค่าแบบมัลติเอเจนต์ที่ประสานงานซับเอเจนต์แบบขนานด้วยต้นทุนโทเคนสามถึงสี่เท่า มีประโยชน์อย่างยิ่งสำหรับงานวิศวกรรมระยะยาวซึ่งเป็นจุดที่ทั้งสองโมเดลจะแข่งขันกันจริง และเส้นทางการใช้คอมพิวเตอร์และการเรียกใช้เครื่องมือแบบโปรแกรมเมติกของ Sol ได้รับการจัดทำเอกสาร ทดสอบในระดับการใช้งานจริง และทดสอบโหลดแล้ว คำกล่าวอ้าง Toolathlon-Verified ของ Tencent หากทำซ้ำได้จริง จะช่วยลดช่องว่างด้านการใช้เครื่องมือลง แต่ไม่ได้ปิดช่องว่างด้านมัลติโมดัลหรือมัลติเอเจนต์ ซึ่ง HY4 Preview ไม่ได้พยายามจัดการ
จุดที่ HY4 Preview น่าสนใจอย่างแท้จริง
{{1}}วางเรื่องการแสดง benchmark ไว้ก่อน แล้วสิ่งที่เหลือจริงๆ มีสามอย่าง{{/1}} {{2}}ประการแรก ราคา: ที่ ¥6/¥18 — ประมาณ $0.85/$2.50 — Tencent ตัดราคาโมเดลระดับแนวหน้าของตะวันตกทุกรุ่นในเรื่องโทเคนเอาต์พุต 4 ถึง 8 เท่า และตัดราคาโมเดลโอเพนเวตจีนด้วยกันเองในเรื่องอินพุต{{/2}} {{3}}ประการที่สอง โอเพนเวต: MoE แอกทีฟ 49B นำไปใช้งานบนโหนดเดียวได้ ในแบบที่สถาปัตยกรรมที่ไม่เปิดเผยของ Sol ไม่มีทางทำได้ และน้ำหนักโมเดลเหล่านี้ก็อยู่บน HuggingFace, ModelScope และ GitHub แล้ว{{/3}} {{4}}ประการที่สาม บริบทและทิศทางวิศวกรรม: DeepSWE 64.3 และหน้าต่างบริบท 1M ขึ้นไปมุ่งเป้าไปที่เวิร์กโหลดแบบเอเจนต์ระยะยาวชุดเดียวกับที่ Ultra mode ของ Sol กำหนดเป้าหมาย ด้วยต้นทุนเพียงเศษเสี้ยว{{/4}}
คำเตือนที่ตรงไปตรงมาก็คือ ไม่มีสิ่งใดในทั้งหมดนี้ที่ผ่านการทดสอบกับเกณฑ์มาตรฐานอิสระ เรื่องราวการปรับตัวเองให้เหมาะสมที่สุดที่ Tencent เล่า — การเพิ่มปริมาณงานแบบ end-to-end 31.8% จากการที่โมเดลวนซ้ำบนสแตกการอนุมานของตัวเอง — เป็นการวัดผลภายใน ชัยชนะในการทดสอบแบบปกปิดเหนือ GLM 5.3 และ Kimi K3 ก็เป็นการดำเนินการภายใน ทุกสิ่งที่น่าสนใจเกี่ยวกับ HY4 Preview ในวันนี้ ยังเป็นเพียงการกล่าวอ้าง
การตัดสินใจ
หากคุณกำลังสร้างระบบที่ใช้งานจริงในปัจจุบัน GPT-5.6 Sol คือตัวเลือกที่สมเหตุสมผล และสามารถเข้าถึงได้ผ่าน OrcaRouter ในราคารายการแบบแบ่งระดับชั้นของ OpenAI เอง — $4.00/$20.00 ในระดับพื้นฐาน, $8.00/$30.00 ในระดับที่สูงขึ้นไป โดยส่งผ่านโดยไม่มีมาร์กอัปเพิ่มเติม ดังนั้นการเปลี่ยนแปลงราคาของผู้ให้บริการรายใดจึงมีผลกับฝั่งเราทันทีในวันเดียวกัน หากเวิร์กโฟลว์ของคุณเป็นแบบเอเจนต์ (agentic) และใช้เครื่องมือจำนวนมาก โครงสร้างแบบแบ่งระดับชั้นหมายความว่าคุณควรตรวจสอบขนาดอินพุตจริงของคุณเทียบกับเกณฑ์ $272K โทเคน แทนที่จะสมมติว่าเป็นอัตราคงที่
หากคุณยินดีจะทดสอบแบบเงียบ ๆ HY4 Preview ก็มีราคาถูกพอที่จะคุ้มค่ากับการทดสอบจริง: กำหนดเส้นทางปริมาณงานเรียกใช้เครื่องมือของคุณผ่าน Sol ในวันนี้ รันพรอมต์ชุดเดียวกันกับ HY4 Preview ผ่าน API ของ Tencent เอง แล้วเปรียบเทียบกับงานสไตล์ Toolathlon ของคุณเอง และถ้าคะแนนจากการทดสอบอิสระออกมาตรงกับที่ Tencent กล่าวไว้ เส้นทางสวิตช์ก็สั้น — โมเดลน้ำหนักเปิดจะถูกวางลงในเราเตอร์ และกฎเฟลโอเวอร์ของคุณจะสลับเอนด์พอยต์ โดยอัตราค่าใช้จ่าย ¥6/¥18 ของผู้จำหน่ายจะถูกส่งผ่านโดยไม่เปลี่ยนแปลง นี่คือโครงสร้างที่ตรงไปตรงมาของการแข่งขันครั้งนี้: โมเดลระดับแนวหน้าที่ได้รับการตรวจสอบแล้วซึ่งคุณสามารถสร้างต่อได้ในวันนี้ กำลังเผชิญหน้ากับคู่แข่งแบบเปิดที่ยังไม่ได้รับการตรวจสอบซึ่งมีราคาถูกพอที่จะทดสอบ และถูกวางตำแหน่งให้เปลี่ยนวาทกรรมการตั้งราคาให้พูดถึงทั้งคลาสโมเดลน้ำหนักเปิด


ดูอะไรดี
• การทำซ้ำอิสระครั้งแรกของ Toolathlon-Verified หากชุดทดสอบจากบุคคลที่สามยืนยัน HY4 Preview ในช่วง 70 ข้อโต้แย้งที่ว่า "open weights ไม่สามารถทำงาน tool use แบบ agentic ได้" ก็พังทลายลง
• ไม่ว่า Tencent จะปล่อยระบบ vision ก่อนการเปิดตัว Hy4 เวอร์ชันเต็มหรือไม่ การรองรับเฉพาะข้อความทำให้ HY4 Preview รองรับเพียงชุดย่อยที่เคร่งครัดของปริมาณงานที่ GPT-5.6 Sol จัดการได้
• ค่าใช้จ่ายโทเค็นที่เกิดขึ้นจริงจากแนวโน้มการคิดแบบใช้เวลานานของ HY4 Preview ที่อัตรา ¥18 ต่อล้านเอาต์พุต การตรวจสอบตัวเองที่ verbose จะกินความได้เปรียบด้านราคาเร็วกว่าบนโมเดลราคา $20
• ไม่ว่าแผนราคาแบบหลายระดับของ Sol จะถูกปรับลดอีกครั้งก่อนที่ Hy4 จะเปิดตัวอย่างเต็มรูปแบบหรือไม่ การส่งผ่านบนเราเตอร์หมายความว่าการลดลงจะเห็นได้ในวันเดียวกัน
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
