
GPT-6 Sol กับ Tencent HY4 Preview: โมเดลที่ถูกกว่ากลับแบกรับทราฟฟิกมากกว่า 600 เท่า
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
การเปรียบเทียบระหว่างโมเดลระดับแนวหน้ากับโมเดลราคาถูกมักจบลงที่ตารางราคา และการเปรียบเทียบนี้ยังมีตอนจบที่ดีกว่าให้เลือกTencent HY4 Preview และ GPT-6 Solต่างถูกกำหนดเส้นทางโดย OrcaRouter ซึ่งหมายความว่าเทเลเมทรีชุดเดียวกันครอบคลุมทั้งสอง และในช่วงเวลาเจ็ดวันแบบเลื่อนเดียวกัน โมเดล HY4 Preview ถูกใช้ไปประมาณ 2.4 พันล้านโทเคน เทียบกับ GPT-6 Sol ที่ประมาณ 3.9 ล้านโทเคน นั่นไม่ใช่การทดสอบมาตรฐานและไม่ใช่คำตัดสิน มันคือหน้าต่างแบบเลื่อนบนทราฟฟิกของแพลตฟอร์มเดียว และสัปดาห์หน้าตัวเลขจะอ่านได้ไม่เหมือนเดิม แต่เป็นสัญญาณจริงเกี่ยวกับสิ่งที่คนที่สร้างสิ่งต่างๆ เลือกใช้จริงเมื่อโมเดลน้ำหนักเปิดที่แข็งแกร่งมีราคาเพียงหนึ่งในสี่ของโมเดลปิด และมันเป็นตัวเลขแบบที่สเปกชีตให้ไม่ได้
สองโมเดลนี้ยังเป็นกรณีศึกษาว่าเกณฑ์มาตรฐานบอกอะไรคุณได้และบอกอะไรคุณไม่ได้ GPT-6 Sol ซึ่งเปิดตัวเมื่อวันที่ 22 กันยายน 2026 ในฐานะรุ่นระดับกลางของตระกูล GPT-6 ของ OpenAI มีคะแนน Intelligence Index ที่เป็นอิสระ ส่วน HY4 Preview ซึ่ง Tencent เปิดตัวและเปิดซอร์สเมื่อวันที่ 28 สิงหาคม 2026 ไม่มีหน้าของโมเดลบน Artificial Analysis ไม่มีดัชนีจากบุคคลที่สาม และไม่มีตัวเลขต้นทุนต่องานที่เป็นอิสระเลย ทุกอย่างที่เผยแพร่เกี่ยวกับว่ามันทำงานได้ดีเพียงใดคือการวัดของ Tencent เอง ความไม่สมมาตรนั้นไม่ได้ทำให้ HY4 Preview เป็นโมเดลที่อ่อนกว่า แต่มันทำให้ HY4 Preview เป็นโมเดลที่ถูกตรวจสอบน้อยกว่า และสองสิ่งนั้นเป็นข้อกล่าวอ้างที่แตกต่างกัน
สเปก รวมถึงสองข้อที่ชี้ขาดการปรับใช้ส่วนใหญ่
• ราคาเอาต์พุต — GPT-6 Sol $10.00 ต่อล้าน เทียบกับ Tencent HY4 Preview $2.50 ต่อล้าน
• ราคาอินพุต — GPT-6 Sol $2.00 ต่อล้าน เทียบกับ Tencent HY4 Preview $0.83 ต่อล้าน
• อินพุตแบบแคช — GPT-6 Sol $0.20 ต่อล้าน เทียบกับ Tencent HY4 Preview $0.04 ต่อล้าน
• น้ำหนักโมเดล — GPT-6 Sol ปิด เฉพาะ API เทียบกับ HY4 Preview เปิดซอร์สภายใต้ Apache 2.0
• รูปแบบอินพุต — GPT-6 Sol ข้อความ รูปภาพ และไฟล์ เทียบกับ HY4 Preview ข้อความเท่านั้น
• หน้าต่างบริบท — GPT-6 Sol 1,050,000 โทเค็น เทียบกับ HY4 Preview 1,048,576 โทเค็น
• เอาต์พุตสูงสุด — GPT-6 Sol 128,000 โทเค็น เทียบกับ HY4 Preview 64,000 โทเค็น
• ขั้นบันไดสำหรับคำขอแบบยาว — GPT-6 Sol คิดราคาคำขอทั้งหมดใหม่เมื่ออินพุตเกิน 272,000 โทเค็น เป็น $4.00 / $15.00 เทียบกับ HY4 Preview ไม่มีขั้นบันไดในบัตรราคาของตน
• สถาปัตยกรรม — GPT-6 Sol ไม่เปิดเผย เทียบกับ HY4 Preview พารามิเตอร์รวม 770B, เปิดใช้งาน 49B, 78 เลเยอร์, ผู้เชี่ยวชาญแบบ routed 256 ตัว บวกหนึ่งตัวที่ใช้ร่วมกัน, เลเยอร์ทำนายหลายโทเค็นแบบเนทีฟ
• คะแนนอิสระ — GPT-6 Sol 47.6 Intelligence Index เทียบกับ HY4 Preview ไม่มีการเผยแพร่
• ความเร็วเอาต์พุตที่วัดได้ — GPT-6 Sol ประมาณ 244 โทเค็นต่อวินาที เทียบกับ HY4 Preview ประมาณ 54 ทั้งคู่เป็นตัวเลขแบบหมุนเวียน 7 วัน
สองบรรทัดที่ตัดสินการปรับใช้จริงส่วนใหญ่คือบรรทัดที่อยู่ล่างสุด บรรทัดแรกคือ HY4 Preview ไม่รับอินพุตรูปภาพหรือไฟล์ ซึ่งตัดมันออกจากไปป์ไลน์ใดก็ตามที่ต้องดูอะไรบางอย่าง บรรทัดที่สองคือเพดานเอาต์พุต: 64,000 โทเค็นเป็นครึ่งหนึ่งของ 128,000 ของ GPT-6 Sol และบนโมเดลที่มีจุดประสงค์ที่ระบุไว้คือเอเจนต์เขียนโค้ดและห่วงโซ่การใช้เครื่องมือที่ยาว นั่นคือข้อจำกัดที่ทีมจะพบก่อน — ไม่ใช่คุณภาพ แต่เป็นจุดที่ไฟล์ที่สร้างขึ้นไม่พอดีในหนึ่งการตอบกลับอีกต่อไป
เมื่อเทียบกับสิ่งเหล่านั้น ราคาเอาต์พุตเพียงหนึ่งในสี่และราคาอินพุตแบบแคชเพียงหนึ่งในห้า ก็ทำให้ลองใหม่ได้อีกมากมายมหาศาล และสถาปัตยกรรมของ HY4 Preview ถูกบันทึกไว้ในลักษณะที่ GPT-6 Sol ไม่มี: Tencent เผยแพร่จำนวนพารามิเตอร์ จำนวนเลเยอร์ การจัดวางผู้เชี่ยวชาญ (expert layout) และเลเยอร์ speculative decoding ซึ่งหมายความว่าคุณลักษณะด้านการให้บริการอย่างน้อยก็สามารถคาดเดาได้บางส่วนจากเอกสารงานวิจัย แทนที่จะสังเกตได้เพียงผ่าน API เท่านั้น

ตาราง benchmark ของ HY4 Preview จริง ๆ แล้วคืออะไรกันแน่
ตัวเลขที่ Tencent เผยแพร่นั้นแข็งแกร่ง และทั้งหมดล้วนมาจากการทดสอบที่ผู้ขายจัดทำเอง บน Terminal-Bench 2.1 โมเดลทำได้ 85.4; บน DeepSWE ได้ 64.3; และในการประเมินแบบ blind ภายในองค์กรจากงานวิศวกรรม 203 งาน โมเดลได้ค่าเฉลี่ย 2.99 เมื่อเทียบกับ GLM-5.3 ที่ 2.92 และ Kimi K3 ที่ 2.94 — นำอยู่เจ็ดในร้อยของคะแนนบนสเกลสิบจุดในการศึกษาที่ Tencent ออกแบบเอง นอกจากนี้ยังเปิดตัวบนลีดเดอร์บอร์ด WebDev Arena ซึ่ง Tencent รายงานว่าอยู่ราวอันดับห้าโดยรวม และอันดับสามในกลุ่มโมเดลแบบเปิดน้ำหนัก ผลลัพธ์จากอารีนานี้มาจากการโหวตของฝูงชน ไม่ใช่การให้คะแนนโดยผู้ขาย และเป็นหลักฐานที่เป็นอิสระที่สุดในชุดนี้; ส่วนที่เหลือเป็นข้ออ้าง และข้ออ้างก็ยังคงมีค่าให้อ่าน ตราบใดที่ยังติดป้ายกำกับว่าเป็นข้ออ้าง
ช่องว่างที่สำคัญไม่ใช่ว่าตัวเลขเหล่านี้อาจจะสูงเกินจริง — ชุดทดสอบของผู้ขายมักจะเป็นเช่นนั้นในทั้งสองทิศทาง แต่เป็นว่ามันไม่มีการวัดที่สองให้เปรียบเทียบต่างหาก โมเดลที่มีหน้า Artificial Analysis สามารถตรวจสอบได้ โมเดลที่ไม่มีก็ตรวจสอบไม่ได้ และความแตกต่างจะปรากฏขึ้นในอีกหลายเดือนต่อมาเมื่อมีคนค้นพบว่าตัวเลขพาดหัวถูกวัดบนชุดทดสอบที่ไม่มีใครอื่นสามารถทำซ้ำได้ ไม่มีอะไรตรงนี้บ่งชี้ว่าสิ่งนั้นเกิดขึ้นกับ HY4 Preview มันแค่หมายความว่าการตัดสินใจนำไปใช้ที่อ้างอิงจาก 85.4 นั้นอ้างอิงจากแหล่งเดียว
การแปลในทางปฏิบัติก็คือ HY4 Preview ควรได้รับการประเมินจากทราฟฟิกของคุณเอง แทนที่จะประเมินจากตาราง และโครงสร้างต้นทุนทำให้การทำเช่นนั้นมีค่าใช้จ่ายต่ำ — ด้วยอัตราเพียงหนึ่งในสี่ของอัตราเอาต์พุตของ GPT-6 Sol ทราฟฟิกเงาหนึ่งสัปดาห์กับพรอมป์จริงของคุณมีค่าใช้จ่ายน้อยกว่าการทบทวนระดับ API เพียงครั้งเดียว นั่นคือรูปแบบการประเมินที่ดีที่สุดสำหรับโมเดลที่ยังถูกวัดน้อยเกินไป และมันเป็นรูปแบบที่แทบไม่มีใครทำจริง
คำถามเรื่องโอเพนเวต ซึ่งเป็นเส้นแบ่งที่แท้จริง
HY4 Preview เป็นโอเพนซอร์สภายใต้ Apache 2.0 พร้อมบิลด์ FP8 ที่มีสัญญาอนุญาตแบบผ่อนปรน ควบคู่ไปกับเช็กพอยต์พื้นฐาน ส่วน GPT-6 Sol เป็นระบบปิดและไม่มีไฟล์สัญญาอนุญาต เพราะไม่มีอะไรให้อนุญาต ทุกอย่างอื่นในการเปรียบเทียบนี้ล้วนเป็นการได้อย่างเสียอย่าง แต่ข้อนี้เป็นความแตกต่างเชิงประเภท
สิ่งที่คุณได้จากเรื่องนั้นไม่ใช่หลัก ๆ แล้วบิลที่ถูกลง — ด้วยราคา $2.50 ต่อเอาต์พุตหนึ่งล้านโทเค็น API ที่โฮสต์ไว้ก็ต่ำกว่าต้นทุนการรันโมเดลขนาด 770 พันล้านพารามิเตอร์ของทีมส่วนใหญ่อยู่แล้ว และถ้าต้นทุนเป็นข้อโต้แย้งทั้งหมด ใบอนุญาตแบบผ่อนปรนก็ไม่ใช่ประเด็น สิ่งที่คุณได้จากมันคือการติดตั้งใช้งานที่ไม่ต้องพึ่งพาเอนด์พอยต์ของใคร — เวตที่ไม่สามารถถูกจำกัดอัตราการใช้งานได้, เช็กพอยต์ที่สามารถควอนไทซ์ให้พอดีกับฮาร์ดแวร์ที่คุณมี, โมเดลที่สามารถไฟน์จูนได้ และทราฟฟิกที่สามารถอยู่ในขอบเขตเครือข่ายได้ คำตอบของ GPT-6 Sol ต่อทั้งหมดนี้คือคุณไม่ควรจำเป็นต้องมีสิ่งเหล่านี้เลย ซึ่งเป็นข้อโต้แย้งที่ใช้ได้จริงสำหรับทีมกลุ่มหนึ่งที่มีอยู่จริง และเป็นข้อโต้แย้งที่ไม่เกี่ยวข้องสำหรับทีมที่ต้องใช้มันจริง ๆ
การแยกตามโมดัลลิตี้และบรรทัดสัญญาอนุญาตชี้ไปในทางเดียวกัน ซึ่งน่าสังเกต โมเดลที่อ่านได้เฉพาะข้อความและเผยแพร่ภายใต้ Apache 2.0 ถูกสร้างมาให้เป็นส่วนประกอบ — บางสิ่งที่คุณใส่เข้าไปในไปป์ไลน์ที่คุณควบคุม โดยป้อนข้อความที่คุณปรับให้สอดคล้องแล้วให้มัน โมเดลที่อ่านข้อความ รูปภาพ และไฟล์ และเข้าถึงได้ผ่าน API เท่านั้น ถูกสร้างมาให้เป็นจุดเข้า โดยรับอินพุตที่ยุ่งเหยิงโดยตรง เหล่านั้นเป็นงานที่แตกต่างกัน และการเปรียบเทียบที่จัดอันดับพวกมันบนดัชนีเดียวกำลังตอบคำถามที่ไม่มีผู้ขายรายใดถาม

การให้บริการพวกนั้นพร้อมกัน และสิ่งที่ตัวเลขทราฟฟิกบอกเป็นนัย
ทั้งสองโมเดลอยู่ภายใต้คีย์ OrcaRouter เดียวกันพร้อมกับอีก 200+ ตัว และรูปแบบการจัดเส้นทางที่การจับคู่นี้บ่งชี้กลับเป็นสิ่งที่ตรงข้ามกับแบบที่เห็นได้ชัด ให้วาง HY4 Preview ไว้ก่อน — มันเป็นโมเดลที่ถูกกว่าในด้านเอาต์พุตถึงสี่เท่า เป็นตัวที่มีสถาปัตยกรรมซึ่งมีเอกสารอธิบายไว้ และบนเส้นทางของเรา มันเป็นตัวที่แบกรับโหลด — แล้วให้ GPT-6 Sol อยู่ข้างหลังสำหรับคำขอที่ต้องอ่านภาพ หรือที่ต้องส่งออกมากกว่า 64,000 โทเคน หรือที่ไม่ผ่านการตรวจสอบคุณภาพ การประกอบกันนี้แสดงอยู่ใน routing DSL แทนที่จะอยู่ในโค้ดแอปพลิเคชัน ดังนั้นเส้นแบ่งระหว่างทั้งสองจึงเป็นกฎที่คุณแก้ไขได้โดยไม่ต้องดีพลอย
ตัวเลขความเร็วเหล่านี้น่าสมควรมีข้อควรระวังก่อน แล้วจึงตามด้วยข้อสรุป HY4 Preview วัดได้ประมาณ 54 โทเคนเอาต์พุตต่อวินาทีในหน้าต่างเลื่อนของเรา เทียบกับ GPT-6 Sol ที่ประมาณ 244 และทั้งสองเป็นการสังเกตบนโครงสร้างพื้นฐานที่ใช้ร่วมกัน มากกว่าจะเป็นผลการทดสอบเบนช์มาร์กแบบควบคุม โดยเฉพาะตัวเลขของ Tencent สะท้อนโมเดลที่มีจำนวนพารามิเตอร์ที่ใช้งานอยู่ขนาดใหญ่มาก และการมี 49 พันล้านพารามิเตอร์ที่ใช้งานต่อโทเคนก็คือการคำนวณจำนวนมากต่อเอาต์พุตแต่ละรายการ ดังนั้นโมเดลที่ถูกกว่าจึงเป็นตัวที่ช้ากว่าอย่างมาก ซึ่งเป็นข้อแลกเปลี่ยนที่ไปป์ไลน์แบบแบตช์ยินดีทำ แต่ระบบแบบโต้ตอบไม่ยินดีทำ บิลด์โฮสต์ของ Tencent ยังได้รับการปรับประสิทธิภาพเมื่อวันที่ 7 กันยายน 2026 ซึ่งผู้ขายกล่าวว่าช่วยลดรอบการใช้เหตุผลและปริมาณโทเคนที่ใช้ต่องาน โดยคุณภาพเท่าเดิม — เป็นตัวเลขที่ผู้ขายระบุอีกเช่นกัน แต่เป็นตัวเลขที่บ่งชี้ถึงค่าใช้จ่ายที่ต่ำลงมากกว่าสตรีมที่เร็วขึ้น
การสลับไปใช้ระบบสำรองคือสิ่งที่ทำให้การจับคู่นี้ปลอดภัยไม่ว่าจะเรียงลำดับใด โมเดล open-weight ขนาด 770 พันล้านพารามิเตอร์มีผู้ให้บริการโครงสร้างพื้นฐานมากกว่าหนึ่งรายให้บริการ และเส้นทางที่สามารถถอยไปใช้ระบบสำรองได้หมายความว่าโฮสต์ที่ประสิทธิภาพลดลงจะกลายเป็นเพียงการลองใหม่ ไม่ใช่การล่ม แค็ตตาล็อกของเราส่งต่อราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม ซึ่งหมายความว่าอัตราของผู้ขายที่ระบุเป็นสกุลเงินนั้นไม่ใช่สิ่งที่คุณต้องรอ และตัวเลขดอลลาร์ที่หน้าเว็บของเราแสดงคืออัตรานั้นที่แปลงแล้ว ไม่ใช่ส่วนต่างกำไรของตัวแทนจำหน่าย

คู่นี้มีไว้เพื่ออะไรกันแน่
เลือก Tencent HY4 Preview สำหรับงานปริมาณมาก สำหรับไปป์ไลน์แบบข้อความล้วนที่คุณควบคุมเอง สำหรับทุกสิ่งที่ต้องรันบนฮาร์ดแวร์ของคุณเอง และสำหรับเวิร์กโหลดใดก็ตามที่คำตอบผิดสามารถถูกจับได้และลองใหม่ได้ — ราคาทำให้การลองใหม่เป็นคันโยกด้านคุณภาพที่ถูกที่สุดที่คุณมี เลือก GPT-6 Sol เมื่ออินพุตเป็นรูปภาพหรือไฟล์ เมื่อคำตอบเดียวต้องรองรับมากกว่า 64,000 โทเคน หรือเมื่อคำตอบนั้นจะส่งถึงคนที่จะลงมือทำตามโดยไม่ตรวจสอบ เลือกทั้งสองอย่างหากทราฟฟิกของคุณมีทั้งสองแบบปนกัน ซึ่งแทบจะแน่นอนว่าเป็นเช่นนั้น
การตรวจสอบปิดท้ายสองข้อ HY4 Preview ยังคงมีป้ายกำกับว่าเป็น preview และยังเป็นโมเดล Tencent ที่ใหม่ที่สุดในแค็ตตาล็อกของเรา ดังนั้นชื่อจึงยังถูกต้องแม่นยำ ไม่ได้ล้าสมัย แต่ preview สามารถเปลี่ยนแปลงได้โดยที่คุณไม่ทันตั้งตัว และ checkpoint ที่มีสัญญาอนุญาตแบบเปิดกว้างอาจถูกแทนที่ด้วยเวอร์ชัน release ฉบับสมบูรณ์ของตัวเองได้โดยไม่มีการเตือน และ GPT-6 Sol ก็ถูกแทนที่ด้วย GPT-6.1 Sol แล้วในอัตรา short-context ที่เท่ากัน โดย cached input ลดลงครึ่งหนึ่งจาก $0.20 เหลือ $0.10 และหน้าของโมเดลของ OpenAI เองตอนนี้ก็ชี้ผู้อ่านไปที่นั่นแล้ว หากเหตุผลที่คุณกำลังชั่งน้ำหนักเลือก Sol แทนโมเดล Tencent คือการผสานรวมที่มีอายุแปดวัน ข้อนั้นก็ยังใช้ได้ หากเป็นเรื่องความสามารถ สิ่งที่คุณควรนำมาตั้งราคาคือรุ่นสืบทอด
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
