การ์ดชื่อเรื่องที่อ่านว่า GPT-6 Astra ปะทะ Tencent HY4 Preview พร้อมคำโปรยว่า 'ตัวเลขของโมเดลหนึ่งได้รับการตรวจสอบโดยคนอื่นแล้ว ส่วนอีกโมเดลหนึ่งยังไม่ได้รับการตรวจสอบ และ 64,000 โทเคนเอาต์พุตคือจุดที่ฝั่งราคาถูกหยุดลง' ซ้อนทับบนภาพประกอบที่สร้างขึ้น ซึ่งแสดงลูกบาศก์ที่ปิดผนึกและผ่านการรับรองวางอยู่ข้างลูกบาศก์ที่เปิดออกจนมองเห็นชั้นต่าง ๆ ภายใน
Guides & Insights

GPT-6 Astra vs Tencent HY4 Preview: โมเดลหนึ่งมีร่องรอยการตรวจสอบ ส่วนอีกโมเดลหนึ่งมีตารางเบนช์มาร์ก

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Tencent HY4 Preview และ GPT-6 Astra เป็นสองเส้นทางที่ถูกที่สุดไปสู่การเขียนโค้ดแบบเอเจนต์ระดับใกล้แนวหน้าสุดที่มีให้ใช้ในปัจจุบัน หากคุณอ่านตัวเลขของผู้ให้บริการเอง และเป็นสองโมเดลที่เปรียบเทียบกันได้น้อยที่สุดในระดับนั้น หากคุณอ่านข้อมูลของใครอื่น Tencent HY4 Preview เปิดตัวและเปิดซอร์สเมื่อวันที่ 28 สิงหาคม 2026 ภายใต้ Apache 2.0 ในราคา $0.834 ต่อล้านโทเค็นอินพุต และ $2.501 ต่อล้านโทเค็นเอาต์พุต ด้วยสถาปัตยกรรม mixture-of-experts ขนาด 770 พันล้านพารามิเตอร์ หน้าต่างบริบทที่เกินหนึ่งล้านโทเค็น และเพดานเอาต์พุต 64,000 โทเค็น GPT-6 Astra พร้อมใช้งานทั่วไปตั้งแต่ 3 กันยายน 2026 ในราคา $10.00 และ $50.00 พร้อมหน้าต่าง 1,050,000 โทเค็น และเอาต์พุตสูงสุด 128,000 จุดแข็งของ Astra ได้รับการสนับสนุนจากการประเมินโดยบุคคลที่สามที่เผยแพร่แล้วแปดฉบับ ส่วนของ HY4 Preview ได้รับการสนับสนุนจากการรัน terminal, tool-calling และ blind-evaluation ของ Tencent เอง และไม่มีสิ่งอื่นใด ความไม่สมมาตรนั้นไม่ได้หมายความว่าโมเดลที่ถูกกว่าจะอ่อนแอกว่า แต่มันหมายความว่าการเปรียบเทียบหนึ่งในสองนี้สามารถตรวจสอบได้ ส่วนอีกอันหนึ่งต้องเชื่อ และการตัดสินใจในทางปฏิบัติก็แตกต่างกันไปตามนั้น

สิ่งที่การเปิดตัว Apache 2.0 มอบให้คุณจริง ๆ

สัญญาอนุญาตคือส่วนหนึ่งของการเปรียบเทียบนี้ที่ตารางราคาไม่อาจแสดงออกมาได้ Tencent HY4 Preview ไม่ใช่ทีเซอร์ที่โฮสต์ให้ใช้พร้อมป้ายแบรนด์ open-weight — น้ำหนักโมเดลดาวน์โหลดได้จาก Hugging Face, GitHub, ModelScope และ GitCode ซึ่งหมายความว่าโมเดลจะยังอยู่รอดได้ไม่ว่า Tencent จะตัดสินใจอย่างไรเกี่ยวกับราคาของตัวเอง เอนด์พอยต์ของตัวเอง หรือความสนใจที่จะให้บริการมันต่อไปของตัวเอง

• สถาปัตยกรรม — พารามิเตอร์ทั้งหมด 770B, ใช้งานจริง 49B ต่อโทเคน, 78 เลเยอร์, ผู้เชี่ยวชาญแบบ routed 256 รายการบวกผู้เชี่ยวชาญแบบ shared หนึ่งรายการ และเลเยอร์ multi-token prediction แบบเนทีฟสำหรับ speculative decodingbr /> • ลักษณะการให้บริการ — 54.6 โทเคนเอาต์พุตต่อวินาที และเวลามัธยฐานถึงโทเคนแรก 6.26 วินาที วัดจากเส้นทางของ OrcaRouter ในช่วงหน้าต่าง 7 วันแบบ rollingbr /> • บริบทและเพดาน — หน้าต่าง 1,048,576 โทเคน เทียบกับเอาต์พุตสูงสุด 64,000 โทเคนbr /> • ช่องทางอินพุต — ข้อความเท่านั้น; ไม่มีรูปภาพ ไม่มีไฟล์ ไม่มีเสียงbr /> • การควบคุมการให้เหตุผล — สามระดับ ได้แก่ high, low และ none โดยค่าเริ่มต้นคือ high พร้อมคำแนะนำการสุ่มที่ระบุไว้ในเอกสารว่า temperature 0.9 และ top_p 1.0br /> • ความน่าเชื่อถือ — อัตราข้อผิดพลาด 2.8% ในช่วงหน้าต่าง 7 วันแบบ rolling เดียวกัน เทียบกับ 10.3% บนเส้นทาง Astra

ตัวเลขคู่สุดท้ายนั้นเป็นสิ่งที่นำไปปฏิบัติได้จริงมากที่สุดในหน้านี้ และเป็นตัวเลขประเภทที่ไม่มีผู้ขายรายใดเผยแพร่เกี่ยวกับโมเดลของตัวเอง คะแนนเบนช์มาร์กอิสระของ Astra สูงกว่า และเส้นทางของมันล้มเหลวประมาณหนึ่งในสิบคำขอในช่วงสัปดาห์ที่ผ่านมา ในขณะที่โมเดลที่ไม่มีคะแนนอิสระเลยล้มเหลวอยู่ที่หนึ่งในสามสิบห้า ตัวเลขทั้งสองไม่ใช่คำกล่าวเกี่ยวกับตัวโมเดลเอง — อัตราความผิดพลาดวัดที่เส้นทาง ขีดจำกัดอัตรา และอัปสตรีม ไม่ใช่ค่าน้ำหนัก — แต่เป็นตัวเลขที่ระบบโปรดักชันต้องเผชิญจริง

Comparison card with two columns. GPT-6 Astra: $10.00/$50.00 per 1M, cached input $1.00, $20.00/$75.00 whole-request reprice above 272K input, 1,050,000 context / 128,000 max output, 54.7 index and 88.4 Terminal-Bench 2.1 third-party, 10.3% error and 70.6 tok/s over a rolling seven-day OrcaRouter route window. Tencent HY4 Preview: $0.834/$2.501 per 1M, cached input $0.042, 770B MoE with 49B active and Apache 2.0 weights, 1,048,576 context / 64,000 max output, 85.4 Terminal-Bench 2.1 and 74.1 Toolathlon vendor-reported with no independent index, 2.8% error and 54.6 tok/s over the same window

ที่ที่ตัวเลขของ Tencent สามารถตรวจสอบกับของคนอื่นได้

เท่าที่หลักฐานที่เผยแพร่มีอยู่ นี่เป็นโอกาสที่ผิดปกติอย่างแท้จริง: ทั้ง Astra และ HY4 Preview ต่างมีตัวเลข Terminal-Bench 2.1 และมีเพียงตัวเดียวเท่านั้นที่ถูกรายงานโดยผู้ขาย

• Terminal-Bench 2.1 ขับเคลื่อนเทอร์มินัลจริง — GPT-6 Astra 88.4 ประเมินโดยอิสระ; Tencent HY4 Preview 85.4 ตามที่ผู้พัฒนารายงานbr /> • การเรียกใช้เครื่องมือ — Astra 41.4 บน τ²-Banking ประเมินโดยอิสระ; HY4 Preview 74.1 บน Toolathlon-Verified ตามที่ผู้พัฒนารายงาน ในการทดสอบที่แตกต่างกันbr /> • วิศวกรรมซอฟต์แวร์ — HY4 Preview 64.3 บน DeepSWE เพิ่มขึ้นจาก 28.0 ในรุ่นก่อนหน้าอย่าง Hy3 ตามที่ผู้พัฒนารายงานbr /> • งานเอเจนต์ — HY4 Preview 37.1 pass@1 บน APEX-Agents ตามที่ผู้พัฒนารายงานbr /> • ความพึงพอใจของมนุษย์ — ค่าเฉลี่ย 2.99 จาก 4.00 จากการให้คะแนนงานวิศวกรรม 203 งานโดยผู้เชี่ยวชาญ 163 คน ดำเนินการโดยผู้พัฒนา เทียบกับ GLM-5.3 ที่ 2.92 และ Kimi K3 ที่ 2.94br /> • ดัชนีอิสระ — GPT-6 Astra 54.7 Intelligence Index และ 96.1 GPQA Diamond จากบุคคลที่สาม; ไม่มีดัชนีเทียบเท่าสำหรับ HY4 Preview

แถวของ Terminal-Bench เป็นแถวที่ควรค่าแก่การพิจารณาให้ลึกซึ้ง ช่องว่าง 3 จุดระหว่าง 88.4 จากผลวัดอิสระกับ 85.4 ที่ผู้ขายรายงานนั้นอยู่ภายในช่วงที่ฮาร์เนสอื่น สแคฟโฟลด์อื่น หรืออุณหภูมิการสุ่มอื่นสามารถก่อให้เกิดขึ้นได้อย่างสบาย ซึ่งหมายความว่าการตีความอย่างซื่อตรงไม่ใช่ "Astra ดีกว่า 3 จุด" แต่เป็น "โมเดลโอเพนเวตที่ถูกที่สุดในระดับนี้กำลังอ้างความทัดเทียม และข้ออ้างนั้นอย่างน้อยก็เป็นไปได้" การวางกรอบของ Tencent เองก็ระมัดระวังในประเด็นนี้ โดยบรรยาย DeepSWE ว่า "ค่อย ๆ ลดช่องว่างลง" มากกว่าจะปิดช่องว่างให้หมด และข้ออ้างเรื่องความทัดเทียมที่ชัดเจนเพียงข้อเดียวของมัน — การเสมอกันบน Terminal-Bench กับโมเดลปิดชั้นนำจากผู้ขายรายอื่น — ก็เป็นข้ออ้างที่ต้องการการวัดซ้ำมากที่สุดพอดี

ยังมีการเปลี่ยนแปลงอีกอย่างที่ควรทราบ เพราะมันเปลี่ยนเศรษฐศาสตร์ของต้นทุนมากกว่าคะแนน เมื่อวันที่ 7 กันยายน 2026 Tencent ได้ผลักดันการปรับประสิทธิภาพเข้าสู่บิลด์พรีวิวที่ใช้งานจริง ซึ่งบริษัทกล่าวว่าช่วยลดรอบการให้เหตุผลและปริมาณโทเคนต่องานสำหรับงานที่ซับซ้อน เนื่องจากโมเดลคิดค่าบริการตามจำนวนโทเคน การใช้โทเคนน้อยลงต่อหนึ่งงานที่เสร็จสิ้นจึงลดต้นทุนของงานนั้น แม้อัตราต่อโทเคนจะไม่เปลี่ยนแปลง ขนาดของการประหยัดนั้นเป็นการวัดของ Tencent เอง และยังไม่มี任何人ภายนอก Tencent ทำซ้ำได้ — แต่กลไกนี้มีจริง และเป็นเหตุผลที่พรีวิวซึ่งเปิดตัวในเดือนสิงหาคมอาจมีต้นทุนการดำเนินงานในเดือนตุลาคมต่ำกว่าที่บทความเปิดตัวระบุไว้อย่างมีนัยสำคัญ

เพดาน 64,000 โทเคนคือข้อกำหนดที่ชี้ขาดการดีพลอย

เมื่อไล่ลงไปครึ่งทางในเอกสารสเปก จะพบข้อจำกัดที่กัดก่อนเป็นอันดับแรก และมันไม่ใช่เรื่องคุณภาพ เอาต์พุตสูงสุดของ HY4 Preview อยู่ที่ 64,000 โทเคน เทียบกับ 128,000 ของ Astra บนโมเดลที่มีจุดประสงค์ที่ระบุไว้คือเอเจนต์เขียนโค้ดและเชนการใช้เครื่องมือแบบยาว ไฟล์ที่สร้างขึ้น แพตช์หลายไฟล์ รายงานแบบมีโครงสร้างยาว ๆ — สิ่งเหล่านี้คือเอาต์พุตที่ชนเพดาน และในการรันเอเจนต์ ความล้มเหลวไม่ใช่คำตอบที่แย่ลงเล็กน้อย แต่เป็นคำตอบที่ถูกตัดทอน ซึ่งไปป์ไลน์โดยรอบต้องตรวจจับและจัดการ

ทั้งสองโมเดลรับอินพุตประมาณหนึ่งล้านโทเคน ดังนั้นกรณีการอ่านเอกสารจึงเสมอกันอย่างแท้จริง ความแตกต่างอยู่ที่ฝั่งการสร้างทั้งหมด และเป็นปัจจัยสองเท่า ไม่ใช่ความคลาดเคลื่อนจากการปัดเศษ เพิ่มความแตกต่างด้านอินพุตที่รองรับ — Astra รองรับภาพและไฟล์ ส่วน HY4 Preview เป็นข้อความเท่านั้น — ภาพที่ปรากฏจึงเป็นการแบ่งงานกันอย่างชัดเจนมากกว่าการจัดอันดับ: โมเดลน้ำหนักเปิดสำหรับลูปเอเจนต์แบบข้อความเข้า-ข้อความออก ซึ่งสิ่งที่ส่งมอบคือการเรียกใช้เครื่องมือหรือดิฟฟ์ และโมเดลปิดสำหรับสิ่งใดก็ตามที่ต้องดูบางสิ่งหรือเขียนบางอย่างที่ยาว

สิ่งที่อัตราผลผลิต 20× มอบให้ ทีละบรรทัด

• ราคาอินพุต — Tencent HY4 Preview $0.834 ต่อ 1M เทียบกับ GPT-6 Astra $10.00 ประมาณ 12 เท่าbr /> • ราคาเอาต์พุต — HY4 Preview $2.501 ต่อ 1M เทียบกับ Astra $50.00 ประมาณ 20 เท่าbr /> • อินพุตแคช — HY4 Preview $0.042 ต่อ 1M เทียบกับ Astra $1.00 ประมาณ 24 เท่าbr /> • ขั้นบันไดสำหรับคำขอแบบยาว — Astra คิดราคาใหม่ทั้งคำขอเมื่อเกิน 272,000 โทเคนอินพุต เป็น $20.00 และ $75.00; การ์ดของ HY4 Preview ไม่มีขั้นบันไดเทียบเท่าbr /> • อัตราอินพุตที่มีผลจริงบนพรอมป์ 400,000 โทเคน — HY4 Preview ไม่เปลี่ยนแปลงที่ $0.834 เทียบกับ Astra $20.00 ประมาณ 24 เท่าbr /> • ต้นทุนต่อล้านโทเคนของลูปเอเจนต์ทั่วไป อัตราส่วนอินพุตต่อเอาต์พุต 4:1 — HY4 Preview ประมาณ $1.17 เทียบกับ Astra ประมาณ $18.00br /> • ต้นทุนหนึ่งเดือนที่ใช้ 100 ล้านโทเคนในอัตราส่วนเดียวกัน — HY4 Preview ประมาณ $117 เทียบกับ Astra ประมาณ $1,800

บรรทัด cached-input คือรายการที่สเกลได้แย่ที่สุดสำหรับฝั่งที่มีค่าใช้จ่ายสูง เพราะลูปของเอเจนต์ส่ง system prompt และคำนำหน้าบทสนทนาเดิมซ้ำในทุกเทิร์น ที่ $0.042 เทียบกับ $1.00 โทเคนที่ถูกที่สุดของลูปยาวจะถูกกว่าบนโมเดล Tencent ถึง 24 เท่า ซึ่งเป็นเวิร์กโหลดแบบที่ความต่างต่อโทเคนเพียงเล็กน้อยทบต้นเร็วที่สุดพอดี ต้นทุนต่องาน ซึ่งเป็นเมตริกที่จะชี้ขาดเรื่องนี้ได้อย่างชัดเจน กลับไม่ได้ถูกเผยแพร่โดย Tencent เลย — ดังนั้นวิธีเดียวที่จะได้ตัวเลขที่สำคัญคือรันทั้งสองโมเดลกับชุดงานของคุณเอง แล้วอ่านออบเจ็กต์ usage

Text card headed 'The 64,000-token ceiling decides more deployments than quality does' with rows: max output 128,000 on GPT-6 Astra vs 64,000 on Tencent HY4 Preview; context 1,050,000 vs 1,048,576; input surface text image file vs text only; what breaks first is a generated file or multi-file patch; failure mode is silent truncation

สิ่งที่เราเตอร์เพิ่มเข้ามาตรงนี้ เมื่อมีอัตราความผิดพลาดอยู่ในมือ

ทั้งสองโมเดลอยู่ในแค็ตตาล็อกของ OrcaRouter — tencent/hy4-preview และ openai/gpt-6-astra — ผ่านเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI, โดยแต่ละตัวคิดตามราคาตามรายการของผู้ให้บริการเอง ส่งผ่านโดยบวกเพิ่ม 0%รายละเอียดสุดท้ายนี้สำคัญกับคู่นี้มากกว่าคู่อื่นๆ เพราะราคาตามรายการของโมเดล Tencent ประกาศเป็นสกุลหยวน ตัวเลขดอลลาร์ด้านบนคืออัตราที่แปลงแล้วซึ่งคุณเห็นจริง ไม่ใช่ส่วนต่างของตัวแทนจำหน่าย และหาก Tencent ปรับราคา การเปลี่ยนแปลงจะมีผลที่นี่ภายในวันเดียวกัน ไม่ใช่รอถึงการต่อสัญญาครั้งถัดไป

DSL สำหรับการกำหนดเส้นทางคือจุดที่โมเดลทั้งสองเลิกเป็นเพียงทางเลือกแทนกัน กฎที่เป็นธรรมชาติสำหรับคู่นี้คือการยกระดับตามเอาต์พุต: ส่งลูปไปยังโมเดลราคาถูก และเมื่อคำตอบที่ส่งกลับมาถูกตัดทอนจนชนเพดาน 64,000 โทเคน หรือไม่ผ่านการตรวจสอบสคีมาของคุณ ให้ลองขั้นตอนนั้นซ้ำกับopenai/gpt-6-astraซึ่งมีพื้นที่เอาต์พุตเป็นสองเท่า การสลับไปใช้เส้นทางสำรองอัตโนมัติเป็นอีกครึ่งหนึ่งของเหตุผลนี้ และมันไม่ใช่เรื่องทฤษฎีเมื่อหนึ่งในสองเส้นทางเกิดข้อผิดพลาดกับหนึ่งในสิบคำขอในช่วงสัปดาห์ที่ผ่านมา — การรันเอเจนต์แบบยาวที่ผูกติดกับโมเดลเดียวจะล้มไปพร้อมกับบริบทที่สะสมไว้ และโมเดลทั้งสองนี้ก็ไม่ถูกพอที่จะรันใหม่ตั้งแต่ต้นโดยไม่ตั้งใจ

Text card headed 'Checked by somebody else, or checked by the vendor' with rows: GPT-6 Astra 54.7 Intelligence Index against none published for HY4 Preview; Terminal-Bench 2.1 88.4 independently evaluated vs 85.4 Tencent-reported; Tencent's 7 September reasoning-turn optimisation, unreproduced outside the vendor; and route error 10.3% on the Astra route vs 2.8% on the HY4 route over a rolling seven-day window

อะไรจะเปลี่ยนการเปรียบเทียบนี้

สามสิ่ง เรียงตามว่ามันจะสร้างความเปลี่ยนแปลงได้มากน้อยเพียงใด การประเมินโดยอิสระของ HY4 Preview — โมเดลนี้เปิดเผยต่อสาธารณะมาได้หกสัปดาห์แล้ว ยังไม่มีดัชนีจากบุคคลที่สาม ไม่มีตัวเลข Terminal-Bench ที่ทำซ้ำได้ และไม่มีตัวเลขต้นทุนต่องาน และการประเมินแบบปกปิดที่ผู้ขายจัดทำขึ้นเพียงครั้งเดียวคือข้อมูลความชอบของมนุษย์เพียงอย่างเดียวที่มีอยู่ ต้นทุนที่เผยแพร่ต่องานที่ทำสำเร็จสำหรับทั้งสองโมเดล ซึ่งจะแทนที่ทุกอัตราส่วนในบทความนี้ด้วยตัวเลขเดียว และการตัดสินใจของ Tencent เกี่ยวกับการอนุมานโดยบุคคลที่สาม เนื่องจากน้ำหนัก Apache 2.0 นั้นใครก็สามารถให้บริการได้ และในทันทีที่โฮสต์คู่แข่งเปิดให้บริการ HY4 Preview ราคาในด้านที่ถูกกว่าของการเปรียบเทียบนี้จะกลายเป็นตลาดแทนที่จะเป็นรายการราคา

จนถึงตอนนั้น สรุปที่ใช้งานได้จริงยังแคบกว่าโพสต์เปิดตัวของผู้จำหน่ายทั้งสองราย และซื่อตรงกว่ากระดานคะแนน: GPT-6 Astra คือโมเดลที่คำกล่าวอ้างด้านความสามารถได้รับการตรวจสอบแล้ว โดยมีเพดานเอาต์พุตเป็นสองเท่า และมีเส้นทางที่ล้มเหลวหนึ่งคำขอในสิบ ส่วน Tencent HY4 Preview คือโมเดลที่คำกล่าวอ้างด้านความสามารถยังไม่ได้รับการตรวจสอบ โดยมีสถาปัตยกรรมที่เผยแพร่ สัญญาอนุญาตแบบเปิด ราคาหนึ่งในสาม และอัตราข้อผิดพลาดต่ำกว่ามากในช่วงเวลาเดียวกัน หากงานของคุณเป็นแบบข้อความเข้า-ข้อความออก และอยู่ในขอบเขต 64,000 โทเคนที่สร้างขึ้น โมเดลที่ถูกกว่าไม่ใช่การประนีประนอม — มันคือคำตอบที่ถูกต้อง และร่องรอยการตรวจสอบคือสิ่งเดียวที่คุณกำลังสละไป

กฎตามธรรมชาติสำหรับคู่นี้คือการยกระดับเมื่อเอาต์พุต: ส่งลูปไปยังโมเดลราคาถูก และเมื่อการตอบกลับถูกตัดทอนเมื่อเทียบกับเพดาน 64,000 โทเค็น หรือไม่ผ่านการตรวจสอบสคีมาของคุณ ให้ลองขั้นตอนนั้นใหม่กับ openai/gpt-6-astra ซึ่งมีพื้นที่เอาต์พุตเป็นสองเท่า

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube