การ์ด hero ที่ถูกสร้างขึ้น หัวข้อ 'Reflection Beam: 501B พารามิเตอร์, 23B ที่ทำงานอยู่' พร้อมบรรทัดย่อย 'Sparse MoE / โทเคนก่อนการฝึก 23.8T / คอนเท็กซ์ API ขนาด 256K โทเคน / น้ำหนักโมเดลที่สัญญาไว้ว่าจะมาเดือนนี้ / ทุกตัวเลขรายงานโดยผู้ขาย' ใต้ข้อความลงไปมีไอคอนเส้นแบบแบนสามอัน ได้แก่ แผนภาพชั้นซ้อนกันโดยชั้นส่วนใหญ่ถูกหรี่ลงและมีหนึ่งชั้นถูกเน้น, ชั้นวางที่มีบล็อกเซิร์ฟเวอร์เก้าชิ้น, และโครงร่างเอกสารที่มีแม่กุญแจเล็ก ๆ หนึ่งอัน โลโก้ OrcaRouter ถูกซ้อนทับไว้ที่มุมขวาล่าง
Guides & Insights

Reflection Beam อธิบาย: พารามิเตอร์ 501B, ใช้งานอยู่ 23B และเวตที่ยังไม่เปิดตัว

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 5 ตุลาคม 2026 Reflection ได้ประกาศ Reflection Beamโมเดลภาษาชนิด sparse mixture-of-experts ที่มีพารามิเตอร์รวม 501 พันล้านตัว และเปิดใช้งาน 23 พันล้านตัวต่อโทเคน พร้อมทั้งเปิดให้บริการปลายทาง (endpoint) เวอร์ชันเบต้าที่เข้ากันได้กับ OpenAI ตั้งแต่วันเดียวกัน นั่นหมายความว่ามีเพียง 4.6 เปอร์เซ็นต์ของโมเดลที่ตื่นทำงานอยู่ในขณะใดขณะหนึ่ง ซึ่งเป็นอัตราส่วนที่ดุดันมากแม้เมื่อเทียบกับมาตรฐานของวงการโมเดลน้ำหนักเปิดในปัจจุบัน และเป็นตัวเลขที่การเปิดตัวครั้งนี้ทั้งหมดต้องพึ่งพา Reflection กล่าวว่าเวตเต็มรูปแบบ รายงานทางเทคนิค และการ์ดโมเดลจะตามมาภายในปลายเดือนนี้ภายใต้สัญญาอนุญาต Apache 2.0 ณ วันนี้ สิ่งเหล่านั้นยังไม่ปรากฏ ไม่มีการเผยแพร่ราคาที่ใดในช่องทางของ Reflection เอง และ Artificial Analysis ก็ยังไม่มีแถวข้อมูลสำหรับโมเดลนี้ ดังนั้น สรุปการเปิดตัวนี้อย่างตรงไปตรงมาคือ คำกล่าวอ้างที่เจาะจงมากเกี่ยวกับประสิทธิภาพ ซึ่งมาจากห้องแล็บที่ฝึกโมเดลนี้ โดยตัวเลขสนับสนุนทั้งหมดนั้นมาจากห้องแล็บนั้นเอง

ตารางเปรียบเทียบของ Reflection เองวาง Reflection Beam ไว้เทียบกับ Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Maxและ DeepSeek V4.1 Flashซึ่งเป็นภาพที่ยุติธรรมของระดับที่มันตั้งเป้าไว้: โมเดลเปิดและกึ่งเปิดที่แข็งแกร่งแต่ไม่ถึงระดับแนวหน้า หลายตัวมีขนาดเพียงเศษเสี้ยวของ Beam Beam ไม่ได้เอาชนะกลุ่มนั้นในด้านความสามารถดิบ และเราจะแสดงให้คุณเห็นชัดๆ ว่ามันแพ้ตรงไหน สิ่งที่มันอ้างว่าทำได้คือการไปอยู่ใกล้จุดสูงสุดของกลุ่มนั้นในขณะที่ใช้พลังการประมวลผลสำหรับการอนุมานน้อยกว่า GLM 5.2 ประมาณสามถึงสี่เท่า ณ คะแนนการให้เหตุผลที่เทียบเคียงกัน คำกล่าวอ้างนั้นคือบทความนี้

สิ่งที่ดำรงอยู่จริงในปัจจุบัน

ทุกอย่างในส่วนนี้มาจากเอกสารของ Reflection เอง ซึ่งอ่านเมื่อวันที่ 6 ตุลาคม 2026 API เปิดให้ใช้งานจริงในเวอร์ชันเบต้าผ่านรายการรอ ส่วนน้ำหนักโมเดลยังไม่เปิดเผยออกมา

• รหัสรุ่น — Beam-501B-A23B, สร้างเมื่อ 5 ตุลาคม 2026

• อินเทอร์เฟซ — ส่วนติดต่อที่เข้ากันได้กับ OpenAI อยู่ที่ api.reflection.ai/openai/v1 โดยเปิดให้ใช้ Chat Completions และรายการ Models และไม่มีอย่างอื่นเลย ไม่มี Completions ไม่มี embeddings ไม่มี batches

• บริบท — 256,000 โทเคน พร้อมเชิงอรรถแนบท้ายที่ตัวเลขนั้นเองว่า "หน้าต่างบริบทอาจเปลี่ยนแปลงได้ในช่วงเบต้า" เอาต์พุตสูงสุดคือ 128,000 โทเคน

• การให้เหตุผล — พารามิเตอร์ reasoning_effort ที่มีห้าค่า: low, medium, high, xhigh และ max ค่าเริ่มต้นคือ medium และโมเดลจะให้เหตุผลเสมอไม่ว่าจะตั้งค่าใด — ไม่มีสวิตช์ปิด

• โมดัลลิตี — ข้อความเข้า ข้อความออก ไม่มีอินพุตภาพหรือเสียงตอนเปิดตัว ซึ่งเป็นความแตกต่างอย่างแท้จริงจาก Inkling โมเดลที่ให้ความสำคัญกับมัลติโมดัลลิตีเป็นอันดับแรก ที่ Thinking Machines ของ Mira Murati เปิดตัวเมื่อเดือนกรกฎาคม

• ข้อมูลถึงวันที่ — 30 มิถุนายน 2026

• ราคา — ไม่เปิดเผย โพสต์บล็อกของ Reflection เอกสารประกอบ และรายการโมเดลของมัน ต่างก็ไม่ระบุข้อมูลนี้ และคอนโซลแพลตฟอร์มก็อยู่หลังกำแพงการสมัคร

บรรทัดสุดท้ายนั้นสำคัญกว่าที่เห็น โมเดลอื่นทุกตัวในชุดเปรียบเทียบของ Beam ต่างมีราคาตามรายการที่เปิดเผยต่อสาธารณะซึ่งคุณสามารถใส่ลงในสเปรดชีตได้ตั้งแต่วันนี้ Beam ไม่มี ซึ่งหมายความว่าข้อโต้แย้งเรื่องค่าใช้จ่ายใด ๆ เกี่ยวกับมันในตอนนี้เป็นข้อโต้แย้งเรื่องการประมวลผล ไม่ใช่เรื่องเงินดอลลาร์

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

อัตราส่วน 501 ต่อ 23 คือข้อโต้แย้ง

ความเบาบางไม่ใช่เรื่องใหม่ คำถามคือห้องวิจัยหนึ่งแห่งยอมผลักดันมันไปไกลแค่ไหน GLM 5.2 ทำงานด้วยพารามิเตอร์ที่ใช้งานอยู่ราว 40,000 ล้านตัว จากจำนวนรวมที่รายงานไว้ราว 744,000 ล้านตัว — ประมาณ 5.4 เปอร์เซ็นต์ Reflection Beam อยู่ที่ 4.6 เปอร์เซ็นต์จาก 501,000 ล้านตัว เมื่อดูตามตัวเลขแล้ว นั่นเป็นก้าวต่อไปที่ไม่มากนัก และ Reflection ก็ระมัดระวังในสิ่งที่ตนกล่าวอ้างเกี่ยวกับมัน

ตัวเลขประสิทธิภาพในโพสต์เปิดตัวมาจากกราฟที่สร้างจากข้อมูลของ Artificial Analysis และ DataCurve โดยพลอตคะแนนการให้เหตุผลเทียบกับ FLOPs โดยประมาณของการอนุมาน (inference) ซึ่ง FLOPs ถูกประมาณเป็นสองเท่าของจำนวนพารามิเตอร์ที่ใช้งานจริง คูณกับจำนวนโทเค็นที่สร้างโดยเฉลี่ย สูตรนั้นจงใจไม่รวมการเติมพรอมป์ต์ล่วงหน้า (prompt prefill) ต้นทุนของ attention และโอเวอร์เฮดจากการให้บริการ มันเป็นแบบจำลองคร่าว ๆ ไม่ใช่การวัดจริง และ Reflection ไม่ได้นำเสนอว่ามันเป็นเช่นนั้น — แต่มันก็เป็นหลักฐานเชิงปริมาณเพียงอย่างเดียวที่สนับสนุนข้ออ้าง "ถูกกว่า 3 ถึง 4 เท่าที่คะแนนเท่ากัน" และมันถูกเขียนขึ้นโดยผู้ขายเอง จงมองมันเป็นสมมติฐานที่เมื่อน้ำหนักโมเดลเปิดตัวออกมาแล้ว จะทำให้คนอื่นสามารถทดสอบได้

สิ่งที่สถาปัตยกรรมนี้ให้ในทางปฏิบัติคือโปรไฟล์การให้บริการ พารามิเตอร์ที่ใช้งาน 23 พันล้านตัวเป็นโมเดลที่คุณสามารถรันบน GPU จำนวนค่อนข้างน้อยด้วยความหน่วงระดับโต้ตอบ และนั่นเป็นผลิตภัณฑ์ที่แตกต่างจากโมเดลแบบ dense ขนาด 501 พันล้านพารามิเตอร์ แม้ว่าจำนวนพารามิเตอร์บนการ์ดจะเท่ากันก็ตาม นี่คือเหตุผลที่ Reflection สามารถพูดถึงการให้เหตุผลที่ใกล้เคียงระดับแนวหน้าได้ โดยไม่ต้องพูดถึงการปรับใช้ในระดับศูนย์ข้อมูล

ใช้เวลาไม่ถึงสี่สัปดาห์ในการพรีเทรน และการเปิดเผยข้อมูลก็เจาะจงอย่างผิดปกติ

ส่วนที่ว่าด้วยการฝึกคือส่วนของประกาศที่อ่านแล้วให้ข้อมูลอย่างแท้จริง เพราะ Reflection เผยแพร่ตัวเลขที่ห้องแล็บส่วนใหญ่เก็บไว้ใช้ภายใน

• การฝึกก่อน — 23.8 ล้านล้านโทเค็นบนชิป GB300 จำนวน 6,144 ตัวในแร็ค NVL72 เสร็จสิ้นในเวลาไม่ถึงสี่สัปดาห์ด้วยอัตรา goodput ที่รายงานว่า 92.3 เปอร์เซ็นต์ โดยมีการย้อนกลับไปยังเช็คพอยต์เก้าครั้งระหว่างทาง

• การเรียนรู้แบบเสริมกำลัง — ชิป GB300 จำนวน 10,500 ตัว เป็นเวลา 4 สัปดาห์, การ rollout มากกว่า 100 ล้านครั้ง, บริบทของ rollout สูงสุด 256,000 โทเค็น, แซนด์บ็อกซ์ราว 1.3 พันล้านแห่ง และสภาพแวดล้อมที่แตกต่างกันประมาณหนึ่งล้านแห่ง โดยมี rollout ทำงานพร้อมกันโดยเฉลี่ย 110,000 ครั้ง

• การฝึกกลางทาง — ขยายบริบทที่มีประสิทธิภาพของโมเดลไปเป็น 1 ล้านโทเคน

• ความเสถียร — เกรเดียนต์นโยบายแบบอะซิงโครนัสที่ยังคงเสถียรแม้มีความล้าสมัยในระดับวัน พร้อมการลงโทษความยาวที่ควบคุมได้ เพื่อให้สามารถปรับความยาวของการให้เหตุผลได้โดยไม่ต้องฝึกโมเดลใหม่

เมื่ออ่านบรรทัด pre-training กับ RL ควบคู่กัน โครงร่างของข้อกล่าวอ้างก็ปรากฏขึ้น เรื่องราวด้านประสิทธิภาพไม่ได้เกี่ยวกับเฉพาะพารามิเตอร์ที่ทำงานอยู่ ณ เวลาอินเฟอเรนซ์เท่านั้น แต่ยังเกี่ยวกับความเร็วในการฝึกโมเดล และสัดส่วนของคอมพิวต์ที่ไปลงกับ RL ซึ่งผูกกับสภาพแวดล้อม แทนที่จะไปกับโทเคนเพิ่มเติม สภาพแวดล้อมหนึ่งล้านแห่งและแซนด์บ็อกซ์ 1.3 พันล้านแห่งเป็นข้อความเกี่ยวกับโครงสร้างพื้นฐานสำหรับการฝึกใช้เครื่องมือและเอเจนต์ และสอดคล้องกับเบนช์มาร์กที่ Reflection เลือกนำเสนอเป็นจุดเด่น

ตัวเลขหนึ่งตัวควรค่าแก่การติดธงไว้ บล็อกกล่าวว่าการฝึกช่วงกลาง (midtraining) ขยายบริบทที่มีประสิทธิผลไปถึง 1 ล้านโทเคน; เอกสารประกอบ API ระบุขีดจำกัดการให้บริการที่ 256,000 โทเคน พร้อมเชิงอรรถแบบเบต้าแนบมาด้วย สิ่งเหล่านั้นเป็นความสามารถฝั่งการฝึกและขีดจำกัดฝั่งการให้บริการ ไม่ใช่ข้อขัดแย้ง — แต่ช่องว่างนี้ก็เป็นสิ่งที่กลายเป็นพาดหัว "บริบท 1M" ได้พอดี ถ้าไม่มีใครอ่านเอกสารฉบับที่สอง และใครก็ตามที่เขียนเกี่ยวกับ Beam ในสัปดาห์หน้าควรอ่านเอกสารฉบับที่สอง

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

เบนช์มาร์ก: จุดที่ Reflection Beam ชนะ และจุดที่ไม่ได้ชนะ

ตัวเลขทุกตัวด้านล่างเป็นข้อมูลที่ผู้ขายรายงานเอง จากตารางในโพสต์เปิดตัวของ Reflection และไม่มีส่วนใดถูกทำซ้ำอย่างเป็นอิสระ คอลัมน์เปรียบเทียบเป็นตัวเลขชุดเดียวกับที่ Reflection เผยแพร่สำหรับโมเดลอื่น ๆ โดยเมื่อเซลล์ใดแสดง "NR" ในต้นฉบับ หมายความว่าโมเดลนั้นไม่ได้ถูกรัน ไม่มีแถวของ Artificial Analysis สำหรับ Beam ดังนั้นจึงไม่มีสิ่งใดที่นี่ผ่านฮาร์เนสของบุคคลที่สาม

การเขียนโค้ดแบบเอเจนติก

• Terminal-Bench v2.1 — Beam 80.1 เทียบกับ GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen3.8 Max 86.6, DeepSeek V4.1 Flash 90.6, Inkling 63.8, Nemotron 3 Ultra 56.4

• SWE-Bench Pro v1 — Beam 65.5 เทียบกับ Qwen3.8 Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4.

• SWE-Bench Pro v2-Hard — Beam 77.2 เทียบกับ Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9

• SWE-Bench Verified — Beam 80.9 เทียบกับ Inkling 77.6, Nemotron 3 Ultra 70.7

• SWE-Bench Multilingual — Beam 78.0 เทียบกับ Nemotron 3 Ultra 67.7

• DeepSWE v1.1 — Beam 44.4 เทียบกับ DeepSeek V4.1 Flash 74.2, Kimi K3 68.0, GLM 5.3 61.0, Qwen3.8 Max 51.0, GLM 5.2 44.0

• SWE Atlas Codebase QnA — Beam 34.6 กับ Kimi K3 68.0, GLM 5.3 61.0

แถวสุดท้ายนั่นแหละคือแถวที่ควรหยุดคิดให้ดี การตอบคำถามเกี่ยวกับรีพอซิทอรีในระยะยาวเป็นสถานการณ์ที่โมเดลต้องถือฐานโค้ดไว้ในหัวตลอดการโต้ตอบที่ยาวนาน และ 34.6 เทียบกับ 68.0 ไม่ใช่ความต่างแบบปัดเศษทิ้ง DeepSWE ก็เล่าเรื่องคล้ายกัน: 44.4 ทำให้ Beam อยู่ในระดับเดียวกับ GLM 5.2 และตามหลัง DeepSeek V4.1 Flash อยู่ไกล

การให้เหตุผล

• AIME 2026 — Beam 97.8 เทียบกับ GLM 5.2 99.2, Inkling 97.1

• HLE, ไม่ใช้เครื่องมือ — Beam 36.2 เทียบกับ Kimi K3 46.9, Qwen3.8 Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7

• GPQA Diamond — Beam 90.5 เทียบกับ Kimi K3 93.5, Qwen3.8 Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9, Inkling 87.2, Nemotron 3 Ultra 87

• SciCode — Beam 49.7 เทียบกับ GLM 5.3 59.0, Kimi K3 58.7, Qwen3.8 Max 52.1, DeepSeek V4.1 Flash 52.0, Inkling 46.1, Nemotron 3 Ultra 44.6

• CriPT AA — Beam 16.3 เทียบกับ Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

โปรไฟล์การให้เหตุผลของ Beam อยู่กลาง ๆ ของกลุ่ม และรูปแบบก็คงเส้นคงวา: นำหน้าสองโมเดลจากรุ่นก่อนหน้าในรายการของ Reflection อย่างสบาย ๆ แต่ตามหลังโมเดลรุ่นปัจจุบัน GPQA Diamond ที่ 90.5 เป็นคะแนนที่แข็งแกร่ง ซึ่งมีอีกสี่โมเดลที่ทำได้ดีกว่า

• MCP Atlas — Beam 78.7 เทียบกับ Qwen3.8 Max 84.5, GLM 5.3 84.2, Kimi K3 82.3, GLM 5.2 77.8, Inkling 76.0, Nemotron 3 Ultra 63.1.

• AutomationBench ชุดสาธารณะ — Beam 37.0 เทียบกับ DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2

• tau3 banking — Beam 38.0 เทียบกับ Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6

• BrowseComp ด้วยการจัดการบริบท — Beam 77.4 เทียบกับ Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4

• DeepSearchQA ด้วยการจัดการบริบท — Beam 80.1 เทียบกับ Kimi K3 95.0

Reflection ยังได้นำเสนอการสาธิตความสามารถสองรายการในโพสต์ ได้แก่ อัตราการแก้ปริศนา "Land or Water" ที่ 95.5 เปอร์เซ็นต์ ซึ่งเป็นตารางขนาด 180×90 ที่มี 16,200 จุด และต้องรักษาสถานะกระดานขนาดใหญ่ไว้ — เป็นตัวเลขที่อยู่ระหว่าง 92.5 และ 97.8 เปอร์เซ็นต์ที่ Reflection ระบุว่าเป็นผลของ Opus 5 และ Fable 5 ในงานเดียวกัน — และการปรับจูน Text2SQL ของ Gemma-4 ขนาดเล็กที่สุด ซึ่งทำให้ความแม่นยำบนชุดที่กันไว้เพิ่มขึ้นเป็น 66.5 เปอร์เซ็นต์ การสาธิตเหล่านี้ผ่านการคัดเลือกมาแล้ว มันแสดงให้เห็นว่าโมเดลทำสิ่งหนึ่งได้ ไม่ได้แสดงว่าทำได้บ่อยเพียงใด

สิ่งที่คุณทำได้กับมันในวันนี้ และสิ่งที่คุณไม่ควรวางแผนโดยพึ่งพามัน

วันนี้ โดยทั่วไปแล้วมีเพียงสิ่งเดียวเท่านั้นที่ทำได้จริง: ขอสิทธิ์เข้าถึงเวอร์ชันเบต้า และเรียกใช้ Beam-501B-A23B ผ่านเอนด์พอยต์ของ Reflection เองด้วยไคลเอนต์ที่อยู่ในรูปแบบ OpenAI ไม่มีราคาเผยแพร่ ดังนั้นจึงไม่มีวิธีสร้างแบบจำลองต้นทุนของเวิร์กโหลดบนมันได้ ไม่มีเวต ดังนั้นจึงไม่มีการโฮสต์เอง ไม่มีการควอนไทซ์ ไม่มีการไฟน์จูน และไม่มีความสามารถในการทำซ้ำโดยบุคคลที่สาม ไม่มีแถวเบนช์มาร์กที่เป็นอิสระ ดังนั้นภาพประสิทธิภาพทั้งหมดข้างต้นจึงตั้งอยู่บนตารางของห้องแล็บเพียงแห่งเดียว

Reflection Beam ไม่ใช่หนึ่งในเส้นทางของเรา เราจะไม่พูดเป็นนัยเป็นอื่น และเราจะไม่ชี้ให้คุณไปหาตัวแทนจำหน่ายที่อาจมีมัน สิ่งที่เราบอกคุณได้คือราคาของกลุ่มโมเดลที่นำมาเปรียบเทียบ เพราะเรามีเส้นทางให้บริการอยู่สี่ในโมเดลเหล่านั้น และตัวเลขด้านล่างนี้ดึงสด ๆ จากแคตตาล็อกของเราเมื่อเช้านี้: GLM 5.2 ราคา $1.40 ขาเข้า และ $4.40 ขาออก ต่อล้านโทเคน, GLM 5.3 ที่ $1.26 และ $3.96, Qwen3.8 Max ที่ $2.00 และ $6.00 และ DeepSeek V4.1 Flash ที่ $0.15 และ $0.60 นี่คือส่วนต่างที่เห็นได้จริง — DeepSeek V4.1 Flash ถูกกว่า GLM 5.2 เกือบสิบเท่าในด้านขาเข้า — และนั่นคือเหตุผลที่โมเดลเบต้าซึ่งไม่มีราคานั้นยากที่จะหยิบมาใส่ในกระบวนการตัดสินใจ OrcaRouter ใช้คีย์เดียวที่เข้ากันได้กับ OpenAI ใช้ได้กับทั้งโมเดลเหล่านั้นและโมเดลอื่นอีกกว่า 200 โมเดล โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านไปโดยไม่มีการบวกเพิ่ม ซึ่งหมายความว่าการเปลี่ยนแปลงราคาจากผู้ขายจะมีผลทางฝั่งเราภายในวันเดียวกัน แทนที่จะรอให้ตัวแทนจำหน่ายรีเฟรชเมื่อไหร่ก็ได้ และเนื่องจากการสลับสำรองอัตโนมัติเป็นส่วนหนึ่งของการกำหนดเส้นทาง ไม่ใช่สิ่งที่คุณต้องสร้างขึ้นเอง โมเดลใหม่ที่ยังไม่ผ่านการพิสูจน์จึงเป็นสิ่งที่คุณสามารถให้รับทราฟฟิกเพียงบางส่วนได้ แทนที่จะวางไว้บนเส้นทางวิกฤตของคุณ — ซึ่งเป็นวิธีเดียวที่รับผิดชอบได้ในการใช้สิ่งที่ยังไม่มีใครจำลองผลการวัดประสิทธิภาพซ้ำได้

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

สิ่งที่ควรจับตาก่อนจะเชื่อคำกล่าวอ้างเรื่องประสิทธิภาพอย่างจริงจัง

สามสิ่งจะไขข้อข้องใจนี้ และสองในนั้นได้รับการสัญญาว่าจะเกิดขึ้นภายในเดือนนี้

สิ่งแรกคือน้ำหนักโมเดล Apache 2.0 และรายงานทางเทคนิคจะทำให้ใครก็ตามที่มีโหนดสักสองสามโหนดสามารถวัดสิ่งที่สำคัญจริง ๆ ได้ — โทเคนต่อวินาทีต่อ GPU ที่ระดับคุณภาพที่กำหนดไว้ และวัดว่า 23 พันล้านพารามิเตอร์ที่ใช้งานอยู่ให้คะแนนต่อ FLOP ได้จริงอย่างที่กราฟบอกเป็นนัยหรือไม่ จนกว่าจะถึงตอนนั้น ข้อโต้แย้งเรื่องประสิทธิภาพก็เป็นแค่การคำนวณบนเศษกระดาษ

ข้อที่สองคือราคา โมเดลที่ไม่มีราคาที่ประกาศไว้ไม่มีที่ยืนในการเปรียบเทียบต้นทุน และถ้า Beam อยู่ในระดับสูงกว่า GLM กับ DeepSeek เรื่องพลังประมวลผลก็จะไม่สำคัญอีกต่อไปสำหรับใครก็ตามที่มีงบประมาณ ถ้ามันอยู่ต่ำกว่า ภาพก็จะเปลี่ยนไปอย่างรวดเร็ว

ประการที่สามคือบุคคลที่สามที่รันชุดทดสอบนี้ ตัวเลขทุกตัวข้างต้นมาจากเอกสารเดียวกัน และตารางที่ผู้ขายรายงานเองซึ่งจัดให้โมเดลของตัวเองอยู่ตามหลังในเจ็ดจากสิบหกแถวก็เป็นสัญญาณที่ดีเกี่ยวกับความซื่อสัตย์ของห้องแล็บ — แต่มันก็ยังเป็นห้องแล็บเดียว ฮาร์เนสเดียว ชุดพรอมต์เดียว

ถ้าคุณต้องการเอเจนต์เขียนโค้ดที่มีความสามารถในวันนี้ และจำเป็นต้องรู้ว่ามันมีค่าใช้จ่ายเท่าไร คำตอบยังไม่ใช่ Reflection Beam มันอาจจะเป็นเช่นนั้นในอีกสามสัปดาห์ โมเดลที่คำกล่าวอ้างเรื่องประสิทธิภาพคุ้มค่าที่จะเดิมพันด้วย คือโมเดลที่คุณดาวน์โหลดน้ำหนักของมันได้ และนับ FLOPs ได้ด้วยตัวเอง — และในการทดสอบนั้น Reflection ให้วันที่กับเรา ไม่ใช่โมเดล

การเปรียบเทียบในบทความนี้4

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube