การ์ดฮีโร่ที่สร้างขึ้นสำหรับบทความ 'Reflection Beam เปิดตัว API ในเวอร์ชันเบต้า และน้ำหนักโมเดลยังต้องรออีกสองสัปดาห์' โดยมีชื่อเรื่องว่า 'Reflection Beam' คำโปรยว่า 'API เวอร์ชันเบต้า และน้ำหนักโมเดลที่ยังไม่ออกมา' และชิปสามอันที่อ่านว่า '501B ทั้งหมด / 23B ใช้งานอยู่' 'บริบทเบต้า 256K' และ 'ยังไม่ประกาศราคา'
Guides & Insights

Reflection Beam เปิดตัว API เวอร์ชันเบต้า ส่วนเวทอีกสองสัปดาห์กว่าจะพร้อม

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

โมเดลแรกของ Reflection มีชื่อว่า Reflection Beam และสิ่งที่ชวนให้สนใจเกี่ยวกับมันในเช้านี้ไม่ใช่การที่มันมีอยู่ — แต่เป็นการที่มีเพียงครึ่งเดียวของมันเท่านั้น บริษัทประกาศเปิดตัว Beam เมื่อวันที่ 5 ตุลาคม 2026 ในฐานะโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์รวม 501 พันล้านตัว และมีพารามิเตอร์ที่ทำงานต่อโทเคน 23 พันล้านตัว พร้อมทั้งเปิดให้เข้าถึงผ่าน endpoint แบบเบต้าที่เข้ากันได้กับ OpenAI ในวันเดียวกัน น้ำหนักโมเดลถูกสัญญาว่าจะเปิดให้ใช้ในช่วงปลายเดือนนี้ภายใต้ Apache 2.0 พร้อมกับรายงานทางเทคนิค การ์ดโมเดล และสแต็กการให้บริการ จนกว่าสิ่งเหล่านั้นจะเปิดให้ใช้งาน คนกลุ่มเดียวที่สามารถรัน Beam-501B-A23B ได้คือผู้ที่ Reflection มอบคีย์รายการรอให้ และตัวเลขประสิทธิภาพทุกตัวที่เผยแพร่อยู่ในขณะนี้ล้วนมาจากตารางของห้องแล็บเดียวเท่านั้น

นั่นเป็นจุดที่แปลกสำหรับการเปิดตัวที่จะหยุดอยู่แค่นั้น และมันคุ้มค่าที่จะพูดให้ชัดเจนว่าเรามีอยู่ครึ่งไหน Reflection ได้ปล่อยพรีวิวที่คุณสมัครได้แล้ว และชุดตาราง benchmark ที่ยังไม่มีใครทำซ้ำได้ แต่ยังไม่ได้ปล่อยสิ่งที่คำว่า "open-weight" ในพาดหัวข่าวหมายถึง

เช้านี้มีอะไรที่ถ่ายทอดสดจริง ๆ บ้าง

ทุกอย่างในส่วนนี้มาจากโพสต์บล็อกและเอกสารของ Reflection เอง ซึ่งอ่านเมื่อวันที่ 6 ตุลาคม 2026

• ID ของโมเดล — Beam-501B-A23B สร้างเมื่อวันที่ 5 ตุลาคม 2026 ให้บริการที่ api.reflection.ai/openai/v1 ด้วย Chat Completions และรายการ Models เท่านั้น

• รูปร่าง — พารามิเตอร์ทั้งหมด 501 พันล้านตัว ทำงานอยู่ 23 พันล้านตัวต่อโทเคน คิดเป็นอัตราการเปิดใช้งานประมาณ 4.6 เปอร์เซ็นต์ เมื่อเทียบเป็นสเกลแล้ว GLM 5.2 อยู่ที่ประมาณ 5.4 เปอร์เซ็นต์

• บริบท — 256,000 โทเค็นบน API โดยมีเชิงอรรถแนบอยู่กับตัวเลขนั้นเองเพื่อเตือนว่าหน้าต่างนี้อาจเปลี่ยนแปลงได้ในช่วงเบตา เอาต์พุตสูงสุดคือ 128,000 โทเค็น

• การให้เหตุผล — พารามิเตอร์ reasoning_effort ที่มีห้าค่า ได้แก่ low, medium, high, xhigh และ max โดย medium เป็นค่าเริ่มต้น และโมเดลจะให้เหตุผลเสมอ ไม่มีสวิตช์ปิดและไม่มีโหมดที่ไม่ใช้การให้เหตุผล

• รูปแบบการรับส่งข้อมูล — ข้อความเข้า ข้อความออก ไม่มีการรับข้อมูลภาพ เสียง หรือวิดีโอในเวอร์ชันเปิดตัว

• ราคา — ไม่ได้เปิดเผย โพสต์บล็อกไม่ได้ระบุไว้ เอกสารก็ไม่ได้ระบุไว้ และคอนโซลของแพลตฟอร์มอยู่หลังกำแพงการสมัครสมาชิก

• การเข้าถึง — เป็นรายชื่อรอ ไม่มีช่องทางบริการตนเอง และไม่มีน้ำหนักโมเดล ดังนั้นจึงไม่มีการดาวน์โหลด ไม่มีการควอนไทซ์ และไม่มีการปรับละเอียด (fine-tune)

บรรทัดราคาคือบรรทัดที่เปลี่ยนวิธีที่คุณอ่านทุกอย่างที่เหลือ สี่ในเจ็ดโมเดลที่ Beam ถูกนำมาเปรียบเทียบด้วยในตารางของ Reflection เองนั้นมีราคาตามรายการที่เปิดเผยต่อสาธารณะซึ่งคุณใส่ลงในสเปรดชีตได้วันนี้ ส่วน Beam ไม่มี ดังนั้นข้ออ้างเรื่องค่าใช้จ่ายใด ๆ เกี่ยวกับมันในตอนนี้จึงเป็นข้ออ้างเรื่องการประมวลผล ไม่ใช่เรื่องจำนวนดอลลาร์

A screenshot of the coding and agentic table in Reflection's Beam launch post, captured 6 October 2026, showing the header 'The below figure shows Beam's performance across a range of coding, agentic, reasoning, and STEM benchmarks. NR denotes scores that have not been reported.' and Beam's own column of rows — DeepSWE v1.1 44.4, SWE-Bench Pro v2-Hard 77.2, SWE-Bench Pro v1 65.5, Terminal-Bench v2.1 80.1, SWE Atlas Codebase QnA 34.6, SWE-Bench Multilingual 78.0 and SWE-Bench Verified 80.9 — beside the comparison columns for Inkling and Nemotron 3 Ultra.

ตัวเลขที่การเปิดตัวต้องขึ้นอยู่กับ

จุดขายของ Reflection คือประสิทธิภาพในการอนุมาน และมันระบุเจาะจงอย่างไม่ธรรมดาว่าหมายถึงอะไร: บนเกณฑ์มาตรฐานการให้เหตุผลขั้นสูง Beam ทำคะแนนได้เทียบเท่า GLM 5.2 โดยใช้พลังประมวลผลสำหรับการอนุมานน้อยกว่า 3 ถึง 4 เท่า มีการอธิบายว่าผลประโยชน์ที่ได้ยังมากกว่านั้นเมื่อเทียบกับโมเดลในตระกูลที่มีพารามิเตอร์ 2 ล้านล้าน ซึ่ง Qwen 3.8-Max อยู่ในกลุ่มนั้น

แผนภูมิที่อยู่เบื้องหลังข้อกล่าวอ้างนั้นคุ้มค่าที่จะอ่านอย่างละเอียด เพราะมันเป็นหลักฐานชิ้นสำคัญที่แบกรับเนื้อหาทั้งหมดของโพสต์นี้ แผนภูมินี้พล็อตคะแนนการให้เหตุผลเทียบกับปริมาณ FLOPs โดยประมาณสำหรับการอนุมาน (inference) ทั่วทั้ง DeepSWE, Humanity's Last Exam และ Terminal-Bench 2.1 และมันประมาณค่า FLOPs ไว้ที่ราว ๆ สองเท่าของจำนวนพารามิเตอร์ที่ใช้งานจริง คูณกับจำนวนโทเค็นที่สร้างโดยเฉลี่ยต่อการลองหนึ่งครั้ง สูตรนั้นจงใจไม่นับรวมการประมวลผลพรอมต์ล่วงหน้า (prompt prefill) การดำเนินการ attention ที่ขึ้นกับบริบท และภาระค่าใช้จ่ายส่วนเกินในการให้บริการ — Reflection ระบุไว้เช่นนั้นในคำอธิบายภาพ มันเป็นการเปรียบเทียบระหว่างโมเดลอย่างสม่ำเสมอ มากกว่าจะเป็นการวัดบิลของใครคนใดคนหนึ่ง และยังเป็นหลักฐานเชิงปริมาณเพียงชิ้นเดียวที่สนับสนุนข้อกล่าวอ้างเรื่องประสิทธิภาพ ซึ่งเขียนขึ้นโดยห้องแล็บที่สร้างโมเดลนี้ จงมองมันเป็นสมมติฐานที่เวต (weights) จะเปิดทางให้คนอื่นนำไปทดสอบได้

สิ่งที่สถาปัตยกรรมนี้ให้ในทางปฏิบัติคือโปรไฟล์การให้บริการ พารามิเตอร์ที่ทำงานอยู่ 2.3 หมื่นล้านตัวเป็นโมเดลที่คุณสามารถรันได้อย่างสมเหตุสมผลบน GPU จำนวนค่อนข้างน้อยที่ความหน่วงระดับโต้ตอบ ซึ่งเป็นผลิตภัณฑ์ที่ต่างจากโมเดล dense ที่มีพารามิเตอร์ 5.01 แสนล้านตัว แม้ว่าตัวเลขบนการ์ดจะเท่ากันก็ตาม นั่นคือเหตุผลที่ Reflection พูดถึงการให้เหตุผลระดับใกล้ฟรอนเทียร์ได้โดยไม่ต้องพูดถึงการปรับใช้ระดับศูนย์ข้อมูล และเป็นเหตุผลว่าทำไมการปล่อยเวตในที่สุดจึงเป็นเหตุการณ์ที่สำคัญกว่าคีย์เบต้า

จุดที่ Beam ไปอยู่บนตารางของ Reflection เอง

ตัวเลขทุกตัวด้านล่างเป็นข้อมูลที่ผู้ขายรายงานเอง จากตารางในโพสต์เปิดตัวของ Reflection และไม่มีตัวเลขใดถูกทำซ้ำโดยอิสระเลย ในกรณีที่ Reflection ไม่ได้เผยแพร่ตัวเลขสำหรับโมเดลใด เซลล์ดังกล่าวจะเป็น NR ในต้นฉบับ คอลัมน์เปรียบเทียบเป็นของ Reflection ไม่ใช่ของเรา และไม่ใช่ของบุคคลที่สาม

การเขียนโค้ดและงานเทอร์มินัล

• Terminal-Bench v2.1 — Reflection Beam 80.1 เมื่อเทียบกับ GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen 3.8-Max 86.6 และ DeepSeek V4.1 Flash 90.6 โดย Beam อยู่ในอันดับต่ำกว่าพวกมันทั้งหมด

• SWE-Bench Verified — Reflection Beam 80.9 เมื่อเทียบกับ Inkling 77.6 และ Nemotron 3 Ultra 70.7 นี่คือจุดที่ Beam ดูแข็งแกร่งที่สุด แต่โปรดทราบว่ามีเพียงสองโมเดลที่อ่อนแอที่สุดในรายการเท่านั้นที่ถูกนำมาทดสอบบนชุดทดสอบนี้

• SWE-Bench Pro v1 — Reflection Beam 65.5 เทียบกับ Qwen 3.8-Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4

• SWE-Bench v2-Hard — Reflection 77.2 เทียบกับ Kim K3 88.2, GLM 5.3 84.3, Inkling 56.2 ห่างจากจุดสูงสุดของตารางอยู่สิบจุด

• DeepSWE v1.1 — Reflection Beam 44.4 เทียบกับ DeepSeek V4.1 Flash 74.2, Kimi K3 68.0, GLM 5.3 61.0, Qwen 3.8-Max 51.0, GLM 5.2 44.0 โดย Beam อยู่ในระดับเดียวกับรุ่นก่อนหน้า และตามหลังผู้นำอยู่สามสิบพอยต์

• SWE Atlas Codebase QnA — Reflection Beam 34.6 เทียบกับ Kimi K3 68.0 และ GLM 5.3 61.0 การจดจำรีโพซิทอรีขนาดใหญ่ไว้ในใจตลอดการโต้ตอบที่ยาวนานเป็นสิ่งที่ยากที่สุดในรายการนี้ และ 34.6 ของ Beam ไม่ใช่ความต่างเพียงเล็กน้อยที่ปัดเศษทิ้งได้

การใช้เหตุผลและวิทยาศาสตร์

• AIME 2026 — Reflection Beam 97.8 เทียบกับ GLM 5.2 99.2 และ Inkling 97.1

• HLE โดยไม่ใช้เครื่องมือ — Reflection Beam 36.2 เทียบกับ Kimi K3 46.9, Qwen 3.8-Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7 อยู่กลางตาราง และนำหน้าเพียงสองโมเดลรุ่นก่อนหน้าเท่านั้น

• GPQA Diamond — Reflection Beam 90.5 เทียบกับ Kimi K3 93.5, Qwen 3.8-Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9

• SciCode — Reflection Beam 49.7 เทียบกับ GLM 5.3 59.0, Kimi K3 58.7, Qwen 3.8-Max 52.1, DeepSeek V4.1 Flash 52.0

• CriPT AA — Reflection Beam 16.3 เมื่อเทียบกับ Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

เครื่องมือ การค้นหา และบริบทแบบยาว

• MCP Beam 78.7 Qwen 3.8-Max 84.5, GLM 5.3 84.2, K3 82.3, GLM 5.2 77.8

• AutomationBench, ชุดข้อมูลสาธารณะ — Reflection Beam 37.0 เทียบกับ DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen 3.8-Max 39.8, GLM 5.2 26.2

• tau3 banking — Reflection Beam 38.0 เมื่อเทียบกับ Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1

• BrowseComp พร้อมการจัดการบริบท — Reflection Beam 77.4 เทียบกับ Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4

• DeepSearchQA ด้วยการจัดการบริบท — Reflection Beam 80.1 เทียบกับ Kimi K3 95.0

• AA-LCR — Reflection Beam 79.3 เมื่อเทียบกับ Kimi K3 88.7, DeepSeek V4.1 Flash 84.0, Qwen 3.8-Max 80.3, GLM 5.3 79.7, Nemotron 3 Ultra 79.3, GLM 5.2 78.3, Inkling 77.3 การเรียกคืนบริบทยาวเป็นแถวความสามารถทั่วไปเพียงแถวเดียวที่ Beam แข่งขันได้จริง ๆ ไม่ใช่แค่ระดับกลาง ๆ

อ่านตารางทั้งสี่ควบคู่กัน แล้วรูปแบบที่สอดคล้องกันก็ปรากฏขึ้น: บนลิสต์ของ Reflection นั้น Beam เอาชนะโมเดลสองรุ่นก่อนหน้า และแพ้โมเดลรุ่นปัจจุบัน เกือบทุกแถว ด้วยช่องว่างที่ตั้งแต่เล็กน้อยไปจนถึงระดับที่ทำให้หมดสิทธิ์ การที่ผู้ขายเผยแพร่ตารางที่ทำให้โมเดลของตัวเองตามหลังในหลายแถวขนาดนั้นเป็นสัญญาณที่ดีเกี่ยวกับความซื่อสัตย์ของห้องแล็บ แต่มันไม่ใช่สัญญาณว่าโมเดลนี้อยู่ในระดับแนวหน้า

A screenshot of the efficiency section of Reflection's Beam launch post, captured 6 October 2026, showing the sentence 'On advanced reasoning benchmarks, it achieves scores comparable to GLM-5.2 while using 3-4x less inference compute.', the note that gains are more pronounced against 2T+ parameter models like Qwen 3.8-Max, the claim that the results mean 'more intelligence per token', and a score-versus-estimated-FLOPs chart plotting DeepSWE, HLE (text only) and Terminal-Bench 2.1 across reasoning-effort settings.

เสียงอิสระเพียงหนึ่งเดียวจนถึงตอนนี้ และสิ่งที่มันไม่ได้พูด

การประเมินจากบุคคลที่สามเพียงรายเดียวที่มีการบันทึกไว้คือ Artificial Analysis ซึ่งกล่าวเมื่อวันที่ 5 ตุลาคมว่า Reflection ได้ให้สิทธิ์เข้าถึงแก่ตน และตนกำลังทำการวัดประสิทธิภาพ Beam อย่างอิสระ พร้อมเสริมว่าตัวชี้วัดเบื้องต้นบ่งชี้ว่า Beam จะเป็นหนึ่งในโมเดลเปิดที่ใช้โทเคนอย่างมีประสิทธิภาพมากที่สุดเท่าที่ตนเคยเห็นสำหรับระดับสติปัญญาของมัน

นั่นเป็นถ้อยแถลงที่มีนัยสำคัญจากองค์กรที่ดัชนีขององค์กรนั้นเป็นดัชนีที่ผู้ซื้อส่วนใหญ่อ่านกันจริง และยังเป็นถ้อยแถลงที่ไม่มีตัวเลขอยู่ในนั้นด้วย เมื่อเช้านี้ ยังไม่มีแถวของ Beam บนตารางอันดับของ Artificial Analysis — หน้าเพจของโมเดลตอบกลับ 404 และเพย์โหลดของตารางอันดับไม่มีรายการ Beam — ดังนั้น ข้ออ้างเรื่องประสิทธิภาพเชิงโทเคนจึงเป็นเพียงคำสัญญาจากบุคคลที่สามว่าจะเผยแพร่บางสิ่งบางอย่างในตอนนี้ ยังไม่มีสิ่งใดในดัชนีที่ถูกคำนวณใหม่บน Beam

การเปิดเผยข้อมูลการฝึกอบรม ซึ่งเป็นส่วนที่แข็งแกร่งที่สุดของการเปิดตัว

ส่วนวิศวกรรมในโพสต์ของ Reflection มีตัวเลขที่ห้องแล็บส่วนใหญ่เก็บไว้ภายใน และตัวเลขเหล่านั้นก็ควรค่าแก่การบันทึกไว้ เพราะเป็นส่วนหนึ่งของการเปิดตัวที่จะยังน่าสนใจอยู่แม้เวลาผ่านไปหนึ่งเดือน

การฝึกโมเดลล่วงหน้า (Pre-training) — โทเค็นที่คัดสรรแล้ว 23.8 ล้านล้านโทเค็น บนชิป NVIDIA GB300 จำนวน 6,144 ตัว ในแร็ก NVL72 เสร็จสิ้นแบบครบวงจรภายในเวลาไม่ถึงสี่สัปดาห์ ด้วยอัตรา goodput ที่รายงานไว้ร้อยละ 92.3 พร้อมการย้อนกลับแบบกึ่งอัตโนมัติเก้าครั้งระหว่างทาง ซึ่งเกิดจากสไปก์ของบรรทัดฐานเกรเดียนต์ (gradient-norm spikes) หรือความเสียหายของข้อมูลแบบเงียบ (silent data corruption) ที่ต้องสงสัย

• การเรียนรู้แบบเสริมกำลัง — ชิป GB300 จำนวน 10,500 ตัว เป็นเวลาสี่สัปดาห์, การโรลเอาต์มากกว่า 100 ล้านครั้ง, บริบทการโรลเอาต์สูงสุด 256,000 โทเค็น, แซนด์บ็อกซ์ราว 1.3 พันล้านแห่ง และสภาพแวดล้อมที่แตกต่างกันประมาณหนึ่งล้านแห่งซึ่งรวบรวมมาเพื่องานด้านการเขียนโค้ด งานแบบเอเจนติก และงาน STEM

• การให้บริการ — ค่าน้ำหนักใหม่ไปถึงฟลีตสำหรับการอนุมานโดยใช้เวลามัธยฐานประมาณ 12 วินาที โดยการกระจายแบบลำดับชั้นช่วยลดทราฟฟิกข้ามแร็กได้ 75 เปอร์เซ็นต์ และทำให้การนำไปใช้ทั่วทั้งฟลีตเร็วขึ้น 2.2 เท่า เมื่อเทียบกับการที่ทุกรีพลิกาดึงค่าน้ำหนักด้วยตัวเอง

• ความเสถียร — พอลิซีเกรเดียนต์แบบอะซิงโครนัสเต็มรูปแบบที่คงความเสถียรเชิงตัวเลขเมื่อเรียนรู้จากปฏิสัมพันธ์ที่เก่าไปหนึ่งวัน พร้อมบทลงโทษความยาวที่ควบคุมได้สำหรับแลกความยาวในการให้เหตุผลกับคะแนนโดยไม่ต้องฝึกใหม่

• ข้อมูล — ประมาณ 95 เปอร์เซ็นต์ของโทเคนดิบจากอินเทอร์เน็ตถูกกำจัดไปผ่านการแยกวิเคราะห์ การขจัดข้อมูลซ้ำ และการกลั่นกรอง โดยอ้างว่าตัวกรองทั่วไปน่าจะพลาดโทเคนราว 1.8 ล้านล้านรายการที่ Reflection เก็บไว้ รวมถึง 87 เปอร์เซ็นต์ของโทเคนเว็บโค้ดที่กลั่นกรองแล้วของมัน

สองบรรทัดนี้ควรถูกตั้งข้อสังเกต โพสต์ระบุว่า midtraining ขยาย effective context ของ Beam ไปถึง 1 ล้านโทเคน ขณะที่เอกสาร API ระบุขีดจำกัดการให้บริการที่ 256,000 โทเคน พร้อมเชิงอรรถว่าเป็น beta สิ่งเหล่านี้เป็นความสามารถฝั่งการฝึกและขีดจำกัดฝั่งการให้บริการ มากกว่าจะเป็นความขัดแย้งกัน แต่ช่องว่างนี้เองคือสิ่งที่กลายเป็นพาดหัว "1M context" ได้พอดี หากไม่มีใครอ่านเอกสารฉบับที่สอง และตัวเลข RL ที่มากกว่า 100 ล้าน rollouts ถูกนำเสนอว่าเป็นหนึ่งในการรันลักษณะนี้ที่ใหญ่ที่สุดโดยแล็บเปิดใด ๆ ซึ่งเป็นข้อกล่าวอ้างเกี่ยวกับขนาด ไม่ใช่เกี่ยวกับว่าขนาดนั้นซื้ออะไรได้ — กราฟคะแนนเทียบกับ rollouts เป็นของผู้ขายเอง และหยุดตรงจุดที่ผู้ขายหยุดพล็อตมัน

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

สิ่งที่คุณทำได้กับ Reflection Beam วันนี้

มีเรื่องหนึ่ง: ลงชื่อในรายการรอ และถ้าคุณได้คีย์ ให้เรียกใช้ Beam-501B-A23B ผ่านเอนด์พอยต์ของ Reflection เองด้วยไคลเอนต์ที่ใช้รูปแบบเดียวกับ OpenAI ไม่มีราคาเผยแพร่ จึงไม่มีทางจำลองต้นทุนของเวิร์กโหลดบนโมเดลนี้ได้ ไม่มีเวตต์ จึงไม่มีการโฮสต์เอง ไม่มีการควอนไทซ์ และไม่มีการทำสำเนาโดยบุคคลที่สาม ไม่มีแถวเบนช์มาร์กอิสระ ดังนั้นภาพประสิทธิภาพทั้งหมดข้างต้นจึงขึ้นอยู่กับตารางของแล็บเดียวเท่านั้น

Reflection Beam ไม่ใช่หนึ่งในเส้นทางของเรา และเราก็จะไม่พูดเป็นนัยว่ามันเป็นเช่นนั้น สิ่งที่เราให้คุณได้คือราคาของสนามที่มันกำลังพยายามเข้าสู่ ซึ่งดึงสด ๆ จากแคตตาล็อกของเราเมื่อเช้านี้: GLM 5.2 ที่ $1.40 ขาเข้า และ $4.40 ขาออก ต่อล้านโทเคน, GLM 5.3 ที่ $1.26 และ $3.96, Qwen 3.8-Max ที่ $2.00 และ $6.00 และ DeepSeek V4.1 Flash ที่ $0.15 และ $0.60 นั่นคือส่วนต่างกว่าเก้าเท่าระหว่างตัวที่ถูกที่สุดกับตัวที่แพงที่สุด แค่ราคาขาเข้าเพียงอย่างเดียว — และนั่นคือเหตุผลว่าทำไมโมเดลเบต้าที่ไม่มีราคาประกาศ จึงเป็นเรื่องยากจริง ๆ ที่จะจัดให้อยู่ในกระบวนการตัดสินใจ ไม่ว่ากราฟประสิทธิภาพของมันจะดูดีแค่ไหนก็ตาม

OrcaRouter ใช้คีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียวครอบคลุมทั้งสี่รุ่นนั้นและโมเดลอื่น ๆ อีกกว่า 200 รุ่นโดยส่งต่อราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม ดังนั้นเมื่อผู้ขายปรับราคา ฝั่งเราก็อัปเดตทันทีในวันเดียวกัน ไม่ต้องรอให้ตัวแทนจำหน่ายมาคอยรีเฟรชตารางราคา การสลับใช้งานอัตโนมัติเมื่อเกิดข้อขัดข้องเป็นส่วนหนึ่งของการกำหนดเส้นทางอยู่แล้ว ไม่ใช่สิ่งที่คุณต้องสร้างขึ้นมาครอบผู้ให้บริการแต่ละราย ซึ่งหมายความว่าโมเดลที่ยังไม่ผ่านการพิสูจน์ — ไม่มีการทำซ้ำ ไม่มีคะแนนอิสระ และไม่มีราคา — คือสิ่งที่คุณควรปล่อยให้รับทราฟฟิกเพียงบางส่วน แทนที่จะเอาไปไว้บนเส้นทางวิกฤตของคุณ

เมื่อข้อกล่าวอ้างนั้นสามารถทดสอบได้

สามสิ่งจะชี้ขาดเรื่องนี้ และ Reflection ได้วางสองสิ่งนั้นไว้ภายในเดือน

อย่างแรกคือน้ำหนักโมเดล Apache 2.0 บวกกับรายงานทางเทคนิคทำให้ใครก็ตามที่มีโหนดแค่สองสามตัวสามารถวัดสิ่งที่สำคัญได้ — โทเคนต่อวินาทีต่อ GPU ที่ระดับคุณภาพคงที่ และว่า 23 พันล้านพารามิเตอร์ที่ใช้งานจะให้คะแนนต่อ FLOP ตามที่กราฟบ่งชี้ได้จริงหรือไม่ จนกว่าจะถึงตอนนั้น ข้อโต้แย้งเรื่องประสิทธิภาพก็เป็นแค่การคำนวณบนกระดาษเช็ดปาก และทุกคนที่พูดซ้ำก็แค่พูดซ้ำคำบรรยายของ Reflection

อย่างที่สองคือราคา โมเดลที่ไม่มีราคาตั้งย่อมไม่มีที่ยืนในการเปรียบเทียบต้นทุน ถ้า Beam ตั้งราคาสูงกว่าระดับของ GLM และ DeepSeek เรื่องพลังประมวลผลก็จะไม่สำคัญอีกต่อไปสำหรับใครที่มีงบประมาณ แต่ถ้าตั้งต่ำกว่า ภาพก็จะเปลี่ยนไปอย่างรวดเร็ว

อันที่สามคือดัชนี Artificial Analysis กล่าวว่ากำลังทดสอบประสิทธิภาพของ Beam และยังไม่ได้เผยแพร่ตัวเลขใด ๆ เมื่อแถวนั้นปรากฏขึ้น มันจะเป็นตัวเลขตัวแรกในเรื่องนี้ที่ Reflection ไม่ได้คำนวณเอง

ถ้าคุณต้องการนักเขียนโค้ดแบบเอเจนต์ที่มีความสามารถในวันนี้ และต้องการรู้ว่ามันมีค่าใช้จ่ายเท่าไร คำตอบยังไม่ใช่ Reflection Beam มันอาจจะเป็นเช่นนั้นในอีกสามสัปดาห์ โมเดลที่คำกล่าวอ้างเรื่องประสิทธิภาพควรค่าแก่การเดิมพัน คือโมเดลที่คุณดาวน์โหลดน้ำหนักได้เองและนับ FLOPs ได้ด้วยตัวเอง — และในการทดสอบนั้น Reflection ได้ให้วันที่และรายการรอแก่เรา ไม่ใช่โมเดล

การเปรียบเทียบในบทความนี้3

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube