
Reflection Beam อธิบาย: พารามิเตอร์ 501B, ใช้งานอยู่ 23B และเวตที่ยังไม่เปิดตัว
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 145 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 183 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
เมื่อวันที่ 5 ตุลาคม 2026 Reflection ได้ประกาศ Reflection Beamโมเดลภาษาชนิด sparse mixture-of-experts ที่มีพารามิเตอร์รวม 501 พันล้านตัว และเปิดใช้งาน 23 พันล้านตัวต่อโทเคน พร้อมทั้งเปิดให้บริการปลายทาง (endpoint) เวอร์ชันเบต้าที่เข้ากันได้กับ OpenAI ตั้งแต่วันเดียวกัน นั่นหมายความว่ามีเพียง 4.6 เปอร์เซ็นต์ของโมเดลที่ตื่นทำงานอยู่ในขณะใดขณะหนึ่ง ซึ่งเป็นอัตราส่วนที่ดุดันมากแม้เมื่อเทียบกับมาตรฐานของวงการโมเดลน้ำหนักเปิดในปัจจุบัน และเป็นตัวเลขที่การเปิดตัวครั้งนี้ทั้งหมดต้องพึ่งพา Reflection กล่าวว่าเวตเต็มรูปแบบ รายงานทางเทคนิค และการ์ดโมเดลจะตามมาภายในปลายเดือนนี้ภายใต้สัญญาอนุญาต Apache 2.0 ณ วันนี้ สิ่งเหล่านั้นยังไม่ปรากฏ ไม่มีการเผยแพร่ราคาที่ใดในช่องทางของ Reflection เอง และ Artificial Analysis ก็ยังไม่มีแถวข้อมูลสำหรับโมเดลนี้ ดังนั้น สรุปการเปิดตัวนี้อย่างตรงไปตรงมาคือ คำกล่าวอ้างที่เจาะจงมากเกี่ยวกับประสิทธิภาพ ซึ่งมาจากห้องแล็บที่ฝึกโมเดลนี้ โดยตัวเลขสนับสนุนทั้งหมดนั้นมาจากห้องแล็บนั้นเอง
ตารางเปรียบเทียบของ Reflection เองวาง Reflection Beam ไว้เทียบกับ Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Maxและ DeepSeek V4.1 Flashซึ่งเป็นภาพที่ยุติธรรมของระดับที่มันตั้งเป้าไว้: โมเดลเปิดและกึ่งเปิดที่แข็งแกร่งแต่ไม่ถึงระดับแนวหน้า หลายตัวมีขนาดเพียงเศษเสี้ยวของ Beam Beam ไม่ได้เอาชนะกลุ่มนั้นในด้านความสามารถดิบ และเราจะแสดงให้คุณเห็นชัดๆ ว่ามันแพ้ตรงไหน สิ่งที่มันอ้างว่าทำได้คือการไปอยู่ใกล้จุดสูงสุดของกลุ่มนั้นในขณะที่ใช้พลังการประมวลผลสำหรับการอนุมานน้อยกว่า GLM 5.2 ประมาณสามถึงสี่เท่า ณ คะแนนการให้เหตุผลที่เทียบเคียงกัน คำกล่าวอ้างนั้นคือบทความนี้
สิ่งที่ดำรงอยู่จริงในปัจจุบัน
ทุกอย่างในส่วนนี้มาจากเอกสารของ Reflection เอง ซึ่งอ่านเมื่อวันที่ 6 ตุลาคม 2026 API เปิดให้ใช้งานจริงในเวอร์ชันเบต้าผ่านรายการรอ ส่วนน้ำหนักโมเดลยังไม่เปิดเผยออกมา
• รหัสรุ่น — Beam-501B-A23B, สร้างเมื่อ 5 ตุลาคม 2026
• อินเทอร์เฟซ — ส่วนติดต่อที่เข้ากันได้กับ OpenAI อยู่ที่ api.reflection.ai/openai/v1 โดยเปิดให้ใช้ Chat Completions และรายการ Models และไม่มีอย่างอื่นเลย ไม่มี Completions ไม่มี embeddings ไม่มี batches
• บริบท — 256,000 โทเคน พร้อมเชิงอรรถแนบท้ายที่ตัวเลขนั้นเองว่า "หน้าต่างบริบทอาจเปลี่ยนแปลงได้ในช่วงเบต้า" เอาต์พุตสูงสุดคือ 128,000 โทเคน
• การให้เหตุผล — พารามิเตอร์ reasoning_effort ที่มีห้าค่า: low, medium, high, xhigh และ max ค่าเริ่มต้นคือ medium และโมเดลจะให้เหตุผลเสมอไม่ว่าจะตั้งค่าใด — ไม่มีสวิตช์ปิด
• โมดัลลิตี — ข้อความเข้า ข้อความออก ไม่มีอินพุตภาพหรือเสียงตอนเปิดตัว ซึ่งเป็นความแตกต่างอย่างแท้จริงจาก Inkling โมเดลที่ให้ความสำคัญกับมัลติโมดัลลิตีเป็นอันดับแรก ที่ Thinking Machines ของ Mira Murati เปิดตัวเมื่อเดือนกรกฎาคม
• ข้อมูลถึงวันที่ — 30 มิถุนายน 2026
• ราคา — ไม่เปิดเผย โพสต์บล็อกของ Reflection เอกสารประกอบ และรายการโมเดลของมัน ต่างก็ไม่ระบุข้อมูลนี้ และคอนโซลแพลตฟอร์มก็อยู่หลังกำแพงการสมัคร
บรรทัดสุดท้ายนั้นสำคัญกว่าที่เห็น โมเดลอื่นทุกตัวในชุดเปรียบเทียบของ Beam ต่างมีราคาตามรายการที่เปิดเผยต่อสาธารณะซึ่งคุณสามารถใส่ลงในสเปรดชีตได้ตั้งแต่วันนี้ Beam ไม่มี ซึ่งหมายความว่าข้อโต้แย้งเรื่องค่าใช้จ่ายใด ๆ เกี่ยวกับมันในตอนนี้เป็นข้อโต้แย้งเรื่องการประมวลผล ไม่ใช่เรื่องเงินดอลลาร์

อัตราส่วน 501 ต่อ 23 คือข้อโต้แย้ง
ความเบาบางไม่ใช่เรื่องใหม่ คำถามคือห้องวิจัยหนึ่งแห่งยอมผลักดันมันไปไกลแค่ไหน GLM 5.2 ทำงานด้วยพารามิเตอร์ที่ใช้งานอยู่ราว 40,000 ล้านตัว จากจำนวนรวมที่รายงานไว้ราว 744,000 ล้านตัว — ประมาณ 5.4 เปอร์เซ็นต์ Reflection Beam อยู่ที่ 4.6 เปอร์เซ็นต์จาก 501,000 ล้านตัว เมื่อดูตามตัวเลขแล้ว นั่นเป็นก้าวต่อไปที่ไม่มากนัก และ Reflection ก็ระมัดระวังในสิ่งที่ตนกล่าวอ้างเกี่ยวกับมัน
ตัวเลขประสิทธิภาพในโพสต์เปิดตัวมาจากกราฟที่สร้างจากข้อมูลของ Artificial Analysis และ DataCurve โดยพลอตคะแนนการให้เหตุผลเทียบกับ FLOPs โดยประมาณของการอนุมาน (inference) ซึ่ง FLOPs ถูกประมาณเป็นสองเท่าของจำนวนพารามิเตอร์ที่ใช้งานจริง คูณกับจำนวนโทเค็นที่สร้างโดยเฉลี่ย สูตรนั้นจงใจไม่รวมการเติมพรอมป์ต์ล่วงหน้า (prompt prefill) ต้นทุนของ attention และโอเวอร์เฮดจากการให้บริการ มันเป็นแบบจำลองคร่าว ๆ ไม่ใช่การวัดจริง และ Reflection ไม่ได้นำเสนอว่ามันเป็นเช่นนั้น — แต่มันก็เป็นหลักฐานเชิงปริมาณเพียงอย่างเดียวที่สนับสนุนข้ออ้าง "ถูกกว่า 3 ถึง 4 เท่าที่คะแนนเท่ากัน" และมันถูกเขียนขึ้นโดยผู้ขายเอง จงมองมันเป็นสมมติฐานที่เมื่อน้ำหนักโมเดลเปิดตัวออกมาแล้ว จะทำให้คนอื่นสามารถทดสอบได้
สิ่งที่สถาปัตยกรรมนี้ให้ในทางปฏิบัติคือโปรไฟล์การให้บริการ พารามิเตอร์ที่ใช้งาน 23 พันล้านตัวเป็นโมเดลที่คุณสามารถรันบน GPU จำนวนค่อนข้างน้อยด้วยความหน่วงระดับโต้ตอบ และนั่นเป็นผลิตภัณฑ์ที่แตกต่างจากโมเดลแบบ dense ขนาด 501 พันล้านพารามิเตอร์ แม้ว่าจำนวนพารามิเตอร์บนการ์ดจะเท่ากันก็ตาม นี่คือเหตุผลที่ Reflection สามารถพูดถึงการให้เหตุผลที่ใกล้เคียงระดับแนวหน้าได้ โดยไม่ต้องพูดถึงการปรับใช้ในระดับศูนย์ข้อมูล
ใช้เวลาไม่ถึงสี่สัปดาห์ในการพรีเทรน และการเปิดเผยข้อมูลก็เจาะจงอย่างผิดปกติ
ส่วนที่ว่าด้วยการฝึกคือส่วนของประกาศที่อ่านแล้วให้ข้อมูลอย่างแท้จริง เพราะ Reflection เผยแพร่ตัวเลขที่ห้องแล็บส่วนใหญ่เก็บไว้ใช้ภายใน
• การฝึกก่อน — 23.8 ล้านล้านโทเค็นบนชิป GB300 จำนวน 6,144 ตัวในแร็ค NVL72 เสร็จสิ้นในเวลาไม่ถึงสี่สัปดาห์ด้วยอัตรา goodput ที่รายงานว่า 92.3 เปอร์เซ็นต์ โดยมีการย้อนกลับไปยังเช็คพอยต์เก้าครั้งระหว่างทาง
• การเรียนรู้แบบเสริมกำลัง — ชิป GB300 จำนวน 10,500 ตัว เป็นเวลา 4 สัปดาห์, การ rollout มากกว่า 100 ล้านครั้ง, บริบทของ rollout สูงสุด 256,000 โทเค็น, แซนด์บ็อกซ์ราว 1.3 พันล้านแห่ง และสภาพแวดล้อมที่แตกต่างกันประมาณหนึ่งล้านแห่ง โดยมี rollout ทำงานพร้อมกันโดยเฉลี่ย 110,000 ครั้ง
• การฝึกกลางทาง — ขยายบริบทที่มีประสิทธิภาพของโมเดลไปเป็น 1 ล้านโทเคน
• ความเสถียร — เกรเดียนต์นโยบายแบบอะซิงโครนัสที่ยังคงเสถียรแม้มีความล้าสมัยในระดับวัน พร้อมการลงโทษความยาวที่ควบคุมได้ เพื่อให้สามารถปรับความยาวของการให้เหตุผลได้โดยไม่ต้องฝึกโมเดลใหม่
เมื่ออ่านบรรทัด pre-training กับ RL ควบคู่กัน โครงร่างของข้อกล่าวอ้างก็ปรากฏขึ้น เรื่องราวด้านประสิทธิภาพไม่ได้เกี่ยวกับเฉพาะพารามิเตอร์ที่ทำงานอยู่ ณ เวลาอินเฟอเรนซ์เท่านั้น แต่ยังเกี่ยวกับความเร็วในการฝึกโมเดล และสัดส่วนของคอมพิวต์ที่ไปลงกับ RL ซึ่งผูกกับสภาพแวดล้อม แทนที่จะไปกับโทเคนเพิ่มเติม สภาพแวดล้อมหนึ่งล้านแห่งและแซนด์บ็อกซ์ 1.3 พันล้านแห่งเป็นข้อความเกี่ยวกับโครงสร้างพื้นฐานสำหรับการฝึกใช้เครื่องมือและเอเจนต์ และสอดคล้องกับเบนช์มาร์กที่ Reflection เลือกนำเสนอเป็นจุดเด่น
ตัวเลขหนึ่งตัวควรค่าแก่การติดธงไว้ บล็อกกล่าวว่าการฝึกช่วงกลาง (midtraining) ขยายบริบทที่มีประสิทธิผลไปถึง 1 ล้านโทเคน; เอกสารประกอบ API ระบุขีดจำกัดการให้บริการที่ 256,000 โทเคน พร้อมเชิงอรรถแบบเบต้าแนบมาด้วย สิ่งเหล่านั้นเป็นความสามารถฝั่งการฝึกและขีดจำกัดฝั่งการให้บริการ ไม่ใช่ข้อขัดแย้ง — แต่ช่องว่างนี้ก็เป็นสิ่งที่กลายเป็นพาดหัว "บริบท 1M" ได้พอดี ถ้าไม่มีใครอ่านเอกสารฉบับที่สอง และใครก็ตามที่เขียนเกี่ยวกับ Beam ในสัปดาห์หน้าควรอ่านเอกสารฉบับที่สอง

เบนช์มาร์ก: จุดที่ Reflection Beam ชนะ และจุดที่ไม่ได้ชนะ
ตัวเลขทุกตัวด้านล่างเป็นข้อมูลที่ผู้ขายรายงานเอง จากตารางในโพสต์เปิดตัวของ Reflection และไม่มีส่วนใดถูกทำซ้ำอย่างเป็นอิสระ คอลัมน์เปรียบเทียบเป็นตัวเลขชุดเดียวกับที่ Reflection เผยแพร่สำหรับโมเดลอื่น ๆ โดยเมื่อเซลล์ใดแสดง "NR" ในต้นฉบับ หมายความว่าโมเดลนั้นไม่ได้ถูกรัน ไม่มีแถวของ Artificial Analysis สำหรับ Beam ดังนั้นจึงไม่มีสิ่งใดที่นี่ผ่านฮาร์เนสของบุคคลที่สาม
การเขียนโค้ดแบบเอเจนติก
• Terminal-Bench v2.1 — Beam 80.1 เทียบกับ GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen3.8 Max 86.6, DeepSeek V4.1 Flash 90.6, Inkling 63.8, Nemotron 3 Ultra 56.4
• SWE-Bench Pro v1 — Beam 65.5 เทียบกับ Qwen3.8 Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4.
• SWE-Bench Pro v2-Hard — Beam 77.2 เทียบกับ Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9
• SWE-Bench Verified — Beam 80.9 เทียบกับ Inkling 77.6, Nemotron 3 Ultra 70.7
• SWE-Bench Multilingual — Beam 78.0 เทียบกับ Nemotron 3 Ultra 67.7
• DeepSWE v1.1 — Beam 44.4 เทียบกับ DeepSeek V4.1 Flash 74.2, Kimi K3 68.0, GLM 5.3 61.0, Qwen3.8 Max 51.0, GLM 5.2 44.0
• SWE Atlas Codebase QnA — Beam 34.6 กับ Kimi K3 68.0, GLM 5.3 61.0
แถวสุดท้ายนั่นแหละคือแถวที่ควรหยุดคิดให้ดี การตอบคำถามเกี่ยวกับรีพอซิทอรีในระยะยาวเป็นสถานการณ์ที่โมเดลต้องถือฐานโค้ดไว้ในหัวตลอดการโต้ตอบที่ยาวนาน และ 34.6 เทียบกับ 68.0 ไม่ใช่ความต่างแบบปัดเศษทิ้ง DeepSWE ก็เล่าเรื่องคล้ายกัน: 44.4 ทำให้ Beam อยู่ในระดับเดียวกับ GLM 5.2 และตามหลัง DeepSeek V4.1 Flash อยู่ไกล
การให้เหตุผล
• AIME 2026 — Beam 97.8 เทียบกับ GLM 5.2 99.2, Inkling 97.1
• HLE, ไม่ใช้เครื่องมือ — Beam 36.2 เทียบกับ Kimi K3 46.9, Qwen3.8 Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7
• GPQA Diamond — Beam 90.5 เทียบกับ Kimi K3 93.5, Qwen3.8 Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9, Inkling 87.2, Nemotron 3 Ultra 87
• SciCode — Beam 49.7 เทียบกับ GLM 5.3 59.0, Kimi K3 58.7, Qwen3.8 Max 52.1, DeepSeek V4.1 Flash 52.0, Inkling 46.1, Nemotron 3 Ultra 44.6
• CriPT AA — Beam 16.3 เทียบกับ Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
โปรไฟล์การให้เหตุผลของ Beam อยู่กลาง ๆ ของกลุ่ม และรูปแบบก็คงเส้นคงวา: นำหน้าสองโมเดลจากรุ่นก่อนหน้าในรายการของ Reflection อย่างสบาย ๆ แต่ตามหลังโมเดลรุ่นปัจจุบัน GPQA Diamond ที่ 90.5 เป็นคะแนนที่แข็งแกร่ง ซึ่งมีอีกสี่โมเดลที่ทำได้ดีกว่า
การใช้เครื่องมือและการค้นหา
• MCP Atlas — Beam 78.7 เทียบกับ Qwen3.8 Max 84.5, GLM 5.3 84.2, Kimi K3 82.3, GLM 5.2 77.8, Inkling 76.0, Nemotron 3 Ultra 63.1.
• AutomationBench ชุดสาธารณะ — Beam 37.0 เทียบกับ DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2
• tau3 banking — Beam 38.0 เทียบกับ Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6
• BrowseComp ด้วยการจัดการบริบท — Beam 77.4 เทียบกับ Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4
• DeepSearchQA ด้วยการจัดการบริบท — Beam 80.1 เทียบกับ Kimi K3 95.0
Reflection ยังได้นำเสนอการสาธิตความสามารถสองรายการในโพสต์ ได้แก่ อัตราการแก้ปริศนา "Land or Water" ที่ 95.5 เปอร์เซ็นต์ ซึ่งเป็นตารางขนาด 180×90 ที่มี 16,200 จุด และต้องรักษาสถานะกระดานขนาดใหญ่ไว้ — เป็นตัวเลขที่อยู่ระหว่าง 92.5 และ 97.8 เปอร์เซ็นต์ที่ Reflection ระบุว่าเป็นผลของ Opus 5 และ Fable 5 ในงานเดียวกัน — และการปรับจูน Text2SQL ของ Gemma-4 ขนาดเล็กที่สุด ซึ่งทำให้ความแม่นยำบนชุดที่กันไว้เพิ่มขึ้นเป็น 66.5 เปอร์เซ็นต์ การสาธิตเหล่านี้ผ่านการคัดเลือกมาแล้ว มันแสดงให้เห็นว่าโมเดลทำสิ่งหนึ่งได้ ไม่ได้แสดงว่าทำได้บ่อยเพียงใด
สิ่งที่คุณทำได้กับมันในวันนี้ และสิ่งที่คุณไม่ควรวางแผนโดยพึ่งพามัน
วันนี้ โดยทั่วไปแล้วมีเพียงสิ่งเดียวเท่านั้นที่ทำได้จริง: ขอสิทธิ์เข้าถึงเวอร์ชันเบต้า และเรียกใช้ Beam-501B-A23B ผ่านเอนด์พอยต์ของ Reflection เองด้วยไคลเอนต์ที่อยู่ในรูปแบบ OpenAI ไม่มีราคาเผยแพร่ ดังนั้นจึงไม่มีวิธีสร้างแบบจำลองต้นทุนของเวิร์กโหลดบนมันได้ ไม่มีเวต ดังนั้นจึงไม่มีการโฮสต์เอง ไม่มีการควอนไทซ์ ไม่มีการไฟน์จูน และไม่มีความสามารถในการทำซ้ำโดยบุคคลที่สาม ไม่มีแถวเบนช์มาร์กที่เป็นอิสระ ดังนั้นภาพประสิทธิภาพทั้งหมดข้างต้นจึงตั้งอยู่บนตารางของห้องแล็บเพียงแห่งเดียว
Reflection Beam ไม่ใช่หนึ่งในเส้นทางของเรา เราจะไม่พูดเป็นนัยเป็นอื่น และเราจะไม่ชี้ให้คุณไปหาตัวแทนจำหน่ายที่อาจมีมัน สิ่งที่เราบอกคุณได้คือราคาของกลุ่มโมเดลที่นำมาเปรียบเทียบ เพราะเรามีเส้นทางให้บริการอยู่สี่ในโมเดลเหล่านั้น และตัวเลขด้านล่างนี้ดึงสด ๆ จากแคตตาล็อกของเราเมื่อเช้านี้: GLM 5.2 ราคา $1.40 ขาเข้า และ $4.40 ขาออก ต่อล้านโทเคน, GLM 5.3 ที่ $1.26 และ $3.96, Qwen3.8 Max ที่ $2.00 และ $6.00 และ DeepSeek V4.1 Flash ที่ $0.15 และ $0.60 นี่คือส่วนต่างที่เห็นได้จริง — DeepSeek V4.1 Flash ถูกกว่า GLM 5.2 เกือบสิบเท่าในด้านขาเข้า — และนั่นคือเหตุผลที่โมเดลเบต้าซึ่งไม่มีราคานั้นยากที่จะหยิบมาใส่ในกระบวนการตัดสินใจ OrcaRouter ใช้คีย์เดียวที่เข้ากันได้กับ OpenAI ใช้ได้กับทั้งโมเดลเหล่านั้นและโมเดลอื่นอีกกว่า 200 โมเดล โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านไปโดยไม่มีการบวกเพิ่ม ซึ่งหมายความว่าการเปลี่ยนแปลงราคาจากผู้ขายจะมีผลทางฝั่งเราภายในวันเดียวกัน แทนที่จะรอให้ตัวแทนจำหน่ายรีเฟรชเมื่อไหร่ก็ได้ และเนื่องจากการสลับสำรองอัตโนมัติเป็นส่วนหนึ่งของการกำหนดเส้นทาง ไม่ใช่สิ่งที่คุณต้องสร้างขึ้นเอง โมเดลใหม่ที่ยังไม่ผ่านการพิสูจน์จึงเป็นสิ่งที่คุณสามารถให้รับทราฟฟิกเพียงบางส่วนได้ แทนที่จะวางไว้บนเส้นทางวิกฤตของคุณ — ซึ่งเป็นวิธีเดียวที่รับผิดชอบได้ในการใช้สิ่งที่ยังไม่มีใครจำลองผลการวัดประสิทธิภาพซ้ำได้

สิ่งที่ควรจับตาก่อนจะเชื่อคำกล่าวอ้างเรื่องประสิทธิภาพอย่างจริงจัง
สามสิ่งจะไขข้อข้องใจนี้ และสองในนั้นได้รับการสัญญาว่าจะเกิดขึ้นภายในเดือนนี้
สิ่งแรกคือน้ำหนักโมเดล Apache 2.0 และรายงานทางเทคนิคจะทำให้ใครก็ตามที่มีโหนดสักสองสามโหนดสามารถวัดสิ่งที่สำคัญจริง ๆ ได้ — โทเคนต่อวินาทีต่อ GPU ที่ระดับคุณภาพที่กำหนดไว้ และวัดว่า 23 พันล้านพารามิเตอร์ที่ใช้งานอยู่ให้คะแนนต่อ FLOP ได้จริงอย่างที่กราฟบอกเป็นนัยหรือไม่ จนกว่าจะถึงตอนนั้น ข้อโต้แย้งเรื่องประสิทธิภาพก็เป็นแค่การคำนวณบนเศษกระดาษ
ข้อที่สองคือราคา โมเดลที่ไม่มีราคาที่ประกาศไว้ไม่มีที่ยืนในการเปรียบเทียบต้นทุน และถ้า Beam อยู่ในระดับสูงกว่า GLM กับ DeepSeek เรื่องพลังประมวลผลก็จะไม่สำคัญอีกต่อไปสำหรับใครก็ตามที่มีงบประมาณ ถ้ามันอยู่ต่ำกว่า ภาพก็จะเปลี่ยนไปอย่างรวดเร็ว
ประการที่สามคือบุคคลที่สามที่รันชุดทดสอบนี้ ตัวเลขทุกตัวข้างต้นมาจากเอกสารเดียวกัน และตารางที่ผู้ขายรายงานเองซึ่งจัดให้โมเดลของตัวเองอยู่ตามหลังในเจ็ดจากสิบหกแถวก็เป็นสัญญาณที่ดีเกี่ยวกับความซื่อสัตย์ของห้องแล็บ — แต่มันก็ยังเป็นห้องแล็บเดียว ฮาร์เนสเดียว ชุดพรอมต์เดียว
ถ้าคุณต้องการเอเจนต์เขียนโค้ดที่มีความสามารถในวันนี้ และจำเป็นต้องรู้ว่ามันมีค่าใช้จ่ายเท่าไร คำตอบยังไม่ใช่ Reflection Beam มันอาจจะเป็นเช่นนั้นในอีกสามสัปดาห์ โมเดลที่คำกล่าวอ้างเรื่องประสิทธิภาพคุ้มค่าที่จะเดิมพันด้วย คือโมเดลที่คุณดาวน์โหลดน้ำหนักของมันได้ และนับ FLOPs ได้ด้วยตัวเอง — และในการทดสอบนั้น Reflection ให้วันที่กับเรา ไม่ใช่โมเดล
การเปรียบเทียบในบทความนี้4
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
