Một thẻ hero được tạo với tiêu đề 'Reflection Beam: 501B tham số, 23B hoạt động', cùng dòng phụ 'MoE thưa / 23,8T token tiền huấn luyện / ngữ cảnh API 256K token / trọng số được hứa sẽ phát hành trong tháng này / mọi số liệu do nhà cung cấp báo cáo'. Ba biểu tượng đường nét phẳng nằm bên dưới văn bản: một sơ đồ lớp xếp chồng với hầu hết các lớp bị làm mờ và một lớp được tô sáng, một giá đỡ gồm chín khối máy chủ, và một bản phác thảo tài liệu có ổ khóa nhỏ. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Reflection Beam, Giải thích: 501B tham số, 23B hoạt động và trọng số vẫn chưa được phát hành

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 5 tháng 10 năm 2026, Reflection đã công bố Reflection Beam, một mô hình ngôn ngữ hỗn hợp chuyên gia thưa (sparse mixture-of-experts) với tổng cộng 501 tỷ tham số, nhưng chỉ kích hoạt 23 tỷ trong số đó cho mỗi token, và cùng ngày hôm đó đã cung cấp một endpoint beta tương thích với OpenAI cho mô hình này. Đó là 4,6 phần trăm mô hình hoạt động tại bất kỳ thời điểm nào — một tỷ lệ khá quyết liệt ngay cả theo tiêu chuẩn của lĩnh vực trọng số mở hiện nay — và đó là con số mà toàn bộ màn ra mắt phụ thuộc vào. Reflection cho biết toàn bộ trọng số, một báo cáo kỹ thuật và một thẻ mô hình sẽ ra mắt vào cuối tháng này theo Apache 2.0. Tính đến hôm nay, chúng vẫn chưa có mặt, không có mức giá nào được công bố ở bất kỳ đâu trên các nền tảng riêng của Reflection, và Artificial Analysis không có dòng nào cho mô hình này. Vậy nên bản tóm tắt trung thực về màn ra mắt là thế này: một tuyên bố rất cụ thể về hiệu quả, do chính phòng thí nghiệm đã huấn luyện mô hình đưa ra, với mọi con số hỗ trợ đều do phòng thí nghiệm đó cung cấp.

Bảng so sánh của chính Reflection đặt Reflection Beam cạnh Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max và DeepSeek V4.1 Flash, một bức tranh công bằng về phân khúc mà nó đang nhắm tới: những mô hình mở và bán mở mạnh nhưng chưa đạt mức tiên phong, một số trong đó chỉ bằng một phần nhỏ kích thước của Beam. Beam không đánh bại nhóm đó về năng lực thuần, và chúng tôi sẽ chỉ cho bạn chính xác nơi nó thua kém. Điều nó tuyên bố làm được là chen vào gần vị trí dẫn đầu của nhóm đó trong khi chỉ tiêu tốn lượng tính toán suy luận ít hơn khoảng ba đến bốn lần so với GLM 5.2 ở mức điểm suy luận tương đương. Đó chính là luận điểm của bài viết.

Những gì thực sự tồn tại ngày nay

Mọi nội dung trong phần này đều đến từ tài liệu của chính Reflection, được đọc vào ngày 6 tháng 10 năm 2026. API đang hoạt động ở dạng beta nhưng nằm sau một danh sách chờ; các trọng số vẫn chưa được phát hành.

• ID mẫu — Beam-501B-A23B, được tạo vào ngày 5 tháng 10 năm 2026.

• Giao diện — một bề mặt tương thích OpenAI tại api.reflection.ai/openai/v1, chỉ cung cấp Chat Completions và danh sách Models, và không có gì khác. Không có Completions, không có embeddings, không có batches.

• Ngữ cảnh — {{1}}256.000 token{{/1}}, kèm theo chú thích gắn ngay vào chính con số đó: "Cửa sổ ngữ cảnh có thể thay đổi trong thời gian thử nghiệm beta." Đầu ra tối đa là 128.000 token.

• Suy luận — tham số reasoning_effort với năm giá trị: low, medium, high, xhigh và max. Mặc định là medium, và mô hình luôn suy luận bất kể cài đặt — không có công tắc tắt.

• Phương thức — đầu vào văn bản, đầu ra văn bản. Không có đầu vào hình ảnh hay âm thanh khi ra mắt, một khác biệt thực sự so với Inkling, mô hình lấy đa phương thức làm trọng tâm do Thinking Machines của Mira Murati phát hành vào tháng 7.

• Ngày chốt kiến thức — 30 tháng 6 năm 2026.

• Giá — không được công bố. Bài đăng trên blog của Reflection, tài liệu và danh sách mô hình của nó đều không đề cập đến thông tin này, và bảng điều khiển của nền tảng nằm sau tường đăng ký.

Dòng cuối cùng đó quan trọng hơn vẻ ngoài của nó. Mọi mô hình khác trong bộ so sánh của Beam đều có giá niêm yết công khai mà bạn có thể nhập vào bảng tính ngay hôm nay. Beam thì không, nghĩa là mọi lập luận về chi phí đối với nó lúc này là lập luận về năng lực tính toán, không phải về đô la.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

Tỷ lệ 501 trên 23 chính là lập luận

Tính thưa không mới; câu hỏi là một phòng thí nghiệm sẵn sàng đẩy nó xa đến đâu. GLM 5.2 chạy khoảng 40 tỷ tham số hoạt động trên tổng số được báo cáo vào khoảng 744 tỷ — khoảng 5,4%. Reflection Beam ở mức 4,6% trong tổng số 501 tỷ. Trên lý thuyết, đó là một bước tiến xa hơn khiêm tốn, và Reflection thận trọng về những gì mình tuyên bố cho nó.

Con số hiệu quả trong bài đăng ra mắt đến từ một biểu đồ được xây dựng trên dữ liệu của Artificial Analysis và DataCurve, biểu diễn điểm suy luận so với FLOPs suy luận ước tính, trong đó FLOPs được xấp xỉ bằng hai lần số lượng tham số hoạt động nhân với số token được tạo trung bình. Công thức đó cố tình loại trừ prefill prompt, chi phí suy luận và chi phí phục vụ. Đây là một mô hình tính nháp, không phải một phép đo, và Reflection không trình bày nó như một phép đo — nhưng nó cũng là hỗ trợ định lượng duy nhất cho tuyên bố "rẻ hơn 3 đến 4 lần ở cùng điểm số", và nó được viết bởi nhà cung cấp. Hãy coi nó như một giả thuyết mà các trọng số, khi được phát hành, sẽ cho phép người khác kiểm chứng.

Điều mà kiến trúc này mang lại trên thực tế là một cấu hình phục vụ. Hai mươi ba tỷ tham số hoạt động là một mô hình bạn có thể chạy trên số lượng GPU tương đối nhỏ với độ trễ tương tác, và đó là một sản phẩm khác với mô hình dense 501 tỷ tham số dù số lượng tham số trên card là như nhau. Đó là lý do Reflection có thể nói về suy luận tiệm cận mức tiên tiến nhất mà không cần nói đến một triển khai quy mô trung tâm dữ liệu.

Chưa đầy bốn tuần để huấn luyện trước, và thông tin tiết lộ cụ thể một cách bất thường.

Phần mô tả quá trình huấn luyện là phần trong bản phát hành đọc lên thực sự giàu thông tin, bởi vì Reflection đã công bố những con số mà hầu hết các phòng thí nghiệm đều giữ kín trong nội bộ.

• Tiền huấn luyện — 23,8 nghìn tỷ token trên 6.144 chip GB300 trong các rack NVL72, hoàn thành trong chưa đầy bốn tuần với goodput được báo cáo đạt 92,3 phần trăm, cùng với chín lần tua lại từ các checkpoint trong suốt quá trình.

• Học tăng cường — 10.500 chip GB300 trong bốn tuần, hơn 100 triệu rollout, ngữ cảnh rollout tối đa 256.000 token, khoảng 1,3 tỷ hộp cát và khoảng một triệu môi trường riêng biệt, với trung bình 110.000 rollout chạy đồng thời.

• Midtraining — mở rộng ngữ cảnh hiệu dụng của mô hình lên 1 triệu token.

• Tính ổn định — các gradient chính sách bất đồng bộ vẫn ổn định với độ trễ dữ liệu ở quy mô ngày, cùng với hình phạt độ dài có thể điều khiển để có thể tinh chỉnh độ dài suy luận mà không cần huấn luyện lại.

Đọc cùng nhau các dòng về tiền huấn luyện và RL, hình dạng của tuyên bố sẽ hiện ra. Câu chuyện về hiệu quả không chỉ nằm ở các tham số hoạt động khi suy luận; nó còn nằm ở việc mô hình được huấn luyện nhanh đến đâu và bao nhiêu phần tính toán đã đổ vào RL gắn với môi trường thay vì vào thêm token. Một triệu môi trường và 1,3 tỷ sandbox là một tuyên bố về hạ tầng huấn luyện tác tử và sử dụng công cụ, và nó khớp với những benchmark mà Reflection chọn để đưa lên hàng đầu.

Một con số đáng để gắn cờ. Blog nói rằng midtraining mở rộng ngữ cảnh hiệu dụng lên 1 triệu token; tài liệu API liệt kê giới hạn phục vụ 256.000 token kèm một chú thích beta. Đó là năng lực phía huấn luyện và giới hạn phía phục vụ, không phải mâu thuẫn — nhưng khoảng cách đó chính là kiểu điều sẽ trở thành tiêu đề "ngữ cảnh 1M" nếu không ai đọc tài liệu thứ hai, và ai viết về Beam vào tuần tới thì nên đọc tài liệu thứ hai.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

Điểm chuẩn: nơi Reflection Beam chiếm ưu thế và nơi nó không.

Mọi số liệu dưới đây đều do nhà cung cấp báo cáo, lấy từ các bảng trong bài đăng ra mắt của Reflection, và không có số liệu nào trong đó được tái lập một cách độc lập. Các cột so sánh là cùng những con số mà Reflection đã công bố cho các mô hình khác; ở nơi một ô hiển thị "NR" trong bản gốc, thì mô hình đó đã không được chạy. Không có hàng Artificial Analysis nào cho Beam, nên không có gì ở đây từng đi qua một harness của bên thứ ba.

Lập trình agentic

• Terminal-Bench v2.1 — Beam 80,1 so với GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.

• SWE-Bench Pro v1 — Beam 65.5 so với Qwen3.8 Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4.

• SWE-Bench Pro v2-Hard — Beam 77.2 so với Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9.

• SWE-Bench Verified — Beam 80.9 so với Inkling 77.6, Nemotron 3 Ultra 70.7.

• SWE-Bench Multilingual — Beam 78,0 so với Nemotron 3 Ultra 67,7.

• DeepSWE v1.1 — Beam 44.4 so với DeepSeek V4.1 74.2, Kimi K3 68.0, GLM 5.3 61.0, Qwen3.8 Max 51.0, GLM 5.0 44.0.

• Hỏi đáp về cơ sở mã SWE Atlas — Beam 34.6 so với Kimi K3 68.0, GLM 5.3 61.0.

Hàng cuối cùng đó là hàng đáng để suy ngẫm. Hỏi đáp kho mã tầm xa là nơi một mô hình phải giữ cơ sở mã trong đầu qua một tương tác dài, và 34.6 so với 68.0 không phải là sự khác biệt do làm tròn. DeepSWE cũng kể một câu chuyện tương tự: 44.4 đặt Beam ngang hàng với GLM 5.2 và kém xa DeepSeek V4.1 Flash.

No message content was provided to translate. Please send the text you'd like localized into Vietnamese (with any {{1}}...{{/1}} markers, if applicable), and I'll return the translation with all markers preserved exactly.

• AIME 2026 — Beam 97.8 so với GLM 5.2 99.2, Inkling 97.1.

• HLE, không dùng công cụ — Beam 36.2 so với Kimi K3 46.9, Qwen3.8 Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7.

• GPQA Diamond — Beam 90.5 so với Kimi K3 93.5, Qwen3.8 Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9, Inkling 87.2, Nemotron 3 Ultra 87.

• SciCode — Beam 49.7 so với GLM 5.3 59.0, Kimi K3 58.7, Qwen3.8 Max 52.1, DeepSeek V4.1 Flash 52.0, Inkling 46.1, Nemotron 3 Ultra 44.6.

• CriPT AA — Beam 16.3 so với Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

Hồ sơ suy luận của Beam nằm ở mức giữa nhóm, và xu hướng này nhất quán: vượt lên trên hai mô hình thuộc thế hệ trước trong danh sách của Reflection một cách thoải mái, nhưng xếp sau mô hình hiện tại. GPQA Diamond ở mức 90,5 là một điểm số vững vàng mà bốn mô hình khác đã vượt qua.

• MCP Atlas — Beam 78.7 so với Qwen3.8 Max 84.5, GLM 5.3 84.2, Kimi K3 82.3, GLM 5.2 77.8, Inkling 76.0, Nemotron 3 Ultra 63.1.

• AutomationBench, tập công khai — Beam 37.0 so với DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2.

• tau3 ngân hàng — Beam 38.0 so với Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6.

• BrowseComp với quản lý ngữ cảnh — Beam 77.4 so với Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4.

• DeepSearchQA với quản lý ngữ cảnh — Beam 80.1 so với Kimi K3 95.0.

Reflection cũng đã trình bày hai bản demo năng lực trong bài đăng: tỷ lệ giải thành công 95,5% ở câu đố "Land or Water", một lưới 180x90 với 16.200 điểm, đòi hỏi phải giữ một trạng thái bàn cờ lớn — một con số nằm giữa mức 92,5% và 97,8% mà Reflection gán cho Opus 5 và Fable 5 ở cùng tác vụ — và một lần tinh chỉnh Text2SQL của Gemma-4 nhỏ nhất, giúp nâng độ chính xác trên tập held-out lên 66,5%. Các bản demo đều được tuyển chọn; chúng cho thấy mô hình có thể làm được một việc, chứ không cho biết tần suất làm được việc đó.

Những gì bạn có thể làm với nó ngay hôm nay, và những gì bạn không nên lên kế hoạch dựa vào

Hôm nay, nhìn chung chỉ có đúng một việc là có thể làm: yêu cầu quyền truy cập beta và gọi Beam-501B-A23B thông qua endpoint riêng của Reflection bằng một client có dạng OpenAI. Không có mức giá nào được công bố, nên không có cách nào mô hình hóa chi phí của một khối lượng công việc trên đó. Không có trọng số, nên không có tự lưu trữ, không có lượng tử hóa, không có tinh chỉnh và không có khả năng tái lập bởi bên thứ ba. Không có dòng đánh giá độc lập nào, nên toàn bộ bức tranh hiệu năng ở trên chỉ dựa trên các bảng của một phòng thí nghiệm.

Reflection Beam không phải là một trong các tuyến của chúng tôi. Chúng tôi sẽ không ngụ ý điều ngược lại, và chúng tôi cũng sẽ không chỉ bạn đến một nhà bán lại có thể có nó. Điều chúng tôi có thể nói cho bạn là nhóm so sánh đó tốn bao nhiêu, bởi vì chúng tôi định tuyến bốn trong số các mẫu đó và những con số dưới đây được đọc trực tiếp từ danh mục của chính chúng tôi vào sáng nay: GLM 5.2 ở mức $1.40 cho đầu vào và $4.40 cho đầu ra mỗi triệu token, GLM 5.3 ở mức $1.26 và $3.96, Qwen3.8 Max ở mức $2.00 và $6.00, và DeepSeek V4.1 Flash ở mức $0.15 và $0.60. Đó là một khoảng cách thực sự — DeepSeek V4.1 Flash rẻ hơn gần mười lần ở đầu vào so với GLM 5.2 — và đó chính là lý do một mẫu beta không có giá thì rất khó để đưa vào một quyết định. OrcaRouter chạy một khóa tương thích OpenAI trên những mẫu đó và hơn 200 mẫu khác với giá niêm yết của nhà cung cấp được chuyển nguyên và không cộng thêm gì, nghĩa là một thay đổi giá từ nhà cung cấp sẽ có hiệu lực ngay bên phía chúng tôi trong cùng ngày, thay vì phải chờ đến khi một nhà bán lại làm mới. Và vì chuyển đổi dự phòng tự động là một phần của việc định tuyến chứ không phải thứ bạn phải tự xây, một mẫu mới và chưa được kiểm chứng là kiểu thứ bạn có thể đặt vào một phần lưu lượng thay vì đặt lên đường dẫn quan trọng của mình — đó là cách duy nhất có trách nhiệm để dùng một thứ mà chưa ai tái lập được các chỉ số đánh giá của nó.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

Những điều cần chú ý trước khi bạn coi trọng tuyên bố về hiệu quả

Ba điều sẽ giải quyết được vấn đề này, và hai trong số đó đã được hứa hẹn trong tháng này.

Đầu tiên là các trọng số. Apache 2.0 và một báo cáo kỹ thuật sẽ cho phép bất kỳ ai có vài node đo lường thứ thực sự quan trọng — token mỗi giây trên mỗi GPU ở một mức chất lượng cố định, và liệu 23 tỷ tham số hoạt động có thực sự mang lại điểm trên mỗi FLOP như biểu đồ ngụ ý hay không. Cho đến lúc đó, lập luận về hiệu quả chỉ là phép tính nháp trên giấy.

Điều thứ hai là giá. Một mô hình không có giá niêm yết không có chỗ đứng trong so sánh chi phí, và nếu Beam nằm trên phân khúc GLM và DeepSeek, câu chuyện tính toán không còn quan trọng với bất kỳ ai có ngân sách. Nếu nó nằm dưới, bức tranh thay đổi nhanh chóng.

Điều thứ ba là một bên thứ ba chạy bộ kiểm thử. Mọi con số ở trên đều đến từ cùng một tài liệu, và một bảng do nhà cung cấp báo cáo đặt mô hình của chính họ xếp sau ở bảy trong mười sáu dòng là dấu hiệu tốt về tính trung thực của phòng thí nghiệm — nhưng nó vẫn chỉ là một phòng thí nghiệm, một khung đánh giá, một bộ lời nhắc.

Nếu hôm nay bạn cần một lập trình viên agentic đủ năng lực và bạn cần biết nó tốn bao nhiêu, câu trả lời vẫn chưa phải là Reflection Beam. Có thể sẽ là trong ba tuần nữa. Mô hình mà một tuyên bố về hiệu quả đáng để đặt cược vào là mô hình mà bạn có thể tải trọng số của nó xuống và tự đếm FLOPs của nó — và với phép thử đó, Reflection đã cho chúng ta một ngày, chứ không phải một mô hình.

So sánh trong bài viết này4

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày