Một thẻ hero được tạo cho bài viết 'Reflection Beam phát hành API ở bản beta, và các trọng số vẫn còn hai tuần nữa mới có', có tiêu đề 'Reflection Beam' với phụ đề 'Một API ở bản beta, và các trọng số vẫn chưa ra mắt', cùng ba chip ghi '501B tổng / 23B hoạt động', '256K ngữ cảnh beta' và 'Chưa công bố giá'.
Guides & Insights

Reflection Beam phát hành API bản beta, còn các trọng số thì vẫn còn hai tuần nữa mới có.

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mô hình đầu tiên của Reflection có tên là Reflection Beam, và điều thú vị về nó vào sáng nay không phải là nó tồn tại — mà là chỉ một nửa của nó tồn tại. Công ty đã công bố Beam vào ngày 5 tháng 10 năm 2026 dưới dạng mô hình mixture-of-experts thưa với tổng cộng 501 tỷ tham số và 23 tỷ tham số hoạt động trên mỗi token, đồng thời cung cấp một endpoint beta tương thích với OpenAI cho nó ngay cùng ngày. Các trọng số được hứa sẽ ra mắt vào cuối tháng này theo giấy phép Apache 2.0, cùng với một báo cáo kỹ thuật, một model card và serving stack. Cho đến khi chúng được phát hành, những người duy nhất có thể chạy Beam-501B-A23B là những người được Reflection trao chìa khóa danh sách chờ, và mọi con số hiệu năng đang lưu hành đều đến từ các bảng của chính một phòng thí nghiệm.

Đó là một điểm dừng kỳ lạ cho một đợt ra mắt, và thật đáng để nói chính xác chúng ta đang có nửa nào. Reflection đã phát hành một bản xem trước mà bạn có thể đăng ký và một bộ bảng benchmark chưa ai tái lập được. Nó chưa phát hành thứ mà "open-weight" trong tiêu đề ám chỉ.

Thực ra thì sáng nay có gì đang phát trực tiếp vậy?

Mọi thứ trong phần này đều lấy từ bài đăng blog và tài liệu của chính Reflection, đọc vào ngày 6 tháng 10 năm 2026.

• ID mô hình — Beam-501B-A23B, được tạo ngày 5 tháng 10 năm 2026, được cung cấp tại api.reflection.ai/openai/v1 với Chat Completions và một danh sách Models và không gì khác.

• Hình dạng — tổng cộng 501 tỷ tham số, 23 tỷ tham số hoạt động trên mỗi token, tạo ra tỷ lệ kích hoạt khoảng 4,6%. Để so sánh, GLM 5.2 nằm gần mức 5,4%.

• Ngữ cảnh — 256.000 token trên API, kèm chú thích gắn ngay vào chính con số này cảnh báo rằng cửa sổ có thể thay đổi trong thời gian beta. Đầu ra tối đa là 128.000 token.

• Suy luận — tham số reasoning_effort với năm cài đặt: low, medium, high, xhigh và max. Medium là mặc định, và mô hình luôn suy luận. Không có công tắc tắt và không có chế độ không suy luận.

• Phương thức — văn bản vào, văn bản ra. Không nhận đầu vào hình ảnh, âm thanh hoặc video khi ra mắt.

• Giá — chưa được công bố. Bài viết trên blog không có thông tin này, tài liệu cũng không, và bảng điều khiển nền tảng nằm sau tường đăng ký.

• Quyền truy cập — danh sách chờ. Không có lộ trình tự phục vụ và không có trọng số, nên không có tải xuống, không có lượng tử hóa và không có tinh chỉnh.

Dòng giá là thứ thay đổi cách bạn đọc mọi thứ còn lại. Bốn trong số bảy mô hình mà Beam được đem so sánh trong chính các bảng của Reflection có giá niêm yết công khai mà bạn có thể đưa vào bảng tính ngay hôm nay. Beam thì không, nên mọi tuyên bố về chi phí dành cho nó lúc này là tuyên bố về năng lực tính toán, không phải về đô la.

A screenshot of the coding and agentic table in Reflection's Beam launch post, captured 6 October 2026, showing the header 'The below figure shows Beam's performance across a range of coding, agentic, reasoning, and STEM benchmarks. NR denotes scores that have not been reported.' and Beam's own column of rows — DeepSWE v1.1 44.4, SWE-Bench Pro v2-Hard 77.2, SWE-Bench Pro v1 65.5, Terminal-Bench v2.1 80.1, SWE Atlas Codebase QnA 34.6, SWE-Bench Multilingual 78.0 and SWE-Bench Verified 80.9 — beside the comparison columns for Inkling and Nemotron 3 Ultra.

Con số mà buổi ra mắt phụ thuộc vào

Lời chào hàng của Reflection là hiệu quả suy luận, và nó đặc biệt cụ thể về ý nghĩa của điều đó: trên các benchmark suy luận nâng cao, Beam đạt điểm tương đương GLM 5.2 trong khi sử dụng ít hơn 3 đến 4 lần tính toán suy luận. Những mức tăng này được mô tả là còn lớn hơn nữa khi so với các mô hình thuộc nhóm 2 nghìn tỷ tham số, nhóm mà Qwen 3.8-Max thuộc về.

Biểu đồ đằng sau tuyên bố đó đáng để đọc kỹ, vì nó là bằng chứng trụ cột trong toàn bộ bài viết. Nó vẽ điểm suy luận theo FLOPs suy luận ước tính trên DeepSWE, Humanity's Last Exam và Terminal-Bench 2.1, và ước tính FLOPs bằng khoảng hai lần số tham số hoạt động nhân với số token được sinh trung bình mỗi lần thử. Công thức đó cố ý loại trừ prefill prompt, các phép toán attention phụ thuộc ngữ cảnh và chi phí phục vụ — Reflection nói rõ như vậy trong chú thích. Đó là một so sánh nhất quán giữa các mô hình chứ không phải phép đo hóa đơn của bất kỳ ai, và nó cũng là hỗ trợ định lượng duy nhất cho tuyên bố về hiệu quả, do chính phòng thí nghiệm đã xây dựng mô hình viết. Hãy coi đó là một giả thuyết mà bộ trọng số sẽ cho phép người khác kiểm chứng.

Điều mà kiến trúc này thực sự mang lại trong thực tế là một cấu hình phục vụ. Hai mươi ba tỷ tham số hoạt động là một mô hình mà bạn có thể chạy một cách hợp lý trên một số lượng GPU tương đối nhỏ với độ trễ tương tác, và đó là một sản phẩm khác với một mô hình dense 501 tỷ tham số cho dù con số trên thẻ là như nhau. Đó là lý do vì sao Reflection có thể nói về suy luận cận biên giới mà không nói về một triển khai quy mô trung tâm dữ liệu — và vì sao việc phát hành trọng số cuối cùng là sự kiện quan trọng hơn cả khóa beta.

Beam nằm ở đâu trên các bảng của chính Reflection

Mọi số liệu dưới đây đều do nhà cung cấp báo cáo, lấy từ các bảng trong bài đăng ra mắt của Reflection, và không có số liệu nào được tái lập một cách độc lập. Ở những chỗ Reflection không công bố số liệu cho một mô hình, ô đó ghi NR trong bản gốc. Các cột so sánh là của Reflection, không phải của chúng tôi và cũng không phải của bên thứ ba.

Lập trình và làm việc trên terminal

• Terminal-Bench v2.1 — Reflection Beam 80.1 so với GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen 3.8-Max 86.6 và DeepSeek V4.1 Flash 90.6. Beam nằm dưới tất cả chúng.

• SWE-Bench Verified — Reflection Beam 80.9 so với Inkling 77.6 và Nemotron 3 Ultra 70.7. Đây là chỗ Beam có vẻ mạnh nhất, nhưng hãy lưu ý rằng chỉ hai mô hình yếu nhất trong danh sách được chạy trên đó.

• SWE-Bench Pro v1 — Reflection Beam 65,5 so với Qwen 3.8-Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.

• SWE-Bench Pro v2-Hard — Reflection Beam 77.2 so với Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9. Cách biệt mười điểm so với ngôi đầu bảng.

• DeepSWE v1.1 — Reflection Beam đạt 44,4 so với DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen 3.8-Max 51,0, GLM 5.2 44,0. Beam đạt mức ngang bằng với thế hệ trước và kém người dẫn đầu ba mươi điểm.

• SWE Atlas Codebase QnA — Reflection Beam đạt 34,6 so với 68,0 của Kimi K3 và 61,0 của GLM 5.3. Ghi nhớ một kho mã nguồn lớn trong suốt một tương tác dài là điều khó nhất trong danh sách này, và 34,6 của Beam không phải là chênh lệch chỉ do làm tròn.

Lý luận và khoa học

• AIME 2026 — Reflection Beam 97.8 so với GLM 5.2 99.2 và Inkling 97.1.

• HLE không dùng công cụ — Reflection Beam 36.2 so với Kimi K3 46.9, Qwen 3.8-Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7. Ở khoảng giữa bảng, và chỉ xếp trên hai mô hình thuộc thế hệ trước.

• GPQA Diamond — Reflection Beam 90.5 so với Kimi K3 93.5, Qwen 3.8-Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9.

• SciCode — Reflection Beam 49,7 so với GLM 5.3 59,0, Kimi K3 58,7, Qwen 3.8-Max 52,1, DeepSeek V4.1 Flash 52,0.

• CriPT AA — Reflection Beam 16.3 so với Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

Công cụ, tìm kiếm và ngữ cảnh dài

• MCP Atlas — Reflection Beam 78.7 so với Qwen 3.8-Max 84.5, GLM 5.3 84.2, Kimi K3 82.3, GLM 5.2 77.8.

• AutomationBench, tập công khai — Reflection Beam 37.0 so với DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen 3.8-Max 39.8, GLM 5.2 26.2.

• tau3 banking — Reflection Beam 38.0 so với Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1.

• BrowseComp với quản lý ngữ cảnh — Reflection Beam 77.4 so với Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4.

• DeepSearchQA với quản lý ngữ cảnh — Reflection Beam 80.1 so với Kimi K3 95.0.

• AA-LCR — Reflection Beam 79.3 so với Kimi K3 88.7, DeepSeek V4.1 Flash 84.0, Qwen 3.8-Max 80.3, GLM 5.3 79.7, Nemotron 3 Ultra 79.3, GLM 5.2 78.3, Inkling 77.3. Truy hồi ngữ cảnh dài là hàng năng lực tổng quát duy nhất mà Beam thực sự có tính cạnh tranh thay vì chỉ ở mức trung bình.

Đọc bốn bảng cùng nhau và một hình dạng nhất quán hiện ra: Beam đánh bại hai mô hình thế hệ trước trong danh sách của Reflection và thua mô hình hiện tại, trên gần như mọi hàng, với khoảng cách từ nhỏ đến mức loại bỏ. Một nhà cung cấp công bố các bảng đặt mô hình của chính mình ở phía sau trên ngần ấy hàng là một dấu hiệu tốt về tính trung thực của phòng thí nghiệm. Đó không phải là dấu hiệu cho thấy mô hình đang ở vị trí tiên phong.

A screenshot of the efficiency section of Reflection's Beam launch post, captured 6 October 2026, showing the sentence 'On advanced reasoning benchmarks, it achieves scores comparable to GLM-5.2 while using 3-4x less inference compute.', the note that gains are more pronounced against 2T+ parameter models like Qwen 3.8-Max, the claim that the results mean 'more intelligence per token', and a score-versus-estimated-FLOPs chart plotting DeepSWE, HLE (text only) and Terminal-Bench 2.1 across reasoning-effort settings.

Tiếng nói độc lập duy nhất cho đến nay, và điều nó không nói

Đánh giá bên thứ ba duy nhất được ghi nhận là Artificial Analysis, đơn vị này cho biết vào ngày 5 tháng 10 rằng Reflection đã cấp cho họ quyền truy cập và rằng họ đang đánh giá độc lập Beam, đồng thời nói thêm rằng những chỉ báo ban đầu cho thấy Beam sẽ là một trong những mô hình mở tiết kiệm token nhất mà họ từng thấy ở mức độ thông minh của nó.

Đó là một tuyên bố đáng kể từ tổ chức mà chỉ số của họ chính là chỉ số mà hầu hết người mua thực sự đọc, và đó cũng là một tuyên bố không có con số nào trong đó. Tính đến sáng nay, không có dòng Beam nào trên bảng xếp hạng của Artificial Analysis — các trang model trả về 404 và payload của bảng xếp hạng không chứa mục Beam nào — nên tuyên bố về hiệu quả token, hiện tại, chỉ là lời hứa từ một bên thứ ba rằng họ sẽ công bố một thứ gì đó. Chưa có gì trong chỉ số được tính lại trên Beam.

Phần tiết lộ về đào tạo, vốn là phần mạnh nhất của bản công bố

Phần kỹ thuật trong bài đăng của Reflection chứa những con số mà hầu hết các phòng thí nghiệm đều giữ kín nội bộ, và chúng đáng được ghi lại vì đây là phần của bản phát hành vẫn sẽ còn thú vị sau một tháng nữa.

• Tiền huấn luyện — 23,8 nghìn tỷ token đã được tuyển chọn trên 6.144 chip NVIDIA GB300 trong các rack NVL72, hoàn thành từ đầu đến cuối trong chưa đầy bốn tuần, với goodput được báo cáo đạt 92,3%, cùng chín lần tua lại bán tự động trong suốt quá trình, được cho là do các đỉnh chuẩn gradient hoặc nghi ngờ hỏng dữ liệu âm thầm.

• Học tăng cường — 10.500 chip GB300 trong bốn tuần, hơn 100 triệu lượt rollout, ngữ cảnh rollout tối đa 256.000 token, khoảng 1,3 tỷ sandbox và khoảng một triệu môi trường riêng biệt được lấy nguồn cho các tác vụ lập trình, agentic và STEM.

• Phục vụ — trọng số mới đến được cụm suy luận trong trung vị khoảng 12 giây, với phân phối theo tầng giúp cắt giảm 75% lưu lượng giữa các rack và khiến việc áp dụng trên toàn cụm nhanh hơn 2,2 lần so với việc mỗi bản sao tự kéo trọng số.

• Tính ổn định — các gradient chính sách hoàn toàn bất đồng bộ vẫn ổn định về mặt số khi học từ các tương tác đã cũ một ngày, cùng với một hình phạt độ dài có thể điều chỉnh để đánh đổi độ dài suy luận lấy điểm số mà không cần huấn luyện lại.

• Dữ liệu — khoảng 95% token internet thô bị loại bỏ thông qua phân tích cú pháp, khử trùng lặp và tuyển chọn, với tuyên bố rằng các bộ lọc thông thường lẽ ra đã bỏ sót khoảng 1,8 nghìn tỷ token mà Reflection giữ lại, bao gồm 87% token web-code được tuyển chọn của nó.

Hai chi tiết đáng để gắn cờ. Bài đăng nói rằng midtraining mở rộng ngữ cảnh hiệu dụng của Beam lên 1 triệu token, trong khi tài liệu API liệt kê giới hạn phục vụ là 256.000 token kèm một chú thích beta. Đó là một năng lực ở phía huấn luyện và một giới hạn ở phía phục vụ, chứ không phải một mâu thuẫn, nhưng khoảng cách ấy đúng là thứ sẽ trở thành tiêu đề "ngữ cảnh 1M" nếu không ai đọc tài liệu thứ hai. Và con số hơn 100 triệu rollout trong RL được trình bày như một trong những lần chạy lớn nhất thuộc dạng này của bất kỳ phòng thí nghiệm mở nào, nhưng đó là một tuyên bố về quy mô, không phải về những gì quy mô ấy mang lại — đường cong điểm số theo số rollout là của chính nhà cung cấp và dừng lại đúng chỗ mà nhà cung cấp ngừng vẽ.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Bạn có thể làm gì với Reflection Beam ngày hôm nay

Một điều: hãy tham gia danh sách chờ và, nếu bạn nhận được khóa, hãy gọi Beam-501B-A23B thông qua endpoint riêng của Reflection bằng một client có dạng OpenAI. Không có giá được công bố, nên không có cách nào mô hình hóa chi phí của một workload trên đó. Không có trọng số, nên không có tự lưu trữ, không có lượng tử hóa và không có tái tạo bên thứ ba. Không có hàng benchmark độc lập, nên toàn bộ bức tranh hiệu năng ở trên chỉ dựa trên các bảng của một phòng thí nghiệm duy nhất.

Reflection Beam không phải là một trong các tuyến của chúng tôi, và chúng tôi sẽ không ám chỉ rằng nó là như vậy. Điều chúng tôi có thể mang đến cho bạn là giá của thị trường mà nó đang cố gắng bước vào, đọc trực tiếp từ danh mục của chính chúng tôi vào sáng nay: GLM 5.2 ở mức 1,40 USD đầu vào và 4,40 USD đầu ra mỗi triệu token, GLM 5.3 ở mức 1,26 USD và 3,96 USD, Qwen 3.8 ở mức 2,00 USD và 6,00 USD, và DeepSeek V4.1 Flash ở mức 0,15 USD và 0,60 USD. Đó là mức chênh lệch hơn chín lần giữa mức rẻ nhất và mức đắt nhất chỉ tính riêng ở đầu vào — và đó là lý do vì sao một mô hình không có giá niêm yết thực sự rất khó để đưa vào một quyết định, cho dù hiệu quả của nó có ấn tượng đến đâu.

OrcaRouter chạy một khóa tương thích OpenAI trên bốn mô hình đó và hơn 200 mô hình khác, chuyển nguyên giá niêm yết của nhà cung cấp mà không cộng thêm gì, nên khi nhà cung cấp thay đổi giá thì phía chúng tôi cập nhật ngay trong cùng ngày, thay vì chờ đến khi nhà bán lại làm mới bảng giá. Chuyển đổi dự phòng tự động là một phần của định tuyến, chứ không phải thứ bạn phải xây dựng quanh từng nhà cung cấp, nghĩa là một mô hình chưa được chứng minh — không có bản tái tạo, không có điểm đánh giá độc lập và không có giá — chính là kiểu thứ bạn đưa vào một phần lưu lượng thay vì đặt lên đường dẫn quan trọng của mình.

Khi tuyên bố trở nên có thể kiểm chứng

Ba điều định đoạt chuyện này, và Reflection đã đưa hai trong số đó vào trong tháng.

Đầu tiên là các trọng số. Apache 2.0 cùng một báo cáo kỹ thuật cho phép bất kỳ ai có vài node đo lường được điều thực sự quan trọng — token mỗi giây trên mỗi GPU ở một ngưỡng chất lượng cố định, và liệu 23 tỷ tham số hoạt động có thực sự mang lại điểm trên mỗi FLOP như biểu đồ ngụ ý hay không. Cho đến lúc đó, lập luận về hiệu quả chỉ là phép tính trên giấy nháp, và tất cả những ai lặp lại nó đều đang lặp lại chú thích của Reflection.

Điều thứ hai là giá. Một mô hình không có giá niêm yết thì không có chỗ đứng trong một so sánh chi phí. Nếu Beam định giá cao hơn phân khúc GLM và DeepSeek, câu chuyện tính toán không còn quan trọng với bất kỳ ai có ngân sách; nếu thấp hơn, cục diện thay đổi nhanh chóng.

Thứ ba là chỉ số. Artificial Analysis cho biết họ đang chạy benchmark cho Beam và chưa công bố con số nào. Khi dòng đó xuất hiện, nó sẽ là con số đầu tiên trong câu chuyện này mà Reflection không tính toán.

Nếu hôm nay bạn cần một lập trình viên tác tử có năng lực và cần biết nó tốn bao nhiêu, thì câu trả lời chưa phải là Reflection Beam. Có thể là trong ba tuần nữa. Mô hình đáng để đặt cược vào một tuyên bố về hiệu suất là mô hình mà bạn có thể tự tải trọng số về và tự đếm FLOPs — và theo phép thử đó, Reflection mới chỉ đưa cho chúng ta một ngày ra mắt và một danh sách chờ, chứ chưa phải một mô hình.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày