Một thẻ hero được tạo cho bài viết 'Reflection Beam vs Claude Opus 5.5: Một cái bạn có thể gọi hôm nay, một cái bạn phải chờ đợi', có tiêu đề 'Reflection Beam vs Claude Opus 5.5' với phụ đề 'Một cái bạn có thể gọi hôm nay, một cái bạn phải chờ đợi' và ba chip ghi 'Danh sách chờ so với phát hành rộng rãi', 'Không có giá so với $4 / $20' và 'Chỉ văn bản so với đa phương thức'.
Guides & Insights

Reflection Beam so với Claude Opus 5.5: Một cái bạn có thể gọi ngay hôm nay, một cái bạn phải chờ đợi

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Reflection Beam và Claude Opus 5.5thật ra vẫn chưa phải là đối thủ của nhau, và lý do nằm ở khâu hành chính chứ không phải kỹ thuật. Beam, mô hình đầu tiên của Reflection, được công bố vào ngày 5 tháng 10 năm 2026 và là một mô hình mixture-of-experts thưa với 501 tỷ tham số, kích hoạt 23 tỷ tham số mỗi token — nhưng nó chỉ có thể truy cập được thông qua danh sách chờ, trọng số của nó được hứa hẹn sẽ phát hành vào cuối tháng này theo giấy phép Apache 2.0, và chưa có mức giá nào được công bố ở bất kỳ đâu. Opus 5.5 ra mắt ngày 22 tháng 9 năm 2026 với tư cách là mô hình chủ lực của Anthropic: cửa sổ 1 triệu token, đầu vào là văn bản, hình ảnh và tệp, cùng mức giá niêm yết 4,00 đô la cho mỗi triệu token đầu vào và 20,00 đô la cho mỗi triệu token đầu ra. Vậy nên phiên bản trung thực của so sánh này là: một trong hai mô hình thì bạn có thể đưa vào vận hành ngay chiều nay với chi phí đã biết, còn mô hình kia thì không — và mọi thứ còn lại ở đây đều là dự đoán về những gì sẽ xảy ra khi trọng số được phát hành.

Câu trả lời ngắn gọn

Nếu câu hỏi là tuần này nên xây dựng trên mô hình nào, thì câu trả lời là Opus 5.5 gần như không cần tranh cãi: nó được cung cấp rộng rãi, được chấm điểm độc lập, đa phương thức, có giá, và được phục vụ qua một API mà bạn có thể gọi trong năm phút. Lập luận của Beam không dựa vào việc đánh bại Opus 5.5 — không có gì trong tài liệu của chính Reflection khẳng định điều đó. Nó dựa trên một luận điểm hẹp hơn nhiều: rằng ở một điểm số suy luận nhất định, Beam tiêu thụ chỉ khoảng một phần tư lượng tính toán suy luận. Nếu điều đó đứng vững khi ai đó bên ngoài Reflection đo lường nó, Beam trở nên thú vị cho các công việc khối lượng lớn, nơi câu trả lời phải tốt nhưng không cần tốt nhất. Nếu không, Beam chỉ là một mô hình mở tầm trung với một danh sách chờ.

Điều sau đây phân tách những phần của cuộc đối đầu này là sự thật ngày hôm nay khỏi những phần là cá cược.

Chính xác thì mỗi mô hình là gì

Opus 5.5 là phiên bản kế nhiệm đóng, được lưu trữ trực tuyến của Claude Opus 5, được Anthropic định vị cho các thay đổi nhiều bước trên các cơ sở mã lớn, đánh giá mã và các phiên tự trị dài. Nó chấp nhận văn bản, hình ảnh và tệp, trả về văn bản, phục vụ cửa sổ ngữ cảnh 1.000.000 token với tối đa 128.000 token đầu ra, và cung cấp tính năng suy nghĩ mở rộng với mức nỗ lực suy luận có thể cấu hình. Nó không phải là trọng số mở, và kiến thức của nó bị giới hạn bởi thời điểm cắt huấn luyện của Anthropic chứ không phải bởi bất cứ điều gì bạn kiểm soát.

Reflection Beam là cấu trúc ngược lại. Nó có tổng cộng 501 tỷ tham số với 23 tỷ tham số hoạt động — khoảng 4,6 phần trăm mô hình thức cho mỗi token, một tỷ lệ mạnh tay ngay cả khi so với mức khoảng 5,4 phần trăm của GLM 5.2 — được xây dựng để rẻ khi phục vụ thay vì rẻ khi huấn luyện. Nó chỉ xử lý văn bản. Ngữ cảnh API của nó là 256.000 token với một chú thích cảnh báo rằng con số này có thể thay đổi trong giai đoạn beta, và đầu ra tối đa là 128.000 token. Điểm cuối tương thích với OpenAI tại api.reflection.ai/openai/v1 và chỉ cung cấp Chat Completions cùng một danh sách Models, không có gì khác. Tham số reasoning_effort của nó nhận năm giá trị, mặc định là medium và không thể tắt.

• Giá — Claude Opus 5.5 $4.00 cho đầu vào và $20.00 cho đầu ra trên mỗi triệu token, với đọc bộ nhớ đệm ở mức $0.20 và ghi bộ nhớ đệm ở mức $5.00, so với Reflection Beam: không được công bố trên bài đăng blog, tài liệu hay danh sách mô hình.

• Tính khả dụng — Opus 5.5 đã chính thức có sẵn ngay hôm nay; Beam là danh sách chờ cho bản beta, với trọng số, báo cáo kỹ thuật và thẻ mô hình được hứa hẹn sẽ ra mắt vào cuối tháng này.

• Phương thức — Opus 5.5 nhận văn bản, hình ảnh và tệp; Beam chỉ nhận văn bản.

• Ngữ cảnh — 1.000.000 token so với 256.000, với con số của Beam mang một lưu ý beta.

• Trọng số mở — không có cho Opus 5.5, được hứa theo Apache 2.0 cho Beam, nhưng chưa được bàn giao.

• Điểm số độc lập — Opus 5.5 có, Beam thì không.

A generated two-column scoreboard titled 'Reflection Beam vs Claude Opus 5.5 — the scoreboard'. Left column 'Reflection Beam': Availability waitlisted beta; Price not published; Context 256,000 tokens (beta); Input text only; Open weights promised Apache 2.0, not out; Independent score none yet. Right column 'Claude Opus 5.5': Availability generally available; Price $4.00 / $20.00; Context 1,000,000 tokens; Input text, image, file; Open weights no; Independent score AA index 57.6. Footer reads 'Beam figures vendor-reported and unaudited. Opus 5.5 price is the provider list rate; its index is Artificial Analysis, read 6 October 2026.'

Giá là phần không thể so sánh được.

Mức $4.00 và $20.00 của Opus 5.5 là giá niêm yết của nhà cung cấp, và trên danh mục của chúng tôi, chúng được chuyển nguyên vẹn, không cộng thêm gì. Giá đọc cache ở mức $0.20 và ghi cache ở mức $5.00 có ý nghĩa cực kỳ quan trọng đối với khối lượng công việc mà Opus 5.5 được bán vào — một phiên tác tử dài, đọc lại cùng một cơ sở mã 200.000 token hết lượt này đến lượt khác, sẽ trả mức giá cache cho gần như toàn bộ phần đó, chứ không phải mức giá đầu vào. Đó là một đòn bẩy thực sự và thường bị đánh giá thấp, và đáng để mô phỏng trước khi bạn kết luận rằng một mô hình tiên phong vượt ngoài ngân sách.

Beam không có con số nào để so sánh. Không có giá niêm yết để đối chiếu, không có bậc bộ nhớ đệm nào để mô phỏng, và không có mức giá công bố nào cho bản beta. Reflection chưa nói liệu Beam sẽ được bán theo token, tính phí theo người dùng, hay được tặng kèm với trọng số. Bất kỳ ai đưa ra mức chi phí trên mỗi triệu cho Beam vào lúc này đều là đang bịa đặt.

Hệ quả thực tế: việc so sánh giá không phải là “Opus 5.5 đắt còn Beam rẻ hơn”. Mà là “một trong hai thứ này có giá, thứ còn lại có ngày”. Với một đội phải ra quyết định ngay hôm nay, sự bất đối xứng đó mang tính quyết định hơn cả các benchmark.

Điểm chuẩn: hai con số trùng nhau, và vì sao chúng vẫn không thể so sánh với nhau

Các bảng ra mắt của Reflection không bao gồm Opus 5.5, hay bất kỳ mô hình đóng nào thuộc hàng tiên phong. Bộ so sánh của nó hoàn toàn là mô hình mở hoặc bán mở: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max và DeepSeek V4.1 Flash. Vì vậy, bất kỳ bảng so sánh Beam-đối-chiếu-Opus nào cũng phải được dựng thủ công, và dựng nó một cách trung thực nghĩa là phải nêu rõ những khác biệt về harness thay vì xoa nhòa chúng.

Có đúng hai benchmark mà cả hai mô hình đều có một con số được công bố, và cả hai cặp ghép đều không được kiểm soát.

• Humanity's Last Exam — Reflection báo cáo Beam đạt 36,2 khi không dùng công cụ; Artificial Analysis ghi nhận Opus 5.5 đạt 61,4. Hai harness khác nhau, hai cấu hình khác nhau — chỉ số của Opus 5.5 không được ghi nhãn là không dùng công cụ — và khoảng cách hai mươi lăm điểm nói ít hơn về các mô hình so với về cách thiết lập.

• SciCode — Reflection báo cáo Beam đạt 49.7; Artificial Analysis ghi nhận 66.9 cho Opus 5.5. Cùng một benchmark, cùng một vấn đề: một con số là lượt chạy của chính nhà cung cấp, con số kia là bộ khung đánh giá của bên thứ ba.

Mọi thứ còn lại hoàn toàn không trùng lặp với nhau. Bảng của Beam được xây dựng trên Terminal-Bench v2.1, trong khi chỉ số Artificial Analysis hiện tại chạy Terminal-Bench 4.0 — một phiên bản khác của cùng một bộ kiểm thử, đó là lý do vì sao con số 80.1 của Beam và 59.6 của Opus 5.5 trên bảng đó không phải là một phép so sánh và không bao giờ nên được in cạnh nhau. Trên chính chỉ số đó, Artificial Analysis xếp Opus 5.5 ở mức 57.6 trong cấu hình Max / Default Fallback, đứng thứ tư trong số 147 mô hình của lần chạy đó. Beam không có dòng nào trên chỉ số: các trang mô hình trả về lỗi 404 và bảng xếp hạng không có mục Beam nào tính đến sáng nay.

Tuyên bố độc lập thực sự duy nhất về Beam được ghi nhận chính thức là việc Artificial Analysis nói, vào ngày 5 tháng 10, rằng Reflection đã cấp cho họ quyền truy cập và rằng họ đang đánh giá chuẩn mô hình này một cách độc lập — và rằng những chỉ dấu ban đầu cho thấy Beam sẽ là một trong những mô hình mở tiết kiệm token nhất mà họ từng thấy ở mức trí tuệ tương ứng. Đó là một câu mạnh mẽ từ đúng nguồn, và nó vẫn là một câu không có con số. Chính con số sẽ định đoạt cuộc đối đầu này.

A screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), captured 6 October 2026, showing the model name and id, Imtokens context, Max output 128K, input text + image + file, Vision & Tools and JSON Reasoning tags, the INPUT $4.00 and OUTPUT $20.00 pricing tiles, p50 TTFT 5.81 s, p95 TTFT 10.00 s, 48.5M tokens of 7-day traffic, the benchmark provenance lines 'Public benchmarks by Anthropic - 2026-09-22' and 'AI Analysis', and a code sample using base_url https://api.orcarouter.ai/v1.

Nơi tuyên bố về hiệu quả thực sự tạo ra tác động

Lập luận của Reflection không phải là Beam thông minh hơn một mô hình tiên phong. Mà là Beam đạt điểm tương đương với GLM 5.2 trong khi dùng ít hơn 3 đến 4× compute suy luận, và khoảng cách đó còn nới rộng khi so với các mô hình thuộc họ 2 nghìn tỷ tham số, nơi Qwen 3.8-Max nằm trong đó. Biểu đồ đứng sau lập luận này ước tính FLOPs sinh ra bằng hai lần số tham số hoạt động nhân với số token sinh trung bình mỗi lần thử, và chú thích của chính biểu đồ thừa nhận rằng con số này không bao gồm prefill prompt, attention và chi phí phục vụ.

Cứ hiểu theo nghĩa bề mặt như vậy, thì mục tiêu đáng chú ý không phải là Opus 5.5 — mà là khúc giữa của thị trường. Opus 5.5 cạnh tranh bằng năng lực trên mỗi tác vụ và thắng ở những tác vụ cần phán đoán: refactor nhiều bước, review mã, những việc mà một câu trả lời sai tốn kém hơn cả số token. Một mô hình chỉ 4,6 phần trăm thức trên mỗi token cạnh tranh bằng chi phí trên mỗi tác vụ và thắng ở nơi khối lượng chiếm ưu thế và mức chất lượng chỉ cần “đủ tốt và được xác minh ở khâu sau”. Đó là những sản phẩm khác nhau, và việc so sánh Beam với Opus 5.5 trên một bảng điểm duy nhất là đang đo lường sai thứ.

Có một hiệu ứng bậc hai đáng để gọi tên. Nếu tuyên bố về hiệu quả của Beam đứng vững, chỗ đứng tự nhiên của nó là kiểu khối lượng công việc mà nếu không, bạn sẽ phải tiêu token của một mô hình tiên tiến cho một tác vụ mà nó quá thừa năng lực. Đó là một quyết định định tuyến, không phải một lựa chọn mô hình, và đây là lý do câu hỏi về giá ở đây quan trọng hơn câu hỏi về benchmark: bạn không thể định tuyến dựa trên chi phí tới một mô hình không có chi phí.

Chạy chúng song song, khi Beam có thể gọi được

Opus 5.5 đã có trong danh mục của chúng tôi ngay hôm nay với mức giá 4,00 USD và 20,00 USD mỗi triệu token, giá niêm yết được chuyển nguyên vẹn, không cộng thêm gì, và nó nằm cùng hơn 200 mô hình khác phía sau một khóa duy nhất tương thích OpenAI tại api.orcarouter.ai/v1. Nếu bạn muốn A/B một khối lượng công việc giữa một mô hình tiên phong và một mô hình mở giá rẻ, thì đây chính là hình dạng của thiết lập đó: hai ID mô hình, một khóa, không cần hợp đồng thứ hai và không cần thay đổi mã — cùng với cơ chế chuyển đổi dự phòng tự động trong định tuyến, nghĩa là một nhà cung cấp gặp trục trặc cũng không kéo cả pipeline của bạn xuống theo.

Beam chưa thể là một phần của điều đó, và chúng tôi sẽ không giả vờ điều ngược lại. Reflection Beam không phải là một trong các tuyến của chúng tôi, và chúng tôi sẽ không chỉ bạn đến bất kỳ ai có thể bán lại nó. Khi trọng số được phát hành theo Apache 2.0, bạn sẽ có thể tự lưu trữ nó và định tuyến đến endpoint của riêng bạn; cho đến lúc đó, con đường duy nhất là danh sách chờ của Reflection.

Với một khối lượng công việc mà ở đó thực sự cần đến một mô hình tiên tiến, phép so sánh cần thực hiện không phải là với Beam. Mà là với mọi thứ khác trong danh mục: GLM 5.3 ở mức $1.26 và $3.96, Qwen 3.8-Max ở mức $2.00 và $6.00, cùng DeepSeek V4.1 Flash ở mức $0.15 và $0.60, tất cả đều được đọc trực tiếp vào sáng nay. Đó là phân khúc mà Beam sẽ rơi vào nếu định giá cạnh tranh, và đây là một khu vực khó hơn nhiều so với những gì biểu đồ ra mắt ngụ ý.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Điều gì sẽ thay đổi phán quyết này

Ba điều, theo thứ tự mức độ quan trọng của chúng.

Một dòng trên Artificial Analysis dành cho Beam. Không phải thông báo rằng một dòng như vậy sắp xuất hiện — mà chính là dòng đó. Nếu chỉ số này rơi vào khoảng 57,6 của Opus 5.5 trong khi tuyên bố về hiệu quả token vẫn đứng vững trước một harness của bên thứ ba, thì khúc giữa của thị trường sẽ thực sự trở nên khó chịu, và Beam sẽ thành lựa chọn mặc định cho rất nhiều công việc khối lượng lớn. Còn nếu nó rơi gần hơn về cụm open-weights ở khoảng đầu bốn mươi, thì Beam chỉ là một mô hình rẻ, chắc chắn, và không hơn gì thế.

Một mức giá. Một mô hình không có đơn giá niêm yết thì không thể thắng trong một lập luận về chi phí, vì không có gì để so sánh. Nếu Beam định giá thấp hơn phân khúc GLM 5.3, câu chuyện hiệu quả sẽ rất nhanh chóng biến thành câu chuyện ngân sách. Nếu nó định giá cao hơn mức $0.15 và $0.60 của DeepSeek V4.1 Flash mà không có lợi thế về năng lực, nó sẽ chật vật với các công việc khối lượng lớn mà nó được tạo ra để đảm nhiệm.

Các trọng số. Chừng nào chúng chưa tồn tại, “open-weight” chỉ là một tuyên bố về một giấy phép chưa được cấp, và không ai có thể kiểm tra phép tính FLOPs trên mỗi điểm số đối chiếu với một mô hình mà họ thực sự có thể chạy. Đó là phép kiểm tra mà Reflection đã mời gọi và vẫn chưa cho phép.

Cho đến khi ít nhất một trong những điều đó thành hiện thực, lựa chọn thực tế không hề khó nghĩ. Opus 5.5 là mô hình bạn có thể suy luận, tính toán chi phí và triển khai. Beam là mô hình để bạn ngắm nhìn.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày