Thẻ hero được tạo cho bài viết 'Reflection Beam vs Gemini 3.1 Pro Preview: One Reads Video, One Reads Text', có tiêu đề 'Reflection Beam vs Gemini 3.1 Pro Preview' cùng phụ đề 'Một bên đọc video, một bên đọc văn bản' và ba chip ghi 'Chỉ văn bản so với năm phương thức', 'Ngữ cảnh 256K so với 1M' và 'Không có giá so với mức phí theo bậc'.
Guides & Insights

Reflection Beam so với Gemini 3.1 Pro Preview: Một bên đọc video, một bên đọc văn bản

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hãy bắt đầu với sự bất đối xứng mà không bảng điểm chuẩn nào trong so sánh này đề cập đến. Reflection Beam, được công bố vào ngày 5 tháng 10 năm 2026, là một mô hình mixture-of-experts thưa với 501 tỷ tham số, trong đó 23 tỷ tham số hoạt động trên mỗi token, và nó nhận văn bản vào rồi trả văn bản ra. Không có gì khác. Gemini 3.1 Pro Preview, mô hình đa phương thức tiên phong của nhà cung cấp kể từ ngày 19 tháng 2 năm 2026, chấp nhận văn bản, hình ảnh, video, âm thanh và tệp, và đây là mô hình duy nhất trong so sánh này mà câu hỏi "liệu nó có thể nhìn thấy thứ tôi muốn hỏi về hay không" có câu trả lời khác nhau cho mỗi bên. Mọi thứ còn lại — tỷ lệ thưa, cửa sổ ngữ cảnh, các bậc giá — đều chỉ là lập luận. Còn điều kia là thông số kỹ thuật.

Điều đó cũng có nghĩa đây là cặp ít đối xứng nhất trong bộ, và cũng hữu ích nhất, vì nó cho thấy mục đích thực sự của việc so sánh mô hình là gì. Nếu khối lượng công việc của bạn là văn bản, Beam và Gemini 3.1 Pro là hai lựa chọn trên một phổ trải từ rẻ-và-chưa-được-đo-lường đến đắt-và-được-chấm-điểm-kỹ-lưỡng. Nếu khối lượng công việc của bạn có một khung hình video trong đó, thì không có gì để so sánh cả.

Mỗi mô hình là gì

Gemini 3.1 Pro Preview là mẫu flagship thuộc hạng xem trước của Google: 1.048.576 token ngữ cảnh, đầu ra tối đa 65.536 token, năm phương thức đầu vào và cửa sổ 1 triệu token đạt được thông qua thang giá chứ không phải mức giá cố định. Google định vị nó cho kỹ thuật phần mềm nâng cao, độ tin cậy tác tử được cải thiện và sử dụng token hiệu quả hơn trên các quy trình phức tạp. Nó không phải trọng số mở. Tên của nó vẫn mang chữ "Preview", đây là trạng thái mà Google đã duy trì cho mô hình này kể từ tháng Hai.

Reflection Beam là mô hình đầu tiên của Reflection và là khởi đầu của một dòng mô hình trọng số mở. Tổng cộng 501 tỷ tham số, 23 tỷ tham số hoạt động — khoảng 4,6% mô hình thức mỗi token. 23,8 nghìn tỷ token tiền huấn luyện trên 6.144 chip GB300 trong chưa đầy bốn tuần, sau đó là một chiến dịch học tăng cường trên 10.500 chip GB300 trong bốn tuần với hơn 100 triệu lượt rollout trên khoảng một triệu môi trường. API của nó tương thích với OpenAI tại api.reflection.ai/openai/v1 với Chat Completions và danh sách Models, ngữ cảnh của nó là 256.000 token kèm một chú thích beta, tham số reasoning_effort của nó có năm mức và không có nút tắt, và trọng số của nó được hứa hẹn phát hành vào cuối tháng này theo Apache 2.0.

• Phương thức — Gemini 3.1 Pro Preview nhận văn bản, hình ảnh, video, âm thanh và tệp; Reflection Beam chỉ nhận văn bản.

• {{1}}Ngữ cảnh và đầu ra{{/1}} — 1.048.576 token vào và 65.536 ra đối với Gemini, so với 256.000 vào và 128.000 ra đối với Beam.

• Giá — Gemini 3.1 Pro Preview ở mức $2.00 đầu vào và $12.00 đầu ra cho mỗi triệu token lên đến 200.000 token, tăng lên $4.00 và $18.00 trên ngưỡng đó, với đọc cache ở mức $0.20; Reflection Beam không có giá công bố.

• Bề mặt công cụ — gọi công cụ native, đầu ra có cấu trúc và grounding tìm kiếm ở phía Google; gọi công cụ và đầu ra có cấu trúc ở phía Beam, với một endpoint chỉ giới hạn ở Chat Completions.

• Trọng số — độc quyền đối với Gemini; Apache 2.0 đã được hứa cho Beam, nhưng chưa phát hành.

• Điểm số độc lập — Gemini 3.1 Pro Preview có chỉ số Artificial Analysis; Beam không có dòng nào trên bảng xếp hạng.

Khoảng cách phương thức chính là toàn bộ lập luận

Thật đáng để nói cụ thể thay vì chỉ ám chỉ tới "đa phương thức", bởi vì những hệ quả thực tiễn là cụ thể.

Một khối lượng công việc tiếp nhận bản ghi màn hình, ảnh sản phẩm, hợp đồng được quét hoặc tệp âm thanh từ trung tâm cuộc gọi thì Beam không thể phục vụ ở bất kỳ mức giá nào, với bất kỳ prompt nào, trên bất kỳ gói nào. Không có cách xử lý vòng ở tầng API: tài liệu của Beam mô tả một phương thức đầu vào và một phương thức đầu ra, và không có đường dẫn hình ảnh hay âm thanh nào được liệt kê. Gemini 3.1 Pro Preview xử lý được cả năm loại, nghĩa là đây là mô hình duy nhất ở đây có thể được đưa vào một quy trình nơi đầu vào chưa phải là văn bản.

Trường hợp ngược lại cũng đáng để nói tới, vì đây là trường hợp mọi người làm sai. Nếu đầu vào của bạn là văn bản và sẽ vẫn là văn bản, thì năm phương thức của Gemini chẳng mang lại cho bạn điều gì, và bạn đang trả mức giá của một mô hình đa phương thức để chạy một khối lượng công việc văn bản. Đó không phải là lập luận ủng hộ Beam — mà là lập luận rằng câu hỏi về phương thức nên được trả lời trước câu hỏi về benchmark, vì nó loại bỏ các lựa chọn với chi phí thấp hơn và đáng tin cậy hơn so với bất kỳ so sánh điểm số nào.

Hai bản xem trước, hai ý nghĩa khác nhau

Mọi tên model đều đi kèm một lưu ý, và những lưu ý ấy không hề giống nhau — đó chính là điều thú vị nhất ở cặp đôi này.

"Preview" của Gemini 3.1 Pro là một quy ước đặt tên áp cho một mô hình vốn đã có thể gọi được một cách phổ biến kể từ tháng Hai, với điểm số độc lập, bảng giá được công bố bao gồm cả một hạng bậc ngữ cảnh dài đã được ghi trong tài liệu, và một bộ công cụ đầy đủ. Trên thực tế, "preview" ở đây có nghĩa là Google bảo lưu quyền thay thế nó, chứ không phải là nó khó truy cập hay chưa được chấm điểm.

Bản beta của Beam là một cổng chặn thực sự. Quyền truy cập là một danh sách chờ, ID mô hình được tạo vào ngày 5 tháng 10 năm 2026, không có bảng giá, không có điểm số từ bên thứ ba, và những tạo tác có thể cho phép bất kỳ ai xác minh tuyên bố cốt lõi — trọng số, báo cáo kỹ thuật, thẻ mô hình — thì được hứa hẹn chứ chưa được phát hành. Con số ngữ cảnh mang theo một chú thích cảnh báo rằng nó có thể thay đổi trong thời gian beta, một sự phòng hờ mà không mô hình nào được cung cấp rộng rãi cần đến.

Hệ quả là bất đối xứng theo cách quan trọng đối với việc thu mua. Một đội ngũ áp dụng Gemini 3.1 Pro Preview đang chấp nhận rủi ro mô hình bị thay đổi. Một đội ngũ áp dụng Beam ngày hôm nay đang chấp nhận một mức giá chưa biết, một điểm đánh giá độc lập chưa biết và không có khả năng tự chạy mô hình. Đó là những loại rủi ro khác nhau, và giá là yếu tố thường quyết định nhất.

A generated two-column scoreboard titled 'Reflection Beam vs Gemini 3.1 Pro Preview — the scoreboard'. Left column 'Reflection Beam': Input modalities text only; Context 256,000 tokens (beta); Max output 128,000 tokens; Price not published; Availability waitlisted beta; Independent score none yet. Right column 'Gemini 3.1 Pro Preview': Input modalities text, image, video, audio, file; Context 1,048,576 tokens; Max output 65,536 tokens; Price $2.00 / $12.00 to 200K, then $4.00 / $18.00; Availability preview, callable since February 2026; Independent score AA index 29.7. Footer reads 'Beam figures vendor-reported and unaudited. Gemini price is the provider list rate; its index is Artificial Analysis, read 6 October 2026.'

Các benchmark và vấn đề trích dẫn

Các bảng ra mắt của Reflection không bao gồm Gemini 3.1 Pro Preview hay bất kỳ mô hình nào của Google. Bộ so sánh của nó chỉ gồm các mô hình mở và bán mở: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max và DeepSeek V4.1 Flash. Vì vậy, hai mô hình chưa từng được chạy đối đầu với nhau trong một bảng được công bố, và các số liệu dưới đây đến từ các harness khác nhau ở cả hai phía.

• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview ghi nhận 29.7, xếp thứ 58/147 trong lượt chạy của nó. Beam hoàn toàn không có dòng chỉ số nào.

• GPQA Diamond — Gemini 3.1 Pro Preview đạt 94,1 theo Artificial Analysis, so với 90,5 do Beam báo cáo.

• SciCode — 58.7 cho Gemini so với 49.7 do nhà cung cấp của Beam báo cáo.

• Humanity's Last Exam — 47,0 cho Gemini so với 36,2 do Beam tự báo cáo, con số sau rõ ràng là không dùng công cụ.

• Terminal-Bench v2.1 — 73,8 cho Gemini theo Artificial Analysis, so với 80,1 do nhà cung cấp của Beam báo cáo. Đây là hàng mạnh nhất của Beam trong cuộc đối đầu, và đó là một thắng lợi trước một mô hình đã có mặt từ tháng Hai.

• Khả năng ghi nhớ ngữ cảnh dài — 82,0 cho Gemini so với 79,3 do Beam tự công bố trên AA-LCR.

• tau-squared Bench — 95,6 cho Gemini so với 78,7 của Beam trên MCP Atlas và 38,0 trên tau3 banking. Các đánh giá liên quan đến việc sử dụng công cụ tác tử, không phải cùng một đánh giá, và sự khác biệt về tên gọi rất quan trọng.

Có một vấn đề trung thực riêng ở phía Gemini của bảng này xứng đáng có một câu riêng. Điểm chỉ số độc lập cho Gemini 3.1 Pro Preview đã được trích dẫn ở mức 30, 46, 47,7 và 57 từ nhiều nguồn khác nhau, và Artificial Analysis cung cấp các phiên bản chỉ số khác nhau trên các trang mô hình khác nhau tại cùng một thời điểm. Con số 29,7 ở trên là con số trên trang chúng tôi đọc ngày 6 tháng 10 năm 2026, và đó là con số duy nhất chúng tôi sẽ trích dẫn — nhưng bất kỳ bài viết nào đặt một con số chỉ số Gemini duy nhất bên cạnh một đối thủ mà không nói rõ nó đến từ bản chụp nào thì đang trình bày một con số dao động như thể nó cố định. Lời cảnh báo tương tự cũng áp dụng theo chiều ngược lại với Beam, nơi hoàn toàn không có bản chụp nào.

Giá, và bậc mà không ai lên kế hoạch cho

Gemini 3.1 Pro Preview có giá 2,00 USD cho đầu vào và 12,00 USD cho đầu ra trên mỗi triệu token ở mức tối đa 200.000 token, và 4,00 USD cùng 18,00 USD khi vượt ngưỡng đó. Đọc cache tốn 0,20 USD mỗi triệu token và ghi cache tốn 0,375 USD. Ranh giới giữa các bậc giá chính là phần đáng để tính toán trước: điểm bán hàng nổi bật của mô hình là cửa sổ 1.048.576 token, và ngay khi một yêu cầu vượt qua 200.000 token thì mức giá đầu vào tăng gấp đôi còn mức giá đầu ra tăng thêm một nửa. Do đó, một khối lượng công việc được thiết kế xoay quanh cửa sổ một triệu token sẽ được tính theo bậc thứ hai cho phần lớn lưu lượng của nó, chứ không phải bậc thứ nhất.

Beam không có bảng giá, nên không có hạng nào để mô hình hóa và không có gì để so sánh. Sự thiếu vắng đó không trung lập: nó có nghĩa là phát biểu rẻ nhất có thể bảo vệ được về chi phí của Beam là chi phí đó chưa được biết, và hỗ trợ định lượng duy nhất cho định vị hiệu quả của nó là biểu đồ của chính Reflection, biểu đồ này ước tính FLOPs được tạo ra bằng hai lần số tham số hoạt động nhân với số token được tạo trung bình mỗi lần thử trên DeepSWE, HLE và Terminal-Bench 2.1 — kèm một chú thích thừa nhận rằng prefill prompt, attention và chi phí phục vụ bị loại trừ. Trên các workload mà ngữ cảnh một triệu token quan trọng, prefill không phải là sai số làm tròn, và nó chính xác là số hạng mà công thức bỏ sót.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), captured 6 October 2026, showing the model name and id, the INPUT $2.00 and OUTPUT $12.00 pricing tiles, p50 TTFT 10.00 s, p95 TTFT 10.00 s, 13.9M tokens of 7-day traffic, the provenance lines 'Public benchmarks by Google - 2026-02-19' and 'AI Analysis', the summary describing a frontier reasoning model with improved agentic reliability, and a code sample using base_url https://api.orcarouter.ai/v1.

Sử dụng công cụ, tìm kiếm và điểm khác biệt giữa hai thiết kế

Những điểm mạnh được quảng bá của Gemini 3.1 Pro Preview là kỹ thuật phần mềm, độ tin cậy tác tử và hiệu quả token, còn bề mặt công cụ được công bố của nó bao gồm gọi hàm, đầu ra có cấu trúc và neo tìm kiếm. Mục cuối cùng đó là điều cần lưu ý cho bất kỳ ai đang so sánh các ngăn xếp tác tử: tìm kiếm có căn cứ là một năng lực chính chủ về phía Google, và nó thay đổi những gì một tác tử dùng công cụ có thể làm mà không cần một dịch vụ truy xuất bên ngoài được nối vào.

Công cụ của Beam thú vị hơn mức một dòng thông số kỹ thuật gợi ý và khó đánh giá hơn. Reflection báo cáo MCP Atlas đạt 78,7, tau3 banking đạt 37,0, BrowseComp với quản lý ngữ cảnh đạt 77,4 và DeepSearchQA với quản lý ngữ cảnh đạt 80,1 — và lưu ý rằng trong quá trình học tăng cường, mô hình đã tự nhiên học được cách truy vấn các mô hình ngôn ngữ khác và gọi API OCR khi được cấp quyền truy cập web, dù các tác vụ duyệt web không hề có trong hỗn hợp huấn luyện. Nếu khả năng tổng quát hóa đó đúng, thì đó là một tín hiệu thực sự về chuyển giao tác tử. Ở thời điểm này, đó cũng là một quan sát từ nhà cung cấp trong một lần chạy huấn luyện, không có kiểm chứng độc lập.

Ở các hàng sử dụng công cụ nơi cả hai bên đều có số liệu, bức tranh là hỗn hợp chứ không hẳn nghiêng về một phía. Bảng của nhà cung cấp Beam đặt nó vượt GLM 5.2 trên MCP Atlas và ngang bằng với GLM 5.2 và Kimi K3 trên tau3 banking, trong khi con số 95,6 của Gemini trên tau-squared Bench là con số agentic cao nhất mà mỗi bên đã công bố. Các bộ kiểm thử khác nhau, các harness khác nhau, và không có đánh giá chung — đó là vấn đề lặp đi lặp lại trong so sánh này.

Lựa chọn, và cách phòng hộ

Quy tắc quyết định rút ra từ những điều trên đủ đơn giản để nói trong một dòng: nếu bất kỳ đầu vào nào không phải văn bản, Beam không phải là một lựa chọn và việc so sánh chấm dứt. Nếu mọi đầu vào đều là văn bản, câu hỏi trở thành liệu tuyên bố hiệu quả không nêu nguồn của Beam có đáng với một mức giá chưa biết và không có điểm số độc lập hay không, khi đặt cạnh một mô hình có giá $2.00 và $12.00 với một thang bậc được tài liệu hóa và một bề mặt công cụ đầy đủ.

Gemini 3.1 Pro Preview đã có trong danh mục của chúng tôi, với mức giá niêm yết của nhà cung cấp được chuyển nguyên vẹn và không cộng thêm gì, phía sau một khóa tương thích OpenAI tại api.orcarouter.ai/v1 cùng hơn 200 mô hình khác — và cùng khóa đó phục vụ các mô hình mà Beam cạnh tranh về giá, từ GLM 5.3 ở mức $1.26 và $3.96 đến DeepSeek V4.1 Flash ở mức $0.15 và $0.60, được đọc trực tiếp vào sáng nay. Vì ranh giới bậc tại 200.000 token là vấn đề định tuyến chứ không phải vấn đề mô hình, DSL định tuyến cho phép bạn biểu đạt điều đó trực tiếp: giữ các yêu cầu ngắn ở bậc rẻ và ghim những yêu cầu thực sự dài vào nơi cửa sổ chính là lý do bạn chọn mô hình, trong một lần gọi thay vì trong mã ứng dụng.

Reflection Beam không phải là một trong những tuyến của chúng tôi, và chúng tôi sẽ không chỉ bạn đến bất kỳ ai tuyên bố có nó. Nếu trọng số Apache 2.0 đến trong tháng này như đã hứa, việc tự vận hành sẽ trở thành lựa chọn thứ ba cho công việc chỉ văn bản và tuyên bố về hiệu quả sẽ có thể kiểm chứng trên phần cứng của chính bạn.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Điều gì sẽ làm thay đổi câu trả lời

Lập luận của Beam chống lại Gemini dựa trên cùng hai yếu tố mà mọi so sánh về Beam đều dựa vào, và cuộc so tài này bổ sung thêm yếu tố thứ ba.

Một mức giá. Không có nó, lập luận về hiệu quả không thể được chuyển thành một quyết định ngân sách, và mô hình đang cạnh tranh bằng một sơ đồ chứ không phải bằng bảng giá.

Một điểm số độc lập. Artificial Analysis cho biết vào ngày 5 tháng 10 rằng Reflection đã cấp cho mình quyền truy cập và rằng mình đang đánh giá hiệu năng Beam, đồng thời mô tả các chỉ dấu ban đầu cho thấy Beam sẽ là một trong những mô hình mở tiết kiệm token nhất mà mình từng thấy ở mức trí tuệ của nó. Đó là nguồn phù hợp nói điều phù hợp, và vẫn chưa có hàng Beam nào trên bảng — các trang mô hình trả về 404 và bảng xếp hạng không có mục Beam nào tính đến sáng nay.

Và điều không hề thay đổi: Beam chỉ có văn bản. Không bản phát hành trọng số nào, không đợt giảm giá nào và không điểm chỉ số nào thay đổi được điều đó, nghĩa là đối với cả một nhóm khối lượng công việc, sự so sánh này sẽ không bao giờ trở thành một sự so sánh thực sự. Nếu pipeline của bạn có video, câu trả lời đã là Gemini 3.1 Pro Preview trước cả khi benchmark đầu tiên được tải.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày