
Reflection Beam vs Kimi K3: Cùng một tên benchmark, hai bộ khung đánh giá khác nhau
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Reflection Beam đạt 80,1 trên Terminal-Bench 2.1. Kimi K3 đạt 88,3. Đặt hai con số đó cạnh nhau, như phần lớn các bài đưa tin tuần này vẫn làm, và bạn sẽ kết luận Beam kém mô hình mở tốt nhất trong lĩnh vực khoảng tám điểm. Nhưng hai con số đó không đến từ cùng một phòng. Mức 80,1 của Beam là do nhà cung cấp báo cáo, lấy từ bảng trong bài công bố của chính Reflection. Mức 88,3 của Kimi K3 cũng do nhà cung cấp báo cáo, lần này là từ bảng của chính Moonshot — và bảng của một nhà cung cấp chỉ in điểm của đối thủ khi điểm đó đã được chạy trên harness của chính nhà cung cấp, dưới bộ prompt của chính nhà cung cấp, ở thiết lập effort của chính nhà cung cấp. Một bên thứ ba, Artificial Analysis, sau đó đã chạy Kimi K3 trên một benchmark cùng tên và công bố 85,0. Đó là khoảng cách 4,9 điểm, không phải 8,2 — và hướng của sự hiệu chỉnh hoàn toàn có thể đoán trước, vì con số bị bào mòn luôn là con số đến từ phòng thí nghiệm có điều gì đó phải chứng minh.
Đó là toàn bộ vấn đề với phép so sánh mà tiêu đề bài viết này hứa hẹn, và đó cũng là lý do bài viết này dành nửa đầu để nói về nguồn gốc thay vì nói về điểm số. Reflection Beam là một mô hình hỗn hợp chuyên gia thưa (sparse mixture-of-experts) với 501 tỷ tham số, trong đó 23 tỷ tham số hoạt động cho mỗi token, được Reflection AI công bố ngày 5 tháng 10 năm 2026 cùng một endpoint tương thích OpenAI ở dạng beta hoạt động ngay trong cùng ngày. Kimi K3 là mô hình mở hàng đầu của Moonshot AI, được liệt kê trong danh mục của chính chúng tôi với ngày phát hành là 15 tháng 7 năm 2026 và được Artificial Analysis chấm điểm độc lập. Một trong hai là sản phẩm đã ra mắt với bảng giá và một lần chạy thử của bên thứ ba; cái còn lại là bản beta nằm trong danh sách chờ mà trọng số, báo cáo kỹ thuật và giá cả vẫn chưa tồn tại. So sánh chúng không phải là một phép so sánh đối xứng, và giả vờ rằng nó đối xứng sẽ tạo ra một trang trông có vẻ chính xác nhưng lại sai.
Phiên bản 30 giây
• Beam nhanh hơn trên mỗi FLOP trên lý thuyết, chưa được định giá trong thực tế và chưa được tái lập. Kimi K3 được bên thứ ba chấm điểm, có giá 3,00 USD cho mỗi triệu token đầu vào và 15,00 USD cho mỗi triệu token đầu ra, và được cung cấp rộng rãi.
• Trên benchmark duy nhất mà cả hai đã từng được chạy — Terminal-Bench 2.1 — khoảng cách thực sự chỉ vào khoảng năm điểm, chứ không phải tám, một khi số liệu của mỗi bên đều đến từ một harness trung lập.
• Lợi thế thực sự của Beam mang tính cấu trúc, không phải mang tính con số: một cấu hình phục vụ với 23B tham số hoạt động và một giấy phép Apache 2.0 được hứa hẹn. Cả hai đều chưa thể dùng được vào lúc này.
• Nếu bạn cần một mô hình trong tuần này, đây không phải là một cuộc tung đồng xu. Đó là một mô hình đang được phát hành và một danh sách chờ.
Reflection thực sự đã công bố điều gì, và nhắm vào ai
Bài đăng ra mắt của Reflection đưa ra một bảng điểm so sánh với bảy mô hình khác: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max và DeepSeek V4.1 Flash. Mọi số liệu trong bảng đều do nhà cung cấp báo cáo, không có số liệu nào đã được tái lập độc lập và không có trang Artificial Analysis nào cho Reflection Beam — trang mô hình trả về lỗi 404 trên site của họ tính đến ngày 6 tháng 10 năm 2026. Một số ô trong bản gốc được đánh dấu NR vì mô hình không được chạy.
Đây là toàn bộ phần so sánh Beam với K3 trong bảng đó, mỗi khía cạnh một dòng:
• Terminal-Bench 2.1 — Beam 80.1 so với Kimi K3 88.3
• SWE-Bench Pro v2-Hard — Beam 77.2 so với Kimi K3 88.2
• DeepSWE v1.1 — Beam 44.4 so với Kimi K3 68.0
• Hỏi đáp về cơ sở mã SWE Atlas — Beam 34.6 so với Kimi K3 68.0
• HLE, không dùng công cụ — Beam 36.2 so với Kimi K3 46.9
• GPQA Diamond — Beam 90,5 so với Kimi K3 93,5
• SciCode — Beam 49.7 so với Kimi K3 58.7
• MCP Atlas — Beam 78.7 so với Kimi K3 82.3
• BrowseComp với quản lý ngữ cảnh — Beam 77.4 so với Kimi K3 91.2
• DeepSearchQA với quản lý ngữ cảnh — Beam 80.1 so với Kimi K3 95.0
Đọc danh sách đó một cách trung thực và hình hài của đợt ra mắt sẽ hiện ra. Reflection không hề tuyên bố giành chiến thắng trước K3 ở bất cứ đâu. Nó đang tuyên bố đạt được vị trí gần đỉnh của một tầng hạng trong khi sử dụng ít hơn ba đến bốn lần lượng tính toán suy luận so với GLM 5.2 ở các điểm suy luận tương đương — và hàng duy nhất mà hai mô hình sát nhau, Terminal-Bench 2.1, lại là hàng mà sự so sánh kém đáng tin cậy nhất.
Tại sao khung đánh giá lại quan trọng hơn điểm số
Tên của một benchmark là một nhãn, không phải một bản đặc tả. Terminal-Bench 2.1 nghĩa là một tập nhiệm vụ cụ thể được chạy dưới một bộ khung tác nhân cụ thể, với một chính sách thử lại cụ thể, một ngân sách token cụ thể và một thiết lập mức nỗ lực suy luận cụ thể. Hai phòng thí nghiệm đều có thể báo cáo một cách trung thực một con số "Terminal-Bench 2.1" và tạo ra những con số không thể so sánh được với nhau, bởi vì bộ khung và thiết lập mức nỗ lực chính là nơi chứa phần lớn phương sai. Artificial Analysis tồn tại với tư cách là một tổ chức chính vì điều này: tổ chức này vận hành một harness duy nhất, trong một cấu hình duy nhất, trên nhiều mô hình, để các con số của nó có thể được trừ cho nhau.
Vậy con số 80.1 mà Reflection in ra cho Beam là một con số của nhà cung cấp, đo trên harness của chính nhà cung cấp đó, và con số 88.3 mà nó in ra cho K3 cũng là một con số của nhà cung cấp — nhà cung cấp đó chính là Reflection, đang đo lường đối thủ của chính mình. Con số thứ hai ấy là con số kém đáng tin cậy nhất trong hàng: một phòng thí nghiệm chạy trọng số của đối thủ trên bộ khung của chính mình thì không có động lực để chạy chúng ở cấu hình tốt nhất của đối thủ, và cũng không có nghĩa vụ phải tiết lộ cấu hình mà mình đã chọn. Không có gì gian dối trong đó; đó đơn thuần là một con số mà nguồn gốc của nó không xứng với sức nặng mà truyền thông đã đặt lên nó.
Lần chạy của chính Artificial Analysis cho thấy Kimi K3 đạt 85,02 trên Terminal-Bench 2.1, cùng với 12,6 trên Terminal-Bench v4.0 — một bài kiểm tra khác và khó hơn — AA Coding Index là 76,2 (xếp thứ 9 trong số các mô hình trên bảng), Intelligence Index là 43,6, GPQA Diamond 93,5, HLE 46,9, SciCode 59,5, tau-banking 45,98 và Long-Context Recall là 88,7. Đó là những số liệu đọc từ thẻ danh mục của K3 trong hệ thống của chúng tôi, có nguồn từ artificialanalysis.ai, với ảnh chụp đánh giá ghi ngày 15 tháng 7 năm 2026. Beam chỉ có một con số trong vũ trụ của danh sách đó và nó đến từ Reflection. Sự vắng mặt đó nên là tạm thời thay vì vĩnh viễn: Artificial Analysis đã nói rằng Reflection đã cấp cho nó quyền truy cập và rằng nó đang đánh giá chuẩn mô hình, và cách diễn đạt ban đầu của chính họ — rằng Beam "sẽ là một trong những mô hình mở tiết kiệm token nhất mà chúng tôi từng thấy ở mức thông minh của nó" — là một đơn vị đánh giá chuẩn đang phát tín hiệu về một kỳ vọng, chứ không phải đang báo cáo một kết quả. Cho đến khi điểm đó được công bố, các con số trong bài viết này không thể trừ ra được, và chúng tôi sẽ không giả vờ điều ngược lại.

Mỗi thứ giá bao nhiêu, và mỗi thứ là gì
So sánh chi phí thì không hề sát sao, và thật ra nó chẳng phải là một sự so sánh nào cả, bởi vì một bên của nó trống không.
• Giá — Kimi K3: $3.00 cho đầu vào / $15.00 cho đầu ra mỗi triệu token, với lượt đọc cache ở mức $0.30, so với Reflection Beam: không có mức giá nào được công bố ở bất kỳ đâu trên blog, tài liệu hoặc danh sách mô hình của Reflection, khi bảng điều khiển nền tảng nằm sau tường đăng ký.
• Ngữ cảnh — 1.048.576 token trên Kimi K3 so với 256.000 trên Beam beta, kèm một chú thích trong tài liệu của chính Beam ghi rằng “cửa sổ ngữ cảnh có thể thay đổi trong thời gian beta.”
• Phương thức — {{1}}Kimi K3{{/1}} chấp nhận văn bản và hình ảnh; {{2}}Reflection Beam{{/2}} là đầu vào văn bản, đầu ra văn bản, không có đường dẫn hình ảnh hay âm thanh khi ra mắt.
• Tính khả dụng — Kimi K3 hiện đã được cung cấp rộng rãi; Reflection Beam là bản beta có danh sách chờ, với các trọng số được hứa hẹn cung cấp vào cuối tháng 10 theo Apache 2.0.
• Điểm số độc lập — K3 có đầy đủ một hàng Artificial Analysis; Beam thì không có.
• Hồ sơ phục vụ — Kimi K3 là một mô hình tiên tiến lớn, thiên về dense, đạt 46,8 token đầu ra mỗi giây theo đo lường trên playground của chính chúng tôi trong tuần qua; 23B tham số hoạt động của Beam là một lập luận kiến trúc thực sự cho độ trễ thấp hơn và chi phí thấp hơn trên mỗi token, nhưng không có endpoint nào mở cho công chúng để đo lường nó.
Tuyên bố về hiệu quả xứng đáng được thêm một câu cẩn trọng nữa, bởi vì nó là điểm nhấn hàng đầu của buổi ra mắt và nó đang gánh vác nhiều hơn mức nó có thể chịu đựng. Con số "ít hơn 3 đến 4 lần tính toán suy luận" của Reflection đến từ một biểu đồ ước lượng FLOPs bằng hai lần số tham số hoạt động nhân với số token sinh ra trung bình. Công thức đó cố ý loại trừ prefill prompt, chi phí attention và overhead phục vụ — những phần chiếm phần lớn hóa đơn trong công việc agent với ngữ cảnh dài. Đó là một ước tính nháp cho một tỷ lệ tính toán, không phải một phép đo, không phải một con số đô la, và nó do chính nhà cung cấp dựng nên. Hãy coi nó như một giả thuyết mà các trọng số sẽ cho phép người khác kiểm chứng.
Vị trí của OrcaRouter trong bối cảnh này
Kimi K3 là một trong những route của chúng tôi. Nó được niêm yết ở mức $3.00 cho input và $15.00 cho output mỗi triệu token với giá đọc cache là $0.30, đây là mức giá nhà cung cấp của Moonshot được chuyển nguyên không cộng thêm gì — nên nếu Moonshot thay đổi bảng giá, con số trên trang của chúng tôi sẽ thay đổi ngay trong cùng ngày chứ không phải chờ đến lúc một nhà bán lại cập nhật. Nó có thể được gọi từ một khóa tương thích OpenAI cùng hơn 200 mô hình khác, điều này quan trọng ở đây vì một lý do cụ thể: câu trả lời trung thực cho câu hỏi "Beam hay K3?" là một đội đang phòng ngừa rủi ro thì không nên chọn. Bởi vì automatic failover là một phần của routing chứ không phải thứ bạn tự xây, một mô hình như Beam — bản beta, chưa có giá, chưa được bất kỳ bên thứ ba nào đánh giá — chính là thứ bạn đưa vào một phần lưu lượng thay vì đặt lên critical path của mình. Bạn route công việc đến K3 theo mặc định, gửi cho Beam một phần nhỏ khi lời mời waitlist của bạn đến, và để routing tự động fallback về K3 khi gặp lỗi. Đó là một quyết định bạn có thể đưa ra về một mô hình chưa được chứng minh. Đặt cược cả một đường production vào nó thì không.

Điều gì sẽ thay đổi phán quyết này
Ba điều, theo thứ tự giảm dần về mức độ quan trọng.
Một mức giá. Nếu Beam nằm dưới phân khúc K3, lập luận về hiệu quả sẽ trở nên cụ thể thay vì mang tính lý thuyết. Thứ hai, các trọng số. Apache 2.0 cùng một báo cáo kỹ thuật sẽ cho phép bất kỳ ai có vài node đo token mỗi giây trên mỗi GPU ở một ngưỡng chất lượng cố định — bài kiểm tra thực sự phân xử một tuyên bố về năng lực tính toán. Thứ ba, một lần chạy harness của bên thứ ba. Reflection đã cấp cho Artificial Analysis quyền truy cập và một điểm số được kỳ vọng sẽ thu được từ đó; cho đến khi con số đó được công bố, mọi số liệu so sánh Beam với K3 đang lưu hành đều bắt nguồn từ một tài liệu do một trong hai nhà cung cấp viết ra.
Hai câu hỏi đáng để trả lời trực tiếp
Reflection Beam có tốt hơn Kimi K3 không?
Dựa trên bằng chứng hiện có hôm nay, câu trả lời là không — và chưa ai công bố bằng chứng rằng đúng là như vậy. Bảng của chính Reflection cho thấy K3 dẫn trước ở cả mười hàng chung phía trên, một số trong đó có mức chênh lệch (SWE Atlas 34.6 so với 68.0, DeepSearchQA 80.1 so với 95.0) không hề sát nhau. Lập luận của Beam là chi phí trên mỗi đơn vị năng lực, và lập luận đó chỉ là một biểu đồ do nhà cung cấp tự vẽ cho đến khi có trọng số và một mức giá.
Tôi có nên đợi trọng số của Beam trước khi xây dựng trên K3 không?
Chỉ khi tự host là một yêu cầu bắt buộc chứ không phải một sở thích, bởi vì đó là khía cạnh duy nhất mà hai bên không thể thay thế cho nhau — K3 chỉ có API trong khi Beam hứa hẹn cung cấp trọng số Apache 2.0. Nếu bạn đang gọi API, K3 đã có sẵn, đã được chấm điểm và định giá, còn Beam thì nằm trong danh sách chờ. Không có kịch bản nào của quyết định đó đáng để trì hoãn một dự án.

Reflection đã cho chúng ta một ngày và một biểu đồ, mà một ngày thì không phải là một mô hình. Điều duy nhất mà buổi ra mắt thực sự chứng minh là một mô hình 501B kích hoạt 23B tham số có thể được huấn luyện để nằm trong khoảng vài điểm so với biên giới mở — điều này, nếu trọng số được phát hành và các con số vẫn đứng vững, là một kết quả có ý nghĩa về hiệu quả. Nó vẫn chưa phải là lý do để chuyển công việc khỏi một mô hình mà một bên thứ ba đã thực sự đo lường.
