
Atria Dawn vs GLM 5.2: Cùng một nền tảng, được đẩy theo hai hướng đối lập
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Sự thật đơn lẻ hữu ích nhất về cuộc đối đầu này nằm ẩn ngay trong bảng thông số của chính mô hình nhỏ hơn: Atria Dawn Preview, mô hình agentic trọng số mở mới của Phòng thí nghiệm AI Thượng Hải, được công bố trực tiếp vào ngày 14 tháng 9, được xây dựng trên nền tảng MoE 744 tỷ tham số GLM 5.2 — chính là mô hình mà Z.ai đã phát hành hồi tháng Sáu và đang bán như sản phẩm chủ lực trọng số mở với giá 1,40/4,40 đô la Mỹ cho mỗi triệu token. Vậy đây không phải là câu chuyện một tân binh cố gắng vượt mặt một tay chơi lâu năm; mà là câu chuyện cùng một loại silicon, được hậu huấn luyện theo hai hướng bởi hai phòng thí nghiệm khác nhau, rồi được định giá như hai sản phẩm khác nhau. Trước cả khi nhìn vào bất kỳ dòng benchmark nào, sự thật đó đã cho bạn biết cuộc so sánh thực sự xoay quanh điều gì: bạn sẵn sàng đánh đổi bao nhiêu phần khả năng suy luận của GLM 5.2 để lấy một vòng lặp agentic — và bạn phải trả bao nhiêu để giữ được cả hai.
Việc chọn nguồn ở đây mất cân đối theo một cách đáng kể. Hồ sơ độc lập của GLM 5.2 khá mỏng — mức trần trọng số mở của nó được thiết lập bởi GLM 5.3, phiên bản đã thay thế nó vào ngày 14 tháng 8, và Chỉ số AA Intelligence từng đo GLM 5.2 ở mức 53 đã được chấm lại điểm và đổi tên kể từ đó. Mọi phép đánh giá ưu ái Atria Dawn Preview đều do nhà cung cấp tự báo cáo từ model card của nó, chưa được bất kỳ phòng thí nghiệm trung lập nào tái lập, và API quốc tế của nó tại api.atria-asi.ai vẫn chưa có giá niêm yết. Ở những chỗ mà model card đặt hai bên cạnh nhau trên cùng một lưới, Atria Dawn Preview dẫn đầu về khám phá và sử dụng công cụ (BrowseComp 92.5, DeepSearchQA 96.0, BFCL v4 77.0) và xếp sau dòng dõi GLM 5.2 ở các hàng lập trình thuần — chưa có điều nào trong số đó được một phòng thí nghiệm bên ngoài xác nhận.
Cùng một nền tảng, hai post-training
Cả hai mô hình đều là MoE với tổng 744B tham số, cùng kiểu kích hoạt 8 expert mỗi token, vì chúng thực sự khởi đầu từ cùng một bộ trọng số. Điều khác biệt nằm ở những gì mỗi phòng lab làm sau đó. Z.ai lấy GLM 5.2 và tinh chỉnh nó thành một mô hình chủ lực mở trọng số đa dụng: chỉ văn bản, ngữ cảnh 1M, đầu ra 128K, giấy phép MIT, với cấu hình thuộc lớp kích hoạt 40B khiến nó trở thành một trong những mô hình cấp tiên phong rẻ nhất để phục vụ — điều mà nó vẫn còn được nhớ đến là mô hình mở trọng số đạt điểm cao nhất trên bảng xếp hạng độc lập trước khi GLM 5.3 ra mắt một tuần sau Intern-S2.

Phòng thí nghiệm AI Thượng Hải đã lấy chính nền tảng đó và tinh chỉnh nó thành một tác nhân vòng lặp nghiên cứu. Bốn trụ cột năng lực của Atria Dawn Preview — Khám phá, Sáng tạo, Phân phối, An ninh mạng — đều mô tả cùng một vòng lặp: phân tích một vấn đề, thiết kế giải pháp, sử dụng công cụ, viết và chạy mã, đọc kết quả thực nghiệm, phục hồi sau thất bại, lặp lại. Phòng thí nghiệm nói rõ rằng kết quả chỉ có văn bản (đầu vào hình ảnh và PDF sẽ nhận lỗi 400), rằng cửa sổ ngữ cảnh là 256K chứ không phải 1M, và rằng các trọng số được cấp phép MIT và có thể tải xuống ngay hôm nay ở định dạng BF16 (353 phân đoạn) hoặc FP8 (177 phân đoạn). Nền tảng là của GLM 5.2; còn sản phẩm thì không.
• Base — cả hai đều là MoE với tổng tham số 744B trên nền tảng GLM-5.2, 8 chuyên gia hoạt động trên mỗi token
• Bối cảnh — Atria Dawn Preview 256K chỉ văn bản so với GLM 5.2 1M, đầu ra 128K
• Giấy phép — cả hai đều là MIT; các shard Atria BF16 + FP8, GLM 5.2 bản tải xuống quen thuộc cỡ 1.5TB
• Giá — Atria chưa được công bố (API quốc tế) so với GLM 5.2 $1.40/$4.40 mỗi 1M
Lưới do nhà cung cấp báo cáo thực sự cho thấy điều gì
Thẻ mô hình so sánh Atria Dawn Preview với một nhóm bao gồm GLM 5.3 thay vì chính GLM 5.2, một lựa chọn biên tập nhỏ nhằm tô điểm cho cột open-weights. Đối chiếu với nhóm đó, những điểm mạnh được báo cáo của Atria Dawn Preview là khám phá và sử dụng công cụ: AutomationBench 53.8, BrowseComp 92.5, DeepSearchQA 96.0, WideSearch 81.9, BFCL v4 77.0, CyberGym 86.5. Những điểm yếu được báo cáo của nó là các hàng lập trình nơi một mô hình tổng quát được tinh chỉnh thường thắng: SWE-bench Pro 59.6, Terminal-Bench 2.1 78.3, JobBench 50.3. Không có gì ở đây được xác minh độc lập, và mỗi hàng đều là harness của chính phòng thí nghiệm trên các prompt của chính phòng thí nghiệm — nhưng sự phân tách này đủ nhất quán để có thể đọc như một lựa chọn thiết kế thực sự thay vì nhiễu. Về phần GLM 5.2, đây là mô hình mà mức trần độc lập thời tháng Sáu của nó (AA Index 53, điểm open-weights cao nhất lúc bấy giờ) đã bị GLM 5.3 vượt qua vào tháng trước khi Atria ra mắt.
Bạn nên định tuyến đến cái nào
Nếu bạn cần một mô hình đa năng trọng số mở với cửa sổ một triệu token cho lập trình ngữ cảnh dài và công việc tri thức, GLM 5.2 ở mức $1.40/$4.40 là một "con ngựa thồ" đã được kiểm chứng, giấy phép MIT, đã được tự lưu trữ và phục vụ trong môi trường sản xuất suốt một quý — và trên một gateway như OrcaRouter, chỉ với một API key và không phụ phí theo từng yêu cầusau đó bạn sẽ có nó ngay khi cần, với khả năng chuyển đổi dự phòng tự động nếu endpoint của Z.ai có trục trặc. Nếu công việc của bạn là một vòng nghiên cứu mở — một tác vụ đòi hỏi mô hình phải tiếp tục đọc, chạy mã và lặp lại cho đến khi có thứ gì đó có thể kiểm chứng được — thì bản tinh chỉnh của Atria Dawn Preview nhắm thẳng vào đó, nhưng bạn đang đánh đổi cửa sổ 1M, một mức giá đã biết và một hồ sơ độc lập để lấy bản preview 256K không có mức giá công bố và không có điểm số trung lập.


Phán quyết trung thực là một ngã rẽ. Các đội vốn đã dựa vào GLM 5.2 cho công việc mở cần ngữ cảnh dài nên giữ nguyên và theo dõi xem các đơn vị đánh giá độc lập báo cáo gì về Atria Dawn Preview trước khi chuyển một luồng production sang nó. Những đội mà nút thắt chính là vòng lặp — mô hình dừng lại để hỏi thay vì thực thi — có lý do chính đáng để thử sản phẩm mới, lý tưởng là đặt sau một đường dự phòng chuyển sang GLM 5.2 để thử nghiệm không tốn gì nếu bản xem trước vấp ngã. Cùng một nền tảng, hai sản phẩm, và với phần lớn độc giả, cột quyết định không phải là bảng benchmark mà là cửa sổ ngữ cảnh và mức giá mà bảng đó không bao giờ hiển thị.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
