
NV-Reason-CT vs GLM-5.2: Một trong số này đã bị ngừng hỗ trợ, và đó không phải là thứ bạn nghĩ đâu.
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 97 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 182 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Mô hình cũ hơn trong so sánh này là mô hình đang bị ngừng sử dụng. GLM-5.2 được phát hành vào ngày 16 tháng 6 năm 2026; NV-Reason-CT có hoạt động kho lưu trữ được ghi nhận trong khoảng từ ngày 2 đến ngày 25 tháng 9 năm 2026. Bạn sẽ nghĩ rằng mô hình tháng 9 là ẩn số còn mô hình tháng 6 là lựa chọn đã ngã ngũ. Điều ngược lại mới đúng trên khía cạnh quan trọng đối với một pipeline văn bản: GLM-5.2 đã bị GLM-5.3 thay thế, bản này ra mắt ngày 18 tháng 8 năm 2026, và giờ đây nó mang dấu cảnh báo ngừng hỗ trợ trên bảng xếp hạng độc lập nơi công bố các số liệu của nó. NV-Reason-CT, bất kể còn điều gì chưa ngã ngũ về nó, là bản phát hành hiện tại của thứ duy nhất mà nó làm.
Vậy nên, câu hữu ích đầu tiên trong bài viết này là câu mà người đọc ít có khả năng đã biết nhất: nếu hôm nay bạn đang bắt đầu một bản dựng văn bản và theo thói quen chọn ngay GLM-5.2, hãy dừng lại và xem GLM-5.3 trước tiên. Nó có giá 1,26 đô la cho mỗi triệu token đầu vào và 3,96 đô la cho mỗi triệu token đầu ra, so với mức 1,40 đô la và 4,40 đô la của GLM-5.2 — nó vừa mới hơn vừa rẻ hơn — và chỉ số thông minh độc lập của nó là 44,8 so với 33,7, tức là một bước tiến trên cùng một thang đo chứ không phải một bước đi ngang. Đó là một quyết định tách biệt với bất cứ điều gì liên quan đến CT, và nó xứng đáng được đưa ra một cách riêng rẽ.
Hai mô hình, và hai loại stale khác nhau
Có một sự khác biệt thực sự giữa một mô hình đã cũ và một mô hình đã bị thay thế, và sự ghép cặp này khiến điều đó trở nên cụ thể.
• Nó làm gì — NV-Reason-CT đọc một khối CT ngực hoặc bụng và đưa ra các phát hiện có cấu trúc theo từng vùng giải phẫu; GLM-5.2 là mô hình ngôn ngữ chỉ xử lý văn bản, dùng cho suy luận, lập trình và xử lý tài liệu dài
• Đã phát hành — các sản phẩm của NV-Reason-CT có ngày từ 2 đến 25 tháng 9 năm 2026; GLM-5.2 vào ngày 16 tháng 6 năm 2026, với GLM-5.3 tiếp nối vào ngày 18 tháng 8 năm 2026
• Trạng thái thế hệ — NV-Reason-CT là phiên bản 0.1, một bản phát hành đầu tiên, chưa được công bố; GLM-5.2 là thế hệ trước của một dòng sản phẩm đang được bán ra
• Vị thế độc lập — chưa có phép đo độc lập nào về NV-Reason-CT; GLM-5.2 được đo ở mức 33.7 trên Chỉ số Trí tuệ Artificial Analysis, kèm dấu hiệu ngừng hỗ trợ, so với GLM-5.3 ở mức 44.8
• Giấy phép và quyền truy cập — trọng số OpenMDW-1.1 mà bạn tải xuống; so với một mô hình trọng số mở được cung cấp ở mức 1,40 đô la và 4,40 đô la mỗi triệu token với lượt đọc từ bộ nhớ đệm ở mức 0,26 đô la
• Ngữ cảnh — 13,824 token thị giác mỗi tập, không có cửa sổ trò chuyện; so với 1,000,000 token đầu vào và 128,000 token đầu ra
• Mục đích sử dụng được nêu — chỉ dành cho nghiên cứu và giáo dục, không phải thiết bị y tế; không dành cho triển khai mục đích chung
Từ "deprecated" ở đây đang làm một công việc chính xác, và đáng để không suy diễn quá xa. Một dấu đánh dấu deprecation trên bảng xếp hạng nghĩa là bên đánh giá đã ngừng coi mô hình này là hiện hành, thường là vì một phiên bản kế nhiệm đã thay thế vị trí của nó. Điều đó không có nghĩa là trọng số đã bị thu hồi, API đã bị tắt, hay mô hình đã ngừng hoạt động. Các đội có pipeline được tinh chỉnh theo GLM-5.2 không gặp rắc rối. Điều nó thực sự có nghĩa là các số liệu của nó là một ảnh chụp từ trước khi GLM-5.3 ra đời, và việc trộn chúng với các con số hiện tại của những mô hình khác là đem một phép đo tháng Sáu so với một bối cảnh tháng Chín.
Những con số mà mỗi bên có, và giá trị của chúng
Hồ sơ của GLM-5.2 dày đặc một cách bất thường và nó đến từ hai nguồn mâu thuẫn với nhau theo những cách đầy tính gợi mở.
Theo báo cáo của chính Z.ai, mô hình đạt 99.12 trên τ²-Bench, 62.1 trên SWE-bench Pro, 54.7 trên Humanity's Last Exam với công cụ, và mức cao nhất được báo cáo là 82.7 trên Terminal-Bench 2.1. Về phía độc lập, Artificial Analysis đo cùng mô hình này ở mức 77.9 trên Terminal-Bench 2.1, 33.7 trên Intelligence Index của họ, 89.5 trên GPQA Diamond và 41.1 trên Humanity's Last Exam. Còn có những số liệu khác từ nhà cung cấp — 99.2 trên AIME 2026, 92.5 trên HMMT February 2026, 91 trên IMOAnswerBench, 74.4 trên FrontierSWE, 63.7 trên ProgramBench, 76.8 trên MCP-Atlas — và tất cả đều là của Z.ai.
Có hai điều trong danh sách đó đáng để gọi tên. Thứ nhất, mức chênh 4,8 điểm trên Terminal-Bench 2.1 giữa con số 82,7 được nhà cung cấp báo cáo tốt nhất và con số 77,9 độc lập không phải là một mâu thuẫn. Các số liệu được nhà cung cấp báo cáo tốt nhất thường là kết quả tốt nhất trong nhiều harness, và con số Terminus-2 của chính Z.ai cho cùng benchmark là 81 — phép đo độc lập nằm trong chính khoảng của nhà cung cấp. Thứ hai, mức chênh của Humanity's Last Exam lớn hơn: 41,1 khi đo độc lập so với con số 40,5 của nhà cung cấp khi không dùng công cụ và 54,7 khi có công cụ, nghĩa là con số 54,7 ở tiêu đề là số có hỗ trợ công cụ còn 41,1 là số thuần. Việc trích dẫn 54,7 bên cạnh điểm thuần của một mô hình khác sẽ là một sai lầm thực sự.
Hồ sơ của NV-Reason-CT không có cấu trúc hai nguồn như vậy, và đó chính xác là điểm mà nó yếu hơn. Kết quả CT-RATE của nó — 0.614 F1 và 0.871 AUROC trên mười tám nhãn, với ngưỡng đồng nhất cố định và lời nhắc có/không trực tiếp, không có đầu phân loại hay điều chỉnh theo tác vụ — là của chính NVIDIA. Các mô hình mà nó được so sánh trong bài báo đó (VoxelFM 0.581, Pillar-0 0.544, ClinFusion-8B 0.442, CT-CLIP 0.398, Merlin 0.358, MedGemma 1.5 0.303) đều là mô hình hình ảnh. Chưa có gì được tái tạo một cách độc lập, và mô hình đã có thể tải xuống trong nhiều tuần. Nó cũng báo cáo macro-F1 dẫn xuất từ báo cáo là 0.592 và một nghiên cứu sơ bộ của chuyên gia X quang liên kết việc xem xét có hỗ trợ với mức giảm 50% thời gian giải thích trung bình được báo cáo, điều mà chính các tác giả gắn cờ là vấn đề cỡ mẫu nhỏ nghiêm trọng.
Vậy nên so sánh nguồn gốc không nghiêng về phía mô hình mới hơn, và đây chính là điểm đáng để ngẫm cho kỹ. GLM-5.2 là mô hình cũ hơn, đã bị thay thế, mà các con số của nó lại đáng tin cậy hơn của NV-Reason-CT, bởi vì có người bên ngoài công ty đã chạy bộ khung kiểm thử. Đang là bản hiện hành không đồng nghĩa với đã được xác minh.

Vì sao việc ngừng hỗ trợ lại quan trọng hơn vẻ ngoài của nó
Có một kiểu thất bại cụ thể mà sự so sánh này được thiết kế để ngăn chặn, và nó hoàn toàn không liên quan đến CT.
Một nhóm đang xây dựng pipeline văn bản lâm sàng đi tìm một mô hình trọng số mở để chạy trên phần cứng của riêng họ, vì dữ liệu rất nhạy cảm. Họ tìm thấy GLM-5.2, mô hình được cấp phép MIT với 743 tỷ tham số và khoảng 40 tỷ tham số hoạt động, đáp ứng yêu cầu, cùng hồ sơ benchmark được ghi chép đầy đủ. Họ tinh chỉnh dựa trên nó. Sáu tháng sau, họ phát hiện ra rằng thế hệ hiện tại là GLM-5.3, rằng nó có ngữ cảnh 1M với giới hạn đầu ra 128K, rằng nó rẻ hơn ở mức $1.26 và $3.96, và rằng quyết định mà họ tưởng mình đang đưa ra — chọn mô hình trọng số mở nào để chuẩn hóa — thực ra là quyết định về việc chọn thế hệ nào, và họ đã đưa ra quyết định đó một cách vô tình.
Đó là một sai lầm tốn kém nếu phát hiện muộn, và có thể tránh được chỉ với một lần tra cứu. Hướng dẫn cụ thể:
• Hãy kiểm tra xem mô hình mà bạn sắp chuẩn hóa có phải là thế hệ hiện tại hay không — dấu hiệu ngừng hỗ trợ trên bảng xếp hạng là tín hiệu nhanh nhất, còn danh sách mô hình của chính nhà cung cấp mới là nguồn có thẩm quyền
• Đừng trộn ảnh chụp nhanh tháng Sáu với số liệu tháng Chín — chỉ số 33,7 của GLM-5.2 được đo trước khi GLM-5.3 tồn tại, và đặt nó bên cạnh chỉ số của một mô hình hiện tại là so sánh hai thời điểm khác nhau trong một lĩnh vực đang chuyển biến
• Hãy cẩn thận với cái tên — một mục "GLM-5.3 Prime" là một bậc phục vụ mang cùng bộ trọng số với mức giá niêm yết cao gần gấp đôi, chứ không phải một mô hình riêng biệt. Hãy kiểm tra bộ trọng số đằng sau bất kỳ SKU nào trước khi trả thêm tiền cho nó
• Hãy coi mức giá niêm yết thấp hơn như một câu hỏi, chứ không phải câu trả lời — việc GLM-5.3 rẻ hơn phiên bản tiền nhiệm là điều bất thường và đáng để kiểm chứng dựa trên chính khối lượng công việc của bạn thay vì mặc nhiên tin theo
Không có gì trong số đó khiến GLM-5.2 trở thành một lựa chọn tồi. Một mô hình 743B được cấp phép MIT với mức $1.40 và $4.40 mà một nhóm đã tinh chỉnh theo là thứ hoàn toàn hợp lý để tiếp tục vận hành, và một mô hình thuộc thế hệ giữa với thành tích đã được khẳng định đôi khi lại chính xác là điều mà một quy trình chịu quản lý chặt muốn có. Vấn đề là nó nên là một lựa chọn, được đưa ra một cách có chủ đích, thay vì một mặc định thừa hưởng từ một danh sách còn hiệu lực vào tháng Bảy.
Cái bẫy khi so sánh một mô hình văn bản với một mô hình CT
Lý do khiến sự ghép cặp này trông có vẻ hợp lý chút nào là cả hai đều là những mô hình trọng số mở được phát hành vào năm 2026, và một độc giả lướt qua danh mục sẽ thấy hai mục hàng có thể so sánh được. Chúng không thể so sánh được, và sự không khớp này có một hình thái cụ thể.
GLM-5.2 chứa được 1.000.000 token. Một khối CT đơn lẻ của NV-Reason-CT tốn 13.824 token thị giác. Theo cách tính đó, GLM-5.2 có thể chứa bảy mươi ca chụp CT mà vẫn còn dư chỗ, điều này dễ dẫn đến kết luận rằng một mô hình văn bản có ngữ cảnh đủ dài khiến mô hình chẩn đoán hình ảnh trở nên dư thừa. Kết luận đó không suy ra được, và lý do nằm ở giao diện chứ không phải ở hạn mức.
13.824 token đó không phải là một bản tóm tắt. Chúng là một khối lập phương 384 milimét được lấy mẫu lại thành 2 mm đẳng hướng, được cắt thành các bản vá 8 x 8 x 8 trên một lưới 24 x 24 x 24, rồi được đưa cho một xương sống ngôn ngữ không có giảm mẫu không gian và không có lớp hợp nhất — đó là lý do đường dẫn hoạt động có 4,35B tham số trong tổng số 4,69B, và là lý do khối tính toán được dùng để giữ độ phân giải thay vì nén nó đi. GLM-5.2 chỉ xử lý văn bản. Nó hoàn toàn không có nhánh thị giác, nên câu hỏi về việc nó sẽ xử lý một bản quét như thế nào không hề nảy sinh; câu trả lời là không thể đưa cho nó một bản quét dưới bất kỳ hình thức nào. Hai thẻ mô hình mô tả mức chênh lệch gấp sáu trăm lần về ngân sách token mà điều đó không liên quan gì đến so sánh, bởi vì một trong hai không có cách nào để nhận đầu vào.
Sai lầm ngược lại cũng dễ xảy ra chẳng kém. NV-Reason-CT hỗ trợ ngực và bụng, nhận tệp NIfTI thay vì một lời nhắc, không có khả năng sử dụng công cụ, và thẻ mô hình của nó giới hạn nó trong nghiên cứu và giáo dục, đồng thời nêu rõ rằng nó không phải là thiết bị y tế và đầu ra có thể không chính xác. Nó không thể chuẩn hóa một tập ngữ liệu báo cáo, viết một khung đánh giá, hay suy luận trên một tài liệu hướng dẫn. Một mô hình hình ảnh 4.7B không phải là sự thay thế cho một mô hình văn bản 743B, cũng như ngược lại.

Đặt nửa phần văn bản vào một phím
Nếu câu hỏi là nên chạy công việc pipeline trên mô hình văn bản nào, thì câu trả lời ngày nay có lẽ là GLM-5.3 thay vì GLM-5.2 — và cả hai đều có trong danh mục của chúng tôi dưới một khóa. z-ai/glm-5.2 được cung cấp theo mức giá niêm yết của nhà cung cấp Z.ai mà không cộng thêm phụ phí, và GLM-5.3 bên cạnh nó, trong một API duy nhất bao gồm hơn 200 mô hình. Việc giữ cả hai sẵn có quan trọng hơn mức thông thường trong giai đoạn chuyển đổi thế hệ: bạn có thể đánh giá mô hình kế nhiệm trên kho ngữ liệu của riêng mình trước khi quyết định, giữ mô hình đương nhiệm làm phương án dự phòng trong lúc đó, và chuyển đổi mà không cần hợp đồng thứ hai hay thay đổi mã.
Mức giá chuyển tiếp đáng để dành một câu, vì lý do tương tự nó quan trọng trên bất kỳ mô hình nào mà nhà cung cấp định giá lại. Không có lớp markup ở giữa, thay đổi giá của nhà cung cấp sẽ đến phía chúng ta ngay trong ngày. Tự động chuyển đổi dự phòng xử lý trường hợp một nhà cung cấp suy giảm giữa lô, mà với một tác vụ trích xuất dài, đó chính là lỗi thực sự khiến bạn mất cả một đêm, và DSL định tuyến cho phép bạn gửi từng yêu cầu riêng lẻ đến mô hình phù hợp để xử lý chúng thay vì dồn tất cả vào một điểm cuối.
NV-Reason-CT không có trên nền tảng của chúng tôi, và không có mô hình NVIDIA nào cả. Điều đó đáng được nói thẳng ra thay vì để người ta tự suy diễn: phần CT của kiến trúc này là các trọng số được tải xuống trên phần cứng của chính bạn, theo một giấy phép cho phép điều đó và một model card cấm dùng trong lâm sàng. Chúng tôi không lưu trữ nó và chúng tôi sẽ không viết một câu ám chỉ điều ngược lại.
Thứ tự để đưa ra những quyết định này
Trình tự đúng cho một bản dựng lâm sàng không phải là trình tự mà phép so sánh ngụ ý.
Hãy bắt đầu với câu hỏi sinh văn bản, và bắt đầu bằng việc kiểm tra xem thế hệ nào là hiện hành — GLM-5.3 thay vì GLM-5.2, về giá cả và năng lực đo lường được, trừ khi bạn có lý do để giữ nguyên. Sau đó, hãy đo độ trễ trên mỗi nghiên cứu của mô hình CT trên phần cứng của chính bạn, vì con số đó chưa được công bố và nó chi phối phần còn lại của ngân sách. Sau đó thiết kế pipeline sao cho hai nửa có thể được thay thế một cách độc lập, vì một nửa đang trong vòng đời gần với bản xem trước còn nửa kia thì đang ở phiên bản 0.1.
Điều duy nhất không nên làm là coi hai thứ đó như một lựa chọn. Một mô hình văn bản 743B đã bị thay thế và một mô hình CT 4.69B hiện hành không có điểm chung nào về nhiệm vụ. Việc so sánh chỉ đáng làm vì những gì nó phơi lộ: rằng sản phẩm mới hơn có bằng chứng chống lưng yếu hơn, rằng cái cũ hơn đã lặng lẽ không còn thuộc thế hệ hiện hành, và rằng cả hai sự thật đều vô hình với bất kỳ ai đọc một dòng danh mục liệt kê chúng cạnh nhau như thể chúng là những phương án thay thế.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
