Thẻ tiêu đề chính cho 'Ling-3.1-flash vs GLM-5.3-Flash', với phụ đề 'Gấp bốn lần thông lượng so với một điểm chỉ số'. Hai thẻ bo góc nằm cạnh nhau, cách nhau một khoảng rõ ràng: thẻ bên trái, được dán nhãn 'Ling-3.1-flash', ghi 'Tốc độ: 211 tok/s', 'Chỉ số AA: 41', 'Giấy phép: không công bố'; thẻ bên phải, được dán nhãn 'GLM-5.3-Flash', ghi 'Tốc độ: 53 tok/s', 'Chỉ số AA: 42', 'Giấy phép: MIT'. Một dòng chân trang ghi 'Thông lượng trên API riêng của từng nhà cung cấp; chỉ số theo Artificial Analysis.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Ling-3.1-flash so với GLM-5.3-Flash: Gấp bốn lần thông lượng đổi lấy một điểm chỉ số

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ling-3.1-flash và GLM-5.3-Flashcách nhau đúng một điểm trên Artificial Analysis Intelligence Index — 41 so với 42 — khiến chúng trông chẳng khác nào cùng một lựa chọn được đưa ra hai lần. Thực tế không phải vậy. GLM-5.3-Flash tạo đầu ra ở tốc độ 53,0 token mỗi giây trên API riêng của Z.ai; Ling-3.1-flash tạo đầu ra ở tốc độ 211,0 token mỗi giây trên API của InclusionAI. Đó là mức chênh lệch gấp bốn lần về thông lượng, và lớn hơn nhiều so với bất cứ điều gì mà chỉ số dùng để phân tách chúng. Một mô hình có năng lực tốt hơn trong hai trên gần như mọi trục chất lượng và mở theo giấy phép MIT. Mô hình kia là cái về đích trước, đóng, và không có giá, giấy phép hay checkpoint nào được công bố. Việc chọn giữa chúng là câu hỏi về việc khối lượng công việc của bạn đang phải chờ điều gì.

Ling-3.1-flash thắng áp đảo ở trục này

Tốc độ không phải là một chi tiết phụ khi bạn chọn giữa các mô hình cùng mức năng lực, và ở đây nó chính là toàn bộ lý lẽ cho Ant.

• Thông lượng đầu ra — Ling-3.1-flash đạt 211,0 token mỗi giây trên API của InclusionAI so với GLM-5.3-Flash đạt 53,0 token mỗi giây trên API của Z.ai. Tốc độ tạo nhanh gấp bốn lần.

• Thời gian đến token đầu tiên — Ling-3.1-flash 1,80 giây so với GLM-5.3-Flash 3,18 giây. Mô hình Ant bắt đầu trả lời trong khi mô hình Z.ai vẫn đang suy nghĩ, điều này quan trọng hơn thông lượng trong các tình huống sử dụng tương tác và truyền phát.

• Thời gian cho mỗi tác vụ Intelligence Index — Ling-3.1-flash khoảng 357 giây so với GLM-5.3-Flash khoảng 979 giây. Một tác vụ đánh giá duy nhất khiến GLM-5.3-Flash mất gần gấp ba lần thời gian từ đầu đến cuối, vì nó vừa chậm hơn trên mỗi token vừa chậm hơn khi khởi động.

Đối với một vòng lặp agent thực hiện hàng tá lệnh gọi tuần tự, hoặc một sản phẩm mà người ta đang nhìn các token hiện đến, đó không phải là yếu tố quyết định phụ — mà là toàn bộ lý do để ưu tiên một mô hình. GLM-5.3-Flash là mô hình tốt hơn trên giấy tờ và là mô hình chậm hơn trên đường xử lý yêu cầu.

Những điểm mà GLM-5.3-Flash đơn giản là tốt hơn

Ở mọi nơi khác, và danh sách đủ dài đến mức lợi thế về thông lượng phải tự giành lấy chỗ đứng của mình.

• Độ tin cậy kiến thức — GLM-5.3-Flash đạt +7,47 trên AA-Omniscience, cao nhất trong ba mô hình thuộc phân hạng Flash, với tỷ lệ ảo giác 27,6% trên các câu hỏi đã trả lời. Ling-3.1-flash đạt +2,22 với tỷ lệ ảo giác 37,9%. Trên một phép đo trừng phạt việc bịa đặt nhiều hơn việc từ chối, khoảng cách này là có thật và cùng chiều với chỉ số.

• Kiến thức khoa học — GLM-5.3-Flash đạt 0.912 trên GPQA Diamond. Ling-3.1-flash không có dòng GPQA Diamond nào được công bố. DeepSeek V4.1 Flash (Max) cũng vậy. Một mô hình đạt 0.91 ở các câu hỏi khoa học trình độ sau đại học là một công cụ khác so với một mô hình chưa được đo lường trên chúng.

• Dạng thức — GLM-5.3-Flash tiếp nhận văn bản, hình ảnh và video. Ling-3.1-flash chỉ tiếp nhận văn bản. Đây không phải là khoảng cách về hiệu năng có thể được khắc phục bằng một bài đánh giá chuẩn; mà là một năng lực hoàn toàn không tồn tại.

• Trọng số và giấy phép — GLM-5.3-Flash là trọng số mở theo giấy phép MIT, có thể tải xuống và tự lưu trữ. Ling-3.1-flash chưa công bố checkpoint nào, không có văn bản giấy phép, và được xếp vào loại độc quyền.

• Công việc tri thức dạng tác tử — GLM-5.3-Flash đạt 1.453,73 Elo trên AA-Briefcase v1.1 so với 1.400,35 của Ling-3.1-flash, trên một bộ đánh giá được xây dựng dành riêng cho các tác vụ công việc tri thức thay vì điều khiển terminal.

• Giá — GLM-5.3-Flash được công bố ở mức 0,15 đô la cho mỗi triệu token đầu vào và 0,50 đô la cho mỗi triệu token đầu ra trên API của Z.ai, so với 0,30 và 0,90 đô la của Ling-3.1-flash. Bằng một nửa mức giá đầu vào và khoảng một nửa mức giá đầu ra, từ một mô hình có điểm chỉ số cao hơn cùng trọng số mở.

A two-column generated scoreboard titled 'Ling-3.1-flash vs GLM-5.3-Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Speed: 211 tok/s', 'First token: 1.80 s', 'Omniscience: +2.22', 'Weights: closed', 'Price: $0.30 / $0.90'; the right column, 'GLM-5.3-Flash', reads 'AA Index: 42', 'Speed: 53 tok/s', 'First token: 3.18 s', 'Omniscience: +7.47', 'Weights: MIT', 'Price: $0.15 / $0.50'. A footer line reads 'Index and quality rows per Artificial Analysis; throughput per each vendor's own API.' The OrcaRouter logo is composited in the bottom-right corner.

Các hàng nơi mô hình Ant trả lời lại

Ling-3.1-flash không bị vượt qua ở tất cả các hạng mục. Ở công việc terminal dạng tác tử, nó nhỉnh hơn một chút, còn ở coding-science thì ngang bằng:

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 so với GLM-5.3-Flash 0.328. Thực chất là một kết quả hòa, và cả hai đều nằm dưới hạng tiên phong.

• SciCode — Ling-3.1-flash 0.541 so với GLM-5.3-Flash 0.516. Một chiến thắng sát nút.

• AutomationBench-AA — 0.617 so với 0.604. Một chiến thắng sát nút nữa.

• GDPval-AA — Ling-3.1-flash 1.621,75 Elo so với GLM-5.3-Flash 1.646,86. GLM giành lại điểm này.

Đọc bốn dòng cùng nhau và bức tranh đã rõ. Ở những chỗ có thể tách biệt hai mô hình, sự khác biệt nằm trong độ nhiễu của một lần đánh giá. Chênh lệch một điểm chỉ số giữa chúng không phải là một thứ hạng; đó là một lần tung đồng xu được nghiêng nhẹ về phía GLM nhờ các hàng độ tin cậy. Điều không phải là tung đồng xu là khoảng cách thông lượng gấp 4 lần và khoảng cách giá gấp 2 lần, cả hai đều chỉ theo hướng ngược lại.

Cũng có một chi tiết về phục vụ đáng lưu ý, vì nó làm thay đổi độ lớn của khoảng cách thông lượng đó tùy thuộc vào nơi bạn gọi một mô hình. API của chính Z.ai đo được ở mức 53,0 token mỗi giây. Đo lường bảy ngày trong danh mục của chúng tôi đối với GLM-5.3-Flash trên các tuyến của chúng tôi cho thấy 150,6 token đầu ra mỗi giây với độ trễ token đầu tiên trung vị là 4,2 giây. Cùng một bộ trọng số được phục vụ từ một triển khai khác chạy nhanh gần gấp ba lần. Các số liệu thông lượng của nhà cung cấp là thuộc tính của một nhà cung cấp, không phải của một mô hình.

Thông số kỹ thuật, từng dòng một.

Chủ đề ở đầu mỗi dòng:

• Kích thước — Ling-3.1-flash tổng 560B / 25B hoạt động so với GLM-5.3-Flash tổng 320B / 18B hoạt động.

• Ngữ cảnh được công bố — 1M token trên cả hai. Chỉ số suy luận ngữ cảnh dài của GLM-5.3-Flash đạt 0,80 trên AA-LCR; của Ling-3.1-flash đạt 0,83. Cả hai đều gần mức 0,84 của DeepSeek V4.1 Flash (Max), nghĩa là suy luận ngữ cảnh dài không còn là yếu tố tạo khác biệt ở phân khúc này nữa.

• Trần đầu ra — GLM-5.3-Flash 128.000 token trên danh mục của chúng tôi so với Ling-3.1-flash không có mức tối đa được công bố. Một trong số này có thể được định cỡ cho việc tạo dài, còn cái kia thì không.

• Chỉ số — 41 so với 42.

• Thông lượng — 211,0 token mỗi giây so với 53,0 trên API của nhà cung cấp, 150,6 đo được trên các route của chúng tôi.

• Trọng số — độc quyền, không có giấy phép, so với mở theo MIT.

• Phương thức — chỉ văn bản so với văn bản, hình ảnh và video đầu vào.

• Giá — 0,30 USD / 0,90 USD cho mỗi triệu token đầu vào / đầu ra, so với 0,15 USD / 0,50 USD trên API của Z.ai.

Cách thực sự chạy so sánh này

GLM-5.3-Flash hiện đã có trên danh mục OrcaRouter, được niêm yết ở mức $0.075 mỗi triệu token đầu vào, $0.25 mỗi triệu token đầu ra và $0.0173 mỗi triệu lượt đọc bộ nhớ đệm — hãy đọc thẻ trực tiếp thay vì đoạn này, vì giá phục vụ thay đổi và thỏa thuận chuyển tiếp giá nghĩa là thay đổi giá từ nhà cung cấp sẽ được phản ánh về phía chúng tôi trong cùng ngày. Giá trị của thỏa thuận đó cho cặp so sánh cụ thể này là việc GLM-5.3-Flash có tính mở và lợi thế về giá là hai điều khiến nó trở thành mặc định hợp lý, còn một tuyến đóng với mức cộng thêm 0% là cách bạn tiếp tục kiểm thử Ling-3.1-flash so với nó mà không cần thêm một mối quan hệ nhà cung cấp.

Ling-3.1-flash không có trong danh mục của chúng tôi — tra cứu trên API mô hình công khai của chúng tôi trả về không tìm thấy đối với mô hình thuộc InclusionAI, và bài viết này sẽ không ngụ ý rằng chúng tôi cung cấp nó. Nó chạy qua API riêng của Ant và các nền tảng bên thứ ba mang bản phát hành, đó là phạm vi khả dụng trung thực của nó.

Hình thái hữu ích của sự so sánh này không phải là "hoặc cái này hoặc cái kia". GLM-5.3-Flash mở, rẻ nhất, đa phương thức, đáng tin cậy hơn với các câu hỏi tri thức và khả dụng qua 23 nhà cung cấp — đó là một lối đi mặc định. Lợi thế của Ling-3.1-flash nằm ở thông lượng và TTFT trên các vòng lặp tác tử, còn cái giá phải trả là nó đóng, chỉ hỗ trợ văn bản, đắt hơn và có thể tiếp cận qua ít cửa hơn. Hãy định tuyến công việc tương tác và nhạy cảm với độ trễ về phía mô hình nhanh, giữ công việc theo lô, nặng về tri thức và đa phương thức trên mô hình mở, và đặt một phương án dự phòng ở giữa chúng để một upstream chậm không biến thành một sản phẩm chậm.

Chọn cái nào?

Nếu tiêu chí đánh giá của bạn là năng lực, chi phí, tính mở và phương thức, {{1}}GLM-5.3-Flash{{/1}} thắng trong cuộc đối đầu này và không hề sít sao — điểm chỉ số cao hơn, hồ sơ độ tin cậy tri thức trong phân khúc, GPQA Diamond 0.0, trọng số MIT, đầu vào video, giá bằng một nửa, và {{2}}23{{/2}} phía sau. Nếu tiêu chí của bạn bao gồm người dùng phải chờ bao lâu hoặc một tác vụ có thể thực hiện bao nhiêu lệnh gọi tuần tự, {{3}}Ling-3.1-flash{{/3}} là mô hình hoàn thành, và tốc độ sinh gấp bốn lần của nó không phải là sai số làm tròn trong một vòng lặp agent.

Điều có thể giải quyết dứt điểm chuyện này là một chi tiết về khả năng phục vụ mà không nhà cung cấp nào công bố ở dạng có thể so sánh được: thông lượng thực tế phân phối trên khối lượng công việc của bạn, qua nhà cung cấp của bạn. Cả hai mô hình đều đáp ứng cùng một định dạng chat-completions tương thích với OpenAI, nghĩa là chuyển đổi giữa chúng chỉ là một thay đổi cấu hình chứ không phải một cuộc di trú — và với hai mô hình cách nhau một điểm chỉ số cùng hệ số gấp bốn lần về tốc độ, việc đo con số đó trên lưu lượng của chính bạn là cách tận dụng một buổi chiều tốt hơn là đọc thêm một dòng bảng điểm chuẩn.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash, in English, captured 2026-10-07. The header reads 'GLM 5.3 Flash', 'ctx 1M tokens', 'Max output 128K', inputs 'text + image + video' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-08-26. Four rounded stat tiles read '$0.07', '$0.25', '4.20 s' and '10.00 s' — the input and output rates rendered to two decimals, then the median first-token latency and another latency figure. The description states '320B total / 18B active parameters, 1M-token context, text + image + video in, text out.' The PRICING panel lists 'Input / 1M tokens $0.075', 'Output / 1M tokens $0.250' and 'Cache read / 1M $0.017'. A code sample shows base_url https://api.orcarouter.ai/v1 with model 'z-ai/glm-5.3-flash'.Screenshot of the Artificial Analysis model page for GLM 5.3 Flash, in English, captured 2026-10-07, marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 42, 53.0 output tokens per second, $0.25 cost per Intelligence Index task, 180M output tokens generated across the index, input $0.15 with an 83% cache discount and output $0.50 per 1M tokens, a 1M context window, text and image input, 320B total parameters with 18.8B active parameters, and a licence of MIT with weights on Hugging Face. The summary line calls the model 'notably slow (75)'.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày