Thẻ tiêu đề hero cho bài viết 'Ox Alpha', với phụ đề 'Trang tham chiếu chuẩn cho bí danh tàng hình đằng sau GLM-5.3-Flash của Z.ai', các chip ghi 'Được xem trước dưới tên Ox Alpha từ ngày 20 tháng 8 năm 2026', 'Công bố ngày 26 tháng 8 năm 2026', '320B tổng / 18B hoạt động, ngữ cảnh 1M' và 'Giấy phép MIT, trọng số mở', cùng dòng chân trang ghi 'Envelope, các phương thức, bảng giá, bề mặt endpoint và các benchmark - đã xác minh 2026-09-28'. Logo OrcaRouter được ghép vào góc dưới bên phải.
Guides & Insights

Ox Alpha: Bảng thông số kỹ thuật đầy đủ cho Mô hình Stealth hiện đã phát hành dưới tên GLM-5.3-Flash

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ox Alpha là tên ẩn danh mà GLM-5.3-Flash từng được giới thiệu trước dưới tên đó, nó được công bố vào ngày 26 tháng 8 năm 2026, và đây không phải là một mô hình bạn có thể gọi hôm nay. Danh mục xem trước từng mang tên Ox Alpha không còn phục vụ nó nữa; mô hình bên dưới có một trang nhà cung cấp, trọng số theo giấy phép MIT, một bảng giá đã công bố và một bề mặt API đã được ghi tài liệu, tất cả đều thuộc về Z.ai. Trang này là tài liệu tham chiếu cho mô hình đó — phạm vi, các phương thức, bảng giá, bề mặt endpoint, mọi con số benchmark đã công bố kèm theo bản sửa đổi hoặc harness gắn với nó, và, bởi vì bí danh đó vẫn cho ra một kết quả tìm kiếm sơ sài và gây nhầm lẫn, một tuyên bố rõ ràng về những gì không được ghi tài liệu ở bất kỳ đâu. Toàn bộ nội dung dưới đây được đọc vào ngày 2026-09-28 từ tài liệu mô hình và trang định giá của chính Z.ai, từ model card của Z.ai trên Hugging Face, từ Artificial Analysis, và từ danh mục của chính chúng tôi; các con số do nhà cung cấp công bố và các con số do một bên độc lập đo lường được dán nhãn riêng, và không có gì ở đây được suy ra từ sự tương đồng.

Ngày nay, cái tên Ox Alpha dùng để chỉ điều gì

Bí danh đã bị ngừng sử dụng, và nhà cung cấp chính là bên đã ngừng nó. Tài liệu của chính Z.ai cho GLM-5.3-Flash nói rằng mô hình đã được thử nghiệm ẩn danh dưới tên ox-alpha trước khi phát hành, để thu thập phản hồi người dùng, và rằng bản chạy ẩn danh đó đã trở thành mô hình phổ biến nhất của tuần ấy. Các mốc thời gian có thể xác định được thì ngắn gọn và cụ thể: danh mục ẩn cho thấy Ox Alpha được phát hành vào ngày 20 tháng 8 năm 2026, còn màn tiết lộ diễn ra vào ngày 26 tháng 8 — cùng ngày mà trang tài liệu của Z.ai ghi và cùng ngày phát hành mà danh mục của chúng tôi ghi nhận cho z-ai/glm-5.3-flash.

Từ đó suy ra hai điều, và cả hai đều quan trọng đối với một độc giả đã tìm kiếm cái tên đó.

• Bí danh không phải là tuyến. Danh mục của chúng tôi trả về "model not found" cho tra cứu stealth/ox-alpha, đọc ngày 2026-09-28. Không có gì để gọi dưới tên đó, vì sản phẩm của nhà cung cấp mang tên nhà cung cấp.

• Cũng không có kho trọng số nào do nhà cung cấp sở hữu dưới bí danh đó. Việc tìm kiếm Hugging Face cho ox-alpha trả về các bản tải lên do cộng đồng tạo trong giai đoạn tàng hình vào cuối tháng 8 năm 2026, cùng một kho chỉ có thẻ mô hình từ ngày 27 tháng 9 năm 2026, không chứa trọng số và trỏ đến bản phát hành chính thức của Z.ai. Tên kho là nhãn do người tải lên tự chọn; nó không phải là tài liệu chứng minh cho bất cứ điều gì. Tổ chức của chính Z.ai công bố mô hình dưới tên zai-org/GLM-5.3-Flash, với kho được tạo vào ngày 2026-08-25 theo UTC.

Câu hỏi về nhà cung cấp vốn chi phối tuần lễ ẩn danh đã được giải đáp, và nó khép lại theo cách thông thường: một phòng thí nghiệm đã đứng ra và ghi tên mình lên mô hình. Điều còn lại là một bản đặc tả, và đó là nội dung mà trang này đề cập. Câu chuyện khám phá — việc lấy dấu vân tay diễn ra trước khi tiết lộ, dòng dõi mô hình ẩn danh mà nó thuộc về, và việc công bố phần cứng phục vụ đi kèm với nó — nằm trong bài viết trước đây của chúng tôi về cuộc điều tra Ox Alpha, và trang này không tranh luận lại bất kỳ điều nào trong đó.

Phong bì, như được nhà cung cấp ghi trong tài liệu.

A screenshot of Z.ai's official developer documentation page for GLM-5.3-Flash, showing the Model Overview section with the four spec rows on the right reading Input Modality 'Video / Image / Text / File', Output Modality 'Text', Context Length '1M' and Maximum Output Tokens '128K', alongside vendor-stated architecture notes describing 320B total parameters with 18B activated and a hybrid sparse-and-linear attention design that reduces attention computation and KV cache by 3.01x and 4.44x versus GLM-5.3.

Đây là những số liệu do Z.ai báo cáo, được đọc từ chính trang tài liệu của nhà cung cấp vào ngày 2026-09-28, và ba trong bốn chiều kích của phong bì được xác nhận độc lập — hồ sơ mô hình của Artificial Analysis mang cùng tổng 320B, 18B hoạt động, ngữ cảnh 1,000,000-token và giấy phép MIT, còn thẻ danh mục của chúng tôi mang giới hạn ngữ cảnh và đầu ra.

• Cửa sổ ngữ cảnh — 1.000.000 token (tài liệu Z.ai; Artificial Analysis; thẻ danh mục của chính chúng tôi, trong đó liệt kê 1.000.000)

• Đầu ra tối đa — 128K token (tài liệu Z.ai); thẻ của chúng tôi ghi nhận 128.000

• Đầu vào — văn bản, hình ảnh, video và tệp (tài liệu Z.ai, đọc ngày 2026-09-28); thẻ của chúng tôi liệt kê văn bản, hình ảnh và video, và không tuyên bố có đầu vào tệp

• Đầu ra — chỉ văn bản, trên mọi nguồn

• Tham số — tổng cộng 320B với 18B được kích hoạt trên mỗi token (tài liệu và thẻ mô hình của Z.ai; Artificial Analysis ghi nhận độc lập 320B và 18B)

• Giấy phép — MIT, với trọng số được công bố trên Hugging Face (thẻ mô hình của nhà cung cấp; Artificial Analysis phân loại mô hình này là trọng số mở theo một giấy phép thoáng)

• Kiến trúc — sự kết hợp lai giữa attention thưa và attention tuyến tính, được Z.ai mô tả là mô hình tiên phong mã nguồn mở đầu tiên kết hợp cả hai, giúp giảm tính toán attention 3,01× và KV cache 4,44× so với GLM-5.3, cùng một bước IndexPool nén bốn vector khóa indexer thành một ở ngữ cảnh dài, và Manifold-Constrained Hyper-Connections cho hiệu quả mở rộng quy mô. Tất cả đều do nhà cung cấp công bố; không có đánh giá kiến trúc độc lập nào để dẫn chiếu.

• Huấn luyện trước — kho ngữ liệu đa phương thức 30 nghìn tỷ token (do Z.ai công bố). Nhà cung cấp không công bố con số tổng về khối lượng tính toán huấn luyện và cũng không có phân tách tham số theo từng lớp nào ngoài con số tiêu đề 320B/18B.

Một tuyên bố về phạm vi đã thu hẹp kể từ khi ra mắt, và tài liệu hiện tại mới là bản nên trích dẫn. Công bố về phần cứng phục vụ lưu hành hồi tháng 8 ước tính năng lực của tuần ẩn danh vào khoảng 100.000 chip Trung Quốc nội địa. Tài liệu của Z.ai như hiện được ghi cho biết mô hình được phục vụ "trên hàng chục nghìn bộ tăng tốc được phát triển trong nước", với mức cải thiện phục vụ end-to-end gấp 3 lần so với mức cơ sở của chính nhà cung cấp trên cùng phần cứng và chi phí trên mỗi token mà nhà cung cấp mô tả là tương đương với GPU NVIDIA phổ thông. Hàng chục nghìn là con số mà trang hiện nêu; con số lớn hơn là con số thời ra mắt. Cả hai đều là tuyên bố của công ty, không con số nào được kiểm toán độc lập, và hướng điều chỉnh là giảm xuống.

Bảng giá, và lý do vì sao số được phân phối mới là con số quan trọng

Trang định giá của Z.ai liệt kê GLM-5.3-Flash ở mức $0.15 cho mỗi triệu token đầu vào, $0.03 cho mỗi triệu token đầu vào được lưu trong bộ nhớ đệm và $0.50 cho mỗi triệu token đầu ra, cùng với hạng FlashX cùng dòng ở mức $0.37 / $0.075 / $1.25. Đó là giá niêm yết của nhà cung cấp, được đọc từ chính trang của nhà cung cấp vào ngày 28/09/2026.

Mức giá thực tế được áp dụng trên tuyến của chúng tôi hôm nay thấp hơn, và đây chính là điểm thực tiễn của mục này. Số liệu ghi nhận ngày 2026-09-28, thẻ OrcaRouter cho z-ai/glm-5.3-flash niêm yết giá đầu vào ở mức $0.075 mỗi triệu token, đầu ra ở mức $0.25 mỗi triệu và lượt đọc bộ nhớ đệm ở mức $0.0173 mỗi triệu. Đó chỉ bằng một nửa mức giá niêm yết của nhà cung cấp, trên cùng một mô hình, trong cùng một ngày — con số đã chiết khấu chứ không phải con số được quảng bá nổi bật, mà trên thẻ không hề có nhãn khuyến mãi nào. Bài viết trước đây của chúng tôi về mô hình này cũng ghi nhận khoảng cách tương tự sau khi thời gian khuyến mãi đã nêu kết thúc; quan sát đó vẫn đúng cho đến hôm nay, và chúng tôi vẫn không thể truy ra nguyên nhân, nên chúng tôi báo cáo con số được áp dụng và để ngỏ lý do.

Đầu vào được lưu đệm là điểm mà ba nguồn dữ liệu thể hiện sự khác biệt rõ rệt, một lời nhắc hữu ích rằng con số "$0.03" trong bảng không hẳn là mức giá mà bất kỳ ai thực sự phải trả. Trang của nhà cung cấp ghi $0.03 cho mỗi triệu token đầu vào được lưu đệm; hồ sơ mô hình của Artificial Analysis có mức giá truy cập bộ đệm là $0.026; tuyến của chúng tôi phục vụ các lượt đọc bộ đệm ở mức $0.0173. Cả ba đều được đọc vào hoặc ngay trước ngày 2026-09-28, và cả ba đều do nhà cung cấp hoặc nền tảng báo cáo. Chúng tôi trích dẫn con số niêm yết của nhà cung cấp như là con số niêm yết, và con số thực tế phục vụ như là số tiền mà người gọi thực sự bị tính.

Thực hiện phép tính trên một tác vụ agent đại diện — 100.000 token đầu vào và 10.000 token đầu ra, không có cache hit:

• Theo đơn giá niêm yết của nhà cung cấp — 100.000 token × $0,15/1M = $0,015, cộng 10.000 × $0,50/1M = $0,005, vậy $0,020 mỗi lần gọi

• Với mức giá mà route của chúng tôi cung cấp hôm nay — $0.0075 cộng $0.0025, tức $0.010 mỗi cuộc gọi, đúng một nửa

Đó chính là lý do cốt lõi để kiểm tra giá được cung cấp thay vì giá niêm yết trước khi bạn định cỡ một workload: trên một agent hoạt động dài hạn chạy hàng nghìn cuộc gọi mỗi ngày, sự khác biệt giữa hai con số đó chính là sự khác biệt giữa hai ngân sách. OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp với mức markup 0%, đó là lý do mức giảm giá mà nhà bán đang áp dụng hiển thị trên bảng giá của chúng tôi thay vì bị hấp thụ ở đâu đó trong khoảng giữa.

Các phương thức và bề mặt điểm cuối

Nhà cung cấp tài liệu hóa một dạng giao diện và hai mã model: glm-5.3-flash và glm-5.3-flashx, cả hai đều được phục vụ qua Chat Completion API. Hình ảnh được đưa vào dưới dạng một content block với type là image_url trên mảng nội dung của message, nhận vào hoặc một URL — mà nhà cung cấp khuyến nghị — hoặc một base64 data URL, và có thể gửi nhiều image block trong một message. Streaming được hỗ trợ, và Z.ai khuyến nghị bật stream và tool_stream cùng nhau cho các yêu cầu streaming. Tool calling, context caching và structured JSON output đều là những khả năng đã được tài liệu hóa; thinking được hỗ trợ nhưng, như phần tiếp theo giải thích, không phải là tùy chọn.

FlashX là một tầng phục vụ riêng của cùng một mô hình chứ không phải một năng lực riêng: Z.ai ghi nhận nó đạt 200 token mỗi giây, và nêu rằng nó chưa khả dụng trên GLM Coding Plan. Đây không phải là tầng mà danh mục của chúng tôi cung cấp, và nó không phải là thứ mà các số liệu trên trang này mô tả.

Trên tuyến của chúng tôi, bề mặt endpoint hẹp hơn và đáng được nêu chính xác. Thẻ cho z-ai/glm-5.3-flash hiển thị POST /v1/chat/completions — chỉ chat completions, không có endpoint giao thức thứ hai — và chấp nhận reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens và stop. Các chip năng lực trên thẻ là vision, tools, JSON và reasoning. Ngữ cảnh là 1.000.000 token và đầu ra tối đa là 128.000, khớp với tài liệu của nhà cung cấp.

Nỗ lực và tư duy: những thiết lập ấn định mọi con số benchmark

Đây là phần của đặc tả ảnh hưởng nhiều nhất đến cách bạn đọc điểm số, và nhà cung cấp ghi lại nó một cách chính xác. GLM-5.3-Flash nhận tham số reasoning_effort với ba mức — low, high và max — và mặc định là max nếu bạn không truyền gì, hoặc nếu bạn truyền bất cứ thứ gì không phải low hay high. Không thể tắt chế độ suy nghĩ: nhà cung cấp nêu rõ rằng thinking.type chỉ hỗ trợ enabled. Cờ clear_thinking của chat template mặc định là false, và Z.ai khuyến nghị truyền rõ ràng nó là true cho các tình huống chat. Các thiết lập lấy mẫu được nhà cung cấp khuyến nghị là temperature 1 và top_p 0.95, và họ nói thẳng rằng việc tái lập benchmark và bảng xếp hạng nên giữ nguyên mức max mặc định.

Đọc hai dữ kiện đó cùng nhau, và hệ quả đối với bất kỳ ai đang so sánh các con số là không thể tránh khỏi: một điểm số được nêu mà không kèm mức effort thì không phải là một phép đo hoàn chỉnh, bởi vì các thiết lập low, high và max là những điểm vận hành khác nhau của cùng một mô hình, và mặc định là mức đắt nhất trong ba. Card của chúng tôi hiển thị reasoning và reasoning_effort trong số các tham số được hỗ trợ, nên thiết lập này có thể tiếp cận được thông qua route, chứ không chỉ thông qua nhà cung cấp.

Bảng đánh giá chuẩn, kèm theo bản sửa đổi được đính kèm.

Z.ai công bố một bảng đánh giá cho GLM-5.3-Flash, và bảng này hoàn toàn do nhà cung cấp tự báo cáo — hồ sơ độc lập của Artificial Analysis không tái lập được những dòng này. Các con số nổi bật về lập trình và tác tử của nhà cung cấp là DeepSWE v1.1 đạt 63.4 so với 46.2 của GLM-5.2, và AutomationBench v1.0.6 đạt 48.8 so với 26.2 của GLM-5.2. Phần còn lại của bảng, như danh mục của chúng tôi ghi nhận với Z.ai là nguồn được nêu tên: Humanity's Last Exam với công cụ 55.3, Agents' Last Exam 26.3, NL2Repo 56.3, Chartography với công cụ 78, CharXiv reasoning với công cụ 89.4, và về phía thị giác là MMVU 80.5, MVBench 77.8 và BabyVision 53.4.

Hai dòng của nhà cung cấp xứng đáng được đưa các chú thích cuối trang của chúng vào ngay trong câu, vì đây là những dòng mà người đọc có khả năng trích dẫn nhất mà không kèm theo chúng. Đánh giá lập trình nội bộ của Z.ai, Z.ai Code Bench v1.0, xếp GLM-5.3-Flash ở mức 29,0 khi nỗ lực tối đa so với Claude Opus 4.8 ở mức 29,5 — gần như ngang bằng trên chính bộ kiểm thử của nhà cung cấp, chạy trên Claude Code 2.1.207, do nhà cung cấp báo cáo. Đó không phải là một so sánh độc lập và cũng không phải là một so sánh có mức nỗ lực tương ứng do bên thứ ba thực hiện; đó là việc Z.ai đánh giá mô hình của mình so với một đối thủ trên chính đánh giá của họ. Và nhà cung cấp trích dẫn Artificial Analysis Intelligence Index là 57 với $0,045 mỗi tác vụ, ghi rõ bản sửa đổi là v4.1.1.

Con số cuối cùng đó cần được tách khỏi những gì Artificial Analysis công bố ngày hôm nay, bởi vì không thể đặt hai con số đó cạnh nhau như thể hiện một sự thay đổi. Trang riêng của Artificial Analysis về GLM-5.3-Flash, đọc ngày 2026-09-28, báo cáo Chỉ số Thông minh là 41.8 trên Chỉ số v4.3.2, được ghi nhận ở mức nỗ lực tối đa. v4.3.2 bao gồm mười bài đánh giá — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience và AA-LCR v1.1 — còn v4.1.1 thì không. Hai lần sửa đổi chỉ số, hai bộ nhiệm vụ, hai con số. Cả hai đều không sai; chúng không phải là cùng một phép đo, và việc trích dẫn con số 57 bên cạnh con số 41.8 như thể mô hình đã thay đổi sẽ là một sai lầm theo cả hai hướng.

Điều mà hồ sơ độc lập thực sự chứng thực là phạm vi tổng thể chứ không phải các điểm số: Artificial Analysis ghi nhận một cách độc lập 320B tổng số tham số, 18B được kích hoạt, cửa sổ ngữ cảnh 1.000.000 token, giấy phép MIT, trọng số mở và ngày phát hành 2026-08-26, đồng thời liệt kê mức giá niêm yết của nhà cung cấp là 0,15 USD cho đầu vào và 0,50 USD cho đầu ra trên mỗi triệu token, với mức giá trúng bộ nhớ đệm là 0,026 USD. Ở chỗ nhà cung cấp công bố điểm số mà bên độc lập không công bố, chúng tôi nói rõ điều đó; ở chỗ bên độc lập xác nhận một thông số kỹ thuật, đó là loại dữ kiện mạnh nhất trên trang này.

Ở đây không có một so sánh đối đầu trực tiếp tương xứng, và nói thẳng điều đó hữu ích hơn là tạo ra một so sánh như vậy. Chưa ai công bố một lần chạy GLM-5.3-Flash đối đầu với Claude Opus 4.8, GPT-6 Sol hay Grok 4.7 ở một mức effort được nêu rõ trên cùng một harness — so sánh của chính Z.ai là trên bench riêng của họ, ở mức effort tối đa, đối chiếu với mức mặc định của một đối thủ. Cho đến khi điều đó thay đổi, so sánh trung thực giữa mô hình này với bất kỳ thứ gì khác là ở giá, envelope và bề mặt endpoint, tức ba thứ trên trang này mà ai cũng có thể đọc ra từ cùng những con số.

Những gì không được ghi chép, nói rõ ràng

Một trang tham chiếu cho một mô hình có bề mặt thông tin mỏng chỉ hữu ích nếu nó trung thực về những khoảng trống, và trang này có vài khoảng trống như vậy.

• Không có thời điểm cắt kiến thức nào từ nhà cung cấp. Tài liệu của Z.ai và thẻ mô hình trên Hugging Face đều không nêu thời điểm đó, còn hồ sơ của Artificial Analysis để trống trường này. Các ước tính từ cửa sổ stealth là công việc của cộng đồng, không phải con số của nhà cung cấp, và trang này không nhắc lại một con số nào như thể đó là con số của nhà cung cấp.

• Không có chú thích cuối trang về harness cho phần lớn bảng benchmark. Thẻ mô hình thì có chú thích cuối trang cho lần chạy HLE with-tools — temperature 1.0, top_p 0.95, độ dài sinh tối đa 163.840 token, đánh giá ở ngữ cảnh lên tới 300.000 token với một chiến lược quản lý ngữ cảnh, và GPT-5.6 Luna ở mức effort trung bình làm mô hình giám khảo — cùng với NL2Repo và DeepSWE, mà nhà cung cấp nói rằng đã được chạy với harness mini-swe-agent. Các hàng còn lại chỉ là những con số phần trăm trống trơn, không kèm harness hay effort.

• Không có lời giải thích nào về chênh lệch giá của đầu vào đã cache. Ba con số cho cùng một đại lượng trên cùng một mô hình, mà không nguồn nào nói rõ tại sao chúng lại khác nhau.

• Không có đánh giá chuẩn độc lập nào về giai đoạn phục vụ ẩn danh. Danh mục tàng hình đã biến mất; bất cứ thứ gì nó đo được đều không thể đo lại, và không bên thứ ba nào công bố một lần chạy đối với bí danh khi nó còn hoạt động.

• Không có so sánh với bên thứ ba ở mức nỗ lực tương đương, vì lý do đã nêu ở trên.

• Không có xác nhận từ nhà cung cấp về số lượng chip thời điểm ra mắt. Tài liệu ghi rằng có hàng chục nghìn bộ tăng tốc nội địa; con số 100.000 không xuất hiện trên trang.

Chốt lại: những gì danh mục của chúng tôi cung cấp, đã được xác minh hôm nay

A single-column reference scoreboard titled 'GLM-5.3-Flash, the model behind Ox Alpha', with six rows reading 'Context: 1,000,000 tokens', 'Max output: 128K tokens', 'Input / output: text, image, video in / text out', 'Parameters: 320B total, 18B active, MIT licence', 'Vendor list price: $0.15 in / $0.50 out per 1M, $0.03 cached', and 'Served on OrcaRouter: $0.075 in / $0.25 out per 1M'. A footer line reads 'Z.ai-reported envelope and list price; OrcaRouter card read 2026-09-28; Artificial Analysis independently confirms 320B/18B, 1M context and MIT.' The OrcaRouter logo is composited in the bottom-right corner.

Mô hình đằng sau Ox Alpha đã có mặt trong danh mục của chúng tôi dưới tên riêng của nó, được kiểm tra hôm nay thay vì chỉ giả định. Một lần đọc API mô hình OrcaRouter cho z-ai/glm-5.3-flash vào ngày 2026-09-28 đã trả về đầy đủ thẻ mô hình: ngữ cảnh 1.000.000 token, đầu ra tối đa 128.000, đầu vào văn bản, hình ảnh và video với đầu ra văn bản, các chip khả năng gồm vision, tools, JSON và reasoning, ngày phát hành 2026-08-26, không bị deprecated và không bị delisted, giá $0.075 mỗi triệu token đầu vào, $0.25 mỗi triệu token đầu ra và $0.0173 mỗi triệu token đầu vào được cache, qua một endpoint duy nhất POST /v1/chat/completions.

Phép đo playground bảy ngày của chính chúng tôi trên thẻ đó, trong cùng khoảng thời gian, cho kết quả 61,8 token đầu ra mỗi giây, thời gian đến token đầu tiên p50 là 7,39 giây và tỷ lệ lỗi 1,47%. Đây là những con số do chính chúng tôi đo về dịch vụ của mình, không phải số liệu từ nhà cung cấp và cũng không phải các đánh giá độc lập, và vì lý do đó, chúng là những số liệu tốc độ duy nhất trên trang này.

Bản thân alias không nằm trên route. Nếu bạn đến đây sau khi tìm kiếm Ox Alpha, model cần gọi là z-ai/glm-5.3-flash, và dạng request chính là dạng được mô tả ở trên. Nó dùng cùng một key như mọi thứ khác trong danh mục — một API cho hơn 200 model, giá của nhà cung cấp được chuyển nguyên vẹn, không cộng thêm markup, và tự động chuyển đổi dự phòng nếu nhà cung cấp bị treo, nhờ đó một model bạn đang thử nghiệm không nhất thiết phải là model mà đường chạy production của bạn phụ thuộc vào.

A screenshot of the OrcaRouter model page for Z.ai GLM-5.3-Flash (z-ai/glm-5.3-flash), showing the model name and provider, a 1M-token context window with 128K maximum output, text, image and video input with text output, a stat strip reading $0.075 input and $0.25 output per million tokens, the capability chips Vision, Tools, JSON and Reasoning, a release date of 2026-08-26 and a supported-endpoint line reading POST /v1/chat/completions, with a code sample against the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

Một lời làm rõ về việc trang này là gì, vì một độc giả đến từ chính tên của mô hình xứng đáng được điều đó. Đây là trang tham chiếu cho một mô hình đã có trong danh mục, không phải báo cáo ra mắt: GLM-5.3-Flash có từ ngày 26 tháng 8 năm 2026, và vị trí của nó ở đây dựa trên việc cái tên Ox Alpha liên tục được tìm kiếm mà không có trang riêng nào để dẫn tới, chứ không dựa trên độ mới của bản phát hành. Ngày ở trên được dùng để định ngày cho mô hình, không phải như một tin tức. Điều có thể thay đổi trang này là một trong bốn thứ — một lần chạy benchmark độc lập ở mức nỗ lực được nêu rõ, một thời điểm cắt kiến thức do nhà cung cấp công bố, một thay đổi trong mức giá cung cấp, hoặc một quyết định của Z.ai công bố số lượng chip thời điểm ra mắt thực sự là bao nhiêu. Cho đến khi một trong những điều đó xảy ra, thông số kỹ thuật ở trên là toàn bộ những gì nhà cung cấp tài liệu hóa, và những khoảng trống được liệt kê trong phần trước cũng là một phần của câu trả lời chẳng kém gì các con số.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày