
Lấy mẫu phân mảnh theo lô của Qwen4Exp: bên trong vLLM PR #61018, và những gì nó nói về Qwen 4
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Con số đáng chú ý nhất trong pull request #61018 của vLLM là một khoản hao hụt: 1,5%. Đó là giới hạn trên mà chính tác giả tự đặt cho thay đổi của mình — khoảng 0,6 đến 0,8 mili giây tiết kiệm được trong một bước trung bình 42 mili giây, đo trên một cỗ máy mà anh không sở hữu, trong một bản vá mà anh hoàn toàn không thể chạy nổi. Pull request mang tiêu đề "[Model] Qwen4Exp: support batch-sharded sampling (compute_logits_local)" và được mở ngày 10/10/2026 bởi cộng tác viênkimseunghyun-kr, bổ sung ba dòng mã mô hình vào hai tệp để kiến trúc Qwen4Exp có thể đi theo một đường lấy mẫu mà vLLM đã phát hành hồi tháng Tám. Đây là một bản nháp. Nó gồm 14 dòng mã mô hình cộng thêm 57 dòng kiểm thử. Vậy mà nó vẫn đáng để đọc kỹ, vì những gì ba dòng đó đang vá lên: Qwen4Exp là kiến trúc bên trong Qwen3.8-Flash-Next, mô hình trọng số mở 125 tỷ tham số mà nhà cung cấp công bố ngày 24/08/2026 như "một bản xem trước thử nghiệm của kiến trúc sẽ làm nền tảng cho Qwen4" — và một lỗi hai đường trong nửa chỉ xử lý văn bản của kiến trúc đó đúng là kiểu chi tiết mà bạn chỉ có thể biết được khi quan sát tầng phục vụ chứ không phải qua bài đăng ra mắt.
Để nói rõ ràng, không mập mờ về cách định khung, vì điều này quan trọng ở đây: bản thân Qwen 4 chưa được phát hành. Nhà cung cấp đã nêu tên bốn hạng Qwen 4 — Qwen 4 Max, Flash, Plus và 27B — tại hội nghị Apsara của mình vào ngày 2026-09-22, và chưa công bố trọng số, mã định danh, giá, độ dài ngữ cảnh hay benchmark nào cho bất kỳ hạng nào trong số đó. Không có nội dung nào dưới đây là một bản phát hành. Đây là bản tổng hợp những gì chúng ta biết đến nay về một pull request dạng bản nháp duy nhất, và mọi thứ trong đó mang một con số hoặc là dấu thời gian bạn có thể kiểm chứng, hoặc là một số liệu mà người đóng góp đã tự nhập vào phần nội dung PR của chính mình, hoặc là một giá trị được đọc ra từ một tệp cấu hình mô hình công khai.
Lấy mẫu phân mảnh theo lô là gì, trong một đoạn văn.
Song song tensor chia trọng số của một mô hình trên nhiều GPU; phép chiếu từ vựng là tensor đơn rộng nhất trong stack, nên mỗi rank thường chỉ tính phần từ vựng của riêng nó — rồi sau đó mọi rank all-gather, để mỗi rank cuối cùng giữ toàn bộ logits cho mọi yêu cầu trong batch. Lấy mẫu phân mảnh đảo ngược trao đổi đó. Thay vì nhân bản từ vựng trên các rank, nó phân mảnh batch: mỗi rank lấy mẫu một phần của các yêu cầu, và các rank trao đổi phần từ vựng với nhau qua all-to-all. Tài liệu CLI của chính vLLM mô tả cờ này một cách rõ ràng — "Mỗi rank lấy mẫu một phần của batch thay vì mọi rank đều lấy mẫu toàn bộ batch đó" — và nêu các ràng buộc: --enable-batch-sharded-sampling mặc định là False, yêu cầu tensor_parallel_size lớn hơn 1, ít nhất tensor_parallel_size chuỗi tối đa, và một max_logprobs không âm. Dòng cuối cùng của tài liệu đó là điểm móc mà pull request này bám vào: "Các mô hình chọn tham gia bằng cách triển khai compute_logits_local."
Bản thân tính năng này không mới. vLLM đã hợp nhất nó dưới dạng PR #50465 — "[Model Runner V2] batch-sharded sample," của Giancarlo Delfin — vào ngày 24-08-2026, cùng ngày trọng số của Qwen3.8-Flash-Next được đưa lên. Động lực ở đây là bộ nhớ và độ trễ: việc hiện thực hóa toàn bộ logits mục tiêu tốn vào khoảng kích thước batch × (token suy đoán + 1) × kích thước từ vựng, và việc sharding cắt giảm lượng cấp phát đó theo hệ số bằng bậc song song tensor, đồng thời cho phép công việc top-k và top-p của bộ lấy mẫu chạy song song. Đây là bước tạo tiền đề, không phải đích đến: chính nội dung của PR đánh dấu draft-logits được sharding là công việc trong tương lai.
Tại sao ba dòng lại là toàn bộ công việc
![GitHub page for vllm-project/vllm pull request 61018, titled "[Model] Qwen4Exp: support batch-sharded sampling (compute_logits_local)", showing the Draft badge, a three-file diff with 71 additions, the qwen label and the PR body.](https://cms.orcarouter.ai/api/media/file/2-1829.png)
Đây là lỗi thực sự, và nó là một lỗi hay vì nó vô hình từ bên ngoài mã. Cách triển khai Qwen4Exp của vLLM được cung cấp dưới dạng hai lớp. Qwen4ExpForConditionalGeneration là lớp bao bọc ngôn ngữ-thị giác — một tháp thị giác Qwen3-VL được gắn vào mô hình ngôn ngữ — và Qwen4ExpForCausalLM là đường chỉ văn bản. Lớp bao bọc kế thừa compute_logits_local từ Qwen3_5ForConditionalGeneration, lớp này chuyển tiếp lời gọi xuống language_model.compute_logits_local. Nhưng lớp mô hình ngôn ngữ mà lớp bao bọc đang trỏ tới lại chưa từng định nghĩa phương thức đó.
Vậy nên hai nhánh nằm ở hai trạng thái khác nhau. Một triển khai thị giác-ngôn ngữ của Qwen3.8-Flash-Next có thể đi theo nhánh sharded; còn triển khai chỉ văn bản thì không, vì phương thức mà wrapper ủy thác không tồn tại. Bản sửa lỗi là một phương thức duy nhất, giống hệt nhau trong các bản sao tệp mô hình của NVIDIA và AMD:
• Phương thức trả về self.logits_processor(self.lm_head, hidden_states, skip_gather=True) — shard từ vựng riêng của rank, không có gather và không có việc hiện thực hóa toàn bộ từ vựng trên bất kỳ rank nào.
• Nó tuân theo thứ mà PR gọi là “cùng một mẫu 3 dòng như Qwen3.5 và MiniMax M3”, một điểm đáng để dừng lại suy ngẫm: hai họ mô hình khác trong cùng kho lưu trữ đã chọn tham gia từ trước. Qwen4Exp chỉ đơn giản là trường hợp chưa tham gia mà thôi.
Tệp kiểm thử là nơi dễ kiểm tra tính trung thực của bản vá nhất, và là nơi các giới hạn của nó dễ thấy nhất. Nó có 57 dòng, được tham số hóa trên cả hai mô-đun NVIDIA và AMD, và không tải xuống mô hình nào. Trình trợ giúp xây dựng lớp bằng object.__new__, thay thế nn.Identity cho phần đầu mô hình ngôn ngữ, và cài đặt một bộ xử lý logits giả trả về đầu vào của nó cộng thêm một trong khi ghi lại cách nó được gọi. Bài kiểm thử đầu tiên khẳng định rằng 4.0 đưa vào sẽ cho ra 5.0 và rằng lời gọi được ghi lại có mang skip_gather=True. Bài kiểm thử thứ hai bọc mô hình ngôn ngữ trong lớp tạo sinh có điều kiện và khẳng định việc ủy quyền được thực thi đúng. Đó là một bài kiểm thử thực sự về phần kết nối và không kiểm thử gì khác — không có kernel nào được chạy, không có ranh giới rank nào bị vượt qua, và số lượng GPU tham gia là bằng không.
Cả hai sự thật đó đều được nêu rõ trong PR chứ không bị chôn đi. Chính docstring của tệp kiểm thử gọi Qwen4Exp là "một test double chỉ chạy CPU, nhỏ xíu." Phần xác thực của tác giả ghi nhận rằng anh ấy hoàn toàn không thể import mô hình trên thiết lập macOS của mình, vì bản dựng transformers mà anh ấy có không kèm theo Qwen4ExpConfig. Lần chạy CUDA vẫn còn đang chờ. Bài benchmark end-to-end — bộ dữ liệu MLPerf agentic, 20 phiên đồng thời, ba nhánh 60 phút — vẫn còn đang chờ. Đường đi logits của chính MTP drafter được đánh dấu là chưa được kiểm tra. LoRA đã bị cờ upstream từ chối rồi, nên nó nằm ngoài phạm vi chứ không phải là một hồi quy. Ngoài ra còn có một dòng tiết lộ rằng bản nháp được viết với sự hỗ trợ của AI, và trailer của commit ghi Claude Opus 5.5 là đồng tác giả, đây là kiểu công bố thông tin lẽ ra phải bình thường trong một stack cỡ này nhưng phần lớn lại không như vậy.
Ước tính 1,5%, và các phép đo mà nó nằm cạnh
Ước tính của người đóng góp là một nsys trace ở 16 phiên đồng thời trên Qwen3.8-Flash-Next-FP8 với song song tensor 8 và song song chuyên gia trên tám thẻ A100-SXM4-40GB: khoảng 1,6 mili giây trong một bước 42 mili giây, được cắt giảm xuống còn khoảng một phần ba mức đó, để đạt mức tăng từ đầu đến cuối từ 1,5 đến 2%. Con số đáng chú ý của ông ấy là phép tính — 0,6 đến 0,8 ms trên 42 ms. Hãy lưu ý điều gắn với đó: 42 ms là một con số độ trễ giữa các token, vì vậy mức cắt 1,7% là mức cắt 1,7% trên thời gian sinh token, chứ không phải là một tuyên bố về thông lượng nói chung.
So sánh trung thực là so với chính những con số đã được hợp nhất của tính năng gốc, bởi vì chúng đã được đo từ đầu đến cuối bởi người có phần cứng. Trong các lần chạy Speed-Bench 2K/2K được công bố trong PR #50465, lấy mẫu phân mảnh theo lô đã đưa DeepSeek V4 với DSpark ở 7 token suy đoán và độ đồng thời 64 từ 2,62 lên 2,66 yêu cầu mỗi giây — mức tăng thông lượng 1,53% — với độ trễ trung vị giữa các token giảm 3,09% và thời gian đến token đầu tiên tăng 1,45%. Trên MiniMax M3 với DSpark ở 8 token suy đoán, thông lượng yêu cầu tăng 5,38% và TPOT trung vị giảm 8,33%, từ 15,61 xuống 14,31 mili giây. Và cùng kế hoạch đó cũng ghi lại những chỗ nó không giúp ích: ở độ đồng thời từ 4 đến 16, các lần chạy cho kết quả đi ngang đến hơi âm, với nhánh độ đồng thời 16 giảm 0,54% về thông lượng và 1,89% về độ dài chấp nhận.
Đó là mẫu hình cần ghi nhớ mang theo. Lấy mẫu phân mảnh (sharded sampling) mang lại lợi ích khi việc lấy mẫu nặng và batch rộng — độ tương tranh cao, nhiều token suy đoán, top-k và top-p thực sự làm việc — và tốn một chút khi batch đủ nhỏ để all-to-all chỉ còn là chi phí thuần túy. Ước tính 1,5% cho một mô hình chọn tham gia là nhất quán với điều đó, chứ không mâu thuẫn với nó: các con số 5,38% và 8,33% thuộc về những mô hình khác nhau với ngân sách suy đoán khác nhau, và mô hình trong PR này có cấu hình riêng, từ vựng 248.320 token riêng và đường giải mã suy đoán riêng.
Không có phần nào trong đó được kiểm toán. Các con số của PR gốc là những lần chạy ghép cặp của một người đóng góp trên một nút; còn các con số smoke-test ở đây là một trace trên phần cứng mà tác giả không có, từ một bản sửa đổi của bản vá mà anh ấy nói chỉ được đo ở 16 phiên. Một phép đo từ một người đóng góp duy nhất, một cấu hình duy nhất là tín hiệu hữu ích về hướng và là cơ sở kém cho một kế hoạch dung lượng. Lý do chủ đề này đáng để viết đến cùng là hướng, chứ không phải con số thập phân.
Những gì cụm bản vá xung quanh nói về Qwen4Exp
Một PR nháp đơn lẻ sẽ không tạo nên một câu chuyện. Câu chuyện nằm ở chỗ Qwen4Exp đã trở thành một mục tiêu phục vụ bền vững trong tuần mà bản này được hợp nhất, và bản vá nhỏ nhất trong cụm đó chính là bản khiến quy luật trở nên dễ nhận thấy. Trong bảy ngày tính đến 2026-10-10, vLLM đã có, từ cùng người đóng góp đó và những người khác: một đường dẫn KV cache FP8 chính cho sparse attention trên Ampere, với dung lượng KV tăng 1,83× trên tám A100 và 1,87× trên bốn RTX 3090, cùng với số yêu cầu tăng khoảng 2,7× ở mức đồng thời 16, đổi lại là TPOT giải mã một luồng cao hơn khoảng 6%; một bản sửa lỗi cho padding W4A4 MoE ở tensor-parallel 1 và song song expert; một đường dẫn AMD tự động fallback khỏi các phép toán AITER FP8 MoE không được hỗ trợ và phục vụ bằng fp16; một bản sửa lỗi mang trạng thái tích chập ngắn PLE xuyên qua chế độ align; và một kernel giải mã giải nén bốn byte e4m3 mỗi lần trên mỗi thanh ghi trên sm_80. Một trong số đó, một bản tinh chỉnh lại kế hoạch QSA LL-GEMM hợp nhất M=4 của H200, đã được hợp nhất vào main vào ngày 2026-10-09.
Đọc toàn bộ danh sách đó như một chỉnh thể thì nó nói lên điều gì đó cụ thể. Kiến trúc Qwen4Exp — kiến trúc mà nhà cung cấp chưa phát hành — đang được tinh chỉnh cho Ampere, Hopper, ROCm và fp16 fallback cùng một lúc, trong một dự án hỗ trợ ngay từ ngày đầu cho những mô hình mà người ta thực sự có thể tải về. Lý do không có gì bí ẩn: Qwen3.8-Flash-Next là một mô hình có thật, có thể tải về, được dùng rất nhiều, và nó được xây dựng trên kiến trúc mà Qwen 4 sẽ dùng. Liệu các trọng số Qwen 4 có bao giờ xuất hiện với dáng vẻ như thế này hay không thì chưa biết, và nhà cung cấp chưa nói gì, nhưng phạm vi phục vụ đang được nới rộng công khai, và đó là thông tin có thể kiểm chứng theo một cách mà khung thời gian tháng 10 đến tháng 11 được đồn đại thì không.
Một phần hình dạng kiến trúc cũng được công khai, dành cho bất kỳ ai đọc tệp cấu hình thay vì đọc thông báo. Cấu hình của Qwen3.8-Flash-Next liệt kê bộ từ vựng 248.320 token trải trên 48 lớp, 512 expert với 10 expert được định tuyến cộng thêm một expert chia sẻ hoạt động cho mỗi token ở chiều rộng trung gian expert là 640, kích thước ẩn 2.560, và ngữ cảnh gốc 262.144 token được mô tả là có thể mở rộng tới một triệu. Đây là một mô hình lai: danh sách loại lớp xen kẽ ba khối attention tuyến tính với một khối attention đầy đủ, và các khối attention đầy đủ dùng đường attention thưa với một indexer một head nén key theo hệ số bốn và giữ ngân sách 2.048 vị trí. Có một bảng embedding theo từng lớp ở lớp 2, một embedding n-gram với bộ từ vựng 20 triệu mục — đó chính là bảng 47,7 GiB mà các patch khác trong cụm này đang bận host-staging — và một head MTP một lớp cho giải mã suy đoán. Tóm tắt của chính model card là “125B với 6B được kích hoạt, cộng thêm embedding n-gram 51B và MTP 4B.” Bộ từ vựng 248.320 mục chính là lý do khiến phép chiếu logits đáng để sharding ngay từ đầu.
Những gì điều này không thay đổi đối với bạn
Thật đáng để nói chính xác, vì một cụm bản vá dày đặc như thế này có thể đọc như một buổi ra mắt. Không có phần nào ở trên đã được hợp nhất, và một phần trong đó — phần việc Ampere FP8 KV cache — chưa được xác thực một cách rõ ràng trong CI vì CI của vLLM không có A100. Không có phiên bản vLLM nào đã phát hành mà bạn có thể cài đặt hôm nay có tùy chọn bật sharded-sampling của Qwen4Exp. Không có benchmark độc lập nào về hành vi phục vụ của Qwen3.8-Flash-Next dưới bất kỳ thay đổi nào trong số này; mọi con số được trích dẫn ở trên đều đến từ nội dung PR, khiến chúng được người đóng góp báo cáo và chưa được kiểm toán theo nghĩa cụ thể rằng chưa có bên thứ ba nào tái lập lần chạy đó. Và con số nổi bật trong PR khởi nguồn cho bài viết này là 1,5%, một mức tăng thực sự trong một serving stack và không phải là lý do để thay đổi lựa chọn mô hình.
Điều có thể thay đổi một quyết định là một lần chạy phục vụ đầy đủ, đã được kiểm toán, và điều đó vẫn chưa tồn tại. Các phép đo nhịp độ hiện có cho Qwen3.8-Flash-Next nằm hoàn toàn ngoài các bản vá này: mô hình đạt chỉ số Intelligence Index là 40 trên Artificial Analysis, cao hơn hẳn mức trung vị 18 của các mô hình trọng số mở có kích thước tương tự, và con số đó độc lập với mọi thứ được thảo luận ở đây.
Những gì bạn có thể gọi hôm nay, và góc độ định tuyến

Đây là chỗ bức tranh trở nên thiết thực đối với bất kỳ ai đã đọc đến đây và muốn dùng một mô hình được lưu trữ sẵn thay vì tự trang bị cho một mô hình. Qwen3.8-Flash-Next không có trong danh mục của OrcaRouter — nó không phải một trong 205 mô hình mà chúng tôi định tuyến, và không có endpoint được lưu trữ sẵn nào cho nó ở đây. Nhưng người anh em sản phẩm chính thức mà nó xem trước thì có: qwen/qwen3.8-flash, bản phát hành Qwen3.8-Flash chính thức mà chính thẻ mô hình của nhà cung cấp mô tả là mang nhiều tính năng hơn bản xem trước, bao gồm ngữ cảnh một triệu token theo mặc định và các công cụ tích hợp sẵn, hiện có sẵn ở mức $0.15 mỗi triệu token đầu vào và $0.47 mỗi triệu token đầu ra, được chuyển qua theo giá niêm yết của nhà cung cấp mà không cộng thêm phụ trội. Để thấy quy mô trong cùng một dòng họ, qwen/qwen3.8-27b có giá $0.33 và $2.40, còn qwen/qwen3.8-max là $2.00 và $6.00 — tất cả đều truy cập được chỉ với một khóa.
Có hai lý do khiến điều đó quan trọng hơn mức thông thường đối với một bài viết về một kiến trúc chưa phát hành. Lý do thứ nhất là chi phí chuyển đổi. Nếu bạn muốn đánh giá cảm giác của một mô hình sparse-attention trên lưu lượng của mình trước khi Qwen 4 ra đời, phép so sánh bạn nên chạy là với qwen/qwen3.8-flash ở mức giá niêm yết — và thực hiện điều đó qua một router nghĩa là mô hình bạn đang đo và mô hình bạn có thể dự phòng đều nằm sau cùng một endpoint, cùng một SDK và cùng một khóa, không phải ký thêm hợp đồng thứ hai. Lý do thứ hai là mọi thay đổi phục vụ trong cụm bản vá này đều nhắm đến vLLM tự vận hành. Nếu bạn không chạy tám chiếc A100, thì dung lượng KV 1.83× và mức cải thiện lấy mẫu 1.5% chỉ là những thứ bạn đọc được, không phải những thứ bạn có được. Một endpoint được định tuyến là phiên bản của điều này đến mà không cần bước build: tự động chuyển đổi dự phòng nếu nhà cung cấp suy giảm, và một DSL định tuyến cho phép bạn đặt một lệnh gọi được lưu trữ bên cạnh một lệnh gọi tự vận hành trong cùng một endpoint khi bạn thực sự có phần cứng của riêng mình để đo.
Điều duy nhất không nên làm là đọc bài viết này như một lý do để chờ đợi Qwen 4. Không có ngày cụ thể. Không có giá. Không có số lượng trọng số cho phiên bản thật — những con số ở trên mô tả bản dựng xem trước, không phải sản phẩm. Thứ hiện có là một serving stack đang được chuẩn bị công khai cho một kiến trúc mà, hiện tại, chỉ có thể tải xuống dưới dạng bản xem trước.
Phiên bản ngắn

Ba dòng lấp một khoảng trống giữa nhánh chỉ văn bản và nhánh ngôn ngữ-thị giác của một tệp mô hình, tự nó, không phải là tin tức. Đây là kiểu bản vá sẽ bị chôn vùi trong một merge commit nếu có ai có thời gian xem xét nó, và rất có thể nó sẽ được gộp vào một thay đổi lớn hơn hoặc bị đóng hẳn — hướng dẫn agent của chính bot vLLM, được trích dẫn trên PR, chỉ thị những người đóng góp có AI hỗ trợ hãy đóng công việc của họ nếu nó không mang lại lợi ích đáng kể, và 1,5% là con số dễ khiến người ta đặt câu hỏi đó. Điều khiến nó đáng để bạn chú ý là thứ mà nó ghi lại: một bảng n-gram 20 triệu mục, một MoE 512 expert với mười expert hoạt động trên mỗi token, một dạng lai giữa attention tuyến tính và attention thưa nén, một đầu suy đoán — tất cả đều đang được tinh chỉnh trên NVIDIA và AMD, từ Ampere đến Hopper, trước cả khi sản phẩm mang nó ra đời. Nếu bạn quan tâm đến phạm vi phục vụ của Qwen4, thì nội dung các PR chính là nơi các thông số kỹ thuật thực sự của nó hiện đang nằm. Nếu hôm nay bạn muốn gọi một mô hình, Qwen3.8-Flash là cái thực sự đang có mặt.
Một API cho hơn 200 mô hình, tự động chuyển đổi dự phòng, DSL định tuyến. Khám phá danh mục mô hình OrcaRouter
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
