
Tencent Hy4 Preview Chạy Trên vLLM Ngay Từ Ngày Đầu: Mô Hình MoE 770B Trọng Số Mở Mà Bạn Có Thể Thực Sự Triển Khai
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
Khi Tencent Hy4 Preview ra mắt vào ngày 28 tháng 8 năm 2026, nó đã làm điều mà hầu hết các flagship đẳng cấp tiên phong bỏ qua ngay từ ngày đầu: nó được phát hành với khả năng chạy được. Cùng với trọng số mở, Tencent và nhóm vLLM đã công bố một image Docker được dựng sẵn, một công thức phục vụ chính thức, và tích hợp hỗ trợ framework ngay trong vLLM, vì vậy mô hình trọng số mở lớn nhất mà dòng Hunyuan từng tạo ra — 770 tỷ tham số tổng cộng, 49 tỷ tham số kích hoạt cho mỗi token — đã nằm sau một endpoint tương thích OpenAI trên GPU của chính bạn chỉ trong vài giờ sau thông báo. Câu chuyện về khả năng chạy ngay từ ngày đầu đó là tin tức mà bài viết này đề cập, bởi vì "chạy được trong vLLM" không phải là một chú thích cuối trang đối với một mô hình có kích thước như thế này. Nó là sự khác biệt giữa một thông cáo báo chí và một thứ bạn có thể đưa vào sản xuất.
Phần còn lại của buổi ra mắt là một gói sản phẩm xem trước theo khuôn mẫu quen thuộc, và các lưu ý cũng quan trọng không kém các con số. Tencent gọi Tencent Hy4 Preview là một phiên bản sớm, đánh dấu suy luận quá dài và tự kiểm tra quá mức là các hành vi đã biết, đồng thời công bố bảng benchmark hoàn toàn do chính họ tự báo cáo — chưa có phòng thí nghiệm độc lập nào chấm điểm, và tính đến thời điểm viết bài này, mô hình mới chỉ ra mắt được hai ngày. Không điều nào trong số đó làm thay đổi điểm nhấn thực tế: trọng số được cấp phép Apache 2.0, cửa sổ ngữ cảnh là 1 triệu token, và hỗ trợ vLLM ngay từ ngày đầu đảm bảo con đường tự triển khai là điều hiện thực chứ không chỉ là kỳ vọng.
Tencent Hy4 Preview thực sự là gì
Tencent định vị Tencent Hy4 Preview là sản phẩm kế nhiệm của Hy3 (tổng 295B, ngữ cảnh 256K), gần như tăng gấp đôi dung lượng hoạt động và gấp bốn lần cửa sổ ngữ cảnh. Kiến trúc này đáng để đọc từng dòng một, vì mỗi dòng đều thay đổi những gì một mô hình trọng số mở được phép làm trên phần cứng của bạn.
• Kiến trúc — Mixture-of-Experts với tổng cộng 770B tham số và 49B tham số hoạt động trên mỗi token qua 78 lớp. Lớp đầu tiên là lớp dense; 77 lớp còn lại định tuyến từng token qua 256 chuyên gia định tuyến cộng với một chuyên gia dùng chung, kích hoạt 8 chuyên gia hàng đầu. Tỷ lệ thưa khoảng 16:1 đó chính là yếu tố giữ chi phí suy luận trong mức mà một đội ngũ nghiêm túc thực sự có thể vận hành.
• Cửa sổ ngữ cảnh gốc — 1.048.576 token, một trong những cửa sổ rộng nhất trong số các mô hình open-weight. Một kho mã nguồn đầy đủ, một lần tái cấu trúc đa tệp, một lô tài liệu dài: những bài toán chỉ cần một yêu cầu duy nhất.
• Attention — Gated DeepSeek Sparse Attention (Gated DSA) với IndexCache, một thiết kế sparse attention chỉ tính toán một chỉ mục sparse mới trên chỉ 21 trong số 78 tầng và tái sử dụng nó trên 57 tầng còn lại. Đó là lý do tại sao việc phục vụ nó không chỉ là "vLLM lớn hơn" — mà cần một backend hiểu được sparse attention.
• Giải mã suy đoán tích hợp sẵn — lớp MTP (dự đoán đa token) với khoảng 10B tổng / 0.7B tham số hoạt động nằm ngay trong mô hình, nhờ đó vLLM và SGLang có thể tạo token dự thảo mà không cần bạn tự triển khai một mô hình dự thảo riêng.
• Trọng số — Apache 2.0, ở cả hai định dạng checkpoint BF16 và FP8, được xuất bản lên Hugging Face, ModelScope, GitCode và CNB.
Câu "day-zero vLLM" thực sự có nghĩa là gì
Hỗ trợ framework được hợp nhất đúng ngày ra mắt chính là sự kiện cụ thể đằng sau tín hiệu này — thay đổi vLLM bổ sung Tencent Hy4 Preview (PR #54160) đã được đưa vào trong cùng thời điểm với bản phát hành, và quy trình chính thức nhắm đến vLLM 0.29.0 trở lên. Trên thực tế, điều đó có nghĩa là đường dẫn phục vụ chỉ cần một lệnh, chứ không phải cả tuần gỡ lỗi kernel.
docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview
Các cờ này có ý nghĩa, và mỗi cờ ánh xạ tới một thứ gì đó trong mô hình thay vì chỉ là boilerplate:
• --attention-backend FLASHMLA_SPARSE — bắt buộc, không phải tùy chọn. Sparse attention Gated DSA của Tencent Hy4 Preview không chạy đúng trên các backend dense mặc định, và cờ này là thứ mà công thức chính thức thiết lập.
`--speculative-config '{"num_speculative_tokens":3,"method":"mtp"}'` — bật lớp MTP tích hợp của mô hình cho kỹ thuật giải mã suy đoán (speculative decoding), dự đoán trước ba token draft. Không cần triển khai mô hình draft riêng.
• --tool-call-parser hy_v4 và --reasoning-parser hy_v4 — các bộ phân tích tùy chỉnh cho máy chủ biết cách Tencent Hy4 Preview phát ra các lời gọi công cụ và chuỗi suy luận của nó, với --enable-auto-tool-choice cho phép mô hình tự quyết định khi nào gọi công cụ.
Tencent khuyến nghị temperature 0.9 và top_p 1.0 cho quá trình lấy mẫu. Suy luận mặc định sử dụng chain-of-thought ở mức nỗ lực "cao", nhắm đến toán học, lập trình và các tác vụ phức tạp; nếu bạn muốn có phản hồi trực tiếp mà không cần suy nghĩ lâu, bạn truyền no_think reasoning effort trong yêu cầu thay vì hoán đổi trọng số.

Hỗ trợ ngay từ ngày 0 không chỉ riêng vLLM, điều này tự nó đã đáng chú ý đối với một bản phát hành mới đến vậy. SGLang đã phát hành một image đa kiến trúc được dựng sẵn (lmsysorg/sglang:hy4-preview) với cơ chế giải mã suy đoán kiểu NEXTN ngay trong cùng ngày, và hệ sinh thái Ascend đã có hỗ trợ ngay ngày 0 thông qua vLLM-Ascend sử dụng trọng số lượng tử hóa W8A8 trên 16 NPU Atlas 800I A3. Các bản phát hành trọng số mở thường mất nhiều tuần để hệ sinh thái phục vụ bắt kịp; còn bản này chỉ mất vài giờ.
Những điểm số đáng trích dẫn.
Mọi điểm chuẩn mà Tencent công bố cho Tencent Hy4 Preview đều do chính nhà cung cấp báo cáo — được chạy trên hệ thống đánh giá riêng của Tencent, chưa được bất kỳ phòng thí nghiệm độc lập nào tái xác minh, và mô hình này mới được công khai được hai ngày. Hãy đọc chúng như mức trần mà Tencent tin rằng họ đạt được, chứ không phải là sự thật đã được xác lập. Việc xác minh độc lập sẽ không tồn tại cho đến khi bên thứ ba chạy thử; không có gì trên bảng xếp hạng công khai phản ánh mô hình này vào lúc này.

Con số nổi bật là Terminal Bench 2.1, một bài kiểm tra về khả năng điều khiển terminal thực của mô hình khi viết mã. Tencent báo cáo Tencent Hy4 Preview đạt 85.4, được cho là ngang bằng với Claude Opus 5 và vượt qua DeepSeek V4 Pro, đồng thời đánh bại phiên bản tiền nhiệm Hy3 của chính họ với 14.6 điểm. Con số duy nhất đó mang cả trọng lượng của bản phát hành — nó là tuyên bố đặt một mô hình trọng số mở ngang hàng với các mô hình biên giới đóng đắt tiền nhất trong một bài kiểm tra mã hóa tác nhân khó — và cũng là tuyên bố cần được xác nhận độc lập nhất.
Phần còn lại của bảng nội bộ, tất cả đều là số liệu của riêng Tencent: DeepSWE, một benchmark kỹ thuật phần mềm, nhảy từ 28.0 trên Hy3 lên 64.3. SWE-bench Pro đạt 65.7 và SWE-bench Multilingual đạt 82.9. Trên Toolathlon-Verified, một bài kiểm tra gọi công cụ, Tencent báo cáo 74.1, mà họ cho biết vượt qua Qwen 3.8 Max và GPT-5.6 Sol và tiến gần đến Kimi K3 và Claude Opus 5. Trên APEX-Agents pass@1, nó đạt 37.1, chỉ kém Kimi K3 một chút với 37.2. Và trong một đánh giá mù nội bộ riêng biệt, 163 chuyên gia do Tencent tuyển dụng đã chấm điểm 203 nhiệm vụ kỹ thuật ở mức 2.99 trên 4.00, vượt qua GLM-5.3 với 2.92 và Kimi K3 với 2.94.
Có hai điểm đáng lưu ý. Mọi con số ấn tượng đều thuộc về các công việc kỹ thuật agentic — điều khiển terminal, gọi công cụ, tác vụ quy mô kho mã nguồn — còn kiến thức tổng quát hay suy luận lại không có con số nào, điều này phù hợp với định vị năng suất chứ không phải là sự trùng hợp ngẫu nhiên. Và Tencent mô tả DeepSWE cùng các mô hình khác là đang thu hẹp, chứ không khép lại, khoảng cách; tuyên bố ngang bằng rõ ràng và dễ tiếp thị duy nhất là kết quả hòa trên Terminal Bench 2.1, và đó là tuyên bố đáng kiểm chứng nhất với khối lượng công việc của chính bạn.
Chi phí thực sự để vận hành
Bài toán tự triển khai là điều đầu tiên cần phải thành thật. Đây không phải là mô hình đơn GPU và cũng không phải là mô hình để bàn. Checkpoint FP8 nặng gần một terabyte trọng số, và công thức chính thức giả định song song tensor bậc 8 — tám GPU băng thông cao với kết nối nhanh (phần cứng tham chiếu của Tencent cho FP8 là 8×B300, còn BF16 đầy đủ cần 16×B200). Nếu bạn không có quy mô phần cứng đó, bạn sẽ không thể tự triển khai nó một cách rẻ được, và backend chú ý thưa có nghĩa là không có đường tắt nào cho bộ nhớ KV cache ở ngữ cảnh 1 triệu token.
Một add-on trong tuần ra mắt thay đổi một phần phép tính đó cho các đội ngũ muốn có trọng số mở mà không cần dấu chân của mô hình chủ lực. Đội Hy của Tencent đã phát hành một bản dựng GGUF nén của Tencent Hy4 Preview, nén bản phát hành BF16 ~1.5 TB xuống còn khoảng 200 GiB với sơ đồ lượng tử hóa hỗn hợp theo từng lớp mà họ gọi là MIX-STQ1_0 — các tensor chuyên gia số lượng lớn giảm xuống còn khoảng 1.3 bit trong khi các lớp quan trọng đối với luồng phần dư giữ độ chính xác cao hơn. Trong các đánh giá của chính Tencent, sự thay đổi độ chính xác là nhỏ — SWE-bench Multilingual 82.9 xuống 81.3, MCP Atlas 83.7 xuống 83.2, IFBench 73.5 xuống 72.5 — một sự đánh đổi mà nhà cung cấp gọi là gần như không mất mát. Đó là số liệu của Tencent trên thiết lập của Tencent, chưa được tái lập cho đến nay. Một mô hình 200 GiB vẫn chưa phải là mô hình một GPU, nhưng đây là một khoản đặt cược nhỏ hơn đáng kể so với một checkpoint FP8 gần một terabyte, và nó đưa con đường trọng số mở vào tầm với của một nút đa GPU nhỏ hơn so với công thức tám B300 giả định.
Về phía API, giá cả mới trở nên thú vị. Trên TokenHub của Tencent Cloud, Tencent Hy4 Preview được niêm yết ở mức 6 yuan (~0,83 USD) cho mỗi triệu token đầu vào, 18 yuan (~2,50 USD) cho mỗi triệu token đầu ra và 0,3 yuan (~0,04 USD) cho mỗi triệu token khi trúng cache. Giá đầu ra khoảng 2,50 USD mỗi triệu token thấp hơn nhiều so với mức 25 USD mỗi triệu token đầu ra của một mô hình frontier đóng hàng đầu, và tỷ lệ trúng cache rẻ khiến các vòng lặp agent kéo dài — nơi cùng một system prompt và các tiền tố hội thoại được gửi lại liên tục — trở nên rẻ đến bất ngờ.
Tencent cũng đang cung cấp quyền truy cập miễn phí trong hai tuần cho Tencent Hy4 Preview trong WorkBuddy và CodeBuddy khi mô hình còn mới, vì vậy cách rẻ nhất để dùng thử trong tuần này là miễn phí — và WorkBuddy chính là nơi định vị năng suất trở nên cụ thể. Trong bất kỳ cuộc trò chuyện nào trên WorkBuddy, bộ chọn mô hình chuyển đổi qua lại giữa Hy3 và Hy4 preview, vì vậy sự phân tách giữa công việc năng suất văn phòng và phân tích ở một phía, còn lập trình ở phía kia, là lựa chọn theo từng tác vụ chứ không phải quyết định triển khai. Sự phân tách đó khớp với mục tiêu Tencent nhắm tới cho mô hình, và các bài kiểm tra thực hành trong WorkBuddy cho thấy mô hình tạo ra ngay trong một lần các tạo phẩm phức tạp — một nguyên mẫu trò chơi low-poly có thể chơi được chỉ từ một lời nhắc duy nhất, một bản đánh giá kinh doanh quý đầy đủ được dựng từ mười tệp đính kèm mà không cần bất kỳ can thiệp thủ công nào, và, trong bản demo thử nghiệm được lan truyền trong tuần này, một mô phỏng hố đen. Đây là những quan sát của cộng đồng về ứng dụng của chính Tencent thay vì điểm chuẩn của nhà cung cấp — nhưng chúng là những tín hiệu thực hành đầu tiên về những gì mô hình làm được trên các tác vụ đa bước thực sự, và hoàn toàn miễn phí để tái hiện trước khi bạn chi bất kỳ khoản nào.
Quyết định chi phí chính là nơi tầng định tuyến thay đổi bài toán, và chúng tôi sẽ thành thật về phần mình trong đó: {{1}}OrcaRouter hiện chưa định tuyến Tencent Hy4 Preview{{/1}}, vì {{2}}Tencent chưa mở mô hình này cho các nền tảng suy luận bên thứ ba{{/2}} — {{3}}mô hình này chạy trên endpoint TokenHub của riêng Tencent Cloud và trên các bản triển khai tự lưu trữ từ trọng số mở{{/3}}, và {{4}}chúng tôi không tuyên bố phục vụ những gì chúng tôi không có{{/4}}. Điều tầng định tuyến mang lại là khung ra quyết định xoay quanh điều đó. Nếu bạn đang chọn giữa một nút 8 GPU và một API, nguyên tắc chuyển tiếp giá mà toàn bộ danh mục còn lại đang vận hành theo sẽ được áp dụng ngay ngày Tencent mở mô hình này: {{5}}OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp với biên lợi nhuận bằng không{{/5}}, nên việc nhà cung cấp hạ giá sẽ có hiệu lực trên phía chúng tôi ngay trong ngày, thay vì bị bán lại và đội giá lên. Và đối với một mô hình mới ra đời được hai ngày mà bằng chứng duy nhất là điểm chuẩn từ chính nhà cung cấp của nó, {{6}}tự động chuyển đổi dự phòng là cách an toàn để thử nghiệm nó{{/6}} — {{7}}đưa mô hình đã được kiểm chứng vào luồng xử lý quan trọng của bạn và đặt Tencent Hy4 Preview bên cạnh nó{{/7}}, chuyển sang dùng nó cho các tác vụ mà mức chi phí của nó có lợi thế hơn và chuyển về ngay khi lợi thế đó không còn, {{8}}tất cả chỉ thông qua một API và một khóa{{/8}}.

Những giới hạn không thể hiện trên bảng thông số kỹ thuật
Tencent liệt kê rõ ràng các hạn chế đã biết, và chúng nên định hình mọi quyết định triển khai. Tencent Hy4 Preview là một mô hình văn bản, chấm hết — không có thị giác hay đầu vào đa phương thức — vì vậy bất cứ thứ gì liên quan đến hình ảnh hoặc video đều thuộc về một mô hình khác. Tencent cũng nêu rõ hành vi khởi động chậm trên các tác vụ phức tạp (suy nghĩ lâu trước khi có đầu ra đầu tiên) và xu hướng tự kiểm tra quá mức, đốt token để rà soát lại công việc đã làm. Sự kết hợp đó hoàn toàn sai cho các tác vụ chat nhạy cảm với độ trễ và hoàn toàn chấp nhận được cho công việc kỹ thuật xử lý hàng loạt ngoại tuyến, điều này cho thấy Tencent kỳ vọng bạn vận hành nó ở đâu.
Hai tuyên bố trong tài liệu ra mắt đáng được xem xét riêng biệt vì chúng nói về cách mô hình được xây dựng, chứ không phải về điểm số mà nó đạt được. Tencent cho biết Tencent Hy4 Preview đã tham gia vào quá trình phát triển của chính nó — nó đã giúp tối ưu hóa các phương pháp huấn luyện, chiến lược dữ liệu, khung đánh giá và các toán tử cấp thấp đã tạo ra nó, một vòng lặp tự cải thiện đệ quy ban đầu — và rằng nó đã tự động tối ưu hóa hệ thống suy luận của chính mình để đạt được mức tăng 31,8% thông lượng đầu cuối so với mức chuẩn. Về mặt khoa học, Tencent báo cáo rằng họ đã nâng cao chặn dưới đã biết của bài toán Blaschke–Lebesgue trong hình học lồi từ 0,380799 lên 0,41104, và tăng tốc 2,0 lần trên mô phỏng lớp kép phospholipid gồm 32.512 nguyên tử, giảm xuống còn 54,9 mili giây mỗi bước. Giống như mọi thứ khác trong ngày đầu ra mắt, đây là những lời công bố của chính Tencent.
Và sự thiếu vắng quan trọng nhất là sự xác minh. Hiện chưa có điểm số độc lập nào cho Tencent Hy4 Preview ở bất kỳ đâu — không trên bảng xếp hạng công khai, không từ phòng thí nghiệm đánh giá bên thứ ba, không có mục nào trên Artificial Analysis. Mô hình quá mới để có những điều đó. Bài kiểm tra mù nội bộ của chuyên gia là một tín hiệu hữu ích về cách các nhà đánh giá của chính Tencent nhìn nhận nó so với GLM-5.3 và Kimi K3, nhưng đó là các nhà đánh giá của Tencent thực hiện trên các tác vụ của Tencent. Mọi thứ vượt trên bảng thông số kỹ thuật chỉ là một tuyên bố đang chờ được kiểm chứng.
Ai nên chạy Tencent Hy4 Preview trong tuần này?
Câu trả lời thẳng thắn tuần này chia thành ba nhóm, và một trong số đó không cần phần cứng nào cả. Nếu bạn chỉ muốn cảm nhận Tencent Hy4 Preview làm được gì, quyền truy cập WorkBuddy miễn phí là con đường nhanh nhất — không cần GPU, không cần API key, mở một cuộc trò chuyện, chuyển bộ chọn mô hình sang Hy4 preview, và giao cho nó một tác vụ Work hoặc Coding. Nếu bạn có GPU và chạy các khối lượng công việc kỹ thuật theo lô — các tác vụ agentic tầm xa, phân tích quy mô kho mã nguồn, đánh giá ngoại tuyến — mô hình này đáng để thử nghiệm nghiêm túc ngay bây giờ: trọng số được mở, cửa sổ ngữ cảnh ở quy mô kho mã nguồn, đường dẫn vLLM chỉ là một lệnh duy nhất, và bản dựng GGUF của tuần ra mắt hạ thấp rào cản phần cứng cho một lần dùng thử. Nếu bạn đang vận hành chat sản xuất nhạy cảm về độ trễ, hoặc bất cứ thứ gì đa phương thức, hoặc bất cứ thứ gì bạn không thể chấp nhận một mô hình mà bằng chứng duy nhất là điểm chuẩn của chính nhà cung cấp, hãy chờ — Tencent đã lặp lại khoảng hai tháng một lần kể từ tháng Hai, và họ đã nói rằng lô mô hình Hy4 tiếp theo đang đến, vì vậy bản preview rõ ràng là một bản lặp sớm.
Đối với mọi người khác, tư thế hữu ích là một mô hình định tuyến: chứng minh nó bên cạnh một mô hình bạn đã tin cậy, với chi phí bạn có thể rời bỏ, và mở rộng nó chỉ ở nơi mà các con số của nó đứng vững trên khối lượng công việc của chính bạn. Đó chính là mục đích của một bộ định tuyến — ngày Tencent mở mô hình này cho suy luận bên thứ ba, nó sẽ gia nhập danh mục một API, hơn 200 mô hình, chuyển giá niêm yết như bất kỳ mô hình nào khác, và các công cụ chuyển đổi dự phòng cùng tổng hợp sẽ sẵn sàng ngay từ đầu. Cho đến lúc đó, trọng số nằm trên Hugging Face, API nằm trên Tencent Cloud, và bản dùng thử miễn phí nằm trong WorkBuddy — và tuyên bố rằng một mô hình trọng số mở đã đạt đến tầng cao nhất của mã hóa tác nhân cuối cùng đã có một con số cụ thể đi kèm. Con số đó là của Tencent. Bài kiểm tra là của bạn.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
