
Ling-3.1-flash vs Gemini 3.8 Flash: Mô hình thử nghiệm 256K đối đầu với mô hình trực tiếp 1 triệu token
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 219 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đặt Ling-3.1-flash và Gemini 3.8 Flash cạnh nhau và sự khác biệt không nằm ở trí tuệ — mà nằm ở trạng thái. Ling-3.1-flash, mô hình mixture-of-experts ~560 tỷ tham số của Ant Group được công bố từ ngày 29 đến 30 tháng 9 năm 2026, là bản dùng thử miễn phí kéo dài hai tuần với ngữ cảnh phục vụ 256K, giới hạn đầu ra 32.768 token, đầu vào chỉ văn bản, và không công bố trọng số, giấy phép hay giá. Gemini 3.8 Flash, mô hình suy luận thuộc tầng Flash của Google phát hành ngày 2 tháng 9 năm 2026, là API khả dụng chung với cửa sổ đầy đủ 1.048.576 token, đầu ra 65.536 token, đầu vào đa phương thức, và bảng giá công khai. Trên giấy tờ, đó là so sánh hai mô hình; trên thực tế, đó là so sánh một mô hình bạn có thể xây dựng dựa trên ngay hôm nay với một mô hình bạn chỉ có thể thử nghiệm trong tháng này.
Đó không phải là lý do để gạt bỏ Ling-3.1-flash. Một MoE 560B miễn phí mang thiên hướng agentic đáng để bất kỳ ai dành hai tuần để đánh giá. Nhưng nó thay đổi mục đích của một cuộc đối đầu trực tiếp: không phải "tôi nên lấy cái nào làm chuẩn," mà là "mô hình thử nghiệm có đủ tốt để tôi nên phòng hờ cho câu trả lời mười lăm ngày nữa hay không." Đó là những câu hỏi khác nhau, và chúng có câu trả lời khác nhau trên mọi trục bên dưới.
Ba điều quyết định kết quả trước khi bất kỳ bài benchmark nào kịp làm điều đó
Hầu hết các so sánh đều bắt đầu bằng điểm số. Còn so sánh này nên bắt đầu bằng tính sẵn có, bởi vì khoảng cách ở đó không phải là chuyện hơn kém về mức độ.
• Giá — Ling-3.1-flash miễn phí trong suốt thời gian dùng thử và hoàn toàn không có bảng giá công bố sau dùng thử. Gemini 3.8 Flash niêm yết ở mức 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra trong thời gian khuyến mãi, sẽ trở về mức 1,50 USD / 7,50 USD vào ngày 1 tháng 1 năm 2027. Giá niêm yết do nhà cung cấp báo cáo; cả hai đều có thể thay đổi.
• Bối cảnh — Ling-3.1-flash cung cấp 262.144 token trong bản dùng thử, với 1.000.000 được nêu là mục tiêu cuối cùng. Gemini 3.8 Flash cung cấp đầy đủ 1.048.576 token ngay hôm nay. Nếu khối lượng công việc của bạn phụ thuộc vào cửa sổ một triệu token, thì hiện tại chỉ một trong hai mô hình này có nó.
• Trọng số — Ling-3.1-flash không công bố trọng số nào: không kho lưu trữ, không giấy phép, không checkpoint, chỉ là một ý định được tuyên bố là sẽ mở mã nguồn sau đợt thử nghiệm. Gemini 3.8 Flash là đóng và sẽ luôn như vậy, nhưng nó là một API được quản lý mà bạn có thể gọi một cách rõ ràng ngay hôm nay.
Đọc cùng nhau, ba điểm đó hợp thành một luận điểm: những lợi thế nổi bật của mô hình Ling hoặc chỉ mang tính quảng bá (miễn phí) hoặc mang tính tiềm năng (ngữ cảnh 1M, trọng số mở), trong khi lợi thế của mô hình Gemini lại mang tính hợp đồng. Sự bất đối xứng đó xuyên suốt mọi điều được trình bày sau đây.
Nơi mô hình Ling thực sự chiếm ưu thế
Hai nơi, và cả hai đều có thật.
Điều đầu tiên là chi phí trong quá trình đánh giá. Bản dùng thử miễn phí hai tuần cho một mô hình cỡ này không phải là chiêu trò tiếp thị để gạt phăng đi — đó là cách rẻ nhất để biết liệu một mixture-of-experts 560B có xử lý được các prompt của bạn hay không. Gemini 3.8 Flash, dù giá ra sao, cũng không miễn phí, và một cuộc đánh giá nghiêm túc với vài nghìn lượt gọi tốn tiền thật.
Điều thứ hai là quỹ đạo cởi mở. Ling-3.1-flash là phiên bản kế nhiệm của một mô hình đã thực sự phát hành trọng số theo giấy phép MIT, và Ant đã công khai nói rằng họ cũng có ý định mở nguồn mô hình này. Nếu điều đó thành hiện thực với một giấy phép thông thoáng, bạn sẽ có được thứ mà Gemini 3.8 Flash không bao giờ có thể cung cấp: lựa chọn tự lưu trữ, tinh chỉnh hoặc chưng cất một mô hình nền 560B. Vấn đề mấu chốt lại chính là điều quan trọng nhất — bạn đang đặt cược vào một lời hứa, và lời hứa của thế hệ trước đã được thực hiện với độ trễ hai tuần, chứ không phải một sự bảo đảm.
Nơi Gemini 3.8 Flash còn lâu mới thua cuộc
Gạt bỏ phiên tòa và câu hỏi về tính mở sang một bên, thì so sánh trên phương diện vận hành nghiêng hẳn về phía Google.
• Đầu vào — Gemini 3.8 Flash nhận văn bản, hình ảnh, video, tệp và âm thanh. Ling-3.1-flash nhận văn bản và trả về văn bản. Đối với quy trình làm việc với tài liệu, ảnh chụp màn hình hoặc video, đây không phải là một tùy chọn ưu tiên, mà là một ranh giới về năng lực.
• Giới hạn đầu ra — 65,536 token so với 32,768. Điều này trở nên thiết thực ngay khi bạn tạo báo cáo, tệp mã hoặc đầu ra có cấu trúc dài trong một lần chạy.
• Thông lượng — các thử nghiệm độc lập cho thấy tốc độ đầu ra trung vị của Gemini 3.8 Flash đạt gần 249 token mỗi giây, trong khi dữ liệu đo từ xa bảy ngày của chính OrcaRouter ghi nhận 552 token mỗi giây với p50 là 4,95 giây cho token đầu tiên. Dịch vụ hosting thử nghiệm của Ling-3.1-flash được báo cáo khoảng 63 token mỗi giây. Mô hình Gemini nằm ở một đẳng cấp tốc độ hoàn toàn khác.
• Độ sâu tham chiếu — Gemini 3.8 Flash có một khối lượng đo lường độc lập đằng sau nó; các con số của Ling-3.1-flash đều do bên thứ nhất cung cấp, trên một endpoint hoàn toàn mới, và chưa có bên thứ ba nào chạy lại chúng.
• Tác nhân đa phương thức — bất cứ thứ gì phải đọc ảnh chụp màn hình, PDF hay bản ghi cuộc gọi đều là nhiệm vụ của Gemini do bản chất cấu trúc, chứ không phải nhờ chất lượng.

Các benchmark, và lý do vì sao hai bộ này thực sự không thể so sánh với nhau
Trường hợp do nhà cung cấp báo cáo cho Ling-3.1-flash là mức tổng hợp 81,0 trên năm benchmark tác nhân, với 40,4% trên Terminal-Bench 4.0, 55,9% trên SWE-Atlas và 65,35% trên HealthBench Professional; báo cáo của chính Ant bổ sung 1.673 Elo trên GDPVal-AA v2.1 và 75,16 trên FrontierSWE. Mỗi một con số trong đó đều là đo lường của chính Ant. Không có harness nào được công bố và, quan trọng hơn, không có trọng số để bất kỳ ai chạy lại bộ kiểm thử trên đó.
Bức tranh về Gemini 3.8 Flash thì khác về bản chất. Trên bản dựng Intelligence Index hiện tại của Artificial Analysis (v4.3.2), nó đạt 40,9 ở mức nỗ lực suy luận cao, 39,8 ở mức trung bình và 33,5 ở mức thấp — và đáng lưu ý rằng chỉ số này đã được sửa đổi gần đây, nên những con số được công bố về mô hình này hồi đầu mùa thu được tính trên một bản dựng khác và không thể so sánh trực tiếp với những con số này. Những tuyên bố của chính Google về mô hình bao gồm 54,9 trên HLE-Verified và kết quả Terminal-Bench 2.1 mạnh mẽ ở mức cao trong khoảng 80. Các con số độc lập và của nhà cung cấp, đặt cạnh nhau, đều chính đáng, không thể thay thế cho nhau.
Có một so sánh chéo rõ ràng đáng thực hiện, vì cả hai cùng nằm trong một họ benchmark. Trên Terminal-Bench 4.0, con số do nhà cung cấp công bố của Ling-3.1-flash là 40,4%. Claude Sonnet 5.5 — một mô hình tầm trung, không phải flagship — đạt 70,6% trên chính phiên bản đó. Chỉ riêng hàng dữ liệu đó là lập luận mạnh nhất chống lại việc đọc model card của Ant như “gần mức tiên phong”: mô hình này cạnh tranh trên các chỉ số agentic mà Ant chọn nhấn mạnh, và rõ ràng kém hơn ở chỉ số lập trình terminal — nơi tồn tại một con số từ bên ngoài.

Hình thái thực tiễn của sự lựa chọn
Nếu bạn cần xây dựng thứ gì đó trong hai tuần tới, câu trả lời không hề sát nút và đó không phải là lời chê bai dành cho Ling-3.1-flash. Gemini 3.8 Flash là mẫu duy nhất trong hai mẫu mang lại cho bạn endpoint ổn định, mức giá được công bố, cửa sổ một triệu token đầy đủ, đầu vào đa phương thức và giấy phép mà bạn có thể đọc. Đây là một mô hình thuộc tầng Flash dùng cho môi trường sản xuất.
Ling-3.1-flash là một mục tiêu đánh giá. Giá trị của nó lúc này nằm ở chỗ việc đánh giá là miễn phí và mô hình thì thú vị: một MoE 560B với chỉ ~25B tham số hoạt động mỗi token là một canh bạc vào tính thưa, và Ant đã định vị nó đúng cho các khối lượng công việc agent, tìm kiếm và tự động hóa văn phòng mà các mô hình tầng Flash đang cạnh tranh. Việc chạy thử các prompt của riêng bạn qua nó trong khoảng thời gian dùng thử là đáng giá chính vì chưa có ai ngoài Ant làm điều đó — bạn sẽ nằm trong số những người đầu tiên có ý kiến không đến từ nhà cung cấp.
Cây quyết định hợp lý trong tháng này: định tuyến production sang Gemini 3.8 Flash, dành thời gian dùng thử miễn phí để chạy Ling-3.1-flash với những prompt khó nhất của bạn, và coi câu hỏi về trọng số mở là ngã rẽ thực sự. Nếu trọng số được phát hành với điều khoản thoáng và mức giá rơi vào gần phân khúc Flash, Ling-3.1-flash trở thành một lựa chọn thứ hai thực sự — thứ bạn có thể tự vận hành, điều mà Gemini sẽ không bao giờ làm được. Nếu chúng xuất hiện kèm ràng buộc, bản dùng thử kết thúc và cuộc so sánh cũng chấm dứt theo.
Chạy cả hai từ một key, và thẳng thắn về những gì còn thiếu
Gemini 3.8 Flash đã có mặt trên danh mục OrcaRouter ngay hôm nay với mã model google/gemini-3.8-flash, ở đúng mức giá niêm yết của Google, không cộng thêm phụ phí — vì vậy khi mức giá khuyến mãi hết hiệu lực vào tháng 1, mức giá bạn trả ở đây sẽ tự động bám theo thay vì phải cần một hợp đồng mới. DeepSeek-V4.1-Flash, mẫu model Flash-tier giá rẻ khác đáng để đo lường trong cùng thử nghiệm, cũng nằm trên danh mục đó ở mức giá niêm yết của nhà cung cấp, nên một thử nghiệm ba chiều giữa model dùng thử và các lựa chọn Flash-tier đã được khẳng định sẽ chạy phía sau một API key duy nhất với chuyển đổi dự phòng tự động giữa chúng.
Ling-3.1-flash không có trong danh mục của chúng tôi, và khi tra cứu trên API mô hình công khai của chúng tôi thì trả về không tìm thấy cho nó và cho thế hệ trước — vậy nên cách diễn đạt trung thực là bản dùng thử chạy ở đâu thì chạy, thông qua giao diện của chính nhà cung cấp và các nền tảng suy luận bên thứ ba, và chúng tôi không tuyên bố lưu trữ nó. Đó là phần của so sánh này có thể thay đổi nhanh nhất: một mô hình đang dùng thử miễn phí với mức giá chưa công bố đúng là kiểu thứ sẽ xuất hiện trên một lớp định tuyến ngay khi Ant và các đơn vị lưu trữ của nó công bố bảng giá, và việc chuyển thẳng không đánh dấu giá nghĩa là vào ngày điều đó xảy ra, giá ở đây cũng là giá ở đó.
Vậy là phán quyết hẹp hơn so với những gì số lượng tham số gợi ý. Ling-3.1-flash là mô hình tham vọng hơn và là kết quả nghiên cứu thú vị hơn; Gemini 3.8 Flash mới là mô hình bạn có thể đưa vào vận hành. Cho đến khi có giấy phép và mức giá, đó là toàn bộ khác biệt — và đó không phải là điều mà một dòng trên bảng xếp hạng sẽ phân định được.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
