Thẻ hero biên tập được tạo có tiêu đề "Ling-3.1-flash vs Gemini 3.8 Flash" với phụ đề "Bản dùng thử miễn phí 256K so với API sản xuất 1M token". Hai hàng so sánh ghi "Ling-3.1-flash: dùng thử miễn phí hai tuần, ngữ cảnh 262.144 token, không công bố trọng số" và "Gemini 3.8 Flash: 0,75 USD / 3,75 USD mỗi 1M token, ngữ cảnh 1.048.576 token, đầu vào đa phương thức", phía trên phần chân trang ghi "Số liệu Ling do nhà cung cấp báo cáo; số liệu Gemini theo OrcaRouter và Artificial Analysis."
Guides & Insights

Ling-3.1-flash vs Gemini 3.8 Flash: Mô hình thử nghiệm 256K đối đầu với mô hình trực tiếp 1 triệu token

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt Ling-3.1-flash và Gemini 3.8 Flash cạnh nhau và sự khác biệt không nằm ở trí tuệ — mà nằm ở trạng thái. Ling-3.1-flash, mô hình mixture-of-experts ~560 tỷ tham số của Ant Group được công bố từ ngày 29 đến 30 tháng 9 năm 2026, là bản dùng thử miễn phí kéo dài hai tuần với ngữ cảnh phục vụ 256K, giới hạn đầu ra 32.768 token, đầu vào chỉ văn bản, và không công bố trọng số, giấy phép hay giá. Gemini 3.8 Flash, mô hình suy luận thuộc tầng Flash của Google phát hành ngày 2 tháng 9 năm 2026, là API khả dụng chung với cửa sổ đầy đủ 1.048.576 token, đầu ra 65.536 token, đầu vào đa phương thức, và bảng giá công khai. Trên giấy tờ, đó là so sánh hai mô hình; trên thực tế, đó là so sánh một mô hình bạn có thể xây dựng dựa trên ngay hôm nay với một mô hình bạn chỉ có thể thử nghiệm trong tháng này.

Đó không phải là lý do để gạt bỏ Ling-3.1-flash. Một MoE 560B miễn phí mang thiên hướng agentic đáng để bất kỳ ai dành hai tuần để đánh giá. Nhưng nó thay đổi mục đích của một cuộc đối đầu trực tiếp: không phải "tôi nên lấy cái nào làm chuẩn," mà là "mô hình thử nghiệm có đủ tốt để tôi nên phòng hờ cho câu trả lời mười lăm ngày nữa hay không." Đó là những câu hỏi khác nhau, và chúng có câu trả lời khác nhau trên mọi trục bên dưới.

Ba điều quyết định kết quả trước khi bất kỳ bài benchmark nào kịp làm điều đó

Hầu hết các so sánh đều bắt đầu bằng điểm số. Còn so sánh này nên bắt đầu bằng tính sẵn có, bởi vì khoảng cách ở đó không phải là chuyện hơn kém về mức độ.

• Giá — Ling-3.1-flash miễn phí trong suốt thời gian dùng thử và hoàn toàn không có bảng giá công bố sau dùng thử. Gemini 3.8 Flash niêm yết ở mức 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra trong thời gian khuyến mãi, sẽ trở về mức 1,50 USD / 7,50 USD vào ngày 1 tháng 1 năm 2027. Giá niêm yết do nhà cung cấp báo cáo; cả hai đều có thể thay đổi.

• Bối cảnh — Ling-3.1-flash cung cấp 262.144 token trong bản dùng thử, với 1.000.000 được nêu là mục tiêu cuối cùng. Gemini 3.8 Flash cung cấp đầy đủ 1.048.576 token ngay hôm nay. Nếu khối lượng công việc của bạn phụ thuộc vào cửa sổ một triệu token, thì hiện tại chỉ một trong hai mô hình này có nó.

• Trọng số — Ling-3.1-flash không công bố trọng số nào: không kho lưu trữ, không giấy phép, không checkpoint, chỉ là một ý định được tuyên bố là sẽ mở mã nguồn sau đợt thử nghiệm. Gemini 3.8 Flash là đóng và sẽ luôn như vậy, nhưng nó là một API được quản lý mà bạn có thể gọi một cách rõ ràng ngay hôm nay.

Đọc cùng nhau, ba điểm đó hợp thành một luận điểm: những lợi thế nổi bật của mô hình Ling hoặc chỉ mang tính quảng bá (miễn phí) hoặc mang tính tiềm năng (ngữ cảnh 1M, trọng số mở), trong khi lợi thế của mô hình Gemini lại mang tính hợp đồng. Sự bất đối xứng đó xuyên suốt mọi điều được trình bày sau đây.

Nơi mô hình Ling thực sự chiếm ưu thế

Hai nơi, và cả hai đều có thật.

Điều đầu tiên là chi phí trong quá trình đánh giá. Bản dùng thử miễn phí hai tuần cho một mô hình cỡ này không phải là chiêu trò tiếp thị để gạt phăng đi — đó là cách rẻ nhất để biết liệu một mixture-of-experts 560B có xử lý được các prompt của bạn hay không. Gemini 3.8 Flash, dù giá ra sao, cũng không miễn phí, và một cuộc đánh giá nghiêm túc với vài nghìn lượt gọi tốn tiền thật.

Điều thứ hai là quỹ đạo cởi mở. Ling-3.1-flash là phiên bản kế nhiệm của một mô hình đã thực sự phát hành trọng số theo giấy phép MIT, và Ant đã công khai nói rằng họ cũng có ý định mở nguồn mô hình này. Nếu điều đó thành hiện thực với một giấy phép thông thoáng, bạn sẽ có được thứ mà Gemini 3.8 Flash không bao giờ có thể cung cấp: lựa chọn tự lưu trữ, tinh chỉnh hoặc chưng cất một mô hình nền 560B. Vấn đề mấu chốt lại chính là điều quan trọng nhất — bạn đang đặt cược vào một lời hứa, và lời hứa của thế hệ trước đã được thực hiện với độ trễ hai tuần, chứ không phải một sự bảo đảm.

Nơi Gemini 3.8 Flash còn lâu mới thua cuộc

Gạt bỏ phiên tòa và câu hỏi về tính mở sang một bên, thì so sánh trên phương diện vận hành nghiêng hẳn về phía Google.

• Đầu vào — Gemini 3.8 Flash nhận văn bản, hình ảnh, video, tệp và âm thanh. Ling-3.1-flash nhận văn bản và trả về văn bản. Đối với quy trình làm việc với tài liệu, ảnh chụp màn hình hoặc video, đây không phải là một tùy chọn ưu tiên, mà là một ranh giới về năng lực.

• Giới hạn đầu ra — 65,536 token so với 32,768. Điều này trở nên thiết thực ngay khi bạn tạo báo cáo, tệp mã hoặc đầu ra có cấu trúc dài trong một lần chạy.

• Thông lượng — các thử nghiệm độc lập cho thấy tốc độ đầu ra trung vị của Gemini 3.8 Flash đạt gần 249 token mỗi giây, trong khi dữ liệu đo từ xa bảy ngày của chính OrcaRouter ghi nhận 552 token mỗi giây với p50 là 4,95 giây cho token đầu tiên. Dịch vụ hosting thử nghiệm của Ling-3.1-flash được báo cáo khoảng 63 token mỗi giây. Mô hình Gemini nằm ở một đẳng cấp tốc độ hoàn toàn khác.

• Độ sâu tham chiếu — Gemini 3.8 Flash có một khối lượng đo lường độc lập đằng sau nó; các con số của Ling-3.1-flash đều do bên thứ nhất cung cấp, trên một endpoint hoàn toàn mới, và chưa có bên thứ ba nào chạy lại chúng.

• Tác nhân đa phương thức — bất cứ thứ gì phải đọc ảnh chụp màn hình, PDF hay bản ghi cuộc gọi đều là nhiệm vụ của Gemini do bản chất cấu trúc, chứ không phải nhờ chất lượng.

Headless capture of the OrcaRouter model page for Gemini 3.8 Flash, model ID google/gemini-3.8-flash. It is marked FEATURED and credited to Google with a 2026-09-02 date, carries Vision, Audio, Tools, JSON and Reasoning capability chips, and describes the model as Google's most intelligent Flash model with significant gains over 3.7 Flash on software engineering, agentic tasks and multi-step reasoning. A stat strip reads input $0.75 and output $3.75 per 1M tokens, p50 time to first token 4.95 s, p95 10.00 s and 149.9M tokens of traffic over seven days; the pricing table lists $0.750 input, $3.75 output and $0.075 cache read per 1M tokens.

Các benchmark, và lý do vì sao hai bộ này thực sự không thể so sánh với nhau

Trường hợp do nhà cung cấp báo cáo cho Ling-3.1-flash là mức tổng hợp 81,0 trên năm benchmark tác nhân, với 40,4% trên Terminal-Bench 4.0, 55,9% trên SWE-Atlas và 65,35% trên HealthBench Professional; báo cáo của chính Ant bổ sung 1.673 Elo trên GDPVal-AA v2.1 và 75,16 trên FrontierSWE. Mỗi một con số trong đó đều là đo lường của chính Ant. Không có harness nào được công bố và, quan trọng hơn, không có trọng số để bất kỳ ai chạy lại bộ kiểm thử trên đó.

Bức tranh về Gemini 3.8 Flash thì khác về bản chất. Trên bản dựng Intelligence Index hiện tại của Artificial Analysis (v4.3.2), nó đạt 40,9 ở mức nỗ lực suy luận cao, 39,8 ở mức trung bình và 33,5 ở mức thấp — và đáng lưu ý rằng chỉ số này đã được sửa đổi gần đây, nên những con số được công bố về mô hình này hồi đầu mùa thu được tính trên một bản dựng khác và không thể so sánh trực tiếp với những con số này. Những tuyên bố của chính Google về mô hình bao gồm 54,9 trên HLE-Verified và kết quả Terminal-Bench 2.1 mạnh mẽ ở mức cao trong khoảng 80. Các con số độc lập và của nhà cung cấp, đặt cạnh nhau, đều chính đáng, không thể thay thế cho nhau.

Có một so sánh chéo rõ ràng đáng thực hiện, vì cả hai cùng nằm trong một họ benchmark. Trên Terminal-Bench 4.0, con số do nhà cung cấp công bố của Ling-3.1-flash là 40,4%. Claude Sonnet 5.5 — một mô hình tầm trung, không phải flagship — đạt 70,6% trên chính phiên bản đó. Chỉ riêng hàng dữ liệu đó là lập luận mạnh nhất chống lại việc đọc model card của Ant như “gần mức tiên phong”: mô hình này cạnh tranh trên các chỉ số agentic mà Ant chọn nhấn mạnh, và rõ ràng kém hơn ở chỉ số lập trình terminal — nơi tồn tại một con số từ bên ngoài.

Generated two-column scoreboard titled "Ling-3.1-flash vs Gemini 3.8 Flash - the scoreboard". The Ling-3.1-flash column reads Context 262,144, Output 32,768, Input text only, Price free trial, Weights none, Speed ~63 tok/s. The Gemini 3.8 Flash column reads Context 1,048,576, Output 65,536, Input text, image, audio, Price $0.75 / $3.75, Weights closed, Speed 552 tok/s. A footer reads "Ling figures vendor-reported; Gemini figures per OrcaRouter and Artificial Analysis."

Hình thái thực tiễn của sự lựa chọn

Nếu bạn cần xây dựng thứ gì đó trong hai tuần tới, câu trả lời không hề sát nút và đó không phải là lời chê bai dành cho Ling-3.1-flash. Gemini 3.8 Flash là mẫu duy nhất trong hai mẫu mang lại cho bạn endpoint ổn định, mức giá được công bố, cửa sổ một triệu token đầy đủ, đầu vào đa phương thức và giấy phép mà bạn có thể đọc. Đây là một mô hình thuộc tầng Flash dùng cho môi trường sản xuất.

Ling-3.1-flash là một mục tiêu đánh giá. Giá trị của nó lúc này nằm ở chỗ việc đánh giá là miễn phí và mô hình thì thú vị: một MoE 560B với chỉ ~25B tham số hoạt động mỗi token là một canh bạc vào tính thưa, và Ant đã định vị nó đúng cho các khối lượng công việc agent, tìm kiếm và tự động hóa văn phòng mà các mô hình tầng Flash đang cạnh tranh. Việc chạy thử các prompt của riêng bạn qua nó trong khoảng thời gian dùng thử là đáng giá chính vì chưa có ai ngoài Ant làm điều đó — bạn sẽ nằm trong số những người đầu tiên có ý kiến không đến từ nhà cung cấp.

Cây quyết định hợp lý trong tháng này: định tuyến production sang Gemini 3.8 Flash, dành thời gian dùng thử miễn phí để chạy Ling-3.1-flash với những prompt khó nhất của bạn, và coi câu hỏi về trọng số mở là ngã rẽ thực sự. Nếu trọng số được phát hành với điều khoản thoáng và mức giá rơi vào gần phân khúc Flash, Ling-3.1-flash trở thành một lựa chọn thứ hai thực sự — thứ bạn có thể tự vận hành, điều mà Gemini sẽ không bao giờ làm được. Nếu chúng xuất hiện kèm ràng buộc, bản dùng thử kết thúc và cuộc so sánh cũng chấm dứt theo.

Chạy cả hai từ một key, và thẳng thắn về những gì còn thiếu

Gemini 3.8 Flash đã có mặt trên danh mục OrcaRouter ngay hôm nay với mã model google/gemini-3.8-flash, ở đúng mức giá niêm yết của Google, không cộng thêm phụ phí — vì vậy khi mức giá khuyến mãi hết hiệu lực vào tháng 1, mức giá bạn trả ở đây sẽ tự động bám theo thay vì phải cần một hợp đồng mới. DeepSeek-V4.1-Flash, mẫu model Flash-tier giá rẻ khác đáng để đo lường trong cùng thử nghiệm, cũng nằm trên danh mục đó ở mức giá niêm yết của nhà cung cấp, nên một thử nghiệm ba chiều giữa model dùng thử và các lựa chọn Flash-tier đã được khẳng định sẽ chạy phía sau một API key duy nhất với chuyển đổi dự phòng tự động giữa chúng.

Ling-3.1-flash không có trong danh mục của chúng tôi, và khi tra cứu trên API mô hình công khai của chúng tôi thì trả về không tìm thấy cho nó và cho thế hệ trước — vậy nên cách diễn đạt trung thực là bản dùng thử chạy ở đâu thì chạy, thông qua giao diện của chính nhà cung cấp và các nền tảng suy luận bên thứ ba, và chúng tôi không tuyên bố lưu trữ nó. Đó là phần của so sánh này có thể thay đổi nhanh nhất: một mô hình đang dùng thử miễn phí với mức giá chưa công bố đúng là kiểu thứ sẽ xuất hiện trên một lớp định tuyến ngay khi Ant và các đơn vị lưu trữ của nó công bố bảng giá, và việc chuyển thẳng không đánh dấu giá nghĩa là vào ngày điều đó xảy ra, giá ở đây cũng là giá ở đó.

Vậy là phán quyết hẹp hơn so với những gì số lượng tham số gợi ý. Ling-3.1-flash là mô hình tham vọng hơn và là kết quả nghiên cứu thú vị hơn; Gemini 3.8 Flash mới là mô hình bạn có thể đưa vào vận hành. Cho đến khi có giấy phép và mức giá, đó là toàn bộ khác biệt — và đó không phải là điều mà một dòng trên bảng xếp hạng sẽ phân định được.

Headless capture of the Artificial Analysis page for Gemini 3.8 Flash (High), marked "Released September 2026". Summary tiles read Intelligence 41 (rank 50 of 224), Speed 248.5 output tokens per second (rank 4 of 224), Cost $1.24 per Intelligence Index task at $0.75 input and $3.75 output per 1M tokens with a 90% cache discount (rank 62 of 224), and Verbosity 170M output tokens (rank 96 of 224). The comparison summary states the model is notably fast but very verbose, takes text, image, speech and video input, outputs text, and has a 1M-token context window, and the page names the current Artificial Analysis Intelligence Index build as v4.3.2.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày