Thẻ tiêu đề hero cho 'Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite' với phụ đề 'Miễn phí không đồng nghĩa với rẻ — kẻ đương nhiệm vẫn là lựa chọn an toàn' và hai thẻ thống kê: Ling 3.0 Tiny (AA Index 23, rất dài dòng, miễn phí đến hết 14/8) và Gemini 3.5 Flash-Lite (AA Index 36, ~490 tok/s, $0.30 / $2.50). Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite: Miễn phí không hề rẻ, và nhà đương kim vẫn là lựa chọn an toàn.

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

"Miễn phí" là từ đắt đỏ nhất trong từ vựng thị trường mô hình, vì nó thường có nghĩa là ai đó sắp tính phí bạn cho thứ gì đó ngoài giá niêm yết. Đó là cái bẫy ẩn bên trong cuộc so kè giữa Ling 3.0 Tiny, mô hình suy luận MoE 7,9 tỷ tham số mới của Ant Group InclusionAI, và Gemini 3.5 Flash-Lite, bậc Ge​mini hiện tại rẻ nhất và nhanh nhất của Go​ogle. Ling 3.0 Tiny hiện đang miễn phí để gọi và có giá 0,06 USD / 0,18 USD mỗi triệu token sau chương trình khuyến mãi ngày 14 tháng 8 — nhưng Artificial Analysis đo được rằng nó tiêu tốn 210 triệu token đầu ra chỉ để chấm điểm cho nhóm 56 mô hình của mình, so với mức trung vị 63 triệu, và gắn cờ nó là "rất dài dòng". Gemini 3.5 Flash-Lite có giá đắt gấp năm lần cho mỗi token, ở mức 0,30 USD / 2,50 USD, tuy nhiên nó mang Chỉ số Trí tuệ độc lập là 36 — cao hơn Ling 3.0 Tiny 13 điểm — và tốc độ đầu ra khoảng 490 token mỗi giây. Mức giá rẻ hơn, tốc độ phản hồi nhanh hơn và điểm số thấp hơn đều thuộc về cùng một mô hình. Đó là toàn bộ câu chuyện của sự so sánh này, và là toàn bộ lý do để bạn phải suy nghĩ kỹ trước khi mặc định chọn kẻ mới chỉ dựa trên giá cả.

Cả hai mô hình đều thuộc phân khúc bình dân, nhưng chúng đang ở những giai đoạn khác nhau trong vòng đời của mình. Gemini 3.5 Flash-Lite là người đương nhiệm trưởng thành: phát hành ngày 21 tháng 7 năm 2026, được bên thứ ba đo lường liên tục, và được triển khai rộng rãi như tầng mặc định cho các tác vụ agentic khối lượng lớn, nhạy cảm với độ trễ. Ling 3.0 Tiny mới ra mắt được một tuần, được định giá để thu hút người dùng, và mới được chấm điểm đúng một lần. Bài viết này tách bạch từng mô hình thực sự là gì, các con số độc lập nói lên điều gì, và tại sao mức giá "miễn phí" lại là con số ít hữu ích nhất trong phép so sánh này.

Ling 3.0 Tiny, gương mặt mới với một mét

Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.

The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Screenshot of the Artificial Analysis page for Ling 3.0 Tiny, showing an Intelligence Index of 23, price $0.00 / $0.00 on the free tier, a 210M-token verbosity read versus a 63M median, and output speed listed as N/A. REUSED from the what-is-ling-3-0-tiny explainer (audited).

Gemini 3.5 Flash-Lite, mô hình đương nhiệm

Gemini 3.5 Flash-Lite là câu trả lời của Go​ogle cho cùng một câu hỏi, được phát hành ở một bậc thấp hơn trong dòng Gemini 3.5. Mô hình này hỗ trợ đa phương thức gốc ở đầu vào — văn bản, hình ảnh, video, âm thanh và tệp tin — với đầu ra dạng văn bản, cửa sổ ngữ cảnh 1M token, tối đa 64K token đầu ra và mức độ suy luận có thể cấu hình (tối thiểu, thấp, cao) để một pipeline có thể điều chỉnh độ sâu và chi phí cho từng yêu cầu. Điểm số độc lập của nó là một bước nhảy thế hệ thực sự: Chỉ số Trí tuệ Artificial Analysis đạt 36, xếp hạng #12 trong số 151 mô hình được theo dõi, tăng từ 25 của Gemini 3.1 Flash-Lite. Về tốc độ, đây là mô hình nhanh nhất trong dòng 3.5 — Go​ogle công bố 350 token đầu ra/giây khi ra mắt, và trang trực tiếp của AA đã đo được khoảng 490 token/giây, xếp hạng #2 trong số các mô hình được theo dõi. Các con số agentic do nhà cung cấp công bố — 74,0% trên OSWorld-Verified, 54% trên Terminal-Bench 2.1, 72,2% trên bài kiểm tra truy xuất đa kim 128K — là số liệu tự công bố của Go​ogle và mang tính định hướng hơn là tuyệt đối, và một câu hỏi mở (computer-use được liệt kê là tích hợp sẵn trên blog của Go​ogle nhưng không được hỗ trợ trong tài liệu API) đáng để kiểm tra trước khi bạn phụ thuộc vào nó.

Xét theo từng token, nó cũng không rẻ so với phân khúc của mình. Cái tên "Lite" mô tả vị trí của mô hình trong dòng sản phẩm, chứ không phải một mức giá niêm yết đang tụt giảm: Gemini 2.5 Flash-Lite có giá $0,10 / $0,40, 3.1 Flash-Lite là $0,25 / $1,50, còn 3.5 Flash-Lite là $0,30 / $2,50 cho mỗi triệu token, với input được lưu cache ở mức $0,03. Lợi thế về hiệu quả đến từ tốc độ và khả năng tiết kiệm token, và các phép đo của chính Artificial Analysis cho thấy chi phí thực tế cho mỗi tác vụ tăng gần gấp đôi qua từng thế hệ, trong khi thời gian cho mỗi tác vụ giảm một nửa.

Bảng điểm độc lập, được đọc trong ngữ cảnh

Nếu đặt hai mô hình lên cùng một chỉ số, khoảng cách là rất rõ rệt: {{1}}Gemini 3.5 Flash-Lite đạt 36, Ling 3.0 Tiny đạt 23{{/1}}. Nhưng sự so sánh nổi bật đó mới chỉ là một nửa bức tranh, vì hai mô hình không được chấm điểm trên cùng một nhóm mô hình. AA xếp {{2}}Ling 3.0 Tiny ở vị trí #6 trên 56 trong phân khúc mô hình nhỏ của nó, so với mức trung vị của phân khúc là 8{{/2}} — cao hơn đáng kể so với trung bình của một mô hình cùng kích thước. {{3}}Gemini 3.5 Flash-Lite đứng thứ #12 trên 151 trong nhóm được theo dõi rộng hơn{{/3}}. Một là mô hình nhỏ xuất sắc; mô hình còn lại là một mô hình giá rẻ đáng tin cậy trong nhóm mở. Cả hai nhận định đều đúng và chúng mang ý nghĩa khác nhau. {{4}}Ling 3.0 Tiny mang lại giá trị tốt hơn cho phân khúc kích thước của nó so với Gemini 3.5 Flash-Lite cho phân khúc của nó{{/4}} — và {{5}}Gemini 3.5 Flash-Lite vẫn là mô hình mạnh hơn với cách biệt lớn trên cùng một thang đo độc lập{{/5}}.

Comparison scoreboard for Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite. Left column Ling 3.0 Tiny: AA 23, $0.06 / $0.18 after promo, 210M output tokens, text-only, 256K context, speed N/A (Vercel 264 tok/s). Right column Gemini 3.5 Flash-Lite: AA 36, $0.30 / $2.50, 43M output tokens, text + image + video + audio, 1M context, ~490 tok/s (AA). Footer: 'Both models per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Kích thước, mỗi dòng một giá trị:

• Điểm độc lập — Ling 3.0 Tiny AA Index 23 (#6/56, trung vị lớp 8) so với Gemini 3.5 Flash-Lite AA Index 36 (#12/151).

• Giá — Ling 3.0 Tiny $0.06 / $0.18 trên 1M sau khuyến mãi miễn phí so với Gemini 3.5 Flash-Lite $0.30 / $2.50 trên 1M (đầu vào cache $0.03).

• Verbosity — Ling 3.0 Tiny 210M tạo ra token đầu ra trong suốt lần chạy chỉ mục, so với Gemini 3.5 Flash-Lite được đo lường nhưng không dài dòng theo cờ đó.

• Phương thức — Ling 3.0 Tiny chỉ hỗ trợ văn bản, trong khi Gemini 3.5 Flash-Lite hỗ trợ đầu vào văn bản, hình ảnh, video, âm thanh và tệp.

• Context — 256K trên Ling 3.0 Tiny so với 1M trên Gemini 3.5 Flash-Lite, với output tối đa 64K trên cả hai.

• Tốc độ — Ling 3.0 Tiny khoảng 90–264 token/giây trên các điểm cuối đã công bố con số so với Gemini 3.5 Flash-Lite khoảng 490 token/giây trong phép đo trực tiếp của AA.

Hàng tốc độ là hàng có khả năng thay đổi nhiều nhất. Tốc độ đầu ra của Ling 3.0 Tiny thực sự chưa được xác định: Artificial Analysis liệt kê là N/A, trong khi Vercel quảng cáo 264 token/giây. Tốc độ ~490 token/giây của Gemini 3.5 Flash-Lite là phép đo AA trực tiếp được thực hiện sau khi mức biến động khi ra mắt của nó đã lắng xuống. Đối với một phân khúc nhạy cảm với độ trễ, đó là sự khác biệt giữa một đại lượng đã biết và một câu hỏi còn bỏ ngỏ.

Kinh tế học của sự dài dòng: tại sao miễn phí không hề rẻ

Đây là phép tính thường quyết định cuộc so sánh này. Chạy cùng một tác vụ nặng về suy luận — ví dụ 4.000 token đầu vào, 2.000 token đầu ra — qua cả hai mô hình sau khi chương trình khuyến mãi của Ling 3.0 Tiny kết thúc. Ling 3.0 Tiny tính phí (4.000 × $0,06 + 2.000 × $0,18) / 1.000.000, khoảng $0,0006. Gemini 3.5 Flash-Lite tính phí (4.000 × $0,30 + 2.000 × $2,50) / 1.000.000, khoảng $0,0062. Với số token giống hệt nhau, Ling 3.0 Tiny rẻ hơn gấp 10 lần. Giờ đến yếu tố độ dài: một mô hình suy luận tạo ra token suy nghĩ ở đầu ra sẽ không tạo ra số token giống hệt nhau. Nếu tỷ lệ dài dòng 210M so với 63M của Ling 3.0 Tiny vẫn giữ nguyên trên khối lượng tác vụ của bạn, chi phí thực tế cho mỗi tác vụ tăng gấp khoảng ba lần ở phía đầu ra, và lợi thế 10 lần thu hẹp còn khoảng 3–4 lần. Vẫn rẻ hơn — nhưng không còn miễn phí nữa, và không ấn tượng như con số 210M gợi lên.

Cách diễn giải thẳng thắn là hai mô hình này không phải là sản phẩm thay thế ở cùng chất lượng. Điểm 23 của Ling 3.0 Tiny là một điểm số vượt trội đối với mô hình 1.3B-active; điểm 36 của Gemini 3.5 Flash-Lite là một đẳng cấp năng lực khác hẳn, cộng thêm khả năng thị giác, cộng thêm ngữ cảnh 1M, cộng thêm tốc độ đã được khẳng định. Bạn phải trả tiền cho khoảng cách đó — gấp năm lần giá mỗi token, và nhiều hơn nữa cho mỗi tác vụ khi tính đến chênh lệch tốc độ — nhưng đó là khoảng cách năng lực thực sự, không phải khoảng cách tiếp thị. Nếu khối lượng công việc của bạn có thể dùng được với chất lượng của mô hình rẻ hơn, Ling 3.0 Tiny là lựa chọn đáng giá hơn. Nếu khối lượng công việc của bạn cần năng lực đó, thì không có lợi thế giá nào có thể lấp đầy khoảng cách.

Nơi bộ định tuyến chứng tỏ giá trị của mình

Đây chính là dạng khối lượng công việc mà một tầng định tuyến tỏ ra vượt trội so với việc cam kết chỉ dùng một mô hình duy nhất, và các yếu tố về hạ tầng lưu trữ đóng vai trò quan trọng trong cách bạn xây dựng nó. Gemini 3.5 Flash-Lite đã có mặt trên OrcaRouter với đúng giá niêm yết của nhà cung cấp — $0.30 đầu vào / $2.50 đầu ra cho mỗi 1M token, được chuyển qua với mức chênh lệch 0%, nên con số trên bảng giá của Google cũng chính là con số phía chúng tôi, và bất kỳ đợt giảm giá nào trong tương lai cũng sẽ có hiệu lực ngay trong ngày. Mô hình này nằm phía sau cùng một endpoint tương thích OpenAI như 200+ mô hình khác, với khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp khi một nhà cung cấp cơ sở suy giảm hiệu suất giữa lúc đang chạy, và DSL định tuyến có thể gửi một prompt đến nhiều mô hình rồi giữ lại câu trả lời tốt nhất.

{{1}}Ling 3.0 Tiny không nằm trên OrcaRouter; nó được phục vụ bằng các endpoint riêng, miễn phí hôm nay.{{/1}} {{2}}Sự kết hợp đó thực ra khiến cho bài toán routing trở nên vững chắc hơn chứ không hề yếu đi.{{/2}} {{3}}Hãy tận dụng khoảng thời gian miễn phí để benchmark Ling 3.0 Tiny với lưu lượng truy cập của chính bạn trước khi nó bắt đầu tính phí.{{/3}} {{4}}Sau đó, hãy xây dựng đường dẫn production trên tầng hosted — Gemini 3.5 Flash-Lite cho các lệnh gọi cần thị giác, ngữ cảnh dài hoặc cấu hình tốc độ ổn định, với tầng routing được tự do đẩy lên mô hình đắt hơn cho phần thiểu số khó nhằn.{{/4}} {{5}}Một tầng miễn phí là một thử nghiệm tuyệt vời nhưng lại là một chỗ dựa mong manh; tầng hosted mới là thứ bạn có thể xây dựng sản phẩm trên đó.{{/5}} {{6}}Trên OrcaRouter, bạn có thể chạy cả hai trong cùng một graph — Ling 3.0 Tiny qua endpoint trực tiếp, Gemini 3.5 Flash-Lite qua key — và để router tự quyết định cho từng yêu cầu.{{/6}}

Screenshot of the OrcaRouter model page for Gemini 3.5 Flash-Lite (google/gemini-3.5-flash-lite) showing $0.30 input / $2.50 output per 1M tokens, a 1M-token context, up to 64K max output, multimodal text + image + video + file + audio input, and a p50 time-to-first-token of 819ms over the last 7 days. Fresh Edge-headless capture, audited.

Phán quyết

Nếu bạn đang chọn giữa hai mô hình này và không định dùng chúng cùng nhau, quyết định thì dễ nói nhưng khó mà ưng. Ling 3.0 Tiny là món hời hơn nhưng lại là mô hình yếu hơn: một tầng suy luận chỉ xử lý văn bản mới ra mắt được một tuần, có điểm số xuất sắc so với kích thước, mức giá mạnh tay, và bức tranh về tốc độ lẫn độ dài câu trả lời còn bỏ ngỏ, đáng để đánh giá qua bản dùng thử miễn phí ngay lập tức và cũng đáng để biết rằng nó sẽ bị tính phí theo mức dùng từ ngày 14 tháng 8. Gemini 3.5 Flash-Lite là lựa chọn mặc định an toàn hơn cho môi trường sản xuất: được chấm điểm độc lập cao hơn 13 điểm, đa phương thức, ngữ cảnh 1M, nhanh hơn năm lần theo một phép đo đã được xác nhận, và được định giá tương xứng. Miễn phí không hề rẻ khi mô hình phải nói nhiều gấp ba lần để suy nghĩ trong khi trần năng lực lại thấp hơn — và kẻ đương nhiệm là lựa chọn an toàn là có lý do của nó.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube