Gemini 3.5 Flash-Lite là mô hình Gemini hiệu quả về chi phí nhất của Google, được xây dựng chuyên biệt cho các khối lượng công việc rất lớn, nhạy cảm với độ trễ, nơi chi phí mỗi lần gọi chiếm ưu thế. Mặc dù có mức giá thấp, nhưng nó vốn dĩ là đa phương thức — chấp nhận văn bản, hình ảnh, video, âm thanh và tệp với đầu ra văn bản — và có cùng cửa sổ ngữ cảnh 1M token và lên tới 64K token đầu ra như cấp độ Flash lớn hơn, do đó các tài liệu dài và đầu vào đa phương tiện vẫn nằm trong tầm với. Với mức giá chỉ bằng khoảng một phần năm so với 3.6 Flash, nó là công cụ phù hợp cho phân loại, trích xuất, định tuyến, tóm tắt, tác nhân nhẹ, tạo dữ liệu tổng hợp và bất kỳ quy trình nào chạy hàng triệu lần. Nó vẫn hỗ trợ nỗ lực suy luận có thể cấu hình, gọi công cụ gốc và đầu ra có cấu trúc, và vượt trội so với các mô hình nhẹ khác trong các điểm chuẩn về tác nhân và ngữ cảnh dài — ví dụ 74.0% trên OSWorld-Verified và 72.2% trên truy xuất nhiều kim 128k, vượt xa so với 3.1 Flash-Lite trước đó. Nó hỗ trợ cả định dạng chat-completions của OpenAI và API generateContent gốc của Gemini, do đó bạn có thể kết hợp nó với các mô hình nặng hơn đằng sau một tích hợp duy nhất — định tuyến các lưu lượng dễ, khối lượng lớn tới Flash-Lite và chuyển các tác vụ khó lên 3.6 Flash hoặc mô hình Pro.
Google Gemini 3.5 Flash-Lite là một mô hình ngôn ngữ đa phương thức do Google phát triển, được cung cấp thông qua API tương thích OpenAI của OrcaRouter. Nó chấp nhận đầu vào dạng văn bản, hình ảnh,…
Gemini 3.5 Flash-Lite có khả năng thực hiện nhiều tác vụ nhờ hỗ trợ đầu vào đa phương thức và sử dụng công cụ. Nó xử lý các tác vụ chỉ văn bản như tóm tắt, trả lời câu hỏi và sinh mã. Với hình ảnh, nó có thể mô tả cảnh, trích xuất văn bản từ tài liệu hoặc diễn giải sơ đồ. Đầu vào video cho phép nhận dạng hoạt động, tạo chú thích và suy luận thời gian. Đầu vào âm thanh hỗ trợ phiên âm, nhận dạng ngôn ngữ và phân tích dựa trên giọng nói. Mô hình cũng hỗ trợ gọi công cụ, bằng chứng là điểm CharXiv Reasoning của nó là 76.5 (với các công cụ). Điều này có nghĩa là nó có thể được tích hợp vào các quy trình tác nhân, nơi nó gọi các API hoặc cơ sở dữ liệu bên ngoài. Tuy nhiên, nó không được thiết kế cho viết sáng tạo, suy luận trừu tượng cao hoặc các tác vụ đòi hỏi chuyên môn sâu về lĩnh vực. Điểm mạnh của nó nằm ở tốc độ, chi phí và phạm vi hỗ trợ phương thức thay vì hiệu suất thô.
Bạn nên chọn Gemini 3.5 Flash-Lite khi chi phí và thông lượng là mối quan tâm chính và nhiệm vụ nằm trong giới hạn khả năng của nó. Mô hình này vượt trội trong các pipeline khối lượng lớn như lập chỉ mục hàng nghìn tài liệu, phiên âm hàng giờ âm thanh hoặc chạy phân loại thời gian thực trên luồng hình ảnh. Cửa sổ ngữ cảnh lớn (1M token) khiến nó trở nên lý tưởng cho các tác vụ yêu cầu hiểu biết tổng thể về các đầu vào dài, như phân tích vụ án tư pháp hoặc tái cấu trúc mã nguồn. Các mô hình lớn hơn (ví dụ: Gemini 3.5 Pro) có thể đạt độ chính xác cao hơn trên các benchmark phức tạp nhưng đi kèm với chi phí mỗi token cao hơn đáng kể và thông lượng thấp hơn. Nếu ứng dụng của bạn có thể chấp nhận những đánh đổi chất lượng nhỏ để giảm chi phí 10‑100 lần, thì mô hình này là lựa chọn phù hợp. Ngược lại, đối với các tác vụ yêu cầu độ chính xác thực tế, sinh sáng tạo hoặc suy luận hiện đại nhất, nên sử dụng mô hình lớn hơn.
Có, mô hình hỗ trợ đầu vào video và âm thanh gốc cùng với văn bản, hình ảnh và tệp. Đầu vào video có thể được cung cấp dưới dạng một chuỗi khung hình hoặc một tệp video; mô hình xử lý các khung hình và mọi bản nhạc âm thanh liên quan. Đầu vào âm thanh hoạt động với các định dạng phổ biến như WAV, MP3 hoặc FLAC. Cửa sổ ngữ cảnh lớn cho phép xử lý các bản ghi dài trong một yêu cầu duy nhất – ví dụ: bản ghi âm một giờ với độ chi tiết cao có thể tiêu tốn khoảng 10.000 token. Điều này hữu ích cho việc tóm tắt cuộc họp, phân tích podcast hoặc hỗ trợ khách hàng dựa trên giọng nói. Lưu ý rằng mô hình không tạo ra đầu ra âm thanh hoặc video; phản hồi luôn là văn bản. Chất lượng hiểu đa phương thức tương đương với cấp độ flash‑lite của mô hình: phù hợp để trích xuất và phân loại, nhưng có thể bỏ lỡ các chi tiết tinh tế so với các mô hình đa phương thức lớn hơn.
Gemini 3.5 Flash-Lite hỗ trợ gọi công cụ, như được chỉ ra bởi hiệu suất benchmark của nó trên CharXiv Reasoning với các công cụ (điểm 76.5). Điều này có nghĩa là bạn có thể định nghĩa các hàm hoặc API mà mô hình có thể gọi trong quá trình tạo phản hồi. Các trường hợp sử dụng điển hình bao gồm tra cứu cơ sở dữ liệu, tìm kiếm web, hoặc các phép toán số học. Mô hình chọn thời điểm gọi một công cụ dựa trên hướng dẫn của người dùng và ngữ cảnh. Việc sử dụng công cụ có thể cải thiện độ chính xác thực tế và cho phép suy luận phức tạp nhiều bước. Tuy nhiên, vì mô hình là một biến thể flash‑lite, độ tin cậy gọi công cụ của nó có thể thấp hơn so với một mô hình chuyên biệt lớn hơn. Nếu ứng dụng của bạn phụ thuộc nhiều vào việc điều phối công cụ hoàn hảo, bạn có thể cần thêm các lớp xác thực hoặc logic dự phòng. OrcaRouter truyền các định nghĩa công cụ theo cùng định dạng như API của OpenAI, giúp việc tích hợp trở nên đơn giản.
Mô hình đạt điểm 76.5 trên benchmark CharXiv Reasoning khi được đánh giá với công cụ. CharXiv kiểm tra khả năng suy luận trên dữ liệu trực quan dạng biểu đồ, yêu cầu mô hình diễn giải hình ảnh biểu đồ và trả lời các câu hỏi về nó. Điều kiện “với công cụ” có nghĩa là mô hình có thể gọi các hàm bên ngoài (ví dụ: máy tính) để hỗ trợ. Điểm số này cho thấy hiệu suất ở mức trung bình – nó có khả năng suy luận liên quan đến biểu đồ nhưng không đạt đến trình độ của các mô hình chuyên biệt. Không có điểm benchmark nào khác được cung cấp cho mô hình này. Để so sánh, các mô hình lớn hơn như Gemini 3.5 Pro có khả năng sẽ đạt điểm cao hơn trong tác vụ này. Giá trị này hữu ích như một điểm tham chiếu: bạn có thể kỳ vọng khả năng diễn giải biểu đồ hợp lý, nhưng nên kiểm tra kỹ lưỡng nếu ứng dụng của bạn yêu cầu độ chính xác cao trong các tác vụ suy luận trực quan.
Chỉ có điểm CharXiv Reasoning (có công cụ) được cung cấp: 76.5. Không có dữ liệu benchmark bổ sung – chẳng hạn như MMLU, HumanEval, hoặc điểm truy xuất ngữ cảnh dài – nào có sẵn cho Gemini 3.5 Flash‑Lite trong thông tin được cung cấp. Điều này có nghĩa là việc khái quát hóa hiệu suất của nó cho các tác vụ khác đòi hỏi phải thử nghiệm thực nghiệm trên dữ liệu của riêng bạn. Với bản chất flash‑lite của mô hình, nó được dự đoán sẽ hoạt động kém hơn các mô hình kích thước đầy đủ trên hầu hết các benchmark tiêu chuẩn. Tuy nhiên, hiệu quả và chi phí thấp của nó thường bù đắp những thiếu sót này trong môi trường sản xuất. Nếu bạn cần hiệu suất đã được xác minh trên một benchmark cụ thể (ví dụ: tạo mã hoặc hiểu đa ngôn ngữ), bạn nên tự chạy đánh giá của riêng mình. OrcaRouter không lưu trữ kết quả benchmark riêng biệt; các con số được trích dẫn ở đây đến trực tiếp từ nhà cung cấp.
Chi tiết về độ trễ không được chỉ định trong dữ liệu được cung cấp. Theo nguyên tắc chung, các mô hình flash‑lite được thiết kế để có độ trễ thấp so với các phiên bản lớn hơn, nhưng thời gian phản hồi thực tế phụ thuộc vào nhiều yếu tố: độ dài đầu vào, độ dài đầu ra, tải yêu cầu đồng thời và phần cứng bên dưới. Với cửa sổ ngữ cảnh 1M, xử lý các prompt rất dài có thể làm tăng đáng kể độ trễ do sự mở rộng bậc hai của cơ chế attention. Đối với đầu vào ngắn (ví dụ: vài trăm token), bạn có thể mong đợi phản hồi dưới một giây. Đối với đầu vào gần giới hạn 1M token, độ trễ có thể lên đến hàng chục giây. OrcaRouter không đảm bảo SLA độ trễ cụ thể cho mô hình này. Nếu độ trễ thấp là quan trọng, hãy cân nhắc sử dụng ngữ cảnh nhỏ hơn (ví dụ: thông qua việc cắt bớt) hoặc một điểm cuối chuyên dụng. Bạn có thể theo dõi thời gian phản hồi thông qua bảng điều khiển OrcaRouter.
Gemini 3.5 Flash-Lite không được thiết kế để đạt độ chính xác tối tân. Điểm mạnh của nó là tốc độ, chi phí và ngữ cảnh lớn. Các hạn chế bao gồm hiệu suất thấp hơn trên các chuẩn đo lường lập luận phức tạp, khả năng nhớ dữ kiện kém hơn so với các mô hình lớn hơn và xu hướng “ảo giác” trên các đầu vào mơ hồ. Mô hình có thể gặp khó khăn với các tác vụ yêu cầu chuyên môn sâu trong lĩnh vực (ví dụ: lập luận pháp lý, chẩn đoán y tế) hoặc công việc sáng tạo tinh tế. Khả năng sử dụng công cụ của nó, mặc dù có thể hoạt động, nhưng có thể không đáng tin cậy bằng khả năng của một mô hình tác tử chuyên dụng. Ngoài ra, vì chỉ có một điểm chuẩn đo lường được cung cấp (CharXiv Reasoning 76.5 with tools), bạn không thể cho rằng hiệu suất tốt trên các lĩnh vực khác nếu không kiểm tra. Đối với các ứng dụng quan trọng, hãy luôn đánh giá chuẩn trên dữ liệu của riêng bạn và cân nhắc sử dụng mô hình dự phòng có khả năng cao hơn khi độ tin cậy thấp.
Giá là $0.30 cho mỗi 1 triệu token đầu vào và $2.50 cho mỗi 1 triệu token đầu ra. Các mức giá này là giá của nhà cung cấp được tính phí mà không có bất kỳ khoản tăng giá nào từ OrcaRouter. Token đầu vào bao gồm tất cả các token trong lời nhắc (token văn bản, token hình ảnh, khung hình video, mẫu âm thanh, nội dung tệp) bất kể phương thức. Token đầu ra là các token văn bản được tạo ra. Đối với một truy vấn ngữ cảnh dài điển hình tiêu thụ 100,000 token đầu vào và 1,000 token đầu ra, chi phí sẽ xấp xỉ ($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325 cho mỗi yêu cầu. Ở quy mô lớn, mô hình này có thể xử lý hàng triệu truy vấn với vài trăm đô la. So sánh điều này với các mô hình lớn hơn thường có chi phí cao gấp 10‑50x mỗi token. Mức giá đầu ra thấp đặc biệt có lợi cho các ứng dụng tạo ra các phản hồi dài (ví dụ: tóm tắt toàn bộ tài liệu).
Thông tin được cung cấp không đề cập đến bất kỳ cơ chế bộ nhớ đệm nào hoặc giá chiết khấu cho các token được lưu trong bộ nhớ đệm. Do đó, bạn nên giả định rằng mọi token được gửi đến mô hình đều được tính phí theo mức đầu vào tiêu chuẩn là 0,30 đô la cho mỗi triệu token, bất kể sự lặp lại. Một số nhà cung cấp cung cấp tính năng lưu trữ đệm tự động cho prompt, nơi các tiền tố lặp lại được tính phí với mức thấp hơn (ví dụ: giảm 50%). Đối với mô hình này, chưa có thông báo về chiết khấu bộ nhớ đệm nào như vậy. Nếu bạn thường xuyên gửi lại cùng một ngữ cảnh (ví dụ: một prompt hệ thống lớn), bạn có thể muốn tìm hiểu xem OrcaRouter hay Google có triển khai bộ nhớ đệm trong suốt hay không. Trong trường hợp không có thông tin rõ ràng, cách an toàn nhất là dự trù chi phí đầy đủ cho mỗi token cho tất cả các đầu vào. Tối ưu hóa bằng cách cắt bỏ nội dung được sử dụng lại có thể giảm hóa đơn thực tế của bạn.
Zero markup có nghĩa là OrcaRouter tính phí chính xác theo mức giá của nhà cung cấp mà không thêm bất kỳ khoản chênh lệch nào. Đối với Gemini 3.5 Flash-Lite, giá đầu vào là 0,30 USD/1M token và giá đầu ra là 2,50 USD/1M token – đó là mức giá mà Google tính, và OrcaRouter chuyển tiếp nguyên vẹn mà không tăng thêm. Bạn không phải trả bất kỳ khoản phí nền tảng bổ sung nào cho mỗi token. Điều này khác thường so với các cổng API khác, thường cộng thêm 10–20% hoặc hơn. Việc không có markup khiến mô hình này thậm chí còn tiết kiệm chi phí hơn khi truy cập qua OrcaRouter. Bạn vẫn phải trả cho băng thông và hạ tầng API, nhưng các chi phí đó đã được bao gồm trong mức giá của nhà cung cấp; OrcaRouter không tách riêng chúng. Mô hình định giá này minh bạch: chi phí hiển thị trong bảng điều khiển sử dụng của bạn là chi phí cuối cùng.
Bạn gọi nó bằng API tương thích OpenAI của OrcaRouter tại URL cơ sở https://api.orcarouter.ai/v1. Đặt tham số model thành "google/gemini-3.5-flash-lite". Cả chat completions (POST /v1/chat/completions) và embeddings (nếu được hỗ trợ) đều hoạt động. Đối với đầu vào đa phương thức, bạn cấu trúc tin nhắn với một mảng roles và các đối tượng content có thể bao gồm các trường text, image_url hoặc file_url. Ví dụ yêu cầu cURL: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' Bạn phải sử dụng khóa API OrcaRouter, không phải khóa API Google.
Mô hình hỗ trợ các tham số tương thích với OpenAI tiêu chuẩn: model, messages, max_tokens (lên đến giới hạn 65.536 của mô hình), temperature, top_p, stop, frequency_penalty, presence_penalty và tools (dành cho gọi hàm). Các tham số riêng của Google (như safety_settings) có thể không được hiển thị trực tiếp; nếu bạn cần chúng, hãy kiểm tra tài liệu OrcaRouter để tìm các tham số tương đương. Mô hình sẽ tuân thủ giới hạn max_tokens. Đối với đầu vào đa phương thức, trường type trong content hỗ trợ: text, image_url, video_url (nếu OrcaRouter hiển thị nó), audio_url và file_url. Loại file có thể chấp nhận PDF, CSV, v.v. Lưu ý rằng các tệp phương tiện lớn có thể cần được mã hóa trước dưới dạng data URI hoặc được lưu trữ công khai. OrcaRouter cũng có thể yêu cầu tệp phải dưới một kích thước nhất định. Luôn tham khảo tài liệu API mới nhất để biết hỗ trợ tham số chính xác.
Để di chuyển từ nhà cung cấp API khác (ví dụ: Google AI Studio, Vertex AI hoặc các cổng khác) sang OrcaRouter, thay thế base URL bằng https://api.orcarouter.ai/v1 và đặt model ID thành "google/gemini-3.5-flash-lite". Nếu mã hiện tại của bạn sử dụng OpenAI Python client, hãy truyền base_url và api_key. Ví dụ: from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) Bạn có thể cần điều chỉnh định dạng tin nhắn đa phương thức nếu nhà cung cấp trước đây của bạn sử dụng schema khác (ví dụ: Anthropic). OrcaRouter mong đợi định dạng OpenAI. Mảng nội dung người dùng có thể bao gồm nhiều phần. Định nghĩa công cụ cũng theo kiểu OpenAI. Không có phí di chuyển bổ sung; bạn chỉ trả phí theo token như mô tả.
Không có dữ liệu so sánh trực tiếp, nhưng chúng ta có thể suy luận định tính. Gemini 2.0 Flash (nếu tồn tại) có thể là một mô hình flash thuộc thế hệ trước. Gemini 3.5 Flash‑Lite là một biến thể lite mới hơn, có cửa sổ ngữ cảnh lớn hơn (1M so với có thể là 128K) và giá thấp hơn. Chi phí mỗi token cho Gemini 3.5 Flash‑Lite là $0,30/$2,50 mỗi triệu token, rất thấp. Các mô hình flash cũ hơn có thể có chi phí mỗi token cao hơn và cửa sổ ngữ cảnh ngắn hơn. Tuy nhiên, Gemini 2.0 Flash có thể có độ chính xác thô tốt hơn nếu đó là mô hình flash đầy đủ chứ không phải biến thể lite. Nếu tác vụ của bạn yêu cầu chất lượng cao nhất và bạn có thể chấp nhận chi phí cao hơn, mô hình flash đầy đủ cũ hơn có thể là lựa chọn tốt hơn. Nếu bạn cần ngữ cảnh lớn và chi phí thấp thì 3.5 Flash‑Lite là lựa chọn hợp lý.
GPT-4o mini từ OpenAI là một mô hình đa phương thức chi phí thấp tương tự. Nó có cửa sổ ngữ cảnh 128K token (nhỏ hơn đáng kể so với 1M) và được định giá ở mức $0.15 trên một triệu token đầu vào và $0.60 trên một triệu token đầu ra (tính đến đầu năm 2025; giá có thể đã thay đổi). Gemini 3.5 Flash‑Lite cung cấp cửa sổ ngữ cảnh lớn hơn 8x với mức giá đầu vào gấp 2x và giá đầu ra gấp 4x. Vì vậy, Gemini đắt hơn trên mỗi token nhưng cung cấp dung lượng ngữ cảnh lớn hơn nhiều. Đối với các tác vụ cần toàn bộ ngữ cảnh 1M (ví dụ: xử lý toàn bộ sách), Gemini Flash‑Lite tiết kiệm chi phí hơn so với việc cố gắng chia nhỏ đầu vào qua nhiều lần gọi GPT‑4o mini. Nếu ngữ cảnh ngắn, GPT‑4o mini rẻ hơn và có thể có hiệu suất benchmark tốt hơn. Không có điểm benchmark nào có thể so sánh trực tiếp nếu không có dữ liệu.
Không có so sánh điểm chuẩn nào được cung cấp. Llama 3.2 90B (giả sử mô hình này tồn tại) là một mô hình mã nguồn mở lớn với cửa sổ ngữ cảnh nhỏ hơn (thường là 128K token) và chi phí mỗi token cao hơn khi chạy qua API. Gemini 3.5 Flash‑Lite là một mô hình độc quyền với cửa sổ ngữ cảnh lớn hơn nhiều và giá rất thấp – một trong những mô hình đa phương thức rẻ nhất trên mỗi token hiện có. Llama 3.2 90B có thể đạt độ chính xác cao hơn trên nhiều điểm chuẩn NLP nhờ kích thước của nó, nhưng nó không phải là mô hình đa phương thức và có giới hạn ngữ cảnh chặt chẽ hơn. Nếu nhiệm vụ của bạn chỉ là văn bản và bạn cần độ chính xác cao nhất, Llama 90B (nếu có thể truy cập qua OrcaRouter) có thể tốt hơn. Đối với các tình huống đa phương thức, ngữ cảnh dài hoặc thông lượng cao, Gemini Flash‑Lite có những lợi thế rõ ràng. Sự lựa chọn phụ thuộc vào các yêu cầu cụ thể của ứng dụng của bạn.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Đầu vào / 1M tokens | $0.300 |
| Đầu ra / 1M tokens | $2.50 |
| Đọc cache / 1M | $0.030 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/google/gemini-3.5-flash-liteMở @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite