Gemini 3.5 Flash-Lite

google/gemini-3.5-flash-lite
MớiNổi bật
Thị giácÂm thanhCông cụJSONSuy luận
bởi Google · 2026-07-21

Gemini 3.5 Flash-Lite là mô hình Gemini hiệu quả về chi phí nhất của Google, được xây dựng chuyên biệt cho các khối lượng công việc rất lớn, nhạy cảm với độ trễ, nơi chi phí mỗi lần gọi chiếm ưu thế. Mặc dù có mức giá thấp, nhưng nó vốn dĩ là đa phương thức — chấp nhận văn bản, hình ảnh, video, âm thanh và tệp với đầu ra văn bản — và có cùng cửa sổ ngữ cảnh 1M token và lên tới 64K token đầu ra như cấp độ Flash lớn hơn, do đó các tài liệu dài và đầu vào đa phương tiện vẫn nằm trong tầm với. Với mức giá chỉ bằng khoảng một phần năm so với 3.6 Flash, nó là công cụ phù hợp cho phân loại, trích xuất, định tuyến, tóm tắt, tác nhân nhẹ, tạo dữ liệu tổng hợp và bất kỳ quy trình nào chạy hàng triệu lần. Nó vẫn hỗ trợ nỗ lực suy luận có thể cấu hình, gọi công cụ gốc và đầu ra có cấu trúc, và vượt trội so với các mô hình nhẹ khác trong các điểm chuẩn về tác nhân và ngữ cảnh dài — ví dụ 74.0% trên OSWorld-Verified và 72.2% trên truy xuất nhiều kim 128k, vượt xa so với 3.1 Flash-Lite trước đó. Nó hỗ trợ cả định dạng chat-completions của OpenAI và API generateContent gốc của Gemini, do đó bạn có thể kết hợp nó với các mô hình nặng hơn đằng sau một tích hợp duy nhất — định tuyến các lưu lượng dễ, khối lượng lớn tới Flash-Lite và chuyển các tác vụ khó lên 3.6 Flash hoặc mô hình Pro.

ngữ cảnh1.05M token
Đầu ra tối đa65.5K
Đầu vàotext + image + video + file + audio
Đầu ratext
TTFT p501.30 s
ĐẦU VÀO$0.30/ 1M token
ĐẦU RA$2.50/ 1M token
TTFT p501.30 s7 ngày
p95 TTFT10.00 s7 ngày
LƯU LƯỢNG5.9Mtokens / 7 ngày

Google Gemini 3.5 Flash-Lite là một mô hình ngôn ngữ đa phương thức do Google phát triển, được cung cấp thông qua API tương thích OpenAI của OrcaRouter. Nó chấp nhận đầu vào dạng văn bản, hình ảnh,…

Google Gemini 3.5 Flash-Lite là gì?

Mô hình này được thiết kế cho ai?

Mô hình hỗ trợ những phương thức nào?

Cửa sổ ngữ cảnh và đầu ra tối đa có kích thước như thế nào?

Mã ví dụ

Gọi từ bất kỳ SDK nào

Tương thích OpenAI — giữ nguyên SDK bạn đang dùng

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Tham số được hỗ trợ

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Giá

Đầu vào / 1M tokens$0.300
Đầu ra / 1M tokens$2.50
Đọc cache / 1M$0.030
Tiền tệUSD

Máy tính chi phí

Token / tháng10MM
Tỷ lệ đầu vào70%%
Ước tính / tháng $9.60 · Có cache prompt $8.66

Ước tính theo giá niêm yết

Công cụ ước tính token & chi phí

Token đầu vào: 17Chi phí mỗi yêu cầu: $0.001255

Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.

Hiệu suất

TTFT p50
1.30 s
Tốc độ đầu ra
829 tok/s
p95 TTFT
10.00 s
Tỷ lệ lỗi
5.0%

Benchmark công khai

49.3
AA Coding
Tốt hơn 60% số mô hình được so sánh
#49 / 122
36.5
AA Intelligence
Tốt hơn 54% số mô hình được so sánh
#57 / 124
CharXiv Reasoning (no tools)
74.5
CharXiv Reasoning (with tools)
76.5
GDM-MRCR v2 8-needle (128k avg)
72.2
GDM-MRCR v2 8-needle (1M pointwise)
21.3
GPQA Diamond
83.8
Humanity's Last Exam
17.5
Long-Context Recall
62.0
MLE-Bench
39.2
OSWorld-Verified
74.0
SciCode
40.9
SWE-Bench Pro (Public)
54.2
tau_banking
16.5
Terminal-bench 2.1 (Terminus-2)
54.0
terminalbench_v2_1
53.6
Nguồn: artificialanalysis.ai, deepmind.google

So sánh

Gemini 3.5 Flash-LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Đầu vào $/M$0.30$2.00$4.00$0.50
Đầu ra $/M$2.50$12.00$18.00$3.00
Ngữ cảnh1.0M1.0M1.0M1.0M
Chất lượng6/1010/1010/109/10
So sánh song songSo sánh song songSo sánh song songSo sánh song song

Câu hỏi thường gặp

Giá mỗi token cho Gemini 3.5 Flash-Lite trên OrcaRouter là bao nhiêu?
Giá là $0.30 mỗi triệu token đầu vào và $2.50 mỗi triệu token đầu ra. Đây là tỷ lệ nhà cung cấp với mức chênh lệch bằng không. Token đầu vào bao gồm tất cả các dạng thức (văn bản, hình ảnh, video, âm thanh, tệp tin). Token đầu ra là văn bản được tạo ra.
Kích thước cửa sổ ngữ cảnh là bao nhiêu?
Cửa sổ ngữ cảnh là 1,048,576 token (khoảng 1 triệu). Độ dài đầu ra tối đa là 65,536 token. Điều này cho phép xử lý các tài liệu, video hoặc bản ghi âm rất dài trong một yêu cầu API duy nhất.
Các điểm mạnh chính của mô hình này là gì?
Các điểm mạnh chính của nó là: chi phí trên mỗi token rất thấp, hỗ trợ năm phương thức đầu vào (văn bản, hình ảnh, video, âm thanh, tệp), cửa sổ ngữ cảnh khổng lồ 1 triệu, và khả năng sử dụng công cụ (điểm suy luận CharXiv 76.5 với công cụ). Nó được thiết kế cho các pipeline sản xuất có thông lượng cao, nhạy cảm với chi phí.
So sánh với các mô hình lớn hơn như Gemini 3.5 Pro như thế nào?
Không có so sánh điểm chuẩn trực tiếp nào được cung cấp. Là một biến thể flash‑lite, mô hình này ưu tiên hiệu suất và chi phí thấp hơn là hiệu năng thô. Các mô hình lớn hơn như Gemini 3.5 Pro có thể đạt độ chính xác cao hơn trong các tác vụ suy luận phức tạp nhưng chi phí mỗi token cao hơn đáng kể. Hãy sử dụng mô hình này khi chi phí và thông lượng là yếu tố quan trọng.
Mô hình có lưu vào bộ nhớ đệm các prompt để giảm chi phí không?
Thông tin được cung cấp không đề cập đến bất kỳ cơ chế lưu trữ đệm hay giá token được giảm giá cho lưu trữ đệm. Bạn nên giả định rằng tất cả các token được tính phí theo mức đầu vào tiêu chuẩn. Nếu việc lưu trữ đệm quan trọng, hãy kiểm tra với OrcaRouter hoặc Google để biết bất kỳ khoản giảm giá nào có sẵn.
Làm cách nào để truy cập mô hình này qua API tương thích với OpenAI?
Sử dụng API của OrcaRouter tại URL cơ sở https://api.orcarouter.ai/v1. Đặt tham số model thành "google/gemini-3.5-flash-lite". API này hoàn toàn tương thích với định dạng chat completions của OpenAI, bao gồm nội dung đa phương thức và định nghĩa công cụ.
Tôi có thể mong đợi những gì về xử lý dữ liệu và quyền riêng tư?
Việc xử lý dữ liệu được điều chỉnh bởi các chính sách của Google (nhà cung cấp) và các điều khoản của OrcaRouter. Mô hình xử lý đầu vào của bạn và đầu ra được trả lại cho bạn. Không có chứng nhận bảo mật cụ thể nào cho mô hình này được cung cấp. Đối với dữ liệu nhạy cảm, hãy xem xét thỏa thuận xử lý dữ liệu của nhà cung cấp.
Tôi có thể sử dụng mô hình này cho các ứng dụng thời gian thực không?
Chi tiết về độ trễ không được chỉ định. Mô hình có thể trả về phản hồi trong vài giây đối với đầu vào ngắn, nhưng xử lý các prompt rất dài (gần 1 triệu token) có thể mất hàng chục giây. Nó phù hợp cho các ứng dụng gần thời gian thực với kích thước đầu vào vừa phải. Đối với các yêu cầu thời gian thực nghiêm ngặt, hãy kiểm tra với độ dài đầu vào dự kiến của bạn.
CharXiv Reasoning benchmark score là gì?
Mô hình đạt được số điểm 76.5 trên CharXiv Reasoning with tools. Chuẩn mực này kiểm tra khả năng hiểu và suy luận biểu đồ. Điểm số cho thấy hiệu suất ở mức trung bình; mô hình có thể giải thích biểu đồ và trả lời câu hỏi, nhưng không ở cấp độ của các mô hình suy luận chuyên dụng. Không có điểm chuẩn nào khác được cung cấp.
Có yêu cầu về chi phí tối thiểu hoặc cam kết khi sử dụng OrcaRouter không?
OrcaRouter không yêu cầu chi tiêu tối thiểu hàng tháng. Bạn chỉ phải trả cho các token bạn sử dụng với tỷ lệ nhà cung cấp không tăng giá. Không có phí trả trước hay hợp đồng dài hạn. Chỉ cần đăng ký lấy khóa API và bắt đầu gửi yêu cầu.

Nhúng huy hiệu này

Google: Gemini 3.5 Flash-Lite$0.30/M in1298ms p50qua OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg" alt="Google: Gemini 3.5 Flash-Lite trên OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.5 Flash-Lite](https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite)

Thẻ mô hình dạng dữ liệu

GET /api/public/models/google/gemini-3.5-flash-liteMở
Máy đọc được:/llms.txt/llms-full.txt