Gemini 3.5 Flash

google/gemini-3.5-flash
Thị giácÂm thanhCông cụJSONSuy luận
bởi google · 2026-05-23

Google Gemini 3.5 Flash — Mô hình Flash mạnh nhất của Google, nằm ngay dưới 3.1-pro-preview về độ thông minh (AA Intel 55.3 so với 57.2) với độ trễ của Flash. Cửa sổ ngữ cảnh 1M token (1.048.576), đầu ra tối đa 64K (65.536). Hỗ trợ đa phương thức toàn phần trên văn bản, hình ảnh, âm thanh, video và tệp; chỉ đầu ra văn bản. AA Coding 45, GPQA Diamond 92,2%, IFBench 76,3% (tuân theo hướng dẫn hàng đầu), Long-Context Recall 69,3%, SciCode 53,1%, τ²-Bench 95,3% (sử dụng công cụ tác nhân), HLE 41%. Hỗ trợ suy luận (include_reasoning / reasoning), đầu ra có cấu trúc, lời gọi công cụ, response_format, seed, stop và các kiểm soát lấy mẫu tiêu chuẩn. Endpoint: chat_completions, gemini_generate. Phù hợp nhất: vòng lặp tác nhân khối lượng lớn, phân tích tài liệu dài và trích xuất đa phương thức khi độ trễ hoặc chi phí của cấp Pro là quá mức.

ngữ cảnh1.05M token
Đầu ra tối đa65.5K
Đầu vàotext + image + video + file + audio
Đầu ratext
TTFT p502.77 s
ĐẦU VÀO$1.50/ 1M token
ĐẦU RA$9.00/ 1M token
TTFT p502.77 s7 ngày
p95 TTFT8.91 s7 ngày
LƯU LƯỢNG1.0Mtokens / 7 ngày

Gemini 3.5 Flash là một mô hình ngôn ngữ lớn do Google phát triển, được tinh chỉnh để tối ưu tốc độ và hiệu suất. Nó thuộc dòng Gemini và được thiết kế để xử lý đầu vào đa phương thức—văn bản, hình…

Gemini 3.5 Flash là gì?

Ai nên sử dụng Gemini 3.5 Flash?

Gemini 3.5 Flash hỗ trợ những phương thức nhập liệu nào?

Làm thế nào để truy cập Gemini 3.5 Flash thông qua OrcaRouter?

Mã ví dụ

Gọi từ bất kỳ SDK nào

Tương thích OpenAI — giữ nguyên SDK bạn đang dùng

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Tham số được hỗ trợ

  • include_reasoning
  • max_tokens
  • reasoning
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Giá

Đầu vào / 1M tokens$1.50
Đầu ra / 1M tokens$9.00
Đọc cache / 1M$0.150
Ghi cache / 1M$0.083
Tiền tệUSD

Máy tính chi phí

Token / tháng10MM
Tỷ lệ đầu vào70%%
Ước tính / tháng $37.50 · Có cache prompt $32.78

Ước tính theo giá niêm yết

Công cụ ước tính token & chi phí

Token đầu vào: 17Chi phí mỗi yêu cầu: $0.004526

Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.

Hiệu suất

TTFT p50
2.77 s
Tốc độ đầu ra
732 tok/s
p95 TTFT
8.91 s
Tỷ lệ lỗi
1.00%

Benchmark công khai

70.1
AA Coding
Tốt hơn 88% số mô hình được so sánh
#15 / 120
50.2
AA Intelligence
Tốt hơn 83% số mô hình được so sánh
#21 / 122
51.0
AA Math
Tốt hơn 27% số mô hình được so sánh
#59 / 81
GPQA Diamond
92.2
Humanity's Last Exam
41.0
IFBench
76.3
Long-Context Recall
69.3
MMLU-Pro
59.0 index
SciCode
53.1
tau_banking
25.4
TerminalBench Hard
40.9
terminalbench_v2_1
78.7
τ²-Bench
95.3
Nguồn: artificialanalysis.ai

So sánh

Gemini 3.5 FlashGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Đầu vào $/M$1.50$2.00$4.00$0.50
Đầu ra $/M$9.00$12.00$18.00$3.00
Ngữ cảnh1.0M1.0M1.0M1.0M
Chất lượng9/1010/1010/109/10
So sánh song songSo sánh song songSo sánh song songSo sánh song song

Câu hỏi thường gặp

Chi phí Gemini 3.5 Flash trên OrcaRouter là bao nhiêu?
Token đầu vào có giá $1.50 cho mỗi 1 triệu token; token đầu ra có giá $9.00 cho mỗi 1 triệu token. OrcaRouter tính phí theo giá của nhà cung cấp mà không có phần chênh lệch. Không có bất kỳ khoản phí bổ sung nào.
Kích thước cửa sổ ngữ cảnh của Gemini 3.5 Flash là bao nhiêu?
Nó hỗ trợ cửa sổ ngữ cảnh lên đến 1,048,576 token (khoảng 1 triệu token). Con số này bao gồm cả token đầu vào và đầu ra.
Các điểm mạnh chính của Gemini 3.5 Flash là gì?
Nó được tối ưu hóa cho độ trễ thấp, thông lượng cao và hiệu quả chi phí. Nó hỗ trợ đầu vào đa phương thức (văn bản, hình ảnh, video, tệp, âm thanh) và cửa sổ ngữ cảnh lớn, khiến nó trở nên lý tưởng cho các ứng dụng thời gian thực và xử lý tài liệu dài.
Gemini 3.5 Flash so sánh như thế nào với Gemini 3.5 Pro?
Flash nhanh hơn và rẻ hơn nhưng có hiệu suất benchmark thấp hơn trong các tác vụ suy luận phức tạp và toán học. Pro chính xác hơn nhưng chậm hơn và đắt hơn. Flash phù hợp hơn cho các ứng dụng có khối lượng lớn, nhạy cảm với độ trễ.
Dữ liệu được xử lý như thế nào khi sử dụng Gemini 3.5 Flash qua OrcaRouter?
OrcaRouter hoạt động như một proxy và không lưu trữ dữ liệu của bạn. Tuy nhiên, các chính sách xử lý dữ liệu của Google áp dụng cho mô hình cơ bản. OrcaRouter khuyên bạn nên xem xét các điều khoản của Google về lưu giữ dữ liệu và quyền riêng tư.
Làm thế nào để gọi Gemini 3.5 Flash bằng API tương thích với OpenAI?
Sử dụng URL cơ sở https://api.orcarouter.ai/v1, ID mô hình "google/gemini-3.5-flash", và truyền khóa API OrcaRouter trong header Authorization. API hỗ trợ các chat completions tiêu chuẩn và phát trực tuyến.
Gemini 3.5 Flash có thể tạo ra độ dài đầu ra là bao nhiêu?
Nó có thể tạo ra lên tới 65,536 token mỗi phản hồi. Điều này lớn hơn đáng kể so với nhiều mô hình, cho phép tạo nội dung dài, mã nguồn, hoặc suy luận mở rộng.
Có giảm giá nào cho các token lặp lại hoặc được lưu trong bộ nhớ đệm không?
Dựa trên các thông tin đã cung cấp, OrcaRouter không cung cấp bộ nhớ đệm hay chiết khấu theo khối lượng. Mỗi token được tính phí theo mức giá tiêu chuẩn bất kể việc tái sử dụng.

Nhúng huy hiệu này

Gemini 3.5 Flash$1.50/M in2768ms p50qua OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash.svg" alt="Gemini 3.5 Flash trên OrcaRouter" /> </a>
Markdown [![Gemini 3.5 Flash](https://www.orcarouter.ai/embed/google/gemini-3.5-flash.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash)

Thẻ mô hình dạng dữ liệu

GET /api/public/models/google/gemini-3.5-flashMở
Máy đọc được:/llms.txt/llms-full.txt