Gemini 3.6 Flash

google/gemini-3.6-flash
MớiNổi bật
Thị giácÂm thanhCông cụJSONSuy luận
bởi Google · 2026-07-21

Gemini 3.6 Flash là mô hình nhanh, tiết kiệm chi phí mới nhất của Google trong dòng Gemini 3 — một mô hình đa phương thức gốc có khả năng đọc văn bản, hình ảnh, video, âm thanh và tệp tin, đồng thời phản hồi bằng văn bản, với cửa sổ ngữ cảnh 1 triệu token và tối đa 64 nghìn token đầu ra. Mô hình này được xây dựng cho các nhóm cần chất lượng gần như tiên tiến nhất với tốc độ và giá thành của dòng Flash, đồng thời là lựa chọn mặc định mạnh mẽ cho các tác nhân lập trình, hiểu tài liệu và phương tiện, truy xuất tăng cường sinh (RAG) và tự động hóa thông lượng cao. So với phiên bản 3.5 Flash trước đó, mô hình này tiết kiệm token hơn rõ rệt và ít dài dòng hơn — đạt chất lượng tương đương hoặc cao hơn trong khi phát ra ít token đầu ra hơn, giúp giảm trực tiếp chi phí và độ trễ trên các chuỗi tác vụ dài. Mô hình hỗ trợ nỗ lực suy luận có thể cấu hình (cho phép người gọi điều chỉnh độ sâu so với tốc độ cho mỗi yêu cầu), gọi công cụ gốc và đầu ra có cấu trúc, đồng thời hoạt động rất tốt trong các đánh giá về ngữ cảnh dài và lập trình tác nhân ở phân khúc của mình, bao gồm 91,8% trên bài kiểm tra truy xuất nhiều kim (multi-needle retrieval) trung bình 128k và điểm số cạnh tranh trên SWE-Bench Pro, Terminal-Bench và OSWorld. Gemini 3.6 Flash hỗ trợ cả định dạng chat-completions của OpenAI và API generateContent gốc của Gemini, giúp nó trở thành bản nâng cấp tương thích ngay lập tức cho các tích hợp Gemini và tương thích OpenAI hiện có. Hãy sử dụng nó như một con ngựa thồ hàng ngày khi bạn muốn có phần lớn trí thông minh của một mô hình tiên tiến mà không phải trả mức giá của mô hình tiên tiến.

ngữ cảnh1.05M token
Đầu ra tối đa65.5K
Đầu vàotext + image + video + file + audio
Đầu ratext
TTFT p501.67 s
ĐẦU VÀO$1.50/ 1M token
ĐẦU RA$7.50/ 1M token
TTFT p501.67 s7 ngày
p95 TTFT5.38 s7 ngày
LƯU LƯỢNG7.6Ktokens / 7 ngày

Google Gemini 3.6 Flash là một mô hình đa phương thức lớn do Google phát triển, được cung cấp qua API của OrcaRouter với giá minh bạch (không tính phí chênh lệch). Mô hình này chấp nhận đầu vào là…

Google Gemini 3.6 Flash là gì và dành cho ai?

Phiên bản Flash khác với các mô hình Gemini khác như thế nào?

Gemini 3.6 Flash hỗ trợ những phương thức nhập liệu nào?

Mã ví dụ

Gọi từ bất kỳ SDK nào

Tương thích OpenAI — giữ nguyên SDK bạn đang dùng

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.6-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Tham số được hỗ trợ

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Giá

Đầu vào / 1M tokens$1.50
Đầu ra / 1M tokens$7.50
Đọc cache / 1M$0.150
Tiền tệUSD

Máy tính chi phí

Token / tháng10MM
Tỷ lệ đầu vào70%%
Ước tính / tháng $33.00 · Có cache prompt $28.28

Ước tính theo giá niêm yết

Công cụ ước tính token & chi phí

Token đầu vào: 17Chi phí mỗi yêu cầu: $0.003775

Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.

Hiệu suất

TTFT p50
1.67 s
Tốc độ đầu ra
712 tok/s
p95 TTFT
5.38 s
Tỷ lệ lỗi
25.0%

Benchmark công khai

69.2
AA Coding
Tốt hơn 87% số mô hình được so sánh
#16 / 122
50.1
AA Intelligence
Tốt hơn 82% số mô hình được so sánh
#22 / 124
CharXiv Reasoning (no tools)
85.2
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
49.0
GDM-MRCR v2 8-needle (128k avg)
91.8
GDM-MRCR v2 8-needle (1M pointwise)
54.0
GPQA Diamond
92.8
Humanity's Last Exam
38.3
Long-Context Recall
69.7
MLE-Bench
63.9
OSWorld-Verified
83.0
SciCode
52.7
SWE-Bench Pro (Public)
58.7
tau_banking
24.5
Terminal-bench 2.1 (Terminus-2)
78.0
terminalbench_v2_1
77.5
Nguồn: artificialanalysis.ai, deepmind.google

So sánh

Gemini 3.6 FlashGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Đầu vào $/M$1.50$2.00$4.00$0.50
Đầu ra $/M$7.50$12.00$18.00$3.00
Ngữ cảnh1.0M1.0M1.0M1.0M
Chất lượng8/1010/1010/109/10
So sánh song songSo sánh song songSo sánh song songSo sánh song song

Câu hỏi thường gặp

Chi phí sử dụng Gemini 3.6 Flash thông qua OrcaRouter là gì?
Giá là $1.50 cho mỗi 1 triệu token đầu vào và $7.50 cho mỗi 1 triệu token đầu ra. OrcaRouter tính phí theo tỷ lệ nhà cung cấp với mức chênh lệch bằng không. Không có thêm phí nào.
Cửa sổ ngữ cảnh của Gemini 3.6 Flash là gì?
Cửa sổ ngữ cảnh là 1,048,576 token (khoảng 1 triệu token). Đầu ra tối đa là 65,536 token. Ngữ cảnh bao gồm tất cả các phương thức đầu vào (văn bản, hình ảnh, video, tệp, âm thanh).
Các điểm mạnh chính của mô hình này là gì?
Gemini 3.6 Flash cung cấp cửa sổ ngữ cảnh rất lớn, hỗ trợ năm phương thức nhập liệu (văn bản, hình ảnh, video, tệp, âm thanh) và đạt điểm chuẩn truy xuất mạnh mẽ 91,8 trên GDM-MRCR v2 8-needle (128k avg). Nó cũng tiết kiệm chi phí như một biến thể Flash.
Gemini 3.6 Flash so sánh như thế nào với GPT-4o hoặc Claude 3.5 Sonnet?
Nó có cửa sổ ngữ cảnh lớn hơn (1M so với 128K/200K) và giá mỗi token thấp hơn ($1.50/$7.50 so với ~$2.50/$10 hoặc $3/$15). Điểm benchmark không thể so sánh trực tiếp, nhưng Gemini Flash được tối ưu hóa cho việc truy xuất ngữ cảnh dài. GPT-4o và Claude có thể cung cấp độ chính xác suy luận cao hơn trong một số tác vụ.
OrcaRouter xử lý dữ liệu của tôi như thế nào khi tôi sử dụng mô hình này?
OrcaRouter chuyển tiếp yêu cầu của bạn đến các máy chủ suy luận của Google. OrcaRouter không huấn luyện trên dữ liệu của bạn cũng như lưu trữ prompts vượt quá những gì cần thiết cho việc xử lý và thanh toán. Chính sách bảo mật dữ liệu của Google được áp dụng. Bạn có thể tìm thấy chi tiết trong chính sách bảo mật của OrcaRouter.
Tôi có thể gọi Gemini 3.6 Flash sử dụng OpenAI Python SDK không?
Có. Đặt base URL thành https://api.orcarouter.ai/v1 và model ID thành "google/gemini-3.6-flash". Sử dụng thư viện OpenAI Python với khóa API OrcaRouter của bạn. Ví dụ: client = OpenAI(api_key="your_key", base_url="https://api.orcarouter.ai/v1") sau đó client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...]).
Mô hình có hỗ trợ streaming và gọi hàm không?
Thông qua OrcaRouter, có. Bạn có thể đặt stream=true và bao gồm các công cụ trong yêu cầu. API dịch định dạng OpenAI sang API của Google. Hãy kiểm tra với trường hợp sử dụng của bạn để xác nhận tính tương thích đầy đủ.
Ý nghĩa của điểm chuẩn 91.8 trên GDM-MRCR v2 8-needle là gì?
Nó đo độ chính xác của mô hình trong việc truy xuất nhiều phần thông tin cụ thể từ một ngữ cảnh dài (trung bình 128K token). Điểm số 91.8% có nghĩa là mô hình đã trả lời đúng trong 91.8% các tình huống truy xuất được kiểm tra. Điều này cho thấy hiệu suất mạnh mẽ trong các tác vụ ngữ cảnh dài.

Nhúng huy hiệu này

Google: Gemini 3.6 Flash$1.50/M in1666ms p50qua OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.6-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg" alt="Google: Gemini 3.6 Flash trên OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.6 Flash](https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg)](https://www.orcarouter.ai/models/google/gemini-3.6-flash)

Thẻ mô hình dạng dữ liệu

GET /api/public/models/google/gemini-3.6-flashMở
Máy đọc được:/llms.txt/llms-full.txt