Gemini 3.6 Flash là mô hình nhanh, tiết kiệm chi phí mới nhất của Google trong dòng Gemini 3 — một mô hình đa phương thức gốc có khả năng đọc văn bản, hình ảnh, video, âm thanh và tệp tin, đồng thời phản hồi bằng văn bản, với cửa sổ ngữ cảnh 1 triệu token và tối đa 64 nghìn token đầu ra. Mô hình này được xây dựng cho các nhóm cần chất lượng gần như tiên tiến nhất với tốc độ và giá thành của dòng Flash, đồng thời là lựa chọn mặc định mạnh mẽ cho các tác nhân lập trình, hiểu tài liệu và phương tiện, truy xuất tăng cường sinh (RAG) và tự động hóa thông lượng cao. So với phiên bản 3.5 Flash trước đó, mô hình này tiết kiệm token hơn rõ rệt và ít dài dòng hơn — đạt chất lượng tương đương hoặc cao hơn trong khi phát ra ít token đầu ra hơn, giúp giảm trực tiếp chi phí và độ trễ trên các chuỗi tác vụ dài. Mô hình hỗ trợ nỗ lực suy luận có thể cấu hình (cho phép người gọi điều chỉnh độ sâu so với tốc độ cho mỗi yêu cầu), gọi công cụ gốc và đầu ra có cấu trúc, đồng thời hoạt động rất tốt trong các đánh giá về ngữ cảnh dài và lập trình tác nhân ở phân khúc của mình, bao gồm 91,8% trên bài kiểm tra truy xuất nhiều kim (multi-needle retrieval) trung bình 128k và điểm số cạnh tranh trên SWE-Bench Pro, Terminal-Bench và OSWorld. Gemini 3.6 Flash hỗ trợ cả định dạng chat-completions của OpenAI và API generateContent gốc của Gemini, giúp nó trở thành bản nâng cấp tương thích ngay lập tức cho các tích hợp Gemini và tương thích OpenAI hiện có. Hãy sử dụng nó như một con ngựa thồ hàng ngày khi bạn muốn có phần lớn trí thông minh của một mô hình tiên tiến mà không phải trả mức giá của mô hình tiên tiến.
Google Gemini 3.6 Flash là một mô hình đa phương thức lớn do Google phát triển, được cung cấp qua API của OrcaRouter với giá minh bạch (không tính phí chênh lệch). Mô hình này chấp nhận đầu vào là…
Gemini 3.6 Flash xuất sắc trong việc xử lý ngữ cảnh dài (lên đến 1.048.576 token) và xử lý đầu vào đa phương thức. Điểm chuẩn 91.8 trên GDM-MRCR v2 8-needle (trung bình 128k) cho thấy khả năng truy xuất và hiểu ngữ cảnh mạnh mẽ qua nhiều thông tin nhỏ trong một tập dữ liệu lớn, nghĩa là nó có thể định vị chính xác thông tin cụ thể trong các tài liệu lớn. Mô hình cũng hỗ trợ đầu vào âm thanh và video, cho phép các trường hợp sử dụng như phiên âm giọng nói từ video, phân tích biểu đồ hoặc trả lời câu hỏi về một chuỗi hình ảnh. Cái tên Flash ngụ ý độ trễ thấp và hiệu suất chi phí, phù hợp cho các ứng dụng thời gian thực hoặc khối lượng lớn. Vì được cung cấp qua OrcaRouter với giá nhà cung cấp không có phụ phí, tổng chi phí là minh bạch và có thể dự đoán trước.
Gemini 3.6 Flash vốn đã là biến thể Flash được tối ưu hóa chi phí từ Google. Tuy nhiên, nếu trường hợp sử dụng của bạn không yêu cầu đầu vào đa phương thức (ví dụ: các tác vụ chỉ văn bản), một mô hình chỉ văn bản nhỏ hơn với cửa sổ ngữ cảnh ngắn hơn có thể rẻ hơn và nhanh hơn. Nếu tác vụ của bạn nằm trong phạm vi 8K–32K token, các mô hình như Gemini 1.5 Flash (nếu có sẵn qua OrcaRouter) hoặc các mô hình nhẹ khác có thể đáp ứng với chi phí mỗi token thấp hơn. Ngoài ra, nếu bạn không bao giờ sử dụng đầu vào âm thanh, video hoặc tệp, bạn có thể phải trả tiền cho các khả năng mà bạn không cần. Quyết định nên dựa trên các phương thức đầu vào cụ thể của bạn, độ dài ngữ cảnh yêu cầu và yêu cầu về chất lượng. OrcaRouter liệt kê giá cho từng mô hình, vì vậy bạn có thể so sánh tỷ lệ mỗi token và chọn phương án tiết kiệm nhất.
Các tác vụ có thể hưởng lợi từ Gemini 3.6 Flash bao gồm: (1) truy xuất ngữ cảnh dài và trả lời câu hỏi từ các tài liệu vượt quá 100K token, (2) suy luận đa phương thức nơi dữ liệu hình ảnh, âm thanh và văn bản cần được kết hợp, (3) tóm tắt hoặc phân tích video, (4) xử lý tệp như phân tích PDF, bảng tính hoặc bản trình bày có chứa hình ảnh và văn bản, và (5) các ứng dụng nhạy cảm về chi phí nhưng vẫn cần khả năng đa phương thức. Giới hạn đầu ra 65.536 token cho phép tạo các bản tóm tắt, báo cáo hoặc mã nguồn dài. Mô hình này ít phù hợp hơn cho các tác vụ yêu cầu suy luận logic chặt chẽ hoặc suy luận toán học có thể cần đến một biến thể không phải Flash; các trường hợp sử dụng như vậy có thể được hưởng lợi từ độ chính xác cao hơn nhưng với chi phí cao hơn. Hãy kiểm tra điểm chuẩn cho các tác vụ cụ thể của bạn để xác nhận chất lượng so với các giải pháp thay thế.
Qua API tương thích OpenAI của OrcaRouter, Gemini 3.6 Flash hỗ trợ phản hồi dạng stream (sử dụng tham số `stream`) và gọi hàm (tức sử dụng tool) khi được cấu hình đúng. Tính khả dụng chính xác của các tính năng này phụ thuộc vào Google API cơ bản, nhưng OrcaRouter ánh xạ định dạng yêu cầu OpenAI đến các endpoint của Google. Để sử dụng stream, đặt `"stream": true` trong yêu cầu. Để gọi hàm, định nghĩa tools trong phần thân yêu cầu sử dụng schema OpenAI tiêu chuẩn. Bạn nên kiểm thử các tính năng này với model ID `google/gemini-3.6-flash` tại base URL của OrcaRouter. Lưu ý rằng không phải tất cả các phiên bản model Gemini đều hỗ trợ mọi khả năng; hãy tham khảo tài liệu của Google cho phiên bản model cụ thể đằng sau alias.
Điểm chuẩn được cung cấp là 91.8 trên GDM-MRCR v2 8-needle với độ dài ngữ cảnh trung bình 128K token. GDM-MRCR (Google’s Multi-Context Retrieval) v2 đo lường khả năng của một mô hình trong việc truy xuất và suy luận trên nhiều mẩu thông tin (“needles”) được đặt trong một ngữ cảnh dài. Điểm 91.8 cho thấy mô hình đã tìm thấy và trả lời chính xác các truy vấn về trung bình 91.8% số needle. Đây là một kết quả ấn tượng đối với một mô hình Flash, chứng tỏ Gemini 3.6 Flash có thể trích xuất thông tin thực tế từ các tài liệu rất dài một cách đáng tin cậy. Các bài kiểm tra chuẩn không toàn diện; chúng chỉ kiểm tra các tình huống cụ thể. Hiệu suất thực tế có thể thay đổi tùy thuộc vào độ phức tạp của tác vụ truy xuất, số lượng yếu tố gây nhiễu và định dạng thông tin.
Dữ liệu về độ trễ không được cung cấp cho Gemini 3.6 Flash, nhưng các mô hình Flash thường được tối ưu hóa cho thời gian suy luận thấp hơn so với các biến thể không phải Flash. Thời gian phản hồi thực tế phụ thuộc vào các yếu tố như độ dài của ngữ cảnh đầu vào, số lượng token đầu ra được yêu cầu, độ phức tạp của mã hóa đa phương thức (ví dụ: số lượng hình ảnh hoặc khung hình video), và tải máy chủ tại nhà cung cấp. Vì OrcaRouter hoạt động như một cổng, độ trễ bao gồm cả thời gian khứ hồi đến máy chủ của Google và bất kỳ chi phí nào từ việc định tuyến API của OrcaRouter. Đối với các ứng dụng yêu cầu độ trễ rất thấp, bạn có thể muốn kiểm tra với các lời nhắc đại diện và đo thời gian từ đầu đến cuối. Nhìn chung, các mô hình Flash được thiết kế nhanh hơn các mô hình Pro, và phát trực tuyến có thể giảm độ trễ cảm nhận.
Mặc dù Gemini 3.6 Flash hoạt động tốt trên chuẩn đánh giá ngữ cảnh dài được cung cấp, biến thể Flash của nó có thể có độ chính xác thấp hơn trong các tác vụ suy luận, toán học hoặc sinh mã so với các mô hình lớn hơn, đắt tiền hơn. Điểm số so sánh chính xác cho các tác vụ như vậy không được cung cấp. Ngoài ra, giới hạn đầu ra 65,536 token, mặc dù hào phóng, có thể không đủ để tạo ra các tài liệu rất dài hoặc toàn bộ mã nguồn. Mô hình cũng có thể thể hiện các sai lệch hoặc lỗi thực tế thường gặp ở các mô hình ngôn ngữ lớn. Chất lượng hiểu đa phương thức có thể giảm đi với nhiều hình ảnh hoặc video dài do nén token. Cuối cùng, vì mô hình được truy cập thông qua OrcaRouter, bất kỳ sự gián đoạn dịch vụ nào tại Google hoặc OrcaRouter đều có thể ảnh hưởng đến tính khả dụng. Luôn kiểm tra mô hình trên dữ liệu cụ thể của bạn để xác thực chất lượng.
Gemini 3.6 Flash cung cấp một cửa sổ ngữ cảnh gồm 1,048,576 token (xấp xỉ 1 triệu token) cho tổng đầu vào, bao gồm tất cả nội dung văn bản, hình ảnh, video, tệp và âm thanh. Số token đầu ra tối đa được phép trong một phản hồi duy nhất là 65,536 token. Điều này có nghĩa là bạn có thể đưa vào các tài liệu rất dài, nhiều hình ảnh hoặc bản ghi âm dài và vẫn nhận được một phản hồi đáng kể. Cửa sổ ngữ cảnh lớn là một điểm mạnh chính, cho phép thực hiện các tác vụ như tóm tắt sách, xem xét tài liệu pháp lý và các cuộc hội thoại nhiều lượt với lịch sử phong phú. Tuy nhiên, sử dụng đầy đủ ngữ cảnh 1M có thể gây ra thời gian xử lý và chi phí token đáng kể. Hãy lưu ý rằng việc sử dụng ngữ cảnh lớn tiêu tốn token đầu vào với mức giá $1.50 cho mỗi 1 triệu token, do đó đầu vào 1M sẽ tốn $1.50 cho mỗi yêu cầu (cộng với chi phí đầu ra).
Giá là $1.50 cho mỗi 1,000,000 token đầu vào và $7.50 cho mỗi 1,000,000 token đầu ra. OrcaRouter tính phí các mức giá này chính xác như được cung cấp bởi Google, không có phụ phí. Không có thêm phí cho mỗi yêu cầu hoặc phụ phí nền tảng. Token đầu vào bao gồm tất cả các token từ tin nhắn của người dùng (lịch sử hệ thống, người dùng và trợ lý) cũng như bất kỳ nội dung đa phương thức nào được mã hóa thành token. Token đầu ra chỉ tính văn bản được tạo ra. Chi phí cho mỗi yêu cầu phụ thuộc vào độ dài đầu vào và đầu ra của bạn. Ví dụ, một đầu vào 100K token với đầu ra 1K token sẽ có chi phí $0.15 (đầu vào) + $0.0075 (đầu ra) = $0.1575. Đối với việc sử dụng khối lượng lớn, mức giá minh bạch này cho phép dự đoán chi phí chính xác.
OrcaRouter hiện không quảng cáo bất kỳ chương trình giảm giá theo bộ nhớ đệm hoặc chiết khấu số lượng lớn nào dành riêng cho Gemini 3.6 Flash. Mức giá được tính cố định theo token theo tỷ lệ của nhà cung cấp. Một số nền tảng AI cung cấp chiết khấu dựa trên bộ nhớ đệm cho các ngữ cảnh lặp lại, nhưng tính năng này không được đề cập cho mô hình này qua OrcaRouter. Bạn có thể giảm chi phí bằng cách tối ưu hóa độ dài prompt, hạn chế ngữ cảnh không cần thiết và sử dụng token đầu ra ngắn hơn. Nếu bạn cần mức giá thấp hơn trên mỗi token, hãy cân nhắc xem một mô hình nhỏ hơn (ví dụ: Gemini 1.5 Flash) có đáp ứng được tác vụ của bạn hay không. Google có thể cung cấp các mức giá khác nhau cho dung lượng dự trữ, nhưng điều đó không khả dụng qua API trả theo mức sử dụng của OrcaRouter. Luôn kiểm tra tài liệu của OrcaRouter để biết các cập nhật về tùy chọn giá.
Bởi vì OrcaRouter chuyển tiếp giá nhà cung cấp mà không tính thêm phí, chi phí cho mỗi token đối với Gemini 3.6 Flash thông qua OrcaRouter sẽ giống hệt với mức giá mà Google tính trực tiếp. Tuy nhiên, khi sử dụng OrcaRouter, bạn có được một API tương thích với OpenAI thống nhất và có thể hưởng lợi từ việc thanh toán và tích hợp đơn giản hơn. Không có chi phí bổ sung cho dịch vụ gateway. Nếu bạn có hợp đồng trực tiếp với Google Cloud, bạn có thể nhận được chiết khấu theo khối lượng, giúp giảm giá xuống dưới $1.50/$7.50 cho mỗi 1 triệu token. OrcaRouter không cung cấp các khoản chiết khấu như vậy, vì vậy đối với khối lượng rất lớn (>10 tỷ token/tháng), một thỏa thuận trực tiếp có thể rẻ hơn. Đối với hầu hết người dùng, OrcaRouter mang lại sự tương đương về giá cùng với sự tiện lợi của một API tiêu chuẩn.
Khi bạn bao gồm hình ảnh, video, âm thanh hoặc tệp tin trong prompt của mình, dịch vụ sẽ chuyển đổi những nội dung này thành các token, được tính vào hạn mức token đầu vào và tính phí theo tỷ lệ đầu vào (1,50 đô la trên 1 triệu token). Số lượng token tiêu thụ chính xác trên mỗi hình ảnh hoặc mỗi giây âm thanh không được chỉ rõ, nhưng theo hướng dẫn sơ bộ, mỗi hình ảnh có thể tiêu thụ từ vài trăm đến vài nghìn token tùy thuộc vào độ phân giải (độ phân giải cao hơn = nhiều token hơn). Video thường được xử lý dưới dạng một chuỗi các khung hình, mỗi khung hình tốn token. Các tệp như PDF được trích xuất thành văn bản và hình ảnh, trong đó hình ảnh được token hóa tương ứng. Để ước tính chi phí, bạn nên thử nghiệm với các prompt đa phương thức mẫu và theo dõi mức sử dụng token thông qua trường `usage` trong phản hồi API (nếu có). Giảm thiểu nội dung hình ảnh hoặc sử dụng các phiên bản có độ phân giải thấp hơn có thể giúp giảm chi phí.
Để sử dụng Gemini 3.6 Flash, hãy gửi yêu cầu đến endpoint tương thích OpenAI của OrcaRouter. Đặt URL cơ sở là `https://api.orcarouter.ai/v1`. Trong phần thân yêu cầu, chỉ định model là `"google/gemini-3.6-flash"`. API hỗ trợ cùng endpoint chat completions như OpenAI: `POST /chat/completions`. Bạn có thể sử dụng bất kỳ SDK OpenAI nào (Python, Node.js, v.v.) bằng cách cấu hình `api_key` và `base_url`. Ví dụ bằng Python: `client = OpenAI(api_key="your_orcarouter_key", base_url="https://api.orcarouter.ai/v1")` sau đó `response = client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...])`. Model chấp nhận các tham số tiêu chuẩn như `temperature`, `max_tokens`, `stream` và `tools`.
Các tham số được hỗ trợ bao gồm `messages` (mảng các đối tượng tin nhắn với role và content), `max_tokens` (tối đa 65536), `temperature`, `top_p`, chuỗi `stop`, `stream` (boolean), `tools` (dùng để gọi hàm) và `tool_choice`. Nội dung đa phương thức có thể được bao gồm trong trường `content` của một tin nhắn bằng cách sử dụng một mảng các phần (ví dụ: text, image_url, audio_data). Định dạng chính xác tuân theo quy ước API vision của OpenAI. OrcaRouter dịch các tham số này sang API Google bên dưới. Lưu ý rằng không phải tất cả các tham số cụ thể của OCR (như `response_modalities`) đều có sẵn. Để biết chi tiết về các định dạng hình ảnh và âm thanh được hỗ trợ, hãy tham khảo tài liệu của OrcaRouter, nhưng nhìn chung JPEG, PNG, GIF, MP3 và WAV được chấp nhận. Đặt `max_tokens` thành độ dài đầu ra mong muốn trong giới hạn 65536.
Nếu ứng dụng của bạn hiện đang gọi API của OpenAI (ví dụ: `gpt-4o`), việc di chuyển sang Gemini 3.6 Flash qua OrcaRouter yêu cầu thay đổi hai điều: URL cơ sở và tên mô hình. Cập nhật cấu hình client của bạn: đặt URL cơ sở thành `https://api.orcarouter.ai/v1` và sử dụng ID mô hình `"google/gemini-3.6-flash"`. Định dạng tin nhắn hiện tại của bạn, bao gồm các vai trò system, user, và assistant, sẽ hoạt động như cũ. Để hỗ trợ đa phương thức, bạn có thể điều chỉnh mã của mình để bao gồm URL hình ảnh hoặc âm thanh bằng cách sử dụng cấu trúc tin nhắn vision của OpenAI. OrcaRouter xử lý việc dịch API, vì vậy bạn không cần sửa đổi cấu trúc yêu cầu của mình ngoài mô hình và URL cơ sở. Hãy thử nghiệm với một số lượng yêu cầu nhỏ trước để xác nhận hành vi mong đợi và mức sử dụng token.
Để sử dụng OrcaRouter, bạn cần có khóa API do nền tảng cung cấp. Đưa khóa này vào header `Authorization` với giá trị `Bearer <your_key>`. Dữ liệu gửi qua OrcaRouter sẽ được chuyển tiếp đến máy chủ suy luận của Google; OrcaRouter không huấn luyện trên dữ liệu của bạn cũng như không lưu trữ prompt vượt quá mức cần thiết cho quá trình xử lý yêu cầu (ví dụ: ghi log để tính phí). Các chính sách xử lý dữ liệu của Google áp dụng cho nhà cung cấp mô hình. OrcaRouter không thêm bất kỳ lưu trữ dữ liệu bổ sung nào ngoài các log yêu cầu tiêu chuẩn. Đối với thông tin nhạy cảm, hãy tham khảo chính sách bảo mật của OrcaRouter và điều khoản sử dụng dữ liệu Gemini của Google. Vì API tương thích với OpenAI, bạn có thể triển khai các biện pháp bảo mật tiêu chuẩn như mã hóa trong quá trình truyền tải (HTTPS) và luân chuyển khóa.
Cả hai mô hình đều hỗ trợ đầu vào đa phương thức (văn bản, hình ảnh, âm thanh) và cung cấp cửa sổ ngữ cảnh lớn. GPT-4o có ngữ cảnh mặc định 128K (có thể mở rộng lên 256K) trong khi Gemini 3.6 Flash cung cấp 1,048,576 token (1M). Giá cả khác nhau: GPT-4o có giá $2.50 cho mỗi 1M đầu vào và $10 cho mỗi 1M đầu ra (tại thời điểm viết) so với $1.50/$7.50 của Gemini 3.6 Flash. Điểm benchmark không thể so sánh trực tiếp do các bài kiểm tra khác nhau, nhưng điểm 91.8 của Gemini 3.6 Flash trên một benchmark truy xuất cụ thể cho thấy hiệu suất mạnh mẽ. GPT-4o có thể cung cấp khả năng làm theo hướng dẫn và suy luận vượt trội trong nhiều tác vụ, trong khi Gemini 3.6 Flash xuất sắc trong truy xuất ngữ cảnh dài và hiệu quả chi phí. Sự lựa chọn phụ thuộc vào việc bạn ưu tiên độ dài ngữ cảnh, chi phí hay độ chính xác thô cho trường hợp sử dụng cụ thể của mình.
Claude 3.5 Sonnet (ngữ cảnh 200K) có cửa sổ ngữ cảnh ngắn hơn so với 1 triệu token của Gemini 3.6 Flash. Giá mỗi token: Claude 3.5 Sonnet là $3.00 cho mỗi 1M đầu vào và $15.00 cho mỗi 1M đầu ra, cao hơn mức $1.50/$7.50 của Gemini. Claude có thể có thế mạnh về suy luận tinh tế và tuân thủ an toàn, trong khi Gemini Flash tập trung vào tính linh hoạt đa phương thức và truy xuất ngữ cảnh dài. Hỗ trợ đầu vào video và âm thanh của Gemini mang lại lợi thế cho các tác vụ liên quan đến các phương thức đó. Tuy nhiên, đầu ra của Claude thường dài hơn (lên tới 8192 token so với 65K của Gemini). Đối với các tác vụ cần đầu ra rất dài (ví dụ: tạo báo cáo toàn bộ), Gemini 3.6 Flash có thể phù hợp hơn. Không có so sánh điểm chuẩn trên các bộ dữ liệu tiêu chuẩn, vì vậy nên thử nghiệm thực nghiệm.
Chọn Gemini 3.6 Flash khi các yêu cầu chính của bạn là: (a) cửa sổ ngữ cảnh lớn hơn 128K token (lên đến 1M), (b) cần xử lý đầu vào âm thanh, video hoặc tệp, và (c) chi phí trên mỗi token thấp trong số các mô hình đa phương thức. Mô hình này đặc biệt mạnh trong truy xuất tài liệu dài (như được thể hiện qua điểm chuẩn 91.8 của nó). Nếu tác vụ của bạn hoàn toàn dựa trên văn bản và nằm trong 128K token, các mô hình như GPT-4o mini hoặc Claude 3 Haiku có thể rẻ hơn. Nếu bạn cần độ chính xác suy luận cao nhất và ngân sách cho phép, mô hình Pro (ví dụ: Gemini 3.6 Pro, nếu có sẵn qua OrcaRouter) có thể tốt hơn mặc dù chi phí cao hơn. Sử dụng dữ liệu điểm chuẩn và so sánh giá trên OrcaRouter để đưa ra lựa chọn của bạn.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.6-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Đầu vào / 1M tokens | $1.50 |
| Đầu ra / 1M tokens | $7.50 |
| Đọc cache / 1M | $0.150 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/google/gemini-3.6-flashMở @misc{orcarouter_gemini_3_6_flash,
title = {Gemini 3.6 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.6-flash}
}Google. (2026). Gemini 3.6 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.6-flash