Gemini 2.5 Flash Image, hay còn gọi là "Nano Banana," hiện đã có sẵn rộng rãi. Đây là mô hình tạo hình ảnh hiện đại với khả năng hiểu ngữ cảnh. Nó có khả năng tạo hình ảnh,...
Google: Nano Banana (Gemini 2.5 Flash Image) là một mô hình ngôn ngữ đa phương thức do Google phát triển, một phần của dòng Gemini 2.5 Flash. Nó chấp nhận cả hình ảnh và văn bản làm đầu vào và tạo ra…
Các khả năng cốt lõi tập trung vào việc hiểu và suy luận về nội dung thị giác được trình bày dưới dạng hình ảnh. Khi được cung cấp một hình ảnh và một câu lệnh văn bản, mô hình có thể mô tả cảnh, nhận dạng đối tượng, trả lời các câu hỏi về nội dung, trích xuất văn bản (OCR) và thực hiện suy luận thị giác cơ bản (ví dụ: mối quan hệ không gian, màu sắc, hành động). Mô hình cũng có thể xử lý văn bản đi kèm với hình ảnh, chẳng hạn như hướng dẫn hoặc ngữ cảnh. Vì sử dụng kiến trúc flash-tier, mô hình được tối ưu hóa cho độ trễ thấp và thông lượng cao, phù hợp với các ứng dụng thời gian thực hoặc khối lượng lớn. Tuy nhiên, mô hình có thể không đạt được độ sâu suy luận hoặc độ chính xác như các mô hình lớn hơn, đắt tiền hơn như Gemini 2.5 Pro đối với các tác vụ thị giác phức tạp đòi hỏi phân tích chi tiết hoặc chuỗi suy luận dài. Mô hình không được thiết kế cho các tác vụ như tạo hình ảnh, phân tích video hoặc hội thoại nhiều vòng yêu cầu ngữ cảnh dài vượt quá 32K token.
Nếu ứng dụng của bạn hoàn toàn không yêu cầu đầu vào hình ảnh, việc sử dụng một model chỉ xử lý văn bản (ví dụ: biến thể Gemini nhỏ hơn hoặc model mã nguồn mở) sẽ tiết kiệm chi phí hơn. Tương tự, nếu tác vụ của bạn chỉ liên quan đến suy luận dựa trên văn bản mà không có thành phần hình ảnh, thì chi phí phụ cho xử lý hình ảnh là không cần thiết. Đối với các trường hợp độ dài đầu ra lớn—chẳng hạn như tạo báo cáo chi tiết hoặc câu chuyện từ một hình ảnh—mức phí $30 cho mỗi triệu token đầu ra có thể trở nên đắt đỏ. Trong những tình huống như vậy, hãy cân nhắc các model có giá đầu ra thấp hơn, hoặc sử dụng model này để tạo một bản tóm tắt ngắn gọn rồi mở rộng nó bằng một model chỉ xử lý văn bản rẻ hơn. Ngoài ra, nếu bạn cần xử lý nhiều hình ảnh trong một yêu cầu hoặc xử lý các hình ảnh rất lớn, các model có cửa sổ ngữ cảnh lớn hơn hoặc hỗ trợ độ phân giải hình ảnh cụ thể có thể phù hợp hơn.
Triển khai khối lượng lớn được hưởng lợi từ chi phí đầu vào thấp của mô hình này ($0.30 mỗi triệu token) và suy luận nhanh. Các trường hợp sử dụng lý tưởng bao gồm gắn thẻ hình ảnh tự động cho thư viện ảnh lớn, tạo văn bản thay thế cho hàng nghìn hình ảnh sản phẩm, thực hiện OCR trên các lô tài liệu được quét và kiểm duyệt nội dung theo thời gian thực của hình ảnh do người dùng tải lên. Bởi vì chi phí đầu ra cao, phản hồi nên được giữ ngắn gọn—thường là một từ, nhãn hoặc câu. Ví dụ: phân loại hình ảnh vào các danh mục được xác định trước, trích xuất một vài trường chính từ biểu mẫu hoặc trả lời câu hỏi có/không về hình ảnh. Xử lý hàng loạt có thể được thực hiện thông qua API của OrcaRouter với các yêu cầu đồng thời. Độ trễ của mô hình thường thấp, nhưng thông lượng thực tế phụ thuộc vào kích thước và độ phức tạp của hình ảnh. Không có giới hạn tốc độ riêng trong OrcaRouter ngoài việc sử dụng API tổng thể.
Hạn chế chính là chi phí token đầu ra cao so với chi phí đầu vào, khiến việc tạo văn bản dài trở nên tốn kém. Cửa sổ ngữ cảnh 32.768 token giới hạn lượng văn bản và kích thước ảnh (tính theo token) có thể xử lý trong một yêu cầu duy nhất. Mô hình không được thiết kế cho các tác vụ yêu cầu suy luận đa phương thức chuyên sâu, chi tiết hình ảnh phức tạp hoặc xử lý nhiều ảnh cùng lúc (mỗi ảnh bổ sung sẽ tiêu tốn ngữ cảnh). Hơn nữa, là một mô hình cấp flash, nó có thể có độ chính xác thấp hơn đối với các tác vụ thị giác chuyên biệt như phân tích ảnh y tế, phát hiện đối tượng chi tiết hoặc nhận dạng đối tượng hiếm, so với các mô hình có khả năng cao hơn nhưng chậm hơn hoặc đắt hơn. Dữ liệu huấn luyện của mô hình và hiệu suất cụ thể trên các điểm chuẩn không được tiết lộ trong các dữ kiện được cung cấp; người dùng nên tự đánh giá trên tập dữ liệu của mình. Cuối cùng, mô hình chỉ hỗ trợ đầu vào là ảnh và văn bản, không hỗ trợ video hay âm thanh.
Các dữ kiện được cung cấp không bao gồm bất kỳ điểm chuẩn cụ thể nào cho Google: Nano Banana (Gemini 2.5 Flash Image). Nó là một phần của dòng Gemini 2.5 Flash của Google, dòng này thường nhắm đến hiệu quả thay vì độ chính xác hàng đầu. Trong trường hợp không có số liệu, người dùng nên mong đợi hiệu suất tương đương với các mô hình đa phương thức flash-tier khác trên các tác vụ thị giác-ngôn ngữ tiêu chuẩn như VQAv2, COCO Captions và OCR. Tuy nhiên, điểm số chính xác không được đưa ra. Chúng tôi khuyên bạn nên đánh giá mô hình trên tập dữ liệu đại diện của riêng bạn để xác định xem khả năng của nó có đáp ứng yêu cầu của bạn hay không. OrcaRouter không cung cấp các điểm chuẩn nội bộ ngoài những gì có sẵn công khai từ Google. Nếu bạn yêu cầu các chỉ số độ chính xác chính xác, hãy tham khảo tài liệu chính thức của Google cho dòng Gemini 2.5 Flash, nhưng lưu ý rằng mã định danh mô hình cụ thể này có thể có tinh chỉnh riêng.
Các dữ kiện được cung cấp không bao gồm các phép đo độ trễ cho mô hình này. Là một phần của dòng Gemini 2.5 Flash, mô hình này được thiết kế để có độ trễ thấp và thông lượng cao. Thông thường, các mô hình flash-tier của Google đánh đổi một phần chất lượng suy luận để lấy tốc độ, khiến chúng phù hợp cho các ứng dụng gần thời gian thực. Độ trễ thực tế phụ thuộc vào các yếu tố như kích thước và độ phân giải của ảnh đầu vào, độ dài của văn bản nhắc (text prompt), số lượng token đầu ra được yêu cầu và tải hiện tại trên API. Nhìn chung, các tác vụ chú thích ảnh đơn giản có thể hoàn thành trong vài trăm mili giây đến vài giây, trong khi các yêu cầu phức tạp hơn cần đầu ra dài hơn sẽ mất nhiều thời gian hơn. Để có kết quả tốt nhất, hãy giữ độ phân giải ảnh ở mức hợp lý và giới hạn độ dài đầu ra. API của OrcaRouter không có chi phí bổ sung nào ngoài thời gian phản hồi của nhà cung cấp.
Điểm mạnh: Mô hình này hoạt động tốt trong các tác vụ cần câu trả lời nhanh và tiết kiệm chi phí từ một hình ảnh duy nhất. Nó có thể nhanh chóng nhận diện các đối tượng phổ biến, đọc văn bản từ hình ảnh và trả lời trực tiếp các câu hỏi về nội dung hình ảnh. Chi phí đầu vào thấp giúp khả thi cho việc xử lý khối lượng lớn hình ảnh. Hạn chế: Mô hình có thể gặp khó khăn với các tác vụ yêu cầu độ chính xác cao, chẳng hạn như đếm các vật thể nhỏ, phân biệt các kết cấu rất giống nhau, hoặc hiểu các sơ đồ phức tạp. Khả năng hiểu của mô hình chỉ giới hạn ở những gì có thể suy luận từ dữ liệu pixel và lời nhắc văn bản; nó không có quyền truy cập vào kiến thức bên ngoài ngoài dữ liệu huấn luyện (thời điểm cắt không xác định). Ngoài ra, do chi phí đầu ra cao, việc tạo ra các câu trả lời dài dòng cho mỗi hình ảnh có thể nhanh chóng trở nên đắt đỏ. Đối với các tác vụ yêu cầu phân tích dài và chi tiết, một mô hình có khả năng cao hơn (và thường đắt hơn) sẽ phù hợp hơn. Hiệu suất trong các trường hợp đặc biệt như hình ảnh tối mờ hoặc góc chụp bất thường có thể thấp hơn.
Giá cả rất đơn giản: $0.30 cho mỗi 1 triệu token đầu vào và $30.00 cho mỗi 1 triệu token đầu ra. Token đầu vào bao gồm token từ cả văn bản prompt và hình ảnh (hình ảnh được mã hóa token bởi mô hình). Token đầu ra là các token được sinh ra dưới dạng phản hồi. Không có phí thiết lập, không có tối thiểu hàng tháng, và OrcaRouter không cộng thêm phụ phí — bạn trả đúng giá của nhà cung cấp. Token được đếm bởi hệ thống của OrcaRouter. Hóa đơn thường được tính dựa trên mức sử dụng, với các khoản phí phát sinh khi bạn gửi yêu cầu. Bạn có thể theo dõi mức sử dụng qua bảng điều khiển OrcaRouter. Vì token đầu vào rẻ hơn nhiều so với token đầu ra, tổng chi phí cho một yêu cầu điển hình (đầu ra ngắn) chủ yếu đến từ phía đầu vào, đặc biệt nếu bạn bao gồm một hình ảnh lớn. Ví dụ, một hình ảnh 1024x1024 có thể tiêu thụ vài nghìn token đầu vào.
So với các mô hình chỉ văn bản (ví dụ: Gemini 1.5 Flash chỉ văn bản với giá $0.075/M đầu vào, $0.30/M đầu ra), chi phí đầu vào của mô hình này cao gấp 4 lần và chi phí đầu ra cao gấp 100 lần, phản ánh độ phức tạp tăng thêm của thị giác. Đối với các tác vụ không yêu cầu phân tích hình ảnh, các mô hình chỉ văn bản đó rẻ hơn nhiều. So với các mô hình đa phương thức lớn hơn như Gemini 2.5 Pro (có chi phí trên mỗi token cao hơn nhưng khả năng suy luận tốt hơn), mô hình này rẻ hơn về đầu vào nhưng tương tự hoặc cao hơn về đầu ra tùy thuộc vào tầng Pro cụ thể. Sự đánh đổi của tầng flash là độ chính xác thấp hơn để có chi phí đầu vào thấp hơn. Nếu ứng dụng của bạn cần độ chính xác cao và có thể chịu được chi phí đầu vào cao hơn, mô hình Pro có thể tốt hơn. Nếu độ dài đầu ra lớn, chi phí đầu ra của mô hình này trở nên quá cao, vì vậy hãy cân nhắc các mô hình có giá đầu ra thấp hơn, chẳng hạn như Gemini 1.5 Flash (văn bản + thị giác) có thể có mức giá khác.
Các thông tin được cung cấp không đề cập đến bất kỳ cơ chế lưu cache hay chiết khấu theo khối lượng nào cho mô hình này trên OrcaRouter. OrcaRouter truyền trực tiếp mức giá của nhà cung cấp mà không cộng thêm phụ phí, do đó mọi chiết khấu sẽ phải đến từ các thỏa thuận thanh toán trực tiếp của Google. Hiện tại, không có tính năng tự động lưu cache các embedding hình ảnh hoặc prompt trong thông tin công bố của OrcaRouter. Người dùng nên giả định rằng mỗi yêu cầu sẽ được tính phí dựa trên số token đầu vào và đầu ra đã sử dụng. Đối với người dùng có khối lượng lớn, có thể liên hệ OrcaRouter để hỏi về các thỏa thuận doanh nghiệp tiềm năng, nhưng mức giá trả theo nhu cầu tiêu chuẩn là $0.30/M cho đầu vào và $30.00/M cho đầu ra. Để giảm chi phí, hãy tái sử dụng các đầu ra đã tạo trước đó nếu có thể, và hạn chế số lượng token trong mỗi yêu cầu (ví dụ: bằng cách thay đổi kích thước hình ảnh hoặc sử dụng prompt ngắn gọn).
Để sử dụng Google: Nano Banana (Gemini 2.5 Flash Image) qua OrcaRouter, gửi một yêu cầu POST tới https://api.orcarouter.ai/v1/chat/completions với tham số model được đặt là "google/gemini-2.5-flash-image". API tuân theo định dạng chat completions của OpenAI. Bao gồm khóa API OrcaRouter của bạn trong header Authorization dưới dạng "Bearer YOUR_API_KEY". Trong phần thân yêu cầu, cung cấp một mảng messages với một tin nhắn người dùng chứa cả hình ảnh và văn bản. Đối với hình ảnh, bao gồm một phần content có type là "image_url" với URL hoặc dữ liệu base64. Ví dụ: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. Phản hồi sẽ là một chat completion tiêu chuẩn với câu trả lời của mô hình.
API OrcaRouter hỗ trợ nhiều tham số tương tự như API OpenAI. Các tham số cốt lõi: model (bắt buộc, đặt thành "google/gemini-2.5-flash-image"), messages (bắt buộc, mảng các đối tượng tin nhắn), max_tokens (số nguyên, số token tối đa được sinh ra), temperature (số thập phân, mặc định là 1.0, kiểm soát tính ngẫu nhiên), top_p (số thập phân, mặc định là 1.0), presence_penalty và frequency_penalty (số thập phân), stop (chuỗi hoặc mảng các chuỗi, tối đa 4 chuỗi) và stream (boolean, dành cho phản hồi phát trực tuyến). Đối với đầu vào hình ảnh, các tin nhắn phải bao gồm ít nhất một tin nhắn người dùng với nội dung là một mảng các phần, mỗi phần có trường type ("text" hoặc "image_url"). Phần image_url phải có một đối tượng "image_url" với một chuỗi "url" (có thể là URL truy cập công khai hoặc URL dữ liệu với base64). Không có tinh chỉnh hoặc tham số riêng của mô hình nào được công bố. Cửa sổ ngữ cảnh là 32.768 token, do đó hãy đảm bảo prompt_token_count + image_token_count + max_tokens <= 32768.
Việc chuyển sang OrcaRouter chỉ yêu cầu thay đổi mã tối thiểu nếu bạn đã sử dụng API tương thích với OpenAI. Chỉ cần thay đổi base URL từ endpoint trước đó thành https://api.orcarouter.ai/v1. Cập nhật API key của bạn thành key OrcaRouter. Khi gọi model, đặt tham số model thành "google/gemini-2.5-flash-image" (hoặc model bạn muốn). Điều chỉnh các model ID hiện có cho phù hợp. Đối với đầu vào hình ảnh, đảm bảo định dạng yêu cầu của bạn khớp với quy ước OpenAI (ví dụ: sử dụng mảng content với image_url). Thông thường không cần thay đổi mã nào khác. Nếu bạn đang sử dụng định dạng API khác (ví dụ: endpoint đám mây), bạn có thể cần viết lại cấu trúc yêu cầu. OrcaRouter cung cấp tài liệu cho các SDK phổ biến. Hãy thử nghiệm với một số lượng nhỏ yêu cầu để xác minh số lượng token và giá cả. Lưu ý rằng OrcaRouter tính phí theo giá của nhà cung cấp mà không có phụ phí, do đó giá có thể khác với nhà cung cấp trước đây của bạn.
So với Gemini 2.5 Flash chỉ hỗ trợ văn bản (nếu có trên OrcaRouter), mô hình này bổ sung khả năng nhập hình ảnh nhưng với chi phí đầu vào cao hơn. Phiên bản chỉ văn bản thường có chi phí đầu vào mỗi token thấp hơn và chi phí đầu ra thấp hơn đáng kể, khiến nó phù hợp hơn cho các tác vụ thuần văn bản. So với các mô hình Gemini 2.5 Pro, mô hình flash-tier này rẻ hơn về chi phí đầu vào nhưng có thể có độ chính xác và độ sâu suy luận thấp hơn. Các mô hình Pro có cửa sổ ngữ cảnh lớn hơn (thường là 1 triệu token) và hiệu suất tốt hơn trên các tác vụ phức tạp nhiều bước. Chi phí đầu ra cho các mô hình Pro có thể tương tự hoặc cao hơn. Đối với các tác vụ yêu cầu hiểu hình ảnh kèm văn bản, mô hình này cung cấp một điểm khởi đầu tiết kiệm chi phí. Tuy nhiên, nếu bạn cần xử lý video, âm thanh hoặc nhiều hình ảnh cùng lúc, bạn nên cân nhắc mô hình hỗ trợ các phương thức đó (ví dụ: Gemini 2.5 Pro hỗ trợ video và âm thanh trong một số cấu hình).
Mô hình này là một trong nhiều tùy chọn đa phương thức có sẵn thông qua OrcaRouter. GPT-4o (OpenAI) thường có cửa sổ ngữ cảnh lớn hơn (128k) và có thể mang lại khả năng hiểu và suy luận hình ảnh tổng thể tốt hơn, nhưng với chi phí đầu vào và đầu ra cao hơn. Các mô hình thị giác của Claude (ví dụ: Claude 3.5 Sonnet) cũng có tính cạnh tranh nhưng khác nhau về giá cả và độ dài ngữ cảnh. Lợi thế chính của Gemini 2.5 Flash Image là chi phí đầu vào thấp, khiến nó trở nên hấp dẫn cho các tác vụ khối lượng lớn, đầu ra ngắn. Tuy nhiên, đối với suy luận hình ảnh phức tạp, hình ảnh y tế hoặc phân tích tài liệu chi tiết, các mô hình tiên tiến hơn có thể mang lại kết quả tốt hơn. Sự lựa chọn phụ thuộc vào sự cân bằng cụ thể giữa chi phí, độ chính xác và độ trễ. OrcaRouter cho phép bạn dễ dàng chuyển đổi giữa các mô hình bằng cách thay đổi ID mô hình, vì vậy bạn có thể thử nghiệm mô hình này cùng với các lựa chọn thay thế để xác định sự phù hợp nhất.
Một mô hình đắt tiền hơn—chẳng hạn như Gemini 2.5 Pro, GPT-4o, hoặc Claude 3.5 Sonnet—trở nên hợp lý khi nhiệm vụ yêu cầu độ chính xác cao hơn, ngữ cảnh dài hơn, hoặc suy luận đòi hỏi nhiều bước hơn. Nếu ứng dụng của bạn tạo ra kết quả không chính xác hoặc không đầy đủ với mô hình này, thì khoản tiết kiệm chi phí sẽ bị lãng phí nếu bạn cần xử lý hậu kỳ hoặc hiệu chỉnh thủ công. Đối với các nhiệm vụ như phân tích hình ảnh y tế, diễn giải tài liệu pháp lý, hoặc xử lý nội dung tuân thủ nhạy cảm, độ tin cậy của một mô hình cao cấp có thể biện minh cho chi phí cao hơn. Ngoài ra, nếu bạn cần tạo đầu ra dài (ví dụ: mô tả toàn trang) hoặc xử lý hình ảnh rất lớn, các mô hình có cửa sổ ngữ cảnh lớn hơn và chi phí token đầu ra thấp hơn có thể tiết kiệm chi phí hơn về tổng thể. Bản chất flash-tier của mô hình này có nghĩa là nó được thiết kế cho tốc độ và thông lượng, không phải cho độ sâu. Sử dụng nó khi hiểu biết xấp xỉ là đủ; nâng cấp khi độ chính xác quan trọng.
Quyền riêng tư và xử lý dữ liệu phụ thuộc vào chính sách của Google đối với các mô hình Gemini. Cũng như bất kỳ API đám mây nào, dữ liệu đầu vào (hình ảnh và văn bản) được gửi đến máy chủ của Google để xử lý. Google có thể sử dụng dữ liệu để cải thiện mô hình trừ khi bạn từ chối hoặc sử dụng tài khoản cấp doanh nghiệp không cho phép việc này. Các dữ kiện được cung cấp không nêu rõ chi tiết xử lý dữ liệu cho mô hình cụ thể này. Khi sử dụng OrcaRouter làm cổng kết nối, dữ liệu đi qua cơ sở hạ tầng của OrcaRouter nhưng cuối cùng vẫn được Google xử lý. OrcaRouter không lưu trữ dữ liệu của bạn hoặc sử dụng nó để huấn luyện. Người dùng nên xem xét các điều khoản xử lý dữ liệu của Google dành cho API Gemini và cân nhắc mã hóa đầu cuối nếu cần. Đối với dữ liệu nhạy cảm, một số tổ chức ưu tiên các mô hình được lưu trữ trên cơ sở hạ tầng riêng của họ (ví dụ: thông qua Vertex AI với tính năng lưu trữ dữ liệu tại chỗ) thay vì qua cổng kết nối của bên thứ ba. Tuy nhiên, OrcaRouter cung cấp khóa API và hệ thống thanh toán hợp nhất, có thể giúp đơn giản hóa việc truy cập nếu các vấn đề xử lý dữ liệu được chấp nhận.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Đầu vào / 1M tokens | $0.300 |
| Đầu ra / 1M tokens | $30.00 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/google/gemini-2.5-flash-imageMở @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image