Gemini 2.5 Flash là mô hình công cụ chủ lực hiện đại nhất của Google, được thiết kế đặc biệt cho các tác vụ suy luận nâng cao, lập trình, toán học và khoa học. Nó bao gồm khả năng "suy nghĩ" tích hợp, cho phép nó cung cấp các phản hồi với mức độ lớn hơn...
Google Gemini 2.5 Flash là một mô hình ngôn ngữ đa phương thức do Google phát triển. Nó thuộc dòng Gemini 2.5, được thiết kế để xử lý hiệu quả các đầu vào văn bản, hình ảnh, âm thanh và video. Mô…
Gemini 2.5 Flash chấp nhận năm phương thức đầu vào: tệp (ví dụ: PDF, tài liệu), hình ảnh, văn bản, âm thanh và video. Điều này cho phép người dùng cung cấp một hỗn hợp dữ liệu phong phú trong một yêu cầu duy nhất. Ví dụ, bạn có thể gửi một bản ghi video, một bản văn bản lời thoại kèm theo và một tài liệu PDF tham khảo, và mô hình sẽ suy luận trên tất cả các phương thức. Mô hình xử lý các đầu vào này một cách tự nhiên mà không yêu cầu mã hóa hoặc chia nhỏ riêng biệt cho hầu hết các định dạng. Hỗ trợ đa phương thức này đặc biệt hữu ích cho các tác vụ như tóm tắt video, phân tích nhiều tài liệu và trợ lý tương tác.
Với cửa sổ ngữ cảnh 1,048,576 token, Gemini 2.5 Flash có thể tiếp nhận toàn bộ sách, mã nguồn dài, hoặc hàng giờ âm thanh đã được phiên âm trong một lượt duy nhất. Điều này loại bỏ nhu cầu về kỹ thuật cửa sổ trượt hoặc bộ nhớ ngoài. Các trường hợp sử dụng bao gồm xem xét toàn bộ dự án phần mềm để tìm lỗi, phân tích các tài liệu pháp lý dài với nhiều trích dẫn, hoặc tóm tắt một cuộc họp kéo dài nhiều giờ. Ngữ cảnh lớn cũng cho phép mô hình duy trì tính mạch lạc qua các cuộc hội thoại rất dài, mặc dù độ dài đầu ra bị giới hạn ở 65,536 token.
Dựa trên các điểm chuẩn, Gemini 2.5 Flash vượt trội về khả năng suy luận toán học, đạt 93,2 điểm trên MATH-500. Mô hình này cũng thể hiện hiệu suất mạnh mẽ trong việc tạo mã và hiểu ngữ cảnh nhờ khả năng ngữ cảnh lớn và huấn luyện đa phương thức. Khả năng xử lý âm thanh và video thuần túy của mô hình giúp giảm chi phí tiền xử lý. Chi phí thấp trên mỗi token khiến nó trở nên hấp dẫn cho xử lý hàng loạt và các ứng dụng thời gian thực. Tuy nhiên, đối với các tác vụ yêu cầu tính sáng tạo cực cao hoặc chuyên môn miền cụ thể, một mô hình chuyên biệt hoặc lớn hơn có thể được ưu tiên.
Gemini 2.5 Flash đã có mức giá cạnh tranh: $0.30 cho mỗi 1M token đầu vào và $2.50 cho mỗi 1M token đầu ra. Tuy nhiên, đối với các tác vụ rất đơn giản như phân loại hoặc tạo văn bản ngắn, một mô hình nhỏ hơn như Gemini 1.5 Flash hoặc các giải pháp thay thế từ bên thứ ba có thể mang lại chi phí thấp hơn cho mỗi token. Hãy đánh giá mức sử dụng token dự kiến và yêu cầu về độ trễ của bạn. Nếu khối lượng công việc của bạn không yêu cầu ngữ cảnh 1M đầy đủ hoặc đầu vào đa phương thức, một mô hình chỉ văn bản với cửa sổ ngữ cảnh nhỏ hơn có thể giảm chi phí. Danh mục của OrcaRouter cung cấp các tùy chọn để so sánh chi phí.
MATH-500 là một benchmark bao gồm 500 bài toán khó thuộc các lĩnh vực đại số, hình học, xác suất và lý thuyết số. Điểm số 93.2 có nghĩa là mô hình đã giải đúng 93.2% các bài toán này, cho thấy khả năng lập luận toán học và giải quyết vấn đề mạnh mẽ. Điểm số này đưa Gemini 2.5 Flash vào nhóm các mô hình hoạt động hàng đầu cho các tác vụ toán học. Benchmark này kiểm tra cả độ chính xác tính toán và khả năng lập luận logic. Các nhà phát triển làm việc với các công cụ giáo dục, tính toán khoa học hoặc quy trình làm việc nặng về toán học có thể dựa vào điểm số này như một tài liệu tham khảo.
Tốc độ phụ thuộc vào độ phức tạp của yêu cầu, độ dài token và tải máy chủ. Google chưa công bố số liệu cụ thể về độ trễ cho Gemini 2.5 Flash. Tuy nhiên, định danh “Flash” cho thấy sự tối ưu hóa về độ trễ thấp so với phiên bản Pro. Trong các trường hợp sử dụng thông thường qua OrcaRouter, thời gian phản hồi có tính cạnh tranh cho các ứng dụng thời gian thực. Đối với các tình huống thông lượng cao, hãy cân nhắc việc gộp yêu cầu hoặc sử dụng đầu ra streaming. OrcaRouter hỗ trợ phản hồi streaming qua API tương thích với OpenAI, giúp giảm độ trễ cảm nhận.
So với các mô hình giá rẻ như GPT-4o mini hoặc Claude 3 Haiku, Gemini 2.5 Flash cung cấp cửa sổ ngữ cảnh lớn hơn (1M so với thông thường 128K-200K) và hỗ trợ đầu vào đa phương thức. Điểm MATH-500 của nó là 93.2, cao hơn nhiều lựa chọn thay thế có giá tương tự. Chi phí cạnh tranh, đặc biệt cho token đầu ra với $2.50 cho mỗi 1 triệu token. Tuy nhiên, đối với các tác vụ tập trung hoàn toàn vào viết sáng tạo hoặc trôi chảy hội thoại, các mô hình khác có thể hoạt động tốt hơn. Dữ liệu benchmark cho các tác vụ không phải toán học không được cung cấp, do đó việc so sánh trực tiếp còn hạn chế.
Mặc dù Gemini 2.5 Flash hoạt động tốt trong các bài toán và mã nguồn, hiệu suất của nó trên các khía cạnh khác—như khả năng ghi nhớ thực tế, hiểu ngôn ngữ tinh tế, hoặc sáng tạo nội dung—không được đề cập trong tiêu chuẩn đánh giá đã cho. Là một mô hình “Flash”, nó có thể đánh đổi một phần chiều sâu suy luận để lấy tốc độ. Đầu ra tối đa 65.536 token có thể không đủ để tạo các báo cáo rất dài hoặc tóm tắt các đầu vào cực kỳ dài. Ngoài ra, giới hạn dữ liệu huấn luyện và các thiên kiến tiềm ẩn của mô hình cũng không được xác định; người dùng nên xác thực đầu ra cho các ứng dụng quan trọng.
Giá cả minh bạch: $0.30 cho mỗi 1 triệu token đầu vào và $2.50 cho mỗi 1 triệu token đầu ra. Các mức giá này được tính theo giá của nhà cung cấp Google mà không có bất kỳ khoản phụ phí nào từ OrcaRouter. Không có phí ẩn hay phụ phí. Ví dụ, xử lý 10 triệu token đầu vào sẽ tốn $3.00, và tạo ra 1 triệu token đầu ra sẽ tốn $2.50. Mức giá này áp dụng cho tất cả các phương thức đầu vào được hỗ trợ. Số lượng token bao gồm tất cả văn bản, các mảnh hình ảnh (sau khi chuyển đổi), và các đoạn âm thanh/video theo lược đồ token hóa của Google.
Bộ nhớ đệm lời nhắc có thể giảm chi phí đầu vào khi cùng một ngữ cảnh được tái sử dụng qua nhiều yêu cầu. Các mô hình Google Gemini hỗ trợ tự động lưu vào bộ nhớ đệm các token tiền tố lặp lại. Trên OrcaRouter, hành vi lưu vào bộ nhớ đệm tuân theo chính sách của Google. Nếu ứng dụng của bạn thường xuyên gửi cùng các hướng dẫn hệ thống hoặc tài liệu tham khảo, việc lưu vào bộ nhớ đệm có thể giảm chi phí token đầu vào hiệu quả. Mức tiết kiệm chính xác phụ thuộc vào tỷ lệ truy cập bộ nhớ đệm. Không có mức giảm giá cụ thể nào cho việc lưu vào bộ nhớ đệm được cung cấp trong các thông tin về giá, nhưng người dùng nên tham khảo tài liệu của Google về điều kiện sử dụng bộ nhớ đệm.
Gemini 2.5 Pro thường có chi phí trên mỗi token cao hơn so với Flash (giá chính xác cho Pro không được cung cấp), nhưng có thể mang lại chất lượng cao hơn trong các tác vụ suy luận phức tạp. Flash được thiết kế cho các ứng dụng ưu tiên tốc độ và hiệu quả kinh tế. Đối với sản xuất khối lượng lớn, chi phí trên mỗi token thấp hơn của Flash có thể mang lại khoản tiết kiệm đáng kể. Tuy nhiên, nếu một tác vụ yêu cầu độ chính xác tuyệt đối (ví dụ: trong suy luận pháp lý hoặc y tế), chi phí tăng thêm của Pro có thể là hợp lý. Hãy đánh giá cả hai trên một mẫu dữ liệu của bạn để xác định sự cân bằng tối ưu giữa chi phí và hiệu suất.
OrcaRouter không thêm markup, vì vậy giá mỗi token vẫn theo tỷ lệ nhà cung cấp của Google. Các khoản giảm giá theo số lượng có thể được cung cấp trực tiếp từ Google cho doanh nghiệp, nhưng những khoản này không được phản ánh trong bảng giá trả theo mức sử dụng tiêu chuẩn được liệt kê. OrcaRouter cung cấp mô hình tính phí đơn giản theo từng token mà không có cam kết tối thiểu. Người dùng có thể liên hệ với OrcaRouter để biết thông tin về các thỏa thuận dựa trên khối lượng tiềm năng, mặc dù không có cấu trúc giảm giá cụ thể nào được cung cấp trong các thông tin thực tế.
Gọi Gemini 2.5 Flash thông qua API tương thích OpenAI của OrcaRouter. Đặt base URL thành https://api.orcarouter.ai/v1 và model ID thành "google/gemini-2.5-flash". Sử dụng bất kỳ SDK OpenAI hoặc HTTP client nào. Xác thực yêu cầu một API key từ OrcaRouter. Gửi một yêu cầu POST đến /chat/completions với tham số model. Ví dụ bằng Python: client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_KEY"); response = client.chat.completions.create(model="google/gemini-2.5-flash", messages=[{"role":"user","content":"Hello"}]). API hỗ trợ streaming, function calling và các tham số OpenAI tiêu chuẩn khác.
Tất cả các tham số hoàn thành chat chuẩn của OpenAI đều được hỗ trợ, bao gồm: messages (mảng các đối tượng message), temperature (0-2), top_p, max_tokens (tối đa 65536), frequency_penalty, presence_penalty, stop, stream (boolean), và logprobs. Đối với đầu vào đa phương thức, sử dụng cấu trúc nội dung với các phần text và image_url hoặc file_url. Đầu vào âm thanh và video có thể được cung cấp dưới dạng data URI mã hóa base64 hoặc URL tùy theo kích thước tệp. API cũng hỗ trợ response_format với chế độ JSON nếu cần. Tham khảo tài liệu của OrcaRouter để biết chi tiết định dạng chính xác.
Việc di chuyển rất đơn giản vì OrcaRouter sử dụng một endpoint tương thích với OpenAI. Nếu bạn đang sử dụng OpenAI, Anthropic hoặc các nhà cung cấp khác, hãy thay đổi base URL thành https://api.orcarouter.ai/v1 và API key của bạn thành khóa OrcaRouter. Cập nhật model ID thành "google/gemini-2.5-flash". Không cần thay đổi định dạng tin nhắn, luồng (streaming) hoặc cấu trúc gọi khác. Đối với người dùng đến từ SDK Vertex AI hoặc Generative AI gốc của Google, bạn sẽ cần điều chỉnh sang định dạng tin nhắn của OpenAI, nhưng nhiều thư viện đã có các tiện ích chuyển đổi.
OrcaRouter hiển thị các mã lỗi HTTP tiêu chuẩn: 401 cho truy cập trái phép, 429 cho giới hạn tần suất, 500 cho lỗi máy chủ. Giới hạn tần suất phụ thuộc vào gói OrcaRouter của bạn. Google cũng có thể áp dụng giới hạn tần suất riêng cho mỗi khóa API. API trả về lỗi theo định dạng OpenAI. Đối với các yêu cầu lớn vượt quá cửa sổ ngữ cảnh 1M hoặc đầu ra 65K, bạn sẽ nhận được lỗi 400. Tài liệu của OrcaRouter cung cấp các mức giới hạn tần suất cụ thể. Nếu bạn gặp giới hạn tần suất, hãy cân nhắc thử lại với backoff theo cấp số nhân.
GPT-4o mini là một mô hình nhỏ hơn, rẻ hơn từ OpenAI với cửa sổ ngữ cảnh 128K token (nhỏ hơn 8 lần so với Gemini 2.5 Flash). GPT-4o mini chỉ hỗ trợ văn bản, trong khi Gemini 2.5 Flash hỗ trợ tệp, hình ảnh, âm thanh và video. Trên MATH-500, GPT-4o mini đạt khoảng 70-80 (không có con số chính xác cho sự so sánh này), trong khi Gemini 2.5 Flash đạt 93.2. Giá của GPT-4o mini xấp xỉ $0.15/$0.60 trên 1M token (đầu vào/đầu ra) – rẻ hơn Gemini Flash cho đầu vào nhưng đắt hơn cho đầu ra. Chọn Gemini Flash cho các tác vụ đa phương thức, ngữ cảnh dài; chọn GPT-4o mini cho các ứng dụng chỉ văn bản với chi phí rất thấp.
Gemini 2.0 Flash (thế hệ trước) có cửa sổ ngữ cảnh 1M token và hỗ trợ đa phương thức tương tự. Tuy nhiên, Gemini 2.5 Flash cải thiện khả năng suy luận toán học, thể hiện qua điểm MATH-500 là 93,2 so với điểm của 2.0 Flash (không được cung cấp, nhưng có khả năng thấp hơn). Giá cho 2.5 Flash là $0,30/$2,50 trên 1M token, trong khi 2.0 Flash là $0,15/$0,60 trên 1M token – do đó 2.5 Flash đắt hơn trên mỗi token. Sự đánh đổi là độ chính xác cao hơn. Đối với các dự án nhạy cảm về chi phí và không yêu cầu hiệu suất toán học cao, 2.0 Flash có thể là lựa chọn ưu tiên. OrcaRouter cung cấp cả hai phiên bản.
Các mô hình đa phương thức giá rẻ khác bao gồm Claude 3 Haiku (ngữ cảnh 200K, văn bản+hình ảnh) và Llama 3.2 90B (ngữ cảnh 128K, văn bản+hình ảnh). Gemini 2.5 Flash cung cấp cửa sổ ngữ cảnh lớn nhất (1M) và hỗ trợ âm thanh/video một cách tự nhiên, điều hiếm có ở mức giá này. Điểm MATH-500 của nó là 93.2, cao hơn nhiều mô hình tương đương. Tuy nhiên, đối với tạo văn bản thuần túy, các mô hình như Mistral Small có thể mang lại độ trễ thấp hơn. Lựa chọn tối ưu phụ thuộc vào yêu cầu phương thức cụ thể của bạn và liệu ngữ cảnh lớn hơn có biện minh cho chi phí hay không.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Đầu vào / 1M tokens | $0.300 |
| Đầu ra / 1M tokens | $2.50 |
| Đọc cache / 1M | $0.030 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/google/gemini-2.5-flashMở @misc{orcarouter_gemini_2_5_flash,
title = {Gemini 2.5 Flash API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash}
}Google. (2025). Gemini 2.5 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash