Gemini 3.8 Flash là mô hình Flash thông minh nhất của Google, với những cải tiến đáng kể so với 3.7 Flash trong các lĩnh vực kỹ thuật phần mềm, tác vụ agentic và suy luận đa bước.
Gemini 3.8 Flash hướng đến các nhóm cần một mô hình của Google với khả năng đa phương thức đầu vào rộng, ngữ cảnh dài, giới hạn đầu ra lớn và API tương thích OpenAI. Mô hình này phù hợp cho các tác…
Các khả năng được nêu bao gồm hỗ trợ đầu vào đa dạng, ngữ cảnh 1.048.576 token, giới hạn đầu ra 65.536 token và điểm 54,9 trên HLE-Verified. HLE-Verified là một chuẩn đánh giá cấp chuyên gia, vì vậy điểm số này cho thấy mô hình có thể xử lý các câu hỏi đòi hỏi khả năng ghi nhớ, suy luận và tính toán khó. Vì mô hình chấp nhận văn bản, hình ảnh, video, tệp tin và âm thanh, một quy trình làm việc duy nhất có thể truyền đồng thời một tài liệu, một bản ghi âm và các hướng dẫn tiếp theo. Trên OrcaRouter, không cần Google SDK riêng: mô hình được hiển thị dưới dạng google/gemini-3.8-flash phía sau API tương thích OpenAI tiêu chuẩn. Điều này thuận tiện cho các pipeline hiện đang gửi yêu cầu hoàn tất hội thoại (chat completion). Mức đầu ra tối đa cao giúp mô hình có khả năng tạo ra các báo cáo dài đầy đủ, tệp mã nguồn hoặc đầu ra có cấu trúc trong một lần sinh duy nhất. Điều này có nghĩa là mô hình hỗ trợ gọi công cụ (tool calling), thực thi mã hoặc đầu ra có cấu trúc không? Bản ghi danh mục không liệt kê các tính năng đó. Mọi khả năng như vậy nên được kiểm thử trước khi bạn phụ thuộc vào nó.
Cửa sổ ngữ cảnh 1.048.576 token cho phép các lời nhắc chứa một tài liệu lớn, một cuốn sách, một bộ tệp phong phú hoặc một bản ghi âm dài. Điều này giảm nhu cầu phân đoạn, truy xuất hoặc tóm tắt qua nhiều lượt khi tài liệu nguồn có thể nằm gọn trong giới hạn của nhà cung cấp. Nó cũng cho phép bạn đưa văn bản nguồn, hướng dẫn tác vụ và ví dụ vào trong một lần gọi. Ngân sách ngữ cảnh thực tế có thể nhỏ hơn nếu bạn yêu cầu một phản hồi rất dài, vì danh sách này không nêu rõ đầu vào và đầu ra chia sẻ cửa sổ như thế nào. Để đạt độ tin cậy tối đa, hãy đặt hướng dẫn ở vị trí mà mô hình có khả năng phản hồi cao nhất và kiểm thử với bố cục lời nhắc của riêng bạn. Nếu tổng yêu cầu của bạn vượt quá giới hạn của nhà cung cấp, OrcaRouter sẽ trả về lỗi từ phía máy chủ. Các cuộc gọi ngữ cảnh dài được tính phí theo token, vì vậy ngữ cảnh rộng không miễn phí; token đầu vào được tính ở mức 0,75 đô la cho mỗi 1 triệu token. Đối với các tác vụ mà phần lớn cửa sổ không liên quan, một lời nhắc ngắn hơn có thể hoạt động tốt tương đương với chi phí thấp hơn.
Không phải tác vụ nào cũng cần ngữ cảnh 1.048.576 token, đầu vào đa phương thức, hay điểm HLE-Verified 54,9. Đối với phân loại văn bản ngắn, tạo tiêu đề, định tuyến đơn giản, hoặc trích xuất độ phức tạp thấp, một mô hình rẻ hơn thường có thể tạo ra đầu ra chấp nhận được với chi phí thấp hơn. Trong OrcaRouter, việc chuyển đổi ID mô hình không làm thay đổi mẫu API tổng thể, vì vậy các nhóm có thể tạo nguyên mẫu trên một mô hình ít tốn kém hơn và chỉ nâng cấp lên google/gemini-3.8-flash khi chất lượng hoặc độ dài yêu cầu điều đó. Nếu khối lượng công việc chỉ sử dụng văn bản và prompt nhỏ, thì ngữ cảnh lớn và hỗ trợ phương tiện truyền thông không mang lại giá trị gì. Nếu đầu ra mong muốn vượt quá 65.536 token, mô hình này không thể tạo ra nó trong một lần hoàn thành. Cấu trúc giá cũng đóng vai trò quan trọng: token đầu ra có giá 3,75 USD mỗi 1 triệu, gấp năm lần tỷ lệ đầu vào. Một khối lượng công việc thiên về sinh nội dung sẽ bị chi phối bởi chi phí đầu ra. Trong những trường hợp như vậy, tạo đầu ra ngắn hơn hoặc sử dụng mô hình đầu ra ít tốn kém hơn thường tiết kiệm chi phí hơn.
HLE-Verified là tập con đã được xác minh của bộ benchmark Humanity's Last Exam, chứa các câu hỏi khó ở cấp độ chuyên gia đã được kiểm tra tính chính xác. Gemini 3.8 Flash đạt 54,9 trên bộ benchmark đó theo danh mục OrcaRouter. Điểm số cao hơn có nghĩa là mô hình trả lời đúng tỷ lệ lớn hơn trong số các câu hỏi khó này. Điểm trên 50 cho thấy mô hình xử lý đúng hơn một nửa số mục HLE đã được xác minh trong đánh giá này. Đây là một điểm tham chiếu cho các tác vụ kiến thức, toán học và lập luận khó, không phải là một hồ sơ chất lượng toàn diện. Bảng liệt kê này không đưa ra điểm benchmark nào khác, vì vậy hiệu suất MMLU, lập trình, toán học hoặc tuân theo chỉ dẫn không được suy ra từ con số này. Chất lượng sản xuất thay đổi tùy theo tác vụ và phong cách nhắc lệnh, và các con số benchmark có thể bị ảnh hưởng bởi phương pháp đánh giá. Các nhóm nên chạy các ví dụ xác thực riêng thông qua OrcaRouter và so sánh mô hình này với các ứng viên khác thay vì coi một điểm tổng hợp duy nhất là tiêu chí quyết định duy nhất.
Mức đầu ra tối đa 65.536 token đặt ra một giới hạn trên cho độ dài của một phản hồi được tạo ra. Điều này có ý nghĩa khi tác vụ yêu cầu phân tích mở rộng, một tài liệu dài hoặc một payload có cấu trúc lớn. Đối với các tác vụ benchmark trả lời ngắn như HLE-Verified, giới hạn đầu ra thường không phải là điểm nghẽn. Đối với việc tạo nội dung, nó loại bỏ nhu cầu chia nhỏ đầu ra trong hầu hết các trường hợp phổ biến. Giới hạn đầu ra cũng tương tác với cửa sổ ngữ cảnh 1.048.576 token, vì một prompt lấp đầy toàn bộ ngữ cảnh cộng với đầu ra có độ dài tối đa có thể vượt quá tổng ngân sách của nhà cung cấp trừ khi nhà cung cấp tách riêng hạn mức đầu vào và đầu ra. Bản ghi danh mục này không nêu rõ quy tắc tính toán đó. Trong thực tế, hãy đặt max_tokens thành giá trị lớn nhất bạn cần thay vì luôn sử dụng 65.536. Các đầu ra dài được tính phí 3,75 USD cho mỗi 1 triệu token, vì vậy việc tạo không cần thiết sẽ làm tăng chi phí. Nếu ứng dụng cần nhiều hơn 65.536 token trong một phản hồi, chỉ riêng mô hình này là không đủ.
Danh mục OrcaRouter không công bố chỉ số độ trễ hoặc thông lượng cho Gemini 3.8 Flash. Thời gian phản hồi phụ thuộc vào kích thước prompt, độ dài đầu ra, điều kiện mạng, mức độ đồng thời và tải phía nhà cung cấp. Cái tên Flash trong dòng sản phẩm mô hình của Google thường ám chỉ một mô hình phản hồi nhanh hơn so với các dòng sản phẩm lớn hơn hoặc sâu hơn, nhưng không có mục tiêu tốc độ cụ thể nào xuất hiện trong danh sách này. Nếu bạn đang phục vụ các yêu cầu người dùng trực tiếp, hãy đo thời gian trọn vòng qua OrcaRouter với các tải trọng thực tế. Một câu trả lời ngắn sẽ xuất hiện nhanh hơn một bản sinh dài vì tổng thời gian sinh thường tăng theo độ dài đầu ra. Mô hình định giá không tính thêm phí độ trễ cho mỗi yêu cầu; bạn trả tiền theo token đầu vào và đầu ra. Để giảm thời gian tường đồng hồ, hãy loại bỏ nội dung không cần thiết khỏi prompt, giới hạn max_tokens và tránh gửi phương tiện lớn khi không bắt buộc. Không có cam kết tốc độ nào được đưa ra trên trang danh mục này, vì vậy các ứng dụng nhạy cảm với hiệu suất nên được kiểm tra tải trước khi ra mắt.
Danh mục này không cung cấp báo cáo hạn chế riêng biệt. Các thông tin được ghi nhận là tên mô hình, nhà cung cấp, cửa sổ ngữ cảnh, đầu ra tối đa, phương thức đầu vào, giá, quyền truy cập API và một điểm chuẩn. Không có tuyên bố nào về hỗ trợ gọi công cụ, thực thi mã, tạo hình ảnh, đầu ra âm thanh hoặc đầu ra có cấu trúc trong hồ sơ này. Các tính năng đó cần được xác minh bằng một yêu cầu thực tế trước khi tin dùng. Điểm HLE-Verified 54.9 vẫn có nghĩa là mô hình bỏ sót khoảng 45% các mục ở cấp độ chuyên gia đã được xác minh trong điểm chuẩn đó, vì vậy nó không phải là một công cụ suy luận hoàn hảo. Cửa sổ ngữ cảnh lớn không đảm bảo sự chú ý như nhau đến mọi nội dung, và không có dữ liệu nào về ảo giác, thiên kiến, từ chối hoặc độ chính xác theo lĩnh vực được liệt kê. Đầu vào đa phương tiện được hỗ trợ, nhưng danh mục không chỉ rõ cách từng loại phương tiện được mã hóa token hoặc giới hạn nào áp dụng cho kích thước tệp. Đối với đầu ra quan trọng về an toàn hoặc được quản lý, hãy tự xây dựng quy trình xác thực của riêng bạn. Nếu một tác vụ nằm ngoài các đầu vào hoặc đầu ra được hỗ trợ, hãy chọn mô hình có mục danh mục phù hợp.
Gemini 3.8 Flash được tính phí theo mức giá của nhà cung cấp: 0,75 USD cho mỗi 1.000.000 token đầu vào và 3,75 USD cho mỗi 1.000.000 token đầu ra. OrcaRouter không cộng thêm bất kỳ khoản phụ phí nào vào mức giá đó. Token đầu vào bao gồm văn bản cùng với nội dung phương tiện được gửi đến mô hình, mặc dù danh mục này không cung cấp công thức tính token cho từng hình ảnh, video hoặc âm thanh. Token đầu ra bao gồm văn bản được mô hình trả về. Vì mức giá đầu ra gấp năm lần mức giá đầu vào, nên các câu trả lời dài có thể chiếm phần lớn chi phí ngay cả khi lời nhắc lớn. Để quản lý chi phí, hãy viết lời nhắc cung cấp ngữ cảnh liên quan và yêu cầu phản hồi ngắn gọn khi có thể. Danh mục không liệt kê bất kỳ khoản phí phiên, phí nền tảng hoặc phí đăng ký cố định nào. Các khoản phí được chỉ định duy nhất là số tiền trên mỗi token. Các trường thông tin sử dụng phản hồi do API trả về nên được dùng để xác nhận số lượng token đầu vào và đầu ra được tính phí cho mỗi lần gọi.
Dựa trực tiếp trên mức giá và kích thước ngữ cảnh đã niêm yết: ở mức $0.75 cho mỗi triệu token đầu vào, một prompt đầy đủ 1,048,576 token sẽ tốn khoảng $0.79 cho phần đầu vào trước khi đầu ra được tạo ra. Một đầu ra đầy đủ 65,536 token sẽ tốn khoảng $0.25 ở mức $3.75 cho mỗi triệu. Một yêu cầu sử dụng toàn bộ cửa sổ đầu vào và toàn bộ giới hạn đầu ra sẽ có tổng khoảng $1.04 theo giá nhà cung cấp với mức chênh lệch bằng không. Hầu hết các yêu cầu thực tế sử dụng ít hơn nhiều, vì vậy các giá trị này nên được coi là phép tính cận trên, không phải hóa đơn điển hình. Vì token đầu ra đắt hơn, thiết kế tiết kiệm nhất là chỉ gửi những nội dung mà mô hình cần và yêu cầu một kết quả tập trung. Đầu vào video và âm thanh không có mức giá riêng được liệt kê chi tiết trong bản ghi này, vì vậy tổng chi phí cho các prompt giàu phương tiện sẽ phụ thuộc vào cách nhà cung cấp token hóa các đầu vào đó. Hãy theo dõi mức sử dụng từ mỗi phản hồi để ước tính chính xác tổng chi tiêu tích lũy.
OrcaRouter niêm yết Gemini 3.8 Flash theo mức giá của nhà cung cấp với zero markup, vì vậy giá trên mỗi token hiển thị phải khớp với mức giá của nhà cung cấp Google thượng nguồn. Không có khoản phí OrcaRouter bổ sung nào trên mỗi token xuất hiện trong bản ghi danh mục. Caching là một vấn đề riêng biệt: không có giá cho prompt-cache hit, mức chiết khấu cache, hoặc cài đặt cache tự động nào được bao gồm trong các thông tin mô hình được cung cấp. Bạn không nên giả định rằng các tiền tố giống hệt nhau được gửi lặp lại sẽ được tính phí ở mức thấp hơn. Việc không có giá cache được niêm yết đồng nghĩa với mô hình chi phí an toàn nhất được dựa trên việc tính phí toàn bộ token đầu vào. Nếu caching trở nên khả dụng, nó có thể làm giảm chi phí hiệu quả của các prompt lặp lại, nhưng hành vi đó không được đảm bảo trong mục này. Để kiểm soát chi phí mà không có caching, hãy giữ các khối prompt dùng chung ngắn gọn, sử dụng bộ lưu trữ ngoài cho nội dung tĩnh lớn khi có thể, và tránh gửi lại dữ liệu trùng lặp trừ khi tác vụ yêu cầu.
Khi các mô hình OrcaRouter được tính phí theo đúng biểu giá nhà cung cấp với mức phụ giá bằng 0, chênh lệch giá giữa các mô hình đến từ biểu giá của nhà cung cấp thượng nguồn tương ứng. Gemini 3.8 Flash có giá $0.75 cho mỗi 1M token đầu vào và $3.75 cho mỗi 1M token đầu ra. Liệu một mô hình khác có rẻ hơn hay không tùy thuộc vào biểu giá nhà cung cấp của mô hình đó — vốn không được hiển thị trong mục này. Vì OrcaRouter không thu phí theo từng token, việc so sánh giá rất trực tiếp: bạn chỉ cần so sánh các cột biểu giá của nhà cung cấp. Giá không phải là yếu tố duy nhất. Một mô hình rẻ hơn nhưng tạo ra đầu ra không thể sử dụng có thể đòi hỏi các lần thử lại, sự xem xét thủ công hoặc thêm lời nhắc bổ sung, và cuối cùng có thể đắt hơn một mô hình có tỷ lệ thành công cao hơn. Với các tác vụ ngắn và đơn giản, các mô hình có chi phí thấp hơn vẫn có lợi thế rõ ràng. Với các tác vụ suy luận phức tạp hoặc công việc đa phương thức/ngữ cảnh dài, hãy đánh giá tổng chi phí cho mỗi phản hồi thành công. Hãy đo lường cả chất lượng lẫn chi phí trên tập dữ liệu của riêng bạn trước khi chọn ID mô hình mặc định.
OrcaRouter cung cấp API tương thích OpenAI tại https://api.orcarouter.ai/v1. Hãy đặt base_url của bạn thành địa chỉ đó và trường model thành google/gemini-3.8-flash. SDK OpenAI hoặc bất kỳ client nào hỗ trợ các yêu cầu chat completion của OpenAI đều có thể gọi model này. Ví dụ: một client Python sẽ khởi tạo OpenAI với base_url=https://api.orcarouter.ai/v1 và api_key được đặt thành khóa OrcaRouter của bạn, sau đó gọi chat.completions.create với model=google/gemini-3.8-flash. Phản hồi sẽ bao gồm các trường choices và usage theo định dạng thông thường. Điều này có nghĩa là mã hiện có không cần một client dành riêng cho Google. Đối với đầu vào là hình ảnh, video, tệp hoặc âm thanh, yêu cầu phải sử dụng định dạng nội dung mà model chấp nhận và được truyền qua OrcaRouter; trang danh mục này không hiển thị schema cho media, vì vậy hãy thử nghiệm một yêu cầu nhỏ trước. Hãy sử dụng chính xác ID model như được ghi, bao gồm cả tiền tố google.
Tối thiểu, hãy đặt model thành google/gemini-3.8-flash và cung cấp mảng messages chứa nội dung người dùng. Endpoint tương thích với OpenAI, do đó các tham số tiêu chuẩn như max_tokens, temperature, top_p, stop và stream có thể khả dụng, tùy thuộc vào sự hỗ trợ của nhà cung cấp. Mục danh mục không liệt kê giá trị mặc định hoặc giới hạn phạm vi cho các tham số lấy mẫu. Vì đầu ra tối đa được liệt kê là 65.536 token, các yêu cầu đặt max_tokens cao hơn giá trị đó cần được xử lý thận trọng; model thượng nguồn có thể từ chối hoặc giới hạn chúng. Nếu tác vụ của bạn yêu cầu phản hồi dài, hãy đặt max_tokens một cách tường minh theo độ dài dự kiến. Nếu phản hồi ngắn là đủ, hãy giữ max_tokens ở mức thấp để tránh phải trả phí cho đầu ra không cần thiết. Mảng messages nên sử dụng cùng các vai trò như với các model kiểu OpenAI khác. Đối với đầu vào đa phương tiện, hãy thêm nội dung đa phương tiện theo định dạng mà API client của bạn sử dụng và xác minh rằng OrcaRouter trả về một completion hợp lệ thay vì lỗi mã hóa đầu vào.
Có. Vì OrcaRouter sử dụng API tương thích với OpenAI, việc di chuyển thường chỉ bao gồm ba thay đổi: đặt base URL thành https://api.orcarouter.ai/v1, sử dụng API key của OrcaRouter, và đổi tên model thành google/gemini-3.8-flash. Mã nguồn đọc `choices[0].message.content` và `usage` sẽ tiếp tục hoạt động. Các quy trình làm việc chỉ dùng văn bản nên di chuyển một cách sạch sẽ. Các quy trình đa phương tiện (multimodal) kém chắc chắn hơn: nếu mã hiện tại của bạn gửi hình ảnh với các phần nội dung đặc thù của OpenAI, các trường đó có thể được Gemini 3.8 Flash chấp nhận nguyên trạng hoặc không. Hồ sơ danh mục không bao gồm đặc tả chuyển đổi phương tiện. Trước khi di chuyển lưu lượng lớn hoặc nặng về phương tiện, hãy chạy một tập hợp nhỏ các yêu cầu giống hệt nhau trên cả hai endpoint và so sánh phản hồi cùng thông báo lỗi. Giữ model ID hiện tại của bạn làm phương án dự phòng trong quá trình di chuyển vì hành vi của một model không được đảm bảo giống hệt model khác ngay cả khi dùng chung định dạng API.
Trang danh mục này chỉ bao gồm một mô hình Google, nên không xuất ra bảng so sánh đối chiếu với các biến thể Gemini khác. Trong cách đặt tên của Google, Flash thường dùng để chỉ mô hình hướng đến sự cân bằng giữa tốc độ và chi phí, trong khi các hạng Gemini khác có thể nhắm đến khả năng cao hơn hoặc mức giá khác. Các nhận định đó không được dữ liệu trong mục này chứng minh, vì vậy việc lựa chọn cuối cùng nên dựa trên các trường danh mục theo từng mô hình. Hãy so sánh cửa sổ ngữ cảnh, đầu ra tối đa, phương thức đầu vào, giá bán và điểm benchmark. Gemini 3.8 Flash có cửa sổ ngữ cảnh 1.048.576 token, đầu ra tối đa 65.536 token, đầu vào đa phương thức và điểm HLE-Verified là 54,9. Một mô hình Gemini khác có thể có cửa sổ ngữ cảnh nhỏ hơn hoặc mức giá khác, nhưng thông tin đó không được cung cấp ở đây. Hãy chạy cùng các prompt đánh giá qua OrcaRouter với từng ứng viên. Cách này đáng tin cậy hơn việc giả định rằng hai mô hình cùng nhà cung cấp sẽ có hành vi giống nhau.
Đối với các tác vụ đơn giản, một mô hình rẻ hơn theo token có thể đánh bại Gemini 3.8 Flash về chi phí. Gemini 3.8 Flash tính phí $0,75 cho mỗi 1M token đầu vào và $3,75 cho mỗi 1M token đầu ra; một mô hình khác có mức giá thấp hơn có thể hấp dẫn khi đầu ra ngắn và tác vụ đơn giản. Tuy nhiên, giá cả một mình không quyết định tổng chi phí. Nếu một mô hình rẻ hơn khởi động lại hoặc tạo ra câu trả lời kém chất lượng cho các yêu cầu phức tạp, các lần gọi thêm có thể vượt quá số tiền tiết kiệm được. Điểm mạnh bù đắp chính của Gemini 3.8 Flash là điểm HLE-Verified 54,9, đầu vào đa phương thức, ngữ cảnh lớn và giới hạn đầu ra dài. Nếu khối lượng công việc của bạn không sử dụng những điểm mạnh đó, mô hình rẻ hơn là lựa chọn hợp lý. Hãy dùng OrcaRouter để chạy cả hai mô hình trên một mẫu đại diện và so sánh độ chính xác, độ dài đầu ra và tổng chi tiêu cho mỗi kết quả thành công. Giới hạn ngữ cảnh cũng quan trọng vì mô hình có cửa sổ nhỏ hơn có thể cần truy xuất thêm hoặc chia nhỏ văn bản, làm tăng chi phí tích hợp.
Các mô hình chuyên về suy luận thường được tối ưu hóa để dành thêm chi phí tính toán cho các bài toán logic và toán học khó. Mục danh mục này không bao gồm một mô hình khác để so sánh, vì vậy hướng dẫn dưới đây chỉ mang tính định tính. Gemini 3.8 Flash phù hợp khi khối lượng công việc của bạn cần ngữ cảnh dài, đầu ra rất dài, hoặc đầu vào gồm văn bản kết hợp với hình ảnh, video, tệp tin và âm thanh. Những tính năng đó có thể quan trọng hơn một điểm số cộng thêm trên một chuẩn đánh giá khó. Đặc điểm của dòng Flash cũng cho thấy đây là tùy chọn có độ trễ thấp hơn so với một mô hình suy luận nặng hơn, mặc dù không có khẳng định nào về tốc độ được nêu tại đây. Nếu nhiệm vụ là một chứng minh khó, phân tích mã nguồn, hoặc câu hỏi lập kế hoạch nhiều bước, hãy so sánh google/gemini-3.8-flash với một mô hình suy luận trên các lời nhắc kiểu HLE của riêng bạn. Nếu bạn không cần sự suy xét sâu sắc, một mô hình thuộc lớp Flash có thể giúp tránh chi phí cao hơn và phản hồi chậm hơn. Không có mô hình nào thắng tuyệt đối; các yếu tố quyết định là kích thước ngữ cảnh, hỗ trợ đa phương thức, độ trễ yêu cầu, độ dài đầu ra và chất lượng tác vụ được đo lường.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-3.8-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Đầu vào / 1M tokens | $0.750 |
| Đầu ra / 1M tokens | $3.75 |
| Đọc cache / 1M | $0.075 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/google/gemini-3.8-flashMở @misc{orcarouter_gemini_3_8_flash,
title = {Gemini 3.8 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.8-flash}
}Google. (2026). Gemini 3.8 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.8-flash