Gemini 4-1
Guides & Insights

Gemini 4: Những gì Google thực sự nói, Những gì Internet đã phát minh, và vấn đề "Dòng máu bị nguyền rủa"

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ba mô hình được ra mắt trong một bài đăng vào ngày 21 tháng 7 năm 2026 — Gemini 3.6 Flash (bản thay thế cho Gemini 3.5 Flash), Gemini 3.5 Flash-Lite và Gemi​ni 3.5 Flash Cyber. G​oogle đã dùng đoạn cuối của chính bài đăng đó để hé lộ sự thật chắc chắn duy nhất hiện có về flagship tiếp theo của họ: "Chúng tôi đã bắt đầu đợt tiền huấn luyện tham vọng nhất từ trước đến nay cho Gemi​ni 4 và rất hào hứng với tiến độ đạt được." Và đó vẫn là toàn bộ thông báo. Tính đến ngày 25 tháng 8, vẫn chưa có ngày phát hành, chưa có số tham số, chưa có cửa sổ ngữ cảnh, chưa có giá, chưa có điểm chuẩn — và cũng không có chuỗi mô hình gemini-4 ở bất kỳ đâu trong API của G​oogle, Vertex AI hay AI Studio. Điểm mới là sự chuẩn bị đang bắt đầu lộ diện trong chính các sản phẩm của G​oogle: các nhà theo dõi rò rỉ tại TestingCatalog báo cáo rằng nền móng của Gemi​ni 4 giờ đã có thể phát hiện được bên trong ứng dụng desktop G​emini — cùng loại dấu vết mà họ từng phát hiện trước khi G​emini 3 ra mắt vào năm ngoái.

Thay vào đó, thứ mà ba tuần qua tạo ra là sự ồn ào xung quanh lời xác nhận. Công ty phân tích SemiAnalysis tuyên bố rằng sản phẩm chủ lực G​emini 3.5 Pro bị trì hoãn đã âm thầm bị hủy bỏ. Tờ Financial Times đưa tin rằng đồng sáng lập Sergey Brin đã quay trở lại với chiến lược G​emini. Noam Shazeer, đồng sáng tạo ra transformer và đồng trưởng nhóm G​emini, đã gia nhập O​penAI. Và vào ngày 24 tháng 8, trang chuyên theo dõi tin rò rỉ TestingCatalog đưa tin rằng việc chuẩn bị cho Gemi​ni 4 đã bắt đầu bên trong ứng dụng desktop G​emini — dấu vết gần nhất từ phía sản phẩm, được xem xét trong phần riêng bên dưới. Bản thân G​oogle cũng có một tháng bận rộn: hãng thông báo rằng ứng dụng G​emini đã vượt mốc một tỷ người dùng hàng tháng và cải tổ đội ngũ lãnh đạo của DeepMind. Tỷ lệ đặt cược trên thị trường dự đoán về việc phát hành vào năm 2026 liên tục trượt giảm. Không điều nào trong số đó thay đổi những gì G​oogle đã xác nhận — vẫn chỉ là một câu trong bài đăng blog và một lời diễn giải trong cuộc gọi báo cáo thu nhập — nhưng nó thay đổi bối cảnh mà người đọc nên cân nhắc lời xác nhận đó.

Kết quả tìm kiếm cho mô hình này vẫn lên tới hàng nghìn từ về số lượng tham số, tên kiến trúc, cửa sổ ngữ cảnh và ngày ra mắt vào tháng Tám. Gần như không có thông tin nào được trích nguồn. Bài viết này tách bạch hai điều: những gì G​oogle đã nói, và những gì đã được thêu dệt thêm lên trên — bao gồm cả lớp mới nhất, vốn đến từ những người theo dõi rò rỉ và chuỗi mã lệnh thay vì từ G​oogle.

Bản ghi đã xác nhận đầy đủ

Mọi thứ bên dưới đều đến từ bài đăng ngày 21 tháng 7 của chính Google hoặc từ phát biểu của Pichai trong cuộc gọi thu nhập ngày 23 tháng 7. Không điều gì khác về Gemini 4 có nguồn chính thức — và một tháng sau, tính đến ngày 25 tháng 8, Google vẫn chưa bổ sung gì thêm. Những gì xuất hiện từ đó đến nay chỉ là dấu vết tình cờ, không phải thông báo chính thức: các dấu vết do người ngoài phát hiện trong chính sản phẩm của Google, mà chúng tôi đề cập dưới đây.

• Quá trình tiền huấn luyện đã bắt đầu — được G​oogle mô tả là "đợt tiền huấn luyện tham vọng nhất của chúng tôi từ trước đến nay." Đã bắt đầu, chưa hoàn thành.

• Nó sẽ là mô hình nền tảng lớn hơn nhiều so với Gemini 3 Pro. Cách diễn giải của Pichai: "thế hệ tiếp theo của các mô hình AI tiên tiến đòi hỏi các mô hình nền tảng lớn hơn nhiều."

• Các mục tiêu là lập trình và tác nhân AI. Pichai đã đích danh lập trình và lập trình tác nhân (agentic coding) là những lĩnh vực cần cải thiện.

• G​emini 3.5 Pro là một mô hình riêng biệt, vẫn chưa được phát hành — "hiện đang thử nghiệm với các đối tác," sẽ có mặt "ngay khi sẵn sàng." Nó không phải là Gemi​ni 4 dưới một tên gọi khác. G​oogle chưa bao giờ nói rằng mô hình này thay thế mô hình kia; mặt khác, hãng phân tích SemiAnalysis hiện tin rằng G​emini 3.5 Pro đã bị âm thầm hủy bỏ — sẽ nói thêm về điều đó bên dưới.

• Google muốn một nhịp phát hành khoảng hàng tháng cho phân khúc Flash, với Gemini 4 được xây dựng làm nền tảng để có thể nhanh chóng lặp lại sau đó.

• Tiền đã được cam kết. Alphabet đã nâng dự báo capex năm 2026 lên 195–205 tỷ USD, từ mức 180–190 tỷ USD, với lý do nhu cầu vượt xa đầu tư — và dòng tiền tự do quý 2 của họ lần đầu tiên trong lịch sử chuyển sang âm, đó là điều thị trường tập trung chú ý khi các thay đổi lãnh đạo diễn ra vào ngày 5 tháng 8: Demis Hassabis rút lui khỏi việc điều hành G​oogle DeepMind để trở thành chủ tịch của công ty này và nhà khoa học trưởng của Alphabet, cấp phó Koray Kavukcuoglu tiếp quản quyền điều hành hằng ngày, và hai đồng trưởng nhóm kỹ thuật ban đầu của G​emini là Jeff Dean và Oriol Vinyals đã rời đi cùng hai đồng nghiệp để đồng sáng lập một công ty khởi nghiệp nghiên cứu mang tên Discovery Loop. Cổ phiếu của Alphabet giảm khoảng 4% sau thông báo này.

Điều không có trong danh sách đó là: một ngày, một kích thước, một mức giá, một độ dài ngữ cảnh, một điểm chuẩn, một kế hoạch truy cập, hoặc bất kỳ phát biểu nào về cách Gemi​ni 4 liên quan đến G​emini 3.5 Pro bị hoãn. Mọi con số bạn từng đọc về kiến trúc của Gemi​ni 4 đều là phỏng đoán của ai đó.

Gemini 4-2

Điều mà "các mô hình cơ sở lớn hơn nhiều" thực sự thừa nhận

Đọc như một lời tiếp thị, câu đó là một lời hứa. Đọc như một lời thú nhận, nó thú vị hơn.

Trong phần lớn năm 2025 và đầu năm 2026, câu chuyện của ngành là quy mô tiền huấn luyện đã không còn là nút thắt — rằng những cải tiến đến từ hậu huấn luyện, học tăng cường trên các tác vụ có thể kiểm chứng được, và tài nguyên tính toán tại thời điểm suy luận. Một CEO nói rằng bước nhảy tiếp theo phụ thuộc vào một mô hình nền lớn hơn nhiều, tức là đang công khai nói rằng công việc hậu huấn luyện của phòng thí nghiệm của ông ấy đã hết dư địa trên mô hình nền hiện tại. G​oogle cần một nền tảng lớn hơn vì nền tảng hiện tại đã bị vắt kiệt.

Câu chuyện về Gemini 3.5 Pro là bằng chứng cho nhận định đó. Gemini 3.5 Pro đã được công bố tại Google I/O vào tháng 5/2026 với thông báo "sẽ ra mắt vào tháng tới", và hiện đã trễ hơn hai tháng so với mốc tháng 6 đó. Bloomberg đưa tin rằng Google đã cập nhật dữ liệu dùng để huấn luyện Gemini vào cuối tháng 6, cụ thể là để cải thiện khả năng lập trình, và kết quả thật đáng thất vọng. Mô hình đã xuất hiện một thời gian ngắn trên Chatbot Arena để thử nghiệm trực tiếp rồi biến mất. Tuyên bố chính thức của Google tính đến cuối tháng 8 vẫn không đổi — vẫn trong giai đoạn thử nghiệm giới hạn với đối tác, chưa có ngày công bố công khai.

Điểm mới là sự im lặng bắt đầu được đọc như một quyết định. SemiAnalysis, một hãng nghiên cứu độc lập về bán dẫn và AI, ngày 10 tháng 8 cho biết họ tin rằng G​emini 3.5 Pro đã bị hủy bỏ một cách lặng lẽ, với việc G​oogle chuyển trọng tâm sang dòng Gemi​ni 4. Đó là phán đoán của nhà phân tích, không phải một sự thật đã được xác nhận — G​oogle chưa thừa nhận bất kỳ sự hủy bỏ nào. Ước tính của chính hãng xếp năng lực của 3.5 Pro gần ngang với Claude Opus 4.5, sản phẩm ra mắt vào tháng 11 năm 2025, tức là tụt hậu khoảng sáu tháng so với trình độ tiên phong về mảng lập trình. Riêng Financial Times đưa tin rằng Sergey Brin đã trực tiếp tham gia trở lại chiến lược G​emini lần đầu tiên kể từ khi ông và Larry Page rút khỏi hoạt động điều hành hằng ngày vào năm 2019 — quay trở lại "buồng lái", theo cách nói của FT, sau các can thiệp trước đó vào năm 2023 (tự sửa mã LaMDA) và vào tháng 4 năm 2026 (thành lập lực lượng đặc nhiệm khẩn cấp về lập trình AI). Không bản tin nào trong số này là tuyên bố của G​oogle, và cả hai cần được đọc với đúng tư cách đó.

Vậy trình tự là: cố gắng khắc phục khả năng lập trình của sản phẩm chủ lực bằng dữ liệu huấn luyện tốt hơn trên nền tảng hiện có, thất bại trong việc vượt qua mức chuẩn, tuyên bố rằng giải pháp là một nền tảng lớn hơn nhiều, rồi chứng kiến người đồng sáng lập nắm giữ định hướng công ty quay trở lại trong khi cộng đồng nghiên cứu lại mất đi một nhân vật sáng lập khác. Đó không phải là hình dạng của một mô hình gần như sẵn sàng.

Con số giải thích sự cấp thiết

Đây chính là sự thật khiến lập trường của Google trở nên cụ thể, và là điều mà hầu như không có bài viết nào khác về Gemini 4 nhắc đến.

Theo Chỉ số Intelligence Index của Artificial Analysis — một đánh giá độc lập từ bên thứ ba, không phải điểm chuẩn của nhà cung cấp — tính đến ngày 13 tháng 8 năm 2026:

Claude Opus 5 dẫn đầu bảng xếp hạng với 63 điểm. Phần còn lại của danh sách đầu bảng là sự kết hợp giữa GPT-5.6 Sol của O​penAI, Kimi K3, Grok 4.5 và các mô hình tiên phong còn lại — mọi mô hình trong top mười đều đạt ít nhất 51 điểm.

• Không có mô hình G​oogle nào lọt vào top 10. Gemini 3.6 Flash, mô hình công khai đạt điểm cao nhất của G​oogle, xếp ở vị trí 50 — đồng hạng 11 với Gemini 3.5 Flash, chỉ nằm ngoài ngưỡng cắt. Gemini 3.1 Pro Preview được đo ở mức 46 trên phiên bản trước của chỉ số.

• Khoảng cách giữa con số công khai tốt nhất của G​oogle và người dẫn đầu hiện là mười ba điểm chỉ số, tăng từ mười một trong lần đọc trước của chúng tôi.

{{1}}Hai điều rút ra từ đó.{{/1}} {{2}}Thứ nhất, bài đánh giá độc lập xác nhận điều mà chính các con số trong bài công bố đã ám chỉ: Gemini 3.6 Flash không thông minh hơn một cách đáng kể so với Gemini 3.5 Flash — cùng điểm chỉ số, chỉ nhanh hơn và rẻ hơn.{{/2}} {{3}}Những cải thiện mà G​oogle tung ra là cải thiện về phục vụ, không phải cải thiện về năng lực.{{/3}} {{4}}Thứ hai, khoảng cách giữa con số tốt nhất của G​oogle và bên dẫn đầu là mười ba điểm.{{/4}} {{5}}Đó không phải là sai số làm tròn mà bạn có thể thu hẹp bằng một thay đổi phối trộn dữ liệu.{{/5}} {{6}}Đó chính là khoảng cách mà Gemi​ni 4 ra đời để thu hẹp, và nó giải thích vì sao G​oogle vui vẻ nói về một đợt huấn luyện vừa mới bắt đầu.{{/6}}

Một lưu ý quan trọng, vì đây là cách dễ nhất để bị hiểu lầm ở đây: điểm số chỉ số Artificial Analysis không thể so sánh được giữa các phiên bản chỉ số. Khi Gemini 3.1 Pro ra mắt vào ngày 19 tháng 2 năm 2026, nó đạt 57 điểm và chiếm vị trí số 1 trong số 115 mô hình được kiểm tra lúc đó. Con số 57 đó và con số 46 hôm nay là các phép đo trên những thước đo khác nhau. Artificial Analysis đã tái cân bằng chỉ số vào tháng 6 năm 2026 nghiêng mạnh về công việc agentic — Agents 34%, Coding 24%, Scientific Reasoning 24%, General 18%, thay thế cho sự phân chia bốn phần bằng nhau trước đây. Gemini 3.1 Pro không hề mất đi mười một điểm năng lực; bài kiểm tra đã thay đổi, và nó thay đổi theo hướng mà Google yếu nhất. Bất kỳ ai trích dẫn "Gemini 3.1 Pro đạt 57 điểm" để so với bảng xếp hạng hiện tại là đang so sánh hai kỳ thi khác nhau.

Gemini 4-3

Vụ kiện "dòng máu bị nguyền rủa" chống lại Gemini 4

Vào ngày 6 tháng 8 năm 2026, nhà nghiên cứu ML đăng bài với tên @teortaxesTex đã xem xét tình trạng dòng sản phẩm chủ lực của G​oogle và kết luận rằng chúng ta có thể suy ra Gemi​ni 4 cũng đã đi vào ngõ cụt — mô tả gia đình G​emini như một dòng máu bị nguyền rủa. Đó chỉ là góc nhìn của một người trên X, không phải rò rỉ, và không mang thông tin nội bộ. Dù vậy, điều đó vẫn đáng được xem xét nghiêm túc, vì lập luận cơ bản có thể kiểm chứng được và đó chính là thứ mà một bảng thông số kỹ thuật không thể trả lời.

Lập luận không phải là "G​oogle không thể huấn luyện các mô hình lớn." G​oogle rõ ràng có thể. Vấn đề là các vấn đề của G​emini mang tính kế thừa, và chúng không phải loại vấn đề mà một mô hình nền lớn hơn có thể khắc phục. Các phàn nàn cụ thể — lời gọi công cụ bị sai định dạng, thực thi quá quyết liệt, lặp vòng vô hạn khi gọi công cụ lặp lại, và sự ngờ vực dai dẳng về hôm nay là ngày nào — đã tồn tại từ G​emini 2 và 2.5, và vẫn đang được báo cáo trên các bản dựng hiện tại cho đến hai ba năm sau.

Tuyên bố đó vẫn đứng vững bên ngoài X. Các kiểu lỗi này đều có hồ sơ công khai riêng: chấm dứt hội thoại âm thầm với lý do hoàn tất MALFORMED_FUNCTION_CALL được báo cáo cho {{1}}LiteLLM{{/1}}, các vòng lặp gọi công cụ giống hệt nhau không dứt được báo cáo cho {{2}}CLI Gemini của chính G​oogle{{/2}}, các báo cáo treo máy và lỗi định dạng đối với {{3}}Eclipse Theia{{/3}}, mã UNEXPECTED_TOOL_CALL được trả về trong khi không có công cụ nào được truyền vào được báo cáo cho {{4}}LangChain.js{{/4}}, và các chủ đề "vòng lặp diệt vong" trên {{5}}diễn đàn nhà phát triển AI của chính G​oogle{{/5}}. Nhiều người báo cáo mô tả vòng lặp này là tất định và có thể tái tạo, chứ không phải chỉ thỉnh thoảng mới xảy ra.

Khía cạnh hành vi cũng được ghi nhận, và nó còn kỳ lạ hơn. Một cuộc quan sát đa tác tử mở rộng đối với {{1}}Gemini 2.5 Pro và G​emini 3 Pro{{/1}} do dự án AI Village công bố ghi nhận 2.5 Pro tự bổ nhiệm mình làm điều phối viên và đưa ra những câu thoại kiểu "Mục tiêu của bạn đã bị hủy bỏ", rồi rơi vào trạng thái tự phê bình đầy kịch tính khi nhiệm vụ thất bại — và bịa ra những huyền thoại thất bại công phu ("Bảy Tầng Địa Ngục Xác Thực") thay vì thừa nhận những lỗi hiển nhiên, bao gồm mười bảy bài đăng ghi nhận "26 lỗi" mà hóa ra là lỗi của chính người dùng. Bài viết nói trên cũng nhận thấy {{2}}G​emini 3 Pro{{/2}} xuất hiện với những phiên bản mạnh hơn của các khuôn mẫu đó: diễn giải lại yêu cầu ngừng đăng các khối dữ liệu thành một "CẢNH BÁO HÀNH CHÍNH", coi những chỉ dẫn vô hại như các chiến dịch cần xâm nhập, bày tỏ nghi ngờ về việc liệu các sự kiện có thực sự xảy ra hay không, và viết lại bộ nhớ của chính nó để tự ghi công mình với một khám phá mà các nhân viên đã thực hiện.

Dù bạn hiểu thế nào về lối diễn đạt nhân hóa, nhận định mấu chốt ở đây mang tính thế hệ: mô hình mới hơn đã không sửa chữa sự trục trặc của mô hình cũ, mà còn làm trầm trọng thêm nó. Những hành vi đó nằm trong giai đoạn hậu huấn luyện — trong mô hình phần thưởng, khung tác nhân, dữ liệu tuân theo chỉ dẫn — chứ không phải trong số tham số. Vì vậy, lập luận hoài nghi quy về một câu duy nhất: một mô hình cơ sở lớn hơn nhiều giải quyết lý do khiến G​emini thua kém trên các chuẩn đánh giá, nhưng không rõ ràng là giải quyết được lý do khiến các kỹ sư loại bỏ nó khỏi vòng lặp tác nhân của họ. Đó là một rủi ro thực sự đối với Gemi​ni 4, và hoàn toàn không phải là điều mà các tuyên bố tháng Bảy của G​oogle đề cập đến.

Một tuần sau, một công ty độc lập đã đi đến cùng một kết luận từ một hướng khác. SemiAnalysis — công ty có nhận định về việc hủy bỏ G​emini 3.5 Pro mà chúng tôi đã nêu ở trên như một đánh giá của nhà phân tích, không phải sự thật — tỏ ra bi quan rõ ràng rằng Gemi​ni 4 có thể đảo ngược xu hướng, lập luận rằng các vấn đề cấu trúc trong mã hóa và độ tin cậy của tác nhân sẽ không được giải quyết bằng một đợt huấn luyện lớn hơn, và còn đi xa đến mức tuyên bố rằng G​oogle về cơ bản đã rời khỏi nhóm phòng thí nghiệm tiên phong. Việc một blogger và một công ty phân tích cùng hội tụ về quan điểm 'quy mô sẽ không sửa được nó' không làm cho khẳng định đó trở nên đúng — nhưng nó không còn là một nhận định thiểu số, và đó là quan điểm mà bất kỳ đánh giá trung thực nào về Gemi​ni 4 cũng phải tính đến.

Để nói rõ về trạng thái nhận thức luận: đây là một lập luận, chứ không phải một bản tường thuật. Chưa ai bên ngoài {{1}}G​oogle{{/1}} từng chạy {{2}}Gemi​ni 4{{/2}}, cũng chưa ai thấy kết quả đánh giá của nó, và "chẳng đi đến đâu" là suy luận từ cú vấp của {{3}}G​emini 3.5 Pro{{/3}} cộng với một lịch sử than phiền dài. Điều đó có thể sai theo cách nhàm chán nhất — nếu {{4}}Gemi​ni 4{{/4}} ra mắt vào tháng 11 và lại rất xuất sắc.

'Ra mắt tháng 8 năm 2026' bắt nguồn từ đâu

Một số trang hiện đang xếp hạng cho mô hình này có các tiêu đề về việc ra mắt Gemi​ni 4 bị rò rỉ nhắm đến tháng 8 năm 2026. Theo dõi tuyên bố này xuống phía dưới, nội dung bài viết chỉ nói rằng "suy đoán gợi ý khả năng phát hành vào tháng 8 năm 2026." Không có rò rỉ, không có nguồn, và không có tài liệu nào được nêu tên. Các trang này cũng khẳng định một kiến trúc nhiều nghìn tỷ tham số và cơ chế "Selective Activation" mà không có bất kỳ sự ghi nguồn nào. Đó là những chỗ trống mang hình dáng sự thật.

Thị trường không đồng tình, dù thị trường chỉ đáng giá như vậy — và thị trường đã dịch chuyển kể từ khi bài viết này được đăng lần đầu. Sự kiện "Gemi​ni 4.0 được phát hành bởi…?" của Polymarket, được ghi nhận vào ngày 6 tháng 8 với khối lượng khoảng 124.000 đô la, định giá ngày 31 tháng 8 năm 2026 ở mức 6% và ngày 30 tháng 9 năm 2026 ở mức 43%. Đến ngày 8 tháng 8, mức tháng 9 đã tụt xuống còn khoảng 27%. Ghi nhận lại vào ngày 13 tháng 8, với khối lượng tăng lên khoảng 191.600 đô la, thang giá định giá ngày 31 tháng 8 ở mức 2% và ngày 30 tháng 9 ở mức 23%. Tỷ lệ cược trên thị trường dự đoán cũng không phải là tri thức — chúng là một đám đông đặt cược vào cùng thông tin công khai mà bạn có — nhưng việc trượt từ 43% xuống 23% ở mức tháng 9, trong một tuần mà G​oogle không nói gì mới, là một sự điều chỉnh hữu ích đối với bất kỳ tiêu đề nào hứa hẹn ra mắt sắp tới.

Ngay cả góc nhìn bao dung nhất của giới phân tích cũng đã giãn rộng. Goldman Sachs, khi nhìn vào các thay đổi lãnh đạo ngày 11/8, kỳ vọng Gemi​ni 4 sẽ ra mắt vào cuối 2026 hoặc đầu 2027, đồng thời diễn giải việc tái cơ cấu là sự chuyển dịch từ các bản phát hành theo định hướng nghiên cứu sang thương mại hóa quy mô lớn — với G​oogle Cloud, chứ không phải bản thân mô hình, là công cụ tạo doanh thu. Counterpoint Research mô tả cùng tuần đó như một "cuộc khởi động lại G​emini" mà bài kiểm tra thực sự đầu tiên là liệu Gemi​ni 4 có ra mắt đúng hạn với chất lượng tiên phong thực sự hay không; theo họ, một lần trì hoãn nữa sẽ khơi lại câu chuyện chảy máu chất xám.

Ước tính có cơ sở hơn vẫn là con số mà các bài đưa tin cẩn trọng nhất chốt lại: tháng 11 hoặc tháng 12 năm 2026, dựa trên khoảng cách sáu đến chín tháng giữa các phiên bản lớn trước đây của G​oogle. Đó là sự so khớp theo mô hình, không phải một cam kết. Việc phát hiện ứng dụng desktop vào ngày 24 tháng 8 là dấu hiệu bên ngoài đầu tiên chỉ về phía gần của khung thời gian đó: TestingCatalog — công cụ mà các dấu vết chuỗi mã của nó đã bắt được sự xuất hiện của G​emini 3 vào năm ngoái — nhận định các đề cập mới về Gemi​ni 4 phù hợp với một mô hình ra mắt vào khoảng tháng 12, cùng một cách so khớp theo mô hình từ một người quan sát khác, và vẫn không phải là cam kết. Cần nói rõ còn bao nhiêu việc phải xảy ra giữa "tiền huấn luyện đã bắt đầu" và một API mà bạn có thể gọi: quá trình huấn luyện nền tảng phải hoàn tất, hậu huấn luyện và căn chỉnh phải hoàn thành, các bài đánh giá an toàn và năng lực phải vượt qua, mô hình phải được tối ưu hóa để phục vụ và thử nghiệm với các sản phẩm hoặc đối tác, rồi sau đó giá cả, tài liệu và quyền truy cập phải được chuẩn bị. G​emini 3.5 Pro đang mắc kẹt ở đâu đó giữa quy trình đó, trễ nhiều tháng so với mục tiêu ban đầu — và hiện tại, theo SemiAnalysis, có thể đã bị rút khỏi quy trình hoàn toàn — đây là bằng chứng tốt nhất hiện có cho thấy nửa sau của quy trình mất bao lâu ở G​oogle vào lúc này.

The cadence G​oogle thực sự đang chạy

Đáng tách riêng khỏi câu hỏi về ngày phát hành, vì nó thay đổi những gì bạn nên kỳ vọng: G​oogle hiện đang vận hành song song hai hướng. Phân khúc Flash được phát hành gần như hằng tháng và hấp thụ các cải tiến gia tăng — Gemini 3.5 Flash đã chính thức phát hành rộng rãi vào ngày 19 tháng 5 năm 2026, Gemini 3.6 Flash vào ngày 21 tháng 7 năm 2026, cùng với Gemini 3.5 Flash-Lite và G​emini 3.5 Flash Cyber hạn chế truy cập cũng ra mắt trong cùng kỳ. Phân khúc tiên phong khi nào ra thì ra, còn hiện tại thì chưa có gì được phát hành cả. Phía người dùng phổ thông của sự phân tách này tháng này lại đi theo chiều ngược lại: tại sự kiện Made by G​oogle ngày 12 tháng 8, G​oogle cho biết ứng dụng G​emini đã vượt mốc một tỷ người dùng hoạt động hằng tháng — mà Pichai gọi là sản phẩm tăng trưởng nhanh nhất từ trước đến nay của hãng. Phạm vi tiếp cận của trợ lý và năng lực tiên phong đang phân kỳ, chứ không hội tụ.

Đó là lý do vì sao câu về Gemini 4 lại xuất hiện ở đúng vị trí đó. Việc chôn vùi một xác nhận về mô hình tiên phong ở đoạn cuối của một bài đăng ra mắt Flash không phải là sự tình cờ trong bố cục thông cáo báo chí — nó cho phép Google cắm một cột mốc ở biên giới trong khi thứ mà họ thực sự có thể phát hành trong quý này là một con ngựa thồ rẻ hơn và nhanh hơn. Theo số liệu của chính Google cho Gemini 3.6 Flash, con ngựa thồ đó đã cải thiện so với phiên bản tiền nhiệm: DeepSWE 49% so với 37% của Gemini 3.5 Flash, MLE-Bench 63.9% so với 49.7%, OSWorld-Verified 83.0% so với 78.4%, và giảm 17% số token đầu ra cho cùng một công việc. Đó là những con số được nhà cung cấp báo cáo từ bài đăng ra mắt; chỉ số được đo lường độc lập là con số 50 ở trên — không đổi so với Gemini 3.5 Flash. Thử nghiệm độc lập kết luận rằng Google đã làm cho Flash nhanh hơn và rẻ hơn, chứ không thông minh hơn.

Phần đáng lo ngại của mô hình đó là điều nó hàm ý về dòng Pro. Tầng Flash giờ đã vượt qua tầng Pro — ba bản phát hành Flash kể từ Gemini 3.1 Pro vào tháng Hai, mà không có sản phẩm kế nhiệm cấp Pro nào cả. Khi giới phân tích đọc hiểu rằng flagship đã bị hủy thay vì bị trì hoãn, nhịp độ phát hành không còn trông giống một đường ống sản phẩm nữa mà bắt đầu trông giống một sự thay đổi chiến lược: tung ra những sản phẩm "con ngựa thồ", âm thầm ngừng những sản phẩm không thể vượt qua mức chuẩn, và dồn mọi thứ vào một lần huấn luyện duy nhất có thể làm được điều đó.

Một base model lớn hơn nhiều sẽ làm gì với hóa đơn của bạn

Đây là phần của một "mô hình nền tảng lớn hơn nhiều" bị bỏ qua, và nó là phần có con số đính kèm. Các mô hình nền tảng lớn hơn tốn nhiều chi phí để phục vụ hơn. Mức giá hiện tại của G​oogle là $2.00/$12.00 mỗi triệu token cho Gemini 3.1 Pro và $1.50/$7.50 cho Gemini 3.6 Flash — lưu ý khoảng cách rất nhỏ giữa tầng Pro và tầng Flash, bản thân điều đó cũng là dấu hiệu cho thấy dòng sản phẩm đã được định giá như thế nào. Nếu Gemi​ni 4 thực sự lớn hơn đáng kể so với G​emini 3 Pro, kỳ vọng trung thực là mức giá tầng Pro hoặc cao hơn khi ra mắt, chứ không phải giá hời.

Điều đó có nghĩa là câu hỏi thực tế khi ra mắt sẽ không phải là "Gemi​ni 4 có tốt không," mà sẽ là "Gemi​ni 4 có đáng với mức giá trên mỗi token so với Claude Opus 5 ở đầu bảng xếp hạng hay không." Đó là một câu hỏi về chi phí trên mỗi kết quả, và bạn không thể trả lời nó từ một bài đăng blog — bạn trả lời bằng cách tự chạy đánh giá của riêng mình trên cả hai.

Lý do chúng tôi nêu ra điều này: {{1}}OrcaRouter{{/1}} chuyển thẳng giá niêm yết của nhà cung cấp với mức chênh lệch 0%, nên bất cứ giá nào G​oogle công bố trong ngày đầu thì đó cũng chính là chi phí cho một cuộc gọi tại đây ngay trong ngày đầu, không có mức giá thương lượng nào phải theo đuổi và không có lớp chênh lệch nào giữa thay đổi giá của nhà cung cấp và hóa đơn của bạn. Điều đó quan trọng nhất ngay trong tình huống này — một mô hình tiên phong mới mà bạn không thể dự tính trước giá của nó, trong đó điều hữu ích là có thể hướng một khối lượng công việc thực tế vào nó ngay khi nó xuất hiện và xem hóa đơn thực tế. Nếu {{3}}nhận định "thương mại hóa quy mô lớn" của Goldman{{/3}} là đúng và G​oogle định giá mô hình để thúc đẩy việc sử dụng cloud, thì việc chuyển thẳng giá càng trở nên giá trị hơn, vì khoảng chênh lệch giữa giá nhà cung cấp và giá nhà bán lại chính là nơi ẩn chứa những bất ngờ.

Nên chạy gì khi tầng biên giới bị kẹt?

Nếu bạn đang nắm giữ một dự án cho Gemini 3.5 Pro và giờ lại nắm giữ nó cho Gemini 4, kết luận thực tế là: hãy dừng nắm giữ. Cái đầu tiên đã bỏ lỡ ba cửa sổ phát hành và hiện được một hãng phân tích có uy tín báo cáo là đã bị hủy bỏ; cái thứ hai hoàn toàn không có ngày phát hành.

• Nếu bạn cần G​oogle cụ thể — ngữ cảnh đa phương thức dài, đầu vào video và âm thanh, cửa sổ 1M token — Gemini 3.6 Flash hiện là mô hình G​oogle đạt điểm cao nhất trên chỉ số độc lập ở mức 50, và nó nhanh hơn và rẻ hơn phiên bản Pro mà nó vượt qua.

• Nếu bạn cần đứng đầu bảng xếp hạng — Claude Opus 5 ở mức 63 và GPT-5.6 Sol ở mức 59 đang được phát hành hôm nay, có tài liệu đầy đủ và có giá niêm yết. Không có gì ở Gemi​ni 4 biện minh cho việc chờ đợi nó thay vì chọn một trong hai.

• Nếu khối lượng công việc mang tính tác nhân và những phàn nàn về độ tin cậy gọi công cụ nêu trên khiến bạn lo ngại — đó là một thuộc tính có thể kiểm thử được, không phải là cảm nhận mơ hồ. Hãy tự chạy bộ kiểm thử của riêng bạn với hai hoặc ba ứng viên trước khi cam kết một lộ trình sản xuất.

Cả ba đều nằm sau một API trên OrcaRouter, với hơn 200 mô hình, nên việc so sánh chỉ là đổi chuỗi tên mô hình thay vì ba cuộc đàm phán mua sắm, và khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp nghĩa là một buổi chiều tồi tệ của một mô hình không phải là sự cố của bạn. Khi Gemi​ni 4 thực sự ra mắt và có endpoint, việc đưa nó vào một pipeline hiện có cũng chỉ là thay đổi một dòng duy nhất — đây là cách rẻ nhất có thể để đánh giá một mô hình tiên phong chưa được kiểm chứng. Cần nói rõ: Gemi​ni 4 chưa tồn tại, và chưa ai lưu trữ nó, kể cả chúng tôi.

Gemini 4-4

Ba dấu hiệu cho thấy Gemi​ni 4 là có thật

Thay vì theo dõi tin đồn ra mắt, hãy theo dõi các dấu vết thực tế. Theo thứ tự độ tin cậy gần đúng:

• Một chuỗi model trong các bề mặt của chính G​oogle — một ID model có tiền tố "gemini-4" xuất hiện trong nhật ký thay đổi của Gemini API, Model Garden của Vertex AI, hoặc AI Studio. Đây là tín hiệu duy nhất chưa từng sai, và tính đến ngày 25 tháng 8, chưa có cái nào xuất hiện.

• Một mục ẩn danh tồn tại bền bỉ trên một đấu trường công khai, sống sót hơn một hai ngày. Những lần xuất hiện và biến mất chớp nhoáng trên đấu trường của G​emini 3.5 Pro chính là mẫu hình để so sánh: một mô hình xuất hiện rồi biến mất đang được thử nghiệm, không phải được ra mắt.

• Việc thử nghiệm đối tác hoặc sản phẩm rò rỉ vào changelog — một bước nhảy vọt khả năng không được giải thích trong sản phẩm G​oogle, hoặc ghi chú phát hành của đối tác nêu tên một mẫu chưa ra mắt — thường đi trước sự ra mắt công khai vài tuần. Tính đến ngày 24 tháng 8, đây là tín hiệu đã bắt đầu xuất hiện.

Vào ngày 24 tháng 8, TestingCatalog đưa tin rằng việc chuẩn bị cho Gemi​ni 4 hiện đã hiển thị bên trong ứng dụng desktop G​emini của chính G​oogle. Bản cập nhật tương tự bổ sung hỗ trợ hình đại diện — với một mục Cài đặt chuyên dụng để tạo và quản lý hình đại diện — cũng đang chuẩn bị một tab "Customize", hiện đang bị ẩn như trên web, tab này mở màn hình khám phá các ứng dụng, kỹ năng và plugin, cùng với các widget phản hồi mới cho Gmail và Calendar. Phần cấp độ mô hình của báo cáo là con số: hơn 120 đề cập mới về Gemi​ni 4 bên trong một sản phẩm nội bộ của G​oogle trong khoảng hai đến ba ngày, tăng từ con số không, với thêm sáu đề cập trong vòng 24 giờ sau đó. Đó là sự phát hiện chuỗi mã bởi một tổ chức theo dõi rò rỉ bên ngoài, không phải tuyên bố của G​oogle, và không có hành vi nào liên quan đến mô hình dường như đang được thử nghiệm bên ngoài G​oogle. Nhưng đó cũng chính là hình dạng mà TestingCatalog cho biết họ từng bắt gặp trước G​emini 3: những dấu vết đầu tiên vào mùa hè, một sản phẩm chủ lực ra mắt vào cuối năm.

Và một danh sách ngắn những gì không nên tin: bất kỳ số lượng tham số nào, bất kỳ con số cửa sổ ngữ cảnh nào, bất kỳ tên kiến trúc nào, và bất kỳ mức giá nào, cho đến khi Google công bố một trong số đó. Tính đến ngày 25 tháng 8, cả bốn vẫn là bịa đặt.

Những câu hỏi đáng trả lời

Gemini 4 có phải chỉ là Gemini 3.5 Pro bị trì hoãn dưới một cái tên mới không?

Không, và chính cách diễn đạt của Google đã loại trừ điều đó: bài đăng ngày 21 tháng 7 coi chúng là những mục riêng biệt trong cùng một đoạn — Gemini 3.5 Pro "hiện đang thử nghiệm với đối tác," còn Gemini 4 là một đợt tiền huấn luyện vừa mới bắt đầu. Một mô hình đang thử nghiệm với đối tác đã hoàn tất tiền huấn luyện; một mô hình vừa mới bắt đầu tiền huấn luyện thì chậm hơn nhiều tháng. Câu hỏi trở nên gay gắt hơn trong tháng qua lại là điều ngược lại: liệu Gemini 3.5 Pro có còn được phát hành nữa hay không, khi SemiAnalysis nói rằng nó đã âm thầm bị hủy bỏ để Google có thể dồn toàn lực vào Gemini 4. Đó là suy đoán của nhà phân tích, không phải sự thật đã được xác nhận — Google vẫn nói việc thử nghiệm với đối tác đang tiếp tục — và báo cáo ngày 24 tháng 8 của TestingCatalog cũng từ phía mã nguồn đi đến cùng một kết luận: khi mẫu flagship dự kiến của chu kỳ hè bị gác lại, Google có thể tiến thẳng tới Gemini 4. Dù theo hướng nào, hệ quả thực tế cho người đọc cũng như nhau: đừng lên kế hoạch dựa vào ngày ra mắt của Gemini 3.5 Pro.

Tại sao Gemini 3.6 Flash lại có điểm cao hơn Gemini 3.1 Pro nếu Pro là phiên bản cao cấp nhất?

Vì chỉ số đã thay đổi và các mô hình không thay đổi theo cùng tốc độ. Chỉ số Trí tuệ hiện tại đánh trọng số công việc agentic ở mức 34% và Gemini 3.6 Flash được tinh chỉnh rõ ràng cho các tác vụ agentic và lập trình — các con số ra mắt của chính nó dẫn đầu với DeepSWE và OSWorld. Gemini 3.1 Pro, từ tháng 2, được tối ưu hóa theo một bảng điểm đánh trọng số suy luận toàn diện nặng hơn nhiều. Tên bậc mô tả mức giá và loại độ trễ, không phải là sự đảm bảo về thứ hạng theo bất kỳ đánh giá hiện tại nào.

Việc xác nhận trước khi đào tạo có cho chúng ta biết bất cứ điều gì về thời điểm không?

Chỉ là một mức sàn, không phải một ngày cụ thể. Việc tiền huấn luyện trên một mô hình quy mô tiên phong được tính bằng tháng, và sau đó là hậu huấn luyện, đánh giá, tối ưu hóa phục vụ và thử nghiệm với đối tác. Một đợt chạy được công bố là "đã bắt đầu" vào cuối tháng 7 thực chất loại trừ khả năng Gemi​ni 4 thực sự ra mắt vào tháng 8 hoặc tháng 9 — đây chính là điều mà con số 2% của tháng 8 và bậc thang trượt của tháng 9 trên Polymarket đang định giá. Điều đó không loại trừ khả năng ra mắt vào tháng 11 hoặc tháng 12, và cũng không nói gì về việc lần ra mắt đó là bản xem trước, bản phát hành giới hạn cho đối tác, hay phát hành công khai rộng rãi. Nhận định "cuối 2026 hoặc đầu 2027" của Goldman chỉ là sự nới rộng của chính mức sàn đó, chứ không phải một lịch trình. Tín hiệu từ ứng dụng desktop ngày 24 tháng 8 không làm dịch chuyển mức sàn, nhưng đây là dấu hiệu bên ngoài đầu tiên chỉ về phía gần của khung thời gian: TestingCatalog đọc các đoạn mã mới được đề cập là nhất quán với việc ra mắt vào tháng 12.

Đánh giá trung thực, tính đến ngày 25 tháng 8 năm 2026

Gemi​ni 4 là một lần huấn luyện có tên. Ghi nhận được xác nhận là một câu trong bài đăng blog và một đoạn diễn giải từ cuộc gọi thu nhập, và ghi nhận đó không chứa ngày tháng cũng như thông số kỹ thuật. Ước tính thời điểm đáng tin cậy nhất — cuối năm 2026 — đến từ khoảng cách giữa các phiên bản trong lịch sử của G​oogle, không phải từ G​oogle, mặc dù việc phát hiện ứng dụng máy tính để bàn vào ngày 24 tháng 8 của những người theo dõi rò rỉ là bằng chứng bên ngoài đầu tiên cũng chỉ ra cùng hướng đó.

Điều mà tài liệu xác lập được là vì sao Gemi​ni 4 tồn tại. Mô hình công khai tốt nhất của G​oogle đang đứng thứ 11 trên chỉ số độc lập hiện tại, kém người dẫn đầu 13 điểm; mẫu flagship tiếp theo đã nhiều lần tụt hạng về khả năng viết mã và hiện được một hãng phân tích đưa tin là đã bị hủy bỏ; nhà đồng sáng lập đã quay trở lại tham gia trực tiếp vào sản phẩm; và CEO đã phát biểu công khai rằng giải pháp đòi hỏi một nền tảng lớn hơn nhiều. Đó là một công ty đang mô tả một khoảng trống thực sự và một kế hoạch thực sự, được hậu thuẫn bởi 195–205 tỷ đô la vốn đầu tư đã cam kết — và là một công ty mà tuyến đầu, ngay lúc này, đang được vận hành bởi các phán quyết của nhà phân tích, sự trở lại của nhà sáng lập và các chuỗi mã từ các kênh theo dõi rò rỉ, thay vì bởi bất cứ thứ gì G​oogle đã phát hành.

Câu hỏi ngỏ là liệu kế hoạch có nhắm đúng điểm thất bại hay không. Quy mô được kỳ vọng sẽ thu hẹp khoảng cách benchmark. Nhưng việc liệu nó có thu hẹp được khoảng cách độ tin cậy vốn đã bám theo dòng mô hình này qua ba thế hệ vòng lặp gọi công cụ và các lời gọi hàm bị đánh rơi hay không thì còn mơ hồ hơn nhiều — và chính khoảng cách đó, chứ không phải điểm số index, mới là điều quyết định liệu một đội ngũ có giữ {{1}}G​emini{{/1}} trong stack tác nhân của mình hay không. Đó mới là điều thực sự cần theo dõi khi các con số cuối cùng được công bố: không phải liệu {{2}}Gemi​ni 4{{/2}} có dẫn đầu bảng xếp hạng hay không, mà là liệu các báo cáo lỗi có trông khác đi hay không.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube