
Gemini Agentic Video Understanding Đã Ra Mắt: Chế Độ API Giúp Cắt Giảm Hai Phần Ba Chi Phí Phân Tích Video
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0259Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0258Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0166Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
Vào ngày 1 tháng 9 năm 2026, Google đã giới thiệu khả năng hiểu video dạng tác tử cho Gemini 3.7 Flash, Gemini 3.6 Flash, và Gemini 3.5 Flash-Lite — một chế độ mới trong Gemini API, theo đó video không còn bị xem như một chồng khung hình mà được xem như một tài liệu có thể tìm kiếm. Thông báo của Google DeepMind, do giám đốc sản phẩm cấp cao Rohan Doshi và giám đốc nghiên cứu Mario Lučić viết, là thay đổi lớn đầu tiên trong cách Gemini đọc video kể từ khi các mô hình có đầu vào này: thay vì âm thầm xử lý một mẫu khung hình cố định, mô hình giờ đây tự quyết định ngay trong khi trả lời nên xem gì, với tốc độ nào và qua kênh nào trong ba kênh — khung hình trực quan, âm thanh hoặc bản ghi thoại. Hiệu quả nổi bật nhất — tất cả đều do nhà cung cấp báo cáo và chưa có kết quả nào được tái lập độc lập — là phân tích video rẻ hơn tới 66%, tiêu tốn ít hơn tới 88% token và trả lời chính xác hơn tới 7% so với đường cơ sở xử lý từng khung hình mà nó thay thế.
"Agentic" thực sự thay đổi điều gì bên trong?
Hành vi cũ chính là thứ mà Google ngày nay gọi là xử lý "tĩnh": đưa cho Gemini một đoạn video, nó sẽ lấy mẫu khung hình ở một tốc độ cố định — mặc định là một khung hình mỗi giây — chạy toàn bộ mẫu đó qua mô hình, rồi trả lời dựa trên bất cứ thứ gì mà lưới cố định đó thu được. Điều đó có hai điểm mù mang tính cấu trúc. Một sự thay đổi trạng thái xảy ra giữa hai khung hình được lấy mẫu đơn giản là không tồn tại đối với mô hình. Và một video dài hai giờ được lấy mẫu ở tốc độ 1 FPS sẽ tiêu tốn một khoản token khổng lồ, phần lớn trong số đó đổ vào những cảnh quay chẳng liên quan gì đến câu hỏi.
Cơ chế hiểu video dạng tác tử thay thế lưới cố định bằng một vòng lặp. Mô hình kết hợp suy luận cốt lõi của mình với các công cụ video gốc, cho phép nó chủ động quyết định xem nội dung gì, xem ở tốc độ nào, và kiểm tra qua phương thức nào — khung hình trực quan, rãnh âm thanh, hay bản chép lời. Nó kích hoạt một công cụ nội bộ để chỉ nạp các phân đoạn liên quan của tệp, truy xuất những khoảnh khắc và tín hiệu mà câu hỏi thực sự cần, rồi suy luận trên dữ liệu vừa lấy. Google mô tả đây là cùng một mẫu kiến trúc với tính năng thị giác tác tử mà họ đã ra mắt trước đó: mô hình không còn là bên tiêu thụ thụ động media; nó là một tác tử truy vấn media như một công cụ.
Hệ quả thực tiễn là câu hỏi "mô hình đã thấy gì?" không còn phụ thuộc vào may rủi của việc lấy mẫu. Một câu hỏi về một phân đoạn chỉ dài tích tắc, một khuyết điểm gần như không thể nhìn thấy, hay một từ được phát ra giữa tiếng ồn nền, đều có thể được trả lời, vì mô hình có thể quét lại chính xác cửa sổ đó ở độ phân giải và tốc độ cao hơn, trong phương thức chứa đựng câu trả lời.

Các con số, được gắn nhãn đúng như bản chất của chúng.
So sánh điểm chuẩn của chính Google giữa xử lý tác tử (agentic) và xử lý tĩnh là phần cốt lõi của thông báo, và cần được đọc như một tuyên bố của nhà cung cấp cho đến khi một bên bên ngoài tái lập được kết quả. Trên bộ kiểm thử nội bộ của họ:
• Chi phí — chi phí phân tích thấp hơn tới 66%, nhờ mô hình chỉ tải các phân đoạn cần thiết thay vì toàn bộ mẫu cố định.
• Token — giảm tới 88% mức tiêu thụ token, với mức tiết kiệm lớn nhất ở video dài: thông báo nêu rõ từ các video hướng dẫn dài 10 phút đến các bản ghi dài nhiều giờ.
• Độ chính xác — cải thiện tới 7% trên cùng các tác vụ, vì các sự kiện diễn ra trong khoảng dưới một giây và giữa các khung hình giờ đây có thể được quan sát thay vì bị bỏ lọt trong các khoảng trống lấy mẫu.
Google định vị Gemini 3.7 Flash nằm trên "biên Pareto giữa độ chính xác và chi phí" trong số các mô hình được thử nghiệm — nói dễ hiểu, đây là mô hình cho ra câu trả lời tốt nhất trên mỗi đô la chi phí trong ba mô hình. Google cũng nêu tên bốn đối tác truy cập sớm — Ponder, Revyl, Mosaic và Resemble.AI — những đơn vị đã xây dựng dựa trên chế độ này trước khi được phát hành rộng rãi, một chi tiết cho thấy sản phẩm đã được ứng dụng thực tế chứ không chỉ nằm trên slide trình chiếu. Kết quả của các đối tác này đều chưa được công bố, vì vậy cách đánh giá đáng tin cậy là: cơ chế là có thật, hướng đi rõ ràng là đúng, còn những con số phần trăm cụ thể chỉ là số liệu của Google cho đến khi được đo lường độc lập.
Các trường hợp sử dụng mà tính năng được xây dựng để phục vụ.
Thông báo phân nhóm khả năng này thành bốn loại, mỗi loại tương ứng với một khối lượng công việc cụ thể mà nhà phát triển có thể triển khai:
• Truy xuất khoảnh khắc dưới một giây — xác định chính xác các thay đổi trạng thái trong tích tắc và ranh giới cắt cảnh sát nút mà lưới 1 FPS bỏ sót hoàn toàn. Đây là trường hợp sử dụng trong biên tập video tự động: tìm đúng khung hình nơi cảnh thay đổi xảy ra.
• Tìm kiếm dạng dài “mò kim đáy bể” — trả lời một câu hỏi cụ thể về một video dài nhiều giờ mà không tiêu tốn hàng triệu token. Đây là sự khác biệt giữa “xem cuộc gọi 3 giờ này” và “khách hàng có đồng ý gia hạn trong cuộc gọi 3 giờ này không.”
• Phát hiện bất thường — mô hình lấy mẫu lại các khoảng thời gian quan trọng ở tốc độ khung hình cao hơn để kiểm tra chuyển động nhanh và các hiện tượng hình ảnh tinh vi. Kiểm soát chất lượng sản xuất, phân tích thể thao và cảnh quay an ninh là những mục tiêu ứng dụng rõ ràng.
• Đếm các hành động và vật thể — theo dõi các chuyển động vật lý lặp lại và các vật thể riêng biệt theo thời gian, điều mà việc lấy mẫu tĩnh đếm thiếu khi thứ đang được đếm di chuyển nhanh hơn tốc độ lấy mẫu.
Những mẫu nào, và chúng có giá bao nhiêu?
Tính năng này chạy trên gói Flash, và mức chênh lệch giá giữa ba mẫu là yếu tố quan trọng trong việc lựa chọn nơi áp dụng:
• Gemini 3.7 Flash — 0,75 USD đầu vào / 3,75 USD đầu ra cho mỗi triệu token ở mức giá khuyến mãi, được xác nhận đến hết ngày 31 tháng 12 năm 2026, sau đó mức giá tăng gấp đôi lên 1,50 / 7,50 USD. Là model dẫn đầu về độ chính xác trên chi phí trong ba model.
• Gemini 3.6 Flash — $1.50 / $7.50 cho mỗi triệu token. Lựa chọn ổn định, không khuyến mãi trong bộ ba.
• Gemini 3.5 Flash-Lite — $0.30 / $2.50 mỗi triệu token. Phân khúc bình dân, dành cho việc sàng lọc video khối lượng lớn, nơi token rẻ nhất chính là điểm mấu chốt.
Vì tính năng này sử dụng định giá token API Gemini tiêu chuẩn và không tính thêm phí, mức giảm 88% lượng token sẽ tác động trực tiếp lên các mức giá này. Một khối lượng công việc tốn 100 đô la để phân tích tĩnh sẽ chỉ tiêu tốn khoảng 12 đến 34 đô la khi xử lý theo phương thức agentic trên cùng một mô hình, trước khi tính đến bất kỳ cải thiện nào về độ chính xác — đó chính là điểm mấu chốt cho những ai có quy trình xử lý hiện nay vẫn đang đốt token để tải lại hoặc lấy mẫu khung hình từ video dài.
Cách bật nó lên
Chế độ này được bật chỉ bằng một cờ cấu hình duy nhất — truyền xử lý "agentic" trong yêu cầu — và nó hoạt động với cùng đầu vào và mức giá như API tiêu chuẩn. Không có endpoint riêng, không có hạng mục thanh toán mới, không có hạn mức đặc biệt. Đường dẫn Python sử dụng API interactions của SDK google-genai, ví dụ với mô hình "gemini-3.7-flash" và đầu vào là một video cùng một lời nhắc văn bản; video có thể là bản tải lên trực tiếp, một URI Cloud Storage, một URL HTTP công khai hoặc một URL YouTube, tùy thuộc vào bề mặt bạn đang gọi.
Hai ràng buộc thực tế đáng biết trước khi xây dựng: tệp video phải nằm trong giới hạn kích thước của nền tảng (trên nhánh Enterprise Agent Platform, khoảng 15 MB mỗi tệp) và Gemini Enterprise Agent Platform hỗ trợ các định dạng container phổ biến — MP4, MOV, AVI, WebM, WMV, MPEG — nên việc xử lý định dạng diễn ra trước lời gọi API, chứ không phải bên trong nó.
Nơi nó đang chạy hiện tại và nơi nó sẽ hướng tới
Khi ra mắt, tính năng hiểu video dạng agentic sẽ khả dụng cho video tải lên và video YouTube thông qua Gemini API trong Google AI Studio và thông qua Gemini Enterprise Agent Platform — đó là bề mặt dành cho nhà phát triển và doanh nghiệp. Hai đợt triển khai dành cho người dùng phổ thông đã được công bố nhưng chưa chính thức hoạt động: ứng dụng Gemini, nơi tính năng này sẽ sớm được triển khai cho tất cả người dùng trên các mô hình Flash và Flash-Lite, và tính năng "Ask YouTube" của YouTube trên trang xem video, mà Google cho biết sẽ ra mắt trong những tháng tới. Đối với nhà phát triển đang đánh giá tính năng này, API là nơi trung thực nhất để thử nghiệm ngay hôm nay; các bề mặt dành cho người dùng phổ thông là chiến lược phân phối giúp cụm từ này trở nên quen thuộc.
Cũng có một tín hiệu hệ sinh thái đáng chú ý: vì khả năng này được cung cấp dưới dạng một chế độ API tiêu chuẩn, các dự án MCP-server và agent-framework vốn bọc quanh khả năng hiểu video của Gemini — khung GenV dành cho phân tích cuộc họp, các gói MCP nghiên cứu video và các kỹ năng video Gemini xuất hiện trong những tháng qua — đều có thể áp dụng nó mà không cần thay đổi kiến trúc. Chính việc nâng cấp chế độ, chứ không phải một SDK mới, mới là yếu tố mở khóa mức giảm chi phí.
Cần kiểm chứng điều gì trước khi bạn tin vào các tỷ lệ phần trăm
Mọi con số trong thông báo — 66%, 88%, 7%, tuyên bố về đường biên Pareto — đều là số liệu của chính Google, được đo trên bộ kiểm thử của chính Google, và không một con số nào trong số đó được tái lập bên ngoài công ty. Hướng đi thì không còn nghi ngờ: một vòng lặp agentic chỉ nạp các phân đoạn liên quan chắc chắn sẽ thắng một lưới cố định nạp mọi thứ. Mức độ mới là câu hỏi mở, và nó sẽ khác nhau theo khối lượng công việc — một clip 2 phút với một câu hỏi duy nhất sẽ không đạt mức tiết kiệm token 88%, vì không có nhiều thứ để bỏ qua; một cuộc gọi 3 giờ với một câu hỏi trọng tâm thì sẽ. Phép thử đúng là video dài của chính bạn, chạy một lần với xử lý tĩnh và một lần với agentic, trên cùng một mô hình, đếm token thực và chi phí thực.

Tính kinh tế của bài kiểm tra đó chính là nơi lớp định tuyến chứng minh giá trị của mình. Gemini 3.6 Flash và Gemini 3.5 Flash-Lite — hai trong ba mô hình được tính năng này áp dụng — {{1}}được phục vụ trên OrcaRouter ở mức giá niêm yết của Google, được chuyển thẳng qua với biên lợi nhuận 0%, nên việc hạ giá phân tích video có hiệu lực bên phía chúng tôi ngay trong ngày nó có hiệu lực bên Google{{/1}}; còn Gemini 3.7 Flash, mô hình thứ ba và mới nhất, {{2}}thì có sẵn qua API của chính Google lẫn một số nền tảng bên thứ ba{{/2}}. Và bởi vì hiểu video theo hướng tác nhân là một năng lực vừa mới được phát hành, trong khi những khác biệt của nó trên thực tế chưa được kiểm chứng, đây chính là trường hợp điển hình để áp dụng chuyển mạch dự phòng tự động: chuyển một phần lưu lượng video sang chế độ tác nhân, để bộ định tuyến tự động quay về mô hình đã được kiểm chứng khi gặp lỗi, bị giới hạn tần suất hay có dấu hiệu suy giảm chất lượng rõ rệt, và vẫn giữ đường dẫn cơ sở hoạt động cho đến khi chế độ mới chứng tỏ mình xứng đáng nhận được lưu lượng đó.

Thay đổi này không chỉ đơn thuần là thêm một tính năng. Suốt hai năm qua, video vẫn là đầu vào đa phương thức khó xử lý nhất — vô cùng giàu biểu cảm, vô cùng tốn kém để phân tích, và thực chất chỉ được đọc trong trạng thái hao hụt mẫu. Khả năng hiểu video theo hướng tác tử (agentic video understanding) là câu trả lời nghiêm túc đầu tiên của Google cho cả ba vấn đề cùng lúc, và nó xuất hiện ở phân khúc rẻ nhất của dòng mô hình thay vì ở phiên bản cao cấp nhất. Với những đội ngũ từng né tránh khối lượng công việc video vì hóa đơn token, chế độ này đáng để họ tính toán lại ngay hôm nay.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
