
Gemini Agentic Video Understanding เปิดตัวแล้ว: โหมด API ที่ลดต้นทุนการวิเคราะห์วิดีโอลงสองในสาม
- googleใหม่Google: Gemini 3.8 Flash2026-09-0259ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0258ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0166ความฉลาด82การเขียนโค้ด
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
ในวันที่ 1 กันยายน 2026 Google ได้เปิดตัวความเข้าใจวิดีโอแบบเอเจนต์สำหรับ Gemini 3.7 Flash, Gemini 3.6 Flash และ Gemini 3.5 Flash-Lite — โหมดใหม่ใน Gemini API ที่ไม่ปฏิบัติต่อวิดีโอเหมือนกองเฟรมอีกต่อไป แต่กลับปฏิบัติต่อมันเหมือนเอกสารที่ค้นหาได้ การประกาศของ Google DeepMind ซึ่งเขียนโดย Rohan Doshi ผู้จัดการผลิตภัณฑ์อาวุโส และ Mario Lučić ผู้อำนวยการฝ่ายวิจัย นับเป็นการเปลี่ยนแปลงครั้งสำคัญครั้งแรกในวิธีที่ Gemini อ่านวิดีโอนับตั้งแต่โมเดลเริ่มรองรับอินพุตวิดีโอเป็นครั้งแรก แทนที่โมเดลจะประมวลผลชุดตัวอย่างเฟรมคงที่อย่างเงียบ ๆ ตอนนี้โมเดลจะตัดสินใจระหว่างการตอบว่าจะดูอะไร ด้วยความเร็วเท่าใด และผ่านช่องทางใดในสามช่องทาง ได้แก่ เฟรมภาพ เสียง หรือบทถอดความ ผลลัพธ์ที่โดดเด่น ซึ่งทั้งหมดเป็นข้อมูลที่ผู้พัฒนารายงานและยังไม่มีการยืนยันซ้ำอย่างอิสระ ก็คือ การวิเคราะห์วิดีโอมีต้นทุนถูกลงสูงสุด 66% ใช้โทเคนน้อยลงสูงสุด 88% และให้คำตอบที่แม่นยำขึ้นสูงสุด 7% เมื่อเทียบกับวิธีพื้นฐานแบบเฟรมต่อเฟรมเดิมที่วิธีนี้เข้ามาแทนที่
"agentic" จริงๆ แล้วเปลี่ยนแปลงอะไรภายใต้ฝาครอบ
พฤติกรรมแบบเดิมคือสิ่งที่ Google เรียกในตอนนี้ว่า "static" processing: ป้อนวิดีโอให้ Gemini แล้วมันจะสุ่มตัวอย่างเฟรมในอัตราคงที่ — ค่าเริ่มต้นคือหนึ่งเฟรมต่อวินาที — รันตัวอย่างทั้งชุดผ่านโมเดล และตอบจากสิ่งที่กริดคงที่นั้นจับภาพได้ ซึ่งมีจุดบอดเชิงโครงสร้างสองจุด การเปลี่ยนแปลงสถานะที่เกิดขึ้นระหว่างสองเฟรมที่ถูกสุ่มตัวอย่างนั้นไม่มีอยู่จริงสำหรับโมเดล และวิดีโอความยาวสองชั่วโมงที่สุ่มตัวอย่างที่ 1 FPS จะเสียโทเคนเป็นจำนวนมหาศาล โดยส่วนใหญ่ใช้ไปกับฟุตเทจที่ไม่เกี่ยวกับคำถามเลย
ความเข้าใจวิดีโอแบบเอเจนต์เข้ามาแทนที่กริดแบบคงที่ด้วยลูปการทำงาน โมเดลใช้การให้เหตุผลหลักควบคู่กับเครื่องมือวิดีโอแบบเนทีฟที่ทำให้มันตัดสินใจได้อย่างไดนามิกว่าจะดูอะไร ดูด้วยความเร็วเท่าใด และตรวจสอบด้วยโมดาลิตี้ใด ไม่ว่าจะเป็นเฟรมภาพ แทร็กเสียง หรือบทถอดเสียง มันเรียกใช้เครื่องมือภายในเพื่อโหลดเฉพาะส่วนที่เกี่ยวข้องของไฟล์ ดึงช่วงเวลาและสัญญาณที่คำถามต้องการจริงๆ จากนั้นจึงให้เหตุผลกับสิ่งที่ดึงมา Google อธิบายว่านี่คือรูปแบบสถาปัตยกรรมเดียวกับฟีเจอร์การมองเห็นเชิงเอเจนต์ที่เปิดตัวก่อนหน้านี้ นั่นคือโมเดลไม่ใช่ผู้บริโภคสื่อเชิงรับอีกต่อไป แต่เป็นเอเจนต์ที่สอบถามสื่อเสมือนใช้เครื่องมือ
ผลในทางปฏิบัติก็คือ “แบบจำลองเห็นอะไร” จะไม่ใช่เรื่องของโชคจากการสุ่มตัวอย่างอีกต่อไป คำถามเกี่ยวกับช็อตสั้นเพียงเสี้ยววินาที ข้อบกพร่องที่แทบมองไม่เห็น หรือคำพูดที่พูดท่ามกลางเสียงรบกวนพื้นหลัง ล้วนสามารถตอบได้ เพราะแบบจำลองสามารถสแกนซ้ำช่วงเวลาที่แม่นยำนั้นด้วยความละเอียดและอัตราที่สูงขึ้น ในโมดาลิตี้ซึ่งเป็นที่อยู่ของคำตอบ

ตัวเลข ซึ่งถูกกำกับไว้ตามสิ่งที่มันเป็น
การเปรียบเทียบเกณฑ์มาตรฐานของกูเกิลเองระหว่างการประมวลผลแบบเอเจนต์กับการประมวลผลแบบคงที่ถือเป็นแก่นกลางของการประกาศครั้งนี้ และควรอ่านว่าเป็นเพียงข้อกล่าวอ้างจากผู้จำหน่ายจนกว่าหน่วยงานภายนอกจะทำซ้ำการทดสอบได้ผล ในชุดทดสอบภายในของบริษัท:
• ต้นทุน — ลดต้นทุนการวิเคราะห์ได้สูงสุดถึง 66% เนื่องจากโมเดลโหลดเฉพาะส่วนที่จำเป็นเท่านั้น แทนที่จะโหลดตัวอย่างทั้งหมดที่กำหนดไว้
• โทเคน — ลดการใช้โทเคนลงได้สูงสุดถึง 88% โดยประหยัดได้มากที่สุดกับวิดีโอแบบยาว: ประกาศระบุโดยเฉพาะถึงคู่มือความยาว 10 นาทีไปจนถึงการบันทึกที่กินเวลาหลายชั่วโมง
• ความแม่นยำ — ดีขึ้นถึง 7% ในงานเดียวกัน เนื่องจากเหตุการณ์ที่เกิดขึ้นในระดับต่ำกว่าวินาทีและระหว่างเฟรมจะมองเห็นได้ชัดเจนแทนที่จะตกอยู่ในช่องว่างของการสุ่มตัวอย่าง
กูเกิลวางตำแหน่ง Gemini 3.7 Flash ว่าอยู่บน "ขอบเขตแพเรโตด้านความแม่นยำต่อต้นทุน" ของโมเดลที่ผ่านการทดสอบ — พูดภาษาคนก็คือ ให้คำตอบที่ดีที่สุดต่อหนึ่งดอลลาร์ในบรรดาสามโมเดล อีกทั้งยังเอ่ยชื่อพันธมิตรการเข้าถึงก่อนใครสี่ราย ได้แก่ Ponder, Revyl, Mosaic และ Resemble.AI ซึ่งพัฒนาโมเดลนี้ก่อนที่จะเปิดให้ใช้งานทั่วไป รายละเอียดแบบนี้บ่งชี้ถึงการใช้งานจริงในระบบผลิต มากกว่าจะเป็นเพียงสไลด์นำเสนอ ผลลัพธ์ของพันธมิตรเหล่านั้นยังไม่มีการเผยแพร่ ดังนั้นจุดยืนที่น่าเชื่อถือคือ: กลไกมีอยู่จริง ทิศทางถูกต้องอย่างเห็นได้ชัด และตัวเลขเปอร์เซ็นต์เฉพาะเจาะจงยังคงเป็นข้อมูลของกูเกิล จนกว่าจะมีการวัดผลโดยอิสระ
กรณีการใช้งานที่ฟีเจอร์นี้ถูกสร้างขึ้นมาเพื่อรองรับ
การประกาศดังกล่าวจัดกลุ่มความสามารถออกเป็นสี่หมวดหมู่ โดยแต่ละหมวดหมู่เชื่อมโยงกับงานที่เป็นรูปธรรมซึ่งนักพัฒนาสามารถส่งมอบได้:
• การดึงข้อมูลช่วงเวลาแบบย่อยวินาที — ระบุการเปลี่ยนแปลงสถานะในเสี้ยววินาทีและขอบเขตการตัดที่กระชั้นชิด ซึ่งกริดแบบ 1 FPS มองไม่เห็นโดยสิ้นเชิง นี่คือกรณีการใช้งานของการตัดต่อวิดีโออัตโนมัติ: การค้นหาเฟรมที่แม่นยำที่สุดที่เกิดการเปลี่ยนฉาก
• การค้นหาแบบงมเข็มในมหาสมุทรสำหรับเนื้อหายาว — ตอบคำถามเฉพาะเจาะจงเกี่ยวกับวิดีโอที่ยาวหลายชั่วโมงได้โดยไม่ต้องใช้โทเคนนับล้าน นี่คือความแตกต่างระหว่าง “ดูการสนทนา 3 ชั่วโมงนี้” กับ “ลูกค้าตกลงที่จะต่ออายุสัญญาในการสนทนา 3 ชั่วโมงนี้หรือไม่”
• การตรวจจับความผิดปกติ — โมเดลจะสุ่มตัวอย่างช่วงเวลาที่น่าสนใจซ้ำด้วยอัตราเฟรมที่สูงขึ้น เพื่อตรวจสอบการเคลื่อนไหวที่รวดเร็วและจุดบกพร่องทางภาพที่ละเอียดอ่อน การควบคุมคุณภาพในการผลิต การวิเคราะห์กีฬา และฟุตเทจกล้องวงจรปิด ถือเป็นกลุ่มเป้าหมายหลัก
• การนับการกระทำและวัตถุ — การติดตามการเคลื่อนไหวทางกายภาพที่เกิดขึ้นซ้ำๆ และวัตถุที่แตกต่างกันเมื่อเวลาผ่านไป ซึ่งการสุ่มตัวอย่างแบบคงที่ (static sampling) จะนับได้น้อยกว่าความเป็นจริงเมื่อสิ่งที่ถูกนับเคลื่อนที่เร็วกว่าอัตราการสุ่มตัวอย่าง
มีรุ่นใดบ้างและราคาเท่าไร
ฟีเจอร์นี้อยู่ในระดับ Flash และส่วนต่างของราคาระหว่างสามรุ่นมีความสำคัญต่อการตัดสินใจว่าจะใช้กับรุ่นใด:
• Gemini 3.7 Flash — $0.75 ขาเข้า / $3.75 ขาออกต่อล้านโทเคนในอัตราโปรโมชัน ยืนยันจนถึงวันที่ 31 ธันวาคม 2026 หลังจากนั้นจะเพิ่มเป็นสองเท่าเป็น $1.50 / $7.50 เป็นผู้นำด้านความแม่นยำต่อต้นทุนของทั้งสามรุ่น
• Gemini 3.6 Flash — $1.50 / $7.50 ต่อล้านโทเค็น ตัวเลือกที่เสถียรและไม่ใช่โปรโมชันในบรรดาสามรุ่นนี้
• Gemini 3.5 Flash-Lite — $0.30 / $2.50 ต่อล้านโทเคน สายประหยัด สำหรับการคัดกรองวิดีโอปริมาณมาก ซึ่งโทเคนที่ถูกที่สุดคือสิ่งที่สำคัญ
เนื่องจากฟีเจอร์นี้ใช้การคิดค่าบริการโทเคนมาตรฐานของ Gemini API โดยไม่มีค่าธรรมเนียมเพิ่มเติม การลดโทเคนลง 88% จึงส่งผลโดยตรงต่ออัตราค่าบริการเหล่านี้ เวิร์กโหลดที่เคยเสียค่าใช้จ่าย 100 ดอลลาร์ในการวิเคราะห์แบบสถิต ควรมีต้นทุนประมาณ 12 ถึง 34 ดอลลาร์ภายใต้การประมวลผลแบบ agentic บนโมเดลเดียวกัน ก่อนที่จะรวมความแม่นยำที่เพิ่มขึ้นด้วยซ้ำ ซึ่ง这才是เรื่องสำคัญจริงๆ สำหรับใครก็ตามที่ไปป์ไลน์ปัจจุบันเผาโทเคนไปกับการอัปโหลดซ้ำหรือการสุ่มเฟรมจากวิดีโอระยะยาว
วิธีเปิดเครื่อง
โหมดนี้เปิดใช้งานด้วยแฟล็กการกำหนดค่าตัวเดียว นั่นคือส่งค่า "processing" เป็น "agentic" ในคำขอ และทำงานร่วมกับอินพุตและราคาเดียวกันกับ API มาตรฐาน ไม่มีเอนด์พอยต์แยก ไม่มีมิติการเรียกเก็บเงินใหม่ ไม่มีโควตาพิเศษ สำหรับเส้นทาง Python จะใช้ interactions API ของ google-genai SDK เช่นใช้กับโมเดล "gemini-3.7-flash" โดยอินพุตเป็นวิดีโอบวกกับพรอมต์ข้อความ วิดีโออาจเป็นการอัปโหลดโดยตรง, Cloud Storage URI, HTTP URL สาธารณะ หรือ YouTube URL ทั้งนี้ขึ้นอยู่กับพื้นผิวที่คุณเรียกใช้งาน
ข้อจำกัดเชิงปฏิบัติสองประการที่ควรทราบก่อนที่คุณจะสร้าง: ไฟล์วิดีโอจะต้องอยู่ภายใต้ขีดจำกัดขนาดของแพลตฟอร์ม (ในเส้นทาง Enterprise Agent Platform ขนาดประมาณ 15 MB ต่อไฟล์) และ Gemini Enterprise Agent Platform รองรับรูปแบบคอนเทนเนอร์ทั่วไป ได้แก่ MP4, MOV, AVI, WebM, WMV, MPEG — ดังนั้นการจัดการรูปแบบไฟล์จึงเกิดขึ้นก่อนการเรียกใช้ API ไม่ใช่ภายในนั้น
ตอนนี้มันทำงานที่ไหน และกำลังจะไปที่ไหน
เมื่อเปิดตัวครั้งแรก ความเข้าใจวิดีโอแบบเอเจนต์พร้อมใช้งานสำหรับวิดีโอที่อัปโหลดและวิดีโอบน YouTube ผ่าน Gemini API ใน Google AI Studio และผ่าน Gemini Enterprise Agent Platform ซึ่งเป็นช่องทางสำหรับนักพัฒนาและองค์กร มีการประกาศการเปิดตัวสำหรับผู้บริโภคสองรายการแล้ว แต่ยังไม่เปิดใช้งานจริง ได้แก่ แอป Gemini ซึ่งจะทยอยเปิดตัวให้ผู้ใช้ทุกคนบนโมเดล Flash และ Flash-Lite ในเร็วๆ นี้ และฟีเจอร์ "Ask YouTube" บนหน้าชมวิดีโอของ YouTube ซึ่ง Google กล่าวว่าจะเปิดตัวในอีกไม่กี่เดือนข้างหน้า สำหรับนักพัฒนาที่กำลังประเมินฟีเจอร์นี้ API คือช่องทางที่ทดสอบได้จริงในขณะนี้ ส่วนช่องทางสำหรับผู้บริโภคคือกลยุทธ์การเผยแพร่ที่จะทำให้วลีนี้กลายเป็นที่คุ้นเคย
ยังมีสัญญาณจากระบบนิเวศอีกอย่างหนึ่งที่น่าสนใจ: เนื่องจากความสามารถนี้มาพร้อมกับโหมด API มาตรฐาน โปรเจกต์ MCP-server และ agent-framework ที่ครอบการทำงานความเข้าใจวิดีโอของ Gemini อยู่ — เฟรมเวิร์ก GenV สำหรับวิเคราะห์การประชุม ชุดแพ็กเกจ MCP สำหรับงานวิจัยวิดีโอ และทักษะวิดีโอ Gemini ที่ปรากฏขึ้นในช่วงหลายเดือนที่ผ่านมา — จึงสามารถนำไปปรับใช้ได้โดยไม่ต้องเปลี่ยนสถาปัตยกรรมเดิม สิ่งที่ปลดล็อกการลดต้นทุนคือการอัปเกรดโหมดนี้ ไม่ใช่การออก SDK ใหม่
สิ่งที่ควรตรวจสอบก่อนจะเชื่อถือเปอร์เซ็นต์
ตัวเลขทุกตัวในประกาศ — ทั้ง 66%, 88%, 7% และข้อกล่าวอ้างเรื่อง Pareto-frontier — ล้วนเป็นตัวเลขของ Google เอง วัดบนชุดทดสอบของ Google เอง และยังไม่มีใครภายนอกบริษัททำซ้ำผลลัพธ์เหล่านี้ได้ ทิศทางไม่ต้องสงสัย: ลูปแบบเอเจนต์ที่โหลดเฉพาะเซกเมนต์ที่เกี่ยวข้องย่อมต้องเอาชนะกริดแบบตายตัวที่โหลดทุกอย่างได้ ส่วนขนาดของผลลัพธ์คือคำถามเปิด และจะแปรผันตามภาระงาน — คลิปยาว 2 นาทีที่มีคำถามเพียงข้อเดียวจะไม่ได้เห็นการประหยัดโทเค็น 88% เพราะแทบไม่มีอะไรให้ข้าม แต่การโทรยาว 3 ชั่วโมงที่มีคำถามเจาะจงหนึ่งข้อจะเห็นผลดังกล่าว การทดสอบที่ถูกต้องคือการนำวิดีโอแบบยาวของคุณเองมารันหนึ่งรอบด้วยการประมวลผลแบบสแตติก และอีกหนึ่งรอบด้วยวิธีแบบเอเจนต์ บนโมเดลเดียวกัน โดยนับโทเค็นจริงและค่าใช้จ่ายจริง

เศรษฐศาสตร์ของการทดสอบนั้นคือสิ่งที่เลเยอร์การจัดเส้นทาง (routing layer) แสดงคุณค่าที่แท้จริงของมัน Gemini 3.6 Flash และ Gemini 3.5 Flash-Lite — สองในสามโมเดลที่ฟีเจอร์นี้ใช้กับ — ถูกให้บริการบน OrcaRouter ในราคารายการของ Google ที่ส่งผ่านโดยไม่มีมาร์กอัป 0% ดังนั้นการลดราคาการวิเคราะห์วิดีโอจึงมีผลฝั่งเราทันทีในวันเดียวกับที่ Google ประกาศ; Gemini 3.7 Flash ซึ่งเป็นรุ่นที่สามและใหม่ที่สุด พร้อมใช้งานผ่าน API ของ Google เองและแพลตฟอร์มภายนอกหลายแห่ง และเนื่องจากความเข้าใจวิดีโอแบบ agentic เป็นความสามารถที่เพิ่งเปิดตัว ซึ่งความแตกต่างในโลกจริงยังไม่ได้รับการพิสูจน์ จึงเป็นกรณีศึกษาตำราสำหรับการ failover อัตโนมัติ: ชี้ปริมาณการรับส่งวิดีโอบางส่วนไปที่โหมด agentic ให้เราเตอร์ fallback ไปยังโมเดลที่ผ่านการพิสูจน์แล้วเมื่อเกิดข้อผิดพลาด อัตราจำกัด หรือคุณภาพถดถอยอย่างชัดเจน และคงเส้นทางพื้นฐานให้ทำงานต่อไปจนกว่าโหมดใหม่จะพิสูจน์ว่าคู่ควรกับการรับส่งนั้น

การเปลี่ยนแปลงครั้งนี้เกินกว่าการเพิ่มฟีเจอร์ทั่วไป วิดีโอเป็นอินพุตมัลติโมดัลที่งุ่มง่ามมายาวนานถึงสองปี — ให้อารมณ์และรายละเอียดได้มหาศาล แต่ก็แพงมหาศาลในการวิเคราะห์ และแทบจะถูกอ่านด้วยการสุ่มตัวอย่างที่สูญเสียข้อมูล ความเข้าใจวิดีโอแบบเอเจนติกคือคำตอบจริงจังครั้งแรกของ Google ที่จัดการปัญหาทั้งสามข้อพร้อมกัน และมันมาพร้อมกับระดับที่ถูกที่สุดของไลน์โมเดล ไม่ใช่รุ่นเรือธง สำหรับทีมที่หลีกเลี่ยงงานวิดีโอเพราะค่าใช้จ่ายด้านโทเค็น โหมดนี้คุ้มค่าที่จะลองคำนวณใหม่ตั้งแต่วันนี้
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
