การ์ดฮีโร่ที่สร้างขึ้นมีชื่อว่า 'Dots กับ Gemini 3.1 Pro' เส้นแบ่งแนวตั้งแบ่งการ์ดออกเป็น: แผงด้านซ้ายซึ่งมีป้ายกำกับว่า 'D' มีไอคอนคลาวด์คอมพิวเตอร์และข้อความ 'คอมพิวเตอร์ของคุณเอง + เบราว์เซอร์ - แอป 4,000+ รายการ'; แผงด้านขวาซึ่งมีป้ายกำกับว่า 'Gemini 3.1 Pro' มีไอคอนรูปตาและรูปคลื่นเสียง และ 'อินพุตข้อความ, รูปภาพ, เสียง, วิดีโอ - บริบท 1M - $2.00 / $12.00' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Dots vs Gemini 3.1 Pro: เอเจนต์ที่มีเดสก์ท็อป ปะทะ โมเดลที่มีประสาทสัมผัสทั้งห้า

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

The word "multimodal" hides the real difference between these two, so start with what each one does with the world. Gemini 3.1 Pro Preview is Goog​le's flagship reasoning model, released in preview on February 19, 2026: it accepts text, images, audio, video and files as input and returns text, works across a 1,048,576-token context window with up to 65,536 tokens of output, and costs $2.00 per million input tokens and $12.00 per million output tokens below a 200,000-token prompt, repricing to $4.00 and $18.00 above it. Dots is the company's always-on agent, announced at DevDay on September 29, 2026: an agent with its own cloud computer and browser that works across more than 4,000 connected apps, runs on GPT-6 Astra, and comes included with Pro and Business Premium. Gemini 3.1 Pro watches the world and describes it; a dot acts inside it. Those are different verbs, and almost every practical question about this pair follows from which verb your problem needs.

ข้อมูลนำเข้าไม่ใช่สิ่งเดียวกับการลงมือทำ

การรองรับสื่อของ Gemini 3.1 Pro นั้นกว้างขวางอย่างแท้จริง — ทั้งไฟล์บันทึกเสียงยาวสองชั่วโมง รูปถ่ายสินค้า ไฟล์ส่งออกจากสเปรดชีต และสัญญา สามารถเข้ามาในคำขอเดียวกันได้ทั้งหมด — แต่ข้อมูลนำเข้าเหล่านี้ล้วนเป็นสิ่งที่ดำรงอยู่ก่อนการเรียกใช้งานแล้วทั้งสิ้น ผลลัพธ์ของโมเดลคือข้อความ: คำตอบ ข้อมูลที่สกัดออกมา แผนงาน ฉบับร่าง ไม่มีสิ่งใดนอกบทสนทนาเปลี่ยนแปลงไปเพราะโมเดลทำงาน

A dot พลิกกลับสิ่งนั้น อินพุตของมันเป็นเรื่องธรรมดา — ข้อความของคุณ ข้อมูลแอปของคุณ งานที่คุณอธิบาย — และเอาต์พุตของมันคือการเปลี่ยนแปลงในโลก: ไฟล์ถูกย้าย ทิกเก็ตได้รับการอัปเดต ข้อความที่ส่งหลังจากคุณอนุมัติ หน้าเว็บที่เปิดในเบราว์เซอร์ของมันเอง เอกสารเปิดตัวของ OpenAI อธิบายว่ามันขับเคลื่อนหลายโปรเจกต์ไปพร้อมกัน เรียนรู้จากคำติชม และรับงานใหม่โดยไม่ต้องเริ่มเธรดใหม่ นั่นคือคำอธิบายของพนักงาน ไม่ใช่ของโมเดล และมันอธิบายว่าทำไม OpenAI ถึงไม่เผยแพร่เกณฑ์มาตรฐานสำหรับมัน: คุณไม่วัดผลเพื่อนร่วมงานบนกระดานผู้นำ คุณดูว่ามันทำอะไรสำเร็จและตรวจสอบ Activity View

• สิ่งที่รับเข้า — ข้อความ คำอธิบายงาน และข้อมูลจากแอปที่เชื่อมต่อในด้านหนึ่ง; ข้อความ รูปภาพ เสียง วิดีโอ และไฟล์ในอีกด้านหนึ่ง

• สิ่งที่มันสร้างขึ้น — การเปลี่ยนแปลงภายในซอฟต์แวร์อื่น ซึ่งขึ้นอยู่กับกฎและด่านการอนุมัติ เทียบกับข้อความที่คุณต้องจัดการเองในภายหลัง

• ทำงานที่ไหน — คลาวด์คอมพิวเตอร์ของ OpenAI ที่มีเบราว์เซอร์ของตัวเอง แยกออกจากเครื่องของคุณเว้นแต่คุณจะเชื่อมโยงทั้งสองเข้าด้วยกัน เทียบกับโครงสร้างพื้นฐานการให้บริการของ Google ที่สามารถเข้าถึงได้ผ่าน API จากที่ใดก็ได้ตามที่คุณต้องการ

• บริบท — ไม่มีเอกสารกำกับแม้แต่จุดเดียว เทียบกับ 1,048,576 โทเค็นขาเข้า และ 65,536 โทเค็นขาออก

• หลักฐาน — เดโมจากผู้ขาย ไม่มี benchmark ที่เป็นอิสระ เมื่อเทียบกับ Artificial Analysis Intelligence Index ที่ 29.7 โดยได้ 94.1 ใน GPQA Diamond และ 82 ในการระลึกบริบทยาว ซึ่งระบุไว้อย่างเป็นอิสระจาก Google

Gemini 3.1 Pro มีค่าควรแก่การมีตรงไหน

เหตุผลที่ควรเก็บโมเดลแบบนี้ไว้ก็คือ การรับรู้เป็นเรื่องยาก และเอเจนต์ส่วนใหญ่ทำได้แย่ในเรื่องนี้ โปรไฟล์อิสระที่เผยแพร่ของ Gemini 3.1 Pro นั้นผิดปกติ: 94.1 บน GPQA Diamond เป็นผลลัพธ์ใกล้ระดับแนวหน้า, 82 ในการเรียกคืนบริบทแบบยาวเป็นตัวเลขที่ดีเป็นอันดับสองในชุดโมเดลที่เราระบุไว้ และ 58.7 บน SciCode ทำให้มันอยู่บนสุดของลีดเดอร์บอร์ดนั้นโดยเฉพาะ จุดที่มันไม่โดดเด่นคือการตัดสินใจแบบเอเจนต์ — คะแนน τ²-Bench ที่ 95.6 ถือว่าน่านับถือ แต่สไลซ์ τ-banking ของมัน ซึ่งเป็นส่วนที่วัดการใช้เครื่องมือหลายขั้นตอนกับระบบของธนาคาร ได้เพียง 21.4 ทั้งหมดนั้นเป็นการวัดโดยบุคคลที่สามที่ระบุพร้อมแหล่งที่มาในแคตตาล็อกของเรา ไม่ใช่ตัวเลขจากผู้ขาย ซึ่งเป็นเหตุผลว่าทำไมจึงมีค่ามากกว่าสไลด์เปิดตัว

อีกครึ่งหนึ่งของเรื่องราวต่อคำขอคือโมเดลนี้ไม่ได้ใช้ฟรี มันเข้าสู่ช่วงทดลองใช้ในเดือนกุมภาพันธ์ หลายเดือนก่อนที่โมเดลแนวหน้าปัจจุบันจะเปิดตัว และราคาของมันอยู่เหนือระดับราคาถูก: $2.00 และ $12.00 ต่อล้านโทเค็น คิดเป็นอินพุตประมาณ $0.0006 ต่อหน้าข้อความหนาแน่น ซึ่งดูเหมือนไม่มีค่าใช้จ่ายอะไรเลยจนกว่าคุณจะรันการนำเข้าวิดีโอทั้งคลัง แล้วมันจะกลายเป็นรายการค่าใช้จ่าย การอ่านหนึ่งเฟรมวิดีโอมีค่าใช้จ่ายเท่ากับการอ่านหนึ่งย่อหน้า และโมเดลก็ยินดีคิดเงินคุณทั้งสองอย่าง

A screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview, showing the identifier 'google/gemini-3.1-pro-preview' with Vision, Audio, Tools, JSON and Reasoning badges, a publication date of 2026-02-19, the description of it as Google's frontier reasoning model with improved software engineering and agentic reliability, a side panel showing 1M tokens of context and 65K maximum output over audio, file, image, text and video input, and a price strip reading $2.00 and $12.00. The page's own sidebar note records this as a headless screenshot of the live page.

โมเดลต้นทุนสองแบบที่ไม่ยอมแปลง

ค่าใช้จ่ายของ dot คือการสมัครสมาชิกที่มีโควตาที่ยังไม่เปิดเผย โดยตัวแรกถูกรวมอยู่ใน Pro หรือ Business Premium ขีดจำกัดแบบขยายจะมีผลในเดือนแรก การสนทนากับ dot ของคุณไม่ลดขีดจำกัดการใช้งาน ChatGPT และไม่มีราคาที่เปิดเผยสำหรับ dot ตัวที่สอง สำหรับความเร็วหรือความจุเพิ่มเติม หรือสำหรับงานที่ทำเสร็จแล้ว รายงานของ CNBC เกี่ยวกับงาน keynote ระบุว่า Sarah Friar ตั้งราคาแพ็กเกจ Pro 500 ใหม่ราคา $500 เป็นโควตาการใช้งานบวกโหมด Ultrafast มากกว่าเป็นอัตราคิดค่าต่อ dot ดังนั้นแผนที่แพงที่สุดในตารางของ OpenAI จึงไม่ได้ให้ต้นทุนต่อหน่วยของงานเอเจนต์เช่นกัน

Gemini 3.1 Pro แปลงทุกสิ่งทุกอย่างให้กลายเป็นโทเคน รวมถึงส่วนที่ไม่ใช่ข้อความด้วย เสียง วิดีโอ และรูปภาพถูกคิดค่าใช้จ่ายเป็นอินพุต ดังนั้นค่าใช้จ่ายของงานจึงขึ้นอยู่กับว่าคุณให้โมเดลมองโลกมากแค่ไหน — เป็นคุณสมบัติที่มีประโยชน์ เพราะคุณวัดมันได้ และเป็นคุณสมบัติที่อันตราย เพราะตัวเลขที่มากที่สุดในบิลมักเป็นตัวเลขที่ไม่มีใครวางแผนไว้ การกำหนดเส้นทางโมเดลช่วยในจุดนี้ในแบบที่เฉพาะเจาะจง rather than ทั่วไป: ด้วยโมเดลกว่า 200 รุ่นภายใต้คีย์เดียว ในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่มงานอ่านแบบมัลติโมดัลที่มีค่าใช้จ่ายสูงและงานติดตามผลที่มีค่าใช้จ่ายต่ำสามารถอยู่บนโมเดลคนละตัวในไปป์ไลน์เดียวกัน และการเปลี่ยนแปลงอัตราค่าบริการจาก Google จะลงมาที่บัญชีของคุณในวันเดียวกันแทนที่จะรอถึงรอบต่ออายุ

A generated scoreboard titled 'Dots vs Gemini 3.1 Pro - inputs, outputs, evidence', with two columns. 'Dots' lists: Inputs messages and app data; Output changes inside connected apps; Model GPT-6 Astra (vendor-stated); Computer its own cloud computer and browser; Connectors 4,000+ apps; Independent benchmark none. 'Gemini 3.1 Pro' lists: Inputs text, image, audio, video, file; Output text only; Context 1,048,576 tokens; Max output 65,536 tokens; Price $2.00 in / $12.00 out per 1M below 200K; AA Intelligence Index 29.7. A footer reads 'Dots details vendor-stated from DevDay; Gemini 3.1 Pro figures from independent listings in the OrcaRouter catalogue.'

ที่ทั้งสองทำงานร่วมกัน

การจับคู่ที่เป็นธรรมชาติคือดอตที่ทำหน้าที่ประสานงาน กับโมเดลมัลติโมดัลที่รับรู้ งานเข้ามา ดอตจะจัดเส้นทางให้: อะไรก็ตามที่ต้องดูหรือต้องฟังจะถูกส่งไปที่ Gemini 3.1 Pro เพื่อสร้างคำอธิบายที่มีโครงสร้าง แล้วคำอธิบายนั้นจะกลับเข้าสู่เวิร์กโฟลว์ ซึ่งตารางเวลาหรือกฎสามารถดำเนินการกับมันได้ ดอตจัดการเรื่องการตามงาน ส่วนโมเดลจัดการเรื่องการอ่าน การแยกแบบนี้ยังทำให้การเรียกใช้โมดัลลิตีที่มีค่าใช้จ่ายสูงตรวจสอบได้ ซึ่งสำคัญ เพราะสิ่งเหล่านี้แหละที่ทำให้ผู้คนประหลาดใจ

บน OrcaRouter โมเดลนี้ถูกจัดเส้นทางเป็น google/gemini-3.1-pro-preview ในราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยไม่บวกเพิ่มเลย 0% ควบคู่ไปกับโมเดลอื่น ๆ ในแค็ตตาล็อก พร้อมกับการสลับไปใช้ผู้ให้บริการต้นทางรายอื่นโดยอัตโนมัติเมื่อรายใดรายหนึ่งมีประสิทธิภาพลดลง และ DSL สำหรับการจัดเส้นทางเพื่อประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว ควรพูดให้ชัดเจนว่าสิ่งนั้นไม่ได้ครอบคลุมอะไรบ้าง: dots ไม่ได้อยู่ในแค็ตตาล็อกของเรา ไม่มี endpoint สำหรับมัน และไม่มีตัวระบุโมเดลใด ๆ ที่จะใช้ชี้คำขอไปยังมันได้ หากคุณต้องการให้ชั้นการรับรู้อยู่ภายใต้การควบคุมของคุณเอง — และโมเดลพรีวิวจากเดือนกุมภาพันธ์ก็เป็น dependency ประเภทที่ควรจำกัดขอบเขตไว้พอดี — โมเดลควรอยู่เบื้องหลัง endpoint ของคุณ ส่วนเอเจนต์ก็อยู่ที่ใดก็ตามที่คุณเช่ามันไว้

ข้อความของคุณต้องการคำกริยาอะไร

ถ้างานเกี่ยวข้องกับการดูหรือฟังบางสิ่งแล้วสร้างคำตอบ Gemini 3.1 Pro คือเครื่องมือที่ใช่ และ dot คือสิ่งที่ซื้อมาผิด ถ้างานเกี่ยวข้องกับการทำให้บางสิ่งเสร็จสิ้นข้ามแอปพลิเคชันหลายตัวโดยที่คุณไม่ต้องเป็นคนขับเคลื่อน dot คือเครื่องมือ และอินพุตแบบมัลติโมดัลไม่ว่าจะมีมากเพียงใดก็ไม่อาจทดแทนมันได้ ทีมที่ทำแบบนี้ได้อย่างถูกต้องจะใช้ทั้งสองอย่างและกำหนดขอบเขตให้ชัดเจน: การรับรู้บนโมเดลแบบคิดตามการใช้งานที่คุณวัดได้ ส่วนการลงมือทำอยู่เบื้องหลังผลิตภัณฑ์ที่คุณยกเลิกได้

A screenshot of the OrcaRouter model catalogue page headed 'Models', showing the line '206 models - 16 providers - one API key, one bill' above filter controls for input modalities, context length, input price, status and supported parameters, with a grid of model cards and credit top-up offers visible beneath.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube