
Dots vs Gemini 3.1 Pro: 데스크톱을 가진 에이전트와 다섯 감각을 가진 모델의 대결
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 349 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 210 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
"멀티모달"이라는 단어는 이 둘 사이의 진짜 차이를 가리므로, 각자가 세상과 어떻게 상호작용하는지부터 시작하세요. Gemini 3.1 Pro Preview는 2026년 2월 19일 프리뷰로 출시된 Google의 플래그십 추론 모델입니다: 텍스트, 이미지, 오디오, 비디오, 파일을 입력으로 받아 텍스트를 반환하며, 1,048,576토큰 컨텍스트 윈도우에서 최대 65,536토큰의 출력을 지원하고, 200,000토큰 프롬프트 이하에서는 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $12.00의 비용이 들며, 그 이상에서는 $4.00와 $18.00로 재책정됩니다. Dots는 2026년 9월 29일 DevDay에서 발표된 회사의 상시 대기 에이전트입니다: 자체 클라우드 컴퓨터와 브라우저를 갖추고 4,000개 이상의 연결된 앱에서 작동하며, GPT-6 Astra에서 실행되고, Pro 및 Business Premium에 포함되어 제공됩니다. Gemini 3.1 Pro는 세상을 바라보고 설명합니다; 닷은 그 안에서 행동합니다. 이것들은 서로 다른 동사이며, 이 쌍에 관한 거의 모든 실용적인 질문은 여러분의 문제가 어떤 동사를 필요로 하는지에 따라 달라집니다.
입력은 동작과 다릅니다.
Gemini 3.1 Pro의 미디어 지원 범위는 정말 넓습니다 — 두 시간짜리 녹음, 제품 사진, 스프레드시트 내보내기, 계약서까지 모두 같은 요청에 담겨 올 수 있습니다 — 하지만 그런 입력은 하나같이 호출 전에 이미 존재하던 것입니다. 모델의 출력은 텍스트입니다: 답변, 추출, 계획, 초안. 모델이 실행되었다고 해서 대화 밖의 무엇도 바뀌지 않습니다.
점 하나가 그것을 뒤집는다. 그 입력은 평범하다 — 당신의 메시지, 앱 데이터, 당신이 설명한 작업 — 그리고 그 출력은 세상의 변화다: 파일이 옮겨지고, 티켓이 업데이트되고, 승인 후 메시지가 전송되고, 자체 브라우저에서 페이지가 열린다. OpenAI의 출시 자료는 그것이 여러 프로젝트를 동시에 진행하고, 피드백으로부터 배우며, 새 스레드 없이 새 작업을 받아들인다고 설명한다. 그것은 모델이 아니라 일꾼에 대한 설명이며, OpenAI가 그것에 대해 어떤 벤치마크도 공개하지 않은 이유를 설명해 준다: 당신은 동료를 리더보드에서 벤치마킹하지 않고, 그가 무엇을 해내는지 지켜보고 Activity View를 확인한다.
• 입력으로 받는 것 — 한쪽에는 메시지, 작업 설명, 연결된 앱 데이터가 있고, 다른 쪽에는 텍스트, 이미지, 오디오, 비디오, 파일이 있습니다
• 산출하는 것 — 다른 소프트웨어 내부에서의 변경 사항으로, 규칙과 승인 게이트의 적용을 받고, 이후에 직접 처리하는 텍스트를 대상으로 함
• 실행 위치 — 자체 브라우저를 갖춘 OpenAI의 클라우드 컴퓨터로, 연결하지 않는 한 당신의 컴퓨터와 격리되어 있으며, Google의 서빙과 대비되고, API를 통해 당신이 원하는 곳에서 접근할 수 있음
• 컨텍스트 — dot에 대해서는 문서화되지 않음, 입력 1,048,576 토큰 및 출력 65,536 토큰과 대비
• 증거 — 공급업체 데모, 독립적인 벤치마크 없음, Artificial Analysis Intelligence Index 29.7 대비, GPQA Diamond 94.1, 장문맥 회상 82, Google과 독립적으로 기재됨
Gemini 3.1 Pro를 가질 만한 가치
이런 모델을 계속 곁에 두는 이유는 인지가 어렵고 대부분의 에이전트가 그것을 잘 못하기 때문이다. Gemini 3.1 Pro의 공개된 독립 프로파일은 이례적이다. GPQA Diamond에서 94.1은 최전선에 근접한 결과이고, 장문맥 회상에서 82는 우리가 나열한 모델 집합에서 두 번째로 좋은 수치이며, SciCode에서 58.7은 그 특정 순위표의 정상에 올려놓는다. 이 모델이 빛을 발하지 못하는 곳은 에이전트적 의사결정이다. τ²-Bench 점수 95.6은 존경할 만하지만, 은행 시스템을 상대로 한 다단계 도구 사용을 측정하는 τ-banking 부분은 21.4에 그친다. 이 모든 것은 우리 카탈로그에서 출처와 함께 기재된 제3자 측정치이며, 벤더가 내놓은 수치가 아니다. 그래서 이것들은 출시 발표 자료보다 더 가치가 있다.
요청당 비용 이야기의 나머지 절반은 모델이 무료가 아니라는 점이다. 이 모델은 현재의 프런티어 모델이 출시되기 몇 달 전인 2월에 프리뷰에 들어갔고, 저가 티어보다 높은 가격으로 책정되어 있다. 백만 토큰당 $2.00와 $12.00은 빽빽한 텍스트 한 페이지당 입력 비용 약 $0.0006에 해당하는데, 이는 아무것도 아닌 것처럼 보이다가 라이브러리 전체를 대상으로 비디오 인제스트를 실행하면 그때는 하나의 비용 항목이 된다. 비디오 프레임 한 장을 읽는 비용은 문단 하나를 읽는 비용과 같으며, 모델은 기꺼이 둘 모두에 대해 비용을 청구할 것이다.

변환을 거부하는 두 가지 비용 모델
dot의 비용은 공개되지 않은 허용량이 딸린 구독이다: 첫 번째 dot은 Pro 또는 Business Premium에 포함되며, 첫 달에는 확장 한도가 적용되고, 당신의 dot과의 대화는 ChatGPT 사용 한도를 차감하지 않으며, 두 번째 dot이나 추가 속도나 용량, 또는 완료된 작업에 대한 공개된 가격은 없다. CNBC의 기조연설 보도에 따르면 Sarah Friar는 새로운 $500 Pro 500 티어를 dot당 요금이 아니라 사용 허용량에 Ultrafast 모드를 더한 것으로 가격을 책정했으므로, OpenAI의 요금표에서 가장 비싼 요금제도 에이전트 작업 단위당 비용을 산출하지는 않는다.
Gemini 3.1 Pro는 텍스트가 아닌 부분까지 포함해 모든 것을 토큰으로 변환합니다. 오디오, 비디오, 이미지는 입력으로 청구되므로 작업 비용은 모델이 세상의 얼마나 많은 부분을 보게 했는지에 달려 있습니다 — 측정할 수 있기 때문에 유용한 특성이고, 청구서에서 가장 큰 숫자가 계획에 없던 항목인 경우가 많기 때문에 위험한 특성입니다. 모델 라우팅은 일반적이기보다 구체적인 방식으로 여기에 도움이 됩니다: 공급자 정가로 마크업 없이 단일 키 뒤에 있는 200개 이상의 모델을 통해, 값비싼 멀티모달 읽기와 저렴한 후속 작업이 동일한 파이프라인 안의 서로 다른 모델에 위치할 수 있고, Google의 요금 변경이 갱신 시점이 아니라 같은 날 귀하의 계정에 반영됩니다.

두 가지가 함께 작동하는 곳
자연스러운 짝은 조율하는 dot과 인지하는 멀티모달 모델이다. 작업이 도착하면 dot이 그것을 라우팅한다. 눈으로 보거나 귀로 들어야 하는 것은 무엇이든 구조화된 설명을 위해 Gemini 3.1 Pro로 가고, 그 설명은 다시 워크플로로 돌아가 스케줄이나 규칙이 그것에 작용할 수 있게 한다. dot은 추적을 처리하고, 모델은 읽기를 처리한다. 이렇게 분리하면 값비싼 모달리티 호출을 감사 가능하게 유지할 수 있는데, 사람들을 놀라게 하는 것이 바로 그 호출들이라서 이는 중요하다.
OrcaRouter에서는 이 모델이 google/gemini-3.1-pro-preview(으)로 라우팅되며, 나머지 카탈로그와 함께 공급자 정가 그대로 0% 마크업으로 제공되고, 업스트림 공급자 중 하나가 성능이 저하될 때의 자동 페일오버와 여러 모델을 단일 호출로 구성하기 위한 라우팅 DSL도 제공됩니다. 여기에 포함되지 않는 것이 무엇인지는 분명히 짚고 넘어갈 만합니다. dots는 우리 카탈로그에 없고, 이에 대한 엔드포인트도 없으며, 요청을 가리킬 모델 식별자도 존재하지 않습니다. 인지 계층을 직접 통제하고 싶다면 — 그리고 2월의 프리뷰 모델은 바로 통제해 둘 만한 의존성의 전형입니다 — 모델은 여러분의 엔드포인트 뒤에 두고, 에이전트는 여러분이 대여한 곳에 그대로 두는 것이 맞습니다.
문제에 어떤 동사가 필요하신가요?
작업이 무언가를 보거나 듣고 답을 만들어내는 일이라면, Gemini 3.1 Pro가 도구이며 dot은 잘못된 구매입니다. 작업이 당신이 직접 조종하지 않고 여러 애플리케이션에 걸쳐 무언가를 끝내는 일이라면, dot이 도구이며 어떤 양의 멀티모달 입력도 그것을 대체할 수 없습니다. 이걸 제대로 해내는 팀은 둘 다 운영하고 경계를 명확히 유지합니다: 인식은 측정할 수 있는 종량제 모델에, 실행은 취소할 수 있는 제품 뒤에 둡니다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
