
Gemini 3.1 Pro vs Qwen3.8-27B: 7개월 앞선 프리뷰 vs 다운로드할 수 있는 체크포인트
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026년 9월 18일, 벤더 자체 AI 개발자 포럼의 사용자들이 Gemini 3.1 Pro가 AI Studio 모델 선택기에서 사라졌다고 보고하기 시작했다. 유료 계정도 마찬가지였고, 캐시를 지우거나 시크릿 창을 써도 마찬가지였다. 이것이 "버그인지 의도된 것인지" 밝혀 달라는 스레드는 9월 21일까지도 살아 있었다. 디프리케이션 공지도, 마이그레이션 경로도, 직원 답변도 없다. 한편 Qwen3.8-27B는 연구소가 8월 14일 Apache 2.0으로 오픈소스화한 것으로, 이미 내려받은 사람에게서는 빼앗을 수 없다. 실재하긴 하지만 크지 않은 벤치마크 격차가 아니라 바로 이 비대칭성이 이 맞대결의 실제 관건이며, 비교 표가 두 모델을 나란히 놓고 있음에도 두 모델이 사실상 같은 자리를 두고 경쟁하는 것이 아닌 이유가 여기에 있다.
다음은 존재하는 수치들에 대한 정면 비교이며, 각 항목에는 레이블이 붙어 있습니다: 2026년 9월 23일에 수집된 캡처에서 나온 Artificial Analysis 수치, Alibaba 자체 모델 카드, Google의 출시 게시물, 그리고 저희 자체 라우팅 텔레메트리이며, 이들은 전반에 걸쳐 분리해 유지했습니다. 측정된 것이 없는 경우, 이 페이지는 추측하는 대신 그렇다고 밝힙니다.
이번 주에 무슨 일이 있었으며, 그것이 의미하는 것과 의미하지 않는 것
이 보고들은 구체적이며, 경쟁사 블로그가 아니라 Google 자체 포럼에서 나왔습니다. "Gemini 3.1 Pro가 2026-09-18부터 AI Studio에서 사라짐 — 버그인가 의도인가?"라는 제목의 스레드는 유료 사용자들이 아무런 공지 없이 모델을 사용할 수 없게 되었다는 점, Google One 지원팀이 관련 없는 문제 해결 단계를 제시했다는 점, 그리고 Google 상태 페이지에는 아무 문제가 없는 것으로 표시되었다는 점을 설명합니다. "Gemini 3.1 Pro Preview 모델, AI Studio에서 앱 빌드에 사용할 수 없음"이라는 두 번째 스레드에도 같은 불만이 모이고 있습니다. 여기에는 수개월 동안 이 프리뷰를 기반으로 코딩 어시스턴트를 구축해 온 사용자도 포함되는데, 그는 Flash가 자신의 코드베이스에서 "조잡한 결과물을 만든다"고 말합니다.
세 가지 솔직한 단서. 이것은 개발자 콘솔에서의 사라짐이지, 확인된 API 중단이 아닙니다: Gemini 3.1 Pro는 여전히 우리 자체 카탈로그에 등재되어 라우팅 가능하며, 지난 7일 동안 9,470만 토큰을 처리했습니다. 이는 사용자 제보입니다 — Google은 아무 말도 하지 않았으므로, Google 밖의 누구도 "조용한 지원 종료"와 "용량 문제"와 "콘솔 버그"를 구분할 수 없습니다. 그리고 이 모델이 프리뷰 상태로 2026년 2월 19일부터 — 7개월 동안, GA 날짜도 공개되지 않은 채 — 그 아래로 Flash 모델들을 연달아 출시해 온 Google을 고려하면, 이 시점은 결코 좋게 보이지 않습니다. 별개로, GitHub Copilot은 2026년 9월 1일자로 Gemini 3.1 Pro를 30일 사전 고지와 함께 지원 종료했는데, 이는 별개의 무관한 사건이지만 같은 방향을 가리킵니다: GA 약속이 없는 프리뷰 엔드포인트는 불안해할 자격이 있는 의존성입니다.
우리 쪽에서 나온 숫자 하나는 그 맥락 옆에 놓아둘 가치가 있습니다. 설명할 수 없기에, 그렇다고 말하는 편이 낫기 때문입니다. Gemini 3.1 Pro 카탈로그 항목에 대한 우리의 7일 텔레메트리에서는 80.5% 오류율이 나타납니다. 같은 날 아침에 확인한 인접 모델들 — Qwen3.8-Max, Claude Fable 5.1 — 은 5.9%와 6.9%에 있습니다. 그것이 포럼에서 보고되는 것과 같은 문제인지, 한 업스트림 제공자의 나쁜 한 주였는지, 아니면 계측 아티팩트인지는 알 수 없습니다. 모델에 대한 판결로 여기지 말고, 커밋하기 전에 카나리를 실행할 이유로 여기세요.
같은 잣대, 두 개의 다른 점수
이 부분은 대부분의 비교 페이지가 틀리는 부분이라 신중하게 다룰 가치가 있습니다. Artificial Analysis는 이 두 모델 모두를 Intelligence Index v4.3.2에서 평가합니다. 우리는 2026년 9월 23일에 두 페이지를 모두 캡처했고, 둘 다 동일한 리비전을 담고 있습니다 — 따라서 대부분의 모델 간 지수 주장과 달리, 이 주장은 동일 스냅샷에 기반하며 격차는 실제입니다.
• Qwen3.8-27B (xhigh) — 지능 지수 33.7
• Gemini 3.1 Pro Preview — 인텔리전스 지수 29.7
Qwen이 현재 잣대에서 4점 앞선다. 더 어려운 질문은 그것이 무엇을 의미하느냐인데, 그 잣대 자체가 올해 최소 세 번 바뀌었기 때문이다. 2월에 Artificial Analysis는 Gemini 3.1 Pro Preview를 "AI의 새로운 선두주자"라고 부르는 글을 발표했고, 이는 Claude Opus 4.6보다 4점 앞선 것이었으며, 당시 언론 보도는 당시 Index v4.0에서 57점을 기록했다고 전했다. v4.3.2에서는 29.7이다. Artificial Analysis는 2026년 9월 7일, v4.2가 나온 지 나흘 만에 v4.3을 발표했으며, 이 개정에서는 Terminal-Bench 2.1을 훨씬 더 어려운 66개 과제의 Terminal-Bench 4.0으로 교체하고, τ³-Banking을 AutomationBench-AA로 대체했다. Gemini 3.1 Pro의 2월 강점은 새 지수가 폐기하거나 가중치를 바꾼 평가들에 있었다. 그러니까 모델이 나빠진 게 아니라 시험이 더 어려워진 것이다. 하지만 오늘 모델을 고르는 사람이라면, 실제로 행동에 옮길 수 있는 것은 오늘의 숫자이며, 오늘의 숫자는 Qwen에 유리하다.
두 가지가 진정으로 갈라지는 지점
집계 점수는 차이의 형태를 가리며, 유용한 부분은 바로 그 형태다. 아래의 모든 수치는 두 모델에 대한 Artificial Analysis의 v4.3.2 페이지를 동일한 리비전에서 9월 23일에 캡처한 동일한 자료에서 나온 것이다.
• 추론 및 지식 — Gemini가 확실히 앞선다. GPQA Diamond 94.1 대 90.5; Humanity's Last Exam 47.0 대 33.9; SciCode 58.7 대 46.6; CritPt 17.7 대 5.4.
• 실제 업무 환경 과제 — Qwen이 앞서며, 그 격차도 큽니다. GDPval 정규화 45.4% 대 13.8%.
• 에이전트 기반 뱅킹 및 거래 — Qwen이 선두. τ-Banking 48.0 대 Gemini의 21.4.
• 일반 벤치마크에서의 에이전트형 도구 사용 — Qwen이 측정되지 않은 부분에서는 Gemini가 앞섭니다. Gemini의 τ²-Bench 95.6; Qwen3.8-27B 수치는 존재하지 않습니다.
• 터미널 작업 — 비슷하고, 새 벤치마크에서는 둘 다 형편없다. Terminal-Bench 2.1: Qwen 79.8, Gemini 73.8. Terminal-Bench 4.0: Qwen 5.6%, Gemini 4.0% — 둘 다 한 자릿수다.
• 캘리브레이션 — 양쪽 페이지를 통틀어 가장 뚜렷한 차이다. AA-Omniscience에서 Gemini는 정확도 54.9%, 환각률 50.9%로 31.9점을 기록한다. Qwen은 정확도 15.6%, 환각률 30.3%로 −10.0점을 기록한다. Gemini는 더 많이 알지만 절반이 넘는 경우 지어낸다. Qwen은 자주 답변을 거부하며, 실제로 답하는 것의 약 3분의 1에서 환각을 일으킨다.
• 긴 컨텍스트 — 긴 컨텍스트 회상에서는 완전히 동률로 각각 82.0. 멀티모달 긴 컨텍스트 회상에서는 Qwen 21.7% 대 Gemini 15.6%.
"측정되지 않음" 항목을 있는 그대로 읽어라. Gemini는 Qwen의 45.4%와 비교하여 발표된 GDPval-AA 정규화 수치가 없고, Qwen은 Gemini의 77.1, 53.8, 30.3과 비교할 τ²-Bench, IFBench, Terminal-Bench Hard 또는 ITBench-SRE 수치가 없다. 그 모든 빈칸은 요약 표가 조용히 승자를 심어놓았을 자리이다.

예산을 결정하는 분기: 인덱스 운영 비용은 동일
Qwen3.8-27B는 토큰당 비용이 훨씬 더 저렴합니다. Artificial Analysis가 발표하는 시장 수치에 따르면, 입력 100만 토큰당 $0.50, 출력 100만 토큰당 $3.00이며, 80% 캐시 할인과 7:2:1 혼합 비율로 $0.47입니다. Gemini 3.1 Pro Preview는 $2.00와 $12.00 — 입력 가격의 네 배, 출력 가격의 네 배 — 이며, 90% 캐시 할인과 $1.74의 혼합 요율을 갖습니다.
그다음 아무도 인쇄하지 않는 숫자: Artificial Analysis 자체 집계에 따르면 전체 Intelligence Index를 실행하는 비용은 다음과 같다: Gemini 3.1 Pro Preview의 경우 $1,310.21, Qwen3.8-27B의 경우 $1,335.92. Qwen이 실행 비용이 더 저렴한 게 아니다. 거기에 도달하는 데 시간이 더 오래 걸리기 때문에 아주 약간 더 비쌀 뿐이다. Qwen의 출력 청구서 가운데 $512.36은 추론 토큰이었고 실제 답변은 $82.51이었다. Gemini의 경우 $691.82가 추론, 답변은 $113.08이었다. 토큰당 가격은 요율이지 청구서가 아니다.
비교표가 빠뜨리는 두 가지 가격 사실이 더 있습니다. 첫째, Gemini 3.1 Pro의 가격은 요청별 입력 크기에 따라 계층이 나뉘는데, 입력 토큰 200K까지는 $2.00/$12.00이고, 그 이상은 $4.00/$18.00이며, 캐시 읽기는 $0.20에서 $0.40으로 두 배가 됩니다. 100만 토큰 컨텍스트 윈도우는 실제로 존재하지만, 그중 마지막 800,000개 토큰은 비용이 두 배입니다. 둘째, Qwen3.8-27B에 대한 자체 카탈로그 항목은 — block-FP8로 서빙되고 비전 타워는 전체 정밀도 — 입력 $0.40, 출력 $4.21로 기재되어 있는데, 이는 위의 시장 수치보다 입력은 저렴하고 출력은 더 비싸며, 캐시 토큰 요율은 아예 공개하지 않습니다. 제공자가 다르면 분할도 다릅니다. 실제로 청구될 요율을 확인하세요.
두 모델 모두 하나의 OrcaRouter 키를 통해 공급자 정가에 0% 마크업으로 접근할 수 있으므로, 공급업체의 가격 변경은 재가격 책정 주기를 거친 뒤가 아니라 같은 날 우리 쪽에 반영됩니다 — 이는 두 모델 중 하나가 200K 토큰에 티어 경계를 두고 있을 때 평소보다 더 중요합니다.
지연 시간: 가장 빠른 첫 토큰은 더 느린 모델의 것이다
이것은 전체 비교에서 가장 오해를 불러일으키는 숫자 쌍이며, 독자가 가장 잘못 판단해 행동할 가능성이 높은 항목입니다.
• 첫 청크까지 걸리는 시간 — Qwen 4.04초 vs Gemini 28.37초. Qwen이 일곱 배 더 빠른 것으로 보입니다.
• 실제 답변까지 걸린 시간 — Gemini 28.37초 vs Qwen 52.52초. Gemini가 약 1.8배 앞서는데, Qwen이 첫 번째 청크와 첫 번째 답변 토큰 사이에 48.48초를 사고하는 데 쓰기 때문이다.
• 출력 속도 — Gemini 116.5 토큰/초 vs Qwen 41.3. Gemini는 쓰기 시작하면 2.8배 더 빠르며, 이는 Artificial Analysis가 95.4 토큰/초로 제시한 비교 대상 중간값에 대비됩니다. Qwen의 자체 페이지에서는 이를 "눈에 띄게 느림"이라고 부릅니다.
제품이 사용자에게 첫 토큰을 스트리밍한다면, Qwen의 대표 지연 시간 수치는 스스로에게 한 번 하게 될 거짓말입니다. 제품이 완전한 답변을 기다린다면, Gemini가 더 빠른 모델입니다. 두 수치 모두 Artificial Analysis 측정값이며, 둘 다 Qwen의 xhigh 노력 설정에서 측정되었으며, 이는 모델 카드의 기본값입니다.
그 기본값은 실무자들 사이에서 현재도 유효한 불만이며, 모델 카드도 이를 절반쯤 인정한다. Qwen3.8-27B는 reasoning_effort 매개변수를 세 단계로 노출한다 — xhigh(기본값, "철저한 분석을 요구하는 복잡한 작업용"), medium, low. 9월까지 나온 커뮤니티 글들은 xhigh가 매우 긴 사고 단계를 만들어낸다고 보고하며, medium이나 low로 낮추고 추론 예산에 상한을 둘 것을 권한다. 알리바바 자체 카드도 멀티턴 에이전트 작업에서 노력을 낮추는 것이 "전체 작업 완료 시간을 항상 줄여주지는 않는다"고 경고한다 — 이는 모델 카드가 하기としては 솔직한 발언이며, 뻔한 해결책이 항상 해결책은 아니라는 경고다.
컨텍스트: 1M vs 262K, 그리고 실제로 들어가는 것
Gemini 3.1 Pro는 1,000,000토큰 컨텍스트 창을 갖추고 있으며 최대 출력은 65,536토큰입니다. Qwen3.8-27B는 기본적으로 262,144토큰을 지원하며 YaRN 스케일링으로 1,000,000까지 확장할 수 있습니다. 이 안에서는 별도 예산이 권장됩니다: 추론 콘텐츠는 최대 262,144, 최종 응답은 최대 131,072입니다.
솔직한 각주 두 가지. Artificial Analysis의 사양 표에는 Qwen의 윈도우가 256,000으로 나와 있지만, 자체 FAQ 텍스트에는 260K라고 되어 있고 모델 카드에는 262,144라고 되어 있습니다 — 이는 같은 숫자에 대한 반올림 차이일 뿐이지만, 모델 카드에 나온 값이므로 262,144를 인용하세요. 그리고 1M로의 확장은 스케일링 기법이지, 네이티브 백만 토큰 윈도우와 같은 것이 아닙니다: YaRN으로 확장된 모델에서 1M에서의 장문맥 회상은 82.0 AA-LCR 수치가 측정하는 대상이 아닙니다. Qwen3.8-27B에 대한 1M 컨텍스트 회상 점수를 발표한 사람은 아무도 없습니다. Gemini의 윈도우는 전체 길이에서 동작이 측정된 윈도우로, Qwen의 윈도우는 그것을 기반으로 설계하기 전에 직접 테스트해야 하는 윈도우로 취급하세요 — 그리고 200K 입력 토큰을 넘으면 Gemini의 가격이 두 배가 된다는 점을 기억하세요.
에이전트 작업 및 도구 호출
이 지점에서 맞대결은 진정으로 미결 상태이며, 억지로 승자를 만들어내는 것은 쉽지만 잘못된 일입니다. Qwen3.8-27B는 Gemini에 없는 측정된 에이전트 점수를 보유하고 있으며, 그 반대도 마찬가지입니다.
Qwen의 근거는 강력한 독립 지표 하나와 강력한 벤더 지표 하나에 달려 있다. 독립 지표는 τ-Banking의 48.0으로, Gemini의 21.4에 맞선 수치다 — 두 배 이상이며, 동일한 리비전에서, 은행 환경 내 다단계 도구 사용에 관한 벤치마크에서 나온 결과다. 벤더 지표는 Alibaba 자체 카드로, 여기에는 OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9, CoWorkBench 70.7, JobBench 33.4 및 Agents' Last Exam 20.4 Pass@1이 나열되어 있다. 이는 Alibaba의 평가로, 다른 누구도 재실행하지 않았으며, 독립적으로 측정된 GDPval 결과(정규화 45.4% 대 13.8%)가 같은 방향을 가리키는 바로 그 범주에 속한다.
Gemini의 강점은 비교에서 유일하게 높은 절대적 에이전틱 수치인 τ²-Bench 95.6을 보유하고 있다는 점이며, Qwen은 τ²-Bench 점수가 아예 없습니다. 또한 지시 따르기 부문에서 IFBench 77.1을 기록했는데, 이 역시 Qwen 쪽에는 빈칸입니다. 그리고 출시 5주 된 오픈 웨이트 릴리스에는 없는 7개월간의 프로덕션 실적을 갖추고 있습니다.
동점을 가르는 것은 점수가 아니라 당신의 토폴로지입니다. Qwen의 에이전트적 우위는 모델이 자신이 설계하지 않은, 크고 이미 존재하는 소프트웨어 시스템 내부에서 작동하는 벤치마크에서 측정됩니다. Gemini의 우위는 모델이 오랫동안 지침을 정확하게 따라야 하는 벤치마크에서 측정됩니다. 이 둘은 서로 다른 역량이며, 둘 다 실제로 존재합니다.

코딩
코딩도 같은 방식으로 갈리기 때문에, 여기서 "코드에 더 뛰어난 쪽은 어디인가"라는 질문에는 깔끔한 답이 없다. Gemini는 과학 컴퓨팅 쪽에서 앞선다 — SciCode 58.7 대 46.6 — 그리고 우리 카탈로그 페이지의 AA Coding Index 68.8은 Qwen의 68.1과 반올림 오차 범위 안에 있으며, 인용할 만한 어떤 신뢰구간보다도 훨씬 안쪽에 있다. 에이전트 터미널 작업에서는 더 오래된 벤치마크에서 둘이 비슷하고, Terminal-Bench 2.1에서 Qwen 79.8 대 Gemini 73.8이며, 더 새로운 벤치마크에서는 구분할 수 없는데, 둘 다 한 자릿수로 떨어진다.
알리바바의 카드는 훨씬 더 많은 수치를 주장한다 — SWE-bench Pro 61.7, LiveCodeBench v6 90.3, QwenSWEBench 79.0 — 하지만 이는 벤더가 보고한 수치이며, 카드에는 SWE-bench Pro와 QwenSWEBench가 Claude Code 하네스에서 실행되었다고 각주가 달려 있는데, 이는 경쟁사의 수치가 사용했을 하네스가 아니다. 안전하게 말할 수 있는 것은 제3자가 두 연구소의 모델 모두를 측정한 유일한 코딩 벤치마크에서 두 모델이 Terminal-Bench 2.1에서 4점, Terminal-Bench 4.0에서 1.6점 차이로 벌어져 있으며, 둘 다 더 어려운 쪽에서는 성능이 나쁘다는 것이다.
오픈 웨이트 대 프리뷰 엔드포인트
이것은 둘이 전혀 비교될 수 없는 축이며, 실질적으로 가장 큰 결과를 낳는 축이다.
Qwen3.8-27B는 Apache 2.0이고, 27B 덴스 파라미터, 64개 레이어를 갖추고 있으며, Gated DeltaNet 선형 어텐션과 전체 어텐션을 약 3:1 비율로 하이브리드한 구조입니다 — 262K 윈도우를 감당 가능한 서빙 비용으로 만들어 주는 설계죠. 실제로 작동합니다. 4비트로 양자화하면 대략 17GB에 들어가는데, 이는 소비자용 GPU 한 장 분량입니다. 5주 만에 그 주변으로 압축 생태계 전체가 형성되었습니다. Unsloth의 Dynamic V3 퀀트부터, Unsloth가 8GB에서 원래 정확도의 약 77%로 실행된다고 말하는 1비트 빌드를 포함해, 9월 중순의 PrismML Ternary Bonsai 2 27B에 이르기까지요. 미세 조정할 수 있고, 감사할 수 있으며, 네트워크를 뽑은 상태로 노트북에서 실행할 수도 있습니다.
Gemini 3.1 Pro는 비공개 프리뷰 엔드포인트로, 출시된 지 7개월이 되었고, GA 일정이 없으며, 프리뷰는 안정적인 릴리스의 안정성, 가용성, 지원을 갖추지 못할 수 있다고 명시적으로 경고하는 모델 카드가 있고, 이번 주 기준으로는 조용히 개발자 콘솔에서 빠져나간 것으로 보인다. 다운로드할 수 없고, 버전을 고정할 수 없으며, 스스로에게 장애 조치할 수도 없다.
판결이 아니라 솔직한 라우팅 답을 원한다면: 공개 체크포인트의 존재가 바로 Gemini 의존성을 버틸 수 있게 해주는 것입니다. Qwen3.8-27B를 로컬 또는 자체 호스팅 경로 뒤에 폴백으로 두고, Gemini 3.1 Pro는 측정 가능하게 더 뛰어난 추론 중심 작업을 위해 주 경로에 유지하세요. 그리고 둘 다 자동 장애 조치가 있는 하나의 엔드포인트 뒤에 두어서, 다른 사람의 콘솔에서 조용히 사라지는 일이 사용자가 보는 장애가 아니라 라우팅 계층이 흡수하는 인시던트가 되게 하세요. 이것은 제품 홍보가 아닙니다 — 이번 주 뉴스로 당신의 주말을 날리지 않는 유일한 구성입니다.
다음의 경우 Gemini 3.1 Pro를 선택하세요
• 당신의 가장 어려운 작업은 장기적인 도구 사용이 아니라 지식 집약적 추론입니다 — 이는 GPQA Diamond에서 94.1 대 90.5, Humanity's Last Exam에서 47.0 대 33.9, SciCode에서 58.7 대 46.6, CritPt에서 17.7 대 5.4로 앞섭니다.
• 진정으로 긴 입력이 필요합니다. 200K 입력 토큰을 넘으면 가격이 두 배로 오르는 점을 감수할 수 있다면, 리콜 동작을 장시간 테스트한 실측 100만 토큰 윈도우는 기법으로 확장한 262K 윈도우를 능가합니다.
• 완전한 답변까지 걸리는 시간이 첫 토큰까지 걸리는 시간보다 더 중요하며, 41.3이 아니라 116.5 토큰/초를 원한다.
• 오늘날 폭넓은 멀티모달리티가 필요합니다: Qwen의 텍스트, 이미지, 비디오에 대응하는 오디오, 파일, 이미지, 텍스트, 비디오 입력.
• {{1}}귀하는{{/1}} 미리보기 위험을 감수할 의향이 있으며, {{2}}직접{{/2}} 통제할 수 있는 대체 수단이 있습니다.
다음의 경우 Qwen3.8-27B를 선택하세요
• 당신의 에이전트는 대규모 기존 시스템 내부에서 작동합니다 — τ-Banking 48.0 대 21.4, GDPval 45.4% 대 13.8%(정규화)는 이 비교 전체에서 단일 모델이 거둔 가장 큰 두 가지 우위입니다.
• 답변은 자신감 있기보다 정직해야 합니다. Gemini의 50.9%에 대비되는 30.3%의 환각률은 다른 종류의 제품입니다.
• 라이선스 또는 데이터 상주 요건으로 인해 폐쇄형 API를 사용할 수 없거나, 자체 데이터로 파인튜닝해야 하는 경우.
• Gemini의 4분의 1에 해당하는 토큰당 청구액을 원하고, 그 차액을 사고 토큰에 쓰겠다는 점을 받아들입니다 — 인덱스는 두 곳에서 실행하는 비용이 동일합니다.
• 당신은 reasoning_effort를 xhigh 기본값에서 그대로 출시하기보다는 낮출 준비가 되어 있습니다.
우리가 확인할 수 없었던 것
기록을 남기자면, 그리고 비교 페이지는 빈칸만큼만 가치가 있으므로: Qwen3.8-27B의 추론 노력을 낮춘 설정에 대한 독립 평가는 공개된 적이 없습니다. 따라서 속도 대 품질 트레이드오프는 중간 및 낮음에서 측정되지 않았습니다. YaRN으로 확장된 1M 구성에 대한 장문맥 회상 점수는 존재하지 않습니다. Gemini 3.1 Pro에는 공개된 GDPval-AA 정규화 점수가 없고, Qwen3.8-27B에는 τ²-Bench, IFBench 또는 ITBench-SRE에 대한 점수가 없습니다. 그리고 Google을 포함해 누구도 Gemini 3.1 Pro가 9월 18일에 AI Studio 선택기에서 왜 사라졌는지 말하지 않았습니다. 위 항목 중 하나라도 바뀌면 이 페이지를 업데이트하겠습니다.

이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
