
Union Alpha 대 Gemini 3.8 Flash: 하나는 점수를 가졌고, 다른 하나는 주장을 가졌다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha와 Gemini 3.8 Flash는 완전히 다른 두 가지 입증 수준으로 전달된 동일한 홍보 문구다. Union Alpha의 운영사는 이를 두고 "광범위한 범용 작업 전반에서 프런티어급 성능"을 갖췄다고 설명하면서도, 벤치마크도, 파라미터 수도, 라이선스도, 이름도 공개하지 않았다. Gemini 3.8 Flash는 날짜가 명시된 평가표, Artificial Analysis Intelligence Index, 독립 테스터들이 제공한 작업별 비용 수치, 그리고 2027년까지 이어지는 문서화된 가격표를 함께 내놓으며 출시되었다. 가격이 아닌 다른 무엇을 기준으로 둘 중 하나를 고른다면, 당신은 확인할 수 있는 숫자와 확인할 수 없는 문장 사이에서 고르는 것이다.
나란히, 논쟁 전에
• 컨텍스트 윈도우 — Union Alpha 262,144 토큰 vs Gemini 3.8 Flash 1,048,576 토큰.
• 최대 출력 — 131,072 토큰 대 65,536 토큰. 이 항목에서는 Union Alpha가 승리하며, 이것이 Union Alpha가 우위를 점하는 유일한 구조적 축이다.
• 입력 — 둘 다 텍스트와 이미지를 지원하지만, Gemini 3.8 Flash는 비디오, 오디오, 파일도 추가로 지원합니다.
• 가격 — Union Alpha는 프리뷰 기간 동안 $0인 반면, Gemini 3.8 Flash는 입력 $0.75/M, 출력 $3.75/M, 캐시 입력 $0.075/M이며, 2027년 1월 1일에는 $1.50/$7.50로 두 배가 됩니다.
• 추론 제어 — Union Alpha에서는 전혀 제공되지 않는 반면, Gemini 3.8 Flash에서는 품질과 비용을 모두 직접 좌우하는 사고 수준이 제공됩니다.
• 공개된 평가 — Union Alpha 운영사 측 자료는 없음 vs Gemini 3.8 Flash에 관한 날짜가 명시된 전체 표.
• 출처 — 익명 운영자, 가중치 미공개 vs Gemini 3.8 Flash의 날짜가 명시된 릴리스 및 문서화된 계보.

Gemini 3.8 Flash의 수치가 실제로 말하는 것
Gemini 3.8 Flash는 2026년 9월 2일에 출시되었다 — 약 6주 만의 Google의 세 번째 Flash 릴리스이며, 이는 이 모델의 서사에서 돌파구보다 릴리스 케이던스가 얼마나 큰 부분을 차지하는지를 말해준다. 공개된 평가자 표는 artificialanalysis.ai와 deepmind.google 양쪽에 출처를 표기하고 있으므로, 이를 깔끔한 제3자 감사라기보다 독립 수치와 벤더 수치가 섞인 것으로 읽어야 한다.
• AA Coding — 76.3, 정말로 뛰어난 코딩 점수입니다.
• AA Intelligence — 41.2. Artificial Analysis는 높은 추론 노력 설정에서 Intelligence Index 59를 별도로 보고하므로, 이 숫자는 설정에 따라 크게 달라집니다. 설정을 함께 밝히지 않으면 그 숫자는 의미가 없습니다.
• GPQA Diamond — 95.3, 이 비교에서 단연 가장 높은 단일 수치.
• HLE-Verified — 54.9, 일반 Humanity's Last Exam은 47.8.
• Terminal-Bench 2.1 — 구글 자체 표에서 89.4점으로, Claude Opus 5의 89.1점을 근소하게 앞선다.
• 장문맥 회상 — 81.3; SciCode 56.6; tau_banking 44.9.
• 관측된 처리량 — 최근 7일 기간 동안 초당 323개의 출력 토큰, 0.63%의 오류율, 3.46초의 첫 토큰 도달 시간 중앙값, 498.5M 토큰의 측정된 트래픽.
약점도 강점만큼이나 잘 문서화되어 있다. Terminal-Bench 4.0에서는 Claude Opus 5의 51.8점에 맞서 19.1점을 기록한다. OSWorld 2.0에서는 75.4%에 맞서 59.0%를 해낸다. GDPVal-AA v2에서는 1824에 뒤처지는 1545 Elo에 머문다. Gemini 3.8 Flash는 특정 범위의 작업에서는 뛰어나지만, 가장 어려운 범용 에이전트 평가에서는 절벽처럼 성능이 떨어진다 — 이는 바로 공개된 표를 통해 확인할 수 있는 바로 그런 형태다.
사람들을 당황하게 만드는 가격 책정의 반전
Google은 Gemini 3.7 Flash 대비 토큰당 가격을 그대로 두었다. 그런데도 청구서는 올랐다.
모델은 더 열심히 작동합니다. 추론 단계가 더 많아지고, 도구 호출도 더 반복적으로 이루어집니다. Artificial Analysis의 독립 테스트에 따르면 작업당 출력 토큰이 약 30% 더 많고, 작업당 비용은 3.7 Flash보다 약 40% 더 높았습니다. 높은 추론 수준에서는 작업당 약 $0.58에 달하며, 중간 수준은 약 $0.41, 낮은 수준은 약 $0.24입니다.
예산을 짜는 사람이라면 누구에게나 이 비교에서 가장 유용한 단 하나의 사실이며, 이는 이 두 모델을 훨씬 넘어 일반화됩니다: 단가와 작업당 비용은 서로 다른 숫자이고, 가격 페이지에 나타나는 것은 그중 하나뿐입니다. Google이 3.7 Flash를 더 저렴한 옵션으로 계속 제공해 온 것은 이러한 변화를 은연중에 인정한 것입니다.
Union Alpha가 그 대신 제공하는 것
Union Alpha는 2026년 9월 16일 서드파티 카탈로그에 등장했으며 OrcaRouter의 무료 티어에서 실행됩니다. 이는 익명으로 — 연구소도, 가중치도, 라이선스도, 지식 컷오프도 없습니다 — 약 일주일이라는 명시된 기간 동안 무료로 제공되고, 속도 제한이 걸려 있으며, 프리뷰 이후의 가격은 발표되지 않았습니다.
그 엔드포인트는 출처가 검증되지 않는 경우에도 검증할 수 있다: 262,144토큰 컨텍스트, 131,072토큰 최대 출력, 텍스트 및 이미지 입력과 텍스트 전용 출력, 도구 호출 및 JSON 출력, temperature, top_p, max_tokens, 그리고 어떠한 종류의 추론 제어도 없음. 도구 선택은 사실상 "auto"만 지원한다.
독립적인 측정은 정확히 하나뿐입니다. SMF Clearinghouse는 추론을 끈 상태에서 157개의 Official A 테스트를 실행해 136/157점을 기록했습니다 — 86.6%, 오류 0개, 26개 중 10위. 추론은 30/30으로 완벽했고, 도구는 2/2, 코딩은 26/30, 수학은 24/30이었습니다. 작문은 2/5에 그쳤습니다.
그것은 나쁜 결과가 아니다. 단지 비교 가능한 결과가 아닐 뿐이다. Official A는 157개 테스트로 구성된 폭넓은 범용 스위트이고, AA Coding과 GPQA Diamond는 서로 다른 난이도에서 서로 다른 것을 측정하는 서로 다른 도구다. 136/157을 GPQA Diamond의 95.3 옆에 놓고 승자를 선언하는 것은 벤더 수치를 무용지물로 만드는 바로 그런 종류의 세탁일 것이다.


아무도 실제로 끝낼 수 없는 비용 비교
다음은 예제 풀이이며, 의도적으로 불완전합니다.
한 달에 1,000번 실행하는 작업이 있다고 해 보세요. Gemini 3.8 Flash에서 높은 추론 수준으로 실행할 경우, 공개된 작업당 약 $0.58라는 수치는 이를 한 달 약 $580에 해당하게 합니다. 이는 측정된 토큰 소비량을 바탕으로 산출된, 실제적이고 정당화할 수 있는 숫자입니다.
Union Alpha에서는 그 동일한 1,000개 작업의 비용이 오늘 $0입니다. 3주 후에 드는 비용은 알 수 없습니다. 프리뷰 이후 가격이 존재하지 않기 때문입니다. 신뢰성 측면의 비용도 알 수 없습니다. 이 모델은 속도 제한이 걸려 있고, 대체 제공자 없이 단일 엔드포인트에서 실행되며, 아무도 공개하지 않은 한도를 넘으면 HTTP 429로 응답하기 때문입니다.
그러니 솔직한 답은, Union Alpha가 이용 가능한 유일한 비용 비교에서는 이기지만, 그 비용을 예측할 능력은 잃는다는 것이다. 일회성 비교 테스트라면 그것으로 괜찮다. 하지만 예산 항목으로는 숫자가 아니다 — URL이 달린 희망일 뿐이다.
각자가 속한 곳
Gemini 3.8 Flash는 측정 가능한 하한이 필요한 모든 곳, 즉 비디오나 오디오 입력을 다루는 장문 컨텍스트 문서 작업, AA 코딩 점수 76.3이 적절한 지표가 되는 코딩 작업, 그리고 예산이 걸린 모든 워크로드에 어울립니다. 비용을 지출하기 전에 미리 계산할 수 있고, 2027년 1월 1일에는 그 비용이 두 배가 된다는 것을 알고 있기 때문입니다.
Union Alpha는 탐색용 슬롯에 두는 게 맞다 — 출력 상한이 Gemini의 두 배인 비전 지원 256K 모델을, 엔드포인트가 사라져도 손해 볼 게 없는 작업에 시험해 보는 것이다.
이 둘을 두 개의 통합 대신 하나의 엔드포인트 뒤에서 실행하는 이유는 이 비교가 계속해서 형태를 바꿀 것이기 때문입니다. 라우팅 DSL을 사용하면 둘을 하나의 호출로 구성할 수 있습니다 — 측정 경로로서 Gemini 3.8 Flash, 실험 분기로서 Union Alpha — 무료 기간이 끝나거나 Google의 도입 가격이 만료될 때 다시 검토하고 싶어질 결정을 하드코딩하는 대신에요. 그 두 날짜 모두 멀지 않았고, 둘 다 계산을 바꿔 놓을 것입니다.
무엇이 그것을 해결할까요?
Gemini 3.8 Flash도 함께 올라 있는 리더보드에 Union Alpha의 날짜가 명시된 항목 하나. 그것이 바로 유일하게 빠져 있는 조각이다. 그때까지 방어 가능한 입장은 "Union Alpha는 Gemini 3.8 Flash만큼 좋다"가 아니라 "Union Alpha는 일주일 동안 무료이며, 아무도 그것을 Google이 공개한 그 어떤 것과도 비교해 측정하지 않았다"이다. 그 둘은 아주 다른 문장이며, 현재 참인 것은 그중 하나뿐이다.
이 쌍에서 측정된 쪽은 여기에 문서화되어 있습니다: Gemini 3.8 Flash 모델 페이지에는 $0.75/$3.75 요금, 90% 캐시 입력 할인, 그리고 장문 보고서 작업을 좌우하는 65,536토큰 출력 상한이 나와 있습니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
