Gemini 3.5 Flash-Lite vs Qwen 3.8: 저렴한 워크호스 vs 2.4T 플래그십
Guides & Insights

Gemini 3.5 Flash-Lite vs Qwen 3.8: 저렴한 워크호스 vs 2.4T 플래그십

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 비교가 처음 작성되었을 당시, 그 결과는 특이한 방식으로 한쪽으로 치우쳐 있었습니다: Gemini 3.5 Flash-Lite는 실제로 구매할 수 있는 제품이었고, Qwen 3.8은 가격도, 벤치마크도, 가중치도 없는 게이트된 프리뷰였습니다. 비교할 만한 것이 거의 없었습니다.

더 이상 그런 상황이 아닙니다. Qwen3.8-Max는 2026년 8월 3일 일반 공급(GA)에 도달했으며, 백만 토큰당 $2/$6의 공개 요금표, OpenAI 및 DashScope 호환 엔드포인트, 전체 벤치마크 표를 갖추고 있습니다. 셀프 서비스가 가능하고, 예산을 책정할 수 있으며, OrcaRouter를 포함해 실제 운영 중입니다. 따라서 이 글은 처음부터 다시 작성되었습니다. 오늘날의 정직한 비교는 '출시된 모델 대 유령'이 아니기 때문입니다. 이는 진정한 등급 비교, 즉 Google의 가장 저렴한 고처리량 주력 모델과 Alibaba의 최대 플래그십 모델 간의 비교입니다.

빌더를 위한 참고 사항: {{1}}이 둘은 비용 곡선의 양끝에 위치합니다{{/1}}. {{2}}따라서 올바른 질문은 워크로드가 어느 티어에 속하는지입니다{{/2}}. OrcaRouter는 하나의 OpenAI 호환 엔드포인트 뒤에서 200개 이상의 모델을 제공하므로, 두 개의 SDK를 연동하지 않고도 동일한 작업에서 두 모델을 모두 테스트할 수 있습니다.

TL;DR 결론. 이 모델들은 실제로 경쟁하는 것이 아니라 서로 다른 질문에 대한 답입니다. Flash-Lite는 효율성 모델입니다: Artificial Analysis Index 36, $0.30 / $2.50 1M당 약 490 tokens/sec, 일반적으로 사용 가능하며, 무시할 수 있는 비용으로 모든 요청에서 실행되도록 설계되었습니다. Qwen3.8-Max는 플래그십 모델로, 약 2.4조 개의 파라미터, 1M 토큰 고정 요금 컨텍스트, 네이티브 이미지 및 비디오 입력, 그리고 자체 보고된 최첨단 수준의 점수(GPQA Diamond 92.6, Terminal-Bench 2.1 86.6)를 갖추고 있으며, 가격은 $2 / $6로 Flash-Lite 입력 요금의 6.7배입니다. Flash-Lite는 대량 분류, 라우팅, 추출 작업에 적합한 기본 선택입니다. Qwen3.8-Max는 작업에 실제로 최첨단 추론, 백만 토큰 컨텍스트, 또는 비텍스트 입력이 필요할 때 사용하는 모델입니다. 변하지 않은 한 가지 주의사항: Qwen은 여전히 독립적인 벤치마크 점수가 없습니다.

주요 시사점

Qwen 3.8이 이제 일반 공개되었습니다 — 2026년 8월 3일 기준으로 가격, 셀프 서비스 액세스, 벤치마크 테이블이 공개되었습니다. 접근이 제한되고 예산 책정이 불가능한 프리뷰라는 기존의 틀은 더 이상 유효하지 않습니다.

Flash-Lite는 훨씬 저렴합니다: $0.30 / $2.50 1M당 Qwen의 $2 / $6 — 입력 약 6.7×, 출력 약 2.4×.

Flash-Lite는 훨씬 빠릅니다: 대략 490 tokens/sec로, 높은 처리량 작업용으로 설계되었습니다. Qwen3.8-Max는 OrcaRouter의 7일 텔레메트리에서 p50 첫 토큰 시간이 1.64초로 나타나지만, 크고 철저한 모델입니다.

Flash-Lite는 유일하게 감사된 점수를 보유하고 있습니다: Artificial Analysis Index 36. Qwen3.8-Max는 여전히 점수가 매겨지지 않은 상태입니다.모든 독립 평가자로부터, Alibaba가 이제 자체 수치를 발표함에도 불구하고,

Qwen은 능력 면에서 압도적으로 승리합니다: 일괄 청구되는 1M 토큰 컨텍스트 (장기 프롬프트 추가 요금 없음), 텍스트/이미지/비디오 입력, 문서 파싱을 위한 OmniDocBench 1.5 92.1을 제공합니다. Flash-Lite는 작은 효율성 모델입니다.

오픈 가중치: Qwen의 것은 이번 주 내로 제공될 예정입니다 (아직 라이선스 없음). 게다가 Qwen3.8-27B는 약 17GB의 VRAM에서 실행되는 것으로 알려졌습니다. Flash-Lite는 영구적으로 폐쇄되었습니다.

정확성 참고: 모든 Qwen3.8-Max 품질 수치는 Alibaba가 보고한 것이며 제3자에 의해 검증되지 않았습니다. Gemini 3.5 Flash-Lite 수치는 Artificial Analysis에서 제공한 것입니다. Qwen 가격은 Alibaba Model Studio의 GA 요금표를 기준으로 하며, 이 문서의 이전 버전에 설명된 프리뷰 기간 액세스를 대체합니다.

사양과 가격, 나란히

• 제조사 / 상태 — Flash-Lite: Google; 일반 제공; Qwen3.8-Max: Alibaba; GA (2026년 8월 3일)

• 포지셔닝 — Flash-Lite: 저비용·고처리량 효율 등급; Qwen3.8-Max: 플래그십/프런티어 지향

• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: 아직 채점되지 않음

• 공급업체 보고 점수 — Flash-Lite: 순위는 제3자 측정; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (모두 알리바바 보고)

• 가격 (1M당, 입력/출력) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, 1M 컨텍스트 전체에 동일하게 적용되며, 캐시된 입력의 경우 $0.25

• 속도 — Flash-Lite: ~490 tok/sec (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1.64s (OrcaRouter 7일 텔레메트리)

• 컨텍스트 — Flash-Lite: 효율 계층 컨텍스트; Qwen3.8-Max: 1M 토큰 (추론 시 983,616; 최대 출력 131,072)

• 모달리티 — Flash-Lite: 텍스트 중심 효율 모델; Qwen3.8-Max: 텍스트, 이미지, 비디오 입력 → 텍스트 출력

• 가중치 — Flash-Lite: 비공개, API 전용; Qwen3.8-Max: 이번 주 안에 제공 예정, 아직 라이선스 없음

• 지금 이용 가능 — Flash-Lite: 표준 API, 셀프 서비스; Qwen3.8-Max: 표준 API, 셀프 서비스 (Model Studio, DashScope, OrcaRouter)

이런 식으로 나열해 보면, 그 결과는 이전과 완전히 달라진다. Qwen의 열은 더 이상 비어 있지 않다. 가득 차 있으며 여러 행에서는 더 강한 항목이다. 기존의 '검증된 제품 대 유망주'라는 구도를 대체하는 것은 명확한 등급 격차다: Flash-Lite는 입력 비용이 약 6.7배 저렴하고 처리량 기준으로는 약 13배 빠른 반면, Qwen은 백만 토큰 멀티모달 컨텍스트와 최첨단 수준이라고 주장되는 추론 성능을 제공한다. 이 둘은 모두 정당한 제품이며, 단지 수행하는 역할이 다를 뿐이다.

기존의 주의가 여전히 적용되는 유일한 행은 벤치마크 라인입니다. Flash-Lite의 Index 36은 공개 리더보드에서 Artificial Analysis가 측정했습니다. GPQA Diamond 92.6, Terminal-Bench 86.6 등 모든 Qwen 수치는 Alibaba가 자체 하네스로 생성했습니다. 이는 아무것도 공개하지 않는 것보다 확실히 개선된 것이지만, 제3자 검증은 아니며, 연구소는 자신들이 이긴 벤치마크만 공개합니다.

Index 36 대 채점되지 않은 플래그십: 솔직히 읽자면

Flash-Lite의 Index 36과 Qwen의 GPQA Diamond 92.6을 맞세워 압도적 승리를 선언하고 싶은 유혹이 든다. 하지만 그것은 두 가지 면에서 범주 오류일 것이다.

먼저, Artificial Analysis Intelligence Index는 여러 작업에 걸친 종합 지표이고, GPQA Diamond는 단일 대학원 수준 과학 시험입니다. 둘은 같은 척도가 아니므로 서로 뺄 수 없습니다.

둘째로, 더 중요하게는, Flash-Lite는 높은 점수를 얻도록 설계된 적이 없습니다. 인덱스 36은 효율성 모델이 보여주는 전형적인 수치입니다. Google의 엔지니어링 목표는 모든 수신 요청 앞에 배치할 수 있을 만큼 저렴하고 빠른 모델을 만드는 것이었습니다 — 티켓 라우팅, 분류, 추출, 대량 요약 — 프런티어 모델을 사용하는 것이 경제적으로 비합리적인 영역에서 말이죠. 추론 능력의 최고치를 기준으로 2.4T 플래그십 모델과 비교한다면, 그것이 왜 존재하는지를 놓치는 것입니다.

우리가 말할 수 있는 것은 더 좁고 더 유용하다. Qwen3.8-Max는 훨씬 더 유능한 모델일 가능성이 매우 높다 — 자체 보고된 수치는 Index-36 모델이 만들어낼 수치를 훨씬 웃돌며, 전작의 40.7에서 73.5로의 FrontierSWE 상승은 실제 진전을 시사한다. 하지만 "매우 유력하다"는 것은 여전히 추론일 뿐이다. 독립적인 평가자가 이를 평가한 적이 없기 때문이다. 맥락을 위해 말하자면, 전작 Qwen3.7-Max가 기록한 점수는 46이며, 이는 AA Index에서의 점수이다 — Flash-Lite의 36보다 높지만, 최첨단에는 훨씬 못 미치므로, 알리바바가 암시하는 세대 도약은 크고 검증되지 않았다.

실질적인 결과: 당신의 작업이 Flash-Lite가 이미 올바르게 완료하는 작업이라면, Qwen의 더 높은 상한선은 당신에게 아무 가치가 없으며, 그에 대해 6.7배를 지불하게 될 것입니다. 상한선은 Flash-Lite가 실제로 실패할 때에만 중요합니다.

실제 비용: 숫자로 보는 등급 격차

대용량 분류 작업을 예로 들어보겠습니다: 입력 2,000토큰, 출력 200토큰, 하루 500,000회 실행 — 현실적인 지원 트리아지 또는 콘텐츠 라우팅 형태입니다.

Flash-Lite: 호출당 0.002M × $0.30 = $0.0006, 더하기 0.0002M × $2.50 = $0.0005. ≈ $0.0011 호출당 → ~$550/일.

Qwen3.8-Max: 호출당 0.002M × $2 = $0.004, 여기에 0.0002M × $6 = $0.0012를 더함. 호출당 ≈ $0.0052 → 하루 약 $2,600.

• 월간: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — 동일한 작업량에 대해 $61,500 차이.

그 규모에서는 티어 선택이 시스템에서 가장 큰 단일 비용 항목이며, 효율성 모델이 처리하는 작업에 플래그십을 도입하는 것은 정당화하기 매우 어렵습니다. 이것이 바로 Flash-Lite가 존재하는 시나리오입니다.

이제 반대로 해보자. 긴 문서 작업을 하나 들어보자: 하루 200회, 컨텍스트 600,000토큰, 출력 5,000토큰.

Qwen3.8-Max: 0.6M × $2 = $1.20, 더하기 0.005M × $6 = $0.03. 호출당 ≈ $1.23, 긴 프롬프트 할증 없이 — 그리고 대략 $0.18, 컨텍스트가 $0.25/1M로 캐시된 경우입니다.

Flash-Lite는 이 형태에는 전혀 가격을 책정할 수 없습니다. 600,000토큰 단일 호출 컨텍스트는 효율성 등급 모델이 담도록 설계된 것이 아니기 때문입니다.

그래서 답은 워크로드 형태에 따라 완전히 뒤집히며, 이것이 진짜 교훈입니다. Flash-Lite는 대용량 단문맥 작업에서 압도적인 차이로 승리합니다. Qwen은 백만 토큰 또는 비텍스트 입력이 필요한 모든 작업에서 승리하는데, 여기서 Flash-Lite는 더 저렴한 옵션이 아니라 아예 선택지가 아닙니다.

시나리오: 어느 등급이 적합한가

대규모 지원 티켓 분류 및 라우팅.Flash-Lite, 당연하죠. 분류에는 Index 36이면 충분하고, 호출당 약 $0.0011이므로 모든 티켓에 실행할 수 있습니다. 모호한 소수 케이스만 더 큰 모델로 에스컬레이션하면 됩니다.

전체 문서 계약 또는 제출 분석. Qwen3.8-Max. 1M 고정 요금 컨텍스트는 400페이지 문서가 추가 요금이나 청크 분할 없이 한 번의 호출로 처리된다는 것을 의미하며, 자체 보고된 OmniDocBench 1.5 92.1은 정확히 이 작업을 대상으로 합니다.

스크린샷, 차트 또는 비디오 파이프라인. 기본적으로 Qwen3.8-Max는 이미지 및 비디오 입력을 허용하며 실제 GUI 구동에서 OSWorld-Verified 86.1을 기록합니다. Flash-Lite는 비텍스트 입력의 후보가 아닙니다.

에이전틱 코딩. 주장된 수치(Terminal-Bench 2.1 86.6, FrontierSWE 73.5)에서 Qwen3.8-Max는, 어느 것도 독립적으로 검증되지 않았고 자체 보고한 가장 약한 점수가 명령 수행(instruction-following) 분야의 IFBench 82.8이라는 단서가 붙습니다. 이는 각 단계의 출력을 파싱하는 파이프라인에 실질적인 위험입니다.

2계층 아키텍처. 종종 정답은 둘 다입니다. 모든 요청에 대한 저렴한 1차 처리로 Flash-Lite를, 백만 개의 토큰, 이미지, 또는 진정한 추론이 필요한 소수의 요청에 대한 에스컬레이션 경로로 Qwen3.8-Max를 사용하는 것입니다. 이 패턴은 Flash-Lite의 비용 이점 대부분을 확보하면서도 최첨단 옵션을 유지합니다.

자체 호스팅과 개방성

Flash-Lite는 폐쇄되었으며 영구적으로 API 전용입니다 — 자체 호스팅 경로는 없습니다.

Qwen3.8-Max의 가중치는 이번 주 안에 공개될 예정이지만, 플래그십 모델은 현실적인 목표가 아닙니다. 대략 4비트 기준 1.2TB는 H200당 약 141GB와 비교하면 최상위 가속기 8개 이상이 필요하다는 뜻입니다. 알리바바는 아직 활성 파라미터 수를 공개하지 않았으므로, 그 지출로 얻을 수 있는 처리량은 모델링할 수 없습니다. 또한 라이선스 텍스트도 아직 없어 상업적 이용 가능성은 공식적으로 결정되지 않은 상태입니다.

동시에 발표된 Qwen3.8-27B는 온프레미스 계획에 실제로 중요한 릴리스입니다. 또한 오픈 가중치(open-weights)로 전환되었으며 약 17GB의 VRAM에서 실행되는 것으로 알려져 있어, 진정한 자체 호스팅 옵션입니다. 특히 2.4T 플래그십보다 Flash-Lite의 효율성 틈새에 훨씬 더 가까운 경쟁자입니다.

자주 묻는 질문

오늘 Qwen 3.8을 사용할 수 있나요?

네. Qwen3.8-Max는 2026년 8월 3일에 일반 공개(GA)에 도달했으며, 1M 토큰당 $2 / $6의 공개 가격과 OpenAI 및 DashScope 호환 엔드포인트를 제공합니다. Alibaba Model Studio, DashScope, OrcaRouter를 통해 셀프 서비스로 이용할 수 있습니다. 이 문서의 이전 버전에서는 제한된 미리보기로 설명했지만, 이제 그 내용은 더 이상 유효하지 않습니다.

어느 게 더 싸요?

Gemini 3.5 Flash-Lite가 큰 격차로 앞섭니다: Qwen3.8-Max의 $2 / $6 대비 1M당 $0.30 / $2.50 — 입력은 약 6.7배, 출력은 2.4배 더 저렴합니다. 대량의 단문 컨텍스트 작업에서는 이 차이가 다른 모든 고려 사항을 압도합니다.

어느 것이 더 좋아요?

그것들은 서로 다른 등급입니다. Flash-Lite는 유일하게 감사된 점수(AA Index 36)를 보유하고 있지만, 저렴한 처리량을 위해 만들어졌지 추론을 위해 만들어진 것이 아닙니다. Qwen3.8-Max는 훨씬 더 유능할 가능성이 높습니다. 자체 보고한 GPQA Diamond 92.6과 Terminal-Bench 2.1 86.6은 최첨단 수준의 형태를 띠지만, 독립적인 벤치마크가 없으므로 이는 측정된 결과라기보다 추론에 불과합니다.

어느 것이 더 빠릅니까?

Flash-Lite, 압도적으로요. Artificial Analysis는 약 490 tokens/sec로 측정하는데, 이것이 바로 효율성 계층 설계의 목적입니다. Qwen3.8-Max는 OrcaRouter의 7일 텔레메트리에서 p50 첫 토큰 시간(time-to-first-token)이 1.64초로 나타나지만, 크고 정교한 모델이며 프리뷰 시절 리뷰어들은 긴 에이전틱 빌드에서 느리다고 평가했습니다.

Qwen 3.8은 지금 오픈 가중치가 공개되어 있나요?

아직입니다. 알리바바는 플래그십 가중치가 이번 주 안에 도착한다고 말하지만, 여전히 라이선스도, 모델 카드도, 저장소도 없습니다. 공개된다고 해도 2.4T 모델은 H200급 GPU 8개 이상이 필요합니다. 동시에 발표된 Qwen3.8-27B는 약 17GB의 VRAM을 사용하는 것으로 알려져 있으며, 실제로 자체 호스팅하기에 현실적인 선택지입니다.

둘 다 사용해야 할까요?

{{1}}대개 그렇습니다. 2계층 구조 — {{2}}모든 요청에 대한 저렴한 1차 처리로 Flash-Lite를, 장문 맥락·멀티모달·정말 어려운 작업을 위한 에스컬레이션 경로로 Qwen3.8-Max를 사용하는 방식{{/2}} — Flash-Lite의 비용 이점을 대부분 유지하면서도 비용을 정당화할 만한 프런티어 옵션을 제공합니다.{{/1}}

오늘 프로덕션에는 어떤 것을 선택해야 할까요?

Flash-Lite는 Index 36으로 충분한 대규모, 단기 컨텍스트, 텍스트 전용 작업에 적합합니다 — 저렴하고, 빠르고, 감사(audit)되었으며, 검증되었습니다. Qwen3.8-Max는 작업에 백만 토큰 컨텍스트, 이미지나 비디오 입력, 또는 Flash-Lite가 명백히 실패하는 추론이 필요할 때 사용합니다. 이제 둘 다 실제로 배포 가능한 상태이며, 이 비교가 처음 작성되었을 때는 그렇지 않았습니다.

결론

Gemini 3.5 Flash-Lite 대 Qwen 3.8는 한때 제품과 발표 사이의 비교였습니다. 더 이상은 아닙니다. 2026년 8월 3일부터 Qwen3.8-Max는 일반 공개되어 가격이 책정되었고, 셀프 서비스로 이용 가능하며 문서화도 완료되었습니다. 따라서 정직한 관점에서 이제는 준비 여부가 아닌 등급(티어) 선택의 문제입니다.

{{1}}Flash-Lite는 설계된 용도에 맞는 올바른 기본 선택으로 남아 있습니다. $0.30 / $2.50의 가격과 초당 약 490토큰의 속도로 모든 요청에서 반올림 오차에 불과한 비용으로 실행되며, 검증된 Index 36은 분류, 라우팅, 추출에 완전히 충분합니다.{{/1}} {{2}}Qwen3.8-Max는 상위 티어로, 고정 요금으로 제공되는 백만 토큰 컨텍스트, 네이티브 이미지 및 비디오 입력, 그리고 주장되는 최첨단 추론을 갖추고 있으며, 입력 비용은 약 6.7배에 달합니다.{{/2}} 해결되지 않은 유일한 약점은 이전과 동일합니다: {{3}}어떤 독립 평가자도 점수를 매긴 적이 없으므로, 품질에 대한 근거는 Alibaba 자체의 표에 의존합니다.{{/3}} 주목할 점은 {{4}}첫 번째 독립 Intelligence Index 점수와 Qwen3.8-27B 가중치입니다. 이 가중치는 Flash-Lite의 틈새 시장과 훨씬 더 직접적으로 경쟁하게 될 것입니다.{{/4}} 그동안에는 {{5}}워크로드 형태에 따라 선택하되, 두 모델을 모두 실행하는 것도 고려하세요.{{/5}}

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube