'Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite' 히어로 타이틀 카드, 부제: '공짜는 결코 싸지 않다 — 기존 강자가 여전히 안전한 선택이다' 그리고 두 개의 스탯 카드: Ling 3.0 Tiny (AA Index 23, 매우 장황함, 8월 14일까지 무료) 및 Gemini 3.5 Flash-Lite (AA Index 36, ~490 tok/s, $0.30 / $2.50). OrcaRouter 로고는 오른쪽 하단에 합성됨.
Guides & Insights

Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite: 무료라고 해서 싸구려는 아니며, 기존 선두 주자가 여전히 안전한 선택이다

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

"무료"는 모델 시장 어휘에서 가장 비싼 단어입니다. 그것은 대개 누군가가 표시 가격 이외의 다른 것에 대해 당신에게 비용을 청구하려 한다는 뜻이기 때문입니다. 그것이 바로 Ling 3.0 Tiny, Ant Group InclusionAI의 새로운 7.9B 파라미터 MoE 추론 모델, 그리고 Gemini 3.5 Flash-Lite(Google의 현재 가장 저렴하고 가장 빠른 Gemini 등급) 사이의 맞대결에 숨어 있는 함정입니다. Ling 3.0 Tiny는 지금 무료로 호출할 수 있으며, 8월 14일 프로모션 이후에는 백만 토큰당 $0.06 / $0.18의 비용이 듭니다. 하지만 Artificial Analysis는 이 모델이 자신이 속한 56개 모델 클래스에서 점수를 얻기 위해 2억 1,000만 개의 출력 토큰을 소모한 것으로 측정했으며(중앙값은 6,300만 개), 이를 "매우 장황함"으로 표시했습니다. Gemini 3.5 Flash-Lite는 토큰당 $0.30 / $2.50으로 5배 비싸지만, 독립적인 Intelligence Index 36(Ling 3.0 Tiny보다 13포인트 높은 수치)을 보유하고 있으며, 출력 속도는 초당 약 490토큰입니다. 더 저렴한 가격표, 더 빠른 응답, 더 낮은 점수 — 모두 같은 모델을 가리킵니다. 이것이 이번 비교의 전부이며, 가격만으로 신규 모델을 기본 선택하기 전에 다시 생각해야 하는 이유입니다.

두 모델 모두 보급형 티어에 속하지만, 수명주기에서 서로 다른 지점에 있다. Gemini 3.5 Flash-Lite는 성숙한 기존 주자다. 2026년 7월 21일에 출시되었고, 제3자가 지속적으로 재측정하며, 대규모이면서 지연 시간에 민감한 에이전트 작업의 기본 티어로 널리 배포되어 있다. Ling 3.0 Tiny는 출시된 지 일주일밖에 안 되었고, 사용자 확보를 위한 가격으로 책정되었으며, 정확히 한 번 평가되었다. 이 글은 각 모델이 실제로 무엇인지, 독립적인 수치가 무엇을 의미하는지, 그리고 "무료" 가격이 비교에서 가장 쓸모없는 숫자인 이유를 구분한다.

Ling 3.0 Tiny, 미터를 갖춘 신참

Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.

The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Screenshot of the Artificial Analysis page for Ling 3.0 Tiny, showing an Intelligence Index of 23, price $0.00 / $0.00 on the free tier, a 210M-token verbosity read versus a 63M median, and output speed listed as N/A. REUSED from the what-is-ling-3-0-tiny explainer (audited).

Gemini 3.5 Flash-Lite, 현직

Gemini 3.5 Flash-Lite는 동일한 질문에 대한 Go​ogle의 답변으로, Gemini 3.5 라인에서 한 단계 아래로 출시되었습니다. 입력 측면에서 기본적으로 멀티모달(텍스트, 이미지, 비디오, 오디오, 파일)을 지원하며, 출력은 텍스트입니다. 1M 토큰 컨텍스트 창, 최대 64K 출력 토큰, 그리고 구성 가능한 추론 노력(최소, 낮음, 높음)을 갖추고 있어 파이프라인이 요청별로 깊이와 비용을 조절할 수 있습니다. 독립적인 점수는 확실한 세대 도약입니다. Artificial Analysis Intelligence Index 36으로, 추적 대상 151개 모델 중 12위이며, Gemini 3.1 Flash-Lite의 25에서 상승했습니다. 속도 면에서는 3.5 시리즈 중 가장 빠른 모델입니다. Go​ogle은 출시 시 초당 350 출력 토큰을 언급했고, AA의 라이브 페이지에서는 초당 약 490 토큰으로 측정되어 추적 모델 중 2위를 기록했습니다. 벤더가 보고한 에이전트 관련 수치(OSWorld-Verified 74.0%, Terminal-Bench 2.1 54%, 128K 멀티니들 검색 테스트 72.2%)는 Go​ogle 자체 수치로, 절대적 진실이라기보다 방향성을 제시합니다. 그리고 한 가지 미해결 질문(Go​ogle 블로그에는 기본 제공으로 나와 있지만 API 문서에서는 지원되지 않는 computer-use)은 이 기능에 의존하기 전에 확인해 볼 가치가 있습니다.

또한 토큰당 가격은 이 등급에서 저렴하지 않습니다. "Lite"라는 이름은 모델의 라인업 내 위치를 나타낼 뿐, 내려가는 가격표를 의미하지는 않습니다: Gemini 2.5 Flash-Lite는 $0.10 / $0.40, 3.1 Flash-Lite는 $0.25 / $1.50, 3.5 Flash-Lite는 백만 토큰당 $0.30 / $2.50이며, 캐시된 입력은 $0.03입니다. 효율성 개선은 속도와 토큰 경제성에서 비롯되며, Artificial Analysis의 자체 측정에 따르면 실제 작업당 비용은 세대가 거듭될수록 약 두 배로 늘어난 반면, 작업당 시간은 절반으로 줄었습니다.

독립적인 스코어보드, 맥락 속에서 읽힌

두 모델을 같은 지수에 놓으면 그 격차는 뚜렷하다: Gemini 3.5 Flash-Lite는 36, Ling 3.0 Tiny는 23. 하지만 그 표제급 비교는 그림의 절반에 불과하다. 두 모델이 같은 분야를 대상으로 평가된 것이 아니기 때문이다. AA는 Ling 3.0 Tiny를 자사의 tiny-model 클래스 56개 중 6위로 평가하며, 클래스 중앙값은 8이다. 이는 그 크기의 모델로서는 평균을 훨씬 웃도는 수치다. Gemini 3.5 Flash-Lite는 더 넓은 추적 대상 풀에서 151개 중 12위에 위치한다. 하나는 뛰어난 tiny 모델이고, 다른 하나는 오픈 풀에서 견고한 보급형 모델이다. 두 진술 모두 사실이며, 의미하는 바가 다르다. Ling 3.0 Tiny는 자체 크기 클래스에서 Gemini 3.5 Flash-Lite가 자체 등급에서 제공하는 가치보다 더 낫다. 그리고 Gemini 3.5 Flash-Lite는 여전히 동일한 독립적 척도에서 훨씬 더 뛰어난 성능의 모델이다.

Comparison scoreboard for Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite. Left column Ling 3.0 Tiny: AA 23, $0.06 / $0.18 after promo, 210M output tokens, text-only, 256K context, speed N/A (Vercel 264 tok/s). Right column Gemini 3.5 Flash-Lite: AA 36, $0.30 / $2.50, 43M output tokens, text + image + video + audio, 1M context, ~490 tok/s (AA). Footer: 'Both models per Artificial Analysis.' OrcaRouter logo composited bottom-right.

치수, 각각 한 줄씩:

• 독립 점수 — Ling 3.0 Tiny AA Index 23 (#6/56, 클래스 중앙값 8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151).

• 가격 — Ling 3.0 Tiny: 무료 프로모션 후 1M당 $0.06 / $0.18 vs Gemini 3.5 Flash-Lite: 1M당 $0.30 / $2.50 (캐시 입력 $0.03).

• 장황함 — 인덱스 실행 전반에 걸쳐 Ling 3.0 Tiny는 210M 출력 토큰을 생성했고, Gemini 3.5 Flash-Lite는 측정되었지만 해당 플래그 기준으로는 장황하지 않았습니다.

• 모달리티 — Ling 3.0 Tiny: 텍스트 전용 vs Gemini 3.5 Flash-Lite: 텍스트, 이미지, 비디오, 오디오 및 파일 입력.

컨텍스트 — Ling 3.0 Tiny는 256K, Gemini 3.5 Flash-Lite는 1M이며, 두 모델 모두 최대 출력은 64K입니다.

• {{1}}속도 — Ling 3.0 Tiny는 수치를 공개한 엔드포인트 기준 약 90~264 tokens/s인 반면, Gemini 3.5 Flash-Lite는 AA의 실시간 측정 기준 약 490 tokens/s입니다.{{/1}}

속도 행이 가장 움직일 가능성이 높습니다. Ling 3.0 Tiny의 출력 속도는 실제로 아직 불확실합니다. Artificial Analysis는 N/A로 표시하는 반면, Vercel은 초당 264토큰을 광고합니다. Gemini 3.5 Flash-Lite의 초당 약 490토큰은 자체 출시 변동성이 진정된 후에 측정된 실시간 AA 수치입니다. 지연 시간에 민감한 계층에게 이는 알려진 값과 미해결 질문의 차이를 의미합니다.

장황함의 경제학: 무료가 결코 싸지 않은 이유

여기에 {{1}}이 매치업을 보통 결정하는 계산{{/1}}이 있습니다. Ling 3.0 Tiny의 프로모션이 끝난 후, 동일한 추론 비중이 높은 작업(예: 입력 토큰 4,000개, 출력 토큰 2,000개)을 두 모델 모두에 실행해 보세요. Ling 3.0 Tiny는 (4,000 × $0.06 + 2,000 × $0.18) / 1,000,000, 약 $0.0006을 청구합니다. Gemini 3.5 Flash-Lite는 (4,000 × $0.30 + 2,000 × $2.50) / 1,000,000, 약 $0.0062를 청구합니다. 동일한 토큰 수 기준으로 Ling 3.0 Tiny는 10배 더 저렴합니다. 이제 장황함을 더해 보세요. 추론 모델은 thinking 토큰을 출력으로 생성하므로 동일한 토큰 수가 나오지 않습니다. Ling 3.0 Tiny의 210M 대 63M 장황함 비율이 사용자의 워크로드에서도 유지된다면, 출력 측면의 작업당 실효 비용은 대략 3배가 되고, 10배의 이점은 3~4배로 줄어듭니다. 여전히 더 저렴하지만, 더 이상 공짜는 아니며 210M 수치가 시사하는 수준과는 거리가 있습니다.

솔직하게 말하면, 두 모델은 동일한 품질에서 대체재가 아닙니다. Ling 3.0 Tiny의 23점은 1.3B 활성 모델로서는 예외적인 점수입니다. Gemini 3.5 Flash-Lite의 36점은 다른 차원의 성능이며, 여기에 비전, 1M 컨텍스트, 검증된 속도까지 더해집니다. 그 격차에 대한 비용을 지불해야 합니다 — 토큰당 가격은 5배, 속도 차이를 고려하면 작업당 비용은 더 높습니다 — 하지만 이는 마케팅상의 격차가 아니라 실제 성능 격차입니다. 워크로드가 더 저렴한 모델의 품질로 충분하다면 Ling 3.0 Tiny가 더 나은 가치입니다. 워크로드가 그 성능을 필요로 한다면, 어떤 가격 이점도 그 격차를 메울 수 없습니다.

라우터가 제 역할을 하는 곳

이것은 정확히 라우팅 계층이 단일 모델에만 의존하는 것보다 나은 워크로드 형태이며, 호스팅 환경의 조건이 이를 구축하는 방식에 중요합니다. Gemini 3.5 Flash-Lite가 OrcaRouter에서 제공업체 공시 가격으로 제공됩니다 — 입력 $0.30 / 출력 $2.50 (1M 토큰당), 0% 마크업으로 전달되므로 Go​ogle 요금표의 숫자가 곧 우리 쪽 숫자이며, 향후 가격 인하도 같은 날 적용됩니다. 이 모델은 200개 이상의 다른 모델과 동일한 OpenAI 호환 엔드포인트를 사용하며, 기본 제공업체가 실행 중 성능이 저하되는 경우를 대비한 제공업체 간 자동 페일오버를 갖추고 있습니다. 또한 라우팅 DSL은 프롬프트를 여러 모델에 보내 가장 좋은 답변을 채택할 수 있습니다.

Ling 3.0 Tiny는 OrcaRouter에 포함되어 있지 않습니다. 자체 엔드포인트로 제공되며, 오늘은 무료입니다. 이 조합은 사실 라우팅 사례를 약화시키기보다는 오히려 강화합니다. 무료 기간이 끝나 비용이 발생하기 전에 자체 트래픽으로 Ling 3.0 Tiny를 벤치마킹하세요. 그런 다음 프로덕션 경로는 호스팅 티어에 구축하세요 — 비전, 긴 컨텍스트, 또는 안정적인 속도 프로필이 필요한 호출에는 Gemini 3.5 Flash-Lite를 사용하고, 라우팅 레이어는 어려운 소수의 요청에 대해 더 비싼 모델로 자유롭게 에스컬레이션할 수 있게 하세요. 무료 티어는 훌륭한 실험이자 취약한 의존성입니다. 제품을 구축할 수 있는 대상은 호스팅 티어입니다. OrcaRouter에서는 동일한 그래프에서 두 가지를 모두 실행할 수 있습니다 — 직접 엔드포인트로 Ling 3.0 Tiny, 키로 Gemini 3.5 Flash-Lite — 그리고 라우터가 요청별로 결정하게 할 수 있습니다.

Screenshot of the OrcaRouter model page for Gemini 3.5 Flash-Lite (google/gemini-3.5-flash-lite) showing $0.30 input / $2.50 output per 1M tokens, a 1M-token context, up to 64K max output, multimodal text + image + video + file + audio input, and a p50 time-to-first-token of 819ms over the last 7 days. Fresh Edge-headless capture, audited.

평결

이 두 가지 중에서 선택해야 하고 함께 라우팅하지 않는다면, 결정은 말하기는 쉬워도 받아들이기는 어렵다. Ling 3.0 Tiny는 더 나은 조건이면서도 더 약한 모델이다: 일주일 된 텍스트 전용 추론 등급으로, 크기에 비해 우수한 점수, 공격적인 가격, 그리고 아직 해결되지 않은 속도와 장황함 문제를 지니고 있다. 즉시 무료 체험 평가를 해볼 가치가 있으며, 8월 14일부터 사용량이 측정된다는 점을 알아둘 가치가 있다. Gemini 3.5 Flash-Lite는 더 안전한 프로덕션 기본값이다: 독립적으로 13포인트 더 높은 점수를 받았고, 멀티모달이며, 1M 컨텍스트를 지원하고, 확정된 측정 결과 5배 더 빠르며, 그에 상응하는 가격이 책정되어 있다. 모델이 더 낮은 성능 상한에서 생각하기 위해 세 배 더 많이 말할 때, 무료는 결코 싸지 않다 — 그리고 기존 제품이 안전한 선택인 데는 이유가 있다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube