Gemini 3.5 Flash-Lite

google/gemini-3.5-flash-lite
신규추천
비전오디오도구JSON추론
제공 Google · 2026-07-21

Gemini 3.5 Flash-Lite는 Google의 가장 비용 효율적인 Gemini 모델로, 호출당 비용이 중요한 매우 높은 볼륨의 지연 시간에 민감한 워크로드를 위해 특별히 설계되었습니다. 가격에도 불구하고 기본적으로 멀티모달을 지원하여 텍스트, 이미지, 비디오, 오디오 및 텍스트 출력이 있는 파일을 허용하며, 더 큰 Flash 계층과 동일한 1M-토큰 컨텍스트 윈도우와 최대 64K 출력 토큰을 제공하므로 긴 문서와 혼합 미디어 입력도 계속 사용할 수 있습니다. 3.6 Flash 가격의 약 5분의 1에 해당하는 이 모델은 분류, 추출, 라우팅, 요약, 경량 에이전트, 합성 데이터 생성 및 수백만 번 실행되는 모든 파이프라인에 적합한 도구입니다. 또한 구성 가능한 추론 노력, 네이티브 도구 호출 및 구조화된 출력을 지원하며, 라이트 모델로서 에이전트 및 장기 컨텍스트 벤치마크에서 기대 이상의 성능을 발휘합니다. 예를 들어 OSWorld-Verified에서 74.0%, 128k multi-needle 검색에서 72.2%를 기록하여 이전 3.1 Flash-Lite보다 훨씬 앞서 있습니다. 이 모델은 OpenAI 채팅 완료 형식과 Gemini의 네이티브 generateContent API를 모두 지원하므로, 단일 통합 뒤에서 더 무거운 모델과 혼합하여 사용할 수 있습니다. 즉, 쉽고 볼륨이 많은 트래픽을 Flash-Lite로 라우팅하고 어려운 작업을 3.6 Flash 또는 Pro 모델로 에스컬레이션할 수 있습니다.

컨텍스트1.05M 토큰
최대 출력65.5K
입력text + image + video + file + audio
출력text
p50 TTFT1.30 s
입력$0.30/ 100만 토큰
출력$2.50/ 100만 토큰
p50 TTFT1.30 s7일
p95 TTFT10.00 s7일
트래픽5.9M토큰 / 7일

Google Gemini 3.5 Flash-Lite는 Google이 개발한 멀티모달 언어 모델로, OrcaRouter의 OpenAI 호환 API를 통해 제공됩니다. 텍스트, 이미지, 비디오, 파일, 오디오 입력을 처리할 수 있어 여러 데이터 유형을 결합하는 작업에 적합합니다. 이 모델은 1,048,576 토큰의 컨텍스트 윈도우를 가지며, 최대…

Google Gemini 3.5 Flash-Lite는 무엇인가요?

이 모델은 누구를 위해 설계되었나요?

모델은 어떤 모달리티를 지원하나요?

컨텍스트 윈도우와 최대 출력의 크기는 얼마인가요?

코드 샘플

어떤 SDK에서도 호출

OpenAI 호환 — 쓰던 SDK 그대로

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

지원되는 매개변수

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

가격

입력 / 1M tokens$0.300
출력 / 1M tokens$2.50
캐시 읽기 / 1M$0.030
통화USD

비용 계산기

월 토큰 수10MM
입력 비율70%%
월 예상 $9.60 · 프롬프트 캐싱 사용 시 $8.66

정가 기준 추정치

토큰 및 비용 추정기

입력 토큰: 9요청당 비용: $0.001253

추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.

성능

p50 TTFT
1.30 s
출력 속도
829 tok/s
p95 TTFT
10.00 s
오류율
5.0%

공개 벤치마크

49.3
AA Coding
비교된 모델 중 60%보다 우수
122개 중 49위
36.5
AA Intelligence
비교된 모델 중 54%보다 우수
124개 중 57위
CharXiv Reasoning (no tools)
74.5
CharXiv Reasoning (with tools)
76.5
GDM-MRCR v2 8-needle (128k avg)
72.2
GDM-MRCR v2 8-needle (1M pointwise)
21.3
GPQA Diamond
83.8
Humanity's Last Exam
17.5
Long-Context Recall
62.0
MLE-Bench
39.2
OSWorld-Verified
74.0
SciCode
40.9
SWE-Bench Pro (Public)
54.2
tau_banking
16.5
Terminal-bench 2.1 (Terminus-2)
54.0
terminalbench_v2_1
53.6
소스: artificialanalysis.ai, deepmind.google

비교

Gemini 3.5 Flash-LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
입력 $/100만$0.30$2.00$4.00$0.50
출력 $/100만$2.50$12.00$18.00$3.00
컨텍스트1.0M1.0M1.0M1.0M
품질6/1010/1010/109/10
나란히 비교나란히 비교나란히 비교나란히 비교

Google의 다른 모델

FAQ

OrcaRouter에서 Gemini 3.5 Flash-Lite의 토큰당 가격은 얼마인가요?
가격은 입력 토큰 백만 개당 $0.30, 출력 토큰 백만 개당 $2.50입니다. 이는 마크업이 전혀 없는 제공자 요금입니다. 입력 토큰에는 모든 모달리티(텍스트, 이미지, 비디오, 오디오, 파일)가 포함됩니다. 출력 토큰은 생성된 텍스트입니다.
컨텍스트 윈도우 크기는 얼마인가요?
컨텍스트 윈도우는 1,048,576 토큰(약 100만 개)입니다. 최대 출력 길이는 65,536 토큰입니다. 이를 통해 단일 API 요청으로 매우 긴 문서, 비디오 또는 오디오 녹음을 처리할 수 있습니다.
이 모델의 주요 강점은 무엇인가요?
주요 장점은 토큰당 비용이 매우 낮고, 다섯 가지 입력 모달리티(텍스트, 이미지, 영상, 오디오, 파일)를 지원하며, 방대한 1M 컨텍스트 창과 도구 사용 기능(도구 사용 시 CharXiv Reasoning 점수 76.5)을 갖추고 있다는 점입니다. 높은 처리량과 비용에 민감한 프로덕션 파이프라인을 위해 설계되었습니다.
더 큰 모델들(예: Gemini 3.5 Pro)과 비교하면 어떤가요?
직접적인 벤치마크 비교는 제공되지 않습니다. flash‑lite 변형으로서 이 모델은 원시 성능보다 효율성과 저렴한 비용을 우선시합니다. Gemini 3.5 Pro와 같은 더 큰 모델은 복잡한 추론 작업에서 더 높은 정확도를 달성할 가능성이 높지만 토큰당 비용이 훨씬 더 많이 듭니다. 비용과 처리량이 중요한 경우 이 모델을 사용하십시오.
모델이 비용을 줄이기 위해 프롬프트를 캐시하나요?
제공된 정보에는 캐싱 메커니즘이나 할인된 캐시 토큰 요금에 대한 언급이 없습니다. 모든 토큰은 표준 입력 요율로 청구된다고 가정해야 합니다. 캐싱이 중요한 경우 OrcaRouter나 Google에 문의하여 사용 가능한 할인 혜택을 확인하세요.
이 모델을 OpenAI 호환 API를 통해 어떻게 접근하나요?
OrcaRouter의 API를 기본 URL https://api.orcarouter.ai/v1 에서 사용하십시오. 모델 매개변수를 "google/gemini-3.5-flash-lite"로 설정하십시오. 이 API는 멀티모달 콘텐츠 및 도구 정의를 포함하여 OpenAI 채팅 완성 형식과 완벽하게 호환됩니다.
어떤 데이터 처리 및 개인정보 보호를 기대할 수 있나요?
데이터 처리는 Google(제공자)의 정책과 OrcaRouter의 이용 약관에 따라 관리됩니다. 모델은 사용자의 입력을 처리하며, 출력 결과는 사용자에게 반환됩니다. 이 모델에 대한 특정 개인정보 보호 인증은 제공되지 않습니다. 민감한 데이터의 경우 제공자의 데이터 처리 계약을 검토하시기 바랍니다.
이 모델을 실시간 애플리케이션에 사용할 수 있나요?
지연 시간 세부 정보는 명시되지 않았습니다. 모델은 짧은 입력에 대해 몇 초 내에 응답을 반환할 수 있지만, 매우 긴 프롬프트(약 1M 토큰)를 처리하는 데는 수십 초가 걸릴 수 있습니다. 이는 중간 정도의 입력 크기를 가진 준실시간 애플리케이션에 적합합니다. 엄격한 실시간 요구 사항이 있는 경우 예상 입력 길이로 테스트하십시오.
CharXiv Reasoning benchmark 점수는 무엇인가요?
이 모델은 CharXiv Reasoning with tools에서 76.5점을 기록했습니다. 이 벤치마크는 차트 이해와 추론 능력을 테스트합니다. 이 점수는 중간 수준의 성능을 나타냅니다. 이 모델은 차트를 해석하고 질문에 답할 수 있지만, 전용 추론 모델 수준에는 미치지 못합니다. 다른 벤치마크 점수는 제공되지 않습니다.
OrcaRouter를 사용하는 데 최소 비용이나 약정이 있나요?
OrcaRouter는 최소 월 사용 금액을 부과하지 않습니다. 사용한 토큰에 대해서만 마크업이 없는 제공업체 요금으로 청구됩니다. 선불 비용이나 장기 계약이 없습니다. 간단히 API 키에 가입하고 요청을 시작하세요.

이 배지 임베드

Google: Gemini 3.5 Flash-Lite$0.30/M in1298ms p50OrcaRouter를 통해
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg" alt="OrcaRouter 의 Google: Gemini 3.5 Flash-Lite" /> </a>
Markdown [![Google: Gemini 3.5 Flash-Lite](https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite)

모델 카드를 데이터로

GET /api/public/models/google/gemini-3.5-flash-lite열기
기계 판독 가능:/llms.txt/llms-full.txt