Gemini 3.5 Flash-Lite는 Google의 가장 비용 효율적인 Gemini 모델로, 호출당 비용이 중요한 매우 높은 볼륨의 지연 시간에 민감한 워크로드를 위해 특별히 설계되었습니다. 가격에도 불구하고 기본적으로 멀티모달을 지원하여 텍스트, 이미지, 비디오, 오디오 및 텍스트 출력이 있는 파일을 허용하며, 더 큰 Flash 계층과 동일한 1M-토큰 컨텍스트 윈도우와 최대 64K 출력 토큰을 제공하므로 긴 문서와 혼합 미디어 입력도 계속 사용할 수 있습니다. 3.6 Flash 가격의 약 5분의 1에 해당하는 이 모델은 분류, 추출, 라우팅, 요약, 경량 에이전트, 합성 데이터 생성 및 수백만 번 실행되는 모든 파이프라인에 적합한 도구입니다. 또한 구성 가능한 추론 노력, 네이티브 도구 호출 및 구조화된 출력을 지원하며, 라이트 모델로서 에이전트 및 장기 컨텍스트 벤치마크에서 기대 이상의 성능을 발휘합니다. 예를 들어 OSWorld-Verified에서 74.0%, 128k multi-needle 검색에서 72.2%를 기록하여 이전 3.1 Flash-Lite보다 훨씬 앞서 있습니다. 이 모델은 OpenAI 채팅 완료 형식과 Gemini의 네이티브 generateContent API를 모두 지원하므로, 단일 통합 뒤에서 더 무거운 모델과 혼합하여 사용할 수 있습니다. 즉, 쉽고 볼륨이 많은 트래픽을 Flash-Lite로 라우팅하고 어려운 작업을 3.6 Flash 또는 Pro 모델로 에스컬레이션할 수 있습니다.
Google Gemini 3.5 Flash-Lite는 Google이 개발한 멀티모달 언어 모델로, OrcaRouter의 OpenAI 호환 API를 통해 제공됩니다. 텍스트, 이미지, 비디오, 파일, 오디오 입력을 처리할 수 있어 여러 데이터 유형을 결합하는 작업에 적합합니다. 이 모델은 1,048,576 토큰의 컨텍스트 윈도우를 가지며, 최대…
Gemini 3.5 Flash-Lite는 멀티모달 입력 및 도구 사용 지원 덕분에 광범위한 작업을 수행할 수 있습니다. 요약, 질문 답변, 코드 생성과 같은 텍스트 전용 작업을 처리합니다. 이미지의 경우 장면을 설명하고, 문서에서 텍스트를 추출하거나, 다이어그램을 해석할 수 있습니다. 비디오 입력을 통해 활동 인식, 캡션 생성, 시간적 추론이 가능합니다. 오디오 입력은 전사, 언어 식별, 음성 기반 분석을 용이하게 합니다. 또한 이 모델은 도구 호출을 지원하며, 이는 CharXiv Reasoning 점수 76.5(도구 사용 시)로 입증됩니다. 이는 외부 API나 데이터베이스를 호출하는 에이전트 워크플로우에 통합될 수 있음을 의미합니다. 그러나 창작 글쓰기, 고도로 추상적인 추론, 또는 깊은 도메인 전문 지식이 필요한 작업에는 적합하지 않습니다. 그 강점은 원시 성능보다는 속도, 비용 및 모달리티 지원의 폭에 있습니다.
비용과 처리량이 주요 관심사이고 작업이 해당 모델의 성능 범위 내에 있을 때 Gemini 3.5 Flash-Lite를 선택해야 합니다. 이 모델은 수천 개 문서 색인 작성, 수시간 분량 오디오 전사, 이미지 스트림 실시간 분류와 같은 대용량 파이프라인에서 뛰어난 성능을 발휘합니다. 대규모 컨텍스트 윈도우(1M 토큰) 덕분에 사법 사례 분석이나 코드베이스 리팩터링처럼 긴 입력에 대한 전반적 이해가 필요한 작업에 이상적입니다. 더 큰 모델(예: Gemini 3.5 Pro)은 복잡한 벤치마크에서 더 높은 정확도를 달성할 수 있지만, 토큰당 비용이 훨씬 높고 처리량이 낮습니다. 애플리케이션이 10~100배 비용 절감을 위해 약간의 품질 저하를 감수할 수 있다면 이 모델이 적합합니다. 반대로 사실적 정밀성, 창의적 생성, 또는 최첨단 추론이 필요한 작업에는 더 큰 모델을 권장합니다.
네, 모델은 텍스트, 이미지, 파일과 함께 비디오 및 오디오 입력을 기본적으로 지원합니다. 비디오 입력은 프레임 시퀀스나 비디오 파일로 제공할 수 있으며, 모델은 시각적 프레임과 관련 오디오 트랙을 처리합니다. 오디오 입력은 WAV, MP3, FLAC과 같은 일반적인 형식으로 작동합니다. 큰 컨텍스트 창 덕분에 긴 녹음도 단일 요청으로 처리할 수 있습니다. 예를 들어, 1시간 분량의 고음질 오디오 전사는 약 10,000개의 토큰을 소비할 수 있습니다. 이는 회의 요약, 팟캐스트 분석, 음성 기반 고객 지원에 유용합니다. 모델은 오디오나 비디오 출력을 생성하지 않으며, 응답은 항상 텍스트입니다. 멀티모달 이해 품질은 모델의 flash-lite 등급에 해당합니다: 추출 및 분류에 적합하지만, 더 큰 멀티모달 모델에 비해 미묘한 세부 사항을 놓칠 수 있습니다.
Gemini 3.5 Flash-Lite는 도구 호출을 지원하며, 이는 CharXiv Reasoning with tools 벤치마크 성능(점수 76.5)에서 확인할 수 있습니다. 즉, 응답 생성 중에 모델이 호출할 수 있는 함수나 API를 정의할 수 있습니다. 일반적인 사용 사례로는 데이터베이스 조회, 웹 검색, 산술 연산 등이 있습니다. 모델은 사용자의 지시와 맥락에 따라 도구를 호출할 시점을 선택합니다. 도구 사용은 사실적 정확성을 향상시키고 복잡한 다단계 추론을 가능하게 합니다. 그러나 이 모델은 flash-lite 변형이기 때문에 도구 호출의 신뢰성이 더 큰 전문화된 모델보다 낮을 수 있습니다. 애플리케이션이 완벽한 도구 오케스트레이션에 크게 의존하는 경우, 검증 계층이나 폴백 로직을 추가해야 할 수 있습니다. OrcaRouter는 OpenAI API와 동일한 형식으로 도구 정의를 전달하므로 통합이 간단합니다.
이 모델은 도구를 사용한 평가에서 CharXiv Reasoning 벤치마크에서 76.5점을 기록했습니다. CharXiv는 차트 기반 시각 데이터에 대한 추론 능력을 테스트하며, 모델이 차트 이미지를 해석하고 관련 질문에 답변해야 합니다. "도구 사용" 조건은 모델이 외부 함수(예: 계산기)를 호출하여 지원받을 수 있음을 의미합니다. 이 점수는 중간 수준의 성능을 나타냅니다. 차트 관련 추론이 가능하지만 전문 모델 수준에는 미치지 못합니다. 이 모델에 대한 다른 벤치마크 점수는 제공되지 않았습니다. 비교를 위해 Gemini 3.5 Pro와 같은 대형 모델은 이 작업에서 더 높은 점수를 받을 가능성이 높습니다. 이 값은 참고 지점으로 유용합니다. 합리적인 수준의 차트 해석을 기대할 수 있지만, 애플리케이션에서 시각적 추론 작업에 높은 정확도가 요구된다면 철저히 테스트해야 합니다.
제공된 정보에는 CharXiv 추론(도구 사용) 점수만 76.5로 제공되어 있습니다. Gemini 3.5 Flash‑Lite에 대한 MMLU, HumanEval 또는 장문 맥락 검색 점수와 같은 추가 벤치마크 데이터는 제공되지 않습니다. 따라서 다른 작업에 대한 성능을 일반화하려면 자체 데이터에 대한 실증적 테스트가 필요합니다. 이 모델의 Flash‑Lite 특성상 대부분의 표준 벤치마크에서 풀사이즈 모델보다 성능이 낮을 것으로 예상됩니다. 그러나 효율성과 저렴한 비용은 프로덕션 환경에서 이러한 단점을 상쇄하는 경우가 많습니다. 특정 벤치마크(예: 코드 생성 또는 다국어 이해)에 대한 검증된 성능이 필요하다면 자체 평가를 실행해야 합니다. OrcaRouter는 별도의 벤치마크 결과를 호스팅하지 않습니다. 여기에 인용된 숫자는 제공업체에서 직접 가져온 것입니다.
제공된 데이터에는 지연 시간 세부 정보가 명시되어 있지 않습니다. 일반적으로 플래시‑라이트 모델은 더 큰 형제 모델에 비해 낮은 지연 시간을 목표로 설계되었지만, 실제 응답 시간은 입력 길이, 출력 길이, 동시 요청 부하, 기본 하드웨어 등 여러 요인에 따라 달라집니다. 1M 컨텍스트 창의 경우, 어텐션의 이차 확장성으로 인해 매우 긴 프롬프트를 처리하면 지연 시간이 상당히 증가할 수 있습니다. 짧은 입력(예: 수백 개 토큰)의 경우 1초 미만의 응답을 기대할 수 있습니다. 1M 토큰 한계에 가까운 입력의 경우 지연 시간이 수십 초에 달할 수 있습니다. OrcaRouter는 이 모델에 대해 특정 지연 시간 SLA를 보장하지 않습니다. 낮은 지연 시간이 중요한 경우, 더 작은 컨텍스트(예: 잘라내기)를 사용하거나 전용 엔드포인트를 고려하십시오. OrcaRouter 대시보드를 통해 응답 시간을 모니터링할 수 있습니다.
Gemini 3.5 Flash-Lite는 최첨단 정확도를 위해 설계되지 않았습니다. 강점은 속도, 비용, 그리고 대규모 컨텍스트입니다. 한계로는 복잡한 추론 벤치마크에서의 낮은 성능, 대규모 모델에 비해 낮은 사실 회상 능력, 그리고 모호한 입력에 대해 "환각" 현상을 일으키는 경향이 있습니다. 이 모델은 심층 도메인 전문 지식(예: 법률 추론, 의료 진단)이 필요한 작업이나 미묘한 창의적 작업에 어려움을 겪을 수 있습니다. 도구 사용 능력은 기능하지만 전용 에이전트 모델만큼 신뢰할 수 없을 수 있습니다. 또한 단 하나의 벤치마크 점수(CharXiv Reasoning 76.5, 도구 사용)만 제공되므로 테스트 없이 다른 도메인에서도 좋은 성능을 가정할 수 없습니다. 중요한 애플리케이션의 경우 항상 자체 데이터로 벤치마킹하고 신뢰도가 낮을 때는 더 강력한 모델로의 폴백을 고려하십시오.
가격은 입력 토큰 100만 개당 $0.30, 출력 토큰 100만 개당 $2.50입니다. 이 요금은 OrcaRouter가 마크업 없이 청구하는 공급자 요금입니다. 입력 토큰에는 모달리티와 관계없이 프롬프트의 모든 토큰(텍스트, 이미지 토큰, 비디오 프레임, 오디오 샘플, 파일 내용)이 포함됩니다. 출력 토큰은 생성된 텍스트 토큰입니다. 100,000개의 입력 토큰과 1,000개의 출력 토큰을 소비하는 일반적인 장문 컨텍스트 쿼리의 경우 요청당 비용은 대략 ($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325입니다. 규모를 키우면 이 모델은 수백 달러로 수백만 건의 쿼리를 처리할 수 있습니다. 이를 토큰당 비용이 10~50배 더 높은 대형 모델과 비교해 보세요. 낮은 출력 가격은 긴 응답(예: 전체 문서 요약)을 생성하는 애플리케이션에 특히 유리합니다.
제공된 정보에는 캐싱 메커니즘 또는 캐시된 토큰에 대한 할인 가격이 명시되어 있지 않습니다. 따라서 반복 여부와 관계없이 모델로 전송되는 모든 토큰은 표준 입력 요금인 백만 토큰당 $0.30으로 청구된다고 가정해야 합니다. 일부 제공업체에서는 반복되는 접두사에 대해 더 낮은 요금(예: 50% 할인)으로 청구되는 자동 프롬프트 캐싱을 제공합니다. 이 모델의 경우 이러한 캐싱 할인이 발표되지 않았습니다. 동일한 컨텍스트(예: 큰 시스템 프롬프트)를 자주 재전송하는 경우 OrcaRouter 또는 Google이 투명한 캐싱을 구현하는지 조사하는 것이 좋습니다. 명시적인 정보가 없는 경우 모든 입력에 대해 전체 토큰당 비용을 예산에 포함시키는 것이 가장 안전합니다. 재사용된 콘텐츠를 다듬어 최적화하면 실제 청구액을 줄일 수 있습니다.
Zero markup는 OrcaRouter가 제공업체 요율을 정확히 청구하며 추가 마진을 전혀 붙이지 않는다는 의미입니다. Gemini 3.5 Flash-Lite의 경우 입력 가격은 $0.30/1M 토큰, 출력 가격은 $2.50/1M 토큰입니다. 이는 Google이 청구하는 가격이며, OrcaRouter는 이를 인상 없이 그대로 전달합니다. 토큰당 추가 플랫폼 수수료를 지불하지 않습니다. 이는 일반적으로 10~20% 이상을 추가하는 대부분의 API 게이트웨이와 다른 점입니다. 마크업이 없기 때문에 OrcaRouter를 통해 이 모델을 사용할 때 비용 효율성이 더욱 높아집니다. 대역폭 및 API 인프라 비용은 여전히 지불하지만, 해당 비용은 제공업체 요율에 포함되어 있으며 OrcaRouter는 이를 별도로 항목화하지 않습니다. 이 가격 모델은 투명합니다. 사용량 대시보드에 표시되는 비용이 최종 비용입니다.
이것을 OrcaRouter의 OpenAI 호환 API를 사용하여 기본 URL https://api.orcarouter.ai/v1에서 호출합니다. model 파라미터를 "google/gemini-3.5-flash-lite"로 설정합니다. 채팅 완성(POST /v1/chat/completions)과 임베딩(지원 시) 모두 작동합니다. 멀티모달 입력의 경우, roles 배열과 text, image_url 또는 file_url 필드를 포함할 수 있는 content 객체로 메시지를 구성합니다. 예시 cURL 요청: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' OrcaRouter API 키를 사용해야 하며, Google API 키를 사용하면 안 됩니다.
이 모델은 표준 OpenAI 호환 매개변수(모델, 메시지, max_tokens(모델의 65,536 제한까지), temperature, top_p, stop, frequency_penalty, presence_penalty, tools(함수 호출용))를 지원합니다. 추가 Google 특정 매개변수(예: safety_settings)는 직접 노출되지 않을 수 있습니다. 필요한 경우 OrcaRouter 문서에서 해당 항목을 확인하세요. 모델은 max_tokens 제한을 준수합니다. 멀티모달 입력의 경우 콘텐츠의 type 필드는 text, image_url, video_url(OrcaRouter에서 노출하는 경우), audio_url 및 file_url을 지원합니다. 파일 형식은 PDF, CSV 등을 허용할 수 있습니다. 큰 미디어 파일은 데이터 URI로 사전 인코딩하거나 공개적으로 호스팅해야 할 수 있습니다. OrcaRouter는 또한 파일이 특정 크기 미만이어야 할 수 있습니다. 정확한 매개변수 지원을 위해 항상 최신 API 문서를 참조하십시오.
다른 API 제공업체(예: Google AI Studio, Vertex AI 또는 기타 게이트웨이)에서 OrcaRouter로 마이그레이션하려면 기본 URL을 https://api.orcarouter.ai/v1로 변경하고 모델 ID를 "google/gemini-3.5-flash-lite"로 설정하세요. 기존 코드가 OpenAI Python 클라이언트를 사용하는 경우 base_url과 api_key를 전달하세요. 예시: from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) 이전 제공업체(예: Anthropic)에서 다른 스키마를 사용한 경우 멀티모달 메시지 형식을 조정해야 할 수 있습니다. OrcaRouter는 OpenAI 형식을 기대합니다. 사용자 콘텐츠 배열은 여러 부분을 포함할 수 있습니다. 도구 정의도 OpenAI 스타일입니다. 추가 마이그레이션 비용은 없으며 설명된 대로 토큰당 비용만 지불하면 됩니다.
직접적인 비교 데이터는 제공되지 않지만, 정성적으로 추론할 수 있습니다. Gemini 2.0 Flash(존재한다면)는 아마도 이전 세대의 Flash 모델일 것입니다. Gemini 3.5 Flash‑Lite는 더 큰 컨텍스트 윈도우(1M 대 128K)와 더 낮은 가격을 갖춘 더 새롭고 가벼운 변형입니다. Gemini 3.5 Flash‑Lite의 토큰당 비용은 백만 토큰당 $0.30/$2.50으로 매우 낮습니다. 이전 Flash 모델은 토큰당 비용이 더 높고 컨텍스트 윈도우가 더 짧을 수 있습니다. 하지만 Gemini 2.0 Flash는 Lite 변형이 아닌 전체 Flash 모델이라면 원시 정확도가 더 좋을 수 있습니다. 작업에 최고 품질이 필요하고 더 높은 비용을 감당할 수 있다면, 이전 전체 Flash 모델이 더 나을 수 있습니다. 큰 컨텍스트와 낮은 비용이 필요하다면 3.5 Flash‑Lite가 논리적인 선택입니다.
OpenAI의 GPT-4o mini는 유사한 저비용 다중 모달 모델입니다. 이 모델은 128K 토큰(1M보다 상당히 작음)의 컨텍스트 윈도우를 가지며, 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.60의 가격으로 책정되어 있습니다(2025년 초 기준; 가격은 변경될 수 있음). Gemini 3.5 Flash‑Lite는 8배 더 큰 컨텍스트 윈도우를 제공하지만 입력 가격은 2배, 출력 가격은 4배입니다. 따라서 Gemini는 토큰당 더 비싸지만 훨씬 더 큰 컨텍스트 용량을 제공합니다. 전체 1M 컨텍스트가 필요한 작업(예: 전체 책 처리)의 경우, Gemini Flash‑Lite가 여러 GPT-4o mini 호출로 입력을 분할하는 것보다 비용 효율적입니다. 컨텍스트가 짧은 경우, GPT-4o mini가 더 저렴하고 벤치마크 성능이 더 좋을 수 있습니다. 데이터 없이 벤치마크 점수는 직접 비교할 수 없습니다.
벤치마크 비교는 제공되지 않습니다. Llama 3.2 90B(이 모델이 존재한다고 가정)는 대규모 오픈 가중치 모델로, 더 작은 컨텍스트 윈도우(전형적으로 128K 토큰)와 API를 통해 실행할 때 더 높은 토큰당 비용을 가집니다. Gemini 3.5 Flash‑Lite는 독점 모델로, 훨씬 더 큰 컨텍스트 윈도우와 매우 저렴한 가격을 제공하며, 사용 가능한 멀티모달 모델 중 가장 저렴한 토큰당 비용 중 하나입니다. Llama 3.2 90B는 크기 덕분에 많은 NLP 벤치마크에서 더 높은 정확도를 달성할 수 있지만, 멀티모달이 아니며 더 엄격한 컨텍스트 제한이 있습니다. 작업이 텍스트 전용이고 최고의 정확도가 필요하다면, Llama 90B(OrcaRouter를 통해 접근 가능한 경우)가 더 나을 수 있습니다. 멀티모달, 긴 컨텍스트 또는 높은 처리량 시나리오의 경우 Gemini Flash‑Lite가 명확한 장점을 가집니다. 선택은 애플리케이션의 특정 요구 사항에 따라 달라집니다.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 입력 / 1M tokens | $0.300 |
| 출력 / 1M tokens | $2.50 |
| 캐시 읽기 / 1M | $0.030 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
@misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite