Gemini 3.8 Flash는 Google의 가장 지능적인 Flash 모델로, 소프트웨어 엔지니어링, 에이전트 작업, 다단계 추론 분야에서 3.7 Flash 대비 상당한 성능 향상을 보여줍니다.
Gemini 3.8 Flash는 광범위한 멀티모달 입력, 긴 컨텍스트 창, 큰 출력 한도, 그리고 OpenAI 호환 API를 갖춘 Google 모델이 필요한 팀을 대상으로 합니다. 광고된 입력 한도 내에서 긴 파일 분석, 녹취록 또는 영상 검토, 문서 추출, 다회차 콘텐츠 생성과 같은 애플리케이션에 적합합니다. 출력 한도가 65,536 토큰이므로 답변을…
명시된 역량은 광범위한 입력 지원, 1,048,576-토큰 컨텍스트, 65,536-토큰 출력 한도, HLE-Verified에서 54.9점입니다. HLE-Verified는 전문가 수준의 벤치마크이므로, 이 점수는 모델이 어려운 회상, 추론, 계산이 필요한 질문을 처리할 수 있음을 시사합니다. 텍스트, 이미지, 비디오, 파일, 오디오를 모두 입력받을 수 있으므로 단일 워크플로우에서 문서, 녹음 파일, 후속 지침을 함께 전달할 수 있습니다. OrcaRouter에서는 별도의 Google SDK가 필요하지 않습니다. 해당 모델은 표준 OpenAI 호환 API를 통해 google/gemini-3.8-flash로 제공됩니다. 이는 현재 chat completion 요청을 보내는 파이프라인에 편리합니다. 최대 출력 한도가 높기 때문에 모델은 전체 분량의 보고서, 코드 파일, 구조화된 출력을 단일 생성으로 만들어 낼 수 있습니다. 그렇다면 이 모델이 도구 호출, 코드 실행, 구조화된 출력을 지원한다는 뜻일까요? 카탈로그 기록에는 이러한 기능이 나열되어 있지 않습니다. 이러한 기능에 의존하기 전에 반드시 테스트를 수행해야 합니다.
1,048,576토큰 컨텍스트 창은 대용량 문서, 책, 방대한 파일 모음, 긴 녹음 내용이 포함된 프롬프트를 허용합니다. 이로 인해 소스 자료가 공급자의 한도에 맞으면 청킹, 검색 또는 다회차 요약의 필요성이 줄어듭니다. 또한 소스 텍스트, 작업 지시사항, 예시를 하나의 호출에 포함할 수 있습니다. 매우 긴 완성을 요청하면 실질적인 컨텍스트 예산은 더 작아질 수 있습니다. 이 목록에는 입력과 출력이 창을 어떻게 공유하는지 명시되어 있지 않기 때문입니다. 최대 신뢰성을 위해 모델이 가장 반응할 가능성이 높은 위치에 지시사항을 배치하고 자체 프롬프트 레이아웃으로 테스트하세요. 전체 요청이 공급자 한도를 초과하면 OrcaRouter는 업스트림 오류를 반환합니다. 긴 컨텍스트 호출은 토큰 기준으로 청구되므로 넓은 컨텍스트는 무료가 아닙니다. 입력 토큰은 1M당 $0.75가 청구됩니다. 창의 대부분이 관련 없는 작업의 경우 더 짧은 프롬프트도 더 낮은 비용으로 동일한 성능을 낼 수 있습니다.
모든 작업에 1,048,576토큰 컨텍스트, 멀티모달 입력, 또는 54.9 HLE-Verified 점수가 필요한 것은 아닙니다. 짧은 텍스트 분류, 제목 생성, 단순 라우팅, 또는 낮은 복잡도의 추출 작업에서는 더 저렴한 모델도 종종 더 낮은 비용으로 수용 가능한 출력을 만들어 냅니다. OrcaRouter에서 모델 ID를 전환해도 전체 API 패턴은 바뀌지 않으므로, 팀은 덜 비싼 모델로 프로토타입을 만들고 품질이나 길이 요구 사항이 있을 때만 google/gemini-3.8-flash로 전환할 수 있습니다. 워크로드가 텍스트와 작은 프롬프트만 사용한다면, 큰 컨텍스트와 미디어 지원은 부가 가치가 없습니다. 원하는 출력이 65,536토큰을 초과하면 이 모델은 단일 완성으로 생성할 수 없습니다. 가격 구조도 중요합니다. 출력 토큰은 1M당 $3.75로 입력 요금의 5배입니다. 생성이 많은 워크로드는 출력 비용이 지배적입니다. 이러한 경우 더 짧은 생성이나 덜 비싼 출력 모델이 종종 더 경제적입니다.
HLE-Verified는 Humanity's Last Exam 벤치마크의 검증된 하위 집합으로, 정확성이 확인된 어려운 전문가 수준의 질문들을 포함합니다. Gemini 3.8 Flash는 OrcaRouter 카탈로그에 따르면 해당 벤치마크에서 54.9를 달성했습니다. 점수가 높을수록 모델이 이러한 어려운 항목 중 더 많은 부분을 정확히 답한다는 의미입니다. 50점 이상이면 이 평가에서 모델이 검증된 HLE 항목의 절반 이상을 처리한다는 것을 나타냅니다. 이는 어려운 지식, 수학, 추론 작업을 위한 참고 지점이지 전체 품질 프로필은 아닙니다. 이 목록에는 다른 벤치마크 점수가 없으므로 MMLU, 코딩, 수학 또는 지시 수행 성능이 이 숫자에서 파생되지 않습니다. 프로덕션 품질은 작업 및 프롬프트 스타일에 따라 달라질 수 있으며, 벤치마크 수치도 평가 방법론의 영향을 받을 수 있습니다. 팀은 단일 종합 점수를 유일한 결정 기준으로 취급하기보다는 OrcaRouter를 통해 비공개 검증 예제를 실행하고 이 모델을 다른 후보와 비교해야 합니다.
65,536개 토큰의 최대 출력은 한 번 생성되는 응답의 길이에 상한선을 설정합니다. 이는 작업이 확장된 분석, 긴 문서 또는 대규모 구조화된 페이로드를 요구할 때 중요합니다. HLE-Verified와 같은 단답형 벤치마크 작업의 경우 출력 제한은 일반적으로 병목 현상이 아닙니다. 콘텐츠 생성의 경우 대부분의 일반적인 상황에서 출력을 분할할 필요가 없어집니다. 출력 제한은 1,048,576개 토큰의 컨텍스트 창과도 상호 작용합니다. 전체 컨텍스트를 채우는 프롬프트에 최대 길이 출력을 더하면 공급자가 입력 및 출력 허용량을 분리하지 않는 한 공급자의 총 예산을 초과할 수 있기 때문입니다. 이 카탈로그 레코드에는 해당 회계 규칙이 명시되어 있지 않습니다. 실제로는 항상 65,536을 사용하는 대신 필요한 가장 큰 값으로 max_tokens를 설정하세요. 긴 출력은 1M 토큰당 $3.75로 청구되므로 불필요한 생성은 비용을 증가시킵니다. 애플리케이션이 하나의 응답에서 65,536개 이상의 토큰을 필요로 하는 경우 이 모델만으로는 충분하지 않습니다.
OrcaRouter 카탈로그는 Gemini 3.8 Flash에 대한 지연 시간 또는 처리량 수치를 공개하지 않습니다. 응답 시간은 프롬프트 크기, 출력 길이, 네트워크 상태, 동시성, 그리고 공급자 측 부하에 따라 달라집니다. Google 모델 라인업에서 Flash라는 이름은 일반적으로 더 크거나 깊은 제품 라인보다 응답성이 더 좋은 모델을 의미하지만, 이 목록에는 구체적인 속도 목표가 제시되어 있지 않습니다. 사용자 대면 요청을 서빙하는 경우, 실제적인 페이로드로 OrcaRouter를 통한 종단 간 시간을 측정하십시오. 총 생성 시간은 일반적으로 출력 길이에 따라 증가하므로 짧은 답변은 긴 생성보다 더 빨리 나타납니다. 가격 모델은 요청당 지연 시간 수수료를 추가하지 않으며, 입력 및 출력 토큰 기준으로 지불합니다. 실제 경과 시간을 줄이려면 불필요한 콘텐츠를 프롬프트에서 제외하고, max_tokens를 제한하며, 필요하지 않은 경우 대용량 미디어를 보내지 마십시오. 이 카탈로그 페이지에서는 속도 보장이 제공되지 않으므로, 성능에 민감한 애플리케이션은 출시 전에 부하 테스트를 수행해야 합니다.
이 목록에는 별도의 제한 사항 보고서가 제공되지 않습니다. 문서화된 사실은 모델 이름, 제공업체, 컨텍스트 창, 최대 출력, 입력 형식, 가격, API 액세스 및 하나의 벤치마크 점수입니다. 이 레코드에는 도구 호출, 코드 실행, 이미지 생성, 오디오 출력 또는 구조화된 출력 지원에 대한 주장이 없습니다. 이러한 기능에 의존하기 전에 실제 요청으로 검증해야 합니다. 54.9 HLE-Verified 점수는 여전히 해당 벤치마크에서 검증된 전문가 수준 항목의 약 45%를 모델이 놓친다는 것을 의미하므로 완벽한 추론 엔진이 아닙니다. 큰 컨텍스트 창이 모든 콘텐츠에 동일한 주의를 기울인다는 것을 보장하지 않으며, 환각, 편향, 거부 또는 도메인 정확도 데이터는 나열되어 있지 않습니다. 미디어 입력이 지원되지만 카탈로그는 각 미디어 유형이 어떻게 토큰화되는지 또는 파일 크기에 적용되는 제한 사항을 명시하지 않습니다. 안전에 중요한 또는 규제된 출력의 경우 자체 검증을 구축하십시오. 작업이 지원되는 입력 또는 출력 범위를 벗어나면 일치하는 카탈로그 항목이 있는 모델을 선택하십시오.
Gemini 3.8 Flash는 제공업체 요금으로 청구됩니다: 입력 토큰 1,000,000개당 $0.75, 출력 토큰 1,000,000개당 $3.75. OrcaRouter는 해당 요금에 마크업을 전혀 추가하지 않습니다. 입력 토큰에는 모델에 제출된 텍스트와 미디어 콘텐츠가 포함되지만, 이 카탈로그는 이미지별, 비디오별, 또는 오디오별 토큰 공식을 제공하지 않습니다. 출력 토큰은 모델이 반환한 텍스트를 포함합니다. 출력 요금이 입력 요금의 5배이므로, 프롬프트가 크더라도 긴 답변이 청구 금액을 좌우할 수 있습니다. 비용을 관리하려면 관련 맥락을 제공하고 가능하면 간결한 응답을 요청하는 프롬프트를 작성하세요. 카탈로그에는 세션 요금, 플랫폼 요금, 또는 고정 구독 요금이 명시되어 있지 않습니다. 명시된 요금은 토큰당 금액뿐입니다. API가 반환한 응답 사용량 필드를 사용하여 각 호출에 대해 청구된 입력 및 출력 토큰 수를 확인해야 합니다.
백만 입력 토큰당 $0.75의 요율로, 전체 1,048,576토큰 프롬프트는 출력이 생성되기 전에 입력 비용으로 약 $0.79가 소요되며, 이는 명시된 가격과 컨텍스트 크기에 직접적으로 기반합니다. 전체 65,536토큰 출력은 백만 토큰당 $3.75의 요율로 약 $0.25가 소요됩니다. 전체 입력 창과 전체 출력 한도를 사용하는 요청은 마크업이 없는 제공업체 요율 기준으로 총 약 $1.04가 됩니다. 대부분의 실제 요청은 훨씬 적은 양을 사용하므로, 이러한 값은 일반적인 청구액이 아닌 상한 산술값으로 간주해야 합니다. 출력 토큰이 더 비싸기 때문에, 가장 비용 효율적인 설계는 모델이 실제로 필요한 콘텐츠만 전송하고 집중된 결과를 요청하는 방식입니다. 비디오 및 오디오 입력은 이 기록에 별도의 항목별 가격이 없으므로, 미디어가 풍부한 프롬프트의 총비용은 제공업체가 해당 입력을 토큰화하는 방식에 따라 달라집니다. 각 응답의 사용량을 모니터링하여 전체 지출을 정확하게 추정하십시오.
OrcaRouter는 Gemini 3.8 Flash를 마크업 없이 공급업체 요율로 제공하므로, 표시된 토큰당 가격은 업스트림 Google 공급업체 요율과 일치해야 합니다. 카탈로그 레코드에는 토큰당 추가 OrcaRouter 요금이 나타나지 않습니다. 캐싱은 별개의 문제입니다. 제공된 모델 정보에는 프롬프트 캐시 적중 가격, 캐시 할인 또는 자동 캐시 설정이 포함되어 있지 않습니다. 반복되는 동일한 프리픽스가 더 낮은 요율로 청구될 것이라고 가정해서는 안 됩니다. 나열된 캐시 가격이 없다는 것은 가장 안전한 비용 모델이 전체 입력 토큰 청구를 기준으로 한다는 것을 의미합니다. 캐싱이 제공되면 반복 프롬프트의 실질 비용이 줄어들 수 있지만, 이 항목에서는 해당 동작이 보장되지 않습니다. 캐싱 없이 비용을 통제하려면 공유 프롬프트 블록을 짧게 유지하고, 가능한 경우 대용량 정적 콘텐츠에는 외부 스토리지를 사용하며, 작업에 필요하지 않다면 중복 자료를 다시 전송하지 마십시오.
OrcaRouter 모델이 공급자 요금으로 청구되고 마크업이 전혀 없는 경우, 모델 간 가격 차이는 상위 공급자 요금에서 비롯됩니다. Gemini 3.8 Flash는 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75입니다. 다른 모델이 더 저렴한지 여부는 해당 모델의 공급자 요금에 따라 달라지며, 이 요금은 이 항목에 표시되지 않습니다. OrcaRouter에는 토큰별 수수료가 없으므로 가격 비교는 직접적입니다. 즉, 공급자 요금 열을 비교하면 됩니다. 가격만이 유일한 요소는 아닙니다. 사용할 수 없는 출력을 생성하는 저렴한 모델은 재시도, 인간 검토 또는 추가 프롬프트가 필요할 수 있으며, 결국 성공률이 더 높은 모델보다 더 비싸질 수 있습니다. 짧고 단순한 작업의 경우, 저비용 모델이 여전히 분명한 이점을 가집니다. 어려운 추론이나 멀티모달/장문 컨텍스트 작업의 경우, 성공적인 응답당 총 지출을 평가하세요. 기본 모델 ID를 선택하기 전에 자체 데이터셋에서 품질과 비용을 모두 측정하십시오.
OrcaRouter는 https://api.orcarouter.ai/v1에서 OpenAI 호환 API를 제공합니다. base_url을 해당 주소로 설정하고 model 필드를 google/gemini-3.8-flash로 설정하세요. OpenAI SDK 또는 OpenAI 채팅 완성 요청을 지원하는 모든 클라이언트는 모델을 호출할 수 있습니다. 예를 들어, Python 클라이언트는 base_url=https://api.orcarouter.ai/v1 및 api_key를 OrcaRouter 키로 설정하여 OpenAI를 인스턴스화한 다음 model=google/gemini-3.8-flash로 chat.completions.create를 호출합니다. 응답에는 일반적인 스타일의 choices 및 usage 필드가 포함되어야 합니다. 즉, 기존 코드에 Google 전용 클라이언트가 필요하지 않습니다. 이미지, 비디오, 파일 또는 오디오 입력의 경우 요청은 모델이 허용하고 OrcaRouter를 통해 전달되는 콘텐츠 형식을 사용해야 합니다. 이 카탈로그 페이지에는 미디어 스키마가 표시되지 않으므로 먼저 작은 요청을 테스트하세요. 모델 ID를 기록된 그대로(google 접두사 포함) 사용하세요.
최소한 모델을 google/gemini-3.8-flash로 설정하고 사용자 콘텐츠가 포함된 messages 배열을 제공하세요. 엔드포인트는 OpenAI 호환 방식이므로 max_tokens, temperature, top_p, stop, stream과 같은 표준 매개변수를 제공업체의 지원 여부에 따라 사용할 수 있습니다. 카탈로그 항목에는 샘플링 매개변수에 대한 기본값이나 범위 제한이 나열되어 있지 않습니다. 최대 출력이 65,536 토큰으로 명시되어 있으므로 그보다 높은 max_tokens를 설정하는 요청은 주의해야 합니다. 상위 모델이 이를 거부하거나 상한선을 적용할 수 있기 때문입니다. 작업에 긴 응답이 필요하면 max_tokens를 예상 길이로 명시적으로 설정하세요. 짧은 응답으로 충분하다면 불필요한 출력 비용을 피하기 위해 max_tokens를 낮게 유지하세요. messages 배열은 다른 OpenAI 스타일 모델에서 사용하는 것과 동일한 역할(role)을 사용해야 합니다. 미디어 입력의 경우 API 클라이언트가 사용하는 형식으로 미디어 콘텐츠를 추가하고 OrcaRouter가 입력 인코딩 오류 대신 유효한 완성(completion)을 반환하는지 확인하세요.
네. OrcaRouter는 OpenAI 호환 API를 사용하므로, 마이그레이션에는 일반적으로 세 가지 변경이 필요합니다: 기본 URL을 https://api.orcarouter.ai/v1로 설정하고, OrcaRouter API 키를 사용하며, 모델 이름을 google/gemini-3.8-flash로 변경하면 됩니다. choices[0].message.content 및 usage를 읽는 코드는 계속 작동해야 합니다. 텍스트 전용 워크플로는 문제없이 마이그레이션되어야 합니다. 멀티모달 워크플로는 덜 확실합니다. 현재 코드가 OpenAI 특정 콘텐츠 부분으로 이미지를 보내는 경우, 해당 필드는 Gemini 3.8 Flash에서 그대로 수용될 수도 있고 아닐 수도 있습니다. 카탈로그 레코드에는 미디어 변환 사양이 포함되어 있지 않습니다. 대용량 또는 미디어 중심 트래픽을 마이그레이션하기 전에 두 엔드포인트에 동일한 요청 세트를 소량 실행하여 응답과 오류 메시지를 비교하십시오. 마이그레이션 중에는 기존 모델 ID를 폴백으로 사용할 수 있게 유지하십시오. 동일한 API 형태를 통하더라도 한 모델의 동작이 다른 모델과 동일하다고 보장되지 않기 때문입니다.
이 카탈로그 페이지에는 Google 모델 하나만 포함되어 있으므로 다른 Gemini 변형과의 나란한 비교 표는 출력되지 않습니다. Google의 명명 체계에서 Flash는 일반적으로 속도와 비용의 균형을 목표로 하는 모델을 나타내는 반면, 다른 Gemini 등급은 더 높은 성능이나 다른 가격대를 목표로 할 수 있습니다. 이러한 주장은 이 항목의 사실로 뒷받침되지 않으므로 최종 선택은 모델별 카탈로그 필드를 기준으로 해야 합니다. 컨텍스트 창, 최대 출력, 입력 모달리티, 가격, 벤치마크 점수를 비교하세요. Gemini 3.8 Flash는 1,048,576토큰 컨텍스트, 65,536 최대 출력, 멀티모달 입력, 54.9 HLE-Verified 점수를 보유하고 있습니다. 다른 Gemini 모델은 더 작은 컨텍스트나 다른 가격을 가질 수 있지만 해당 정보는 여기에 제공되지 않습니다. 각 후보에 대해 OrcaRouter를 통해 동일한 평가 프롬프트를 실행하세요. 이는 동일한 공급업체의 두 모델이 동일한 동작을 공유한다고 가정하는 것보다 더 신뢰할 수 있습니다.
단순 작업의 경우, 토큰당 가격이 더 저렴한 모델이 비용 측면에서 Gemini 3.8 Flash를 이길 수 있습니다. Gemini 3.8 Flash는 입력 100만 개당 $0.75, 출력 100만 개당 $3.75를 청구합니다. 출력이 짧고 작업이 단순한 경우 더 낮은 요율의 다른 모델이 매력적일 수 있습니다. 그러나 가격만으로 총비용이 결정되지는 않습니다. 더 저렴한 모델이 재시작하거나 복잡한 요청에서 형편없는 답변을 생성하면, 추가 호출 비용이 절감액을 초과할 수 있습니다. Gemini 3.8 Flash의 주요 상쇄 강점은 54.9 HLE-Verified 점수, 멀티모달 입력, 대규모 컨텍스트, 긴 출력 제한입니다. 워크로드가 이러한 강점을 활용하지 않는다면, 더 저렴한 모델이 합리적인 선택입니다. OrcaRouter를 사용하여 대표 샘플에서 두 모델을 모두 실행하고 성공 결과당 정확도, 출력 길이, 총 지출을 비교하십시오. 컨텍스트 제한도 중요합니다. 윈도우가 더 작은 모델은 추가 검색이나 분할이 필요할 수 있어 통합 비용이 증가하기 때문입니다.
추론 특화 모델은 일반적으로 어려운 논리와 수학에 추가 계산을 투자하도록 최적화됩니다. 이 카탈로그 항목에는 비교를 위한 다른 모델이 포함되어 있지 않으므로 아래의 방향은 정성적입니다. Gemini 3.8 Flash는 워크로드가 긴 컨텍스트, 매우 긴 출력, 또는 텍스트와 이미지, 비디오, 파일, 오디오 입력을 필요로 할 때 적합합니다. 이러한 기능은 어려운 벤치마크에서의 추가 점수보다 더 중요할 수 있습니다. Flash 프로필은 또한 더 무거운 추론 모델보다 지연 시간이 낮은 옵션을 암시하지만, 여기에 속도 관련 주장은 명시되어 있지 않습니다. 작업이 어려운 증명, 코드 분석 또는 다단계 계획 질문이라면 google/gemini-3.8-flash를 자체 HLE 스타일 프롬프트에서 추론 모델과 비교하세요. 깊은 숙고가 필요하지 않다면 Flash급 모델이 더 높은 비용과 느린 응답을 피할 수 있습니다. 보편적인 승자는 없습니다. 결정 요인은 컨텍스트 크기, 모달리티 지원, 요구되는 지연 시간, 출력 길이, 그리고 측정된 작업 품질입니다.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-3.8-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 입력 / 1M tokens | $0.750 |
| 출력 / 1M tokens | $3.75 |
| 캐시 읽기 / 1M | $0.075 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
이번 주 개발자들의 이야기
@misc{orcarouter_gemini_3_8_flash,
title = {Gemini 3.8 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.8-flash}
}Google. (2026). Gemini 3.8 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.8-flash