
OpenCode에서의 DeepSeek V4.1 Flash: 설정, 비용, 그리고 아무도 언급하지 않는 에포트 다이얼
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 151 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 251 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
DeepSeek V4.1 Flash는 9월 10일부터 OpenCode Go에 자리 잡고 있으며, OpenCode가 여기에 붙인 배수에는 공개된 종료일이 있습니다: 9월 20일. 지금부터 나흘 뒤입니다. 흥미로운 점은 마감일이 아니라, 이 모델과 코딩하는 것이 즐거운지를 결정하는 설정이 검색 결과 첫 페이지의 모든 설정 가이드에서 빠져 있고, 적어도 두 개의 하네스에서는 조용히 무시된다는 점입니다. 이 글은 코딩 에이전트를 DeepSeek V4.1 Flash로 향하게 하기 위한 플레이북입니다: 정확한 모델 ID, 오늘 검증된 세 가지 통합, 커뮤니티에서 보고된 추론 노력(reasoning-effort) 제어, 그리고 실제로 효과가 있는 완화책과 함께하는 과잉 사고(overthinking) 실패 모드.
당신이 실제로 자신의 에이전트를 향하게 하고 있는 것
DeepSeek V4.1 Flash는 2026-09-10에 출시되었습니다. DeepSeek 자체 API 문서에 있는 릴리스 노트도 같은 날짜로 되어 있으며, 이 모델은 해당 공급업체의 새로운 아키텍처 제품군에서 가장 작은 모델입니다. DeepSeek에 따르면, 이 모델은 자체적으로 Causal Encoder–Decoder 설계라고 부르는 구조를 기반으로 한 552B 매개변수 전문가 혼합(mixture-of-experts) 백본을 갖추고 있으며, 프리필(prefill) 시 토큰당 약 8B, 디코드(decode) 시 16B의 매개변수를 활성화합니다. 텍스트와 이미지를 입력으로 받아 텍스트를 반환하고, 최대 100만 토큰의 컨텍스트 윈도우를 제공하며, 단일 응답에서 최대 384,000 토큰을 생성합니다. 컨텍스트와 출력 상한은 모두 OrcaRouter의 해당 모델 자체 페이지에서 비롯된 것으로, 해당 페이지에는 각각 1,048,576과 384,000으로 기재되어 있습니다.
벤더 벤치마크는 DeepSeek의 릴리스 페이지에 있는 차트에서 나온 것이므로 벤더가 보고한, 감사를 거치지 않은 수치입니다. Terminal-Bench 3.0에서 30.0, DeepSWE v1.1에서 74.2, CyberGym에서 88.1, Automation-Bench에서 54.8, GPQA Diamond에서 90.9입니다. 독립적인 평가는 더 드물지만 존재합니다. 오늘 직접 확인한 Artificial Analysis는 DeepSeek V4.1 Flash를 자사의 Intelligence Index에서 40으로 평가하며, 비교 클래스 113개 중 6위로 순위를 매겼습니다. 같은 페이지의 한 문장은 코딩 에이전트를 읽는 사람에게 순위보다 더 중요합니다. Artificial Analysis는 이 모델에 매우 장황함이라는 딱지를 붙였는데, Intelligence Index 실행을 완료하는 데 140M 중앙값에 비해 250M 출력 토큰을 소비했습니다. 이 점은 다시 다루겠습니다.
두 가지 이름 관련 사실만 알아도 실제 디버깅 시간을 아낄 수 있습니다. DeepSeek의 표준 API 모델 ID는 이제 code>deepseek-flash/code>입니다. 이전 문자열 code>deepseek-v4-flash/code>과 code>deepseek-v4-flash-vision-exp/code>도 여전히 허용되지만, 그 뒤에 있는 모델들은 은퇴했고 요청은 Flash 가격으로 V4.1 Flash가 처리합니다. 별개로, DeepSeek V4 Pro가 사라진 것은 아닙니다: DeepSeek 문서에 따르면 V4 Pro API 서비스는 2026-09-14 이후에도 요금 변경 없이 계속됩니다. 플래그십이 꺼졌다는 말을 들었다면, 그것은 벤더 자체 문서가 말하는 바가 아닙니다.

OpenCode: 두 가지 진입 경로, 그리고 실제로 입력해야 하는 id
OpenCode 뒤에 DeepSeek V4.1 Flash를 두는 방법에는 두 가지가 있으며, 이들은 경제성이 서로 다릅니다.
구독 경로는 OpenCode Go이며, OpenCode가 테스트와 벤치마크를 거친 엄선된 오픈 코딩 모델 모음이라고 설명하는 월 $10 요금제입니다. 설정은 네 단계이며 직접 편집할 구성 파일이 없습니다: OpenCode Zen에 로그인하고, Go를 구독하고, API 키를 복사한 다음, code>/connect/code>를 TUI에서 실행하고, OpenCode Go를 선택한 뒤 키를 붙여넣으세요. 그런 다음 code>/models/code>는 사용 가능한 항목을 나열합니다. 구성에서 모델 참조는 다음과 같은 형식을 취합니다: code>opencode-go/<model-id>/code>.
어떤 모델 ID 말인가요? 둘 다입니다. Go 게이트웨이 자체의 모델 목록은 오늘 code>https://opencode.ai/zen/go/v1/models/code>에서 가져왔으며, 다음을 반환합니다: code>deepseek-flash/code>와 code>deepseek-v4.1-flash/code>를 별개의 두 항목으로, 레거시 code>deepseek-v4-flash/code>와 code>deepseek-v4-pro/code>도 함께. 처음 두 개 중 어느 것이든 원하는 모델로 해석됩니다; code>deepseek-flash/code>가 정식 이름이며, 계속 실행하려는 모든 것에 더 안전한 선택입니다.
직접 경로는 구독을 완전히 건너뜁니다: 실행할 명령은 code>/connect/code>입니다. DeepSeek를 검색한 뒤 DeepSeek 플랫폼 키를 붙여넣으세요. 그러면 Go 할당량을 사용하는 대신 DeepSeek에서 정가로 청구됩니다. DeepSeek는 정가를 오프피크 기준 100만 입력 토큰당 $0.15, 100만 출력 토큰당 $0.60, 캐시 읽기는 100만 토큰당 $0.003으로 공개하며, 피크 시간에는 정확히 그 두 배입니다. OpenCode Go 문서와 OrcaRouter의 모델 페이지를 오늘 확인한 결과, 둘 다 이 수치에 일치합니다.
OpenCode Go가 추가하는 것은 할당량 구조이며, 여기서 숫자들은 주의 깊게 읽을 가치가 있습니다. 왜냐하면 그것들이 마감 기한이 중요한 이유이기 때문입니다. OpenCode 자체 문서에는 DeepSeek V4.1 Flash가 월 한도 $15로 등재되어 있으며, 현재 OpenCode가 "9월 20일 종료"라고 표시한 프로모션 아래에서 4배가 적용되어 $60입니다. 예상 요청 수는 두 개의 열로 공개됩니다. 표준 요율 기준으로 5시간당 6,500 / 주당 16,250 / 월당 32,500, 또는 4× 배수가 적용된 경우 26,000 / 65,000 / 130,000입니다. 할당량의 형태는 모델 전반에서 일관됩니다 — 5시간 한도는 월 수치의 20%, 주간 한도는 50%, 월간 한도는 전체입니다.
그것들은 OpenCode가 공개한 수치이며, 오늘 Go 문서에서 읽은 것입니다. 프로모션을 끝낼지는 그들의 몫이고, 그 프로모션에는 날짜가 정해져 있습니다.

Command Code: 여전히 살아 있고, 알아둘 만한 버그 리포트
Command Code 자체 카탈로그에는 오늘 기준으로 여전히 해당 모델이 id code>deepseek-v4-1-flash/code>로 등록되어 있으며, 1M 토큰 컨텍스트 윈도와 동일한 패스스루 요금 체계를 갖추고 있습니다: 비피크 시간대 $0.15 / $0.60, 피크 시간대 $0.30 / $1.20, 캐시 읽기 $0.003. 두 개의 독립적인 하네스에서 가격이 일치하는 것은 우연이 아닙니다 — 둘 다 자체 가격을 책정하는 것이 아니라 DeepSeek의 정가를 그대로 전달하고 있는 것입니다.
작동 방식은 간단합니다. 설치하려면 code>npm i -g command-code/code>, 프로젝트 디렉터리에서 실행한 다음, code>/login/code>으로 인증하고, code>/connect/code>는 자체 공급자 키를 사용하려는 경우에 사용하면 됩니다. code>/model <id>/code>는 모델 변경을 바로 적용하고, code>/model/code>만 입력하면 선택기가 열리며, code>/effort/code>는 현재 모델의 추론 노력을 설정합니다 — 여기서 가장 중요한 플래그입니다.
잘못된 계층을 디버깅하기 전에 머릿속에 새겨 둘 만한 커뮤니티 버그 보고서가 하나 있습니다. 타사 라우팅 계층에 대한 열린 이슈는 추론 리플레이 캐시가 code>command-code/deepseek-v4.1-flash/code> id에 대해 전혀 작동하지 않는다고 설명합니다. 왜냐하면 라우팅 계층이 매칭하는 패턴은 code>v4./code> 또는 code>v4-/code> 세그먼트를 기대하는데 문자열은 code>v4.1/code>이기 때문입니다. 보고된 증상은 사고 모드에서 생성된 추론 콘텐츠를 API로 다시 전달해야 한다는 메시지를 내는 업스트림 400 오류입니다. 이는 클라이언트 측 매처에 관한 커뮤니티 버그 보고서이며, 공급업체 지침도 아니고 모델의 문제도 아닙니다. 하지만 새벽 2시에 모델 결함처럼 보이는 바로 그런 종류의 일입니다.
Claude Code, Codex, 그리고 OpenCode 자체가 검증한 클라이언트
OpenCode Go는 OpenCode 전용이 아니며, 그들의 문서는 이를 명시적으로 밝히고 있습니다. 이는 OpenCode와 유사한 요청 패턴을 생성하는 다른 코딩 에이전트를 위해 설계되었으며, 작동이 검증된 클라이언트 목록도 공개되어 있습니다. 현재 그 목록에는 Hermes, Claude Code, Codex, ZCode, Pi가 이름을 올리고 있으며, Claude Code에 대해서는 "네이티브 세션 헤더를 인식하므로 커스텀 헤더 래퍼가 필요하지 않습니다"라는 설명이 붙어 있습니다. 여기에는 두 가지 요구 사항이 따릅니다. 일반적인 SDK 이름 대신 클라이언트 자체의 사용자 에이전트로 클라이언트를 식별하고, 각 대화마다 안정적인 세션 식별자를code>x-opencode-session/code> 헤더에 보내야 하며, 이것이 바로 그들의 라우팅과 프롬프트 캐싱을 작동하게 하는 것입니다. Hermes의 경우 검증된 빌드가 중요합니다. 헤더 수정이 v0.21.0 이후에 병합되었으므로, 해당 릴리스만으로는 이 수정을 포함하지 않습니다.
구독이 전혀 연결되어 있지 않은, DeepSeek의 Anthropic 호환 엔드포인트를 직접 사용하는 경로도 있습니다. code>ANTHROPIC_BASE_URL/code>을 code>https://api.deepseek.com/anthropic/code>으로 설정하고, code>ANTHROPIC_AUTH_TOKEN/code>은 DeepSeek 키로 설정한 뒤 모델 변수들이 해당 모델을 가리키게 하세요. Claude 모델 이름은 들어오는 과정에서 재매핑됩니다. code>claude-opus/code>로 시작하는 이름은 모두 DeepSeek V4 Pro로 연결되어 V4 Pro 가격으로 청구되는 반면, code>claude-sonnet/code> 및 code>claude-haiku/code> 이름은 Flash 모델로 연결됩니다. 모델 문자열에 붙는 code>[1m]/code> 접미사는 백만 토큰 컨텍스트 변형을 요청합니다. 이 설정에 관한 DeepSeek의 자체 가이드에서도 code>CLAUDE_CODE_EFFORT_LEVEL=max/code>를 설정하고 자동 압축 창을 786432 토큰으로 고정합니다.
그 마지막 변수가 바로 커뮤니티 수정이 있는 곳이다. 우회 프록시가 존재하는 이유는 최근 Claude Code 빌드가 code>thinking: {"type": "disabled"}/code>를 하위 에이전트 요청에서 보내는 한편, code>CLAUDE_CODE_EFFORT_LEVEL=max/code>는 추론 노력 파라미터를 추가하는데, DeepSeek의 Anthropic 형식 엔드포인트는 추론 노력이 설정된 경우에는 thinking 옵션을 비활성화할 수 없다는 메시지와 함께 그 조합을 거부하기 때문이다. 보고된 우회 방법은 범위가 좁다 — 하위 에이전트 요청에서만 effort 파라미터를 제거하고, 메인 에이전트는 그대로 둔다. 이를 클라이언트/서버 계약 불일치에 관한 커뮤니티 발견으로 취급하고, 정확한 버전 경계가 이동할 것으로 예상하라.
노력 다이얼: 1–100, 그리고 "낮음"이 50을 의미하는 이유
이 섹션의 모든 내용은 벤더 지침이라기보다 커뮤니티에서 발견된 것입니다. DeepSeek은 우리가 검증할 수 있는 프리셋-숫자 매핑을 공개하지 않으며, 아래 숫자들은 실무자들의 글과 타사 하네스 문서에서 나온 것입니다. 이는 여러 출처에 걸쳐 유용할 만큼 일관되지만, 확정되지 않았기에 여러분의 작업에서 직접 테스트해 보아야 합니다.
DeepSeek V4.1 Flash는 1부터 100까지의 연속적인 추론 노력 스칼라로 훈련됩니다. 이는 토큰 상한이 아닙니다 — 훈련 과정이 학습한 곡선상에서 모델이 어디에 위치하는지를 움직이는 것으로, 낮은 노력은 더 간결해지도록 더 많은 압력을 가하고 높은 노력은 추가 추론을 더 저렴하게 만듭니다. 세 가지 공개 프리셋이 그 척도에 대응합니다:
• 낮음 — 50, 가장 짧은 경로, 그리고 이 컨트롤에 '싸구려'라는 평판을 안겨준 프리셋.
• 높음 — 75, 그리고 대부분의 커뮤니티 자료에서 에이전트 작업의 합리적인 상한선으로 설명하는 수준입니다.
• Max — 100, 이 경우 추론 길이에 대한 페널티가 완전히 제거됩니다.
다이얼이 주는 것은 실재하지만 급격히 줄어듭니다. 한 커뮤니티 벤치마크 스윕은 effort를 25에서 100으로 높이자 Terminal-Bench 2.1이 82.4에서 90.6으로 올라간 반면, 전반적인 출력 토큰은 대략 2.5배가 되었다고 보고했습니다. 여러 보고서는 effort 60에서 80 사이 어딘가가 토큰 예산의 절반 미만으로 가용 정확도의 대부분을 확보한다는 점에 수렴하며, max는 한계적 이득을 위해 에이전트 궤적에 1.6–1.8배를 추가로 더합니다.
기본값은 아무도 합의하지 못하는 부분입니다. 일부 하네스 문서와 실무자 보고서는 설정되지 않은 effort가 high로 귀결된다고 말하고, 다른 이들은 서버 기본값을 단순히 알 수 없다고 설명합니다. 논쟁이 아니라 문서로 확인된 것은 두 하네스 통합이 매개변수를 전혀 보내지 못하는 것이 발견되었다는 점입니다 — OpenCode Go 공급자 프로필과 네이티브 DeepSeek 프로필 모두 code>reasoning_effort/code>를 code>deepseek-flash/code> 슬러그에 대해, 그들의 match guard가 정규 ID에 없는 code>deepseek-v…/code> 접두사를 기대했기 때문에 내보내지 못했습니다. 두 경우 모두 사용자가 선택한 설정이 공급자 기본값으로 조용히 대체되었습니다. 클라이언트에 effort 컨트롤이 표시된다고 해서 그것이 전송된다는 증거는 아닙니다. 요청 본문 하나를 기록해 보고 확인하세요.
같은 보고서들에서 나온 또 하나의 특이점: OpenCode Go 엔드포인트는 다음 값을 허용합니다: code>low/code>, code>medium/code>, code>high/code> 및 code>max/code>, 하지만 정수형 effort는 거부합니다 — 80이라는 값이 HTTP 400을 반환하는 것으로 보고되었습니다. 1–100 다이얼은 모델에 존재하지만 모든 곳에서 원시 숫자로 노출되는 것은 아니므로, "effort를 65로 설정"은 클라이언트에서 표현하지 못할 수 있습니다.
과잉 사고 실패 모드, 그리고 실제로それを 고치는 방법
이것은 모델을 작업 루프에 계속 둘지 결정하는 실패 모드입니다. 커뮤니티 보고서에 따르면 DeepSeek V4.1 Flash는 작업이 끝난 뒤에도 계속 추론합니다: 이미 올바르게 답한 논점을 다시 논쟁하고, 자신의 잘못된 가정을 바로잡는 과정을 줄줄이 설명하며, 정보 밀도가 낮은 긴 추론 사슬을 생성합니다. 한 실무자는 코딩 CLI 세션 안에서 추론 출력이 한 시간 넘게 계속되었다고 보고했습니다. 또 다른 실무자는 긴 벤치마크 실행을 끝내게 하는 것 자체가 불가능했다고 보고했습니다.
그 두 번째 보고서에 관한 출처 메모입니다. 이런 종류의 주장은 세탁되기 쉽기 때문입니다. 이는 모델을 안정적으로 실행하는 방법에 관한 커뮤니티 스레드에서 나온 것인데, Reddit이 우리 페처를 차단해서 그 스레드를 직접 읽을 수 없었습니다 — 우리가 연 페이지를 인용하는 것이 아니라 그 보고를 전달하는 것입니다. 우리가 독립적으로 확인할 수 있었던 것은 문제의 형태이며, 그 부분에서 외부 증거는 이례적으로 깔끔합니다. Artificial Analysis는 자체 페이지에서 이 모델을 매우 장황하다고 지적하며, 중간값 비교 모델이 140M으로 끝내는 실행을 완료하는 데 250M 출력 토큰을 소비한다고 밝힙니다. 이는 고정된 작업 세트에서 제3자가 측정한 기준으로 대략 1.8배입니다. 포럼 보고와 독립 지표는 같은 행태를 설명하고 있습니다.
그 보고서들에서 나온 완화 조치들, 모두 커뮤니티에서 제공된:
• 노력 수준을 high 이하로 고정하고, 그것이 점증하도록 내버려 두지 마십시오. 현장에서 목격된 가장 명시적인 해결책은 노력 에스컬레이션을 막기 위해 특별히 작성된 라우팅 플러그인입니다. 턴 깊이는 에스컬레이션 점수에 아무것도 기여하지 않고, 실패한 도구 결과나 동일한 재시도만 점수로 계산되며, 에스컬레이션에는 상한이 있고, max는 옵트인 방식이며 기본적으로 강등됩니다. 당신의 하네스가 실행이 길어질수록 에이전트가 스스로 노력을 높이도록 허용한다면, 그것이 꺼야 할 메커니즘입니다.
• 기본값으로 max를 실행하지 마세요. 여러 실무자들은 일상적인 작업에서 max가 수렴하지 않고 제자리를 맴돌며, 다시 high로 전환해야 해결된다고 보고합니다.
• code>max_tokens/code>에는 대화형 경로에서 상한을 두세요. 384,000토큰 출력 상한은 목표가 아니라 한계일 뿐이며, 종료되지 않는 루프는 그 상한에서 비용이 많이 듭니다.
• 파라미터가 실제로 전송되는지 확인하세요. 두 개의 하네스가 이 파라미터를 조용히 누락시키는 사례가 발견된 만큼, "high로 설정했다"와 "high가 API에 도달했다"는 서로 다른 주장입니다.
• 하네스는 예상보다 훨씬 더 중요하다. 동일한 가중치를 실행하는 실무자들은 셸에 따라 행동이 크게 다르다고 보고한다 — 한 하네스에서는 스스로와 다투고 신호를 묻어버리는 같은 모델이 다른 하네스에서는 그러한 불만을 전혀 받지 않는다. 이는 하네스 동작에 관한 커뮤니티 관찰이며, 모델에 대한 벤더의 주장은 아니지만, 보고서에서 가장 자주 반복되는 조언이다.
이 요금 기준으로 코딩 루프에 실제로 드는 비용
DeepSeek의 정가는 비피크 시간대 기준 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.60입니다 — 출력이 입력의 네 배라는 점은 코드뿐 아니라 추론까지 생성하는 에이전트에 대해 가장 먼저 체득해야 할 사실입니다.
현실적인 에이전트 턴 하나를 생각해 보자: 컨텍스트 60,000토큰(시스템 프롬프트, 도구 스키마, 레포 슬라이스, 대화 기록)이 입력되고, 추론 3,000토큰과 패치가 출력된다. 이는 60,000 × $0.15/1M = $0.009 입력 비용에 3,000 × $0.60/1M = $0.0018 출력 비용을 더한 것으로, 턴당 약 1.1센트다. 근무일 하루에 그런 턴이 200번이면 대략 $2.16이고, 오프피크 요금 기준으로 한 달 평일 동안 약 $47이다. 바로 이 계산이 4× 프로모션이 붙은 월 $15 허용량을 넉넉해 보이게 만들고, 장황함을 주시해야 할 대상으로 만드는 계산이다.
왜냐하면 바로 여기에 그 Artificial Analysis 수치에 숨어 있는 지렛대가 있다. 고정된 작업 세트에서 모델이 중앙값의 1.8배에 해당하는 출력 토큰을 사용한다는 것은, 출력에 의해 좌우되는 루프가 토큰 가격만으로 시사되는 비용의 1.8배가 든다는 뜻이다. 그리고 effort 다이얼이 바로 그것을 제어하는 수단이다. 커뮤니티 보고에서는 max에서 high로 내리는 것이 출력 토큰을 대략 절반으로 줄이는 것으로 본다 — 이는 peak/off-peak 스케줄이 당신에게 일으킬 어떤 변화보다도 훨씬 큰 폭이다. effort 설정은 큰 레버이고, 스케줄은 공짜 레버다.
무엇이든 스케줄하기 전에 알아둘 만한 점: 피크 시간은 월요일부터 금요일까지 UTC 01:00–04:00 및 06:00–10:00이고, 주말을 포함한 나머지 모든 시간은 비피크입니다. CET 기준 09:00–18:00에 일하는 유럽 팀은 피크 시간대에 전혀 해당하지 않습니다. 같은 현지 시간에 일하는 베이징 팀은 09:00–12:00과 14:00–18:00에 피크 시간대를 맞이합니다 — 9시간의 근무 시간 중 7시간이 두 배 가격입니다. 같은 모델, 같은 코드, 두 배의 청구액, 전적으로 시간대에 따라 결정됩니다.
또 다른 무료 절감은 캐시 읽기 요금으로, 100만 개당 $0.003이며 신규 입력의 $0.15에 비해 50분의 1입니다. 코딩 에이전트의 프롬프트는 대부분 안정적인 프리픽스입니다: 시스템 지시문, 도구 정의, 리포지토리에서 변하지 않는 부분들. 안정적인 내용을 앞에 두고 가변 내용을 그 뒤에 이어지게 하면, 나머지는 제공자 측 캐시가 알아서 처리합니다. 할인된 캐시 입력이 적용되는지, 어떤 조건에서 적용되는지는 클라이언트가 아니라 DeepSeek가 정하므로, 이를 토대로 예산을 세우기 전에 최신 문서에서 확인하세요 —code>deepseek/deepseek-v4.1-flash/code>에 관한 저희 자체 모델 페이지도 같은 내용, 즉 캐시 입력 요금은 제공자의 약관을 따른다는 점을 말하고 있습니다.
모델을 평가하기 위해 두 번째 구독을 추가하고 싶지 않다면, 동일한 id를 전체 카탈로그 앞단에 있는 하나의 OpenAI 호환 엔드포인트를 통해 이용할 수 있습니다. 공급자 요율에 0% 마크업으로 제공되므로, DeepSeek 측의 가격 변경이 다음 재가격 책정 시점이 아니라 같은 날 바로 여기에 반영됩니다. 이 점은 이 글에서 설명하는 바로 그 상황, 즉 계속 이어가려는 경향이 문서로 확인된 모델을 아직 평가를 끝내지 못한 경로에서 사용하는 경우에 가장 중요합니다. 폴백 체인이란 응답이 시작되기 전에 잘못된 턴이 다른 모델로 넘어가게 함으로써 요청이 실패하는 대신 처리되도록 하는 것을 의미합니다.
552B, 748B, 또는 763B — 크기 문제는 정말로 열려 있다
이 모델의 파라미터 수를 확정된 것으로 반복하지 마세요. 서로 다른 세 개의 숫자가 회자되고 있고, 그중 어느 것도 단순히 틀린 것은 아니기 때문입니다.
DeepSeek 자체 모델 카드에는 "552B 백본 파라미터" 모델이라고 설명되어 있으며, 이는 벤더가 보고한 수치입니다. 또한 우리 자체 모델 페이지의 사양 패널에 실린 수치이기도 합니다. 같은 카드에는 196B 파라미터의 "Engram 조건부 메모리" 모듈이 별도로 기재되어 있는데, "토큰 기반 조회를 통해 희소하게 액세스"됩니다. 두 수치를 더하면 748B가 되며, 이는 출시 후 몇 시간 안에 커뮤니티 분석이 도출한 계산입니다. 그리고 동일한 모델 저장소의 파일 메타데이터에는 모델 크기가 763B 파라미터로 기재되어 있는데, 이는 또 세 번째 수치입니다.
겉으로 드러난 논쟁은 모순이라기보다 정의의 문제다. 조회되는 Engram 파라미터는 메모리를 소모하지만 토큰당 거의 산술 연산을 쓰지 않는 반면, 계산되는 백본 파라미터는 매 토큰마다 시간을 소모한다 — 바로 그래서 벤더가 이 둘을 별도로 보고하는 것이고, 아키텍처가 다른 두 모델의 대표 수치를 비교하는 것은 거의 아무것도 알려주지 않는다.
진지하게 논란이 되지 않는 것은 활성 파라미터 수다: 프리필 동안 토큰당 대략 8B, 디코드 동안 16B이며, 이는 실제로 추론 비용을 좌우하는 수치다. 가중치는 MIT 라이선스로 공개되어 있으니 이 중 무엇이든 직접 확인하고 싶다면 가능하다. 552B는 공급업체 보고치로, 748B는 신뢰할 만한 커뮤니티 총계로 취급하고, 크기 문제가 종결되었다는 어떤 주장도 시기상조로 취급하라.

20일 전에 무엇을 해야 할까요
코딩 에이전트에서 DeepSeek V4.1 Flash를 사용해 볼 생각이라면, 시간을 가장 적게 낭비하는 순서는 다음과 같습니다: 먼저 하네스를 고르고, 그다음 effort를 고정하고, 그다음 측정하세요.
하네스에서 오늘 검증에 대해 솔직히 요약하자면, 세 경로 모두 작동하며 각기 여러분에게 요구하는 바가 다릅니다. OpenCode Go는 9월 20일에 만료되는 프로모션 배율이 적용된 월 $10 구독이며, 설정은 code>/connect/code>와 code>/models/code>만 하면 되고 편집할 파일이 없습니다. Command Code는 자체 카탈로그에 모델을 실시간으로 표시하고 code>/model <id>/code>로 전환하며, effort를 일급 명령으로 제공합니다. Claude Code는 OpenCode Go의 검증된 클라이언트 경로를 통하거나 — 여기서는 사용자 지정 헤더 래퍼가 필요 없습니다 — DeepSeek의 Anthropic 형식 엔드포인트에 직접 연결하여 도달하는데, 후자의 경우 서브에이전트 effort 충돌이 알려진 거친 부분입니다.
effort는 명시적으로 설정하고, 다소 낮게 잡으세요: high, 또는 high가 결국 그 값이라면 모델 기본값으로, 그리고 max는 아닙니다. 그런 다음 그것이 정말 당신의 머신을 떠났는지 확인하세요. 두 개의 하네스가 그것을 누락시키는 것이 발견됐기 때문입니다.
측정할 때는 실제 경과 시간이 아니라 출력 토큰을 보세요. 장황함은 비용이고, 노력 다이얼은 통제 수단이며, 피크 스케줄은 공짜로 피할 수 있는 시간대의 우연일 뿐입니다.
이번 주에 여러분에게 인용될 크기 주장들 — 552B, 748B, 763B —에 대한 유용한 대응은 이렇습니다. 벤더는 자기 백본을 보고하고, 커뮤니티는 메모리 모듈을 더하며, 저장소 메타데이터는 또 다른 말을 합니다. 그중 하나를 확정된 답으로 내세우는 사람은 숫자를 확인한 것이 아니라 숫자를 골라낸 것뿐입니다.
