
Inkling AI 모델 리뷰: Thinking Machines의 첫 번째 오픈 가중치 모델, 테스트 및 설명
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 2030 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3055지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1653지능69코딩60수학
이 Inkling AI 모델 리뷰 는 전 OpenAI CTO Mira Murati가 이끄는 스타트업인 Thinking Machines Lab의 데뷔 출시작을 면밀히 살펴봅니다. Inkling은 오픈 가중치, 멀티모달 Mixture-of-Experts (MoE) 모델로, 100만 토큰 컨텍스트 윈도우와 제어 가능한 “사고 노력” 다이얼을 갖추고 있습니다. 빠르고 자체 호스팅 비용이 저렴하며, 리더보드 점수보다는 커스터마이제이션에 중점을 두고 설계되었습니다. 아래에서는 공급업체의 자체 보고 벤치마크와 독립적인 측정을 구분하고, 아키텍처를 살펴보며, 실행 방법을 보여주고, 정확히 누가 채택해야 하고 하지 말아야 하는지 설명합니다.
기준일: 2026-07-16 — 출시 하루 후. 이는 연구 기반 리뷰입니다; 이렇게 새로운 모델에 대한 장기 실전 테스트는 아직 존재하지 않으며, 아래의 모든 검증되지 않은 수치에 플래그를 표시합니다.
빌더를 위한 참고 사항: Inkling을 다른 모델과 함께 사용해보고 싶다면, OrcaRouter는 API-available 모델들을 단일 OpenAI 호환 엔드포인트로 제공하여, 새로운 통합 없이 비교하고 전환할 수 있습니다.
- TL;DR 평결: Inkling은 진정으로 유능하고 효율적인 오픈 모델로, 미세 조정 및 비용 민감 배포에 뛰어나지만 최첨단 선두주자는 아니며 제작사도 이를 공개적으로 인정합니다. 맞춤 설정 가능하고 로열티가 없는 큰 컨텍스트 윈도우를 가진 베이스를 원한다면, 이는 2026년 가장 흥미로운 출시작 중 하나입니다. 단일 최고 성능 모델을 원한다면 다른 곳을 찾아보십시오.
- 정의:오픈 가중치(Apache 2.0) MoE 추론 모델. 대상: 폐쇄형 최첨단 API에 비용을 지불하는 대신 파인튜닝 및 자체 호스팅을 원하는 실무자.
주요 시사점
제조사 및 날짜: Thinking Machines Lab; 2026년 7월 15일에 실험실의 첫 번째 모델로 출시됨.
아키텍처: Sparse MoE, 총 975B / 활성 파라미터 41B, 66개 레이어, 가중치 내 최대 1M 토큰 컨텍스트 (호스팅 API를 통해 256K).
라이선스: Apache 2.0 — Hugging Face에서 전체 가중치 제공, 상업적 사용 및 자체 호스팅 무료.
정직한 포지셔닝: 회사는 자사 모델이 “오늘날 사용 가능한 가장 강력한 모델(폐쇄형 또는 개방형)이 아니다”라고 솔직히 밝힙니다.
독립 점수: 41/100 (Artificial Analysis Intelligence Index 기준) — 97개 모델 중 10위, 그리고 여러 오픈 피어보다 앞서 있습니다 (아래 조정 내용 참조).
비용: 가중치는 자체 호스팅 시 로열티 프리입니다; 호스팅 접속은 약 1M 입력 토큰당 $1.87부터 시작합니다.
주의: 거의 모든 주요 벤치마크는 공급업체가 자체 보고한 것이며 독립적으로 감사되지 않았습니다.
Inkling의 배후는 누구인가?
- Founder box.Inkling은 첫 번째 모델로 Thinking Machines Lab(thinkingmachines.ai)에서 설립되었으며, Mira Murati(전 OpenAI 최고 기술 책임자)가 주도합니다. 이 연구소는 이번 출시 전까지 비교적 은밀하게 운영되었으며, 무라티의 전 직장이 채택한 폐쇄형 플래그십 접근 방식과 대조적으로 오픈 웨이트(open-weights) 입장을 취했습니다. Thinking Machines는 not 모델 자체에서 수익을 창출하지 않으며, 수익은 Tinker 미세 조정 플랫폼과 제3자 호스팅 파트너를 통해 발생합니다. 이 비즈니스 모델이 Inkling을 이해하는 핵심입니다. 즉, 가중치는 무료 온램프 역할을 하고, 회사는 사용자가 모델을 맞춤화하거나 확장할 때 수익을 얻습니다.
Inkling이란 무엇인가요?
Inkling은 오픈 가중치(open-weights), 멀티모달(multimodal), Mixture-of-Experts 대규모 언어 및 추론 모델로, Thinking Machines Lab이 2026년 7월 15일에 발표하고 허가 조건인Apache 2.0 라이선스로 전체 가중치를 Hugging Face에 공개했습니다.
이번 출시가 주목할 만한 이유는 그 프레이밍에 있다. 최전선의 왕관을 주장하기보다는, Thinking Machines는 Inkling을 다재다능하고 효율적이며 맞춤 설정이 가능한 오픈 모델이라고 설명한다. 출시일로서는 이례적으로 솔직한 인정으로, 회사는 Inkling이 “오늘날 사용 가능한 모델 중 가장 강력한 모델은 아닙니다, 폐쇄형이든 오픈형이든.” 그 정직함이 이 리뷰 전체의 분위기를 결정한다: Inkling은 벤치마크 트로피가 아니라 적응, 자체 호스팅, 미세 조정이 가능하도록 설계된 도구이다.
Fortune과 TechCrunch의 보도도 이 같은 해석을 반영했다. TechCrunch는 Inkling이 최첨단 계층에서 OpenAI, Anthropic, 또는 Google을 위협하지는 않지만, 대신 오픈 웨이트 호스팅 제공업체와 파인튜닝 플랫폼의 중간 계층에 압력을 가한다고 주장했다. Forbes는 Murati의 오픈 웨이트 전략이 폐쇄적인 미국 주력 모델보다는 중국의 오픈 모델 전략(DeepSeek, Qwen, Kimi)에 더 가깝다고 평가했다 — 이는 출시 관련 논평 전반에 걸쳐 나타나는 미국 대 중국의 오픈 웨이트 서사이다.
아키텍처 및 사양
내부적으로 Inkling은 희소 혼합 전문가 트랜스포머입니다. 각 토큰당 매개변수의 일부만 활성화되므로, 총 매개변수 수가 많음에도 불구하고 추론 효율이 유지됩니다. 자세한 내용은 공식 모델 카드와 Hugging Face 블로그에 문서화되어 있습니다.
총 파라미터: 975B
활성 매개변수: 41B (희소 MoE)
층: 66층 디코더 전용 트랜스포머
전문가: 라우팅된 256개 + 공유된 2개; 토큰당 라우팅된 256개 중 6개 (공유된 2개는 항상 활성화됨)
라우팅: 시그모이드 / 보조 손실 없음
주의: 하이브리드, 5:1 슬라이딩 윈도우(로컬)에서 글로벌로; 8 KV 헤드
위치 인코딩: 학습된 상대 위치 임베딩 (RoPE 아님)
멀티모달리티: 인코더 프리 — 오디오는 dMel 스펙트로그램, 이미지는 40×40 패치로 직접 입력됨
추가: 짧은 컨볼루션 (SConv); MTP 레이어추측 디코딩을 위한
수치: BF16, MXFP8, NVFP4 (NVFP4 NVIDIA Blackwell용 체크포인트)
컨텍스트 창: 최대 1,000,000개의 토큰 (가중치 기준) (호스팅 API에서는 256K)
더 작은 변형: Inkling-Small, 총 276B / 활성 12B (프리뷰, 가중치 아직 공개되지 않음)

몇 가지 디자인 선택이 Inkling을 일반적인 MoE와 차별화합니다:
전문가 배치. 256개의 라우팅된 전문가와 2개의 공유 전문가가 있으며, 토큰당 6개의 라우팅된 전문가가 활성화됩니다. 공유 쌍은 항상 켜져 있는 "expert sink" 역할을 하여 공통 계산을 처리하고, 라우팅된 전문가는 특화된 작업을 수행합니다. 보조 손실 없는 시그모이드 라우팅은 많은 MoE 설계에서 사용되는 부하 분산 페널티 항을 피합니다.
상대 위치 임베딩, RoPE가 아닙니다. 대부분의 현대적인 긴 컨텍스트 모델은 회전 임베딩을 사용하지만, Inkling은 대신 학습된 상대 위치 임베딩을 사용합니다. 이는 이 규모에서 드문 선택입니다.
인코더 없는 멀티모달리티. 별도의 비전/오디오 인코더를 부착하는 대신, Inkling은 40×40 이미지 패치와 dMel 오디오 스펙트로그램을 트랜스포머 스택에 직접 입력합니다. 이는 파이프라인을 단순화하며, 모델이 기본적으로 멀티모달로 설명되는 이유 중 하나입니다.
MTP는 추론적 디코딩을 위한 것입니다.다중 토큰 예측(MTP) 레이어는 내장된 드래프터 역할을 하여, 별도의 드래프트 모델 없이 생성을 가속화합니다.
편집자 주 — 시각 자료 추가: 하나의 Inkling 레이어의 라벨이 있는 블록 다이어그램 — 슬라이딩 윈도우 대 글로벌 어텐션 (5:1), 256+2 전문가 라우터 (6개의 활성 전문가가 강조 표시됨), SConv 및 MTP 드래프터 헤드.
훈련 및 "사고 노력" 다이얼
Inkling은 다음에 대해 사전 학습되었습니다: 45조 개의 멀티모달 토큰 텍스트, 이미지, 오디오, 비디오를 포함하며, 하이브리드 최적화기(Muon은 대규모 행렬 가중치, Adam은 나머지)를 NVIDIA GB300 NVL72 시스템에서 사용했습니다. 사후 학습은 대규모 비동기 강화 학습을 사용했으며, 확장되어 30M+ 롤아웃 두 번의 긴 연속 실행에 걸쳐 있으며, 초기 합성 데이터에 대한 지도 미세 조정에서 부트스트래핑되었습니다.
특징적인 기능은 제어 가능한 추론 노력 매개변수로, 대략 0.2에서 0.99까지 스윕하는 것으로 시연되었습니다. 더 높은 값은 더 많은 추론과 더 많은 비용을 의미합니다. 이를 통해 운영자는 지연 시간과 지출을 사고의 깊이와 맞바꿀 수 있습니다. 아래의 모든 벤치마크 수치는 Effort = 0.99로 실행되었습니다.
제어 가능한 사고 노력: 운영 가이드
배포 시, 노력 제어는 reasoning_effort 열거형으로 노출되며 수준은 없음 / 최소 / 낮음 / 중간 / 높음 / 매우 높음 / 최대. 단일 '올바른' 설정은 없습니다. 이는 지연 시간-비용-품질 트레이드오프를 위한 실시간 조절 장치입니다. 아래 표를 시작 지도(상대적 지침; 벤치마크 등급 품질은 범위 상단에서 측정됨)로 사용하십시오:
없음 / 최소. 상대적 지연 시간 및 토큰 비용: 가장 낮음; 최적 대상: 분류, 추출, 포맷팅, 라우팅, 검색 접착
낮음. 상대적 지연 시간 및 토큰 비용: 낮음; 적합 대상: 짧은 Q&A, 간단한 요약, 대량 배치 작업
중간. 상대적 지연 시간 및 토큰 비용: 보통; 최적 용도: 일반 대화, 초안 작성, 대부분의 에이전트 도구 호출
높음. 상대적 지연 시간 및 토큰 비용: 높음; 최적 용도: 다단계 추론, 코드 생성, 분석
xhigh / max. 상대적 지연 시간 및 토큰 비용: 가장 높음; 최적 대상: 어려운 수학, 대회 스타일 추론, 벤치마크 동등성 (Effort=0.99)

로컬에서 실행할 수 있나요? 하드웨어 및 VRAM
Inkling은 975B-파라미터 모델이기 때문에, "로컬"은 현실적으로 노트북이 아닌 멀티-GPU 서버를 의미합니다. 대략적인 요구 사항(출시 보도 및 커뮤니티 도구 기준):
BF16 (full). 대략적인 총 VRAM: ~2 TB; 예시 구성: 8× NVIDIA B300 또는 16× H200
NVFP4 (양자화). 대략 총 VRAM: ~600 GB; 예시 구성: 4× NVIDIA B300, 또는 8× H200
GGUF (커뮤니티). 대략적인 집계 VRAM: quant에 따라 다름; 예시 구성: Unsloth GGUF 빌드는 더 작거나 양자화된 풋프린트용으로 존재합니다
NVFP4 체크포인트 — NVIDIA Blackwell용으로 특별히 출시된 — BF16 대비 메모리 비용을 약 2/3 절감하며, 이는 8-GPU B300 노드와 4-GPU B300 노드의 차이에 해당합니다. 대부분의 팀에게 이는 여전히 자체 하드웨어보다는 호스팅 제공업체나 임대 GPU 노드를 가리킵니다. Unsloth GGUF 양자화는 하드웨어 사다리를 더 낮춰 실험 가능성을 확장하지만, 일부 품질 비용이 따릅니다.
배포 퀵스타트
Inkling이 노출합니다OpenAI 호환 API, 따라서 대부분의 기존 클라이언트 코드는 base URL과 모델 이름만 변경하여 드롭인으로 작동합니다. 세 가지 일반적인 서빙 경로는 다음과 같습니다:
vLLM — 단일 명령 서버 (기본적으로 8000번 포트를 사용):
vllm serve thinkingmachines/Inkling --port 8000
# 그런 다음 http://localhost:8000/v1에서 OpenAI 호환 엔드포인트를 호출하세요
SGLang — 8개의 GPU에 걸쳐 샤딩 (기본 포트 30000):
python -m sglang.launch_server \
--model-path thinkingmachines/Inkling \
--tp 8 --port 30000
Hugging Face transformers — 멀티모달 자동 클래스를 통해 로드:
from transformers import AutoModelForMultimodalLM, AutoProcessor
model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# reasoning_effort를 {none, minimal, low, medium, high, xhigh, max} 중 하나로 전달합니다.
엔드포인트가 OpenAI 호환되므로, 기존 앱을 마이그레이션하는 것은 일반적으로 SDK를 새 기본 URL로 지정하고 원하는 대로 reasoning_effort를 설정하는 문제입니다. 출시 시 추가 런타임으로는 TokenSpeed와 Unsloth가 있습니다.
실행 위치: 추론 제공자 가용성
GPU를 직접 관리하고 싶지 않다면, 여러 파트너가 Inkling을 호스팅합니다. 출시 시 “Run Inkling on X” 옵션:
Tinker (Thinking Machines). 역할: 미세 조정; 참고: 64K 및 256K 컨텍스트 옵션; 50% 한정 출시 할인(유료)
Together AI. 역할: 호스팅 추론; 참고: OpenAI 호환 엔드포인트
Fireworks. 역할: 호스팅된 추론; 참고사항: —
Modal. 역할: 호스팅 추론 / 서버리스 GPU; 참고: —
Databricks. 역할: 호스팅된 추론; 참고: Unity AI Gateway를 통해
Baseten. 역할: 호스팅된 추론; 참고: —
벤치마크: 업체 주장 vs. 독립적 측정
이것은 어떤 정직한 Inkling review 2026의 가장 중요한 부분입니다, 왜냐하면 숫자들이 매우 다른 두 곳에서 오기 때문입니다.
공시: 단 하나의 예외로 Artificial Analysis Index를 제외하고, 아래의 모든 Inkling 벤치마크는 벤더가 출시 시 자체 보고한 (Effort = 0.99, temperature 1.0) 이며 독립적으로 감사되지 않았음. 경쟁사 수치는 제3자(MarkTechPost, Artificial Analysis)로부터 제공되거나 Thinking Machines에 의해 재실행되었으며, 마찬가지로 독립적으로 감사되지 않음 여기에서. 일부 수치에는 하네스 또는 하위 집합 한정자가 포함되어 있습니다. 모두 방향성 지표로 간주하고, 절대적 진리로 여기지 마십시오.
벤더 자체 보고 점수
Thinking Machines 자체의 출시 자료에 따르면:
AIME 2026 (수학): 97.1%
GPQA Diamond (과학 추론): 87.2%
SWE-bench Verified (코딩, bash 전용 harness): 77.6%
SWE-bench Pro (공개): 54.3%
MMMU Pro (multimodal): 73.3%
VoiceBench (오디오): 91.4%
MMAU (오디오): 77.2%
IFBench (지시 따르기): 79.8%
Terminal Bench 2.1 (에이전트 터미널): 63.8
FORTRESS Adversarial: 78.0%
SimpleQA 인증됨: 43.9%
서류상으로는 이것들이 강력해 보입니다. 특히 수학 및 과학 추론 수치가 그렇습니다. 하지만 회사는 Inkling을 가까운 미래의 경쟁자 버전(GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) 자체 생성한 점수를 사용했습니다. 그 경쟁사 수치는 경쟁사들이 보고한 자체 수치와 일치하지 않을 수 있으므로, 직접 비교 결과는 주의해서 읽어야 합니다.
멀티모델 맞대결 (오픈 웨이트 경쟁 모델)
Inkling을 다른 오픈웨이트 모델과 가장 명확하게 비교할 수 있는 자료는 MarkTechPost의 비교표입니다 (아래에 MarkTechPost 출처로 재현됨). 이 비교표가 유용한 이유는 경쟁 모델들을 한 프레임에 담고 있기 때문입니다.
HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%
AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%
SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%
Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%
FORTRESS (adversarial). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%
MarkTechPost. 독립적으로 감사되지 않음.
패턴은 분명하며 Thinking Machines의 겸손함과 일관됩니다. Inkling은 FORTRESS (적대적 안전성)에서 선두를 달리며 Nemotron 3 Ultra를 전반적으로 이기지만, 그것은 뒤처집니다 GLM 5.2, Kimi K2.6, DeepSeek V4 Pro에 HLE, SWE-bench Verified, 특히 Terminal Bench 2.1에서 (63.8% vs GLM 5.2’s 82.7%). 만약 에이전트 코딩과 터미널 작업이 우선이라면, 선도적인 중국 오픈 모델이 현재 앞서 있습니다.
독립적인 측정 (Artificial Analysis)
좀 더 중립적인 평가를 위해, Artificial Analysis가 2026-07-15에 Inkling을 평가하여 그 점수를 Intelligence Index에서 41/100, 97개 모델 중 #10으로 순위가 매겨졌습니다. 그 순위를 공정하게 읽는 방법에 대한 두 가지 포인트:
강력한 오픈 모델 성능을 보여주지만, 전체 1위는 아닙니다. Artificial Analysis에 따르면, Inkling의 지수 41은 Nemotron 3 Ultra(38), Gemma 4 31B(29), gpt-oss-120b(24)보다 앞서 있습니다 — 즉, 오픈 가중치 모델 중에서는 경쟁력이 있거나 선두에 있습니다. 하지만 97개 중 10위라는 것은 전체적으로 9개의 모델이 더 높은 순위에 있다는 뜻이며, 이는 “유능하지만 최첨단은 아니다”라는 프레이밍과 일치합니다.
효율성은 이 모델이 두드러지는 부분입니다. Artificial Analysis는 강력한 토큰 효율성을 지적합니다. 평가 세트를 완료하는 데 약 25K 토큰이 소요되는 반면 비교 모델은 37-43K가 소요되며, GDPval-AA v2 Elo 1238로 Kimi(1190)와 DeepSeek V4 Flash (1189), 그리고 AA-Omniscience에서 +2의 약간의 우위를 점했습니다.
출력 속도는 72.7 tokens/sec로 측정되었으며, 첫 토큰까지의 시간은 1.75초입니다. 요약하자면: 존경할 만한 상위 10위 안에 드는 위치이자 진정으로 효율적인 성과입니다. 하지만 우리는 이를 리더보드 승리로 과장하는 것을 의도적으로 피합니다.

멀티모달 및 장문맥 처리 능력
Inkling은 텍스트(UTF-8), 이미지(계층적 패치 인코더를 통해 40px에서 4096px까지), 오디오(개별 토큰 인코딩을 사용하는 16kHz WAV, 최대 약 20분)를 허용합니다. 출력은 텍스트만 가능합니다 — 이미지나 오디오 생성 기능은 없으므로, 생성 모델이 아닌 이해 모델을 계획하세요. 사전 학습 중에는 비디오가 사용되었지만 아니며 출시 시점에서 지원되거나 평가되는 입력이 아니므로 아직 이를 고려하여 계획하지 마십시오.
헤드라인 기능은 100만 토큰 컨텍스트 윈도우 출시된 가중치에서, 이는 전체 저장소 코드 분석, 긴 문서 합성, 그리고 공격적인 청킹 없이 확장된 다중 턴 에이전트 세션을 가능하게 합니다. 실용적인 뉘앙스에 주목하세요: 호스팅 API는 최대 256K 토큰을 제공합니다, 따라서 전체 1M은 오늘날 자체 호스팅 기능입니다. 슬라이딩 윈도우 어텐션 설계 및 추측 디코딩과 결합하여, 긴 컨텍스트 스토리는 Inkling의 가장 실용적인 판매 포인트 중 하나로 남아 있습니다.
가격, 요금제, 그리고 총 소유 비용
Inkling은 진정으로 오픈되어 있습니다. 전체 가중치(BF16 체크포인트와 NVFP4 체크포인트)는 Hugging Face Apache 2.0 라이선스 하에 있으므로, 셀프 호스팅은 로열티가 없습니다 — 당신은 컴퓨팅 비용만 지불하면 됩니다. Thinking Machines는 모델 자체를 수익화하지 않으며, 수익은 Tinker와 타사 호스트를 통해 발생합니다.
호스팅된 토큰당 가격 (Artificial Analysis), 컨텍스트 계층별:
64K. 입력 / 1M: $1.87; 캐시된 입력 / 1M: $0.374; 출력 / 1M: $4.68
256K. 입력 / 1M: $3.74; 캐시된 입력 / 1M: $0.748; 출력 / 1M: $9.36
일시적인 출시 할인 50%를 반영합니다; 정확한 Tinker 토큰당 수치는 문서에 있으며 변경될 수 있습니다.
셀프 호스트 대 API — TCO에 대해 어떻게 생각할 것인가. 경제학은 규모와 활용도에 달려 있습니다:
API (Tinker / partners): 고정 비용 제로, 토큰당 지불, 거의 즉시 시작 가능. 낮거나 불규칙한 볼륨 또는 프로토타입 제작 중에 최적.
자가 호스팅 (임대 또는 소유 GPU): 4~8 GPU 노드를 사용 중이든 아니든 비용을 지불하지만, 한계 토큰 비용은 원시 전기 비용에 근접합니다. Inkling은 41B 파라미터만 활성화하고 토큰 효율적이기 때문에(~25K 대 Artificial Analysis 세트 기준 37–43K), GPU 시간당 처리량이 유리하며, 무거운 정적 워크로드는 노드가 잘 활용될 경우 토큰당 API 가격보다 실질적으로 저렴해질 수 있습니다. 출시 당시의 논평에서는 오픈 가중치 자체 호스팅이 대규모에서 유사한 폐쇄 API 사용보다 대략 40–60% 저렴하다고 언급했으며, 이는 방향성 주장일 뿐 감사된 수치는 아닙니다.
편집자 주 — 시각 자료 추가:손익분기점 차트 — 월별 토큰 볼륨(x) vs 총 비용(y)과 세 개의 선: 폐쇄형 프론티어 API, Inkling 호스팅 API, 그리고 임대 GPU 노드에서 셀프 호스팅하는 Inkling — 자체 호스팅이 우세한 교차점을 보여줌.
안전, 정렬, 검열
안전은 Inkling의 더 강력하고 차별화된 이야기 중 하나입니다. 이에 FORTRESS adversarial 벤치마크에서 점수는 78.0% — 오픈 가중치 모델 중 최고 MarkTechPost의 비교에서, GLM 5.2(71.3%), Kimi K2.6(65.6%), 그리고 DeepSeek V4 Pro(36.0%)보다 훨씬 앞서며, Thinking Machines는 또한 모델 출력의 보정된 불확실성을 강조합니다.
VentureBeat의 보도는 관련 속성을 강조했습니다: 검열 저항성. 관대한 Apache 2.0 라이선스와 결합하면, 이는 Inkling을 팀이 불투명하고 공급업체가 부과한 콘텐츠 체제를 상속받는 대신 자체 정책에 맞출 수 있는 개방형 모델로 자리 잡게 합니다 — 규제 대상 또는 지역별 배포에 있어 중요한 고려 사항입니다. 출시 당일 모델의 경우 항상 그렇듯이, 독립적인 레드팀 또는 제3자 안전 감사가 작성 시점에 공개되지 않았으므로, FORTRESS 리드를 외부에서 인증된 것이 아닌 공급업체/제3자 출처로 간주하십시오.
잉클링을 미세 조정해야 할까요?
미세 조정은 Inkling이 존재하는 이유라고 할 수 있습니다. 빠른 의사 결정 프레임워크:
파인튜닝 (Tinker 또는 자체 파이프라인을 통해)을 수행해야 하는 경우: 독점 데이터, 좁은 도메인 또는 더 작은 전문화된 모델이 일반 모델보다 뛰어난 작업이 있는 경우; 가중치를 소유해야 하는 경우; 또는 특정 어조, 형식 또는 정책을 적용하려는 경우입니다. 64K/256K Tinker 컨텍스트 옵션과 출시 할인이 장벽을 낮춰줍니다.
기본 모델(자체 호스팅 또는 API)을 사용하세요: 작업이 일반 목적이고, 볼륨이 낮거나, 파인튜닝이 메트릭을 개선하는지 아직 검증하지 않은 경우입니다. 프롬프트 엔지니어링과 reasoning_effort 다이얼을 사용하면 충분히 좋은 결과를 얻을 수 있습니다.
다른 곳을 찾으세요: 오늘날 최첨단 에이전틱 코딩이 필요하다면 (GLM 5.2와 Kimi K2.6이 해당 벤치마크에서 선두입니다) 또는 독립적으로 감사된 품질 보증이 필요하다면.
장단점
장점
하에 있는 완전히 공개된 가중치Apache 2.0, 자체 호스팅에 로열티가 없으며 상업적 사용에 무료입니다.
효율적인 희소 MoE(활성화된 것만 41B)와 강력한 토큰 효율성은 추론 비용과 속도를 경쟁력 있게 유지합니다.
거대한 1M-토큰 컨텍스트 가중치에 (API를 통한 256K) 있습니다.
진정한 멀티모달리티 (텍스트, 이미지, 오디오 입력).
제어 가능한 reasoning_effort 다이얼 (없음 → 최대)로 실시간 비용/품질 트레이드오프를 조정합니다.
최고 수준의 오픈 웨이트 적대적 안전성 (FORTRESS 78.0%, MarkTechPost 기준) 및 “검열 저항성.”
강력한 독립적 입지 — Artificial Analysis Index에서 97개 중 상위 10위, Nemotron 3 Ultra, Gemma 4 31B, gpt-oss-120b를 앞서고 있습니다.
단점
명백히 아닌 최첨단 모델, 제작사 자체 인정에 따른 것입니다.
주요 오픈 경쟁사들(GLM 5.2, Kimi K2.6, DeepSeek V4 Pro)에 뒤쳐지며, 에이전트 및 코딩 벤치마크(Terminal Bench 2.1, SWE-bench Verified, HLE)에서의 결과를 보여줍니다.
대부분의 벤치마크는 공급업체 자체 보고이며, 독립적으로 감사되지는 않았습니다.
텍스트 전용 출력; 이미지/오디오 생성 없음; 출시 시 비디오 입력 없음; Inkling-Small은 아직 미리보기 단계.
실제 “로컬” 사용에는 다중 GPU 노드(~600GB VRAM, 양자화된 경우에도)가 필요합니다.
출시 당시에는 실질적인 독립적 비판이나 안전/레드팀 검토가 나타나지 않았다.
Inkling은 누가 사용해야 하나요?
Inkling은 실무자나 팀이 원하는 경우에 적합합니다 소유하고 맞춤화하는 자신의 모델을 폐쇄형 API를 임대하는 대신에. 이상적인 사용 사례는 다음과 같습니다:
파인튜닝 팀 도메인 특화 모델을 Tinker 또는 자체 파이프라인을 통해 구축합니다.
비용에 민감한 대량 배포로열티 프리 자체 호스팅이 토큰당 최첨단 가격을 이기는 경우.
긴 컨텍스트 워크로드 예를 들어, 저장소 전체 코드 지원, 문서 분석 및 긴 에이전트 세션 등이 있습니다.
멀티모달 애플리케이션 텍스트, 이미지, 오디오 이해를 결합해야 하는.
정책에 민감한 배포.강력한 안전성과 검열 저항성을 갖춘 개방 기반을 원하며 스스로를 정렬하고자 하는
최고 수준의 추론 능력이나 에이전트 코딩 성능이 필요하거나, 비디오 입력이나 생성적 출력이 필요하거나, 배포 전에 독립적으로 검증된 벤치마크가 필요하다면 적합하지 않습니다.
최종 평결 및 평점
코끼리를 직접 언급해 보겠습니다: Inkling은오늘날 가장 강력한 모델이 아닙니다, 그리고 Thinking Machines는 정확히 그렇게 말합니다. 냉소적으로 읽으면, 그것은 낮은 기준입니다. 공정하게 읽으면, 그것이 핵심입니다 — Inkling은 리더보드 정상보다는 다른 목표에 최적화되어 있습니다. 효율적이고(활성 41B, ~25K 토큰 작업 예산), 오픈 라이선스(Apache 2.0), 오픈 가중치 기준으로 안전하며(FORTRESS 78%), 미세 조정 및 자체 호스팅이 가능하도록 설계되었습니다. 이러한 조합은 가장 어려운 에이전트 및 코딩 벤치마크에서 GLM 5.2와 Kimi K2.6에 뒤처지더라도, 2026년의 더 사려 깊은 오픈 모델 출시 중 하나로 만듭니다.
남은 별표(*)들은 대부분 자체 보고된 벤치마크 결과와, 이 이른 시점에 독립적인 비판적 검토가 없다는 점입니다. 하지만 의도된 청중 — 최고 수준의 자랑거리보다 소유권, 맞춤화, 비용 통제, 방대한 컨텍스트 창을 중요시하는 빌더들 — 에게 Inkling은 그 가치를 제공합니다.
평점: 5점 만점에 4점 건축가와 미세 조정가를 대상으로 한 경우; 최첨단 기능만을 엄격히 구매한다면 더 낮음.
자주 묻는 질문
Inkling이 무엇이며 누가 만들었나요? Inkling은 전 OpenAI CTO인 Mira Murati가 이끄는 AI 스타트업 Thinking Machines Lab의 첫 번째 모델입니다. 2026년 7월 15일에 오픈 가중치, 멀티모달 Mixture-of-Experts 추론 모델로 출시되었습니다.
Inkling이 최고의 AI 모델인가요?아니요, 회사도 그렇게 주장하지 않습니다. Inkling은 "현재 이용 가능한 가장 강력한 모델(폐쇄형 또는 개방형)이 아니다"라고 밝히고 있습니다. 독립적인 측정(Artificial Analysis)에 따르면 전체 97개 중 10위를 차지했지만, 여러 오픈 피어보다는 앞서 있습니다.
Inkling의 파라미터 수와 컨텍스트 윈도우는 어떻게 되나요?총 975B 중 41B 활성화 (희소 MoE), 66개 레이어로 구성. 릴리즈된 가중치에서는 최대 1,000,000 토큰, 호스팅 API에서는 최대 256K입니다.
Inkling은 오픈 소스인가요? 라이선스는 무엇인가요? 가중치는 다음 라이선스로 배포됩니다: Apache 2.0, 상업적 사용 및 자체 호스팅을 허용합니다. 이는 '오픈 가중치'입니다 — 전체 모델 가중치는 Hugging Face에 있습니다.
Inkling은 무료로 사용할 수 있나요? 가중치는 무료이며, 자체 호스팅 시 로열티가 없습니다. Tinker에서의 파인튜닝 및 Together AI, Fireworks, Modal, Databricks 또는 Baseten과 같은 제공업체를 통한 호스팅 추론은 유료 서비스입니다. 호스팅 액세스는 약 $1.87 / 100만 입력 토큰부터 시작됩니다(한정 출시 할인).
Inkling을 실행하거나 다운로드하는 방법과 필요한 하드웨어는 무엇인가요?Hugging Face에서 가중치를 다운로드하고, vLLM, SGLang 또는 Hugging Face transformers를 통해 OpenAI 호환 API로 제공하세요. BF16의 경우 약 ~2TB의 집계된 VRAM(8× B300 / 16× H200)이 필요하며, NVFP4 양자화 체크포인트의 경우 약 ~600GB(4× B300 / 8× H200)가 필요합니다. 커뮤니티 Unsloth GGUF 빌드는 실험을 위한 진입 장벽을 낮춥니다.
Inkling을 어떻게 미세 조정하나요? Thinking Machines’ Tinker 플랫폼을 사용하세요. 이 플랫폼은 64K 및 256K 컨텍스트 옵션과 한정 기간 50% 출시 할인을 제공하며, 자체 파이프라인에서 오픈 웨이트를 미세 조정할 수도 있습니다.
제어 가능한 사고 노력이란 무엇인가요?추론 깊이를 위해 지연 시간과 토큰 비용을 맞바꾸는 reasoning_effort 설정(none / minimal / low / medium / high / xhigh / max)입니다. 낮은 노력은 분류 및 추출에 적합하고, 최대 노력은 어려운 수학 문제에 적합하며 벤치마크 구성(Effort=0.99)과 일치합니다.
Inkling은 Kimi, GLM, DeepSeek, Nemotron과 어떻게 비교되나요? MarkTechPost의 비교에 따르면, Inkling은 FORTRESS(안전성)에서 앞서고 Nemotron 3 Ultra를 전반적으로 능가하지만, Terminal Bench 2.1, SWE-bench Verified, HLE에서 GLM 5.2, Kimi K2.6, DeepSeek V4 Pro에 뒤처집니다. 에이전트 코딩 분야에서는 경쟁력이 있지만 가장 강력한 오픈 모델은 아닙니다.
Inkling이 이미지, 오디오, 비디오를 처리할 수 있나요? 텍스트, 이미지(40px–4096px), 오디오(16kHz WAV, 최대 약 20분)를 받습니다 로 입력. 출력은 텍스트만 가능합니다 — 이미지나 오디오 생성은 불가능합니다. 비디오는 사전 훈련에 사용되었지만 출시 시 지원되는 입력은 아닙니다.
Inkling의 벤치마크 점수는 신뢰할 수 있나요?조심스럽게 다루세요. 독립적인 Artificial Analysis Intelligence Index를 제외하고, 헤드라인 수치는 출시 시점에 공급업체가 자체 보고한 것으로 독립적으로 감사되지 않았습니다. 경쟁사 수치는 제3자(MarkTechPost)로부터 제공되거나 Thinking Machines에 의해 재실행된 것으로, 경쟁사가 자체 보고한 수치와 일치하지 않을 수 있습니다.
Inkling-Small이 무엇이며, 로드맵에는 무엇이 있을까요? Inkling-Small은 더 작은 변형입니다 (총 276B / 활성 12B). 출시 당시에는 아직 미리보기 상태였으며, 가중치는 아직 공개되지 않았습니다. 메인 모델은 이미 추측 디코딩을 위한 MTP 레이어를 제공합니다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
