Inkling-Small-1
Guides & Insights

Inkling-Small: 자체 플래그십을 능가하는 1/4 크기 모델, 그러나 여전히 인덱스에는 뒤처진다

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Thinking Machines Lab은 첫 오픈 가중치 모델을 출시한 후 이주 동안 그 약 4분의 1 크기의 모델을 구축했으며, 연구소 자체 평가표에서는 더 작은 모델이 승리한다. Inkling-Small는 SWE-bench Verified에서 80.2%를 기록해 Inkling의 77.6%, GPQA Diamond에서는 89.5% 대 87.2%, Terminal-Bench 2.1에서는 64.7% 대 63.8%, 그리고 Humanity's Last Exam에서는 31.6% 대 29.7%를 기록했다 — 총 276B(활성 12B) 파라미터로, 975B(활성 41B) 대신. 두 모델 카드가 공유하는 주요 수치 중 975B 플래그십이 정확히 하나만 앞선다: AIME 2026에서 1.6점 차이.

그런 다음 Artificial Analysis는 두 모델을 독립적으로 실행하여, Intelligence Index에서 Inkling-Small을 40, Inkling을 41로 평가했습니다 — 더 작은 모델은 1점 뒤처져 있습니다. 이 두 결과 모두 실제이며, 두 결과 사이의 간격이 이번 출시에서 가장 유용한 정보입니다. 아래의 모든 내용은 Thinking Machines가 자체 모델에 대해 보고한 것과 다른 사람이 측정한 것을 구분합니다: 공급업체 수치는 발표 자료와 두 개의 Hugging Face 모델 카드에서, 독립 수치는 Artificial Analysis의 자체 실행에서, 가격 및 컨텍스트 수치는 OpenRouter의 실시간 엔드포인트 데이터에서 가져왔으며, 이 글을 작성한 날 확인했습니다. 세 출처가 일치하지 않는 경우 — 실제로 컨텍스트 길이에서는 그렇습니다 — 우리는 아첨하는 수치를 선택하는 대신 그 사실을 명시합니다.

7월 30일에 실제로 출시된 것

Inkling-Small은 희소 혼합 전문가(sparse mixture-of-experts) 트랜스포머입니다: 총 276B 파라미터, 토큰당 활성 12B, 42개 레이어로 구성되며, 각 토큰은 256개 전문가 중 6개와 모든 토큰에 활성화되는 2개의 공유 전문가로 라우팅됩니다. 어텐션은 로컬 레이어와 글로벌 레이어를 번갈아 사용합니다. 가중치는 상업적 제한이 없는 Apache 2.0 라이선스로 Hugging Face에 공개되어 있으며, Thinking Machines의 Tinker API에서 파인튜닝할 수 있고, Tinker Playground에서 텍스트, 이미지, 오디오로 대화할 수 있습니다. 연구소에 따르면 NVIDIA GB300 NVL72 시스템에서 훈련되었다고 합니다.

Inkling-Small-2

멀티모달리티는 부가 기능이 아니라 기본 내장이며, 해당 카드는 그 방식에 대해 이례적으로 구체적이다. 별도의 비전 또는 오디오 인코더는 없다. 오디오는 dMel 스펙트로그램으로, 이미지는 4계층 hMLP를 통과한 40×40 픽셀 패치로 입력되며, 둘 다 텍스트와 동일한 토큰 스트림에 직접 임베딩된다. 입력은 텍스트, 이미지, 오디오이며; 출력은 텍스트뿐이다, 이는 분명히 짚고 넘어갈 가치가 있는데, '멀티모달'이 '음성 출력이 가능하다'로 오해되는 경우가 잦아 낭패를 보기 쉽기 때문이다. 사고 노력은 다이얼 방식으로 최소, 낮음, 중간, 높음, 최고의 다섯 단계가 있어, 동일한 가중치를 저비용으로 또는 고강도로 실행할 수 있다.

이 레시피에서 흥미로운 부분은 사후 훈련(post-training)이다. Inkling-Small는 전체 Inkling을 교사로 삼아 온-폴리시(on-policy) 증류를 거친 후, 에이전틱 코딩(agentic coding)에 확장된 강화 학습을 약 2주 더 받았다. 이러한 순서가 결과의 형태를 설명한다. 학생 모델은 교사의 일반적인 능력을 물려받은 뒤, 정확히 현재 교사를 능가하는 축에 대해 추가 훈련을 받은 것이다.

Thinking Machines가 발표한 스코어보드

벤더 벤치마크는 누군가 재현하기 전까지는 마케팅일 뿐이다. 따라서 이 섹션은 검증된 내용이 아니라 연구소의 주장으로 읽어야 한다. 그럼에도 이는 여전히 광범위한 테스트 세트이며, 플래그십에게 불리한 방향으로 광범위하다.

Inkling-Small-3

네 개의 공유 숫자 너머로, 카드는 그림의 나머지 부분을 채웁니다 — 모든 Thinking Machines의 자체 실행:

에이전트 작업 — GDPval-AA v2에서 1269 Elo, 퍼즐이 아닌 현실적인 경제 과제를 다루는 벤치마크입니다.

차트 및 문서 — CharXiv RQ에서 77.4%를 기록했으며, 모델이 Python 코드를 작성하고 실행할 수 있을 때는 81.3%로 상승합니다. 이 3.9포인트 상승은 프롬프트 엔지니어링보다 도구 접근이 시각적 추론 작업에서 더 많은 효과를 낸다는 유용한 힌트입니다.

Vision — MMMU Pro에서 74.0%로, Inkling의 73.5%보다 약간 높습니다.

Audio — 90.1% VoiceBench and 77.0% MMAU, both fractionally below the flagship's 91.4% and 77.2%. Audio is one of the two places where shrinking clearly cost something.

안전성 — StrongREJECT에서 98.4%, FORTRESS 정상 프롬프트에서 96.9%를 기록했지만, FORTRESS 적대적 프롬프트에서는 플래그십의 78.0%에 비해 71.6%에 그칩니다. 이것이 또 다른 비용입니다: 적대적 견고성에서 6.4포인트 하락이며, 모델이 공개 텍스트 박스 뒤에 놓일 경우 이는 어떤 코딩 성능 향상보다도 더 중요합니다.

Forecasting — 검색 접근 없이 ForecastBench에서 61.3 ± 0.46 Brier Index, Prophet Arena에서 0.1238 ± 0.0086 Brier score를 기록했습니다. 오차 막대를 전혀 보고하는 것만으로도 대부분의 출시 게시물보다 더 엄격한 태도를 보여줍니다.

한 가지 공백: 플래그십의 카드에는 SWE-bench Verified의 더 어려운 형제인 SWE-bench Pro에서 54.3%가 기재되어 있습니다. Inkling-Small의 카드에는 SWE-bench Pro가 보고되지 않습니다. Verified 수치가 얼마나 크게 부각되는지 감안할 때, 그 부재는 우리가 가장 채워지길 바라는 수치입니다.

독립 지수가 대신 말하는 것

Artificial Analysis는 Intelligence Index 4.1 버전에서 Inkling-Small을 40으로 평가했으며, 이는 Inkling의 41보다 1포인트 낮은 수치입니다. 이 지수는 9가지 평가(GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience 및 AA-LCR)의 복합 지표이며, 이 목록은 명백한 모순의 대부분을 설명합니다. 9개 중 2개만이 Thinking Machines 카드의 추론 쇼케이스와 겹칩니다. 나머지는 에이전트 도구 사용, 장문 맥락 검색 및 환각 저항에 가중치가 부여되어 있으며, 모델은 실험실이 게재하기로 선택한 벤치마크에서 승리하면서 제3자가 실행하기로 선택한 벤치마크에서는 패배할 수 있습니다. 어느 쪽도 거짓말을 하는 것이 아닙니다. 두 쪽은 서로 다른 것을 측정하고 있습니다.

Inkling-Small-4

세부 조항에는 1점 차이라는 헤드라인보다 더 가치 있는 세부 사항이 있습니다: Artificial Analysis는 플래그십 모델의 항목을Inkling (xhigh) — 즉, 최상위 thinking-effort 설정 — 으로 기록했습니다. 반면 Inkling-Small 행에는 effort 접미사가 없습니다. 따라서 플래그십의 1점 차이 리드는 추론 다이얼을 최대치로 올린 상태에서 기록된 것입니다. 만약 effort 수준을 동일하게 맞춘다면 그 비교가 조금이라도 달라질 것이고, 성능만으로 더 큰 모델을 선택해야 하는 마지막 근거도 함께 사라질 것입니다.

독립적인 데이터가 전혀 근접하지 않은 부분은 속도와 비용이며, 여기서는 벤치마크 표가 전달하지 못하는 격차로 소형 모델이 유리합니다:

출력 속도 — 초당 133토큰으로, Inkling(xhigh)의 초당 80토큰과 대조됩니다. Artificial Analysis는 속도 부문에서 해당 클래스의 101개 모델 중 Inkling-Small을 7위로 평가했으며, 클래스 중앙값은 66입니다.

첫 토큰까지의 시간 — 1.63초 대 1.84초. 실질적이지만 사소한 우위입니다.

1M 토큰당 혼합 가격 — 가중치 기준 $0.72 대비 $0.22. 인덱스 포인트 1이 낮은 대신 비용은 약 3분의 1입니다.

지능 순위 — 101개 중 15위, 클래스 중앙값 점수 25 대비. 평균을 여유 있게 상회하지만, 최첨단에는 한참 못 미친다.

장황함 — 그리고 여기에 문제가 있습니다. 인덱스를 통과하는 데 중앙값 1억 개와 비교해 1억 3천만 개의 출력 토큰을 소모했습니다. Artificial Analysis의 자체 요약은 이를 "눈에 띄게 빠르지만 다소 장황하다"고 말합니다. 일반적인 모델보다 약 30% 더 생각하는 셈인데, 이는 조용히 토큰당 할인의 일부를 잠식합니다.

작은 회계상의 메모입니다. 출처를 비교하는 사람이라면 누구나 부딪힐 문제이기 때문입니다. Artificial Analysis는 총 파라미터 수를 266B로 표기하는 반면, 발표 자료와 두 모델 카드, OpenRouter는 모두 276B라고 표기합니다. 우리는 전체적으로 276B를 사용했습니다. 이는 어떤 결론도 바꾸지 않지만, 설계 문서에서 숫자를 인용하기 전에 알아두면 좋을 만한 불일치입니다.

오늘 실제로 렌트할 수 있는 것, 사양서에 적힌 내용과는 다른

오픈 웨이트 발표와 실제 사용 가능한 엔드포인트 사이의 간극은 대부분의 출시 보도가 더 이상 주목하지 않는 지점이다. Thinking Machines는 최대 1M 토큰의 컨텍스트 윈도우를 광고하며, Artificial Analysis도 1M으로 명시한다. OpenRouter에서는 현재 Inkling-Small을 제공하는 두 제공업체 모두 그 상한을 다음과 같이 정한다: 524,288 토큰 — 광고된 수치의 절반이다. 이는 모순이라기보다는 아키텍처가 지원하는 것과 실제로 프로덕션에 구축된 것 사이의 차이에 가깝다. 대조적으로, 플래그십 Inkling은 전체 1,048,576 토큰을 지원하는 엔드포인트가 하나 있지만, 같은 엔드포인트는 완성 길이를 32,768 토큰으로 제한한다.

실시간 화면의 나머지는 OpenRouter의 엔드포인트 데이터에서 읽어옵니다:

두 제공업체, 두 가격 — 한 곳은 입력 100만 토큰당 $0.45, 출력 100만 토큰당 $1.20이고, 다른 곳은 $0.50과 $1.20입니다. Artificial Analysis는 Thinking Machines의 자체 퍼스트파티 요금이 입력당 $0.30, 출력당 $1.20으로 더 낮고, 캐시 입력은 $0.06이라고 명시합니다. 타사 호스팅은 동일한 가중치에 대해 입력에서 50–67%의 프리미엄을 부과하고 있습니다.

프롬프트 캐싱 — OpenRouter 경유 시 캐시된 입력 토큰 1M당 $0.10, 플래그십 모델의 경우 $0.17.

당신이 임대하는 수치는 벤치마크된 수치가 아닙니다. — 모델 카드에는 BF16과 NVFP4가 나열되어 있습니다. 더 저렴한 엔드포인트는 fp8을 제공하며, 다른 하나는 양자화를 전혀 명시하지 않습니다. 공급업체 벤치마크 점수는 이 가중치의 fp8 서빙에서 측정된 것이 아니며, 긴 에이전틱 실행에서의 양자화 효과는 0.9포인트의 Terminal-Bench 마진이 견딜 수 없는 종류의 것입니다. 숫자를 재현하는 경우, 어떤 엔드포인트를 사용했는지 기록하세요.

기능 지원 범위는 제공업체마다 고르지 않습니다 — 두 엔드포인트 모두 reasoning과 reasoning_effort를 노출하므로 5단계 추론 다이얼이 작동합니다. 그러나 tool calling과 logprobs를 지원한다고 광고하는 곳은 하나뿐이며, 현재 어느 쪽도 response_format을 광고하지 않습니다 (구조화 출력/JSON 모드 매개변수). 플래그십 Inkling에는 이를 지원하는 엔드포인트가 있습니다. 파이프라인이 스키마 기반 JSON에 의존한다면, 이 세부 사항이 첫날부터 문제가 될 것입니다. 이는 모델의 한계가 아니라 제공업체의 한계입니다.

생성 상한 — fp8 엔드포인트에서는 262,144 토큰이며, 다른 엔드포인트는 상한이 없다고 명시합니다.

측정된 토큰 수를 기준으로 한 비용 사례

백만 토큰당 가격은 추론 모델을 비교하는 나쁜 방법입니다. 핵심 변수는 모델이 사고 과정에서 소모하는 토큰 수이기 때문입니다. Artificial Analysis는 실제 지출을 공개하는데, 이것이 훨씬 더 나은 지표입니다. Inkling-Small을 전체 Intelligence Index에 통과시키는 데 약 1억 3천만 개의 출력 토큰이 소모되었고 비용은 $192.37이었으며, 가중 평균 기준 작업당 약 $0.07에 해당합니다.

그것을 실제로 배포되는 모델에 대한 동일한 측정값과 비교해 보세요: DeepSeek V4 Flash는 작업당 $0.03, gpt-oss-120b는 $0.08, Gemini 3.6 Flash는 $0.56, GLM-5.2는 $0.57, Kimi K3는 $0.86, GPT-5.6 Sol는 $1.23, Claude Opus 5는 $2.34, Claude Fable 5는 $3.15. Inkling-Small은 그 그룹에서 두 번째로 저렴한 모델이며, GPT-5.6 Sol보다 작업당 약 18배 저렴합니다. GPT-5.6 Sol은 59점, Inkling-Small은 40점입니다.

가격이 왜 그 지점까지 떨어졌는지를 보는 더 깔끔한 방법도 있습니다. 활성 파라미터는 41B에서 12B로 감소했으며, 이는 3.4배입니다. 출력 가격은 백만 개당 $4.05에서 $1.20로 하락했으며, 이는 3.375배입니다. 희소 MoE의 임대 가격은 본질적으로 토큰당 계산 비용일 뿐이며, Thinking Machines는 벤치마크에 가격을 매기는 대신 그에 따라 요금을 부과했습니다.

직접 그 비교를 실행할 때 실용적인 참고 사항 하나: Inkling-Small은 현재 OrcaRouter 카탈로그에 없으므로 자체 엔드포인트에서 임대해야 합니다. 비교 대상이 되는 비공개 모델들(GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash 등 목록의 나머지)은 OrcaRouter에서 단일 키 뒤에 0% 마크업조건으로 제공됩니다. 즉, 각 제공업체의 정가에 아무것도 더하지 않은 금액을 지불하게 됩니다. 이는 특히 비용 모델에 중요합니다. 스프레드시트에 적는 숫자가 청구되는 숫자이고, 제공업체가 가격을 인하하면 재협상을 거칠 필요 없이 당일에 바로 반영되기 때문입니다. 제공업체 간 자동 장애 조치는 평가의 나머지 절반, 즉 실행 도중 기준군이 다운되어 조용히 결과 수치를 망치는 상황을 처리합니다.

실제로 오픈 가중치 모델들 사이에서 어디에 위치하는지

플래그십과 비교해 보면 Inkling-Small은 쾌거처럼 보인다. 그러나 경쟁 모델들과 비교해 보면, 이는 견실한 중위권 오픈웨이트 모델일 뿐이며, 출시 보도는 대부분 두 번째 해석을 간과했다.

Artificial Analysis Intelligence Index에서 두 Inklings보다 앞선 모델에는 61점의 Claude Opus 5, 60점의 Claude Fable 5, 59점의 GPT-5.6 Sol, 57점의 Kimi K3, 54점의 Grok 4.5, 51점의 GLM-5.2와 Muse Spark 1.1, 그리고 50점의 Gemini 3.6 Flash가 포함됩니다. 이는 예상된 결과입니다. 그것들은 최첨단 시스템이며, 대부분이 폐쇄형이고, 여러 개는 규모가 엄청납니다.

실제로 결정을 바꿔야 할 것은 DeepSeek V4 Flash로, 전체 284B 및 활성 13B 기준으로 Inkling-Small의 40점에 비해 50점을 기록했습니다. 실질적으로 동일한 규모 등급이자 동일한 오픈 가중치 가성비를 제공하면서 작업당 비용은 절반 미만입니다. 가장 저렴하면서도 성능이 우수한 오픈 가중치 모델을 원한다면, 독립적인 수치는 여기가 아니라 그쪽을 가리킵니다. 또한 Inkling-Small과 달리 OrcaRouter를 통해 제공되므로, 자체 워크로드에 대해 해당 대안을 테스트하는 것은 조달 작업이 아니라 모델 문자열 변경에 불과합니다.

Inkling-Small이 DeepSeek V4 Flash에는 없고 오직 가진 것은 동일한 가중치 내의 네이티브 오디오·이미지 입력, 5단계 사고 다이얼, 그리고 이를 훈련시킨 연구소의 Tinker 파인튜닝입니다. 이것들은 멀티모달 에이전트에게 진정한 차별점이며, 인덱스 점수가 아니라 이를 선택해야 하는 정직한 이유입니다.

누가 옮겨야 하고, 누가 그대로 있어야 할까요?

그 결정은 깔끔하게 갈라지는데, 이는 그 자체로 언급할 가치가 있을 만큼 이례적인 일이다.

코딩 에이전트를 실행 중이라면 Inkling에서 Inkling-Small로 전환하세요. 공급업체 수치에 따르면 SWE-bench Verified와 Terminal-Bench에서 소형 모델이 유리하며, 문서화된 이유는 추가적인 에이전틱 RL입니다. 비용은 약 1/3 수준이고 토큰 반환 속도는 1.66배 빠릅니다. 최대 추론 노력으로 측정된 지수 1포인트에 3.3배를 지불하는 것은 정당화하기 어렵습니다.

추론 작업당 비용이 제약 조건이라면, 인덱스에서 40을 감당할 수 있다면 이동하세요. 자사 엔드포인트의 100만 회당 $0.06 캐시 적중률이 적용된 작업당 $0.07이라는 가격은 네이티브 오디오와 비전을 갖춘 모델로서는 공격적인 가격 책정입니다.

파인튜닝을 한다면 이동하세요. 276B/12B 모델은 975B/41B보다 적응 및 서비스 비용이 훨씬 저렴하며, Tinker는 두 가지를 모두 지원합니다.

긴 오디오가 필요하다면 Inkling을 계속 사용하세요. 이번 릴리스에서 가장 두드러진 퇴보이며 모델 카드에 묻혀 있습니다: 플래그십은 20분 미만의 오디오 입력을 권장하는 반면, Inkling-Small의 카드의 권장 사항은 2분 미만입니다. 10배나 줄어든 수치입니다. 회의를 전사하거나 추론하는 용도였다면, 소형 모델은 어떤 가격에서도 대체재가 아닙니다.

호스팅된 엔드포인트에서 512K를 초과하는 컨텍스트가 필요하거나 262K 토큰보다 긴 컴플리션이 필요하다면 이 옵션을 유지하세요. 현재 플래그십 모델만이 전체 백만 토큰을 제공하는 엔드포인트를 운영합니다.

스키마가 강제된 JSON이 필요하면 유지하세요, 자체 검증 및 재시도 루프를 작성하지 않고, 제공업체가 response_format을 소형 모델용으로 지원할 때까지.

적대적 강건성이 핵심이라면 유지하세요. FORTRESS adversarial에서 71.6% 대 78.0%는 사용자 대면 제품에 있어서는 잘못된 방향이며, 이는 연구소 자체가 낸 수치입니다.

발사 중계가 남겨둔 세 가지 질문

Inkling-Small은 그냥 Inkling을 증류한 것인가요?

부분적으로는 맞습니다. 그리고 맞지 않는 부분이 바로 중요한 부분입니다. 인클링을 교사로 한 온-폴리시 증류는 포스트-트레이닝의 한 단계였기 때문에, 일반 능력의 상당 부분은 실제로 계승됩니다. 하지만 이것은 별도로 설계된 모델입니다 — 플래그십의 66개 레이어에 비해 42개의 레이어를 가지고 있으며, 256개 중 6개의 활성 전문가와 2개의 공유 전문가를 사용하는 동일한 라우팅 토폴로지를 가집니다. 즉, 전문가의 수가 적어진 것이 아니라 각 전문가가 더 좁아진 것입니다. 그리고 교사는 결코 받지 못한 약 2주간의 에이전틱 코딩 RL을 받았습니다. 바로 그 마지막 단계 때문에 증류된 학생이 코딩 벤치마크에서 교사를 능가하며, 그렇지 않았다면 그런 일은 일어나지 않았을 것입니다.

현실적으로 자체 호스팅할 수 있을까요?

제대로 된 하드웨어에서만 가능합니다. 276B 파라미터는 8비트에서 약 276GB, BF16에서 약 552GB의 가중치에 해당하며, 이는 KV 캐시를 제외한 수치입니다. 어느 쪽이든 워크스테이션이 아닌 멀티 GPU 노드가 필요합니다. 스파스 MoE의 장점은 메모리 사용량이 아니라 추론 비용입니다. 전체 276B를 저장하고 12B로 연산합니다. 카드에는 지원되는 서빙 경로로 SGLang, vLLM, TokenSpeed, Unsloth, Hugging Face Transformers가 명시되어 있고, BF16 및 NVFP4 수치 형식이 나열되어 있습니다. 또한 오늘날 두 호스팅 엔드포인트 모두 양자화된 버전을 서빙하므로, BF16으로 자체 호스팅한 "동일한 모델"은 테스트했던 API와 동일하게 동작하지 않는다는 점에 유의하세요.

975B Inkling은 여전히 존재할 가치가 있나요?

셋이며, 모두 폭이 좁습니다: 제공되는 전체 1M 토큰 컨텍스트, 2분 이상의 오디오 입력, 그리고 더 나은 적대적 안전성 동작입니다. 주목할 점은 "더 똑똑하다"는 것이 그 목록에 자신 있게 들어 있지 않다는 것입니다. 최대 사고 노력에서의 한 지수 포인트는, 더 작은 모델이 대부분 이기는 일련의 벤더 벤치마크를 상대로 볼 때, 능력 논거가 되지 못합니다. Thinking Machines는 975B 플래그십을 출시한 지 2주 만에, 추천하기 어려운 모델을 출시했습니다. 그것은 이례적인 솔직함이거나 이례적인 속도이며, 어느 쪽이든 그 연구소에 대해 좋은 신호입니다.

다음에 볼 콘텐츠

이번 릴리스가 어떻게 평가될지는 세 가지에 달려 있다. 광고된 1M 컨텍스트를 제공하는 엔드포인트가 나타나는지 — 그렇다면 플래그십의 가장 분명한 남은 우위가 사라진다. 누군가 두 모델에 동일한 노력을 기울인 독립적 비교를 발표하는지 — 그것만이 그 하나의 인덱스 포인트가 진짜인지 알 수 있는 유일한 방법이다. 그리고 2분짜리 오디오 권장사항이 훈련 제한인지 서빙 기본값인지 — 만약 후자라면, 더 큰 모델에 남아 있어야 할 가장 큰 이유가 사라진다. 그때까지, 정직한 요약은 Thinking Machines가 가격은 3분의 1, 속도는 3분의 2 더 빠르고, 자체 증거로는 코딩에서 더 우수하며, 독립적 종합 점수에서는 약간 뒤처지고, 대부분의 보도가 언급하지 않은 같은 크기의 라이벌보다는 분명히 뒤처지는 모델을 출시했다는 것이다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube