
Tiny Aya Base 32K vs Tiny Aya En-Thinker: 부모와 자식이지, 라이벌이 아니다
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 100만 토큰당
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
Hugging Face 저장소 두 개, 각각 네 개의 safetensors 샤드, 그리고 샤드 크기는 바이트 단위까지 일치합니다 — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K와 Tiny Aya En-Thinker는 같은 질문에 대한 두 연구소의 답이 아닙니다. 이들은 서로 다른 두 단계에 있는 동일한 3.35B Cohere2 아키텍처입니다. 그리고 Cohere Labs 자체의 모델 카드가 이를 대놓고 말합니다: 기본 체크포인트는 "Tiny Aya L2-Thinker와 Tiny Aya En-Thinker의 기본 모델로 사용됩니다."
그러면 흔히 하는 맞대결 구도는 잘못된 것이 된다. 당신은 경쟁하는 두 개의 3B 다국어 모델 중에서 고르는 게 아니다. 당신은 출발점과 완성본 중에서 고르는 것이다 — 그리고 흥미로운 질문은 그 사이의 포스트트레이닝 단계가 실제로 무엇을 얻어냈고, 무엇을 대가로 치렀으며, 둘 다 동일한 비상업적 라이선스에 묶여 있고 어느 쪽도 공개된 벤치마크를 단 하나도 갖고 있지 않다는 점을 고려할 때, 둘 중 어느 하나라도 당신이 염두에 둔 용도에 쓸 수 있는지이다.
관계를 정리하는 단 한 문장
보통 "vs" 비교 글은 아키텍처와 파라미터 수로부터 두 체크포인트 사이의 관계를 추론해야 합니다. 여기서는 그럴 필요가 없습니다.
Tiny Aya Base 32K의 카드는 이를 명확히 밝히고 있으며, 그 문장이 놓인 위치 때문에 주의 깊게 읽을 가치가 있다 — 각주가 아니라 모델 요약에서, 체크포인트 설명과 개발자 크레딧 사이에:
"이것은 기본 사전 학습 모델이며, 명령어 튜닝이나 선호도 정렬이 적용되지 않았습니다. 이 체크포인트는 Tiny Aya L2-Thinker 및 Tiny Aya En-Thinker의 기본 모델로 사용됩니다."
그것이 한 문단을 할애할 가치가 있는 이유는 그것이 드러내는 불일치 때문이다. En-Thinker의 자체 카드는 Base 32K를 언급하지 않는다. 마지막 줄은 독자들을 "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker"로 안내하는데 — 그리고 tiny-aya-base는 2월 체크포인트로, 8K 컨텍스트로 문서화되어 있으며, 자신이 En-Thinker의 부모라고 말하는 32K 변형이 아니다. En-Thinker는 자체 카드에서 32K를 주장한다. 모델은 사전 학습에 사용된 창보다 네 배 더 넓은 창으로 사후 학습될 수 없다. 따라서 8K 베이스는 결코 답이 될 수 없었고, 32K 베이스의 주장은 En-Thinker 자체의 포인터가 그렇지 못한 곳에서 그 산술과 들어맞는다.
유력한 설명은 평범하다: Base 32K는 2026년 9월 8일에 업로드되었는데, 이는 6일 후였고, 그 기점은 Thinkers였으며, 따라서 En-Thinker의 카드는 그 부모가 존재하기 전에 작성되었으며 그 이후로 업데이트되지 않았다. 이는 타임스탬프에 근거한 추론이지 벤더의 진술은 아니다 — 하지만 가장 적은 가정을 필요로 하는 해석이며, 이는 이 제품군에서 가장 최신 문서가 가장 많은 정보를 담고 있다는 뜻이다.

차원별로
아래의 모든 내용은 두 카드가 밝힌 것에서 중복을 제외한 것입니다 — 둘 다 3.35B, BF16, 텍스트 전용, Cohere2ForCausalLM, CC-BY-NC-4.0, 게이트 적용, 벤치마크 없음입니다.
• 단계 — Tiny Aya Base 32K는 사전 학습된 베이스로, "명령어 튜닝이나 선호 정렬이 적용되지 않았으며"; Tiny Aya En-Thinker는 영어 추론 트레이스를 사용한 다국어 추론 데이터로 사후 학습되었습니다.
• 채팅 템플릿 — Base 32K는 chat_template.jinja를 전혀 제공하지 않습니다. En-Thinker는 이를 제공하며, 해당 카드에서는 턴을 렌더링하는 방식에 전체 섹션을 할애합니다.
• 프롬프트 스타일 — Base 32K의 자체 예시는 완성(completion)입니다 (prompt = "The capital of Spain is"); En-Thinker가 기대하는 것은 apply_chat_template()를 메시지 목록과 함께 사용하는 것입니다.
• 추론 모드 — Base 32K에는 추론 모드가 없으며, En-Thinker는 이중 모드로, /think를 기본적으로 덧붙여 영어로 사고 흔적을 출력하거나, /no_think와 함께enable_thinking=False로 직접 답변을 얻습니다.
• 언어 범위 — Base 32K의 카드는 70개 이상의 언어로 학습했다고 주장하며 67개를 명시적으로 언급한다; En-Thinker는 영어 추론 트레이스와 함께 "44개 언어 + 영어"를 포괄하며, 추가적인 비추론 지시 데이터를 통해 20개 이상으로 더 확장된다.
• 아키텍처 풋프린트 — 동일함. 동일한 네 가지 샤드 크기, 동일한 파라미터 수, 동일한 구성 파일 길이.
• 컨텍스트 — 두 카드 모두 32K 입력 + 출력. 어느 쪽도 검증할 수 없습니다: 두 구성 모두 라이선스 게이트 뒤에 있습니다.
• 벤치마크 — 두 카드 모두 없음. 두 모델 중 어느 것에 대해서도 제3자 평가가 존재하지 않는다.
• 트랙션 — Base 32K는 다운로드 0회와 좋아요 1개를 보이며, En-Thinker는 다운로드 7회와 좋아요 2개를 보입니다. 둘 다 추론 제공업체의 카탈로그에는 나타나지 않습니다.
포스트 트레이닝 단계가 얻어낸 것
세 가지입니다. 모두 구조적이라기보다 행동적인 것입니다.
첫 번째는 사용 가능한 인터페이스입니다. 채팅 템플릿이 없는 체크포인트는 프롬프트를 넣는 모델이 아니라 이어 쓰는 모델입니다. Base 32K와 나누는 모든 대화는 직접 텍스트로 직렬화해야 하며, 카드에도 그대로 나와 있습니다: "프롬프트는 채팅 템플릿보다 텍스트 완성을 사용해야 합니다. 대화형 어시스턴트로 배포하기 전에 추가 사후 학습을 권장합니다." En-Thinker는 토큰 레이아웃에 이르기까지 이미 당신을 대신해 그 결정을 내려 두었습니다.
두 번째는 추론을 스위치로 다루는 것입니다. En-Thinker의 /think 및 /no_think 모드는 동일한 가중치가 thinking 태그 사이에서 가시적인 사고 연쇄를 생성하거나 곧바로 답변하도록 하며, 카드에서는 이전 thinking 블록을 어시스턴트 턴으로 대화에 다시 전달하는 방법을 문서화합니다. 그것은 포스트트레이닝 아티팩트입니다 — 기본 체크포인트에는 이에 반응하는 것이 아무것도 없습니다.
세 번째는 En-Thinker의 중심에 있는 설계상의 승부수입니다: 질문과 답이 다른 언어로 되어 있어도 추론은 영어로 이루어진다는 것입니다. 이 카드는 이것이 Tiny Aya L2-Thinker와 구별되는 점이라고 분명히 밝힙니다. Tiny Aya L2-Thinker는 "프롬프트와 같은 언어로 생각합니다." 고자원 언어로 계획하고 저자원 언어로 답하는 것이 실제로 도움이 되는지는 미해결 연구 질문이며, En-Thinker는 이 문제를 해결하기보다 사람들이 그것을 시험해 볼 수 있도록 존재합니다. 추론 모드가 전혀 없는 Base 32K는 이 질문에 대해 침묵합니다 — 그리고 바로 그 점 때문에, 이 질문에 답하려는 사람에게 Base 32K는 올바른 대조군입니다.

학습 후 단계에 얼마가 들었을까
솔직한 답은 아무도 그것을 수치로 나타낼 수 없다는 것입니다. 왜냐하면 두 모델 모두 어떤 것에 대해서도 평가된 적이 없기 때문입니다. 하지만 두 카드를 함께 보면 그 트레이드오프가 어디에 존재하는지가 어렴풋이 드러나는데, 그것은 당신이 예상할 만한 곳이 아닙니다.
그것은 언어 지원 범위 때문이 아닙니다. En-Thinker의 좁은 44개 이상의 영어 추론 범위는 추론 훈련 데이터의 속성이며, 카드에는 지원 범위가 "추가 비추론 지시 데이터를 통해" 20개 이상의 추가 언어로 확장된다고 나와 있습니다 — 따라서 모델은 여전히 그 언어들을 처리하지만, 사고 경로 없이 처리할 뿐입니다. 컨텍스트 창 때문도 아닙니다. 둘 다 32K를 주장합니다.
그것은 행동의 폭이다. Base 32K의 카드는 "지속 사전 학습, 지시 튜닝, 다국어 및 장문맥 언어 모델링 연구"를 의도된 용도로 나열하며, 다국어 텍스트 생성, 요약, 번역, 교차언어 적응을 모두 다운스트림 애플리케이션으로 명시한다. En-Thinker의 카드는 더 좁다: "수학, 과학, 일반 추론 작업, 그리고 지시 따르기와 다국어 개방형 생성." 포스트트레이닝된 체크포인트는 베이스 체크포인트와 달리 특정한 관점을 취하며, Base 32K의 카드가 지적하는 한계 — "다국어 수학과 같은 사고 사슬 추론 작업은 상대적으로 더 약하다" — 는 바로 포스트트레이닝이 해결하고자 했던 약점이다.
그래서 이 패밀리는 경쟁이 아니라 분업으로 읽힌다. 베이스는 넓고 미완성이며, En-Thinker는 좁고 완성되어 있다. 그리고 베이스 카드 자체의 텍스트는 그것을 있는 그대로 부른다 — 두 Thinker가 빚어진 토대라고.
라이선스가 실제로 구속력을 가지는 제약이다
두 모델 모두 CC-BY-NC-4.0이며, 그 위에 Cohere Labs의 허용 가능한 사용 정책이 추가로 적용됩니다. 두 모델 모두 파일을 다운로드하기 전에 약관에 동의하고 등록하도록 요구하는 동일한 게이트 뒤에 있으며, 상업적 문의는 모두 Cohere Sales로 연결됩니다.
이 점은 어떤 기술적 비교보다 먼저 말할 가치가 있습니다. 많은 독자에게 이 질문의 답을 결정하기 때문입니다. 계획이 상업용 제품이라면, Cohere와 논의하지 않고는 어느 체크포인트도 후보가 될 수 없으며, 긴 문맥 처리나 추론 모드 유연성이 아무리 뛰어나도 이 사실은 달라지지 않습니다. 비상업적 용도가 정말로 괜찮은 경우 — 학술 연구, 내부 연구, 벤치마크 하네스, 자체 모델과의 비교 — 에서는 라이선스가 무관하며 기술적 선택이 결정의 전부입니다.
둘 다 벤치마크된 적이 없습니다. 그래도 선택하는 방법은 다음과 같습니다
숫자가 없다는 사실은 분명하며, 더 꼼꼼히 읽는다고 해결될 문제가 아니다. 두 카드 모두 성능 관련 주장을 전혀 하지 않고, 어떤 리더보드에도 두 모델이 올라 있지 않으며, 둘 다 뒤에 추론 제공자가 없다. 즉, 보통 벤치마크를 대신하는 처리량이나 가격을 공개한 제공자가 없다는 뜻이다. 할 수 있는 일은 구조를 따지는 것이다. 그 부분에서는 근거가 탄탄하다.
• 훈련할 예정이라면 Tiny Aya Base 32K를 선택하세요. 다국어 3.35B 모델 위에서의 지속 사전 학습, 인스트럭션 튜닝 또는 도메인 적응이 이 모델 카드가 밝힌 용도이며, 베이스 체크포인트에서 시작한다는 것은 자신이 선택하지 않은 후속 학습과 싸우지 않아도 된다는 뜻입니다. 32K 컨텍스트 창은 또한 8K February base가 할 수 없었던 긴 컨텍스트 연구도 지원합니다.
• 오늘 뭔가를 프롬프트하고 싶다면 Tiny Aya En-Thinker를 선택하세요. 둘 중 대화를 나눌 수 있는 유일한 모델이며, 추론 모드가 아예 있는 유일한 모델이기도 합니다.
• 질문이 실용적이라기보다 과학적이라면 둘 다 고르세요. 이 쌍은 통제된 비교입니다 — 동일한 아키텍처, 동일한 크기, 동일한 윈도, 주로 포스트트레이닝이 이루어졌는지 여부에서만 차이가 나는 — 영어 추론 흔적이 다국어 답변을 개선하는지 묻기 위한 것입니다. 바로 그 질문을 사람들이 탐구할 수 있도록 En-Thinker가 공개되었으며, En-Thinker 자체의 부모가 가장 깨끗한 베이스라인입니다.

둘 중 하나를 평가할 때 참고할 실무적인 사항 하나: 이들은 배포 이력이 전혀 없는 검증되지 않은 연구용 체크포인트이며, 6.7GB BF16 다운로드에 GPU 시간까지 더하면 한 번도 독립적으로 실행된 적 없는 모델에 쏟아붓기엔 적지 않은 비용입니다. 각 후보의 가중치를 직접 띄우는 대신 단일 엔드포인트로 그 비교를 돌리는 편이 더 저렴합니다 — OrcaRouter는 하나의 API 뒤에 195개 모델을 갖추고 있으며 제공업체 정가에 0% 마크업과 제공업체 간 자동 페일오버를 지원하므로, 단지 테스트만 해 보는 연구용 체크포인트가 프로덕션 경로에 놓이는 일은 결코 없습니다. Tiny Aya는 여기에 없고 저희도 호스팅하지 않습니다. 요점은 당신이 그것을 비교 대상으로 삼을 모델들은 대부분 거기에 있다는 것뿐입니다.
이 문제를 해결할 수 있는 방법은 무엇일까요?
두 가지입니다. 그리고 둘 다 Cohere Labs가 공개하는 데는 저렴하고, 다른 누구든 만들어 내는 데는 비쌉니다.
첫 번째는 벤치마크입니다 — 어떤 벤치마크든 말이죠. 두 체크포인트 모두에서 실행된 단일 다국어 추론 평가는 전체 패밀리를 "카드에 명시된" 상태에서 "측정된" 상태로 전환할 것이며, 영어로 사고하는 설계가 후처리 학습 없이 동일한 모델을 능가하는지 즉시 답할 것입니다. 이는 이번 릴리스가 중심에 두고 있는 연구 질문입니다.
두 번째는 구성 파일이다. 두 카드의 32K 주장은 저장소가 게이트로 막혀 있는 동안에는 검증할 수 없고, 진정한 장문맥 사전 학습 실행과 8K 체크포인트에 적용한 위치 인코딩 확장 사이의 차이는 둘 다 32K 토큰을 받아들이는 모델을 만들어 내더라도 실제로는 크다. 두 구성 파일을 열어 보면 마케팅 문구로는 결코 할 수 없는 방식으로 그 격차를 좁힐 수 있을 것이다.
그때까지는 "Tiny Aya Base 32K냐 Tiny Aya En-Thinker냐"에 대한 정확한 답은 비교는 실제지만 경쟁은 아니라는 것이다. 같은 가중치, 같은 윈도, 같은 라이선스, 그것들을 다운로드하지 않은 모든 사람의 똑같은 침묵 — 둘 중 하나는 그저 채팅 템플릿과 사고 태그를 갖고 있을 뿐이고, 다른 하나는 그것이 만들어진 원본이다.
