
Deep Think Mathematica: Google의 유출된 수학 모델 내부, 그리고 그 추론 트레이스 속의 비명
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
에 대해 가장 많은 것을 드러내는 점은Deep Think Mathematica — 이번 주 내부 테스트에서 모습을 드러낸 Google의 수학 모델 — 그것이 소리치는 듯하다는 것이다. "Lyra"라는 이름으로 게시하는 X 계정이 2026년 9월 16일 내부 추론 로그의 스크린샷을 온라인에 올렸고, 그 로그는 증명 보조 도구처럼 읽히기보다 화이트보드에서 돌파구를 얻은 사람처럼 읽힌다: "잠깐." "오 마이 갓." 그리고 방정식을 성공적으로 단순화한 뒤, 문자열 수학의 성모님이시여!!!!!!!!!!!!!!!!!!!!!!!! 반응은 즉각적이고 애정 어렸다 — Google은 수학을 진심으로 사랑하는 AI를 만든 모양이었다. 그 반응은 또한 이 유출에서 얻을 수 있는 가장 쓸모없는 것이다. 여기 있는 어떤 것도 Google의 확인을 받지 않았다. 모델 카드도, 공개된 목록 어디에도 모델 ID도, 가격도, 출시일도 없다. 존재하는 것은 빌드 문자열, 두 개의 내부 레이블, 토큰 예산, 스크린샷 한 세트, 그리고 같은 제품군에서 실제 출시된 최고의 비교 기준, Gemini 3.1 Deep Think — 오늘 실제로 사용할 수 있는 모델이자, 이 유출이 결국 견주어 평가받게 될 기준이다.
그러니 아래의 모든 내용을 있는 그대로 다루십시오. 즉, 각 항목에 출처가 붙어 있는 주장 목록이며, 각 항목이 감당할 무게에 따라 정렬되어 있습니다.
신호가 실제로 말하는 것 — 그리고 그 위에 자리한 결정적 단서
그 신호 자체는 @testingcatalog에서 나왔습니다. 이 계정은 특히 Google에 관해서는 제법 신뢰할 만한 이력을 가진 계정입니다: Gemini 데스크톱 컴퓨터 사용 계획을 처음으로 드러냈고, Google이 아무 말도 하기 전에 Nano Banana 2의 초기 미리보기 카드를 내부 이름 "GEMPIX2"로 포착했습니다. 9월 16일 게시물에는 질이 매우 다른 두 가지 주장이 담겨 있습니다.
두 번째 주장은 모델에 관한 것이다. 새로운 'Deep Think Mathematica'가 내부 테스트에서 포착되었는데, 이는 Google이 작년에 선별된 기관들에 제공한 Deep Think IMO 모델의 정신적 후속작으로 묘사된다.
첫 번째 주장이 바로 결정적 단서이며, 이해할 가치가 있는 것도 바로 그것이다: "Gemini가 배경을 바꾸려 할 때, 뭔가 큰일이 벌어지고 있다." 그것은 모델에 관한 사실이 아니다. 그것은 Google의 출시 안무에 관한 커뮤니티의 경험적 추론이다 — Gemini 앱 표면의 눈에 띄는 새로고침이 Google의 여러 대규모 발표에 앞서 일어났다는 관찰이다. 이런 경험적 추론은 실제 실적은 있지만 예측력은 전혀 없다. UI 새로고침은 모델이 아니다.
두 주장 모두 검증되지 않았습니다. 어느 쪽도 릴리스가 아니며, 이 글은 그것을 릴리스로 취급하지 않습니다.
여기서 가장 구체적인 산출물이기 때문에 빌드 문자열을 해독하는 것
유통 중인 증거 가운데 가장 결정적인 단 하나는 유출된 로그에서 비롯된 빌드 식별자입니다:
• 빌드 경로 — models/deepthink-mathematica-tf-raw-thoughts, 2026년 9월 16일에 AI Sight가 스크린샷과 함께 보고함.
그 문자열은 자세히 읽을수록 보람이 있으며, 대부분의 보도가 멈추는 지점이기도 하다. 그것의 세 부분이 정보를 담고 있다.
• "deepthink" — 모델을 메인라인 Gemini 라인이 아니라 Deep Think 라인에 위치시킵니다. 이는 중요한데, Deep Think는 모드로서 Google의 출시 제품에 포함되어 있으며, 별도의 제품군이 아니라 여러 후보 솔루션을 동시에 실행하는 병렬 추론 경로입니다.
• "tf" — 문맥상 빌드와 함께 보고된 두 내부 레이블 중 두 번째인 "Teamfood"의 약자입니다. Google의 내부 용어로 이것은 이른 도그푸딩(dogfooding) 단계의 명칭입니다: 고객이 아니라 이를 사용하는 직원을 가리킵니다.
• "raw-thoughts" —가장 흥미로운 부분이며, 그 고함의 열쇠입니다. 이는 필터링되지 않은 사고 연쇄 구성, 즉 예의 조정, 스타일 제약, 출력 필터링 없이 내보내지는 모델의 추론을 뜻합니다. "raw thoughts" 빌드는 제품이 아닙니다. 그것은 누군가가 이를 보기 좋게 만들기 전에 모델이 무엇을 하는지 보고 싶어 할 때 엔지니어들이 들여다보는 것입니다.
두 번째로 보고된 레이블은 UNSTABLE_EXPERIMENTAL인데, 이는 거의 자명하며 "Teamfood"와 같은 방향을 가리킵니다: 초기, 내부용, 고객용 아님.
추가로 두 가지 수치는 동일한 로그에 귀속되며 단일 출처이므로, 잠정적으로만 받아들이세요:
• 컨텍스트 윈도우 — 약 1,000,000 토큰으로, 구글이 이미 최전선 Gemini 모델에 탑재한 1M 윈도우와 맞먹습니다.
• 출력 한도 — 65,536 토큰으로, 추론 모델의 경우 이는 답변 전에 매우 긴 숙고를 의미합니다.
그것이 이번 유출의 기술적 표면 전부다. 빌드 경로 하나, 두 개의 단계 레이블, 컨텍스트 윈도, 출력 상한. 어떤 것이 테스트 하네스 안에 존재한다고 말하기에는 충분하다. 그것이 어떤 점수를 받는지 말하기에는 충분하지 않다.

고함치는 추론 추적이 보기보다 약한 증거인 이유
느낌표가 이 유출이 퍼진 이유이며, 그것을 조심해야 하는 이유이기도 하다.
보고된 설명은 평범하고 빌드 문자열과 정확히 들어맞는다: 필터링되지 않은 추론 구성이 높은 생성 온도에서 실행되었고, 정중함과 서식 계층은 제거된 상태다. 모델이 차분하게 들리도록 만드는 튜닝을 제거한다고 해서 그 모델의 영혼이 드러나는 것은 아니다 — 드러나는 것은 그 샘플러다. 느낌표가 많은 출력은 흥분한 이어짓기의 고온 샘플이 어떤 모습인지를 보여줄 뿐이다. 그 감정적 해석은 구성의 부산물이지, 모델에 관한 발견이 아니다.
더 깊은 요점은 사고의 연쇄란 무엇인지에 관한 것이다. 추론 흔적은 문제를 푸는 데 우연히 도움이 되는 생성된 텍스트다. 그 기록을 읽고 내부 상태—열의, 좌절, 기쁨—을 추론하는 것은 계산기가 깔끔한 정수를 산출할 때 기뻐한다고 추론하는 것과 같은 범주의 오류다. 이 점은 분명히 말할 가치가 있는데, 이번 유출을 다룬 중국어 보도는 농담("等等", "我的天")을 적극적으로 활용했고 일부 영어 보도는 그 농담이 모델의 성격에 대한 묘사로 굳어지도록 내버려 두었기 때문이다.
그렇다고 해서 그 트레이스가 무가치해지는 것은 아니다. raw-thoughts 빌드를 노출하는 것은 실제 엔지니어링 관행에 관한 진짜 증거다 — 추론 자체를 디버깅할 때만 필터링되지 않은 추론을 기록하는데, 이는 어려운 문제를 얼마나 잘 사고해내는지가 전체 가치 제안인 모델에 대해 하는 일이다. 그리고 그 트레이스가 의도적인 디버깅에서 나온 것인지 의도치 않은 로깅에서 나온 것인지는 검증되지 않았다.
솔직한 요약: 감탄사들은 가공되지 않은 추론 구성이 존재한다는 것을 알려준다. 그것들은 수학적 능력에 대해서는 아무것도 알려주지 않는다.
Millennium Bench는 밀레니엄 문제가 아닙니다
이 유출에 관한 여러 글, 그중에서도 9월 16일에 유통된 애그리게이터 요약문들은 모델이 "Millennium Bench를 목표로 삼고 있다"고만 말하고 거기서 끝난다. 그 이름은 우연히 역할을 하고 있는데, 훨씬 더 유명하고 훨씬 더 많은 의미가 실린 어떤 것과 한 단어 차이에 있기 때문이다 — 각각 100만 달러의 상금이 걸려 있고, 이번 달 OpenAI와 Navier–Stokes 증명에 관한 별개의, 전적으로 확인되지 않은 주장의 주제이기도 한 클레이 수학연구소의 7대 밀레니엄 문제. 그 스레드의 한 보고서는 Google이 88시간 만에 그 문제를 "해결했다"는 AI를 만들었다고 말한다. 클레이는 여전히 그것을 미해결로 올려 두고 있다.
이것들은 서로 다른 것이며, 이 둘을 혼동하면 이 유출이 상당히 부풀려집니다.
ICLR 2026 논문에서 소개된 MILLENNIUM-BENCH는"연역이 무너지는 곳: 연구 수준 수학에서의 추론 실패 진단"이라는 벤치마크로, 수리물리학, 위상수학, 측도론적 확률론을 포함한 아홉 개 영역에 걸친 전문가 선별 연구 수준 문제들로 구성되어 있습니다. 이는 경시대회 수학을 훨씬 뛰어넘는 지속적인 다단계 연역을 요구하도록 만들어졌습니다.
이 유출 자료를 읽는 데 중요한 부분은 논문의 핵심 결과다. 다섯 개 프런티어 모델을 대상으로 문제당 100회 실행했을 때, 가장 강력한 모델도 많아야 24%의 pass@1과 39%의 pass@3를 달성했다. 모델이 실패하는 방식에 대한 논문의 진단은 점수보다 더 유용하다: 프레임워크 환각, 즉 모델이 적용할 수 없는 이론을 만들어 낸 뒤 그 안에서 일관되게 추론하는 경우, 그리고 날조된 정리, 즉 존재하지 않는 결과를 인용하며 저자 이름과 정리 번호까지 지어내는 경우다.
그 두 가지를 함께 염두에 두세요. 최고의 모델이 문제의 4분의 1 부근에서 한계에 다다르고, 대표적인 실패 양상이 확신에 찬 날조인 벤치마크는 바로 유출된 스크린샷이 무엇도 입증하기 가장 어려운 벤치마크입니다. 일하는 동안 소리치는 모델은, 그 출력을 작성자가 아닌 다른 사람이 채점해 주기를 바라게 되는 모델입니다.
구글이 이 라인에서 실제로 출시한 것
유출된 내용은 출시된 기록과 맞대어 볼 때에만 읽힌다. 왜냐하면 Google의 수학 이야기는 문서화된 진행 과정이고, 유출된 이름은 그 신뢰성을 빌려오고 있기 때문이다.
• 2025년 7월 — Gemini Deep Think의 고급 버전이 국제 수학 올림피아드에서 금메달 수준에 도달하여, 6문제 중 5문제를 풀어 42점 만점에 35점을 획득했으며, 이는 학생들에게 적용되는 것과 동일한 기준에 따라 IMO 관계자들이 채점한 결과입니다. Demis Hassabis는 이것이 형식 구문으로의 변환 없이 자연어로 처음부터 끝까지 작동했다고 언급했습니다.
• 2025년 8월 1일 —Google은 Gemini 2.5 Deep Think를 공개 출시했지만, 골드 모델은 아니었습니다. 공개된 버전은 Google이 더 빠르고 최적화된 변형이라고 설명한 것으로, Google의 내부 평가에 따르면 2025 IMO 벤치마크에서 브론즈 수준의 성능에 도달했습니다. 이 버전은 최상위 소비자 등급으로만 제공되었습니다. 동시에 Google은 완전한 골드 모델을 엄선된 수학자 및 학계 그룹 — 유출된 신호가 다시 언급하는 “선별된 기관” — 에게 제공했습니다.
• 2025년 12월 — Gemini 3 Deep Think, Google이 코드 실행을 사용한 ARC-AGI-2에서 45.1%, 도구 없이 Humanity's Last Exam에서 41.0%라고 보고한 큰 세대적 도약과 함께.
• 이제 — Gemini 3.1 Deep Think는 Gemini 3.1 Pro를 기반으로 구축되었으며, 최상위 소비자 구독 등급과 초대 전용 API 프로그램을 통해 판매됩니다. 구글이 자체 공개한 수치로, 벤더가 보고한 값이며 독립적으로 재현된 바 없는 이 수치는 ARC-AGI-2 84.6%, Humanity's Last Exam 도구 없이 48.4%·검색과 코드 사용 시 53.4%, IMO 2025 81.5%, Codeforces Elo 3455를 기록했습니다.
인접한 두 가지 노력도 중요하다. Aletheia는 Gemini Deep Think를 기반으로 구축된 수학 연구 에이전트로, 제3자 보고에 따르면 IMO-ProofBench Advanced에서 약 95.1%를 기록한 것으로 알려져 있다. 그리고 이는 그 수치 자체보다, 해를 만들어내기보다 "해를 찾지 못함"이라고 말하도록 설계되었다는 점에서 더 주목할 만하다. 2026년 2월 FirstProof 챌린지에서는 10문제 중 6문제를 해결하고 나머지는 거절했다. 또한 보고에 따르면, Gemini 3.1 Pro에서 실행되는 AI Co-Mathematician 구성은 FrontierMath Tier 4 성능을 19%에서 47.9%로 끌어올렸다.

그 마지막 수치는 잠시 짚고 넘어갈 만합니다. 그것이 이 유출을 기사화된 방식대로 읽는 데 반대하는 가장 강력한 논거이기 때문입니다. 새로운 체크포인트가 아니라 일반 Gemini 모델을 감싼 스캐폴드로 달성한, 연구 수준 수학에서의 19%에서 47.9%로의 도약은 Google의 수학 성능에서 최근 가장 큰 향상이 모델 아래에 있는 전문 모델이 아니라 모델을 둘러싼 하네스에서 비롯되었음을 시사합니다. 그것이 Mathematica가 스캐폴드라는 뜻은 아닙니다. 다만 "이것은 새로운 전용 수학 모델이다"라는 주장에 대한 입증 책임이 그 보도가 전제한 것보다 더 크다는 뜻입니다.
이 모든 것 위에 또 하나의 맥락이 있습니다: DeepMind는 2026년 8월에 재편되었고, 데미스 하사비스는 회장직으로 옮겼습니다. 재편 중인 연구소 내부에서 나온 유출이 안정적인 연구소에서 나온 유출보다 더 신뢰할 만한 것은 아니며, 보도는 그 시점을 관련 있는 것으로 다루지 않았습니다. 관련이 있을 수도 있습니다.
모델인가, 스캐폴드인가? 이번 유출로는 해결되지 않는 질문
보도에는 Mathematica가 애초에 새로운 모델인지에 대한 활발한 논쟁이 있다. 한쪽 진영은 빌드 문자열의 "deepthink" 접두사를 지목하며 이를 별도 체크포인트로 해석한다. 다른 진영 — 우리가 앞서 Deep Think V3 루머에 관해 쓴 글도 여기에 속한다 — 은 Google의 전문 수학 결과가 일반 Gemini 모델을 감싼 에이전트 스캐폴드에서 비롯된 것이며, 그 수치가 실제이기 위해 별도의 수학 모델이 존재할 필요는 없다고 주장한다.
빌드 문자열은 첫 번째 진영에 유리한 소소한 근거다: models/deepthink-mathematica-tf-raw-thoughts는 하나의 모델을 가리키며, "raw-thoughts"는 하네스 계층이 아니라 모델 구성을 설명한다. 스캐폴드는 디버깅되기 위해 추론이 여과되지 않은 상태일 필요가 없을 것이다; 생각이 곧 제품인 모델은 그럴 것이다. 그것은 실제 신호다.
그것은 결정적인 것이 아니다. 하네스에도 설정이 있고, 내부 경로 문자열은 스키마가 아니라 로깅을 설정한 사람이 쓴 것이다. 이것을 결판낼 수 있는 것은 아무도 가지고 있지 않은 것이다: 모델 카드, 또는 엔드포인트, 또는 답에 이해관계가 없는 누군가가 실행한 벤치마크.
오늘 실제로 전화할 수 있는 것
이 중 어느 것도 이번 주에 프로덕션에 투입할 수 있는 것을 바꾸지 않으며, 이 격차에 대해서는 직설적으로 말할 가치가 있습니다. Deep Think mathematica는 어떤 API에도 없습니다. Gemini 3.1 Deep Think도 토큰당 판매되지 않습니다 — 최상위 소비자 구독 등급을 통해서만 제공되며, 등급에 따라 월 $99.99에서 $199.99 사이로 책정되어 있고, 초대 전용 API 프로그램도 있습니다. 이에 대한 공개된 백만 토큰당 가격은 없습니다.
기반으로 삼는다고 알려진 기본 모델은 이야기가 다르다. Gemini 3.1 Pro의 가격은 200,000토큰 미만 컨텍스트 기준 입력 토큰 100만 개당 $2.00, 캐시 적용 시 $0.20, 출력 토큰 100만 개당 $12.00이며, 이를 초과하면 $4.00 / $0.40 / $18.00으로 올라간다 — Google이 직접 공개한 요율이다.
그 가격 세부 정보에 실질적인 결정이 달려 있습니다. 추론 모드 간 비용 격차가 작지 않기 때문입니다. ARC-AGI-2에서 Deep Think는 작업당 약 $13.62로 약 85%를 기록한 것으로 보고되며, 반면 Gemini 3.1 Pro는 작업당 약 $0.96로 77%를 기록했습니다. 8점을 얻기 위해 약 14배를 더 지불하는 셈입니다. 그것은 어려운 연구 문제에는 정당화할 수 있는 선택이지만, 대부분 평범한 작업을 처리하는 프로덕션 경로에는 정당화할 수 없는 선택입니다 — 그리고 올바른 답은 대개, 미리 내리는 구독 결정이 아니라 둘 모두 같은 곳에서 접근 가능하기를 원한다는 것입니다.

이는 하나의 키로 라우팅하는 경우에 해당합니다. 오늘 호출 가능한 Gemini 모델들 — Gemini 3.1 Pro Preview, Gemini 3.8 Flash는 백만 입력 토큰당 $0.750에 캐시 읽기 $0.075이고, 나머지 제품군 역시 — 15개 제공업체에 걸친 198개 모델로 이루어진 OrcaRouter의 카탈로그 위에, 하나의 OpenAI 호환 엔드포인트 뒤에 자리합니다. 제공업체 정가에는 마크업이 붙지 않으므로, Google의 가격 변경은 재계약을 기다릴 필요 없이 같은 날 저희 쪽에 바로 반영됩니다. 자동 페일오버 덕분에 검증되지 않았거나 프리뷰 단계인 모델이 프로덕션 경로를 혼자 감당하지 않고도 라우트에 포함될 수 있는데, 이는 유출된 모델에게 딱 맞는 자세입니다: 한번 써보고, 폴백을 남겨두고, 그 외에는 아무것도 바꾸지 않는 것. 라우팅 DSL은 여러 모델을 하나의 호출로 구성하고, 모델 퓨전은 패널을 돌려 답변을 결합합니다 — 둘 다 질문이 어렵고 "한 모델 이상의 의견을 원한다"는 것이 솔직한 입장일 때 유용합니다.
경계를 분명히 하자면: OrcaRouter는 Deep Think mathematica를 호스팅하지 않으며, Gemini 3.1 Deep Think도 호스팅하지 않습니다. 그것들은 우리 카탈로그에 없으며, 여기에서 달리 암시하는 내용은 없어야 합니다. 카탈로그에 있는 것은 그것들 아래에 있는 Gemini 계층입니다.
무엇이 이것을 유출에서 뉴스로 바꿔 놓을까
네 가지, 이야기를 얼마나 크게 움직일지에 따른 대략적인 순서대로.
• 모델 카드. Google의 Deep Think 출시에는 공개된 평가가 함께해 왔습니다. MILLENNIUM-BENCH나 IMO-ProofBench Advanced에 대한 수치를 담고, 명시된 조건에서 실행된 카드라면 이것은 빌드 문자열에서 하나의 모델로 바뀔 것입니다.
• 엔드포인트. 가장 명확한 신호는 Mathematica가 Gemini API나 Google의 모델 목록에 어떤 이름으로든 나타나는 것입니다. 그 일이 일어나기 전까지는 아무도 그것을 호출할 수 없고 비교할 가격도 존재하지 않습니다.
• 기관 경로. 2025년 구글의 패턴은 가장 강력한 수학 모델을 선별된 수학자들에게 먼저 제공하고, 대중에게는 나중에 더 빠른 변형을 내놓는 것이었습니다. 연구자들을 대상으로 한 조용한 배포는 이러한 전례에 부합할 것이며, 제품 발표보다 먼저 드러날 가능성이 높습니다.
• 제3자 실행.문제의 벤치마크가 현존 최고 모델 기준으로도 pass@1 약 24% 부근에서 최고치를 기록하고, 그 대표적인 실패 양상이 자신감에 찬 날조라는 점을 감안하면, 독립적 평가만이 유일하게 견고한 증거입니다. 이 글에서 숫자를 동반하는 모든 수치는 구글 자체 수치이거나 제3자가 보고한 것이거나, 검증되지 않았음이 명시적으로 표시된 것입니다 — 그리고 그중 어느 것도 딥마인드 외부의 누군가가 실행해 본 모델에서 나온 것이 아닙니다.
지금 할 가치가 있는 단 한 가지는 기다리는 것이 아니다. Google의 수학 모드와 기본 모델 사이에는 비용 14배, 정확도 8포인트의 격차가 있고, 그 트레이드오프는 이미 실제로 작동 중이다. 오늘 Gemini 3.1 Pro Preview를 하나의 키에 두고 그 뒤에 폴백을 두면 그 선택을 바로 할 수 있다. Mathematica에 모델 카드가 생기면, 어려운 문제를 어떻게 라우팅할지 이미 결정해 두고 싶을 것이다. 그리고 그 답은 유출된 모델이 결국 무엇으로 밝혀지든 달라지지 않을 것이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
