Титульная карточка с надписью «Модель DeepSeek 3T» и подзаголовком «Заявленные 3 триллиона параметров, таблица памяти Engram объёмом 1T и кластер, который появится не раньше 2027 года», над тремя плитками-иконками с надписями «3T — параметры: не подтверждены», «~1T — Engram: предположение самого автора» и «Кластер — не раньше конца 2027 года», с нижней строкой «Утечка из единственного источника; репозитория, карточки модели или строки с ценой не существует».
Guides & Insights

Модель DeepSeek на 3T: масштабирование, которому придётся подождать кластеров

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

14 сентября Deep​Seek выведет из эксплуатации DeepSeek V4 Pro — флагманскую модель с 1,6 триллиона параметров, выпущенную в общий доступ 13 августа, — и будет отвечать на все вызовы к deepseek-v4-pro с помощью DeepSeek V4.1 Flash, модели с 552 миллиардами параметров, выпущенной 10 сентября. За четыре дня до объявления об этом переходе наблюдатель за Deep​Seek, выступающий под псевдонимом, опубликовал нечто, указывающее в противоположную сторону, а именно: лаборатория работала над моделью с 3 триллионами параметров, «вероятно, ещё одним Engram с 1 триллионом параметров», и причина, по которой она не выпущена, — экономика, а не возможности.

Ничего об этой модели не подтверждено. Нет ни названия, ни репозитория, ни конфигурационного файла, ни бенчмарка, ни окна релиза — один пост в X, со ссылкой на «достоверный источник», при этом самая интересная деталь в нём прямо помечена автором как предположение. Относитесь к этому как к сигналу, а не как к факту. В любом случае это стоит прочитать, потому что две половины утверждения тянут в противоположные стороны, и только одна из них, вероятно, переживёт столкновение с дорожной картой самого Deep​Seek.

Что на самом деле говорит утечка, а чего она не говорит

Пост опубликован с аккаунта teortaxesTex — давнего наблюдателя за DeepSeek, который называет себя фанатом лаборатории с 2023 года. Вот его полный текст: «Вообще-то, у меня есть достоверные сведения, что DeepSeek работал над моделью на 3T параметров (бэкбон, вероятно, ещё один Engram на 1T параметров, но это мои догадки). Они просто не были уверены, что её пост-обучение и обслуживание будут экономически оправданы. Когда их кластеры вырастут, мы кое-что увидим...»

В этих двух предложениях четыре вещи имеют вес, и одна из них — вовсе не факт. «Авторитетный источник» не назван. Количество параметров указывается одним числом, без разделения на общее и активное. Побочное замечание об Engram сам его автор называет предположением. А «когда их кластеры вырастут» — это условие, к которому не привязана дата.

• Что утверждается — что модель Deep​Seek с 3 триллионами параметров существует на некоторой стадии разработки.

• Что именно является собственным предположением автора — что примерно 1T из этого — это память Engram.

• Что неизвестно — его название, архитектура, число активных параметров, контекстное окно, статус обучения и то, выпускается ли он вообще как продукт.

• Что можно проверить прямо сейчас — ничего. Ни в репозитории Deep​Seek, ни в карточке модели, ни в строке с ценами, ни в документации об этом не упоминается.

Даже арифметика здесь неоднозначна. Фраза «3T-модель (бэкбон, вероятно, ещё 1T параметров Engram)» допускает два прочтения: либо это 3T-модель, из которой около 1T приходится на Engram, либо это 3T-бэкбон с отдельными ещё 1T параметров Engram, что в сумме даёт примерно 4T. Этот разрыв в триллион параметров меняет счёт за обслуживание на сумму, превышающую то, что большинство лабораторий тратит на обучающий прогон.

Стоит также помнить, что послужной список этого аккаунта неоднозначен, а не безупречен. Он воспринял уведомление Deep​Seek от 9 сентября о перенаправлении трафика V4 Pro как свидетельство того, что лаборатория «решила архитектурные проблемы семейства V4», — разумное умозаключение, но всё же умозаключение. В начале сентября он также выдвинул предположение, что анонимная скрытая модель на сторонней платформе для программирования — это Xiaomi MiMo-V3-Flash, чего никто не подтвердил. Полезный ранний сигнал; не источник истины.

Интересная половина — это таблица памяти, а не количество параметров.

Энграмма реальна, и именно поэтому заявление о 3T выглядит более правдоподобным, чем кажется на первый взгляд. Deep​Seek опубликовал архитектуру условной памяти в январе 2026 года с приложенным открытым исходным кодом, и она делает кое-что необычное: разделяет статическое извлечение знаний и динамическое рассуждение. Вместо того чтобы тратить вычислительные ресурсы GPU на вспоминание фактов, модель хэширует свой контекст в таблицы эмбеддингов, хранящиеся в DRAM, и выполняет извлечение за постоянное время, без участия GPU в пути поиска, плюс механизм гейтирования, который подавляет извлечённую память, когда она конфликтует с окружающим контекстом.

«Цифры, которые Deep​Seek приводит для своей собственной тестовой конфигурации, — это те, на которые стоит ориентироваться: таблица эмбеддингов со 100 миллиардами параметров, выгруженная в DRAM, с потерей пропускной способности менее 3%, и точность „иголка в стоге сена“ 97% при 1 млн токенов против 84,2% для стандартного внимания. Это собственные цифры лаборатории, не воспроизведённые нами. По имеющимся данным, независимые ранние оценки ложатся в диапазон 93–96% при той же длине контекста — выше базового уровня, но ниже заявленного.»

{{1}}Увеличьте эту идею в десять раз, и форма утечки изменится.{{/1}} {{2}}Если большая часть дополнительных параметров модели на 3T — это память хеш-таблиц в DRAM, а не конкурирующие за HBM эксперты, то «3T» перестаёт быть синонимом «необслуживаемой».{{/2}} {{3}}Общее количество параметров и стоимость обслуживания расходятся.{{/3}} {{4}}Именно это — по-настоящему новая идея в этой утечке, и именно эту часть опубликованное исследование действительно подтверждает.{{/4}}

Оговорка состоит в том, что статья Engram, по имеющимся данным, не рассматривает накладные расходы на этапе инференса — задержку и пропускную способность, — а именно здесь таблица поиска, размещённая в DRAM, проявилась бы, если бы проявилась где-либо. Память, к которой приходится обращаться, — это не память, которая достаётся бесплатно.

A single-column scoreboard titled "DeepSeek's scale ladder — the scoreboard" with six rows: DeepSeek-V4-Flash-0731 at 284B total / 13B active; DeepSeek-V4-Pro-0813 at 1.6T total / 49B active; DeepSeek V4.1 Flash at 552B backbone / 8B prefill, 16B decode; Leaked successor at ~3T, unverified; Engram memory table at ~1T claimed, unverified; and Serving status reading "V4 Pro retired Sept 14; 3T has no cluster date". Footer reads "V4 figures per DeepSeek model cards; 3T and Engram figures unverified, single-source."

Почему собственный сентябрьский доклад Deep​Seek утверждает обратное

Аргумент против скорого выпуска продукта 3T заключается в том, что Deep​Seek только что провел эксперимент на 1.6T и ответил на свой собственный вопрос чем-то меньшим. Лестница V4 на сегодняшний день:

DeepSeek-V4-Flash-0731 — всего 284B параметров, 13B активных на токен.

DeepSeek-V4-Pro-0813 — 1,6 трлн параметров всего, 49 млрд активных, открытые веса под лицензией MIT.

• DeepSeek V4.1 Flash — это backbone с 552B параметрами на архитектуре Causal Encoder-Decoder, который активирует 8B параметров на токен во время prefill и 16B во время decode.

14 сентября в полдень по пекинскому времени средняя ступень убирается. Deep​Seek отключает V4 Pro и перенаправляет запросы для deepseek-v4-pro на V4.1 Flash, оплачиваемый по тарифам Flash, до появления V4.1 Pro. Официальная страница цен сегодня содержит две строки, и ни одна из них не является преемницей снятой модели по размеру: deepseek-flash по $0,30 за миллион входных токенов и $1,20 за миллион выходных токенов в пиковое время, deepseek-v4-pro по $1,32 и $3,96, а вне пикового времени тарифы вдвое ниже. Обе указывают контекстное окно в 1 млн токенов и потолок выходных токенов в 384 000.

Направление движения недвусмысленно. Лаборатория, которая выводит из эксплуатации свою крупнейшую модель в пользу модели, активирующей в десять раз меньше параметров на токен, уже пришла к выводу, что экономическая единица передовых возможностей — это не самый большой чекпойнт, который она может обучить. Модель на 3 триллиона параметров, создатель которой не уверен, что её можно «дообучить и экономически эффективно обслуживать», — это не слух о нерешительности; это описание лаборатории, у которой теперь есть фактические данные об альтернативе.

Пост-обучение — это более сложная половина этой задачи. Полнопараметрическое пост-обучение линейки DeepSeek-V4-Pro на CloudMatrix384 SuperPOD от Huawei было зафиксировано сторонним проектом SLAI T-Rex на уровне 34,22% MFU, что примерно в 2,93 раза превышает открытый базовый рецепт. Это обнадеживающая цифра — сторонняя оценка для модели с 1,6 трлн параметров. Удвоение бэкбона примерно удваивает счет еще до того, как будет обслужен хотя бы один токен.

Screenshot of DeepSeek's official API documentation "Models & Pricing" page, captured September 10 2026, in English, showing two model columns: deepseek-flash (model version DeepSeek-V4.1-Flash) and deepseek-v4-pro (model version DeepSeek-V4-Pro-0813), both listing a 1M context length and a 384K maximum output, a features block where Vision is supported on flash and marked "Not supported" on v4-pro, and a pricing block with peak and off-peak rates including input cache-miss at $0.3 / $1.32 per million tokens and output at $1.2 / $3.96 per million tokens.

Когда их кластеры разрастаются

Ключевой пункт в утечке — последний, потому что это единственная часть с публичным бумажным следом. По сообщениям, Deep​Seek планирует задействовать как минимум 160 000 ускорителей Huawei Ascend 950DT в новом дата-центре в Уланцабе, Внутренняя Монголия, в рамках заказа стоимостью примерно 2,56 миллиарда долларов — одного из крупнейших кластеров китайских ИИ-чипов, который кто-либо пытался создать.

Оговорки, связанные с этим планом, важнее, чем заголовок. Чипы предназначены для инференса, а не для обучения: Deep​Seek уже пробовала обучать модели на кремнии Huawei и по-прежнему обучает их на ускорителях Nvidia — а именно это и нужно для модели на 3T параметров. Поставки могут занять более года. Частичная мощность ожидается в конце 2027 — начале 2028 года. И именно поставки высокоскоростной памяти, а не логики, как ожидается, ограничат количество устройств 950DT, которые Huawei сможет выпустить в этом году.

Итак, оптимистичное прочтение «когда их кластеры вырастут» помещает модель на 3T параметров на срок не ранее 2027–2028 годов, а пессимистичное — что она останется исследовательским артефактом и никогда не станет продуктом — согласуется со всем, что Deep​Seek выпустила в 2026 году. Вычислительная среда вокруг лаборатории — это также вопрос оспариваемой политики, а не чисто предложения: 8–9 сентября АНБ, ФБР и CISA совместно заявили, что шесть китайских лабораторий, включая Deep​Seek, дистиллировали американские frontier-модели «в промышленных масштабах» — обвинение, которое министерство торговли Китая отвергло. Как бы ни относиться к этому заявлению, релиз, зависящий от роста кластеров, зависит от решений, которые никто внутри Deep​Seek не контролирует.

Что бы превратило это из утечки в запуск?

Контрольный список короткий и конкретный, и ни один из его пунктов ещё не сработал:

• Репозиторий в организации deepseek-ai на Hugging Face, с именем версионированного чекпоинта, а не слагом семейства.

• Новая строка на странице Models & Pricing компании Deep​Seek.

• Запись с датой в ленте новостей документации API в обычном для лаборатории формате newsYYMMDD.

• Идентификатор модели, а не название семейства — Deep​Seek версионирует чекпоинты, и простое имя семейства до сих пор означало превью.

Ближайшая веха — V4.1 Pro, которую участник команды Deep​Seek упомянул 9 сентября как конечную точку окна маршрутизации. У V4.1 Pro нет ни опубликованных спецификаций, ни количества параметров, ни цены, ни даты. В каком-то смысле V4.1 Pro — это проверка этой утечки: если следующий флагман будет иметь примерно 1.6T параметров, как у V4 Pro, или меньше, то заявление о 3T отодвинулось как минимум на поколение.

Что всё это значит, если вы выбираете модель на этой неделе.

Модель 3T — это не решение о покупке в 2026 году, и практический урок сентябрьского DeepSeek вовсе не о масштабе. Он в том, что модель за эндпоинтом может меняться, пока имя эндпоинта остаётся точно тем же. Любой, кто вызывает deepseek-v4-pro через слой абстракции, получает другую, меньшую и более дешёвую модель 14 сентября, не трогая свой код. Любой, кто подключён напрямую к реализации этого ID у конкретного провайдера, получает то, что решит сделать этот провайдер.

И DeepSeek V4.1 Flash, и DeepSeek V4 Pro находятся в OrcaRouter под одним ключом с нулевой наценкой — цена провайдера из прайс-листа передаётся как есть, а значит, изменение цен Deep​Seek от 10 сентября действует здесь в тот же день по номиналу, а не в какой-то версии с наценкой. На странице модели указано $0.15 за миллион входных токенов и $0.60 за миллион выходных по непиковому тарифу — это собственная непиковая цена Deep​Seek, и ничего сверху. Автоматическое переключение между провайдерами — та самая неприметная функция, которая важнее всего в такую неделю: когда вендор подменяет модель на эндпоинте, именно на уровне маршрутизации это превращается в изменение конфигурации, а не в миграцию.

Если 3-триллионная модель Deep​Seek когда-нибудь действительно выйдет, то обслуживать её будет тот, у кого есть кластеры для её размещения, по цене, которую диктуют вычисления. На том же уровне маршрутизации вы с ней и встретитесь — без второго контракта и без перестройки чего-либо.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, captured September 10 2026, in English, showing a p50 time-to-first-token of 287 milliseconds, an OpenAI-compatible base URL of api.orcarouter.ai/v1, a Python code sample calling the model by that ID, and an off-peak price block reading input $0.150 per million tokens, output $0.600 per million tokens and cache read $0.0030 per million tokens.

Открытый вопрос не в том, сможет ли Deep​Seek построить модель с 3 триллионами параметров. Три опубликованные статьи по архитектуре, проект рабочей памяти и модель на 552B параметров, которая, по словам создателя, превосходит собственную предшественницу с 1.6T параметров, — всё это говорит о том, что лаборатория умеет это делать. Вопрос в том, найдётся ли кто-то, кто заплатит за её обслуживание, — и, судя по последним двум неделям, сам Deep​Seek в этом не уверен. Смотрите на кластер, а не на количество параметров. Страница с ценами быстрее любой утечки покажет, что Deep​Seek на самом деле выпускает.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно