GLM-5.3-Flash против DeepSeek V4 Flash — Какую бюджетную фронтирную модель стоит вызывать? Перегенерированная иллюстрация.
Guides & Insights

GLM-5.3-Flash против DeepSeek V4 Flash: Какую бюджетную фронтирную модель стоит вызвать?

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Интеллект фронтир-класса раньше стоил от пяти долларов за миллион входных токенов; сегодня две модели предлагают его за копейки, и они находятся бок о бок в одном бюджетном ярусе. GLM-5.3-Flash — 18B-активная мультимодальная модель Zhipu AI, ставшая открытой 26 августа, и DeepSeek V4 Flash — ~13B-активный агентный кодер, которого Deep​Seek перевела в продакшн в конце июля, — два самых веских аргумента в пользу того, что {{1}}"почти фронтир за копейки" теперь реальная продуктовая категория{{/1}}. Они различаются сильнее, чем можно предположить по их ценникам: одна — нативно мультимодальный универсал с весами под лицензией MIT, другая — проверенный специалист по коду и агентам, за плечами которого независимые результаты бенчмарков.

Краткий ответ для большинства команд: если вам нужна дешёвая открытая мультимодальная модель для создания на её основе — GLM-5.3-Flash; если вам нужна модель для кодинга с независимо измеренными агентными показателями, которые можно защитить на совещании, — DeepSeek V4 Flash. Остальная часть этой страницы — это обоснование, таблица оценок по каждому показателю и оговорки, начиная с честного признания, что значительная часть заявлений GLM-5.3-Flash основана на данных вендора, тогда как ключевые показатели DeepSeek V4 Flash измерены независимо.

Противостояние за один проход

Обе модели построены по архитектуре смеси экспертов: примерно 300 млрд суммарных параметров и менее 20 млрд активных на токен; обе поддерживают контекстное окно в 1 млн токенов, и у обеих открытые веса. На этом сходство заканчивается. GLM-5.3-Flash — первая нативно мультимодальная модель в линейке GLM-5 от Zhipu: она принимает текст, изображения и видео — и выпущена под лицензией MIT, а значит, её можно разместить у себя уже сегодня. DeepSeek V4 Flash — это продакшн-сборка модели, которую Deep​Seek дорабатывает с апреля: её основной релиз — текст и код, архитектура оптимизирована для агентного использования инструментов, а поддержка зрения поставляется отдельно в экспериментальной сборке, а не нативно. По индексу интеллекта Zhipu заявляет 57 для Flash против независимо измеренных 50 у DeepSeek V4 Flash — разрыв значимый, если он подтвердится, и это цифра, за которой стоит следить до подтверждения третьей стороной.

A generated two-column scoreboard titled 'GLM-5.3-Flash vs DeepSeek V4 Flash — the scoreboard'. Left column GLM-5.3-Flash: AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, Price ~$0.14/$0.44 (discount ~$0.07/$0.22). Right column DeepSeek V4 Flash: AA Index 50 (independent), Active params ~13B, Context 1M tokens, Modality text (vision in exp build), Open weights yes, Price $0.14/$0.28. Footer: GLM figures vendor-reported; DeepSeek figures independently measured where noted.

Интеллект и бенчмарки

Это раздел, где важна дисциплина работы с источниками, поскольку доказательные базы двух моделей сильно различаются.

• AA Intelligence Index — GLM-5.3-Flash: 57, согласно материалам запуска Zhipu (не воспроизведено), по сравнению с DeepSeek V4 Flash: 50, измеренным независимо Artificial Analysis. Для ориентира: Claude Opus 4.8 находится около 57, а Kimi K3 — на 57 по тому же индексу.

• SWE-bench Verified — данные по GLM-5.3-Flash ещё не опубликованы; у DeepSeek V4 Flash — 79,0% (независимое тестирование).

• LiveCodeBench — по GLM-5.3-Flash показатель ещё не опубликован, против 91.6% у DeepSeek V4 Flash (независимый тест).

• Agents' Last Exam — результат GLM-5.3-Flash пока не опубликован, в отличие от DeepSeek V4 Flash 25.2 (независимый тест).

• Заявление о паритете в кодировании — Zhipu сообщает, что навыки кодирования GLM-5.3-Flash на её внутреннем бенчмарке Z.ai Code Bench сопоставимы с Claude Opus 4.8 (по данным вендора, не воспроизведено).

• Контекст семейства — GLM-5.3, старший «брат» Flash, независимо набирает 60 на AA Index; на Terminal-Bench 2.1 собственная линейка GLM-5.3 от Zhipu в прогонах сообщества показывает 83.1–88.2. У DeepSeek V4 Flash результат Terminal-Bench 2.1 — 82.7 (независимо).

Асимметрия в этом и заключается: показатели DeepSeek V4 Flash по кодингу и агентным задачам воспроизведены третьими сторонами с момента июльского релиза, тогда как показатели GLM-5.3-Flash — это заявления вендора с первого дня. Если Zhipu прав, 57 баллов у Flash на семь пунктов выше, чем 50 у Deep​Seek, но модель широко тестировалась анонимно до запуска, так что независимые оценки должны появиться быстро.

Программирование и агенты: настоящая дифференциация

Если вы покупаете бюджетную модель для агентных задач программирования, доказательная база важнее, чем сырая дельта индекса. DeepSeek V4 Flash был повторно дообучен специально для агентных возможностей в своей продакшн-сборке, и его независимо измеренные показатели — 79.0 SWE-bench Verified, 91.6 LiveCodeBench, 82.7 Terminal-Bench 2.1 — это теперь ориентир, с которым сравнивают конкурентов в дешёвом сегменте. Заявление Zhipu о том, что GLM-5.3-Flash по кодингу сопоставим по силе с Claude Opus 4.8 на собственном внутреннем бенчмарке, — это сильное утверждение, но пока не независимое.

Есть также поведенческое различие, о котором стоит знать. По сообщениям сообщества, DeepSeek V4 Flash демонстрирует сравнительно сдержанное мышление — примерно 25–45% выходных токенов составляют токены мышления, с коэффициентом расширения вывода около 1.3–1.5x, — что и обеспечивает низкую стоимость за задачу. Zhipu не опубликовала сопоставимых данных об объёме вывода для GLM-5.3-Flash, а объём вывода — это та переменная, которая превращает дешёвый тариф в дорогую задачу. Пока реальное расширение токенов Flash не измерено, фактический разрыв в стоимости задачи между этими двумя моделями шире, чем разрыв в цене за токен.

Мультимодальность, или ещё нет

Это самый наглядный отличительный признак. {{1}}GLM-5.3-Flash нативно принимает изображения и видео наряду с текстом{{/1}} — {{2}}первая модель GLM-5 с такой возможностью{{/2}} — и {{3}}Zhipu утверждает, что стоимость обслуживания длинного контекста составляет около трети от стоимости GLM-5.3{{/3}}. {{4}}Производственный релиз DeepSeek V4 Flash — это текст и код{{/4}}; {{5}}мультимодальные возможности Deep​Seek реализованы в отдельной экспериментальной vision-сборке{{/5}}, что означает: {{6}}vision-нагрузка на стороне Deep​Seek — это другой эндпоинт модели и другая история оценки{{/6}}. Если вашему пайплайну нужно понимание изображений или видео от бюджетной модели уже сегодня, {{7}}GLM-5.3-Flash — единственная из двух, которая поддерживает это нативно{{/7}}.

Цена: фактические цифры

Обе модели по цене ниже всех остальных в своём классе производительности, но по разным графикам.

• GLM-5.3-Flash — Zhipu оценивает его в десятую часть цены GLM-5.3: $1,40 / $4,40 за миллион токенов, что составляет примерно $0,14 / $0,44, или $0,07 / $0,22 в период ограниченной по времени скидки при запуске. Zhipu также заявляет о ~$0,045 за задачу по индексу AA Intelligence. Долларовые показатели получены из заявленных Zhipu соотношений; само соотношение является текущим фактом.

• DeepSeek V4 Flash — $0.14 за миллион входных токенов, $0.28 за миллион выходных, официальная опубликованная ставка Deep​Seek, при этом стоимость входных данных, попавших в кэш, намного ниже. Независимые оценки затрат на один тест составляют около $0.03 за бенчмарк-тест — самая дешёвая крупная модель в таблице.

• Длинный контекст — GLM-5.3-Flash примерно за треть стоимости длинного контекста GLM-5.3 (заявление вендора) против DeepSeek V4 Flash с контекстом 1M за $0.14 / $0.28 и максимальным выходом ~393K.

На бумаге две заявленные цены почти совпадают, и скидка делает GLM-5.3-Flash дешевле за токен на данный момент. Загвоздка в том, что цена DeepSeek V4 Flash за токен стабильна, а его многословность выверена, тогда как у Flash цена — это временная скидка, а многословность пока нет, — так что честный прогноз: разрыв в эффективной стоимости меньше, чем разрыв в ценниках, и может даже развернуться в обратную сторону, когда обе модели измерят на одном и том же наборе задач.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

Скорость и стоимость обслуживания

Zhipu утверждает, что GLM-5.3-Flash имеет наименьший объём вычислений внимания среди сравниваемых моделей бюджетного уровня — GLM-5.3, DeepSeek V4 Flash и Kimi K3 — при этом вычисления внимания снижены в 3,0 раза, а KV-кэш — в 4,4 раза по сравнению с GLM-5.3, хотя признаётся, что его KV-кэш всё ещё немного больше, чем у DeepSeek V4 Flash. Что касается серверного инференса, Zhipu сообщает о трёхкратном улучшении сквозной производительности на отечественных китайских чипах при стоимости за токен, которую называет сопоставимой с мейнстримными GPU NVIDIA. Все данные предоставлены вендором. Экономика инференса DeepSeek V4 Flash, напротив, уже проверена: модель находится в продакшене с 31 июля, она одна из самых дешёвых в эксплуатации по результатам тестов, и сторонние хостинг-провайдеры уже месяц обслуживают её в больших объёмах. Для продакшена проверенное решение лучше многообещающего.

Кому следует позвонить?

Руководство по принятию решений, простыми словами:

• Вам нужна открытая мультимодальная модель прямо сейчас — GLM-5.3-Flash — единственная из двух с нативным вводом изображений/видео, и её веса под лицензией MIT уже сегодня доступны на Hugging Face.

• Вам нужна модель для кодинга/агентная модель с независимыми показателями — SWE-bench Verified 79.0 и Terminal-Bench 2.1 82.7 у DeepSeek V4 Flash подтверждены третьей стороной, а заявления GLM-5.3-Flash о возможностях кодирования — пока нет.

• Вы хотите абсолютный минимум стоимости за токен — скидка на запуск Flash пока что даёт ей преимущество, но считайте эту скидку временной.

• Вам важна стабильная ставка для продакшена — цена DeepSeek V4 Flash $0.14 / $0.28 остаётся стабильной с июля; тарифная карта Flash появилась всего несколько дней назад.

Вы не уверены и хотите попробовать оба варианта без второго контракта — DeepSeek V4 Flash уже доступен на OrcaRouter сегодня по прейскурантной цене Deep​Seek с нулевой наценкой, а GLM-сторона этого семейства (GLM-5.3, старший брат Flash) тоже там доступна, так что как только сам Flash появится в списке, обе стороны этого противостояния окажутся за одним ключом. А пока MIT-веса Flash на Hugging Face — самый дешевый способ протестировать его самостоятельно, а автоматическое переключение на проверенную модель — это способ попробовать новую, не ставя на нее производственный путь.

A screenshot of the OrcaRouter model page for DeepSeek V4 Flash showing the model id, a 1,000,000-token context window, the current per-1M input and output rates, and the tools, JSON and reasoning capability chips.

Суть

GLM-5.3-Flash — более интересная модель: нативная мультимодальность, лицензия MIT, заявленный индексный показатель, который соответствует гораздо более дорогим моделям, — но она также менее проверенная, и её лучшие цифры предоставлены вендором на день запуска. DeepSeek V4 Flash — более безопасный бюджетный выбор для программирования и агентных задач: более низкий независимый показатель интеллекта, зато измеренный, воспроизводимый и стабильный при цене $0,14 / $0,28. Покупайте Flash за то, что он уникально предлагает, — открытую мультимодальность по такой цене — и покупайте DeepSeek V4 Flash для всего, где вам нужны подтверждённые бенчмарки. По-настоящему открытый вопрос, на который ответят следующие две недели, — переживёт ли 57 у Flash независимую проверку.

Сравнение в этой статье4

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube