Без потерь и без цензуры версия Qwen3.6 35B A3B, сохраняющая возможности оригинальной модели при удалении отказного поведения. Создана для разработчиков, исследователей ИИ и продвинутых агентных рабочих процессов, требующих неограниченных выходных данных модели без ущерба для производительности в рассуждении, кодировании, многоязычности или использовании инструментов. Вариант Aggressive полностью разблокирован и предназначен для прямых, полных ответов на широкий спектр запросов. Хотя модель иногда может добавлять краткие информационные оговорки, унаследованные от обучения базовой модели, это не отказы, и запрашиваемый контент по-прежнему генерируется полностью. Идеально подходит для исследований ИИ, тестирования безопасности, red teaming, разработки агентов, ассистентов кодирования и других продвинутых приложений ИИ, выигрывающих от максимальной гибкости выводов. Доступ к этой модели ограничен и предназначен для исследователей безопасности, специалистов red team, исследователей безопасности ИИ и других квалифицированных профессионалов, проводящих легитимные исследования, оценку и тестирование.
Эта модель является вариантом Mixture-of-Experts из серии Qwen3.6, изначально разработанной Alibaba Cloud и размещённой провайдером Obsidian на OrcaRouter. Она имеет 35 миллиардов параметров всего,…
Эта модель превосходно справляется с задачами, требующими большого контекстного окна и мультимодального понимания. Для текста она может обобщать или отвечать на вопросы по документам длиной до 262 144 токенов, таким как целые книги или объемные отчеты. Для изображений и видео она может извлекать детальную информацию и объединять ее с текстовым контекстом. Отсутствие цензуры позволяет генерировать креативный контент без типичных ограничений безопасности, что полезно для создания историй, ролевых игр или других сценариев, где нежелательны ограничивающие фильтры. Архитектура MoE обеспечивает быстрый вывод по сравнению с плотными моделями схожего общего размера, что делает ее практичной для приложений реального времени при эффективном развертывании. Многоязычные возможности унаследованы от семейства Qwen3.6, поддерживающего множество языков.
Тег "uncensored" означает, что модель прошла сниженное обучение выравниванию по сравнению со стандартными контрольными точками Qwen3.6. Это может приводить к выводам, которые менее отфильтрованы от вредного, оскорбительного или спорного контента. Пользователям следует тщательно тестировать модель в своем конкретном случае использования, чтобы убедиться, что выводы соответствуют их стандартам. Отсутствие цензуры может быть полезным для таких задач, как творческое письмо, нецензурированная ролевая игра или исследование чувствительных тем, где желательна нейтральная генерация. Однако это также означает, что модель может создавать контент, нарушающий типичные политики контента. OrcaRouter не заявляет о дополнительной фильтрации безопасности; базовое поведение модели — это то, что вы получаете.
Если ваша задача включает короткие входные данные (например, несколько сотен токенов), простую классификацию или требует только базового понимания языка, то более маленькие и дешевые модели, такие как Qwen2.5-7B или GPT-4o-mini, могут быть более экономичными. Сильные стороны этой модели наиболее заметны при работе с очень длинными контекстами (более 10K токенов) или мультимодальными входными данными. Для чисто текстовых задач с объемом до 8K токенов, не требующих работы с изображениями или видео, вы можете сэкономить, используя специализированную небольшую модель. Кроме того, если ваше приложение требует строгой фильтрации контента, нецензурированный характер может вынудить вас добавить внешний уровень модерации, что увеличит стоимость.
Модель принимает на вход изображения и видео в дополнение к тексту. Для изображений вы можете предоставить данные в формате base64 или URL-адреса (через массив content API с типом "image_url"). Для видео API, вероятно, принимает видеокадры в виде последовательностей изображений или URL-адреса видеофайлов; точный формат следует уточнить в документации OrcaRouter. Модель обрабатывает эти визуальные входные данные вместе с текстом для формирования ответов. Контекстное окно размером 262 144 токенов применяется к общему количеству токенов всех входных модальностей. Обратите внимание, что обработка изображений и видео расходует токены пропорционально визуальному разрешению и длительности, поэтому более крупные входные данные уменьшат доступную текстовую ёмкость.
Конкретные показатели производительности для этой модели поставщиком не предоставлены. Серия Qwen3.6 в целом показывает конкурентоспособные результаты в тестах на длинный контекст, таких как L-Eval и RULER, а также в мультимодальных задачах, например MMMU и MathVista, но точные цифры для данного варианта 35B A3B без цензуры не опубликованы. Пользователям, заинтересованным в эмпирической производительности, следует провести собственные оценки на репрезентативных наборах данных. Архитектура MoE с 3B активированных параметров часто даёт результаты, сопоставимые с плотными моделями аналогичного активного размера, при этом общие затраты на хранение и память выше из-за полных 35B параметров.
Скорость и задержка зависят от нескольких факторов: длины ввода, длины вывода, загрузки сервера и конфигурации оборудования. Поскольку модель активирует только 3B параметров на токен, ожидается, что она будет быстрее, чем плотная модель 35B, со скоростью генерации, сравнимой с моделями типа GPT-3.5 (хотя точных цифр не предоставляется). Инфраструктура OrcaRouter через Obsidian может обеспечивать переменную задержку; пользователи могут тестировать на своих нагрузках. Для сценариев с длинным контекстом (например, 100K+ токенов) время предварительного заполнения увеличивается линейно с длиной ввода. Генерация выходных токенов обычно является основным источником задержки. Никакого соглашения об уровне обслуживания (SLA) для скорости не указано.
К сильным сторонам модели относятся большое контекстное окно в 262K токенов, позволяющее обрабатывать целые книги или многочасовые расшифровки видео за один проход. Архитектура MoE обеспечивает хороший баланс между производительностью и скоростью вывода. Мультимодальный ввод даёт возможность выполнять задачи, сочетающие текстовые и визуальные данные. Отсутствие цензуры позволяет генерировать контент, который другие модели могут отказаться создавать. Многоязычная поддержка охватывает десятки языков. Ценообразование конкурентоспособно для модели такого уровня: $0.31/M за ввод и $4.21/M за вывод, нулевая наценка.
Ограничения включают отсутствие опубликованных эталонных показателей, что затрудняет оценку относительной производительности. «Нефильтрованный» характер может приводить к нежелательным результатам без дополнительной модерации. Количество активированных параметров в 3 миллиарда означает, что модель может не соответствовать «сырой» мощности рассуждений более крупных плотных моделей (например, GPT-4) при решении сложных логических задач. Мультимодальные возможности могут быть менее проработанными, чем у специализированных моделей «зрение-язык». Входные модальности, такие как токенизация видео, могут сократить эффективный контекст для текста. Потоковая передача или использование инструментов не гарантируются. Наконец, зависимость от стороннего провайдера Obsidian означает, что доступность и время безотказной работы не находятся под контролем OrcaRouter.
Цены прозрачны: $0,31 за миллион входных токенов и $4,21 за миллион выходных токенов. Это точные тарифы провайдера Obsidian, без наценки со стороны OrcaRouter. Входные токены включают все текстовые и визуальные токены (для изображений и видео). Выходные токены — это сгенерированный текст. Не требуется плата за запрос или подписка. Вы платите только за потребленные токены. Цены указаны за 1 млн токенов, поэтому небольшие запросы стоят доли цента. Бесплатный тариф или пробный период не предлагается.
Никакие скидки, преимущества кэширования или оптовые цены для этой модели не disclosed. Указанные тарифы являются плоскими за токен. В отличие от некоторых провайдеров, предлагающих сниженные цены на кэшированные входные токены, OrcaRouter применяет одинаковую ставку для входных токентов независимо от повторения. При очень высоком уровне использования вы можете связаться с OrcaRouter для обсуждения возможных индивидуальных условий, но стандартные скидки не зафиксированы. Политика нулевой наценки гарантирует, что вы платите ровно столько, сколько взимает Obsidian, без скрытых комиссий.
Сопоставимые мультимодальные модели с длинным контекстом от других провайдеров часто стоят дороже: например, OpenAI GPT-4 Turbo стоит $10 за 1M входных токенов и $30 за 1M выходных, а Claude 3.5 Sonnet — $3 за 1M входных и $15 за 1M выходных. Данная модель заметно дешевле — $0.31/$4.21. Однако эти модели предлагают разные возможности (например, использование инструментов, более высокие показатели тестов на рассуждение). Более низкая цена отражает архитектуру MoE и тот факт, что это бесцензурная модель, размещенная сторонним провайдером. Если вам требуется гарантированная надежность, более высокая безопасность или продвинутые функции, такие как вызов функций, дополнительная стоимость может быть оправдана.
Чтобы использовать модель, отправьте POST-запрос на https://api.orcarouter.ai/v1/chat/completions (или соответствующий endpoint в соответствии с совместимым с OpenAI API OrcaRouter). Включите заголовок "Authorization: Bearer YOUR_API_KEY". В теле запроса установите "model": "obsidian/Qwen3.6-35B-A3B". Передавайте сообщения в стандартном формате OpenAI: массив объектов с полями "role" и "content". Для мультимодального контента используйте массив content с типами "text" и "image_url" (или видео-эквивалент). Пример с использованием cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
Вы можете использовать типичные параметры, совместимые с OpenAI: temperature (по умолчанию 1.0), top_p (0.9), max_tokens (по умолчанию варьируется, рекомендуется задавать явно), stop sequences, frequency_penalty, presence_penalty и seed для воспроизводимости. Модель поддерживает потоковую передачу через "stream": true для получения ответов токен за токеном. Для мультимодальных входных данных API ожидает массивы содержимого с типом "image_url" и опционально "video_url" (проверьте документацию OrcaRouter для точного формата видео). Лимит контекстного окна в 262,144 токена применяется к общему количеству токенов в сообщениях плюс ответ. Если вы превысите лимит, вы получите ошибку длины контекста; вы можете настроить "max_tokens" или сократить сообщения.
Чтобы использовать контекст 262K, структурируйте свои запросы так, чтобы они включали полный документ или историю разговора. Имейте в виду, что каждый токен во входных данных учитывается при расчете стоимости и лимитов. Для очень длинных входных данных рассмотрите возможность разбиения на части или суммаризации перед отправкой, хотя модель предназначена для обработки полного контекста. Используйте параметр "max_tokens" для управления длиной выходных данных. Если вы столкнетесь с ошибками тайм-аута, включите потоковую передачу (streaming), чтобы получать частичные результаты быстрее. OrcaRouter может иметь собственные настройки тайм-аута; при необходимости обратитесь в службу поддержки. Модель не поддерживает системные сообщения особым образом; обращайтесь с ними как с сообщением пользователя или ассистента с ролью "system" (стандартный формат OpenAI).
Миграция с провайдеров, таких как OpenAI или Anthropic, включает изменение базового URL на https://api.orcarouter.ai/v1 и обновление идентификатора модели. Если ваш код использует OpenAI Python клиент, задайте client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1") и затем используйте client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...). Формат сообщений и имена параметров идентичны. Изменения логики промптов не требуются. Обратите внимание, что формы объектов ответа также совместимы, поэтому существующий код парсинга должен работать. Сначала протестируйте с небольшим запросом, чтобы убедиться в правильной аутентификации и биллинге.
По сравнению с Qwen3.6-72B (плотная модель), данная модель использует MoE, поэтому стоимость инференса на токен ниже, но исходная ёмкость может быть немного меньше. Контекст в 262K больше, чем 128K у Qwen2.5. По сравнению с Qwen3.6-32B (возможно, плотная модель), эта модель поддерживает мультимодальный ввод, который может отсутствовать в более ранних версиях. Вариант «uncensored» уникален; стандартные версии Qwen имеют выравнивание. Если вам нужна строгая безопасность, выбирайте обычную Qwen3.6. По цене эта модель дешевле многих плотных моделей Qwen на других платформах.
GPT-4o и Claude 3.5 Sonnet — проприетарные модели с обширным обучением безопасности, более высокими показателями бенчмарков по рассуждению и программированию, поддерживают использование инструментов, зрение и большой контекст (200K для Claude). Эта модель предлагает больший контекст (262K) и мультимодальный ввод по значительно более низкой цене. Однако ей не хватает продвинутых функций, надежности и стабильности производительности этих моделей. Для приложений, где стоимость является основным фактором, и вы можете принять некоторое снижение качества, эта модель является хорошей альтернативой. Если вам нужны первоклассные рассуждения или вызов функций, премиум-модели стоят дополнительных затрат.
Эта модель лучше всего подходит, когда вам нужно: (1) очень длинный контекст (262K токенов) по низкой цене; (2) мультимодальный ввод (изображения/видео) без оплаты премиальных цен; (3) нецензурированная генерация текста, где цензурные фильтры мешали бы; (4) быстрый вывод относительно общего числа параметров за счет активации MoE. Она является сильным кандидатом для исследований, извлечения данных, творческого письма и любых задач, выигрывающих от большого контекста и низкой стоимости за токен. Если вам нужны расширенные функции, такие как вызовы инструментов, структурированные выходные данные или высокая надежность, рассмотрите другие модели.
| Ввод / 1M токенов | $0.310 |
| Вывод / 1M токенов | $4.21 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BОткрыть @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B