Una versione senza perdite e non censurata di Qwen3.6 35B A3B che preserva le capacità del modello originale eliminando il comportamento di rifiuto. Progettata per sviluppatori, ricercatori di IA e flussi di lavoro avanzati per agenti che richiedono output del modello senza restrizioni senza compromettere il ragionamento, la codifica, le prestazioni multilingue o l'uso di strumenti. La variante Aggressive è completamente sbloccata e progettata per fornire risposte dirette e complete a un'ampia gamma di prompt. Sebbene il modello possa occasionalmente aggiungere brevi dichiarazioni di non responsabilità informative ereditate dall'addestramento del modello base, queste non sono rifiuti e il contenuto richiesto viene comunque generato per intero. Ideale per la ricerca sull'IA, i test di sicurezza, il red teaming, lo sviluppo di agenti, gli assistenti di codifica e altre applicazioni avanzate di IA che beneficiano della massima flessibilità degli output. L'accesso a questo modello è limitato e destinato a ricercatori di sicurezza, red team, ricercatori di sicurezza dell'IA e altri professionisti qualificati che conducono ricerche, valutazioni e test legittimi.
Questo modello è una variante Mixture-of-Experts della serie Qwen3.6, sviluppato originariamente da Alibaba Cloud e ospitato dal provider Obsidian su OrcaRouter. Ha 35 miliardi di parametri totali,…
Questo modello eccelle in compiti che beneficiano di una finestra di contesto ampia e di una comprensione multimodale. Per il testo, può riassumere o rispondere a domande su documenti lunghi fino a 262.144 token, come interi libri o rapporti estesi. Per immagini e video, può estrarre informazioni dettagliate e combinarle con il contesto testuale. La natura non censurata gli consente di generare contenuti creativi senza i tipici vincoli di sicurezza, utile per la generazione di storie, giochi di ruolo o altri scenari in cui filtri restrittivi sono indesiderati. Il suo design MoE fornisce un'inferenza rapida rispetto ai modelli densi di dimensioni totali simili, rendendolo pratico per applicazioni in tempo reale quando distribuito in modo efficiente. Le capacità multilingue sono ereditate dalla famiglia Qwen3.6, supportando molte lingue.
Il tag "uncensored" significa che il modello ha subito un addestramento di allineamento ridotto rispetto ai checkpoint standard di Qwen3.6. Ciò può generare output meno filtrati per contenuti dannosi, offensivi o controversi. Gli utenti dovrebbero testare accuratamente il modello nel loro specifico caso d'uso per assicurarsi che gli output soddisfino i loro standard. La mancanza di censura può essere vantaggiosa per attività come la scrittura creativa, il gioco di ruolo non censurato o la ricerca su argomenti sensibili in cui si desidera una generazione neutrale. Tuttavia, significa anche che il modello potrebbe produrre contenuti che violano le politiche sui contenuti tipiche. OrcaRouter non rivendica alcun filtro di sicurezza aggiuntivo; il comportamento di base del modello è ciò che si ottiene.
Se il tuo compito prevede input brevi (ad esempio, poche centinaia di token), classificazione semplice o richiede solo una comprensione linguistica di base, modelli più piccoli ed economici come Qwen2.5-7B o GPT-4o-mini potrebbero essere più convenienti. I punti di forza di questo modello sono più evidenti quando si gestiscono contesti molto lunghi (oltre 10K token) o input multimodali. Per attività puramente testuali con meno di 8K token e senza necessità di capacità di immagini/video, puoi risparmiare utilizzando un modello piccolo dedicato. Inoltre, se la tua applicazione richiede un filtraggio dei contenuti rigoroso, la natura non censurata potrebbe costringerti ad aggiungere un livello di moderazione esterno, aumentando i costi.
Il modello accetta input di immagini e video oltre al testo. Per le immagini, puoi fornire dati immagine codificati in base64 o URL (tramite l'array di contenuti dell'API con tipo "image_url"). Per i video, l'API probabilmente accetta fotogrammi video come sequenze di immagini o URL di file video; il formato esatto dovrebbe essere verificato nella documentazione di OrcaRouter. Il modello elabora questi input visivi insieme al testo per generare risposte. La finestra di contesto di 262.144 token si applica al conteggio combinato di token di tutte le modalità di input. Nota che l'elaborazione di immagini e video consuma token proporzionalmente alla risoluzione visiva e alla durata, quindi input più grandi ridurranno la capacità di testo disponibile.
Non sono stati forniti punteggi di benchmark specifici per questo modello dal fornitore. La serie Qwen3.6 si comporta generalmente in modo competitivo su benchmark a lungo contesto come L-Eval e RULER, e su compiti multimodali come MMMU e MathVista, ma le cifre esatte per questa variante non censurata da 35B A3B non sono pubblicate. Gli utenti interessati alle prestazioni empiriche dovrebbero eseguire le proprie valutazioni su dataset rappresentativi. L'architettura MoE con 3B parametri attivati spesso produce risultati paragonabili a modelli densi di dimensioni attive simili, mentre i costi totali di archiviazione e memoria sono più elevati a causa dei 35B parametri completi.
Velocità e latenza dipendono da diversi fattori: lunghezza dell'input, lunghezza dell'output, carico del server e configurazione hardware. Poiché il modello attiva solo 3B parametri per token, ci si aspetta che sia più veloce di un modello denso da 35B, con tassi di generazione paragonabili a modelli come GPT-3.5 (sebbene non siano fornite cifre esatte). L'infrastruttura di OrcaRouter tramite Obsidian può offrire una latenza variabile; gli utenti possono testarla con i propri carichi di lavoro. Per scenari con contesto lungo (ad esempio, 100K+ token), il tempo di prefill aumenta linearmente con la lunghezza dell'input. La generazione dei token di output è tipicamente il principale contributore alla latenza. Non viene dichiarato alcun accordo sul livello di servizio (SLA) per la velocità.
I punti di forza del modello includono la sua ampia finestra di contesto di 262K, che consente di elaborare interi libri o trascrizioni video di più ore in un'unica passata. Il design MoE offre un buon compromesso tra capacità e velocità di inferenza. L'input multimodale abilita attività che combinano dati testuali e visivi. La natura non censurata consente la generazione di contenuti che altri modelli potrebbero rifiutare. Il supporto multilingue copre decine di lingue. Il prezzo è competitivo per un modello di questa capacità: $0,31/M input e $4,21/M output, margine zero.
Le limitazioni includono la mancanza di numeri di benchmark pubblicati, rendendo più difficile valutare le prestazioni relative. La natura non censurata può produrre output indesiderati senza moderazione aggiuntiva. Il conteggio dei parametri attivati 3B significa che potrebbe non eguagliare la potenza di ragionamento grezza di modelli densi più grandi (ad es., GPT-4) su compiti logici complessi. Le capacità multimodali possono essere meno raffinate rispetto ai modelli dedicati vision-language. Modalità di input come la tokenizzazione video potrebbero ridurre il contesto effettivo per il testo. Non sono garantite capacità di streaming o di utilizzo di strumenti. Infine, la dipendenza dal provider di terze parti Obsidian significa che la disponibilità e il tempo di attività non sono sotto il controllo di OrcaRouter.
Il prezzo è trasparente: $0.31 per milione di token di input e $4.21 per milione di token di output. Queste sono le tariffe esatte del fornitore Obsidian, senza alcun margine aggiunto da OrcaRouter. I token di input includono tutti i token di testo e visivi (per immagini e video). I token di output sono il testo generato. Non è prevista alcuna commissione per richiesta né abbonamento richiesto. Paghi solo per i token consumati. Il prezzo è per 1 milione di token, quindi le richieste piccole costano frazioni di centesimo. Non viene pubblicizzato alcun livello gratuito o periodo di prova.
Nessuno sconto, vantaggi di caching o prezzi volumetrici sono stati divulgati per questo modello. Le tariffe elencate sono fisse per token. A differenza di alcuni fornitori che offrono prezzi ridotti per token di input memorizzati in cache, OrcaRouter applica la stessa tariffa di input indipendentemente dalla ripetizione. Per un utilizzo molto elevato, è possibile contattare OrcaRouter per potenziali accordi personalizzati, ma non è documentato alcuno sconto standard. La politica di margine zero garantisce che tu stia pagando esattamente ciò che Obsidian addebita, senza commissioni nascoste.
Modelli multimodali con contesto lungo comparabili di altri fornitori spesso costano di più: per esempio, OpenAI GPT-4 Turbo costa $10/1M input e $30/1M output, mentre Claude 3.5 Sonnet costa $3/1M input e $15/1M output. Questo modello è notevolmente più economico a $0.31/$4.21. Tuttavia, quei modelli offrono capacità diverse (ad esempio, uso di strumenti, benchmark di ragionamento superiori). Il prezzo più basso riflette l'architettura MoE e il fatto che si tratti di un modello non censurato ospitato da terze parti. Se hai bisogno di affidabilità garantita, maggiore sicurezza o funzionalità avanzate come la chiamata di funzioni, il costo aggiuntivo potrebbe essere giustificato.
Per utilizzare il modello, invia una richiesta POST a https://api.orcarouter.ai/v1/chat/completions (o all'endpoint appropriato secondo l'API compatibile con OpenAI di OrcaRouter). Includi l'intestazione "Authorization: Bearer YOUR_API_KEY". Nel corpo della richiesta, imposta "model": "obsidian/Qwen3.6-35B-A3B". Invia i messaggi nel formato standard OpenAI: un array di oggetti con "role" e "content". Per contenuti multimodali, utilizza un array content con tipo "text" e "image_url" (o equivalente per video). Esempio con cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
Puoi utilizzare i tipici parametri compatibili con OpenAI: temperature (default 1.0), top_p (0.9), max_tokens (il default varia, si consiglia di impostarlo esplicitamente), sequenze di stop, frequency_penalty, presence_penalty e seed per la riproducibilità. Il modello supporta lo streaming tramite "stream": true per ricevere risposte token per token. Per input multimodali, l'API si aspetta array di contenuti con tipo "image_url" e opzionalmente "video_url" (controlla la documentazione di OrcaRouter per il formato video esatto). Il limite della finestra di contesto di 262.144 token si applica al numero totale di token nei messaggi più la risposta. Se superi il limite, riceverai un errore di lunghezza del contesto; puoi regolare "max_tokens" o troncare i messaggi.
Per sfruttare il contesto di 262K, struttura i tuoi prompt in modo da includere l'intero documento o la cronologia della conversazione. Tieni presente che ogni token nell'input contribuisce al costo e ai limiti. Per input molto lunghi, considera di suddividere in blocchi o riassumere prima di inviare, anche se il modello è progettato per gestire l'intero contesto. Usa il parametro "max_tokens" per controllare la lunghezza dell'output. Se incontri errori di timeout, abilita lo streaming per ottenere risultati parziali più velocemente. OrcaRouter potrebbe avere le proprie impostazioni di timeout; contatta il supporto se necessario. Il modello non supporta i messaggi di sistema in modo speciale; trattali come un messaggio utente o assistente con ruolo "system" (formato OpenAI standard).
Migrare da provider come OpenAI o Anthropic comporta cambiare l'URL di base in `https://api.orcarouter.ai/v1` e aggiornare l'ID del modello. Se il tuo codice utilizza il client Python di OpenAI, imposta `client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1")` e poi usa `client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...)`. Il formato dei messaggi e i nomi dei parametri sono identici. Non sono necessarie modifiche alla logica dei prompt. Nota che anche le forme degli oggetti di risposta sono compatibili, quindi il codice di parsing esistente dovrebbe funzionare. Effettua prima un test con una richiesta piccola per garantire autenticazione e fatturazione corrette.
Rispetto a Qwen3.6-72B (dense), questo modello utilizza MoE e quindi ha un costo di inferenza per token inferiore, ma potrebbe avere una capacità grezza leggermente inferiore. Il contesto di 262K è più grande di quello di Qwen2.5 che è di 128K. Rispetto a Qwen3.6-32B (forse dense), questo modello offre input multimodale che le versioni precedenti potrebbero non avere. La variante "uncensored" è unica; le versioni standard di Qwen hanno un allineamento. Se hai bisogno di una stretta sicurezza, scegli il Qwen3.6 regolare. In termini di prezzo, questo modello è più economico di molti modelli Qwen dense su altre piattaforme.
GPT-4o e Claude 3.5 Sonnet sono modelli proprietari con un ampio addestramento sulla sicurezza, punteggi benchmark più alti in ragionamento e codifica, e supportano l'uso di strumenti, la visione e un contesto ampio (200K per Claude). Questo modello offre un contesto più ampio (262K) e input multimodali a un prezzo significativamente inferiore. Tuttavia, manca delle funzionalità avanzate, dell'affidabilità e della coerenza delle prestazioni di quei modelli. Per le applicazioni in cui il costo è una preoccupazione primaria e si può accettare un compromesso sulla qualità, questo modello è una buona alternativa. Se hai bisogno di ragionamento di alto livello o chiamate di funzione, i modelli premium valgono il costo aggiuntivo.
Questo modello è ottimale quando hai bisogno di: (1) un contesto molto lungo (262K token) a basso costo; (2) input multimodale (immagini/video) senza pagare prezzi premium; (3) generazione di testo senza censura dove i filtri di contenuto interferirebbero; (4) inferenza rapida rispetto al numero totale di parametri grazie all'attivazione MoE. È un forte contendente per ricerca, estrazione dati, scrittura creativa e qualsiasi attività che beneficia di un contesto elevato e di un basso costo per token. Se hai bisogno di funzionalità avanzate come chiamate a strumenti, output strutturati o alta affidabilità, considera altri modelli.
| Input / 1M token | $0.310 |
| Output / 1M token | $4.21 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BApri @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B