
Bernini-Diffusers-v2 vs Qwen Image 3.0: Vikter du äger vs ett API som renderar text
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
Två kinesiska labb skickade ut bildkapabla modeller med tre veckors mellanrum och hamnade på motsatta sidor av den största klyftan i kategorin. Qwen-Image-3.0, släppt av Alibabas team den 21 juli 2026 och öppnat för ett internationellt API den 4 augusti, är en bildmodell med slutna vikter som du anropar över HTTP. Bernini-Diffusers-v2, som ByteDance skickade till Hugging Face den 13 augusti 2026 utan tillkännagivande, är Apache-2.0 öppna vikter som du laddar ner och kör. Samma ungefärliga arbetsbeskrivning – bildgenerering och redigering – och motsatta svar på frågan om vem som kontrollerar modellen. Det mesta som följer är en konsekvens av det enda beslutet, så det är här denna jämförelse börjar snarare än slutar.
Vikterna delar
• Qwen-Image-3.0 — stängda vikter. I skrivande stund har Alibaba inte publicerat vikterna eller en teknisk rapport för den; du använder den via API:t på Alibaba Cloud Bailian eller Qwen-plattformen. Utdata bär en AIGC-ursprungsmärkning. Vad du köper är kapacitet utan besittning: ingen egen drift, ingen finjustering, ingen offline-användning, ingen möjlighet att kika under huven.
• Bernini-Diffusers-v2 — öppna vikter. Apache-2.0, en fristående diffusers-katalog på Hugging Face och lokala inferensskript i bytedance/Bernini-repositoriet. Du kan finjustera den, köra den utan internetanslutning, behålla dina data på din egen hårdvara och sluta betala per bild. Priset för att ha den i eget förvar är att driva den: README rekommenderar Hopper-klassade GPU:er och en Python 3.11.2 / PyTorch 2.7.1+cu126-stack.
För ett team vars bilder innehåller konfidentiellt material, eller vars efterlevnadsregler förbjuder att skicka data till ett tredjeparts-API, avgör den uppdelningen frågan av sig själv.
Text- och layouttrohet
Där Qwen-Image-3.0 verkligen är utmärkande är text. Dess rubriksiffror, från Alibabas utgivningsmaterial:
• Promptfönster — upp till 4 500 tokens av indata, ett 4,5× hopp jämfört med föregående generation, vilket gör att den kan hantera kompakta underlag som tidningsframsidor eller ett nio-rutors kunskapsdiagram i ett enda anropbr />• Liten text — läsbar rendering ner till ungefär 10px, inklusive matematisk notation, subskript, superskript och flerradiga formlerbr />• Språk — nativ rendering på 12 språk med 20+ typsnitt och 100+ konstnärliga stilar, plus förtrogenhet med vanliga webb-, spel- och programgränssnitt
Bernini-Diffusers-v2 gör inga jämförbara anspråk på text- och layoutprecision på sitt kort. Dess styrkor ligger annanstans — planeringsbaserad semantisk redigering och en videopipeline — och för ett uppdrag som i första hand går ut på att "återge denna infografik korrekt," är Qwen-Image-3.0 det beprövade valet och Bernini det obeprövade.
Redigeringsdjup
• Qwen-Image-3.0 — generering plus redigering, med en portfölj av specialknep: restaurering av gamla målningar, panoramagenerering, skiss-till-PPT och storyboarding i flera steg. Säljargumentet är produktionsnytta — layouter som håller, detaljer som känns äkta — snarare än en specifik redigeringsarkitektur.
• Bernini-Diffusers-v2 — redigering genom en semantisk planerare. En Qwen2.5-VL-planerare delar upp instruktionen i en plan för vad som ska ändras, och en renderare baserad på Wan2.2 ritar det. Det är en övertygande design för komplexa, flerstegsredigeringar — "ändra årstiden, byt bilen, behåll inramningen" — och den utvidgas till videouppgifter (t2v, v2v, rv2v) som ingen konkurrent rör vid. Alltihop är leverantörsrapporterat och offentligt overifierat.


Kostnad
• Qwen-Image-3.0 — ungefär $0.025 per 1K-bild på det internationella API:t (cirka 0.18 yuan), med upp till 2048×2048-utdata och upp till sex bilder per anrop. Det är prissatt för att konkurrera hårt med resten av API-bildmarknaden — en bråkdel av vad premium värdbaserade bildmodeller kostade för ett år sedan.
• Bernini-Diffusers-v2 — gratis vikter, ingen avgift per bild, och i stället en hårdvaruräkning. Ekonomin vänder med volymen: självhostning är en dålig affär för enstaka bilder och en allt bättre sådan ju fler du genererar, eftersom marginalkostnaden för ytterligare en bild närmar sig noll.
Det finns en tredje kostnad som gynnar open-weights-sidan och som är lätt att underskatta: kostnaden för att byta. En sluten API-modell låser dig till dess prissättning, dess hastighetsbegränsningar och dess färdplan; en modell du äger kan bytas ut, patchas eller finjusteras utan att du behöver omförhandla något.
Vilket är det API som du bygger på?
Qwen-Image-3.0 är endast API-baserat, så om du bygger på det förbinder du dig till en mätare per bild på någon annans infrastruktur – vilket är precis där OrcaRouters pass-through spelar roll. Priset du ser hos oss är Alibabas listpris med 0% påslag, och en prissänkning från leverantören slår igenom samma dag, så ekonomin per bild följer leverantören, inte en återförsäljares påslag ovanpå. Automatisk failover över leverantörer är andra halvan av argumentet: ett bild-API som går ner mitt i en kampanj slutar spela roll när dina anrop dirigeras runt det. Om du istället väljer vägen med öppna vikter med Bernini-Diffusers-v2, accepterar du driftsbördan idag i utbyte mot noll avgifter per bild, och när en hostad leverantör så småningom plockar upp vikterna, gäller samma pass-through för vad den leverantören än tar betalt.

Domen
På papperet är Qwen-Image-3.0 den starkare rena bildmodellen: beprövad textrendering, ett enormt promptfönster, flerspråkig layouttrohet och ett konkurrenskraftigt API-pris. Det är det säkra valet för produktionsbildgenerering där briefen är texttung och arbetsflödet är API-format. Bernini-Diffusers-v2 är modellen du faktiskt kan äga — Apache-2.0-vikter, självhostad, finjusterbar, videokapabel — till priset av att du driver den själv och litar på en benchmark-tabell som ingen har reproducerat. Välj Qwen-Image-3.0 för noggrannhet och noll infrastruktur; välj Bernini-Diffusers-v2 för besittning och kontroll. Tumregeln i en mening: vill du hyra förmågan, eller äga modellen?
