Hero-kort för matchen Bernini-Diffusers-v2 mot Qwen Image 3.0, som visar Apache-2.0-vikter som du själv hostar mot ett slutet API som renderar text ner till ~10px, under tagline "Samma arbetsbeskrivning, motsatta svar gällande kontroll"
Guides & Insights

Bernini-Diffusers-v2 vs Qwen Image 3.0: Vikter du äger vs ett API som renderar text

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två kinesiska labb skickade ut bildkapabla modeller med tre veckors mellanrum och hamnade på motsatta sidor av den största klyftan i kategorin. Qwen-Image-3.0, släppt av Alibabas team den 21 juli 2026 och öppnat för ett internationellt API den 4 augusti, är en bildmodell med slutna vikter som du anropar över HTTP. Bernini-Diffusers-v2, som ByteDance skickade till Hugging Face den 13 augusti 2026 utan tillkännagivande, är Apache-2.0 öppna vikter som du laddar ner och kör. Samma ungefärliga arbetsbeskrivning – bildgenerering och redigering – och motsatta svar på frågan om vem som kontrollerar modellen. Det mesta som följer är en konsekvens av det enda beslutet, så det är här denna jämförelse börjar snarare än slutar.

Vikterna delar

Qwen-Image-3.0 — stängda vikter. I skrivande stund har Alibaba inte publicerat vikterna eller en teknisk rapport för den; du använder den via API:t på Alibaba Cloud Bailian eller Qwen-plattformen. Utdata bär en AIGC-ursprungsmärkning. Vad du köper är kapacitet utan besittning: ingen egen drift, ingen finjustering, ingen offline-användning, ingen möjlighet att kika under huven.

Bernini-Diffusers-v2 — öppna vikter. Apache-2.0, en fristående diffusers-katalog på Hugging Face och lokala inferensskript i bytedance/Bernini-repositoriet. Du kan finjustera den, köra den utan internetanslutning, behålla dina data på din egen hårdvara och sluta betala per bild. Priset för att ha den i eget förvar är att driva den: README rekommenderar Hopper-klassade GPU:er och en Python 3.11.2 / PyTorch 2.7.1+cu126-stack.

För ett team vars bilder innehåller konfidentiellt material, eller vars efterlevnadsregler förbjuder att skicka data till ett tredjeparts-API, avgör den uppdelningen frågan av sig själv.

Text- och layouttrohet

Där Qwen-Image-3.0 verkligen är utmärkande är text. Dess rubriksiffror, från Alibabas utgivningsmaterial:

• Promptfönster — upp till 4 500 tokens av indata, ett 4,5× hopp jämfört med föregående generation, vilket gör att den kan hantera kompakta underlag som tidningsframsidor eller ett nio-rutors kunskapsdiagram i ett enda anropbr />• Liten text — läsbar rendering ner till ungefär 10px, inklusive matematisk notation, subskript, superskript och flerradiga formlerbr />• Språk — nativ rendering på 12 språk med 20+ typsnitt och 100+ konstnärliga stilar, plus förtrogenhet med vanliga webb-, spel- och programgränssnitt

Bernini-Diffusers-v2 gör inga jämförbara anspråk på text- och layoutprecision på sitt kort. Dess styrkor ligger annanstans — planeringsbaserad semantisk redigering och en videopipeline — och för ett uppdrag som i första hand går ut på att "återge denna infografik korrekt," är Qwen-Image-3.0 det beprövade valet och Bernini det obeprövade.

Redigeringsdjup

Qwen-Image-3.0 — generering plus redigering, med en portfölj av specialknep: restaurering av gamla målningar, panoramagenerering, skiss-till-PPT och storyboarding i flera steg. Säljargumentet är produktionsnytta — layouter som håller, detaljer som känns äkta — snarare än en specifik redigeringsarkitektur.

Bernini-Diffusers-v2 — redigering genom en semantisk planerare. En Qwen2.5-VL-planerare delar upp instruktionen i en plan för vad som ska ändras, och en renderare baserad på Wan2.2 ritar det. Det är en övertygande design för komplexa, flerstegsredigeringar — "ändra årstiden, byt bilen, behåll inramningen" — och den utvidgas till videouppgifter (t2v, v2v, rv2v) som ingen konkurrent rör vid. Alltihop är leverantörsrapporterat och offentligt overifierat.

Two-column comparison scoreboard for Bernini-Diffusers-v2 and Qwen Image 3.0: weights, price, prompt window, text rendering, editing strengths, and hosted API availabilityScreenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the News and Highlights sections, including the v2 training-recipe change, and the start of the model card table

Kostnad

Qwen-Image-3.0 — ungefär $0.025 per 1K-bild på det internationella API:t (cirka 0.18 yuan), med upp till 2048×2048-utdata och upp till sex bilder per anrop. Det är prissatt för att konkurrera hårt med resten av API-bildmarknaden — en bråkdel av vad premium värdbaserade bildmodeller kostade för ett år sedan.

Bernini-Diffusers-v2 — gratis vikter, ingen avgift per bild, och i stället en hårdvaruräkning. Ekonomin vänder med volymen: självhostning är en dålig affär för enstaka bilder och en allt bättre sådan ju fler du genererar, eftersom marginalkostnaden för ytterligare en bild närmar sig noll.

Det finns en tredje kostnad som gynnar open-weights-sidan och som är lätt att underskatta: kostnaden för att byta. En sluten API-modell låser dig till dess prissättning, dess hastighetsbegränsningar och dess färdplan; en modell du äger kan bytas ut, patchas eller finjusteras utan att du behöver omförhandla något.

Vilket är det API som du bygger på?

Qwen-Image-3.0 är endast API-baserat, så om du bygger på det förbinder du dig till en mätare per bild på någon annans infrastruktur – vilket är precis där OrcaRouters pass-through spelar roll. Priset du ser hos oss är Alibabas listpris med 0% påslag, och en prissänkning från leverantören slår igenom samma dag, så ekonomin per bild följer leverantören, inte en återförsäljares påslag ovanpå. Automatisk failover över leverantörer är andra halvan av argumentet: ett bild-API som går ner mitt i en kampanj slutar spela roll när dina anrop dirigeras runt det. Om du istället väljer vägen med öppna vikter med Bernini-Diffusers-v2, accepterar du driftsbördan idag i utbyte mot noll avgifter per bild, och när en hostad leverantör så småningom plockar upp vikterna, gäller samma pass-through för vad den leverantören än tar betalt.

Decision card for the Bernini-Diffusers-v2 versus Qwen Image 3.0 matchup: Qwen Image 3.0 rents the capability as a text-accurate API at ~$0.025 per image with zero infrastructure; Bernini-Diffusers-v2 owns the model as Apache-2.0 weights that are self-hosted and fine-tunable but unverified

Domen

På papperet är Qwen-Image-3.0 den starkare rena bildmodellen: beprövad textrendering, ett enormt promptfönster, flerspråkig layouttrohet och ett konkurrenskraftigt API-pris. Det är det säkra valet för produktionsbildgenerering där briefen är texttung och arbetsflödet är API-format. Bernini-Diffusers-v2 är modellen du faktiskt kan äga — Apache-2.0-vikter, självhostad, finjusterbar, videokapabel — till priset av att du driver den själv och litar på en benchmark-tabell som ingen har reproducerat. Välj Qwen-Image-3.0 för noggrannhet och noll infrastruktur; välj Bernini-Diffusers-v2 för besittning och kontroll. Tumregeln i en mening: vill du hyra förmågan, eller äga modellen?

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube