
Qwen-Image-2.1 vs Nano Banana 2 Lite: 340 ดอลลาร์สำหรับหนึ่งหมื่นภาพ หรือ 13 ชั่วโมงบน GPU
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ภาพขนาด 1024 พิกเซลจำนวนหนึ่งหมื่นภาพด้วย Nano Banana 2 Lite มีค่าใช้จ่ายประมาณ $340 ภาพหนึ่งหมื่นภาพจาก Qwen-Image-2.1 ใช้เวลา GPU 24 GB ประมาณสิบสามชั่วโมง และใบอนุญาตที่ห้ามคุณขายภาพเหล่านั้น นั่นคือข้อแลกเปลี่ยนในหนึ่งบรรทัด และเป็นการเปรียบเทียบเดียวในตระกูลนี้ที่โมเดลทั้งสองทำงานเดียวกันจริง ๆ ในช่วงเวลาเดียวกัน Qwen-Image-2.1 เปิดให้ใช้งานแบบ open-weights เมื่อวันที่ 20 กันยายน 2026 Nano Banana 2 Lite — รหัสโมเดลของผู้ให้บริการ google/gemini-3.1-flash-lite-image, ชื่ออย่างเป็นทางการ Gemini 3.1 Flash-Lite Image — เปิดตัวเมื่อวันที่ 30 มิถุนายน 2026 และเป็นตัวสร้างภาพนิ่งที่ถูกที่สุดในสาย Nano Banana
ผู้สมัครทั้งสองราย ในราคาที่ตรงไปตรงมา
Nano Banana 2 Lite สร้างภาพ 1K ได้ในเวลาประมาณสี่วินาที เร็วกว่า Gemini 3.1 Flash Image ประมาณ 2.7 เท่า และคิดค่าบริการแบบเหมาจ่าย $0.034 ต่อภาพ 1K อัตราค่าโทเค็นของ Google ที่รองรับตัวเลขนั้นคือ $0.25 ต่อ 1M อินพุตโทเค็น และ $30 ต่อ 1M เอาต์พุตโทเค็นภาพ ซึ่งคำนวณออกมาได้ประมาณ $0.0336 ที่ 1K ส่วนโหมดแบทช์จะลดครึ่งหนึ่งเหลือประมาณ $0.0168 ไม่มีระดับใช้งานฟรี และทุกเอาต์พุตมีลายน้ำ SynthID ที่มองไม่เห็น
Qwen-Image-2.1 ไม่มีราคา เพราะไม่มีอะไรให้ซื้อ มันเป็นการดาวน์โหลดขนาดประมาณ 33 GB — diffusion transformer แบบ single-stream ขนาด 7B จำนวน 32 เลเยอร์ ที่จับคู่กับ text encoder Qwen3-VL 8B — ที่คุณต้องโฮสต์เอง สิ่งที่ใกล้เคียงกับตารางราคามากที่สุดคือค่าความหน่วงที่วัดได้ของ SGLang-Diffusion: 4.74 วินาทีสำหรับรอบ denoising บน RTX 4090 ขนาด 24 GB โดยใช้ Cache-DiT และเคอร์เนล INT8, 8.23 วินาทีสำหรับการสร้างภาพเต็มรูปแบบ 1024×1024 จำนวน 40 ขั้นตอนบน RTX PRO 6000 Blackwell ที่มีหน่วยความจำสูงสุด 40.1 GiB และ 2.748 วินาทีบน B200 ตัวเดียว นั่นคือความหน่วงต่อคำขอเดียว ซึ่งรวมองค์ประกอบที่ระบุไว้ ไม่ใช่ตัวเลขอัตราการประมวลผล ดังนั้นให้ถือว่า 13 ชั่วโมงสำหรับภาพหนึ่งหมื่นภาพเป็นเพียงการประมาณระดับคร่าว ๆ มากกว่าจะเป็นเกณฑ์มาตรฐาน
เอาสองอย่างนั้นมาเทียบกัน แล้วการคำนวณจะไม่ใช่ "$340 เทียบกับฟรี" อีกต่อไป มันคือ $340 เทียบกับสิบสามชั่วโมงของการ์ดที่คุณมีอยู่แล้วหรือเช่า บวกกับเวลางานวิศวกรรมในการตั้งสแตกสำหรับให้บริการ ปริมาณจุดคุ้มทุนต่ำกว่าที่ทีมส่วนใหญ่คิดไว้มาก — แต่เฉพาะเมื่อการ์ดไม่ได้ว่างอยู่เฉย ๆ ตลอดช่วงที่เหลือของเดือน และเฉพาะเมื่อผลลัพธ์เป็นสิ่งที่คุณได้รับอนุญาตให้สร้างเท่านั้น
สามเวิร์กโหลด และโมเดลใดรับงานแต่ละอย่าง
ปริมาณเป็นแกนที่ผิดหากใช้เพียงลำพัง ประเภทของงานต่างหากที่ตัดสินได้เร็วกว่า
• แอสเซ็ตบนหน้าจอปริมาณมาก — ภาพตัดสำหรับโซเชียล, ภาพย่อ, ตัวแปร A/B Nano Banana 2 Lite ชนะในแทบทุกองค์ประกอบ สี่วินาทีต่อภาพ, อัตราส่วนภาพสิบสี่แบบ รวมถึง 1:4 และ 8:1, ราคาต่อภาพแบบคงที่ที่คาดการณ์ได้ถึงระดับเซนต์, โหมดแบตช์ที่ราคาครึ่งเดียว ไม่มีส่วนใดของงานนี้ที่ต้องใช้ alpha หรือ 2K และใบอนุญาตเชิงพาณิชย์แบบมีลายน้ำคือสิ่งที่คุณต้องการพอดีเมื่อส่งมอบผลลัพธ์
• งานพิมพ์, การคอมโพสิตขนาดใหญ่, หรือสิ่งใดก็ตามที่คุณจะต้องตัดอย่างหนัก Qwen-Image-2.1 และห่างชั้นกันแบบไม่ใกล้เคียง ความละเอียดเนทีฟ 2048×2048 ที่ 40 ขั้น เทียบกับโมเดลที่ถูกจำกัดเพดานไว้ที่ประมาณ 1 เมกะพิกเซล โดยไม่มีโหมด 2K, ไม่มีการอัปสเกล และไม่มีพารามิเตอร์ API ให้เพิ่มได้ — Google แนะนำให้ส่งงาน 2K และ 4K ไปที่ Nano Banana 2 หรือ Nano Banana Pro แทน ถ้าคุณต้องตัดหนึ่งในสามของเฟรมออกไปแล้วยังได้แอสเซ็ตที่ใช้งานได้ Lite พาคุณไปถึงจุดนั้นไม่ได้
• ภาพตัดพื้นหลังโปร่งใส, ไอคอน, สไปรต์, องค์ประกอบแบบมีเลเยอร์ Qwen-Image-2.1 ช่อง alpha เป็นองค์ประกอบหนึ่งของพื้นที่แฝง RGBA 64 ช่องสัญญาณที่ตัวสุ่มตัวอย่างใช้ขจัดสัญญาณรบกวน ดังนั้นจึงไม่มีขั้นตอนการแบ่งส่วนภาพและไม่มีขั้นตอนการทำ matting; โมเดลยังสามารถดึงตัวแบบออกจากภาพถ่ายธรรมดาไปเป็นเลเยอร์โปร่งใสได้อีกด้วย Nano Banana 2 Lite ไม่มีเอาต์พุตพื้นหลังโปร่งใสที่ระบุไว้ในเอกสาร
• อะไรก็ตามที่ต้องได้รับใบอนุญาตเชิงพาณิชย์ Nano Banana 2 Lite อย่างไม่มีข้อแม้ Qwen-Image-2.1 เผยแพร่ภายใต้ Qwen Research License Agreement ลงวันที่ 20 กันยายน 2026 และอนุญาตให้ใช้เพื่อการวิจัยและประเมินผลแบบไม่ใช่เชิงพาณิชย์เท่านั้น; การนำไปใช้งานเชิงพาณิชย์ต้องมีใบอนุญาตแยกต่างหากจาก Hangzhou Tongyi Laboratory Technology และไม่มีการเผยแพร่ราคาหรือเอกสารเงื่อนไข (term sheet) สำหรับใบอนุญาตดังกล่าว
อีกหนึ่งรายการควรอยู่ในลิสต์นั้น และมันสวนทางกับโมเดลแบบเปิด Nano Banana 2 Lite รู้หลายเรื่อง — มันมาพร้อมจุดตัดข้อมูลความรู้ ณ เดือนมกราคม 2025 และโปรไฟล์การทำตามพรอมป์ต์ที่สร้างบนแกนหลัก Gemini 3.1 Flash Lite โดยมีความสามารถแข็งแกร่งในการเรนเดอร์ข้อความในภาพ รวมถึงภาษาจีน ญี่ปุ่น และเกาหลี หลักฐานอิสระเกี่ยวกับการทำตามคำสั่งของ Qwen-Image-2.1 นั้นมีน้อยและคละกัน การเปรียบเทียบในอารีนาที่มี AI เป็นผู้ตัดสิน ซึ่งจับ Nano Banana 2 Lite ประลองกับโมเดลภาพ Qwen — รายการนี้ไม่ได้ระบุเวอร์ชัน ดังนั้นให้อ่านเป็นสัญญาณเกี่ยวกับตระกูลมากกว่าเกี่ยวกับ 2.1 โดยเฉพาะ — ให้ Lite ชนะในพรอมป์ต์เชิงพื้นที่แปลก ๆ ("astronaut riding a horse", "capybara taxi driver") และในด้านการเรนเดอร์ข้อความ ซึ่งเอาต์พุตของ Qwen เรนเดอร์ชื่อคำเชิญฮัลโลวีนเป็น "Hallofarty Invitation" จุดอ่อนที่ได้รับการบันทึกไว้ของ Lite เองคือ ใบหน้าเล็ก รายละเอียดข้อความเล็ก ๆ อินโฟกราฟิกที่แน่น และการแก้ไขแบบมาสก์ที่ซับซ้อน ไม่มีโมเดลใดที่ดีกว่าอย่างน่าเชื่อถือในการทำตามคำสั่งแปลก ๆ พวกมันล้มเหลวคนละจุด

ประเด็นภาพอ้างอิงที่ยังไม่มีข้อยุติ
การแก้ไขภาพหลายภาพเป็นจุดที่ไปป์ไลน์ปริมาณมากเริ่มไม่สามารถใช้โมเดลหนึ่งแทนอีกโมเดลหนึ่งได้ และยังเป็นแถวที่ข้อมูลสาธารณะขัดแย้งกัน
Qwen-Image-2.1 รองรับภาพอ้างอิงสูงสุด 10 ภาพ และรองรับการลองเสมือนจริง ภาพหมู่ และการจัดชุดเสื้อผ้าเพิ่มเติมจากนั้น สำหรับ Nano Banana 2 Lite แหล่งข้อมูลขัดแย้งกันอย่างรุนแรง หน้าของโมเดลจากผู้ให้บริการรายหนึ่งระบุว่ารองรับภาพอ้างอิงสูงสุด 14 ภาพสำหรับการถ่ายโอนสไตล์และการแก้ไขแบบอ้างอิงหลายภาพ ขณะที่บทความเปรียบเทียบระบุตรงกันข้าม — ว่า Lite รับภาพเดียวสำหรับการแก้ไข และความสามารถอ้างอิง 14 ภาพเป็นของ Nano Banana 2 เวอร์ชันเต็ม โดยมีคนสูงสุดห้าคนบวกวัตถุหกชิ้น เมื่อมีความขัดแย้งนี้ จุดยืนที่ป้องกันได้คือ Lite รองรับอินพุตภาพและการจัดองค์ประกอบหลายภาพ แต่ความสามารถด้านจำนวนภาพอ้างอิงคือสิ่งที่ Google ใช้เป็นตัวสร้างความแตกต่างจาก Nano Banana 2 หากเวิร์กโฟลว์ของคุณพึ่งพาตัวละครที่สอดคล้องกันหกตัวตลอดซีรีส์ ควรตรวจสอบขีดจำกัดกับ model card ของ Google เองก่อนที่คุณจะออกแบบสถาปัตยกรรมโดยอิงกับมัน
นี่ก็เป็นจุดที่โมเดลต่าง ๆ เริ่มใช้แทนกันไม่ได้ในความหมายที่กว้างขึ้นเช่นกัน Google วางตำแหน่ง Nano Banana 2 Lite และ Gemini Omni Flash เป็นคู่ — โมเดลภาพนิ่งและโมเดลวิดีโอ ที่สร้างมาให้ทำงานต่อเนื่องกันเป็นลูกโซ่ Qwen-Image-2.1 ไม่มีคู่เทียบด้านวิดีโอ และกลไกแอนิเมชันของมันคือลำดับการแก้ไขเฉพาะพื้นที่แบบเชื่อมต่อกัน ซึ่งสร้างลูปแบบเฟรมต่อเฟรมอย่างง่าย ไม่ใช่โมเดลวิดีโอ
เมื่อเลเยอร์การกำหนดเส้นทางพิสูจน์คุณค่าของตัวเอง
ไม่มีโมเดลใดในสองตัวนี้อยู่บน OrcaRouter เราไม่จัดเส้นทางให้โมเดล Qwen-Image เวอร์ชันใดเลย ดังนั้น Qwen-Image-2.1 จึงมีแค่ทางเลือกโฮสต์เอง หรือไม่ก็ไม่มีให้ใช้เลย Nano Banana 2 Lite — ตัวระบุ gemini-3.1-flash-lite-image — ก็ไม่อยู่ในแค็ตตาล็อกของเราเช่นกัน ส่วนเส้นทางรูปภาพของ Google ที่เรามีให้บริการจริงคือ google/gemini-3.1-flash-image-preview, google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview และ Imagen 4 ทั้งสามระดับ รวมถึง GPT-Image-2, GPT-Image-1.5 และ GPT-Image-1-mini ของ OpenAI และปลายทางรูปภาพ Grok Imagine ของ xAI
สิ่งที่การซื้อแบบไปป์ไลน์ผสมจะให้ได้ คือสิ่งที่การเปรียบเทียบนี้เจออยู่เรื่อย ๆ นั่นคือ การตัดสินใจที่เปลี่ยนไปตามแต่ละแอสเซต งานที่เน้นปริมาณจะไปเส้นทางโฮสต์ราคาถูก ภาพตัดพื้นหลังโปร่งใสจะไปการ์ดของคุณเอง และการขยับราคาของผู้ขายฝั่งโฮสต์จะสะท้อนถึงคุณในวันเดียวกัน เพราะเราส่งผ่านราคาตามรายการของผู้ให้บริการโดยบวกกำไรเป็นศูนย์ แทนที่จะตั้งราคาเอง เพิ่มระบบสลับอัตโนมัติเมื่อผู้ให้บริการล่มข้ามผู้ให้บริการหลายราย, DSL สำหรับจัดเส้นทางเพื่อประกอบ fallback และการหลอมรวมโมเดลสำหรับการเรียกแบบ panel ครึ่งฝั่งโฮสต์ก็จะไม่ใช่ความสัมพันธ์กับผู้ขายที่คุณต้องบริหารทีละโมเดลอีกต่อไป — โมเดล 200+ ตัว เอนด์พอยต์ที่เข้ากันได้กับ OpenAI หนึ่งจุด คีย์เดียวครึ่งฝั่งโฮสต์เองยังคงเป็นปัญหาของคุณ ซึ่งคือต้นทุนที่ตรงไปตรงมาของการรันเช็กพอยต์ที่มีใบอนุญาตสำหรับงานวิจัยบนฮาร์ดแวร์ที่คุณเป็นเจ้าของ
จะเลือกอันไหนดี และเงื่อนไขที่ทำให้มันพลิก
ถ้าคุณผลิตแอสเซตบนหน้าจอปริมาณมากเพื่อใช้เชิงพาณิชย์ Nano Banana 2 Lite คือคำตอบ และคำถามเรื่องใบอนุญาตก็ไม่เกิดขึ้นเลย: 0.034 ดอลลาร์ต่อภาพ สี่วินาที คาดการณ์ได้ ขายได้ ถ้าคุณต้องการ 2K ความโปร่งใสแบบเนทีฟ หรือภาพอ้างอิงสิบภาพ Qwen-Image-2.1 เป็นเพียงตัวเดียวในสองตัวนี้ที่มีความสามารถเหล่านั้น และคุณต้องจ่ายสำหรับสิ่งนั้นด้วยฮาร์ดแวร์ เวลางานวิศวกรรม และใบอนุญาตที่ไม่ใช่เชิงพาณิชย์ ซึ่งทำให้มันเป็นเครื่องมือวิจัยมากกว่าที่จะเป็นสิ่งที่ต้องพึ่งพาในงานโปรดักชัน
ข้อเท็จจริงเพียงข้อเดียวจะทำให้ช่องว่างนี้ยุบหายไป เทอมชีตเชิงพาณิชย์ที่เผยแพร่แล้วสำหรับ Qwen-Image-2.1 — พร้อมราคาและเงื่อนไขที่มีคนเซ็นได้จริง — เปลี่ยนงาน GPU 13 ชั่วโมงให้เป็นรายการค่าใช้จ่ายที่แข่งกับ $340 ได้ และ ณ จุดนั้น ความได้เปรียบด้านความละเอียดและ alpha ก็เริ่มชนะเวิร์กโหลดที่ปัจจุบันถูกส่งให้ Lite โดยปริยาย จนกว่าสิ่งนั้นจะมีอยู่ การแบ่งแยกก็ยังชัดเจน: Lite สำหรับทุกอย่างที่ต้องส่งมอบ, Qwen-Image-2.1 สำหรับทุกอย่างที่อยู่ในองค์กร, และสแตกสำหรับให้บริการของตัวหลังที่คุณดูแลเอง


การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
