
Ming-Image-0.1-Design กับ Qwen-Image 3.0: ใครแสดงให้คุณเห็นว่าข้อความถูกวาดขึ้นมาอย่างไร
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
สิ่งที่น่าสนใจที่สุดเกี่ยวกับ Ming-Image-0.1-Design ไม่ได้อยู่บนการ์ดโมเดลของมัน แต่อยู่ในคอมมิตของเฟรมเวิร์กสำหรับการอนุมาน ช่วงราว ๆ ที่โมเดลนี้ถูกอัปโหลดขึ้น Hugging Face อย่างเงียบ ๆ เมื่อวันที่ 17 กันยายน 2026 vLLM-Omni ได้รวมการเปลี่ยนแปลงที่มีชื่อว่า feat: เพิ่มการรองรับ byte5 สำหรับ Ming ที่เชื่อมตัวเข้ารหัส glyph ของ ByT5 เข้ากับไปป์ไลน์ ming_flash_omni ใหม่ — คอมโพเนนต์เฉพาะทางที่มีหน้าที่ทั้งหมดคือดูตัวอักษรที่คุณขอให้เรนเดอร์ ไม่ใช่ดูภาพที่คุณขอ สิ่งนี้เป็นรายละเอียดประเภทที่หาได้จากการอ่านโค้ดเท่านั้น และเป็นรายละเอียดที่ Qwen-Image 3.0 — โมเดลภาพแบบโฮสต์ปิดของผู้จำหน่าย เปิดตัวเมื่อวันที่ 21 กรกฎาคม 2026 และเปิดให้ใช้งานทั่วไปเมื่อวันที่ 5 สิงหาคม — ไม่เปิดให้ใครอ่านได้เลย ทั้งสองโมเดลมุ่งเป้าไปที่งานออกแบบซึ่งตัวอักษรที่อ่านได้ชัดเจนเป็นส่วนที่ยาก มีเพียงตัวเดียวเท่านั้นที่จะบอกคุณว่ามันทำได้อย่างไร
สิ่งที่แต่ละคนพูดเกี่ยวกับข้อความ
เรื่องราวการเรนเดอร์ข้อความของ Qwen-Image 3.0 เป็นเพียงคำกล่าวอ้างในตอนเปิดตัวเท่านั้น และเมื่อดูในทางทฤษฎีก็ถือเป็นคำกล่าวอ้างที่ดี เอกสารของ Alibaba ระบุถึงพรอมป์ต์ที่มีความยาวสูงสุดประมาณ 4,500 โทเคน ข้อความที่อ่านออกได้จนถึงขนาดราว 10 พิกเซล ความครอบคลุม 12 ภาษาในฟอนต์มากกว่า 20 แบบ เอาต์พุตสูงสุด 2048×2048 และได้สูงสุดหกภาพต่อการเรียกหนึ่งครั้ง โดยมีให้ใช้ในรุ่น Pro และ Standard ผ่าน API แบบโฮสต์เดียว ไม่มีการเผยแพร่เวต ไม่มีสัญญาอนุญาตที่ระบุไว้ ไม่มีการ์ดโมเดล ไม่มีรายงานทางเทคนิค และไม่มีตารางเบนช์มาร์กที่เผยแพร่เพื่อใช้ตรวจสอบสิ่งใด ๆ เหล่านั้น ตัวเลขประมาณ ~20B พารามิเตอร์ของ MMDiT ที่ถูกกล่าวซ้ำกันอย่างแพร่หลายนั้นเป็นข้อมูลที่มีการรายงานมา มากกว่าจะได้รับการยืนยัน
เรื่องราวของ Ming-Image-0.1-Design คือรีโพซิทอรี พารามิเตอร์ 6,154,901,056 ตัว สัญญาอนุญาต MIT และ diffusers เป็นแท็กไปป์ไลน์ น้ำหนักทั้งหมดอยู่ในรูปแบบ BF16 safetensors ประมาณ 71.5 GB กระจายอยู่ใน connector/, mllm/, mlp/, scheduler/, transformer/ และ vae/ การอนุมานที่แนะนำคือ 2048×2048 ที่ 12 ขั้นตอนการสุ่มตัวอย่าง โดยใช้ guidance ที่ 1.0 บน GPU CUDA ขนาด 80 GiB หนึ่งตัว หรือ 1024 เพื่อความเร็ว โดยมี vLLM-Omni ที่ระบุไว้สำหรับการปรับใช้ และโมเดลภาษาภาพแยกต่างหากที่ระบุไว้สำหรับการเสริมพรอมต์ การ์ดนี้อธิบายว่าเป็นโมเดลข้อความเป็นภาพสำหรับ UI อินโฟกราฟิก โปสเตอร์ และงานออกแบบภาพที่ใช้ข้อความจำนวนมากอื่น ๆ พร้อมเอาต์พุต RGBA สำหรับพื้นหลังโปร่งใส
สองย่อหน้านั้นไม่ใช่ข้อความชนิดเดียวกัน และก็คุ้มค่าที่จะพูดตรง ๆ ว่าทำไม ย่อหน้าหนึ่งเป็นคำอธิบายผลิตภัณฑ์ที่เขียนโดยคนที่ขายมัน อีกย่อหน้าเป็นคำอธิบายชิ้นงานที่ใคร ๆ ก็ดาวน์โหลดและตรวจสอบได้
ตัวเข้ารหัสสัญลักษณ์คือส่วนที่อธิบายหมวดหมู่
การเรนเดอร์ข้อความในโมเดลภาพมักล้มเหลวในลักษณะเฉพาะอย่างหนึ่ง: โมเดลสร้างสิ่งที่ดูเหมือนงานเขียนโดยที่ไม่ใช่การเขียน รูปทรงตัวอักษรดูสมเหตุสมผล แต่คำนั้นผิด เหตุผลเป็นเรื่องสถาปัตยกรรมก่อนสิ่งอื่นใด — โมเดลภาพส่วนใหญ่ไม่มีองค์ประกอบใดที่มองตัวอักษรในฐานะตัวอักษร ดังนั้นตัวพิมพ์จึงถูกประกอบกลับขึ้นใหม่จากสถิติเชิงภาพ ในแบบเดียวกับที่หญ้าถูกสร้างขึ้น
คอมมิตของ vLLM-Omni น่าสนใจก็เพราะมันชี้ไปที่เรื่องนั้น ไฟล์ที่เพิ่มเข้ามา — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py และตัวประมวลผลอินพุตของสเตจ — อธิบายเส้นทางที่ตัวเข้ารหัสระดับไบต์ ByT5 อ่านข้อความที่ควรปรากฏในภาพ คำศัพท์ของโทเค็นไนเซอร์ถูกขยายด้วยเครื่องหมายฟอนต์และสี และฟีเจอร์ที่ได้จะถูกต่อท้ายตามมิติของลำดับ โดยฝั่งลบได้รับค่าศูนย์ รายละเอียดสุดท้ายนั้นคือสัญญาณบ่งบอกว่านี่เป็นการตัดสินใจออกแบบจริง ๆ ไม่ใช่แค่การเชื่อมต่อ: หากสาขาลบมีฟีเจอร์ glyph เดียวกัน การชี้แนะแบบไม่มีตัวจำแนก (classifier-free guidance) จะถูกดึงไปทางการเรนเดอร์ข้อความและออกจากพรอมต์ ดังนั้นค่าศูนย์จึงมีอยู่เพื่อไม่ให้วัตถุประสงค์ทั้งสองขัดแย้งกัน ตัวเข้ารหัสจะโหลดเฉพาะเมื่อเช็กพอยต์มีอยู่จริงซึ่ง byte5/ โฟลเดอร์ย่อย
หมายเหตุด้านความซื่อตรงสองข้อ นี่เป็นคอมมิตของเฟรมเวิร์กอินเฟอเรนซ์จากบุคคลที่สาม ไม่ใช่แถลงการณ์ของ Ant Group และการตีความว่าไฟล์เหล่านั้นหมายถึงอะไรเป็นของเรา ไม่ใช่ของผู้ขาย และมันสนับสนุนเจตนาในการออกแบบ ไม่ใช่ผลลัพธ์: การมีตัวเข้ารหัสไกลฟ์อยู่ สอดคล้องกับการเรนเดอร์ข้อความที่ดี และไม่ใช่หลักฐานว่าการเรนเดอร์ข้อความนั้นดี หลักฐานอิสระเพียงอย่างเดียวเกี่ยวกับคุณภาพคือตำแหน่งบนลีดเดอร์บอร์ดเพียงตำแหน่งเดียว ซึ่งจะกล่าวถึงด้านล่าง

ความต่างเมื่อเทียบกับ Qwen-Image 3.0 ไม่ใช่ว่าโมเดลของ Alibaba เรนเดอร์ข้อความได้แย่ — ไม่มีใครนอก Alibaba บอกได้ว่าโมเดลเรนเดอร์ข้อความได้ดีแค่ไหน ซึ่งนั่นแหละคือประเด็น แต่อยู่ที่ว่าคำถามที่ว่า "โมเดลนี้วาดตัวอักษรอย่างไร" นั้นมีคำตอบสำหรับโมเดลหนึ่ง และเป็นเพียงคำกล่าวอ้างทางการตลาดสำหรับอีกโมเดลหนึ่ง และช่องว่างระหว่างคำตอบกับคำกล่าวอ้างคือจุดที่การตัดสินใจทางวิศวกรรมเกิดขึ้น
หมายเลขหนึ่งตัว และกระดานที่มันไม่ได้อยู่บน
Ming-Image-0.1-Design อยู่อันดับหนึ่งบน Artificial Analysis Text to Image Leaderboard สำหรับ UI/UX Design ในมุมมอง open-weights ด้วยคะแนน Elo 1,082 — นำหน้า Ideogram 4.0 (Quality) ที่ 1,052, Ideogram 4.0 ที่ 1,015, HunyuanImage 3.0 Instruct ที่ 1,005, FLUX.2 [dev] ที่ 1,000, FLUX.2 [dev] Flash ที่ 999 และ FLUX.2 [dev] Turbo ที่ 994 สำเนาของกระดานนั้นเป็นฉบับที่ถูกทำซ้ำบนการ์ดของโมเดลเอง และมีแบรนด์ของ Artificial Analysis กำกับอยู่; ยังไม่มีใครทำซ้ำคะแนนนี้ได้อย่างอิสระ
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1124.png)
มันเป็นบอร์ดแบบ open-weights ดังนั้น Qwen-Image 3.0 จึงไม่มีรายการอยู่ในนั้น และการที่มันไม่มีอยู่ก็ไม่ได้บอกอะไรเกี่ยวกับคุณภาพของมัน สิ่งที่มันบอกได้คือเชิงโครงสร้าง: บอร์ดแบบ blind-preference สามารถจัดอันดับได้เฉพาะโมเดลที่มีน้ำหนักเปิดเผยต่อสาธารณะเท่านั้น นั่นทำให้การเปิดตัวแบบเปิดได้รับตำแหน่งที่วัดได้หลายเดือนก่อนที่มันจะมีผลิตภัณฑ์ และทำให้การเปิดตัวแบบปิดได้ตัวเลขทางการตลาดและไม่มีอะไรอื่นเลย คำกล่าวอ้างของ Qwen-Image 3.0 — ความอ่านออกที่ 10 พิกเซล, พรอมต์ 4,500 โทเคน, ฟอนต์ 20 แบบขึ้นไป — ไม่มีการวัดผลที่เป็นอิสระรองรับอยู่เบื้องหลังเลยแม้แต่น้อย

คุณจะทดสอบสิ่งนี้จริง ๆ ได้อย่างไร และการลองต้องแลกกับอะไร
ถ้าตัวอักษรที่อ่านออกได้คือเหตุผลที่คุณอ่านสิ่งนี้ การทดสอบไม่ใช่ตารางอันดับ มันคือไทป์เฟซของคุณเอง ภาษาของคุณเอง และสตริงของคุณเอง ที่รันผ่านทั้งสองตัวเลือกแล้วให้คนอ่าน การทดสอบนั้นต้องให้หนึ่งในโมเดลเหล่านี้เข้าถึงได้และราคาถูก ส่วนอีกโมเดลต้องดาวน์โหลดได้ และพวกมันตั้งราคาบนหลักการที่ตรงกันข้าม
• Qwen-Image 3.0 — ประมาณ $0.04 ต่อภาพในรุ่น Pro และประมาณ $0.03 ในรุ่น Standard โดยราคาสำหรับผู้บริโภคภายในประเทศเริ่มต้นที่ประมาณ ¥0.18 ต่อภาพ ตัวเลขเหล่านี้เป็นตัวเลขตอนเปิดตัวและยังไม่ได้ผ่านการตรวจสอบ คุณสามารถรันเมทริกซ์พรอมป์ต์ได้ในช่วงบ่ายนี้ และจ่ายตามจำนวนครั้งที่เรียกใช้
• Ming-Image-0.1-Design — ไม่มีราคาเผยแพร่ เพราะไม่มีเอนด์พอยต์ที่โฮสต์ไว้ ต้นทุนคือการดาวน์โหลด 71.5 GB การ์ด 80 GiB และเวลาของคุณเอง ส่วนประโยชน์คือคุณสามารถชี้การทดสอบเดียวกันไปที่เส้นทางตัวเข้ารหัส glyph และดูว่ามันเป็นองค์ประกอบที่ทำงานนั้นหรือไม่
นี่คือสถานการณ์ที่เลเยอร์การกำหนดเส้นทางถูกสร้างขึ้นมาเพื่อรองรับ และคุ้มค่าที่จะระบุให้ชัดเจนว่าส่วนใดของมันที่นำมาใช้ได้ ทั้ง Qwen-Image 3.0 และ Ming-Image-0.1-Design ต่างก็ไม่ได้อยู่บนแพลตฟอร์มของเรา ดังนั้นเลเยอร์การกำหนดเส้นทางจึงไม่สามารถนำตัวใดตัวหนึ่งไปไว้หลังคีย์ได้ในวันนี้ สิ่งที่มันทำได้คือทำให้การเปรียบเทียบยังคงซื่อตรงในขณะที่คุณทดลองใช้งาน: OrcaRouter เปิดให้เข้าถึงโมเดลกว่า 200 รุ่นผ่านปลายทางเดียวที่รองรับ OpenAI-compatible ในราคาตามที่ผู้ให้บริการระบุ โดยไม่มีค่าบวกเพิ่ม พร้อมการสลับไปใช้ผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง ดังนั้นโมเดลที่คุณไว้วางใจอยู่แล้วจึงสามารถดูแลเส้นทางการใช้งานจริงไว้ได้ — และค่าใช้จ่ายของมันยังคงผูกกับราคาตามที่ผู้ให้บริการระบุ ดังนั้นหากผู้ขายปรับเปลี่ยนอัตราราคา มันจะส่งผลมาถึงฝั่งเราในวันเดียวกัน — ในขณะที่โมเดลงานออกแบบที่ยังไม่ได้วัดผลจะถูกประเมินเคียงข้างมัน มากกว่าที่จะถูกวางไว้ด้านหน้าแทน
สองรีลีสแบบเปิด หนึ่งรีลีสแบบปิด และรูปแบบหนึ่ง
เป็นเรื่องที่ควรค่าแก่การสังเกตว่าการเปิดตัว Ming เป็นหลักฐานของสิ่งใด นอกเหนือไปจากตัวมันเอง Ant Group เผยแพร่โมเดลออกแบบขนาด 6.15 พันล้านพารามิเตอร์ภายใต้สัญญาอนุญาต MIT โดยไม่มีการประกาศใด ๆ พร้อมกับโมเดลที่สองสำหรับการแยกชั้นภายใต้สัญญาอนุญาตเดียวกัน Alibaba เผยแพร่โมเดลโฮสต์แบบปิดที่ไม่มีสัญญาอนุญาต ไม่มี model card และไม่มีรายงาน ซึ่งมุ่งเป้าไปที่งานประเภทเดียวกัน และคิดราคาเป็นรายภาพ
นั่นเป็นสองเดิมพันที่แตกต่างกันเกี่ยวกับว่าคุณค่าในโมเดลการออกแบบนั้นอยู่ที่ใด อันหนึ่งกล่าวว่าโมเดลคือผลิตภัณฑ์และน้ำหนักคือช่องทางการจัดจำหน่าย อีกอันกล่าวว่าโมเดลคือบริการและน้ำหนักคือสิ่งที่คุณเก็บไว้ เดิมพันทั้งสองสามารถถูกต้องได้ในตลาดเดียวกัน และพวกมันให้คำตอบที่แตกต่างกันมากต่อคำถามเดียวที่สำคัญในเวลาประเมิน: ฉันสามารถค้นพบว่าสิ่งนี้ทำงานอย่างไรก่อนที่ฉันจะพึ่งพามันได้หรือไม่?
• หากคุณจำเป็นต้องรู้ว่าข้อความถูกเรนเดอร์อย่างไร และเหตุใดบางครั้งจึงไม่เป็นเช่นนั้น — Ming-Image-0.1-Design เป็นเพียงหนึ่งเดียวในสองตัวเลือกที่ให้คุณตรวจดูได้ และสัญญาอนุญาต MIT หมายความว่าคุณสามารถลงมือทำกับสิ่งที่คุณพบได้
• หากคุณต้องการ endpoint สำหรับงานโปรดักชันที่ใช้งานได้วันนี้ โดยคิดราคาตามจำนวนภาพและไม่ต้องมีโครงสร้างพื้นฐานใด ๆ — Qwen-Image 3.0 เป็นเพียงตัวเดียวในสองตัวที่เสนอให้ได้ และระบบภายในของมันก็รวมอยู่ในราคานั้นแล้ว
• หากคุณต้องการหลักฐานอิสระก่อนตัดสินใจ — ทั้งสองฝ่ายต่างมีไม่เพียงพอ ฝ่ายหนึ่งมีอันดับบนลีดเดอร์บอร์ดเพียงรายการเดียวที่ยังไม่มีใครทำซ้ำได้ ส่วนอีกฝ่ายมีเอกสารอ้างสรรพคุณจากผู้ขายที่ไม่มีตัวเลขกำกับเลย
สิ่งที่ต้องจับตาคือว่ารูปแบบนี้ยังคงอยู่หรือไม่ การเปิดตัวภายใต้ MIT ที่ไม่ได้ประกาศล่วงหน้าและมีตัวเข้ารหัส glyph อยู่ในนั้น คือคำแถลงว่าผู้เขียนคาดหวังให้โมเดลถูกนำไปใช้อย่างไร — ตรวจสอบได้ รันในเครื่องได้ แก้ไขได้ หากการเปิดตัวครั้งถัดไปจากทีมเดิมถูกประกาศ มีการวัด benchmark และโฮสต์ให้ใช้งาน นั่นก็เป็นแค่กรณีครั้งเดียว หากมันเป็นอีกหนึ่ง repository เงียบ ๆ หมวดหมู่โมเดลเชิงออกแบบก็จะมีคู่แข่งแบบเปิดรายที่สองอยู่ในนั้น และครึ่งฝั่งปิดของตลาดก็มีปัญหาเรื่องราคาที่มันไม่มีในเดือนกรกฎาคม
