
Ming-Image-0.1-Design เปิดตัวเงียบ ๆ: โมเดลดีไซน์ขนาด 6B ที่มีอยู่แค่ในรีโปและไม่มีที่อื่นอีกแล้ว
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
มีโมเดลแปลงข้อความเป็นภาพขนาด 6B ชื่อ Ming-Image-0.1-Designตั้งอยู่ในองค์กร inclusionAIบน Hugging Face และ ณ วันที่ 23 กันยายน 2026 แทบไม่มีสิ่งอื่นใดเกี่ยวกับมันอยู่อีกเลย รีโพซิทอรีนี้ถูกสร้างขึ้นเมื่อวันที่ 17 กันยายน เวตต์มาถึงในวันเดียวกัน และการ์ดโมเดลถูกเขียนใหม่เมื่อวันที่ 22 กันยายน — สามคอมมิตในห้าวัน ทั้งหมดมาจากบัญชีเดียว โดยไม่มีโพสต์บล็อกจากผู้จำหน่าย ไม่มีบันทึกการเปิดตัว ไม่มีหน้าโมเดลบนแพลตฟอร์ม API ใด ๆ และตัวนับการดาวน์โหลดยังคงอ่านค่าเป็นศูนย์ นั่นคือสิ่งที่การเปิดตัวแบบเงียบ ๆ ดูเป็นเช่นนี้จากภายนอก: ชิ้นงานที่สมบูรณ์โดยไม่มีการประกาศ บทความนี้จึงเป็นบัญชีรายการสิ่งที่รีโพซิทอรีระบุ สิ่งที่เปลี่ยนแปลงไปเมื่อวานนี้ และสิ่งที่ยังคงตรวจสอบยืนยันไม่ได้ — ไม่ใช่บทวิจารณ์ เพราะยังไม่มีใครนอก inclusionAI เผยแพร่ตัวเลขใด ๆ สำหรับโมเดลนี้เลย
สิ่งที่ repository มีอยู่จริง
การ์ดนี้อธิบาย Ming-Image-0.1-Design ว่าเป็นโมเดลแปลงข้อความเป็นภาพขนาด 6B สำหรับ UI อินโฟกราฟิก โปสเตอร์ และงานออกแบบภาพที่เน้นข้อความอื่น ๆ โดยสร้างองค์ประกอบภาพที่สมบูรณ์และรองรับเอาต์พุตแบบ RGBA พร้อมพื้นหลังโปร่งใส เมทาดาทาของโมเดลนี้เปิดกว้างผิดปกติสำหรับโมเดลที่ใหม่ขนาดนี้: สัญญาอนุญาต MIT, diffusers และ safetensors แท็กไปป์ไลน์ text-to-image และแท็กที่ครอบคลุมการสร้างภาพ การออกแบบกราฟิก การเรนเดอร์ข้อความ และ RGBA
การตั้งค่าการอนุมานที่แนะนำนั้นเจาะจงเพียงพอที่จะมีประโยชน์:
• ความละเอียด — แนะนำ 2048 x 2048 หรือ 1024 x 1024 สำหรับการสร้างที่เร็วขึ้น
• ขั้นตอนการสุ่ม — 12
• CFG scale — 1.0
• ความแม่นยำ — BF16
• ฮาร์ดแวร์ — CUDA GPU หนึ่งตัวที่มี VRAM 80 GiB โดยอธิบายว่าเป็นคอนฟิกูเรชันที่ผ่านการตรวจสอบแล้ว
สิบสองขั้นตอนที่สเกลคำแนะนำ 1.0 เป็นลักษณะของตัวสุ่มตัวอย่างแบบกลั่นหรือไม่มีคำแนะนำ: ราคาถูกต่อภาพ ซึ่งเป็นเหตุผลที่การ์ดสามารถให้เอาต์พุต 2048 พิกเซลที่จำนวนขั้นตอนที่โมเดลดิฟฟิวชันส่วนใหญ่จะไม่พยายาม การ์ดยังระบุว่าโค้ดการอนุมานสาธารณะแมปคำขอความละเอียดข้อความเป็นภาพไปยังบัคเก็ต 1024 หรือ 2048 ที่รองรับ ดังนั้นขนาดกลางจะถูกปรับให้เป็นหนึ่งในสองขนาดนั้น
โครงสร้างไฟล์บอกข้อมูลได้มากกว่าตัวบทบรรยายเล็กน้อย ควบคู่ไปกับ vae และ scheduler ยังมีโฟลเดอร์ transformer ที่บรรจุไฟล์น้ำหนักห้าส่วน พร้อมด้วยองค์ประกอบแยกต่างหากอย่าง mllm, connector และ mlp — ซึ่งเผยให้เห็นรูปร่างของไปป์ไลน์หลายขั้นตอนที่ใช้โมเดลภาษามัลติโมดัลเป็นตัวเข้ารหัสข้อความ แทนที่จะเป็นตัวขจัดสัญญาณรบกวนแบบโมโนลิทิกเพียงตัวเดียว สอดคล้องกับหมายเหตุในการ์ดที่ว่าการเสริมพรอมป์ต์สามารถจัดการได้ด้วย Ling-3.0-flash-VL หรือ qwen3.8-27B ซึ่งเป็นโมเดลพี่น้องจากองค์กรเดียวกัน
คอมมิตทั้งสามที่ลงเมื่อวันที่ 22 กันยายน
นี่เป็นส่วนเดียวของเรื่องที่มีการประทับเวลาอยู่ในช่วงสัปดาห์ที่ผ่านมา และเป็นเหตุผลที่โมเดลนี้ควรค่าแก่การเขียนถึงตอนนี้มากกว่าในเดือนตุลาคม ชื่อคอมมิตตามลำดับ:
• 22 กันยายน 11:25 UTC — "เผยแพร่แพ็กเกจรีลีสของ Ming-Image-0.1-Design"
• 22 กันยายน 12:01 UTC — "รีเฟรชการ์ดโมเดล Ming-Image-0.1-Design"
• 22 กันยายน 15:17 UTC — "เพิ่มลิงก์การปรับใช้ vLLM-Omni"
สองรายการแรกเป็นงานธุรการทั่วไป ส่วนรายการที่สามคือการเปลี่ยนแปลงที่มีนัยสำคัญจริง ๆ: มีเฟรมเวิร์กที่ไม่ได้เป็นของผู้ขายเองนำโมเดลนี้ไปรองรับ และการ์ดตอนนี้แนะนำให้ให้บริการโมเดลนี้ผ่าน vLLM-Omni พร้อมลิงก์ไปยังสูตรการใช้งานและคู่มือการติดตั้ง นั่นคือสัญญาณมาตรฐานว่าโมเดลได้เปลี่ยนจาก "น้ำหนักที่วางอยู่บนชั้น" ไปเป็น "สิ่งที่ทีมสามารถตั้งระบบให้ทำงานอยู่เบื้องหลัง endpoint ได้จริง" และมันเป็นการเปลี่ยนแปลงประเภทที่ไม่เคยก่อให้เกิดข่าวประชาสัมพันธ์
มันก็ยังเป็นงานที่ยังไม่เสร็จสมบูรณ์เช่นกัน ลิงก์คู่มือการติดตั้งใช้งานได้ แต่เส้นทางสูตรเฉพาะโมเดลในคอมมิตเดียวกันกลับใช้ไม่ได้ — ณ วันที่ 23 กันยายน มันคืนค่าเป็น 404 ดังนั้นภาพรวมการดีพลอย Ming-Image-0.1-Design ในตอนนี้อ่านได้ว่า กรอบงานทั่วไปมีอยู่จริง แต่คำแนะนำสำหรับโมเดลนี้ภายในกรอบงานยังเป็นเพียงตัวยึดตำแหน่ง หากคุณวางแผนจะให้บริการโมเดลนี้ จงเผื่อเวลาไว้สำหรับอ่านคู่มือเริ่มต้นอย่างรวดเร็วของ vLLM-Omni และคิดหาการเชื่อมต่อโมเดลด้วยตัวคุณเอง
ลีดเดอร์บอร์ดในการ์ด และลีดเดอร์บอร์ดที่มันไม่ได้อยู่บน
ที่เก็บโค้ดนี้มาพร้อมกราฟิกประสิทธิภาพหนึ่งรายการ: assets/uiux_leaderboard.webp ซึ่งเป็นภาพในสไตล์ลีดเดอร์บอร์ด มีหัวข้อว่า "ลีดเดอร์บอร์ดการสร้างภาพจากข้อความ: การออกแบบ UI/UX" ส่วนท้ายมีข้อความว่า "คะแนน Elo จากการโหวตตามความชอบแบบไม่เปิดเผยตัวตนใน Image Arena ของเรา" และป้าย "ลีดเดอร์บอร์ด Open Weights" ในภาพ Ming-Image-0.1-Design อยู่อันดับหนึ่งที่ 1,082 Elo นำหน้า Ideogram 4.0 (Quality) ที่ 1,052, Ideogram 4.0 ที่ 1,015, HunyuanImage 3.0 Instruct ที่ 1,005 และตัวแปร FLUX.2 dev ที่มีคะแนนระหว่าง 994 ถึง 1,000
มีสามสิ่งที่ต้องพูดเกี่ยวกับภาพนั้น และลำดับมีความสำคัญ
ประการแรก มันเป็นงานศิลป์ที่ผู้จำหน่ายเผยแพร่เองภายในที่เก็บของผู้จำหน่ายเอง เรากำลังรายงานว่าไฟล์นั้นมีอะไรอยู่ ไม่ได้กำลังรับรองมัน
ประการที่สอง เราไม่พบ Ming-Image-0.1-Design ที่ใดเลยบนบอร์ดไลฟ์ของ Artificial Analysis เมื่อวันที่ 23 กันยายน — ไม่พบบนลีดเดอร์บอร์ด text-to-image ไม่พบในมุมมองหมวดหมู่ UI/UX Design ไม่พบบนบอร์ด image-editing และไม่พบในมุมมอง open-weights อันดับสูงสุดของหมวด UI/UX Design แบบไลฟ์คือ GPT Image 2.5 Flare ที่ 1,227 Elo และรายการ FLUX.2 ที่การ์ดระบุไว้ก็ปรากฏบนบอร์ดไลฟ์เดียวกันนั้นด้วยค่าที่แตกต่างออกไป: FLUX.2 [flex] ที่ 1,065, FLUX.2 [max] ที่ 1,053, FLUX.2 [dev] ที่ 1,000 ดังนั้นการจัดอันดับของการ์ดจึงเป็นข้อกล่าวอ้างเกี่ยวกับบอร์ดที่เราระบุตำแหน่งไม่พบ ซึ่งแสดงบนสเกลที่ต่ำกว่าสเกลที่เราพบได้ราว 150 Elo
ประการที่สาม Elo คำนวณแยกกันในแต่ละบอร์ด คะแนน UI/UX ที่เจาะจงตามหมวดหมู่กับคะแนน text-to-image ทั่วไปเป็นปริมาณที่ต่างกัน แม้จะเป็นโมเดลเดียวกันก็ตาม ซึ่งเป็นเหตุผลว่าทำไม FLUX.2 เวอร์ชันเดียวกันจึงปรากฏอยู่ที่ 1,026 บนบอร์ดหนึ่งของ Artificial Analysis และ 1,065 บนอีกบอร์ดหนึ่ง การเปรียบเทียบใดก็ตามที่นำบอร์ดต่าง ๆ มาปนกัน ไม่ถือว่าเป็นการเปรียบเทียบ
สถานะสุทธิ: Ming-Image-0.1-Design มีคำกล่าวอ้างด้านประสิทธิภาพเพียงข้อเดียว ซึ่งเป็นคำกล่าวอ้างของผู้ขายเอง และยังไม่มีการประเมินอย่างอิสระต่อคำกล่าวอ้างนั้น นั่นไม่ใช่การกล่าวหา นี่คือเหตุผลที่โมเดลนี้ต้องมีการรันจากภายนอก ก่อนที่ใครจะจัดงบประมาณโดยอิงกับ 1,082
สิ่งที่คุณยังทำกับมันไม่ได้
Quick Start คือปัญหา มันบอกให้คุณโคลน github.com/inclusionAI/Ming-Image ติดตั้ง requirements ของมัน แล้วรัน infer.py กับ model ID บน Hugging Face รีโพซิทอรีนั้นไม่มีอยู่จริง หน้าเว็บคืนค่า 404, README แบบ raw คืนค่า 404 และไม่มี Ming-Image รีโพซิทอรีปรากฏอยู่ที่ใดเลยในรายการรีโพซิทอรีสาธารณะขององค์กร — ซึ่งในรายการนั้นมี Ming, Ling, Ring, Ming-UniVision, Ming-UniAudio และอื่น ๆ อีกเป็นสิบ ดังนั้นนี่คือการไม่มีอยู่จริง ไม่ใช่ URL ที่พิมพ์ผิด เส้นทางเดียวที่ได้รับการบันทึกไว้สำหรับการรัน Ming-Image-0.1-Design คือเส้นทางเดียวที่ไม่มีอยู่ตรงนั้น
เรื่องการเข้าถึงส่วนที่เหลือก็บางเบาพอ ๆ กัน การ์ดตั้งค่า inference: false และ Hugging Face รายงานว่าไม่มีผู้ให้บริการ inference รายใดนำโมเดลนี้ไปใช้งาน ไม่มีราคาที่เผยแพร่ ไม่มีตัวระบุ API ไม่มี playground และไม่มีข้อกำหนดทางการค้าใด ๆ นอกเหนือจากสัญญาอนุญาต MIT ที่แนบมากับไฟล์เวตส์เอง จำนวนการดาวน์โหลดเป็นศูนย์ และจำนวนไลก์เป็นสี่
ดังนั้น สรุปอย่างตรงไปตรงมาเกี่ยวกับความพร้อมใช้งานก็คือ: ตัวเวตนั้นมีอยู่จริงและมีสัญญาอนุญาตแบบเปิดกว้าง และทุกสิ่งรอบๆ ตัวมัน — โค้ด เอกสาร การโฮสต์ การประเมินผล — ล้วนขาดหายไปหรือเป็นเพียงโครงร่างเท่านั้น
ตัวเลขที่กำหนดว่าใครสามารถใช้ได้
VRAM 80 กิกะไบต์คือประเด็นทั้งหมด นั่นคือการ์ดระดับ H100 หรือ H200 หนึ่งใบ หรือ A100 80GB ไม่ใช่ GPU สำหรับเวิร์กสเตชัน ไม่ใช่แล็ปท็อป และไม่ใช่สปอตอินสแตนซ์ที่คุณลืมปิดทิ้ง เมื่อรวมกับการกำหนดค่าแบบใช้ GPU เดียวที่ผ่านการตรวจสอบแล้ว มันหมายความว่า Ming-Image-0.1-Design ไม่มีค่าใช้จ่ายด้านสิทธิ์การใช้งานแต่มีค่าใช้จ่ายสูงในการรัน ซึ่งเป็นรูปแบบที่คุ้นเคยของการเปิดตัวแบบ open-weights จากแล็บที่ฝึกโมเดลในระดับสเกลใหญ่
เพื่อความครบถ้วนในส่วนของเราเอง: ไม่มีโมเดลของ inclusionAI ใดที่สามารถจัดเส้นทางผ่าน OrcaRouter ได้ในปัจจุบัน หน้าแคตตาล็อกแสดง 199 โมเดลจากผู้ให้บริการ 15 รายเมื่อเราอ่านมันในวันที่ 23 กันยายน และไม่มีรายการ Ming และไม่มีรายการ inclusionAI ใด ๆ เลย ดังนั้นจึงไม่มีอะไรให้เรียกผ่านเราได้ สิ่งที่เลเยอร์การจัดเส้นทางมีค่าจริง ๆ ในสถานการณ์นี้คือขั้นตอนที่สอง — วันที่ผู้ให้บริการต้นทางนำโมเดลนี้ไปใช้ การลองใช้จะกลายเป็นการเปลี่ยน model-ID บนคีย์ที่คุณมีอยู่แล้วแทนที่จะเป็นสัญญาใหม่และ SDK ใหม่ จนกว่าจะถึงตอนนั้น วิธีเดียวที่จะรัน Ming-Image-0.1-Design ได้คือการค้นหา repository ที่หายไปและ GPU ที่มีพื้นที่ว่าง 80 GiB
![The UI/UX Design leaderboard image published in the Ming-Image-0.1-Design repository. It is headed 'Text to Image Leaderboard: UI/UX Design' with the footer 'Elo scores from blind preference votes in our Image Arena' and an 'Open Weights Leaderboard' badge. Ming-Image-0.1-Design is listed first at 1,082 Elo, above Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005, FLUX.2 [dev] at 1,000, FLUX.2 [dev] Flash at 999, FLUX.2 [dev] Turbo at 994 and HiDream-O1-Image at 987.](https://cms.orcarouter.ai/api/media/file/2-1131.png)

อะไรจะทำให้สิ่งนี้กลายเป็นเรื่องราว
สี่สิ่ง เรียงตามลำดับจากน้อยไปมากในแง่ของข้อมูลที่แต่ละอย่างจะบอกคุณได้ การปรากฏขึ้นของรีโพซิทอรีคู่กัน ซึ่งจะทำให้โมเดลรันได้ตามที่เอกสารระบุ การมีสูตร vLLM-Omni ครบถ้วน ซึ่งจะทำให้ให้บริการได้โดยไม่ต้องเดา การที่ผู้ให้บริการ inference รายหนึ่งลงรายการโมเดลนี้ ซึ่งจะกำหนดราคาให้มัน และ Elo อิสระ ซึ่งจะเป็นตัวเลขแรกเกี่ยวกับโมเดลนี้ที่ไม่ได้มาจากคนที่ฝึกมัน
จนกว่าอย่างน้อยหนึ่งในนั้นจะเกิดขึ้นจริง จุดยืนที่ถูกต้องคือแคบและไม่หวือหวา หากคุณสร้างชุดประเมินสำหรับการสร้าง UI และเลย์เอาต์ น้ำหนักโมเดลนี้คุ้มค่าที่จะดึงมาตอนนี้ — MIT, 6B, คอนฟิกเดียว และจำนวนสเต็ปต่ำพอที่จะทำให้การสุ่มตัวอย่างไม่กี่พันตัวอย่างจ่ายไหว หากคุณต้องการสร้างภาพในงานโปรดักชันไตรมาสนี้ Ming-Image-0.1-Design ไม่ใช่ตัวเลือก: ไม่มีเอนด์พอยต์ ไม่มีการสนับสนุน และไม่มีคะแนนจากบุคคลที่สาม และหากคุณกำลังติดตามองค์กร inclusionAI ให้สังเกตว่าตอนนี้มันมีโมเดลภาพไว้คู่กับสายภาษาและเสียงแล้ว, ว่ามันเปิดตัวโมเดลนี้โดยไม่บอกใคร, และช่องว่างสองสัปดาห์ระหว่างการอัปโหลดครั้งแรกกับแพ็กเกจรีลีส บ่งชี้ว่าช่วงเงียบนั้นเป็นเจตนา

