การ์ดชื่อเรื่องหลักที่อ่านว่า 'Ming-Image-0.1-Design' คำบรรยายใต้ภาพ 'โมเดลการออกแบบขนาด 6B ที่เปิดตัวโดยไม่มีการประกาศและมีลิงก์เสียหนึ่งลิงก์' พร้อมการ์ดสองใบที่อ่านว่า 'ใน repo: สัญญาอนุญาต MIT, เอาต์พุต 2048 x 2048, 12 ขั้นตอนการสุ่ม, GPU 80 GiB หนึ่งตัว' และ 'ไม่มีใน repo: การประกาศ, API, หรือ Quick Start ที่ใช้งานได้' โลโก้ OrcaRouter ถูกผสมไว้ที่มุมขวาล่าง
Guides & Insights

Ming-Image-0.1-Design เปิดตัวเงียบ ๆ: โมเดลดีไซน์ขนาด 6B ที่มีอยู่แค่ในรีโปและไม่มีที่อื่นอีกแล้ว

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

มีโมเดลแปลงข้อความเป็นภาพขนาด 6B ชื่อ Ming-Image-0.1-Designตั้งอยู่ในองค์กร inclusionAIบน Hugging Face และ ณ วันที่ 23 กันยายน 2026 แทบไม่มีสิ่งอื่นใดเกี่ยวกับมันอยู่อีกเลย รีโพซิทอรีนี้ถูกสร้างขึ้นเมื่อวันที่ 17 กันยายน เวตต์มาถึงในวันเดียวกัน และการ์ดโมเดลถูกเขียนใหม่เมื่อวันที่ 22 กันยายน — สามคอมมิตในห้าวัน ทั้งหมดมาจากบัญชีเดียว โดยไม่มีโพสต์บล็อกจากผู้จำหน่าย ไม่มีบันทึกการเปิดตัว ไม่มีหน้าโมเดลบนแพลตฟอร์ม API ใด ๆ และตัวนับการดาวน์โหลดยังคงอ่านค่าเป็นศูนย์ นั่นคือสิ่งที่การเปิดตัวแบบเงียบ ๆ ดูเป็นเช่นนี้จากภายนอก: ชิ้นงานที่สมบูรณ์โดยไม่มีการประกาศ บทความนี้จึงเป็นบัญชีรายการสิ่งที่รีโพซิทอรีระบุ สิ่งที่เปลี่ยนแปลงไปเมื่อวานนี้ และสิ่งที่ยังคงตรวจสอบยืนยันไม่ได้ — ไม่ใช่บทวิจารณ์ เพราะยังไม่มีใครนอก inclusionAI เผยแพร่ตัวเลขใด ๆ สำหรับโมเดลนี้เลย

สิ่งที่ repository มีอยู่จริง

การ์ดนี้อธิบาย Ming-Image-0.1-Design ว่าเป็นโมเดลแปลงข้อความเป็นภาพขนาด 6B สำหรับ UI อินโฟกราฟิก โปสเตอร์ และงานออกแบบภาพที่เน้นข้อความอื่น ๆ โดยสร้างองค์ประกอบภาพที่สมบูรณ์และรองรับเอาต์พุตแบบ RGBA พร้อมพื้นหลังโปร่งใส เมทาดาทาของโมเดลนี้เปิดกว้างผิดปกติสำหรับโมเดลที่ใหม่ขนาดนี้: สัญญาอนุญาต MIT, diffusers และ safetensors แท็กไปป์ไลน์ text-to-image และแท็กที่ครอบคลุมการสร้างภาพ การออกแบบกราฟิก การเรนเดอร์ข้อความ และ RGBA

การตั้งค่าการอนุมานที่แนะนำนั้นเจาะจงเพียงพอที่จะมีประโยชน์:

• ความละเอียด — แนะนำ 2048 x 2048 หรือ 1024 x 1024 สำหรับการสร้างที่เร็วขึ้น

• ขั้นตอนการสุ่ม — 12

• CFG scale — 1.0

• ความแม่นยำ — BF16

• ฮาร์ดแวร์ — CUDA GPU หนึ่งตัวที่มี VRAM 80 GiB โดยอธิบายว่าเป็นคอนฟิกูเรชันที่ผ่านการตรวจสอบแล้ว

สิบสองขั้นตอนที่สเกลคำแนะนำ 1.0 เป็นลักษณะของตัวสุ่มตัวอย่างแบบกลั่นหรือไม่มีคำแนะนำ: ราคาถูกต่อภาพ ซึ่งเป็นเหตุผลที่การ์ดสามารถให้เอาต์พุต 2048 พิกเซลที่จำนวนขั้นตอนที่โมเดลดิฟฟิวชันส่วนใหญ่จะไม่พยายาม การ์ดยังระบุว่าโค้ดการอนุมานสาธารณะแมปคำขอความละเอียดข้อความเป็นภาพไปยังบัคเก็ต 1024 หรือ 2048 ที่รองรับ ดังนั้นขนาดกลางจะถูกปรับให้เป็นหนึ่งในสองขนาดนั้น

โครงสร้างไฟล์บอกข้อมูลได้มากกว่าตัวบทบรรยายเล็กน้อย ควบคู่ไปกับ vae และ scheduler ยังมีโฟลเดอร์ transformer ที่บรรจุไฟล์น้ำหนักห้าส่วน พร้อมด้วยองค์ประกอบแยกต่างหากอย่าง mllm, connector และ mlp — ซึ่งเผยให้เห็นรูปร่างของไปป์ไลน์หลายขั้นตอนที่ใช้โมเดลภาษามัลติโมดัลเป็นตัวเข้ารหัสข้อความ แทนที่จะเป็นตัวขจัดสัญญาณรบกวนแบบโมโนลิทิกเพียงตัวเดียว สอดคล้องกับหมายเหตุในการ์ดที่ว่าการเสริมพรอมป์ต์สามารถจัดการได้ด้วย Ling-3.0-flash-VL หรือ qwen3.8-27B ซึ่งเป็นโมเดลพี่น้องจากองค์กรเดียวกัน

คอมมิตทั้งสามที่ลงเมื่อวันที่ 22 กันยายน

นี่เป็นส่วนเดียวของเรื่องที่มีการประทับเวลาอยู่ในช่วงสัปดาห์ที่ผ่านมา และเป็นเหตุผลที่โมเดลนี้ควรค่าแก่การเขียนถึงตอนนี้มากกว่าในเดือนตุลาคม ชื่อคอมมิตตามลำดับ:

• 22 กันยายน 11:25 UTC — "เผยแพร่แพ็กเกจรีลีสของ Ming-Image-0.1-Design"

• 22 กันยายน 12:01 UTC — "รีเฟรชการ์ดโมเดล Ming-Image-0.1-Design"

• 22 กันยายน 15:17 UTC — "เพิ่มลิงก์การปรับใช้ vLLM-Omni"

สองรายการแรกเป็นงานธุรการทั่วไป ส่วนรายการที่สามคือการเปลี่ยนแปลงที่มีนัยสำคัญจริง ๆ: มีเฟรมเวิร์กที่ไม่ได้เป็นของผู้ขายเองนำโมเดลนี้ไปรองรับ และการ์ดตอนนี้แนะนำให้ให้บริการโมเดลนี้ผ่าน vLLM-Omni พร้อมลิงก์ไปยังสูตรการใช้งานและคู่มือการติดตั้ง นั่นคือสัญญาณมาตรฐานว่าโมเดลได้เปลี่ยนจาก "น้ำหนักที่วางอยู่บนชั้น" ไปเป็น "สิ่งที่ทีมสามารถตั้งระบบให้ทำงานอยู่เบื้องหลัง endpoint ได้จริง" และมันเป็นการเปลี่ยนแปลงประเภทที่ไม่เคยก่อให้เกิดข่าวประชาสัมพันธ์

มันก็ยังเป็นงานที่ยังไม่เสร็จสมบูรณ์เช่นกัน ลิงก์คู่มือการติดตั้งใช้งานได้ แต่เส้นทางสูตรเฉพาะโมเดลในคอมมิตเดียวกันกลับใช้ไม่ได้ — ณ วันที่ 23 กันยายน มันคืนค่าเป็น 404 ดังนั้นภาพรวมการดีพลอย Ming-Image-0.1-Design ในตอนนี้อ่านได้ว่า กรอบงานทั่วไปมีอยู่จริง แต่คำแนะนำสำหรับโมเดลนี้ภายในกรอบงานยังเป็นเพียงตัวยึดตำแหน่ง หากคุณวางแผนจะให้บริการโมเดลนี้ จงเผื่อเวลาไว้สำหรับอ่านคู่มือเริ่มต้นอย่างรวดเร็วของ vLLM-Omni และคิดหาการเชื่อมต่อโมเดลด้วยตัวคุณเอง

ลีดเดอร์บอร์ดในการ์ด และลีดเดอร์บอร์ดที่มันไม่ได้อยู่บน

ที่เก็บโค้ดนี้มาพร้อมกราฟิกประสิทธิภาพหนึ่งรายการ: assets/uiux_leaderboard.webp ซึ่งเป็นภาพในสไตล์ลีดเดอร์บอร์ด มีหัวข้อว่า "ลีดเดอร์บอร์ดการสร้างภาพจากข้อความ: การออกแบบ UI/UX" ส่วนท้ายมีข้อความว่า "คะแนน Elo จากการโหวตตามความชอบแบบไม่เปิดเผยตัวตนใน Image Arena ของเรา" และป้าย "ลีดเดอร์บอร์ด Open Weights" ในภาพ Ming-Image-0.1-Design อยู่อันดับหนึ่งที่ 1,082 Elo นำหน้า Ideogram 4.0 (Quality) ที่ 1,052, Ideogram 4.0 ที่ 1,015, HunyuanImage 3.0 Instruct ที่ 1,005 และตัวแปร FLUX.2 dev ที่มีคะแนนระหว่าง 994 ถึง 1,000

มีสามสิ่งที่ต้องพูดเกี่ยวกับภาพนั้น และลำดับมีความสำคัญ

ประการแรก มันเป็นงานศิลป์ที่ผู้จำหน่ายเผยแพร่เองภายในที่เก็บของผู้จำหน่ายเอง เรากำลังรายงานว่าไฟล์นั้นมีอะไรอยู่ ไม่ได้กำลังรับรองมัน

ประการที่สอง เราไม่พบ Ming-Image-0.1-Design ที่ใดเลยบนบอร์ดไลฟ์ของ Artificial Analysis เมื่อวันที่ 23 กันยายน — ไม่พบบนลีดเดอร์บอร์ด text-to-image ไม่พบในมุมมองหมวดหมู่ UI/UX Design ไม่พบบนบอร์ด image-editing และไม่พบในมุมมอง open-weights อันดับสูงสุดของหมวด UI/UX Design แบบไลฟ์คือ GPT Image 2.5 Flare ที่ 1,227 Elo และรายการ FLUX.2 ที่การ์ดระบุไว้ก็ปรากฏบนบอร์ดไลฟ์เดียวกันนั้นด้วยค่าที่แตกต่างออกไป: FLUX.2 [flex] ที่ 1,065, FLUX.2 [max] ที่ 1,053, FLUX.2 [dev] ที่ 1,000 ดังนั้นการจัดอันดับของการ์ดจึงเป็นข้อกล่าวอ้างเกี่ยวกับบอร์ดที่เราระบุตำแหน่งไม่พบ ซึ่งแสดงบนสเกลที่ต่ำกว่าสเกลที่เราพบได้ราว 150 Elo

ประการที่สาม Elo คำนวณแยกกันในแต่ละบอร์ด คะแนน UI/UX ที่เจาะจงตามหมวดหมู่กับคะแนน text-to-image ทั่วไปเป็นปริมาณที่ต่างกัน แม้จะเป็นโมเดลเดียวกันก็ตาม ซึ่งเป็นเหตุผลว่าทำไม FLUX.2 เวอร์ชันเดียวกันจึงปรากฏอยู่ที่ 1,026 บนบอร์ดหนึ่งของ Artificial Analysis และ 1,065 บนอีกบอร์ดหนึ่ง การเปรียบเทียบใดก็ตามที่นำบอร์ดต่าง ๆ มาปนกัน ไม่ถือว่าเป็นการเปรียบเทียบ

สถานะสุทธิ: Ming-Image-0.1-Design มีคำกล่าวอ้างด้านประสิทธิภาพเพียงข้อเดียว ซึ่งเป็นคำกล่าวอ้างของผู้ขายเอง และยังไม่มีการประเมินอย่างอิสระต่อคำกล่าวอ้างนั้น นั่นไม่ใช่การกล่าวหา นี่คือเหตุผลที่โมเดลนี้ต้องมีการรันจากภายนอก ก่อนที่ใครจะจัดงบประมาณโดยอิงกับ 1,082

สิ่งที่คุณยังทำกับมันไม่ได้

Quick Start คือปัญหา มันบอกให้คุณโคลน github.com/inclusionAI/Ming-Image ติดตั้ง requirements ของมัน แล้วรัน infer.py กับ model ID บน Hugging Face รีโพซิทอรีนั้นไม่มีอยู่จริง หน้าเว็บคืนค่า 404, README แบบ raw คืนค่า 404 และไม่มี Ming-Image รีโพซิทอรีปรากฏอยู่ที่ใดเลยในรายการรีโพซิทอรีสาธารณะขององค์กร — ซึ่งในรายการนั้นมี Ming, Ling, Ring, Ming-UniVision, Ming-UniAudio และอื่น ๆ อีกเป็นสิบ ดังนั้นนี่คือการไม่มีอยู่จริง ไม่ใช่ URL ที่พิมพ์ผิด เส้นทางเดียวที่ได้รับการบันทึกไว้สำหรับการรัน Ming-Image-0.1-Design คือเส้นทางเดียวที่ไม่มีอยู่ตรงนั้น

เรื่องการเข้าถึงส่วนที่เหลือก็บางเบาพอ ๆ กัน การ์ดตั้งค่า inference: false และ Hugging Face รายงานว่าไม่มีผู้ให้บริการ inference รายใดนำโมเดลนี้ไปใช้งาน ไม่มีราคาที่เผยแพร่ ไม่มีตัวระบุ API ไม่มี playground และไม่มีข้อกำหนดทางการค้าใด ๆ นอกเหนือจากสัญญาอนุญาต MIT ที่แนบมากับไฟล์เวตส์เอง จำนวนการดาวน์โหลดเป็นศูนย์ และจำนวนไลก์เป็นสี่

ดังนั้น สรุปอย่างตรงไปตรงมาเกี่ยวกับความพร้อมใช้งานก็คือ: ตัวเวตนั้นมีอยู่จริงและมีสัญญาอนุญาตแบบเปิดกว้าง และทุกสิ่งรอบๆ ตัวมัน — โค้ด เอกสาร การโฮสต์ การประเมินผล — ล้วนขาดหายไปหรือเป็นเพียงโครงร่างเท่านั้น

ตัวเลขที่กำหนดว่าใครสามารถใช้ได้

VRAM 80 กิกะไบต์คือประเด็นทั้งหมด นั่นคือการ์ดระดับ H100 หรือ H200 หนึ่งใบ หรือ A100 80GB ไม่ใช่ GPU สำหรับเวิร์กสเตชัน ไม่ใช่แล็ปท็อป และไม่ใช่สปอตอินสแตนซ์ที่คุณลืมปิดทิ้ง เมื่อรวมกับการกำหนดค่าแบบใช้ GPU เดียวที่ผ่านการตรวจสอบแล้ว มันหมายความว่า Ming-Image-0.1-Design ไม่มีค่าใช้จ่ายด้านสิทธิ์การใช้งานแต่มีค่าใช้จ่ายสูงในการรัน ซึ่งเป็นรูปแบบที่คุ้นเคยของการเปิดตัวแบบ open-weights จากแล็บที่ฝึกโมเดลในระดับสเกลใหญ่

เพื่อความครบถ้วนในส่วนของเราเอง: ไม่มีโมเดลของ inclusionAI ใดที่สามารถจัดเส้นทางผ่าน OrcaRouter ได้ในปัจจุบัน หน้าแคตตาล็อกแสดง 199 โมเดลจากผู้ให้บริการ 15 รายเมื่อเราอ่านมันในวันที่ 23 กันยายน และไม่มีรายการ Ming และไม่มีรายการ inclusionAI ใด ๆ เลย ดังนั้นจึงไม่มีอะไรให้เรียกผ่านเราได้ สิ่งที่เลเยอร์การจัดเส้นทางมีค่าจริง ๆ ในสถานการณ์นี้คือขั้นตอนที่สอง — วันที่ผู้ให้บริการต้นทางนำโมเดลนี้ไปใช้ การลองใช้จะกลายเป็นการเปลี่ยน model-ID บนคีย์ที่คุณมีอยู่แล้วแทนที่จะเป็นสัญญาใหม่และ SDK ใหม่ จนกว่าจะถึงตอนนั้น วิธีเดียวที่จะรัน Ming-Image-0.1-Design ได้คือการค้นหา repository ที่หายไปและ GPU ที่มีพื้นที่ว่าง 80 GiB

The UI/UX Design leaderboard image published in the Ming-Image-0.1-Design repository. It is headed 'Text to Image Leaderboard: UI/UX Design' with the footer 'Elo scores from blind preference votes in our Image Arena' and an 'Open Weights Leaderboard' badge. Ming-Image-0.1-Design is listed first at 1,082 Elo, above Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005, FLUX.2 [dev] at 1,000, FLUX.2 [dev] Flash at 999, FLUX.2 [dev] Turbo at 994 and HiDream-O1-Image at 987.The commit history page of the Ming-Image-0.1-Design repository on Hugging Face, captured 23 September 2026, showing five commits: 'Add vLLM-Omni deployment links' and 'Refresh Ming-Image-0.1-Design model card' and 'Publish Ming-Image-0.1-Design release package' all dated 22 September, above 'Upload initial model' and 'initial commit' dated 17 September.

อะไรจะทำให้สิ่งนี้กลายเป็นเรื่องราว

สี่สิ่ง เรียงตามลำดับจากน้อยไปมากในแง่ของข้อมูลที่แต่ละอย่างจะบอกคุณได้ การปรากฏขึ้นของรีโพซิทอรีคู่กัน ซึ่งจะทำให้โมเดลรันได้ตามที่เอกสารระบุ การมีสูตร vLLM-Omni ครบถ้วน ซึ่งจะทำให้ให้บริการได้โดยไม่ต้องเดา การที่ผู้ให้บริการ inference รายหนึ่งลงรายการโมเดลนี้ ซึ่งจะกำหนดราคาให้มัน และ Elo อิสระ ซึ่งจะเป็นตัวเลขแรกเกี่ยวกับโมเดลนี้ที่ไม่ได้มาจากคนที่ฝึกมัน

จนกว่าอย่างน้อยหนึ่งในนั้นจะเกิดขึ้นจริง จุดยืนที่ถูกต้องคือแคบและไม่หวือหวา หากคุณสร้างชุดประเมินสำหรับการสร้าง UI และเลย์เอาต์ น้ำหนักโมเดลนี้คุ้มค่าที่จะดึงมาตอนนี้ — MIT, 6B, คอนฟิกเดียว และจำนวนสเต็ปต่ำพอที่จะทำให้การสุ่มตัวอย่างไม่กี่พันตัวอย่างจ่ายไหว หากคุณต้องการสร้างภาพในงานโปรดักชันไตรมาสนี้ Ming-Image-0.1-Design ไม่ใช่ตัวเลือก: ไม่มีเอนด์พอยต์ ไม่มีการสนับสนุน และไม่มีคะแนนจากบุคคลที่สาม และหากคุณกำลังติดตามองค์กร inclusionAI ให้สังเกตว่าตอนนี้มันมีโมเดลภาพไว้คู่กับสายภาษาและเสียงแล้ว, ว่ามันเปิดตัวโมเดลนี้โดยไม่บอกใคร, และช่องว่างสองสัปดาห์ระหว่างการอัปโหลดครั้งแรกกับแพ็กเกจรีลีส บ่งชี้ว่าช่วงเงียบนั้นเป็นเจตนา

The Artificial Analysis text-to-image leaderboard's UI/UX Design category view, captured 23 September 2026, showing GPT Image 2.5 Flare (max) first at 1,227 Elo with 1,287 samples and $210.7 per 1,000 images, GPT Image 2.5 Sunburst (max) second at 1,218, GPT Image 2 (high) third at 1,206, and Grok Imagine Image 2.0 fourth at 1,182. No Ming-Image-0.1-Design row appears anywhere on the board.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube