
GPT-Image-2.5 ปะทะ LLaDA-Image: API ราคา $30 ต่อล้านโทเค็น เทียบกับโมเดล Diffusion ฟรีขนาด 6B
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0455ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0247ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0247ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0157ความฉลาด82การเขียนโค้ด
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2646ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1849ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1541ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1251ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0547ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0347ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2140ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128ความฉลาด49การเขียนโค้ด
ถามว่าการสร้างภาพควรมีต้นทุนเท่าไร และสองแล็บก็สร้างคำตอบที่ตรงข้ามกันโดยสิ้นเชิงภายในห่างกันแค่หนึ่งสัปดาห์ เมื่อวันที่ 8 กันยายน 2026 OpenAI เปิดตัว GPT-Image-2.5 — โมเดลที่อยู่เบื้องหลัง ChatGPT Images 2.5 จำหน่ายผ่าน API ในชื่อ GPT-Image-2.5 Flare และ GPT-Image-2.5 Sunburst — ตั้งราคาบนการ์ดโทเคนที่ $8 ต่อล้านโทเคนอินพุตรูปภาพ และ $30 ต่อล้านโทเคนเอาต์พุตรูปภาพ ห้าวันก่อนหน้านั้น ในวันที่ 4 กันยายน inclusionAI (แล็บที่ได้รับการสนับสนุนจาก Ant Group ซึ่งอยู่เบื้องหลังตระกูลภาษา LLaDA) ปล่อย LLaDA-Image อย่างเงียบ ๆ ซึ่งเป็นเจเนอเรเตอร์และตัวแก้ไขภาพแบบ diffusion-transformer ขนาดหกพันล้านพารามิเตอร์ ที่สามารถดาวน์โหลดน้ำหนักได้ฟรี หนึ่งคือโมเดลภาพที่มีศักยภาพเชิงพาณิชย์มากที่สุดที่ OpenAI เคยวางไว้เบื้องหลังเครื่องนับโทเคน อีกอันคือความพยายามที่จะพิสูจน์ว่าโมเดลภาพที่แข็งแกร่งสามารถสร้างขึ้นได้ด้วยสูตรการฝึกแบบเปิดและแจกจ่ายให้เปล่า การเปรียบเทียบทั้งสองไม่ใช่การชกตัวต่อตัว แต่เป็นการตัดสินใจว่าคุณกำลังจ่ายเงินตามนิยามของต้นทุนแบบใด
แทบทุกตัวเลขของฝั่ง GPT-Image-2.5 เป็นตัวเลขที่รายงานโดยผู้ผลิต และยังไม่มีตัวใดผ่านการตรวจสอบอย่างเป็นอิสระเลย: OpenAI กล่าวว่า Flare ช่วยลดความหน่วงได้สูงสุดถึง 50% เมื่อเทียบกับ GPT-Image-2 และการทดสอบจากบุคคลที่สามโดยบริษัทเอเจนต์ Manus วัดผลว่าสร้างภาพได้เร็วขึ้น 2–4 เท่า แต่ ณ วันที่ 9 กันยายน 2026 โมเดล GPT-Image-2.5 ทั้งคู่ยังไม่มีรายชื่อในกระดานอันดับภาพของ Artificial Analysis ตัวเลขหลักของ LLaDA-Image ก็ไม่ได้รับการยืนยันซ้ำเช่นกัน — inclusionAI รายงานคะแนน 53.53 ภาษาอังกฤษ / 53.38 ภาษาจีน บน Qwen-Image-Bench ซึ่งเป็นอันดับหนึ่งในบรรดาโมเดลโอเพนเวต ณ ตอนเปิดตัว — และเนื่องจากโมเดลนี้ไม่มี hosted API จึงไม่สามารถปรากฏในกระดานอันดับที่รองรับเฉพาะ API ได้เลย ทั้งสองฝ่ายของการเปรียบเทียบนี้ล้วนพึ่งพาคำกล่าวอ้างของผู้ผลิตมาเอง ซึ่งสมควรจดจำเอาไว้ชั่วระยะที่เหลือของบทความ
สองโมเดลที่แทบจะไม่มีหมวดหมู่ร่วมกัน
GPT-Image-2.5 เป็นโมเดลภาพแบบโฮสต์และปิด (closed model) ในสายเลือดเดียวกับ ChatGPT Images 2.0 จากเดือนเมษายน 2026 โดยเป็นโมเดลแบบมัลติโหมดในฝั่งอินพุต และสร้างภาพที่ OpenAI อ้างว่ามีความคมชัดในรายละเอียดเล็กน้อย เป็นธรรมชาติมากขึ้นในแสงและพื้นผิว และคงเส้นคงวาในการแก้ไขหลายรอบ — เอ็นด์พอยต์ Sunburst มีไว้สำหรับงานโปรดักชันที่เน้นการแก้ไขเป็นหลัก ซึ่งการสร้างที่ช้าลงเป็นที่ยอมรับได้เพื่อแลกกับการควบคุมคำสั่งที่แม่นยำยิ่งขึ้น ขณะที่ Flare เป็นค่าเริ่มต้นที่เร็วสำหรับการสร้างปริมาณมาก ผลลัพธ์มีขนาดสูงสุด 2048×2048 และ 3840×2160 รองรับพื้นหลังโปร่งใส และทุกผลลัพธ์มีข้อมูลเมตาประวัติที่มา C2PA พร้อมลายน้ำที่มองไม่เห็น
LLaDA-Image คือการเปิดเผยผลงานแบบโอเพนซอร์สในรูปแบบงานวิจัยที่สร้างขึ้นบนแนวคิดที่ต่างออกไปโดยสิ้นเชิง ในขณะที่ GPT-Image-2.5 ให้บริการผ่านโครงสร้างพื้นฐานของ OpenAI นั้น LLaDA-Image คือชุดน้ำหนักที่คุณนำไปรันด้วยตัวเอง: ทรานส์ฟอร์มเมอร์แบบดิฟฟิวชัน (DiT) ขนาด 6 พันล้านพารามิเตอร์ในฝั่งเจเนอเรชัน — การ์ดโมเดลระบุว่ามีพารามิเตอร์ประมาณ 7 พันล้านเมื่อนับรวมฝั่งภาษาแล้ว — จับคู่กับ LLaDA 2.0-mini ซึ่งเป็นโมเดลภาษาดิฟฟิวชันแบบ mixture-of-experts ที่มีพารามิเตอร์รวม 16B และใช้งานจริง 1B ในฐานะฝั่ง “ความเข้าใจ” ที่แปลงพรอมป์ข้อความหรือคำสั่งแก้ไขให้เป็นสัญญาณที่ DiT ปฏิบัติตาม ข้ออ้างที่ผิดปกติในรายงาน arXiv (2609.03796) คือสูตรการฝึก: มากกว่า 90% ของตัวอย่างประมาณ 220 ล้านตัวอย่างสะสมระหว่างการฝึกก่อน (pre-training) และการฝึกกลาง (mid-training) เป็นภาพล้วน โดยใช้โมเดลวิทัศน์-ภาษาที่แช่แข็ง (frozen vision-language model) สกัดความหมายจากภาพที่ไม่มีป้ายกำกับเป็นสัญญาณปรับเงื่อนไขตนเอง (self-conditioning) ทำให้โมเดล “เรียนรู้ที่จะวาดก่อน แล้วจึงเชื่อฟัง” ความละเอียดแบบโปรเกรสซีฟจะพาการฝึกจาก 256×256 ผ่าน 512×512 ไปจนถึงการปรับละเอียดที่ 1024×1024 ตามด้วยการฝึกแบบผสมระหว่าง text-to-image และการแก้ไขภาพ และการกลั่นหลายขั้นตอนด้วย TwinFlow ซึ่งให้กำเนิดตัวแปร LLaDA-Image-Turbo
แต่ละอย่างเก่งอะไรจริงๆ
จุดขายของ GPT-Image-2.5 คือความแม่นยำและการควบคุมในระดับคุณภาพเชิงพาณิชย์ การประกาศของ OpenAI เน้นย้ำถึงความเที่ยงตรงต่อต้นฉบับ (reference fidelity) — การรักษาให้บุคคล สัตว์เลี้ยง หรือผลิตภัณฑ์ยังคงเป็นที่จดจำได้เมื่อเปลี่ยนฉากหรือสไตล์ — และการแก้ไขที่เปลี่ยนแปลงเฉพาะสิ่งที่ผู้ใช้ขอให้เปลี่ยนเท่านั้น ซึ่งคงอยู่ได้ตลอดการแก้ไขหลายรอบในการสนทนาเดียวกัน การแสดงข้อความภายในภาพถูกกล่าวถึงเป็นพิเศษ รวมถึงการกำจัดตัวอักษรจีนที่เพี้ยนซึ่งเป็นปัญหาของโมเดลสร้างภาพรุ่นก่อนหน้า สิ่งเหล่านี้คือความสามารถที่ทีมผลิตภัณฑ์ แบรนด์ หรือทีมโฆษณาต้องพึ่งพาซ้ำแล้วซ้ำเล่า
จุดขายของ LLaDA-Image คือชุดน้ำหนักชุดเดียวที่ทำการสร้างแบบสองภาษาและการแก้ไขตามคำสั่งด้วยสูตรเปิด inclusionAI รายงานการเรนเดอร์ข้อความภาษาจีนและอังกฤษแบบเนทีฟ เส้นทางแก้ไขที่แทรกภาพอ้างอิงผ่านการออกแบบแบบสองเส้นทางเพื่อคงเนื้อหาที่ไม่ถูกแก้ไขไว้ และ—บน Qwen-Image-Bench—คะแนนสูงสุดในบรรดาโมเดลโอเพนเวต ณ ตอนเปิดตัว ข้อจำกัดที่เปิดเผยอย่างตรงไปตรงมาจากการเปิดตัวคือคุณภาพการแก้ไขเชิงการรับรู้ยังตามหลังตัวแก้ไขเฉพาะทาง และการนับจำนวนวัตถุยังคงอ่อนแอ มันคือโมเดลโอเพนเอนกประสงค์ ไม่ใช่ผลิตภัณฑ์เชิงพาณิชย์ที่เสร็จสมบูรณ์

กระดานคะแนนนี้จงใจไม่ให้เป็นการแข่งขันด้านคุณภาพของภาพ — โมเดลทั้งสองไม่เคยถูกประเมินด้วยเกณฑ์ชุดเดียวกัน สิ่งที่มันแสดงให้เห็นคือเงินและการควบคุมไหลไปในทิศทางใด
ราคาของภาพหนึ่งภาพคือตัวเลขที่ไม่มีฝ่ายใดจะให้คุณ
OpenAI เผยแพร่อัตราค่า token สำหรับ GPT-Image-2.5 ซึ่งเหมือนกับ GPT-Image-2: 8 ดอลลาร์ต่อ token ภาพขาเข้าหนึ่งล้าน token, 30 ดอลลาร์ต่อ token ภาพขาออกหนึ่งล้าน token, token ภาพขาเข้าแบบแคชที่ 2 ดอลลาร์ และ token ข้อความคิดค่าบริการแยกต่างหากที่ 5 ดอลลาร์ต่อหนึ่งล้าน token สิ่งที่ OpenAI ไม่ได้เผยแพร่คือจำนวน token ที่รูปภาพหนึ่งรูปใช้ไป ซึ่งหมายความว่าไม่มีราคาต่อรูปอย่างเป็นทางการและไม่มีเครื่องคำนวณต้นทุน ตามราคาที่ AA ระบุไว้สำหรับรุ่นก่อนหน้าในลีดเดอร์บอร์ด — ประมาณ 211 ดอลลาร์ต่อ 1,000 ภาพสำหรับ GPT Image 2 ที่คุณภาพ "สูง" — เรือธงที่คิดค่าใช้จ่ายตาม token เป็นเครื่องมือที่แพงเมื่อใช้งานในปริมาณมาก แต่ตัวเลขดังกล่าวเป็นของ GPT-Image-2 ไม่ใช่ 2.5 และต้นทุนต่อภาพสำหรับโมเดลใหม่นั้นไม่เป็นที่รู้จักอย่างแท้จริงนอกเหนือจาก OpenAI
LLaDA-Image มีปัญหาตรงกันข้ามเกี่ยวกับความซื่อสัตย์ น้ำหนักของโมเดลไม่มีค่าใช้จ่าย และการ์ดโมเดลระบุใบอนุญาต Apache-2.0 แต่ราคาที่แท้จริงอยู่ที่โครงสร้างพื้นฐาน: diffusion transformer ขนาด 6B ต้องใช้ GPU ที่มีประสิทธิภาพสูงสำหรับ Base variant แบบ 50 ขั้นตอน และ FP8 checkpoints (ประมาณ 49 GB ในรูปแบบ diffusers) เป็นทางเลือกที่ปฏิบัติได้จริงสำหรับผู้ใช้ส่วนใหญ่ การกลั่นแบบ 2–4 ขั้นตอนของ LLaDA-Image-Turbo คือการยอมรับความเป็นจริงนั้น เครื่องมือของชุมชนก้าวหน้าเร็ว — pull request ของ SGLang เพิ่มการรองรับ text-to-image, การแก้ไขภาพ, sequence-parallel และ FP8 และแพ็กเกจโหนด ComfyUI ของ RebelAI รองรับการอนุมานในเครื่องแบบ INT8 และ GGUF-quantized — แต่ "โมเดลฟรี" ยังหมายถึง "คุณคือผู้ให้บริการโฮสต์" สำหรับทีมที่รันความจุ GPU อยู่แล้ว ต้นทุนส่วนเพิ่มของ LLaDA-Image เข้าใกล้ศูนย์ สำหรับคนอื่น ๆ ต้นทุนโดยรวมในการให้บริการอาจสูงกว่าค่าใช้จ่าย API แบบคิดตามการใช้งาน เมื่อคุณรวมเวลาทางวิศวกรรมด้วย
เส้นทางที่ซื่อสัตย์หากคุณต้องการทั้งสอง
สำหรับทีมส่วนใหญ่ สิ่งเหล่านี้ไม่ใช่ทางเลือกแบบใดแบบหนึ่ง ไปป์ไลน์การผลิตสามารถใช้ API แบบโฮสต์อย่าง GPT-Image-2.5 สำหรับงานที่ติดต่อกับลูกค้าโดยตรง งานที่ต้องแก้ไขหนัก และงานที่ห้ามพลาด ขณะเดียวกันก็เก็บโมเดลเปิดอย่าง LLaDA-Image ไว้สำหรับการทดลอง งานแบตช์แบบออฟไลน์ และอะไรก็ตามที่ไม่สามารถส่งพรอมป์ต์ให้บุคคลที่สามได้ การแบ่งแบบนี้คือรูปแบบของปัญหาที่เลเยอร์การจัดเส้นทางถูกสร้างขึ้นมาเพื่อจัดการ — API หนึ่งเดียวที่เข้าถึงโมเดลแบบโฮสต์ที่คุณใช้จริง ราคารายการของพรอไวเดอร์ส่งผ่านไปโดยไม่มีมาร์กอัป การลองใช้โมเดลโอเพนเวตผ่านเส้นทางแบบโฮสต์ในภายหลังจึงมีค่าใช้จ่ายเท่ากับการไปที่พรอไวเดอร์โดยตรง ไม่มีโมเดลใดอยู่ในแคตตาล็อกของ OrcaRouter ณ วันที่ 9 กันยายน 2026: GPT-Image-2.5 เป็นแบบ OpenAI-API เท่านั้นในตอนนี้ (รุ่นก่อนหน้า GPT-Image-2 ถูกจัดเส้นทางแล้ว) และ LLaDA-Image เป็นแบบเวตเท่านั้นโดยไม่มีการอนุมานแบบโฮสต์ เจตนารมณ์ของการออกแบบยังคงอยู่ ไม่ว่าแคตตาล็อกในวันนี้จะเป็นอย่างไร

คุณควรสร้างบนอันไหน?
หากงานของคุณคือการสร้างภาพเชิงพาณิชย์ที่การแก้ไขที่ล้มเหลวอาจทำลายความสัมพันธ์กับลูกค้า — ภาพถ่ายผลิตภัณฑ์ งานครีเอทีฟแคมเปญ ภาพที่อ้างอิงสอดคล้องกัน เซสชันการแก้ไขแบบหลายรอบยาว — {{1}}GPT-Image-2.5{{/1}} คือโมเดลที่ออกแบบมาเพื่องานนั้นโดยเฉพาะ และ Sunburst endpoint คือเหตุผลที่ควรจับตามองแม้ยังไม่มีคะแนนประเมินจากหน่วยงานอิสระ ความเสี่ยงคือความไม่โปร่งใสของราคาต่อภาพ และความจริงที่ว่าคำกล่าวอ้างด้านคุณภาพทั้งหมดเป็นของ OpenAI เอง หากงานของคุณคืองานวิจัย การทดลองปริมาณมาก การสร้างภาพสองภาษาจีน-อังกฤษ หรือสิ่งใดก็ตามที่ต้องรันในสภาพแวดล้อมของคุณเองหรือบนข้อมูลของคุณเอง {{2}}LLaDA-Image{{/2}} คือการเปิดตัวที่น่าสนใจกว่า — น้ำหนักโมเดลโอเพนอย่างแท้จริงพร้อมสูตรที่ตีพิมพ์ แลกมาด้วยการเป็นโครงสร้างพื้นฐานของคุณเองและอยู่กับคะแนนที่ไม่ได้รับการยืนยันซ้ำ โมเดลทั้งสองเปิดตัวห่างกันหนึ่งสัปดาห์และห่างกันคนละโลกในแง่โมเดลการดำเนินงาน ทางเลือกที่ถูกต้องคือโมเดลที่ตรงกับต้นทุนที่คุณสามารถจ่ายได้จริง

