
Ideogram 4.5 vs GPT Image 2.5: Ideogram เป็นฝ่ายเปิดศึกครั้งนี้เอง
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 261 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
การเปรียบเทียบโมเดลส่วนใหญ่ถูกรวบรวมขึ้นโดยคนที่เขียนมันเอง แต่ชิ้นนี้ถูกรวบรวมโดย Ideogram หน้าเปิดตัวของ Ideogram 4.5 ซึ่งเปิดให้ใช้งานมาตั้งแต่วันที่ 30 กันยายน 2026 มีเดโมการแก้ไขแบบวางเทียบกันข้าง ๆ พร้อมระบุชื่อคู่แข่งไว้ในคำบรรยายว่า "การแก้ไขชุดเดียวกันบน Ideogram 4.5 เทียบกับ GPT Image 2.5 Sunburst, Nano Banana Pro และ Nano Banana 2" จากนั้นจึงตั้งข้อกล่าวอ้างถึงสิ่งที่ผู้ชมจะได้เห็น — "ผลลัพธ์จาก GPT Image และ Nano Banana จะใช้ไม่ได้ภายในไม่กี่ครั้งที่แก้ไข ขณะที่ Ideogram 4.5 ยังคงความสะอาดหมดจดครั้งแล้วครั้งเล่า"
นั่นตรงไปตรงมาผิดปกติ การที่ผู้ขายรายหนึ่งเลือกเป้าหมายของเบนช์มาร์กเองแล้วบอกผลลัพธ์ให้คุณล่วงหน้า ถือว่าน่าจริงจังในแง่หนึ่ง และน่าสงสัยในอีกแง่หนึ่ง GPT Image 2.5เป็นสิ่งที่แข็งแกร่งที่สุดบนกระดานจัดอันดับอิสระในหมวดหมู่ภาพทั้งสองหมวด ดังนั้นจึงเป็นคู่ต่อสู้ที่เลือกได้อย่างถูกต้อง และมันเป็นการเปิดตัวแบบสองรหัส — Flare และ Sunburst ทั้งคู่เปิดตัวเมื่อวันที่ 8 กันยายน 2026 — ด้วยคะแนนจากอารีน่าสาธารณะที่ Ideogram 4.5 ยังไม่สามารถเทียบได้ในตอนนี้ คำถามที่น่าสนใจไม่ใช่ว่าใครจะชนะอารีน่า แต่เป็นว่าข้อกล่าวอ้างของ Ideogram กำลังวัดสิ่งที่อารีน่าไม่ได้วัดอยู่หรือไม่
จุดยืนของทั้งสองโมเดลเป็นอย่างไรกันแน่
• Ideogram 4.5 — เปิดตัวเมื่อวันที่ 30 กันยายน 2026 โมเดลแก้ไขแบบแม่นยำ; สร้างและแก้ไขด้วยความเร็วในการเรนเดอร์สี่ระดับ; 2K แบบเนทีฟ; การแก้ไขที่สาธิตที่ความละเอียดต้นฉบับสูงสุดถึง 4,016 × 6,016 (24.2 MP) การสร้างภาพจากข้อความอยู่อันดับที่ 34 จาก 167 ที่ 1,014 ± 11 Elo (2,247 โหวต); การแก้ไขภาพอยู่อันดับที่ 23 ที่ 1,064 ± 11 Elo (2,382 โหวต) $0.03–$0.22 ต่อภาพ ตามการตั้งค่าความเร็ว
• GPT Image 2.5 Sunburst — เปิดตัวเมื่อวันที่ 8 กันยายน 2026 ในฐานะครึ่งแรกที่เน้นความแม่นยำของการอัปเกรดภาพแบบแยกของ OpenAI, ตัวระบุ API gpt-image-2.5-sunburst. ข้อความเป็นภาพ อันดับ 1 ที่ 1,197 ± 9 Elo (14,023 โหวต); การแก้ไขภาพ อันดับ 1 ที่ 1,182 ± 8 Elo (17,899 โหวต). ราคา $210.70 ต่อ 1,000 ภาพ ตามการแปลงของบอร์ด.
• GPT Image 2.5 Flare — ครึ่งที่เร็วของการเปิดตัวเดียวกัน ตัวระบุ gpt-image-2.5-flare. อันดับ 2 บนทั้งสองบอร์ด: 1,190 ข้อความเป็นภาพ, 1,162 การแก้ไข ราคาเดียวกันที่ $210.70 ต่อ 1,000
เมื่อนำตัวเลขการแก้ไขทั้งสองมาวางเทียบกัน และช่องว่างคือ 118 Elo — 1,182 เทียบกับ 1,064 — โดยมีช่วงความเชื่อมั่นที่ ±8 และ ±11 ช่วงเหล่านี้ไม่ทับซ้อนกัน บนกระดานที่วัดความชอบในการแก้ไขแบบครั้งเดียว Sunburst ชนะ และชนะโดยมีจำนวนโหวตสนับสนุนอยู่เบื้องหลังคิดเป็นราวเจ็ดเท่าครึ่ง
สิ่งที่ลีดเดอร์บอร์ดกำลังวัดและไม่ได้วัด
นี่คือส่วนที่ตัดสินว่าข้อกล่าวอ้างของ Ideogram จะยืนหยัดได้หรือไม่เมื่อเผชิญกับหลักฐาน
สนามประลองการแก้ไขของ Artificial Analysis คือการให้มนุษย์เปรียบเทียบความชอบแบบไม่เห็นข้อมูลระบุตัวตนเป็นรายคู่ (blind pairwise): ผู้ลงคะแนนเห็นภาพต้นฉบับเดียวกันและคำสั่งเดียวกัน ได้รับผลลัพธ์ที่แก้ไขแล้วสองชิ้นโดยไม่มีป้ายกำกับ แล้วเลือกอันที่ดีกว่า นี่เป็นวิธีที่ทรงพลังสำหรับคำถามที่ว่า “ผลลัพธ์สองอันนี้ อันไหนดูตรงกับสิ่งที่คำสั่งต้องการมากกว่ากัน”
มันไม่สามารถวัดสิ่งที่ Ideogram กำลังโฆษณาได้ ผู้ลงคะแนนที่ตัดสินการแก้ไขเพียงครั้งเดียวไม่สามารถมองเห็นได้ว่าโมเดลแอบเปลี่ยนวอลเปเปอร์ ขยับใบหน้าไปสองมิลลิเมตร หรือเรนเดอร์เกรนใหม่ทั่วส่วนที่เหลือของเฟรมหรือไม่ ความล้มเหลวที่ Ideogram อ้างว่าจะแก้ไขจะปรากฏให้เห็นก็ต่อเมื่อดูต่อเนื่องกันหลายเทิร์น — เทิร์นที่สี่ เทิร์นที่เจ็ด เทิร์นที่สิบ — และไม่มีอารีนากระแสหลักใดนำเสนอลำดับให้ผู้ลงคะแนนตัดสิน คะแนน Elo 1,064 บอกว่าการแก้ไขแต่ละครั้งของ Ideogram นั้นดี แต่ไม่ได้บอกอะไรเลยว่าการแก้ไขเหล่านั้นยังคงดีอยู่หรือไม่
เรื่องนี้ตัดได้ทั้งสองทางสำหรับ Ideogram และเวอร์ชันที่ตรงไปตรงมาคือแบบนี้: ลีดเดอร์บอร์ดไม่ได้ยืนยันข้อกล่าวอ้างเรื่องการดริฟต์ และก็ไม่ได้หักล้างมันเช่นกัน สิ่งที่มันหักล้างคือข้อกล่าวอ้างที่แรงกว่าโดยนัยซึ่งผู้อ่านอาจรับมาจากหน้าเปิดตัว — ว่า 4.5 คือตัวแก้ไขที่ดีกว่า จบเรื่อง เมื่อเทียบกับบอร์ด มันเป็นตัวแก้ไขที่อันดับต่ำกว่า ด้วยส่วนต่างที่กว้างกว่าช่วงความคลาดเคลื่อนของมัน

สิ่งที่แต่ละอันทำได้ที่อีกอันทำไม่ได้
• การแก้ไขที่ความละเอียดระดับต้นฉบับ — คำกล่าวอ้างเชิงวิศวกรรมที่ทำให้ Ideogram 4.5 โดดเด่น หน้าเพจของ Ideogram 4.5 แสดงการแก้ไขที่นำไปใช้กับต้นฉบับขนาด 4,016 × 6,016 โดยไม่มีการดาวน์สเกล พร้อมคำสัญญาว่าขอบเขตการแก้ไขจะถูกรักษาไว้ดีพอที่จะต่อส่วนที่ครอบตัดกลับเข้าไปในต้นฉบับได้ สำหรับงานพิมพ์ นั่นคือความแตกต่างระหว่างงานที่ส่งมอบได้กับงานที่ต้องประนีประนอม
• ความกว้างของชุดพารามิเตอร์ — ของ GPT Image 2.5 โดย OpenAI ได้เพิ่ม xhigh และ max เข้าไปในบันไดระดับคุณภาพ และทำให้พื้นหลังโปร่งใสกลายเป็นพารามิเตอร์ชั้นหนึ่ง โดยตั้งค่า background เป็น transparent, opaque หรือ auto และเอาต์พุตเป็น PNG หรือ WebP เอาต์พุตแบบโปร่งใสเคยเป็นช่องว่างของ GPT Image 2 และกลายเป็นฟีเจอร์เด่นของคู่รุ่น 2.5
• เลนด่วน — Flare ถูกสร้างขึ้นโดยเฉพาะเพื่อเป็นค่าเริ่มต้นที่รวดเร็ว OpenAI อ้างว่ามีความหน่วงต่ำกว่ารุ่นก่อนหน้าถึง 50% ส่วน Sunburst นั้นตั้งใจให้ช้ากว่าและมุ่งเป้าไปที่การแก้ไขที่ต้องผ่านการตรวจสอบอย่างเข้มงวด
• โครงสร้างราคา — Ideogram คิดค่าบริการต่อภาพตามความเร็วในการเรนเดอร์ ($0.03 ถึง $0.22) ส่วน OpenAI คิดค่าบริการตามโทเคนโดยใช้อัตราเดียวกันกับ GPT Image 2 — 8 ดอลลาร์ต่อโทเคนอินพุตรูปภาพ 1 ล้านโทเคน และ 30 ดอลลาร์ต่อโทเคนเอาต์พุตรูปภาพ 1 ล้านโทเคน — ด้วยเหตุนี้การแปลงเป็นราคาต่อภาพแบบอิสระจึงอยู่ที่ประมาณ $0.21 สำหรับภาพคุณภาพสูงขนาด 1024 × 1024
เส้นราคาตัดกันในจุดที่ชวนอึดอัด ที่การตั้งค่า Low และ Medium ของ Ideogram 4.5 ราคาต่อภาพถูกกว่าคู่ของ OpenAI อย่างมาก ที่ระดับ High — ซึ่งเป็นจุดที่มีการสาธิตเรื่อง drift และเป็นจุดที่คุณจะรันซอร์สขนาด 24 เมกะพิกเซล — ทั้งสองมีตัวเลขใกล้เคียงกัน การเปรียบเทียบที่ผู้ซื้อส่วนใหญ่จะรันจริงคือ Ideogram 4.5 คุณภาพ High เทียบกับ Sunburst คุณภาพสูง และในการเปรียบเทียบนั้น ราคาแทบจะเสมอกัน โดยมีคะแนน Elo ขาดไป 118 คะแนนบนบอร์ดที่วัดผล
ซึ่งก็โอเค ถ้าข้ออ้างเรื่องดริฟต์เป็นจริง นั่นคือเดิมพันทั้งหมด


ความแตกต่างด้านการเข้าถึงที่ไม่มีใครโปรโมต
ความไม่สมดุลในทางปฏิบัติประการหนึ่งวิ่งสวนทางกับกระดานคะแนน ตัวระบุทั้งสองของ GPT Image 2.5 นั้นใหม่กว่าทุกสิ่งในแคตตาล็อกของ OrcaRouter — สายผลิตภัณฑ์ภาพ OpenAI ของเราในวันนี้คือ GPT-Image-1.5 ที่ $8/$32 ต่อล้านโทเคน และ GPT-Image-2 ที่ $8/$30 ทั้งคู่ในราคาตามที่ผู้ให้บริการระบุโดยไม่บวกเพิ่มใด ๆ คู่ 2.5 มาถึงบนตารางราคาของ OpenAI ที่ $8/$30 เท่ากับ GPT-Image-2 ซึ่งหมายความว่าทันทีที่สามารถจัดเส้นทางได้ พวกมันจะลงเอยที่ราคาส่งผ่านเดิมแทนที่จะเป็นราคาใหม่ และคำถามเรื่องต้นทุนระหว่างทั้งสองจึงกลายเป็นเรื่องประสิทธิภาพของโทเคน มากกว่าว่าคุณจะเรียกใช้ผู้ให้บริการรายใด
Ideogram 4.5 อยู่บน API ของ Ideogram เองและบนแพลตฟอร์มพาร์ตเนอร์ แต่ไม่ได้อยู่ในแคตตาล็อกของเรา เรื่องนี้สำคัญต่อการเปรียบเทียบในแบบที่น่าเบื่อ นั่นคือ หนึ่งในสองโมเดลนี้เป็นแบบเสียบใช้แทนได้ทันทีสำหรับไคลเอนต์ที่เข้ากันได้กับ OpenAI ส่วนอีกโมเดลเป็นการผสานรวมใหม่ หากคุณเรียก GPT-Image-2 ผ่านเอนด์พอยต์ที่จัดรูปแบบเหมือน OpenAI อยู่แล้ว ต้นทุนของการลอง Sunburst คือการเปลี่ยน model-ID ส่วนต้นทุนของการลอง Ideogram 4.5 คือสัญญาฉบับที่สองและไคลเอนต์ตัวที่สอง ก่อนที่คุณจะไปถึงขั้นประเมินคุณภาพด้วยซ้ำ
เลเยอร์การกำหนดเส้นทางไม่ได้ขจัดความแตกต่างนั้นออกไป — มันเพียงขจัดงานเชื่อมต่อที่ยุ่งยากออกจากฝั่งที่เข้ากันได้อยู่แล้ว และช่วยให้คุณส่งทราฟฟิกส่วนหนึ่งไปยังผู้เล่นรายใหม่ได้ โดยไม่ต้องผูกเส้นทางโปรดักชันไว้กับมัน การสลับไปใช้ระบบสำรองสำคัญกว่าปกติในกรณีนี้ เพราะสิ่งที่คุณจะนำมาทดลองคือโมเดลที่ข้อกล่าวอ้างหลักไม่มีการตรวจสอบอย่างเป็นอิสระ และมีขนาดตัวอย่างเพียงหนึ่งในห้าของคู่แข่ง
วิธีจัดการมัน
อย่ารันการเปรียบเทียบนี้กับภาพเดี่ยว นั่นคือวิธีของอารีน่า และมันเป็นเครื่องมือที่ผิด — มันจะบอกคุณว่า Sunburst ชนะ ซึ่งคุณก็รู้อยู่แล้ว
ลองรันมันบนซีเควนซ์ หยิบภาพห้าหรือสิบภาพจากงานของคุณเอง เขียนเชนของการแก้ไขแบบเพิ่มทีละขั้นเดียวกันไว้หกหรือแปดครั้ง แล้วรันเชนเดียวกันนั้นบน Ideogram 4.5 (High) และบน Sunburst (max) จากนั้น diff เทิร์นแรกกับเทิร์นแปดของแต่ละโมเดล ในบริเวณที่คุณไม่ได้สั่งให้โมเดลแตะต้องเลย นับพิกเซลที่ขยับไป ตัวเลขนั้น — ความคลาดเคลื่อนของบริเวณที่ไม่เปลี่ยนแปลงตลอดทั้งซีเควนซ์ — คือสิ่งที่ Ideogram อ้างว่าตัวเองชนะ และเท่าที่ผมรู้ ไม่มีใครเปิดเผยค่านั้นสำหรับโมเดลใดเลย
จากนั้นคิดราคาการรันทั้งสองครั้งต่อซีเควนซ์ที่เสร็จสมบูรณ์หนึ่งชุด ณ จุดนั้นคุณจะได้คำตอบที่มีค่ามากกว่า 118 Elo เพราะมันจะเกี่ยวกับภาพของคุณ ไม่ใช่ของคณะผู้ลงคะแนน
แมตช์อัปนี้จริงๆ แล้วคืออะไร
Ideogram 4.5 ไม่ได้เข้าร่วมการแข่งขันที่มันชนะบนกระดานผู้นำ และดูเหมือนว่ามันจะรู้ตัว — ซึ่งเป็นเหตุผลว่าทำไมหน้าเปิดตัวจึงสาธิตพฤติกรรมแทนที่จะแสดงอันดับ พฤติกรรมที่มันสาธิตนั้นเป็นของจริงพอที่จะคุ้มค่าแก่การทดสอบ และเฉพาะเจาะจงพอที่จะพิสูจน์ว่าเป็นเท็จได้: การแก้ไขซ้ำๆ จะยังคงสอดคล้องกันหรือไม่ และการทดสอบสิบรอบกับไฟล์ของคุณเองก็สรุปได้ในบ่ายเดียว
การตีความที่สมเหตุสมผลในวันนี้คือ GPT Image 2.5 Sunburst เป็นเครื่องมือแก้ไขภาพที่ดีกว่า ด้วยมาตรวัดอิสระเพียงหนึ่งเดียวที่มีอยู่ โดยมีส่วนต่างที่อยู่นอกช่วงความคลาดเคลื่อน พร้อมหลักฐานรองรับตัวเลขนั้นมากกว่าอย่างชัดเจน และ Ideogram 4.5 กำลังขายคุณสมบัติที่แคบกว่าและยังไม่ได้รับการวัด ในราคาที่ถูกกว่าเมื่อใช้การตั้งค่าต่ำ และพอๆ กันเมื่อใช้การตั้งค่าที่คำกล่าวอ้างของมันขึ้นอยู่กับ หากความเที่ยงตรงในการสนทนาหลายรอบคือคอขวดในการผลิตของคุณ การทดสอบนี้มีค่าใช้จ่ายต่ำ และโมเดลนี้ก็สมควรได้รับการทดสอบ หากไม่ใช่ คณะกรรมการก็ตอบไปแล้ว
