gpt-image-2 ของ OpenAI เป็นรุ่นถัดไปของซีรีส์ gpt-image — โมเดลภาพที่คิดค่าบริการตามโทเค็น ซึ่งเข้าถึงได้ผ่าน OpenAI Images API มาตรฐาน เป็นการอัปเกรดแบบดรอปอินจาก gpt-image-1: SDK เดียวกัน รูปแบบการเรียกใช้เดียวกัน พารามิเตอร์เดียวกัน ชี้ไคลเอ็นต์ OpenAI ที่มีอยู่ของคุณไปยัง URL ฐานของ OrcaRouter และตั้งค่าโมเดลเป็น `openai/gpt-image-2` ราคาคือ $5.00 สำหรับอินพุต / $30.00 สำหรับเอาต์พุตต่อ 1M โทเค็น คิดค่าบริการตามต้นทุน — ไม่มีส่วนเพิ่ม ไม่ต้องย้ายระบบ
OpenAI GPT-Image-2 เป็นโมเดล multimodal จาก OpenAI ที่เชี่ยวชาญด้านการสร้างและแก้ไขภาพ รองรับข้อความ prompt และ input ภาพแบบไม่บังคับเพื่อสร้างผลลัพธ์ภาพที่ถูกแก้ไขหรือใหม่ทั้งหมด…
GPT-Image-2 ถูกออกแบบมาเพื่อสร้างภาพจากคำอธิบายข้อความ และแก้ไขภาพที่มีอยู่ตามคำแนะนำที่เป็นข้อความ สามารถปรับเปลี่ยนคุณสมบัติต่างๆ เช่น สี พื้นผิว รูปร่าง และองค์ประกอบ รวมถึงเพิ่มหรือลบวัตถุ โมเดลนี้รองรับการเติมเต็มส่วนที่ขาด (inpainting) และการต่อขยายภาพ (outpainting) โดยปริยายผ่านการออกแบบพรอมต์ (prompt design) นอกจากนี้ยังอนุญาตให้ถ่ายทอดสไตล์ (style transfer) ซึ่งช่วยให้ผู้ใช้สามารถนำสุนทรียภาพที่กำหนดไปใช้กับภาพต้นฉบับ ความสามารถเหล่านี้ทำให้เหมาะสำหรับงานตั้งแต่การแก้ไขง่ายๆ ไปจนถึงการทดลองเชิงสร้างสรรค์ทางภาพ
ใช่ GPT-Image-2 สามารถสร้างภาพใหม่ทั้งหมดจากข้อความแจ้ง (prompts) โดยไม่ต้องมีภาพนำเข้าใดๆ โมเดลใช้คำอธิบายที่ให้มาเพื่อสร้างภาพแทนด้วยสายตา รวมถึงรายละเอียดเกี่ยวกับองค์ประกอบของฉาก แสง สี และวัตถุ คุณภาพและความเที่ยงตรงของภาพที่สร้างขึ้นขึ้นอยู่กับความเฉพาะเจาะจงของข้อความแจ้งและข้อจำกัดของสถาปัตยกรรมพื้นฐาน เพื่อผลลัพธ์ที่ดีที่สุด ข้อความแจ้งควรชัดเจนและหลีกเลี่ยงการอ้างอิงที่คลุมเครือ ความสามารถนี้มีประโยชน์สำหรับการสร้างแนวคิด การสร้างต้นแบบ และการสร้างภาพประกอบเฉพาะจากคำอธิบายแนวคิด
GPT-Image-2 รับข้อความแจ้ง (text prompts) เป็นอินพุตหลัก ในการแก้ไขภาพ จะต้องมีภาพที่มีอยู่แล้วส่งให้ โดยระบุเป็น URL หรือข้อมูลที่เข้ารหัส base64 ภายในคำขอ API ภาพควรอยู่ในรูปแบบมาตรฐาน เช่น PNG หรือ JPEG โดยมีข้อจำกัดด้านความละเอียดและขนาดตามข้อกำหนดของ API ของ OpenAI โมเดลนี้ไม่รองรับวิดีโอหรืออินพุตหลายภาพโดยตรง แต่ละคำขอจะทำงานกับคู่ข้อความแจ้งและภาพเพียงคู่เดียว ภาพเอาต์พุตจะถูกสร้างในรูปแบบทั่วไป โดยปกติคือ PNG และสามารถส่งเป็น URL หรือข้อมูล base64 ตามความต้องการของไคลเอนต์
GPT-Image-2 ไม่คงสถานะระหว่างคำขอ การเรียก API แต่ละครั้งเป็นอิสระต่อกัน การแก้ไขแบบหลายขั้นตอน—ซึ่งรูปภาพจะถูกปรับปรุงทีละน้อยผ่านชุดของพรอมต์—ต้องถูกจัดการโดยแอปพลิเคชันที่เรียกใช้ นักพัฒนาสามารถใช้ขั้นตอนการทำงานที่แต่ละขั้นตอนส่งผ่านผลลัพธ์ก่อนหน้าเป็นอินพุตไปยังคำขอถัดไป แนวทางนี้ช่วยให้การแก้ไขแบบวนซ้ำ เช่น ปรับสีก่อน แล้วเพิ่มพื้นหลัง แล้วปรับขนาด แม้จะใช้งานได้จริง แต่การไม่มีสถานะในตัวหมายความว่าแอปพลิเคชันต้องจัดการบริบท เช่น การจัดเก็บรูปภาพระหว่างกลาง และสร้างพรอมต์ที่เหมาะสมสำหรับแต่ละขั้นตอน
คะแนน LM Arena Image Edit Elo ที่ 1467.0 เป็นเกณฑ์ชี้วัดที่ใช้ประเมินคุณภาพของผลลัพธ์การแก้ไขภาพ คะแนน Elo ในบริบทนี้คำนวณจากการเปรียบเทียบผลลัพธ์ของโมเดลแบบทีละคู่โดยผู้ประเมินที่เป็นมนุษย์ คะแนนที่ 1467 บ่งชี้ว่า GPT-Image-2 มีประสิทธิภาพเหนือกว่าโมเดลพื้นฐานอย่างมีนัยสำคัญและสามารถแข่งขันกับโมเดลการแก้ไขภาพชั้นนำอื่นๆ ได้ สะท้อนถึงประสิทธิภาพที่แข็งแกร่งในงานต่างๆ เช่น การแทรกวัตถุ การเปลี่ยนพื้นหลัง การเปลี่ยนสี และการแก้ไของค์ประกอบภาพ คะแนนนี้ถือเป็นหนึ่งในคะแนนสูงสุดในกระดานผู้นำ LM Arena สำหรับหมวดการแก้ไขภาพ ซึ่งบ่งชี้ว่าโมเดลนี้สร้างผลลัพธ์การแก้ไขที่มีความสอดคล้อง ตรงตามคำอธิบาย และมีความสวยงามน่าดึงดูด
เวลาแฝงของ GPT-Image-2 แตกต่างกันไปตามความซับซ้อนของพรอมต์ ขนาดของอินพุต (ถ้ามี) และความละเอียดเอาต์พุตที่ต้องการ OpenAI ไม่ได้เผยแพร่การรับประกันเวลาแฝงที่แน่นอนสำหรับโมเดลนี้ เวลาในการตอบกลับโดยทั่วไปอยู่ในช่วงไม่กี่วินาทีถึงหลายสิบวินาทีสำหรับภาพขนาดใหญ่หรือการแก้ไขที่ซับซ้อน เนื่องจาก OrcaRouter เป็นรีเลย์ที่ไม่เพิ่มค่าใช้จ่ายใดๆ ให้กับเวลาประมวลผลของผู้ให้บริการ เวลารอจริงจึงเหมือนกับการเรียก OpenAI โดยตรง สำหรับแอปพลิเคชันในระบบผลิต ผู้ใช้ควรใช้ตรรกะการหมดเวลาและการลองใหม่ และพิจารณาการประมวลผลแบบกลุ่มเพื่อจัดการปริมาณงาน
GPT-Image-2 โดดเด่นในงานแก้ไขภาพที่ต้องการการปรับเปลี่ยนอย่างแม่นยำตามคำแนะนำภาษาธรรมชาติ คะแนน LM Arena Elo ที่สูงสะท้อนถึงความสามารถในการสร้างผลลัพธ์ที่ทั้งถูกต้องและสวยงามน่ามอง โมเดลนี้จัดการกับการเปลี่ยนแปลงองค์ประกอบที่ซับซ้อนได้ดี เช่น การแทนที่วัตถุในขณะที่ยังคงแสงและเงาที่เหมาะสม นอกจากนี้ยังสร้างภาพคุณภาพสูงจากศูนย์ด้วยความสมจริงและการยึดตามคำแนะนำที่ดี ผู้ใช้มักรายงานว่าสามารถจัดการกับคำแนะนำที่สร้างสรรค์ (เช่น "ทำให้ฉากนี้ดูเหมือนภาพวาดสีน้ำมัน") ด้วยการถ่ายทอดสไตล์ที่สมเหตุสมผล
แม้จะมีผลการทดสอบมาตรฐานที่แข็งแกร่ง แต่ GPT-Image-2 ก็ยังมีข้อจำกัดอยู่บ้าง มันอาจมีปัญหาเมื่อได้รับคำแนะนำที่ยาวมากหรือมีหลายส่วน โดยเฉพาะเมื่อวัตถุหลายชิ้นต้องถูกปรับเปลี่ยนพร้อมกัน โมเดลสามารถสร้างสิ่งแปลกปลอมเป็นครั้งคราว เช่น ใบหน้าที่บิดเบี้ยวหรือพื้นผิวที่ไม่สมจริง โดยเฉพาะในฉากที่ซับซ้อน นอกจากนี้ยังมีข้อจำกัดด้านความปลอดภัยที่ป้องกันการสร้างเนื้อหาบางประเภท ซึ่งอาจจำกัดการใช้งานเชิงสร้างสรรค์บางอย่าง นอกจากนี้ เนื่องจากโมเดลนี้เข้าถึงผ่านโครงสร้างพื้นฐานของ OpenAI ผู้ใช้จึงต้องปฏิบัติตามนโยบายเนื้อหาและข้อจำกัดอัตราการใช้งานของ OpenAI ซึ่งอาจส่งผลต่อขั้นตอนการทำงานของการแก้ไขแบบกลุ่ม
GPT-Image-2 มีราคาต่อโทเค็น: $8.00 ต่อล้านโทเค็นขาเข้า และ $30.00 ต่อล้านโทเค็นขาออก โทเค็นขาเข้ารวมถึงข้อความพรอมต์และข้อมูลรูปภาพที่เข้ารหัสเป็น base64 (เนื่องจากรูปภาพถูกแปลงเป็นโทเค็น) โทเค็นขาออกคือการแสดงผลรูปภาพที่สร้างขึ้น ต้นทุนรวมสำหรับคำขอขึ้นอยู่กับความยาวของพรอมต์และความละเอียดของรูปภาพทั้งขาเข้าและขาออก OrcaRouter ส่งต่อราคานี้โดยไม่มีส่วนเพิ่ม หมายความว่าต้นทุนเท่ากับที่ OpenAI คิด ไม่มีค่าธรรมเนียมเพิ่มเติมจากแพลตฟอร์ม OrcaRouter
ไม่ OrcaRouter ระบุอย่างชัดเจนว่าคิดค่าใช้จ่าย GPT-Image-2 ตามอัตราของผู้ให้บริการโดยไม่มีส่วนเพิ่มใด ๆ ซึ่งหมายความว่าราคาต่อโทเค็นคือ $8.00 สำหรับอินพุตและ $30.00 สำหรับเอาต์พุตโดยตรง ไม่มีค่าสมัครรายเดือน ค่าฐาน หรือเปอร์เซ็นต์ส่วนเพิ่มที่ OrcaRouter เพิ่มเข้าไป ค่าใช้จ่ายเพียงอย่างเดียวคือต้นทุนโทเค็นที่ใช้โดย OpenAI ผู้ใช้ควรตรวจสอบว่ามีวิธีการชำระเงินที่ถูกต้องกับ OrcaRouter เพื่อหลีกเลี่ยงการหยุดชะงักของบริการ แต่สูตรการกำหนดราคามีความโปร่งใสและคาดการณ์ได้
OpenAI ไม่ได้มีการเสนอการแคชแบบสาธารณะสำหรับพรอมต์การสร้างภาพหรือการแก้ไข แต่ละคำขอจะถูกประมวลผลอย่างอิสระ ดังนั้น การทำซ้ำพรอมต์ที่เหมือนกันกับภาพอินพุตเดียวกัน โดยทั่วไปจะทำให้เกิดค่าใช้จ่ายโทเค็นเต็มในแต่ละครั้งที่เรียกใช้ อย่างไรก็ตาม หากแอปพลิเคชันของคุณใช้งานภาพอินพุตเดิมบ่อยครั้ง คุณอาจลดการใช้โทเค็นอินพุตโดยจัดเก็บภาพภายนอกและอ้างอิงผ่าน URL (หากรองรับ) แทนที่จะเข้ารหัสใหม่เป็น base64 OrcaRouter ไม่ได้ให้เลเยอร์แคชเพิ่มเติมใดๆ ที่จะช่วยลดการใช้โทเค็นสำหรับโมเดลนี้
ราคาของ GPT-Image-2 ถูกกำหนดโดย OpenAI และเป็นหนึ่งในตัวเลือกที่มีต้นทุนสูงกว่าสำหรับโมเดลภาพ เนื่องจากความสามารถในการแก้ไขเฉพาะทาง ทางเลือกที่ถูกกว่า เช่น โมเดล Stability AI ที่มีให้ใช้งานบน OrcaRouter อาจเสนออัตราต่อโทเค็นที่ต่ำกว่า แต่อาจไม่ตรงกับความแม่นยำในการแก้ไขที่วัดโดยเกณฑ์วัด LM Arena การแลกเปลี่ยนคือระหว่างต้นทุนและคุณภาพผลลัพธ์ สำหรับการแก้ไขง่ายๆ หรือการใช้งานที่มีความเสี่ยงต่ำ โมเดลที่ราคาถูกกว่าอาจเพียงพอ ในขณะที่ GPT-Image-2 เหมาะสมกว่าเมื่อความเที่ยงตรงสูงและการปฏิบัติตามคำสั่งเป็นสิ่งสำคัญ
หากต้องการใช้ GPT-Image-2 ผ่าน OrcaRouter ให้ส่งคำขอ HTTP POST ไปยังปลายทางที่เข้ากันได้กับ OpenAI ที่ https://api.orcarouter.ai/v1/images/generations (หรือปลายทางที่คล้ายกันขึ้นอยู่กับการดำเนินการ) กำหนดพารามิเตอร์ model เป็น "openai/gpt-image-2" รวมสตริง prompt และอาจรวมรูปภาพ (ในรูปแบบ base64 หรือ URL) สำหรับงานแก้ไข OrcaRouter ตรวจสอบสิทธิ์คำขอโดยใช้คีย์ API ของคุณ (โดยปกติจะส่งในส่วนหัว Authorization เป็น "Bearer <key>") การตอบกลับจะประกอบด้วยข้อมูลรูปภาพที่สร้างขึ้นในรูปแบบที่ระบุโดยคำขอ โดยปกติจะเป็น URL หรือสตริง base64
พารามิเตอร์ API ส่วนใหญ่เป็นไปตาม schema การสร้างภาพของ OpenAI พารามิเตอร์สำคัญได้แก่ "model" (ตั้งค่าเป็น "openai/gpt-image-2"), "prompt" (คำสั่งข้อความ), "n" (จำนวนภาพที่ต้องการสร้าง ค่าเริ่มต้นคือ 1), "size" (ขนาดเอาต์พุต เช่น "1024x1024"), "response_format" ("url" หรือ "b64_json") และ "user" (สำหรับติดตามอัตราการใช้งาน) สำหรับงานแก้ไข คุณอาจรวม "image" (ภาพอินพุตเป็น base64) และ "mask" (สำหรับ inpainting ระบุบริเวณที่ต้องการปรับเปลี่ยน) โปรดดูเอกสารอย่างเป็นทางการของ OpenAI สำหรับรายการพารามิเตอร์ที่รองรับทั้งหมดและข้อจำกัดของพารามิเตอร์
การโยกย้ายเป็นเรื่องง่ายเพราะ OrcaRouter มี API ที่เข้ากันได้กับ OpenAI อย่างสมบูรณ์ การเปลี่ยนแปลงที่จำเป็นคือการอัปเดต base URL จาก https://api.openai.com เป็น https://api.orcarouter.ai/v1 และแก้ไขสตริงโมเดลจากเช่น "gpt-image-2" เป็น "openai/gpt-image-2" โค้ดที่มีอยู่ของคุณสำหรับการตรวจสอบสิทธิ์ การจัดลำดับคำขอ และการจัดการการตอบสนองจะทำงานได้โดยไม่ต้องแก้ไข ไม่จำเป็นต้องเปลี่ยนแปลงชื่อพารามิเตอร์หรือโครงสร้างข้อมูล หลังจากอัปเดตเอนด์พอยต์และรหัสโมเดลแล้ว ให้ทดสอบด้วยคำขอเดียวเพื่อยืนยันการเชื่อมต่อและพฤติกรรมการเรียกเก็บเงิน
OrcaRouter ใช้การตรวจสอบสิทธิ์ด้วยคีย์ API คุณต้องรวมคีย์ API ของ OrcaRouter ของคุณในส่วนหัวของคำขอ (request header) การจำกัดอัตราการใช้งาน (rate limits) ถูกกำหนดโดยทั้ง OrcaRouter และ OpenAI OrcaRouter อาจกำหนดขีดจำกัดเพื่อป้องกันการใช้งานในทางที่ผิด แต่โดยทั่วไปแล้วจะมีความใจกว้าง OpenAI ใช้การจำกัดอัตราการใช้งานของตัวเองตามระดับและการเรียกเก็บเงิน ซึ่งจะมีผลไม่ว่าคุณจะเข้าใช้โมเดลผ่าน OrcaRouter หรือโดยตรง ผู้ใช้ควรติดตามการใช้งานผ่านแดชบอร์ดของ OrcaRouter และปรับจังหวะการส่งคำขอตามนั้น ไม่จำเป็นต้องมีการตรวจสอบสิทธิ์เพิ่มเติมนอกเหนือจากคีย์ API
GPT-Image-2 และ DALL-E 3 เป็นโมเดลสร้างภาพจาก OpenAI ทั้งคู่ แต่มีเป้าหมายการใช้งานที่แตกต่างกัน DALL-E 3 เป็นโมเดลข้อความเป็นภาพเอนกประสงค์ที่เน้นการสร้างภาพที่สร้างสรรค์และเหมือนจริงจากศูนย์ ส่วน GPT-Image-2 ได้รับการปรับให้เหมาะสมสำหรับการแก้ไขภาพที่มีอยู่แล้ว ซึ่งเห็นได้จากคะแนน LM Arena Image Edit Elo ที่สูง แม้ว่า DALL-E 3 จะสามารถแก้ไขได้บ้าง แต่จุดแข็งของมันคือการสร้างภาพต้นฉบับ ส่วน GPT-Image-2 มักจะให้การปรับเปลี่ยนภาพต้นทางที่แม่นยำกว่า โดยเฉพาะเมื่อคำสั่งเกี่ยวข้องกับการคงองค์ประกอบดั้งเดิมของภาพ
โมเดล Stability AI เช่น SD3.5 เป็นตัวสร้างภาพแบบโอเพนซอร์สที่ให้ต้นทุนต่อโทเค็นต่ำกว่า แต่อาจต้องใช้การออกแบบพรอมพ์มากขึ้นเพื่อให้ได้คุณภาพที่ใกล้เคียงกัน GPT-Image-2 ในฐานะโมเดลที่เป็นลิขสิทธิ์เฉพาะ ได้รับประโยชน์จากข้อมูลการฝึกอบรมที่ครอบคลุมและการปรับแต่งสำหรับงานแก้ไข ซึ่งสะท้อนในคะแนน LM Arena ของมัน การเลือกระหว่างทั้งสองขึ้นอยู่กับงบประมาณและข้อกำหนดด้านคุณภาพ สำหรับงานแก้ไขที่มีความสำคัญสูงซึ่งความแม่นยำเป็นสิ่งสำคัญ GPT-Image-2 เป็นตัวเลือกที่ดีกว่า สำหรับการสร้างจำนวนมากหรือเมื่อต้นทุนเป็นข้อกังวลหลัก โมเดล Stability AI ที่มีให้บน OrcaRouter อาจเป็นทางเลือกที่ใช้งานได้ แม้ว่าคุณจะต้องประเมินความแตกต่างด้านคุณภาพสำหรับการใช้งานเฉพาะของคุณ
เลือกใช้รุ่นที่ถูกกว่าเมื่องานของคุณคือการสร้างภาพแบบง่ายที่ไม่ต้องการการแก้ไข หรือเมื่อความทนทานต่อการแก้ไขที่ไม่สมบูรณ์แบบอยู่ในระดับสูง ตัวอย่างเช่น การสร้างภาพแบบสำรอง, ไอคอนง่ายๆ, หรือกราฟิกความละเอียดต่ำอาจไม่จำเป็นต้องใช้ความซับซ้อนของ GPT-Image-2 ในทำนองเดียวกัน หากพรอมต์ของคุณเกี่ยวข้องกับการปรับแต่งเพียงเล็กน้อย (เช่น การเปลี่ยนความสว่างหรือการครอบตัด) รุ่นที่ไม่เชี่ยวชาญเฉพาะทางอาจเพียงพอ OrcaRouter นำเสนอช่วงของรุ่นภาพที่มีจุดราคาแตกต่างกัน ประเมินกรณีการใช้งานเฉพาะของคุณ—หากงานแก้ไขซับซ้อนและต้องการความเที่ยงตรงสูง GPT-Image-2 ก็สมเหตุสมผล มิฉะนั้น ให้พิจารณาประหยัดค่าใช้จ่ายจากรุ่นอื่นๆ
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1| อินพุต / 1M โทเค็น | $8.00 |
|---|---|
| เอาต์พุต / 1M โทเค็น | $30.00 |
| อ่านแคช / 1M | $1.25 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
สิ่งที่นักพัฒนาพูดถึงในสัปดาห์นี้
GET /api/public/models/openai/gpt-image-2เปิด @misc{orcarouter_gpt_image_2,
title = {openai/gpt-image-2 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-2}
}openai. (n.d.). openai/gpt-image-2 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-2