OpenAI's GPT-Image 1.5 สำหรับการป้อนข้อความและรูปภาพ เข้าถึงผ่าน OrcaRouter's API ในราคาโดยตรงจากผู้ให้บริการ
openai/gpt-image-1.5 เป็นโมเดล multimodal ที่พัฒนาโดย OpenAI ซึ่งรองรับการป้อนข้อมูลทั้งข้อความและภาพ ออกแบบมาเพื่อทำงานด้านการให้เหตุผลที่ต้องทำความเข้าใจเนื้อหาภาพร่วมกับภาษาธรรมชาติ…
โมเดลมีความสามารถในการเข้าใจและให้เหตุผลเกี่ยวกับภาพที่ร่วมกับคำสั่งที่เป็นข้อความ งานทั่วไปได้แก่ การสร้างคำบรรยายที่สื่อความหมายสำหรับภาพถ่าย การตอบคำถามเกี่ยวกับเนื้อหาของภาพ (เช่น 'รถสีอะไร?') และการแยกข้อความออกจากภาพ (งานแบบ OCR เมื่อได้รับคำสั่งที่เหมาะสม) นอกจากนี้ยังสามารถใช้สำหรับการให้เหตุผลที่ซับซ้อนขึ้น เช่น การวิเคราะห์แผนภูมิ แผนภาพ หรือบันทึกที่เขียนด้วยมือ ขอบเขตความสามารถที่แน่นอนขึ้นอยู่กับการฝึกฝนของโมเดล ซึ่ง OpenAI ยังไม่ได้ระบุรายละเอียด แต่โมเดลนั้นเป็นไปตามกระบวนทัศน์ multimodal transformer ทั่วไป
โมเดลนี้มีความโดดเด่นในสถานการณ์ที่บริบททางภาพมีความจำเป็นต่อการสร้างผลลัพธ์ที่เป็นข้อความที่แม่นยำ ตัวอย่างกรณีการใช้งาน ได้แก่ การให้คำอธิบายแบบเรียลไทม์สำหรับผู้ใช้ที่มีความบกพร่องทางการมองเห็น การแท็กสินค้าจากภาพในแคตตาล็อกโดยอัตโนมัติ และการช่วยในการวิเคราะห์ภาพทางการแพทย์โดยการสร้างรายงานเบื้องต้น นอกจากนี้ยังเหมาะสมสำหรับการประยุกต์ใช้ทางการศึกษา เช่น การอธิบายแผนภาพหรือการแก้ปริศนาทางภาพ เนื่องจากเป็นโมเดลภาพ-ข้อความเฉพาะทาง อาจมีประสิทธิภาพเหนือกว่าโมเดลมัลติโมดัลทั่วไปในงานแปลงภาพเป็นข้อความบริสุทธิ์ แม้ว่าจะไม่มีการเปรียบเทียบโดยตรงจากผู้ให้บริการ
หากแอปพลิเคชันของคุณไม่จำเป็นต้องใช้อินพุตภาพ คุณควรพิจารณาโมเดลที่รับเฉพาะข้อความที่มีราคาถูกกว่าซึ่งมีให้ใช้งานบน OrcaRouter เช่น openai/gpt-4o-mini ซึ่งมีต้นทุนต่อโทเค็นต่ำกว่า ในทำนองเดียวกัน หากงานที่ใช้รูปภาพของคุณเป็นงานง่าย ๆ (เช่น การจำแนกแบบไบนารี) และสามารถจัดการได้ด้วยโมเดลวิทัศน์ที่มีน้ำหนักเบา ทางเลือกที่มีขนาดเล็กกว่าอาจคุ้มค่ากว่า GPT-Image 1.5 มีราคาอยู่ในระดับสูงของข้อเสนอของ OpenAI ดังนั้นสำหรับงานภาพที่มีปริมาณมากแต่ความซับซ้อนต่ำ อาจคุ้มค่าที่จะประเมินว่าโมเดลที่มีขนาดเล็กกว่าตรงตามข้อกำหนดความแม่นยำของคุณหรือไม่ OrcaRouter ช่วยให้คุณทดสอบหลายโมเดลกับงานเดียวกันเพื่อเปรียบเทียบต้นทุนและคุณภาพ
โมเดลต้องการทั้งข้อความและรูปภาพเป็นอินพุตเพื่อสร้างเอาต์พุต ในทางปฏิบัติ คุณสามารถใช้ข้อความแจ้งที่สั้นที่สุด เช่น 'อธิบายภาพนี้' เพื่อประมวลผลเฉพาะรูปภาพได้อย่างมีประสิทธิภาพ อย่างไรก็ตาม สถาปัตยกรรมของโมเดลคาดหวังให้มีส่วนประกอบข้อความในข้อความเสมอ ไม่มีโหมดสำหรับการอนุมานเฉพาะรูปภาพ รูปภาพจะถูกถือเป็นส่วนหนึ่งของบริบทการสนทนา ดังนั้นคุณจึงสามารถเชื่อมต่อการแลกเปลี่ยนระหว่างข้อความและรูปภาพหลายครั้งได้ ไม่มีข้อมูลสาธารณะว่าโมเดลรองรับอินพุตวิดีโอหรือเฟรมแอนิเมชันหรือไม่
ณ วันที่ตัดความรู้ (knowledge cutoff) OpenAI ยังไม่ได้เผยแพร่คะแนน Benchmark ใด ๆ สำหรับโมเดล GPT-Image 1.5 ซึ่งเป็นเรื่องปกติสำหรับโมเดลสายพันธุ์เฉพาะที่อาจมีไว้สำหรับใช้งานภายในหรือการเข้าถึงก่อนเปิดตัว หากไม่มี Benchmark อย่างเป็นทางการ ก็ไม่สามารถเปรียบเทียบเชิงปริมาณกับโมเดลหลายรูปแบบอื่น ๆ ได้ ขอแนะนำให้ผู้ใช้งานประเมินโมเดลด้วยชุดข้อมูลของตนเองเพื่อพิจารณาประสิทธิภาพสำหรับงานเฉพาะเจาะจง แพลตฟอร์มของ OrcaRouter มีการบันทึกข้อมูลและการวิเคราะห์ที่สามารถช่วยในการประเมินดังกล่าว
รายละเอียดความหน่วงสำหรับ openai/gpt-image-1.5 ไม่เปิดเผยต่อสาธารณะ โดยทั่วไป การประมวลผลอินพุตภาพมักจะช้ากว่าคำขอที่เป็นข้อความล้วน เนื่องจากโมเดลต้องเข้ารหัสข้อมูลภาพก่อนที่จะสร้างข้อความ เวลาตอบสนองจริงจะขึ้นอยู่กับปัจจัยต่างๆ เช่น ขนาดภาพ ความซับซ้อนของคำขอ และโหลด API ในปัจจุบัน API ของ OrcaRouter มีการหมดเวลา (timeout) มาตรฐานที่สามารถกำหนดค่าได้ และผู้ใช้ควรทดสอบโมเดลด้วยขนาดภาพของตนเองเพื่อวัดประสิทธิภาพในโลกจริง ไม่มีเกณฑ์มาตรฐานความเร็วที่เปิดเผยต่อสาธารณะสำหรับโมเดลนี้
จุดแข็งหลักของ GPT-Image 1.5 คือความสามารถในการบูรณาการข้อมูลภาพเข้ากับกระบวนการให้เหตุผลของแบบจำลองภาษา ทำให้สามารถทำงานที่แบบจำลองข้อความล้วนไม่สามารถจัดการได้ ข้อจำกัดคือการขาดข้อมูลประสิทธิภาพที่เปิดเผยต่อสาธารณะ ทำให้ยากต่อการคาดการณ์ความแม่นยำโดยไม่มีการทดสอบเชิงประจักษ์ นอกจากนี้ แบบจำลองนี้น่าจะเหมาะสมน้อยกว่าสำหรับงานที่ต้องการรายละเอียดภาพความละเอียดสูง (เช่น OCR แบบละเอียดสำหรับข้อความขนาดเล็กมาก) เมื่อเทียบกับแบบจำลองคอมพิวเตอร์วิทัศน์เฉพาะทาง เช่นเดียวกับแบบจำลองภาษาขนาดใหญ่ทั้งหมด มันอาจสร้างคำอธิบายที่ดูน่าเชื่อถือแต่ไม่ถูกต้อง ดังนั้นผลลัพธ์ควรได้รับการตรวจสอบความถูกต้องสำหรับกรณีการใช้งานที่สำคัญ
ราคาสำหรับ openai/gpt-image-1.5 เป็นต่อ token: $8.00 ต่อ token อินพุตหนึ่งล้าน token และ $32.00 ต่อ token เอาต์พุตหนึ่งล้าน token อัตราเหล่านี้กำหนดโดย OpenAI และถูกส่งผ่านโดยไม่มีการบวกเพิ่มจาก OrcaRouter ทั้งข้อมูลข้อความและรูปภาพจะถูกนับเป็น token อินพุต รูปภาพถูก tokenize ตามขนาดและความละเอียดตามรูปแบบการ tokenize ของ OpenAI token เอาต์พุตคือข้อความที่สร้างโดยโมเดล การเรียกเก็บเงินจะคิดตามการเรียก API แต่ละครั้ง และไม่จำเป็นต้องมีการใช้งานขั้นต่ำ OrcaRouter ไม่คิดค่าธรรมเนียมเพิ่มเติมต่อคำขอใดๆ
ต้นทุนต่อโทเค็นค่อนข้างสูงเมื่อเทียบกับโมเดลภาษาขนาดเล็ก แต่โมเดลนี้มีความเชี่ยวชาญสำหรับงานมัลติโมดัลที่จำเป็นต้องมีอินพุตภาพ สำหรับแอปพลิเคชันที่ประมวลผลภาพจำนวนมากพร้อมกับข้อความแจ้งสั้นๆ ต้นทุนโทเค็นอินพุตจะมีบทบาทสำคัญ สำหรับแอปพลิเคชันที่สร้างคำอธิบายยาวละเอียด โทเค็นเอาต์พุตจะเป็นปัจจัยหลัก ไม่มีข้อมูลว่าโมเดลรองรับการแคชข้อความแจ้งหรือมีส่วนลดสำหรับการใช้งานปริมาณมากหรือไม่ นักพัฒนาควรประมาณจำนวนโทเค็นสำหรับคำขอทั่วไปก่อนที่จะตัดสินใจใช้โมเดลนี้
API ของ OrcaRouter อาจรองรับกลไกการแคช แต่สิ่งนี้ไม่เฉพาะเจาะจงกับ GPT-Image 1.5 หากเปิดใช้การแคช คำขอที่ซ้ำกันอาจลดจำนวนโทเค็นที่เรียกเก็บ แต่ผู้ให้บริการ (OpenAI) เป็นผู้กำหนดว่าการแคชจะถูกนำไปใช้หรือไม่ และในระดับใด ผู้ใช้ควรปรึกษาเอกสารของ OrcaRouter สำหรับรายละเอียดเกี่ยวกับพฤติกรรมของแคชและผลกระทบต่อราคา ณ ขณะนี้ ยังไม่มีแถลงการณ์สาธารณะจาก OpenAI เกี่ยวกับการแคชสำหรับโมเดลนี้ ดังนั้นจึงปลอดภัยที่สุดที่จะถือว่าไม่มีประโยชน์จากการแคช
การเรียกเก็บเงินสำหรับการใช้งาน openai/gpt-image-1.5 บน OrcaRouter จะดำเนินการผ่านระบบการวัดการใช้งานที่มีอยู่ของแพลตฟอร์ม ค่าใช้จ่ายจะสะสมตามการใช้งานโทเค็นที่รายงานโดย API โดยไม่มีค่าธรรมเนียมเพิ่มเติม OrcaRouter มีแดชบอร์ดการใช้งานเพื่อดูปริมาณการบริโภคแบบใกล้เคียงเวลาจริง วิธีการชำระเงินถูกกำหนดค่าในระดับบัญชี ไม่มีการคืนเงินหรือเครดิตสำหรับคำขอที่ล้มเหลวซึ่งส่งคืนข้อผิดพลาด การเรียก API ที่สำเร็จจะถูกเรียกเก็บเงินตามปกติ ผู้ใช้ควรตรวจสอบให้แน่ใจว่าขีดจำกัดอัตราการใช้งานเหมาะสมเพื่อหลีกเลี่ยงค่าใช้จ่ายที่ไม่คาดคิด
ในการเรียกใช้ openai/gpt-image-1.5 ผ่าน OrcaRouter ให้ตั้งค่า base URL เป็น https://api.orcarouter.ai/v1 และใช้พารามิเตอร์โมเดล 'openai/gpt-image-1.5' ในคำขอ chat completion ของคุณ API นี้เข้ากันได้อย่างสมบูรณ์กับไลบรารีไคลเอ็นต์ Python ของ OpenAI ตัวอย่างเช่น ใน Python คุณจะตั้งค่า openai.api_base = 'https://api.orcarouter.ai/v1' และ openai.api_key = 'your-orcarouter-key' ข้อความสามารถมีทั้งเนื้อหาข้อความและรูปภาพโดยใช้อาร์เรย์ 'content' ที่มีประเภท 'image_url' หรือ 'image_base64' ตามรูปแบบข้อความ multimodal ของ OpenAI
API รองรับพารามิเตอร์มาตรฐาน เช่น 'messages' (จำเป็น), 'max_tokens', 'temperature', 'top_p', 'frequency_penalty', และ 'presence_penalty' ไม่มีพารามิเตอร์เฉพาะของโมเดลที่ถูกบันทึกไว้ต่อสาธารณะนอกเหนือจากพารามิเตอร์มาตรฐาน ข้อมูลภาพจะถูกส่งผ่านฟิลด์ 'content' ของข้อความระบบหรือผู้ใช้ รูปแบบที่แน่นอนสำหรับภาพเป็นไปตามหลักปฏิบัติของ OpenAI: ใช้ 'type': 'image_url' พร้อมกับออบเจ็กต์ 'image_url' ที่ประกอบด้วยฟิลด์ 'url' (base64 data URI หรือ URL สาธารณะ) OrcaRouter อาจกำหนดข้อจำกัดเพิ่มเติม โปรดดูเอกสารอ้างอิง API ของพวกเขาสำหรับรายละเอียด
หากคุณใช้ API ของ OpenAI โดยตรงสำหรับ GPT-Image 1.5 อยู่ การย้ายไปใช้ OrcaRouter ต้องเปลี่ยนแปลงเพียงสองอย่าง: อัปเดต base URL เป็น https://api.orcarouter.ai/v1 และเปลี่ยนคีย์ API ของ OpenAI ของคุณเป็นคีย์ API ของ OrcaRouter รูปแบบคำขอและการตอบกลับเหมือนกันทุกประการ ดังนั้นจึงไม่จำเป็นต้องเปลี่ยนแปลงโค้ดในโครงสร้างข้อความ OrcaRouter เสนอโมเดลเดียวกันในราคาเดียวกับผู้ให้บริการ โดยไม่มีค่าธรรมเนียมเพิ่มเติม นอกจากนี้ OrcaRouter อาจมีการจำกัดอัตราการใช้งาน การบันทึก และคุณสมบัติอื่นๆ ที่แตกต่างจากบริการของ OpenAI
การยืนยันตัวตนกับ API ของ OrcaRouter ทำได้โดยใช้คีย์ API ที่ส่งในส่วนหัว 'Authorization' ในรูปแบบ: 'Authorization: Bearer <your-api-key>' คีย์ API สามารถรับได้จากแดชบอร์ดของ OrcaRouter ไม่จำเป็นต้องใช้ OAuth หรือใบรับรองไคลเอ็นต์เพิ่มเติม คีย์ต้องถูกเก็บเป็นความลับและไม่ควรเปิดเผยในโค้ดฝั่งไคลเอ็นต์ OrcaRouter รองรับการจำกัดอัตราการใช้งานต่อคีย์ และสามารถสร้างคีย์หลายรายการสำหรับแอปพลิเคชันต่างๆ ได้ คีย์สามารถเพิกถอนได้ทุกเมื่อจากแดชบอร์ด
GPT-4o เป็นโมเดล multimodal ที่ใหญ่กว่าจาก OpenAI ซึ่งสามารถรับอินพุตทั้งข้อความและรูปภาพ ข้อแตกต่างหลักคือ GPT-4o มี context window ที่ใหญ่กว่า (128k tokens) และออกแบบมาสำหรับการให้เหตุผลทั่วไป ในขณะที่ GPT-Image 1.5 เป็นโมเดลเฉพาะทางที่มีขนาด context ไม่ทราบแน่ชัด ราคาของ GPT-4o อยู่ที่ $5/M สำหรับอินพุตและ $15/M สำหรับเอาต์พุต ทำให้ GPT-Image 1.5 มีราคาแพงกว่า (โดยเฉพาะเอาต์พุต) หากไม่มีเกณฑ์มาตรฐาน ก็ไม่ชัดเจนว่าโมเดลใดทำงานได้ดีกว่าในงานที่เกี่ยวข้องกับรูปภาพ GPT-4o อาจคุ้มค่ากว่าสำหรับงานแบบผสม ในขณะที่ GPT-Image 1.5 อาจถูกปรับแต่งมาโดยเฉพาะสำหรับความเข้าใจข้อความ-รูปภาพ
มีโมเดลคอมพิวเตอร์วิทัศน์เฉพาะทางเช่น CLIP, DALL-E หรือ OCR เอนจินเฉพาะที่อาจมีประสิทธิภาพเหนือกว่าในงานภาพเฉพาะ (เช่น การจำแนก, การสร้าง หรือการสกัดข้อความ) GPT-Image 1.5 ผสมผสานความเข้าใจภาพเข้ากับการสร้างภาษาธรรมชาติ ซึ่งให้ความยืดหยุ่นแต่อาจไม่ตรงกับความแม่นยำของโมเดลที่ออกแบบมาเฉพาะสำหรับงานที่แคบ ตัวอย่างเช่น สำหรับการสกัดข้อมูลโครงสร้างจากเอกสาร โมเดล OCR เฉพาะอาจมีความแม่นยำและเวลาแฝงที่ต่ำกว่า แต่ GPT-Image 1.5 สามารถทำตามคำสั่งภาษาธรรมชาติที่ซับซ้อนได้ การเลือกขึ้นอยู่กับความซับซ้อนของงานและความต้องการในการอธิบายได้
OrcaRouter ให้การเข้าถึง openai/gpt-image-1.5 โดยไม่มีค่าธรรมเนียมเพิ่มเติมจากราคาของผู้ให้บริการ หมายความว่าคุณจ่ายตามอัตราที่ OpenAI กำหนดเท่านั้น มันมี API ที่เข้ากันได้กับ OpenAI ทำให้การย้ายระบบสำหรับผู้ใช้ปัจจุบันเป็นเรื่องง่าย นอกจากนี้ OrcaRouter อาจให้คุณสมบัติต่างๆ เช่น การติดตามการใช้งาน การบันทึกข้อมูล การจัดการการจำกัดอัตรา และการกำหนดเส้นทางหลายโมเดล ซึ่งไม่สามารถใช้งานได้โดยตรงจาก OpenAI สำหรับผู้ใช้ที่ต้องการเปรียบเทียบหลายโมเดลหรือจัดการคีย์ API แบบรวมศูนย์ OrcaRouter นำเสนออินเทอร์เฟซแบบรวมโดยไม่มีการล็อกผู้จำหน่าย
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1backgroundmoderationnoutput_compressionoutput_formatpartial_imagesqualitysize| อินพุต / 1M โทเค็น | $8.00 |
| เอาต์พุต / 1M โทเค็น | $32.00 |
| อ่านแคช / 1M | $1.25 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
สิ่งที่นักพัฒนาพูดถึงในสัปดาห์นี้
GET /api/public/models/openai/gpt-image-1.5เปิด @misc{orcarouter_gpt_image_1_5,
title = {openai/gpt-image-1.5 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-1.5}
}openai. (n.d.). openai/gpt-image-1.5 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-1.5