โมเดลหลายรูปแบบที่คุ้มค่าของ OpenAI สำหรับงานภาพและข้อความผ่าน OrcaRouter
gpt-image-1-mini เป็นโมเดลแบบ multimodal จาก OpenAI ที่ประมวลผลทั้งอินพุตข้อความและรูปภาพเพื่อสร้างเอาต์พุตข้อความ โดยถูกวางตำแหน่งให้เป็นทางเลือกที่เบาและคุ้มค่าด้านต้นทุนมากกว่าโมเดล…
gpt-image-1-mini สามารถทำงานด้านวิทัศน์-ภาษาได้หลากหลาย: สร้างคำบรรยายภาพเชิงพรรณนา, ตอบคำถามเกี่ยวกับเนื้อหาภาพ (เช่น วัตถุ สี ข้อความที่ปรากฏ), ดึงข้อมูลจากเอกสารหรือภาพหน้าจอ, และให้คำตอบที่คำนึงถึงบริบทซึ่งรวมภาพเข้าไปด้วย มันไม่ได้ออกแบบมาสำหรับการสร้างหรือปรับแต่งภาพ โมเดลทำงานได้ดีที่สุดกับภาพที่ชัดเจน มีแสงสว่างเพียงพอ และมีหัวข้อที่เกี่ยวข้อง ประสิทธิภาพอาจลดลงเมื่อใช้กับศิลปะนามธรรมสูง วัตถุที่ถูกบดบัง หรืออินพุตที่มีความละเอียดต่ำมาก
ต้นทุนอินพุตเป็นแบบตามจำนวนโทเคน เมื่อคุณรวมรูปภาพ OpenAI's API จะแปลงรูปภาพเป็นโทเคนตามสัดส่วนของขนาดพิกเซล รูปภาพความละเอียดสูงจะใช้โทเคนมากขึ้น ทำให้ต้นทุนต่อคำขอเพิ่มขึ้น ตัวอย่างเช่น รูปภาพขนาด 1024x1024 มีต้นทุนสูงกว่ารูปภาพขนาด 256x256 เพื่อจัดการค่าใช้จ่าย คุณสามารถปรับขนาดหรือบีบอัดรูปภาพก่อนส่ง ต้นทุนต่อโทเคนสำหรับอินพุตคือ $2.00 ต่อ 1M โทเคน ดังนั้นคำขอที่มีรูปภาพใช้โทเคนประมาณ ~1,000 โทเคนและข้อความสั้นๆ อาจมีต้นทุนอินพุตประมาณ $0.002 และต้นทุนเอาต์พุตในจำนวนใกล้เคียงกัน
หากแอปพลิเคชันของคุณไม่ต้องการความเข้าใจภาพเลย โมเดลที่ใช้ข้อความอย่างเดียวเช่น GPT-4o mini จะคุ้มค่ากว่าในราคา $0.15 ต่อ 1M input tokens สำหรับงานภาพที่ง่ายมาก (เช่น การตรวจจับวัตถุเดียว) ตัวจำแนกภาพเฉพาะทางอาจถูกกว่า gpt-image-1-mini เป็นตัวเลือกกึ่งกลางที่ดีเมื่อคุณต้องการการให้เหตุผลทางภาพแบบเอนกประสงค์ แต่ไม่ต้องการความแม่นยำสูงสุดของโมเดลที่ใหญ่กว่า ประเมินความต้องการด้านเวลาแฝงและความแม่นยำของคุณ: หากงานสามารถยอมรับข้อผิดพลาดเป็นครั้งคราวได้ ทางเลือกที่ถูกกว่าก็อาจเพียงพอ
เพื่อให้ใช้ประโยชน์จาก gpt-image-1-mini อย่างเต็มที่ ควรให้พรอมต์ที่ชัดเจนและมีคำอธิบายที่ดีพร้อมกับรูปภาพ ตัวอย่างเช่น แทนที่จะใช้ "อธิบายรูปภาพนี้" ให้ใช้ "มีวัตถุอะไรอยู่ในรูปภาพนี้และพวกมันกำลังทำอะไรอยู่" ปรับขนาดรูปภาพให้มีความละเอียดต่ำที่สุดที่จำเป็นสำหรับงานเพื่อลดค่าใช้จ่ายโทเค็น สำหรับการประมวลผลแบบแบตช์ ควรพิจารณาแคชพรอมต์ที่ใช้บ่อย ทดสอบกับข้อมูลที่เป็นตัวแทนเสมอเพื่อทำความเข้าใจความแม่นยำของโมเดลในโดเมนเฉพาะของคุณ เนื่องจากโมเดลอาจไม่ได้รับการปรับแต่งสำหรับอุตสาหกรรมเฉพาะทาง เช่น การวิเคราะห์ภาพทางการแพทย์หรือการวิเคราะห์ดาวเทียม
คะแนนการเปรียบเทียบเฉพาะสำหรับ gpt-image-1-mini ไม่ได้ถูกระบุไว้ในข้อมูลที่มีอยู่ อย่างไรก็ตาม ในฐานะที่เป็นโมเดลของ OpenAI มันได้รับประโยชน์จากการฝึกอบรมพื้นฐานเดียวกันบนข้อมูลอินเทอร์เน็ตที่กว้างขวาง คาดว่าจะทำงานได้ดีในงานด้านวิทัศน์-ภาษาทั่วไป เช่น การตอบคำถามเชิงภาพในชุดข้อมูลอย่าง VQA v2 และการบรรยายภาพใน MS COCO ประสิทธิภาพและต้นทุนต่ำของโมเดลทำให้มันสามารถแข่งขันในแอปพลิเคชันการผลิตที่ให้ความสำคัญกับความเร็วและงบประมาณมากกว่าความแม่นยำระดับล้ำสมัย
ค่า latency ผ่าน OrcaRouter ขึ้นอยู่กับโครงสร้างพื้นฐานของผู้ให้บริการเบื้องหลังและขนาดของอินพุต (ความละเอียดของภาพ ความยาวของพรอมต์) เวลาตอบสนองโดยทั่วไปสำหรับคำขอที่เป็นภาพมาตรฐานพร้อมข้อความสั้นจะอยู่ในช่วงไม่กี่ร้อยมิลลิวินาทีถึงไม่กี่วินาที OrcaRouter ไม่เพิ่มโอเวอร์เฮดที่มีนัยสำคัญเกินกว่า round trip ของเครือข่าย สำหรับสถานการณ์แบบ batch หรือ high-throughput ควรพิจารณาส่งคำขอแบบอะซิงโครนัสหรือใช้ streaming หากมีให้เลือก ไม่มีการรับประกันค่า latency ที่แน่นอน ทดสอบกับ workload ทั่วไปของคุณ
gpt-image-1-mini มีข้อจำกัดหลายประการ มันไม่สามารถสร้างภาพได้ มันผลิตได้เฉพาะข้อความเท่านั้น มันอาจตีความความสัมพันธ์เชิงพื้นที่ที่ซับซ้อนหรือรายละเอียดเล็กๆ ในภาพผิดพลาด มันมีปัญหากับภาพที่มีสัญญาณรบกวนมากเกินไป การบิดเบือนอย่างรุนแรง หรือฉากที่ไม่ชัดเจน โมเดลอาจสร้างข้อมูลเท็จเกี่ยวกับภาพเมื่อได้รับคำถามชี้นำ นอกจากนี้ จุดตัดความรู้และรายละเอียดข้อมูลการฝึกอบรมไม่ได้รับการเปิดเผย ดังนั้นมันอาจไม่รู้จักเหตุการณ์ล่าสุดหรือวัตถุเฉพาะทาง สำหรับการใช้งานที่สำคัญ ควรตรวจสอบผลลัพธ์เสมอ
เมื่อเทียบกับโมเดลขนาดใหญ่อย่าง GPT-4 Turbo ที่มีความสามารถด้านภาพแล้ว gpt-image-1-mini อาจมีความแม่นยำน้อยกว่าในงานที่ต้องใช้เหตุผลเชิงภาพที่ซับซ้อน (เช่น การนับวัตถุในฉากที่มีความหนาแน่นสูง การอ่านข้อความขนาดเล็ก) อย่างไรก็ตาม ราคาของมันถูกกว่ามาก: $2/$8 ต่อล้านโทเค็น เทียบกับ $10/$30 สำหรับ GPT-4 Turbo สำหรับงานทั่วไปหลายๆ งาน การแลกเปลี่ยนนี้อาจเป็นที่ยอมรับได้ หากคุณต้องการความแม่นยำสูง ให้เริ่มต้นด้วย gpt-image-1-mini เพื่อสร้างต้นแบบ จากนั้นเปรียบเทียบประสิทธิภาพกับโมเดลที่ใหญ่กว่าเพื่อดูว่าการเพิ่มความแม่นยำนั้นคุ้มค่ากับค่าใช้จ่ายที่เพิ่มขึ้นหรือไม่
ราคามีความโปร่งใส: $2.00 ต่อ 1 ล้าน input tokens และ $8.00 ต่อ 1 ล้าน output tokens คิดค่าบริการตามอัตราของผู้ให้บริการอย่างตรงไปตรงมา โดยไม่มีการบวกเพิ่ม ซึ่งหมายความว่าต้นทุนรวมของคำขอหนึ่งครั้งเท่ากับจำนวน token คูณด้วยอัตราเหล่านี้ ไม่มีค่าธรรมเนียมแอบแฝง ไม่มีค่าธรรมเนียมเพิ่มเติมสำหรับการเรียก API และไม่มีข้อผูกมัดขั้นต่ำ OrcaRouter ส่งต่อราคาของ OpenAI โดยตรง คุณจ่ายเฉพาะ tokens ที่คุณใช้เท่านั้น โมเดลนี้เป็นหนึ่งในตัวเลือก vision-language ที่มีราคาย่อมเยาที่สุดที่มีให้ใช้งานผ่าน OrcaRouter
เพื่อลดค่าใช้จ่าย ให้ส่งภาพด้วยความละเอียดที่เล็กที่สุดที่เพียงพอต่อการใช้งาน ตัวอย่างเช่น ภาพขนาด 256x256 อาจเพียงพอสำหรับการตรวจจับวัตถุอย่างง่าย ในขณะที่ภาพ 1024x1024 อาจมากเกินไป ใช้คำสั่งที่สั้นและมีประสิทธิภาพ เก็บคำตอบในแคชสำหรับอินพุตที่เหมือนกันเพื่อหลีกเลี่ยงการเรียก API ซ้ำซ้อน หากแอปพลิเคชันของคุณอนุญาต ให้รวมคำขอที่คล้ายกันเพื่อใช้บริบทร่วมกัน เนื่องจากโทเค็นอินพุตรวมโทเค็นของรูปภาพ การควบคุมขนาดภาพจึงเป็นปัจจัยที่มีผลมากที่สุด นอกจากนี้ให้พิจารณาว่าโมเดลที่ใช้ข้อความเท่านั้นสามารถแทนที่ส่วนที่ใช้วิทัศน์ในขั้นตอนการทำงานของคุณได้หรือไม่
ปัจจุบัน OrcaRouter ไม่ได้โฆษณาว่ามีเลเยอร์แคชในตัวสำหรับการตอบกลับของ gpt-image-1-mini แต่ละคำขอจะถูกส่งไปยังปลายทางการอนุมานของ OpenAI และคิดค่าบริการต่อโทเคน หากคุณใช้แคชผลลัพธ์ของคุณเอง (เช่น โดยใช้คีย์ตามค่าแฮชของภาพและพรอมต์) คุณจะสามารถหลีกเลี่ยงค่าใช้จ่ายซ้ำซ้อนได้ เนื่องจากโมเดลไม่มีสถานะ จึงไม่มีค่าใช้จ่ายต่อเซสชัน สำหรับการผลิตที่มีปริมาณสูง คุณอาจเจรจาส่วนลดตามปริมาณกับ OpenAI โดยตรง แต่ราคาของ OrcaRouter ไม่รวมส่วนลดดังกล่าวตามค่าเริ่มต้น
ไม่ OrcaRouter ไม่เพิ่มมาร์กอัปใดๆ ให้กับอัตราของผู้ให้บริการ ค่าใช้จ่ายเพียงอย่างเดียวคือต้นทุนต่อโทเค็นตามที่ OpenAI คิดเงิน ไม่มีค่าสมัครสมาชิกรายเดือน ไม่มีค่าโอนข้อมูล และไม่มีขั้นต่ำต่อคำขอ คุณจ่ายเฉพาะโทเค็นที่ใช้เท่านั้น หากยอดเงินในบัญชีของคุณไม่เพียงพอ คำขอจะถูกปฏิเสธจนกว่าคุณจะเติมเงิน ติดตามการใช้งานของคุณผ่านแดชบอร์ด OrcaRouter เสมอเพื่อหลีกเลี่ยงค่าใช้จ่ายที่ไม่คาดคิด
ใช้ปลายทางที่เข้ากันได้กับ OpenAI ที่ https://api.orcarouter.ai/v1 พร้อมรหัสโมเดล "openai/gpt-image-1-mini" ตัวอย่างใน Python: ```python import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_KEY") response = client.chat.completions.create( model="openai/gpt-image-1-mini", messages=[ {"role": "user", "content": [ {"type": "text", "text": "What is in this image?"}, {"type": "image_url", "image_url": {"url": "https://example.com/cat.jpg"}} ]} ], max_tokens=300 ) ``` การตอบกลับจะเป็นไปตามรูปแบบ chat completion มาตรฐานพร้อมเอาต์พุตเป็นข้อความ
โมเดลรองรับพารามิเตอร์การสนทนาแบบสมบูรณ์ทั่วไป: `messages` (ซึ่งประกอบด้วยเนื้อหาที่เป็นข้อความและรูปภาพ), `max_tokens`, `temperature`, `top_p`, `frequency_penalty`, `presence_penalty`, และ `stop` เนื้อหาที่เป็นรูปภาพต้องระบุเป็นอาร์เรย์ของออบเจ็กต์เนื้อหาที่มีประเภท "image_url" (URL หรือ base64) โมเดลไม่รองรับการตอบกลับแบบสตรีมมิ่งหรือไม่? (ตรวจสอบเอกสารของ OpenAI) เพื่อประสิทธิภาพที่ดีที่สุด ควรใช้ `temperature` ระหว่าง 0 ถึง 1 ค่าที่สูงขึ้นอาจให้คำอธิบายที่สร้างสรรค์มากขึ้น แต่มีความแม่นยำลดลง `max_tokens` ควบคุมความยาวของผลลัพธ์; ตั้งค่าให้เหมาะสมกับงานเพื่อหลีกเลี่ยงการตอบกลับที่ยาวเกินคาดและค่าใช้จ่ายที่สูงขึ้น
หากคุณกำลังเรียกใช้ API ของ OpenAI โดยตรงสำหรับ gpt-image-1-mini (หรือโมเดลวิทัศน์อื่น) การโยกย้ายไปยัง OrcaRouter ต้องการเปลี่ยนแปลงเพียงสองอย่าง: 1. ตั้งค่า base_url เป็น "https://api.orcarouter.ai/v1" 2. ใช้ model ID "openai/gpt-image-1-mini" ตรรกะการยืนยันตัวตนที่มีอยู่ของคุณสามารถคงไว้เหมือนเดิมเป็นส่วนใหญ่ เพียงแค่เปลี่ยน API key เป็น OrcaRouter key ของคุณ รูปแบบข้อความและพารามิเตอร์เดียวกันยังคงใช้ได้ ไม่จำเป็นต้องเปลี่ยนแปลงตรรกะการแชทของคุณ ทดสอบด้วยชุดข้อมูลขนาดเล็กเพื่อให้แน่ใจว่ามีความเท่าเทียมกัน
ข้อผิดพลาดทั่วไป ได้แก่ การยืนยันตัวตนล้มเหลว (ตรวจสอบ API key ของคุณ), การจำกัดอัตราการใช้งาน (implement exponential backoff), และรูปแบบภาพที่ไม่ถูกต้อง (ตรวจสอบให้แน่ใจว่า base64 ถูกเข้ารหัสอย่างถูกต้องหรือ URL สามารถเข้าถึงได้) หากคุณได้รับข้อผิดพลาด 400 ให้ยืนยันว่า model ID คือ "openai/gpt-image-1-mini" ทุกประการ และโครงสร้างข้อความถูกต้อง สำหรับข้อผิดพลาด 500 ให้ลองใหม่หลังจากรอสักครู่ ทีมสนับสนุนของ OrcaRouter สามารถช่วยเหลือปัญหาที่เกิดขึ้นอย่างต่อเนื่อง ติดตามข้อมูลการจำกัดอัตราการใช้งานจาก response headers
GPT-4o mini เป็นโมเดลที่เน้นข้อความเป็นหลัก (แม้ว่าจะสามารถรับรูปภาพได้ในบางการกำหนดค่า) โดยมีราคาที่ถูกกว่ามาก: $0.15 ต่อ 1M input tokens และ $0.60 ต่อ 1M output tokens หากงานของคุณไม่ต้องการรูปภาพ GPT-4o mini จะถูกกว่ามาก สำหรับการเข้าใจรูปภาพ gpt-image-1-mini เป็นโมเดลเฉพาะทางและน่าจะเชื่อถือได้มากกว่าสำหรับงานที่เกี่ยวข้องกับภาพ แต่มีค่าใช้จ่ายสูงกว่า เลือกใช้ gpt-image-1-mini เมื่อคุณต้องการประสิทธิภาพแบบ multimodal ที่สม่ำเสมอโดยไม่ต้องเสียค่าใช้จ่ายเท่ากับ GPT-4 Turbo
DALL-E models ใช้สำหรับสร้างภาพจากข้อความแจ้งเตือน gpt-image-1-mini สร้างข้อความจากภาพและข้อความ—ไม่สามารถสร้างภาพได้ หากคุณต้องการสังเคราะห์ภาพ DALL-E คือตัวเลือกที่ถูกต้อง ราคาของ DALL-E คิดต่อภาพที่สร้าง ไม่ใช่ต่อโทเค็น gpt-image-1-mini เป็นส่วนเสริม: สามารถวิเคราะห์ภาพที่คุณมีอยู่แล้ว สำหรับแอปพลิเคชันที่ต้องการทั้งความเข้าใจและการสร้าง คุณอาจใช้ gpt-image-1-mini สำหรับการวิเคราะห์และ DALL-E สำหรับการสร้างผลลัพธ์ แต่ทั้งสองมีวัตถุประสงค์ที่แตกต่างกัน
โมเดลโอเพนซอร์สอย่าง LLaVA หรือระบบที่ใช้ CLIP อาจมีต้นทุนต่อคำขอที่ต่ำกว่า (หากโฮสต์เอง) แต่ต้องมีการตั้งค่าโครงสร้างพื้นฐานและการบำรุงรักษา gpt-image-1-mini ผ่าน OrcaRouter ให้ API ที่มีการจัดการโดยไม่มีต้นทุนฮาร์ดแวร์ล่วงหน้า โมเดลโอเพนซอร์สสามารถปรับแต่งสำหรับโดเมนเฉพาะได้ ในขณะที่ gpt-image-1-mini เป็นโมเดลวัตถุประสงค์ทั่วไปที่ตายตัว สำหรับการใช้งานปริมาณน้อยหรือต้นแบบด่วน วิธีการใช้ API จะง่ายกว่า สำหรับปริมาณมากหรืองานเฉพาะทาง โมเดลโอเพนซอร์สอาจประหยัดกว่าแม้จะมีค่าใช้จ่ายด้านวิศวกรรม
หากปริมาณงานของคุณเป็นข้อความล้วนๆ ทางเลือกอย่าง GPT-4o mini หรือ Claude Haiku จะมีราคาถูกกว่า สำหรับการสร้างภาพ ให้ใช้ DALL-E หรือ Stable Diffusion หากคุณต้องการการให้เหตุผลแบบ multimodal ขั้นสูง (เช่น แผนภาพที่ซับซ้อน) ให้พิจารณา GPT-4 Turbo พร้อมฟีเจอร์มองเห็นภาพ แม้ว่าจะมีค่าใช้จ่ายสูงกว่าก็ตาม สำหรับแอปพลิเคชันแบบสตรีมมิ่ง ให้ตรวจสอบว่าโมเดลที่คุณเลือกนั้นรองรับการสตรีมมิ่งหรือไม่ — gpt-image-1-mini อาจไม่รองรับ OrcaRouter มีหลายโมเดล คุณสามารถสลับไปมาระหว่างโมเดลเหล่านั้นตามคำขอ โดยพิจารณาจากความซับซ้อนของงานและข้อจำกัดด้านงบประมาณ
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1backgroundmoderationnoutput_compressionoutput_formatpartial_imagesqualitysize| อินพุต / 1M โทเค็น | $2.00 |
|---|---|
| เอาต์พุต / 1M โทเค็น | $8.00 |
| อ่านแคช / 1M | $0.200 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
สิ่งที่นักพัฒนาพูดถึงในสัปดาห์นี้
GET /api/public/models/openai/gpt-image-1-miniเปิด @misc{orcarouter_gpt_image_1_mini,
title = {openai/gpt-image-1-mini API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-1-mini}
}openai. (n.d.). openai/gpt-image-1-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-1-mini