GPT-4o mini เป็นโมเดลใหม่ล่าสุดของ OpenAI หลังจาก [GPT-4 Omni](/models/openai/gpt-4o) ซึ่งรองรับทั้งอินพุตข้อความและรูปภาพพร้อมเอาต์พุตข้อความ ในฐานะที่เป็นโมเดลขนาดเล็กที่ล้ำหน้าที่สุดของพวกเขา มันมีราคาถูกกว่าหลายเท่า...
GPT-4o-mini (2024-07-18) เป็นโมเดลมัลติโมดอลน้ำหนักเบาที่พัฒนาโดย OpenAI ออกแบบมาเพื่อการประมวลผลข้อความและภาพอย่างคุ้มค่า เหมาะสำหรับนักพัฒนาและองค์กรที่ต้องการประสิทธิภาพสูงในราคาต่ำ…
GPT-4o-mini สามารถทำงานด้านการให้เหตุผลเกี่ยวกับภาพ เช่น การบรรยายเนื้อหาภาพ การตอบคำถามเกี่ยวกับภาพ และการระบุวัตถุหรือข้อความในภาพ รองรับรูปแบบภาพมาตรฐาน (JPEG, PNG, GIF, WebP) และสามารถจัดการกับหลายภาพในคำขอเดียว โมเดลนี้ไม่ได้ทำการตรวจจับวัตถุในลักษณะกรอบขอบเขตที่มีโครงสร้าง แต่สามารถอธิบายตำแหน่งและความสัมพันธ์ได้ ตัวอย่างเช่น สามารถอ่านข้อความจากภาพถ่าย เข้าใจแผนภูมิและแผนภาพ และให้คำอธิบายฉากโดยละเอียด ความแม่นยำของงานที่ใช้ภาพขึ้นอยู่กับความละเอียดและบริบท ภาพความละเอียดสูงอาจทำให้เกิดค่าโทเค็นเพิ่มขึ้น แต่สามารถให้ผลลัพธ์ที่ดีกว่าสำหรับรายละเอียดที่ละเอียด
GPT-4o-mini รองรับการป้อนไฟล์ เช่น PDF เอกสาร Word และไฟล์รูปภาพผ่านโครงสร้างเนื้อหาแบบหลายรูปแบบ (multi-modal) เมื่อมีการระบุไฟล์ โมเดลจะแยกเนื้อหาข้อความและรูปภาพจากไฟล์นั้น ทำให้ผู้ใช้สามารถสอบถามเกี่ยวกับเนื้อหาของเอกสาร สรุปข้อความ หรือวิเคราะห์ตารางและรูปภาพที่ฝังอยู่ ไฟล์จะไม่ถูกอัปโหลดหรือจัดเก็บ แต่จะถูกประมวลผลแบบอินไลน์ระหว่างการเรียก API ซึ่งมีประโยชน์สำหรับขั้นตอนการทำงานที่เกี่ยวข้องกับการตรวจสอบเอกสาร การวิเคราะห์สัญญา หรือการดึงข้อมูลจากแบบฟอร์มที่สแกน โปรดทราบว่าไฟล์ที่มีขนาดใหญ่มากอาจเกินขอบเขตหน้าต่างบริบท 128,000 โทเค็น หรือทำให้เกิดต้นทุนโทเค็นสูง
สำหรับงานที่ต้องการเพียงการสร้างข้อความที่มีน้ำหนักเบา งบประมาณโทเค็นอาจถูกใช้อย่างมีประสิทธิภาพมากขึ้นด้วยโมเดลที่ถูกกว่าเช่น GPT-3.5-Turbo หรือทางเลือกโอเพนซอร์ส (เช่น Llama 3 8B) หากปริมาณงานของคุณไม่ต้องการอินพุตแบบมัลติโมดัลหรือบริบท 128k โมเดลที่เล็กกว่าก็สามารถลดต้นทุนได้อีก นอกจากนี้ สำหรับงานที่แคบ เช่น การจำแนกประเภทง่ายๆ หรือการสกัดคำสำคัญ โมเดลขนาดเล็กที่ได้รับการปรับแต่งอย่างละเอียดอาจมีความหน่วงและต้นทุนที่ต่ำกว่า อย่างไรก็ตาม การรวมกันของราคาต่ำ บริบทขนาดใหญ่ และความสามารถแบบมัลติโมดัลของ GPT-4o-mini ทำให้มันเป็นค่าเริ่มต้นที่แข็งแกร่งสำหรับแอปพลิเคชันทั่วไปหลายประเภท
GPT-4o-mini เหมาะอย่างยิ่งสำหรับสภาพแวดล้อมการผลิตที่มีปริมาณงานสูง ซึ่งได้รับประโยชน์จากการทำความเข้าใจแบบหลายรูปแบบ (multimodal) และหน้าต่างบริบทขนาดใหญ่ กรณีการใช้งานที่เหมาะสม ได้แก่ แชทบอทบริการลูกค้าที่สามารถจัดการกับภาพหน้าจอและประวัติการสนทนาที่ยาว, ไปป์ไลน์ประมวลผลเอกสารสำหรับแยกข้อมูลจาก PDF หรือรูปภาพ, เครื่องมือทางการศึกษาสำหรับการสอนคณิตศาสตร์ (ตามที่เห็นจากคะแนน 78.9 MATH-500) และการดีบักโค้ดที่เกี่ยวข้องกับทั้งข้อความและไดอะแกรม นอกจากนี้ยังเหมาะสำหรับเวิร์กโฟลว์การกลั่นกรองเนื้อหาที่ต้องมีการวิเคราะห์ภาพควบคู่ไปกับข้อความ ต้นทุนต่อโทเค็นที่ต่ำช่วยให้สามารถขยายขนาดไปยังคำขอหลายล้านรายการโดยไม่มีค่าใช้จ่ายที่สูงเกินไป
GPT-4o-mini ได้คะแนน 78.9 บนเกณฑ์วัด MATH-500 ซึ่งเป็นส่วนหนึ่งของชุดข้อมูล MATH ที่ประกอบด้วยโจทย์คณิตศาสตร์ที่ท้าทาย 500 ข้อ คะแนนนี้บ่งบอกถึงความสามารถของโมเดลในการแก้ปัญหาเลขคณิต พีชคณิต เรขาคณิต และปัญหาทางคณิตศาสตร์อื่นๆ ด้วยการให้เหตุผลทีละขั้นตอน คะแนน 78.9 ทำให้มันอยู่เหนือโมเดลขนาดเล็กหลายตัวและ GPT-4 รุ่นก่อนหน้าบางรุ่น ซึ่งบ่งชี้ถึงความสามารถในการให้เหตุผลที่แข็งแกร่งสำหรับโมเดลที่มีขนาดและต้นทุนเช่นนี้ อย่างไรก็ตาม มันไม่ได้มีประสิทธิภาพเท่ากับ GPT-4o เต็มรูปแบบหรือ GPT-4 Turbo ในเกณฑ์วัดเดียวกัน ผลลัพธ์นี้ควรตีความในบริบท: GPT-4o-mini ถูกออกแบบมาเพื่อประสิทธิภาพ ไม่ใช่ความแม่นยำสูงสุด
ตัวเลข latency ที่เฉพาะเจาะจงไม่ได้ถูกเปิดเผยต่อสาธารณะโดย OpenAI แต่ GPT-4o-mini โดยทั่วไปเร็วกว่าโมเดล GPT-4 ขนาดใหญ่กว่าเนื่องจากมีจำนวนพารามิเตอร์น้อยกว่า ในทางปฏิบัติ ผู้ใช้รายงาน time-to-first-token ในช่วงไม่กี่ร้อยมิลลิวินาทีสำหรับ prompt สั้นๆ และ throughput การสร้างข้อความในระดับหลายสิบ token ต่อวินาที Latency ขึ้นอยู่กับจำนวน token ทั้งหมด (input + output), จำนวนรูปภาพ และโหลดของเซิร์ฟเวอร์ปัจจุบัน เนื่องจาก OrcaRouter ทำหน้าที่เป็นพร็อกซี latency เครือข่ายเพิ่มเติมจึงน้อยมาก—โดยทั่วไปอยู่ในช่วงไม่กี่มิลลิวินาทีของ latency โดยตรงจาก OpenAI API โมเดลรองรับการสตรีมสำหรับแอปพลิเคชันแบบเรียลไทม์
จุดแข็ง: ความคุ้มค่าในด้านต้นทุน (ราคาต่ำที่สุดในบรรดาสมาชิกกลุ่ม GPT-4 ที่รองรับมัลติโมดัล), หน้าต่างบริบทขนาดใหญ่ 128k, ความสามารถในการให้เหตุผลทางคณิตศาสตร์ที่แข็งแกร่ง (78.9 MATH-500), และการอนุมานที่รวดเร็วเมื่อเทียบกับรุ่นที่ใหญ่กว่า รองรับการประมวลผลภาพและไฟล์ได้อย่างมีประสิทธิภาพสำหรับงานทั่วไป ข้อจำกัด: สำหรับงานที่ต้องใช้การให้เหตุผลที่ซับซ้อนและละเอียดอ่อน หรือการเขียนเชิงสร้างสรรค์ ผลลัพธ์จะด้อยกว่า GPT-4o และ GPT-4 Turbo การทำตามคำสั่งอาจมีความน่าเชื่อถือน้อยลงสำหรับงานที่ต้องมีการจัดรูปแบบที่เข้มงวดหรือข้อจำกัดแบบหลายขั้นตอน นอกจากนี้ เนื่องจากเป็นรุ่นที่เล็กกว่า จุดตัดของความรู้ (มกราคม 2024) อาจล้าสมัยสำหรับเหตุการณ์ล่าสุดมาก นอกจากนี้ยังไม่รองรับความสามารถด้านการมองเห็นสำหรับการตรวจจับวัตถุแบบละเอียดหรือการจดจำใบหน้า
ราคาถูกกำหนดไว้ที่ $0.15 ต่อ 1 ล้าน input tokens และ $0.60 ต่อ 1 ล้าน output tokens นี่คืออัตรามาตรฐานของผู้ให้บริการ OpenAI และ OrcaRouter ไม่คิดค่าธรรมเนียมเพิ่มใดๆ จากอัตราดังกล่าว การเรียกเก็บเงินขึ้นอยู่กับจำนวน tokens ตามที่ผู้ให้บริการโมเดลรายงาน ไม่มีค่าธรรมเนียมเพิ่มเติมต่อคำขอหรือขั้นต่ำ นโยบายไม่คิดค่าธรรมเนียมเพิ่มนี้ใช้กับทุกโมเดลที่มีให้ผ่าน OrcaRouter ทำให้ราคาเท่ากับที่คุณจะจ่ายโดยตรงให้กับ OpenAI ความโปร่งใสนี้ช่วยให้ผู้ใช้วางแผนงบประมาณได้อย่างแม่นยำโดยไม่มีค่าใช้จ่ายที่ไม่คาดคิด
โทเค็นเอาต์พุตมีราคาแพงกว่าโทเค็นอินพุตถึงสี่เท่าต่อโทเค็น ($0.60 เทียบกับ $0.15 ต่อล้าน) สำหรับงานที่สร้างการตอบสนองยาว เช่น การสรุปโดยละเอียดหรือการสร้างโค้ด ต้นทุนเอาต์พุตอาจครอบงำ ผู้ใช้สามารถควบคุมการใช้งานโทเค็นเอาต์พุตได้ผ่านพารามิเตอร์ max_tokens และโดยการสร้างพรอมต์ที่กระตุ้นให้เกิดการตอบสนองที่กระชับ ในทางกลับกัน งานที่มีอินพุตขนาดใหญ่ (เช่น การประมวลผลเอกสารยาวที่มีรูปภาพจำนวนมาก) จะเกิดต้นทุนอินพุต หน้าต่างบริบทขนาดใหญ่ 128k ทำให้ง่ายต่อการรวมบริบทที่สำคัญ แต่ก็มาพร้อมกับอัตราอินพุตต่อโทเค็น การปรับสมดุลระหว่างความยาวอินพุตและเอาต์พุตเป็นกุญแจสำคัญในการจัดการต้นทุนโดยรวม
ปัจจุบัน OrcaRouter ไม่มีบริการแคชในตัวสำหรับคำขอ GPT-4o-mini นอกเหนือจากที่ OpenAI มีให้ในระดับ API ไม่มีส่วนลดตามปริมาณหรือตัวเลือกความจุที่สงวนไว้ผ่าน OrcaRouter; การกำหนดราคาเป็นแบบจ่ายตามการใช้งานในอัตราของผู้ให้บริการ OpenAI ผู้ใช้มีหน้าที่ใช้กลยุทธ์การแคชของตนเอง (เช่น ที่ชั้นแอปพลิเคชัน) เพื่อลดการเรียก API ที่ซ้ำกัน นโยบายไม่มีส่วนเพิ่มราคาหมายความว่าการเปลี่ยนแปลงราคาในอนาคตโดย OpenAI จะสะท้อนให้เห็นโดยอัตโนมัติ สำหรับกรณีการใช้งานที่มีปริมาณสูงมาก ข้อตกลงองค์กรโดยตรงกับ OpenAI อาจเสนอเงื่อนไขที่ดีกว่า แต่ผ่าน OrcaRouter ความเรียบง่ายของคีย์ API เดียวและการเรียกเก็บเงินแบบรวมอาจยังคงเป็นประโยชน์
รูปภาพที่ประมวลผลโดย GPT-4o-mini จะถูกแปลงเป็นโทเค็นตามความละเอียดและระดับรายละเอียด OpenAI ใช้อัลกอริทึมการคำนวณโทเค็นที่พิจารณาทั้งความกว้างและความสูง เช่น รูปภาพขนาด 1024x1024 ทั่วไปที่ระดับรายละเอียดสูงอาจใช้โทเค็นอินพุตประมาณ 2,000–3,000 โทเค็น เนื่องจากโทเค็นอินพุตคิดค่าบริการที่ $0.15 ต่อล้าน ต้นทุนต่อรูปจึงต่ำมาก (โดยทั่วไปต่ำกว่า 1 เซนต์) อย่างไรก็ตาม การประมวลผลหลายรูปในคำขอเดียวอาจเพิ่มขึ้นได้ ผู้ใช้สามารถควบคุมต้นทุนได้โดยใช้ระดับรายละเอียด `low` (ใช้โทเค็นประมาณ 85 โทเค็นต่อรูป) เมื่อไม่ต้องการความเที่ยงตรงสูง ควรตรวจสอบโทเค็นที่ใช้ในการตอบกลับของ API เสมอเพื่อทำความเข้าใจต้นทุนของรูปภาพ
ตั้งค่า API base URL ของคุณเป็น https://api.orcarouter.ai/v1 และใช้ model ID "openai/gpt-4o-mini-2024-07-18" API นี้เป็นไปตามรูปแบบ chat completions มาตรฐานของ OpenAI ตัวอย่างเช่น ใน Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]) พารามิเตอร์ทั้งหมด เช่น temperature, top_p, max_tokens, stream, และ stop sequences รองรับเหมือนกับ OpenAI API ดั้งเดิม การตอบสนองประกอบด้วยฟิลด์มาตรฐาน เช่น id, choices, usage พร้อมจำนวน token
สำหรับผลลัพธ์ที่แน่นอน (deterministic) ให้ตั้งค่า temperature=0 และ top_p=1 สำหรับงานที่ต้องการความคิดสร้างสรรค์ ค่า temperature ประมาณ 0.8–1.2 อาจเหมาะสม Max_tokens ควบคุมความยาวของคำตอบ ค่าเริ่มต้นคือ 16,384 เพื่อลดต้นทุนในการสร้างผลลัพธ์ ให้ตั้งค่า max_tokens ให้เหมาะสมกับความต้องการของคุณ เมื่อใช้ multimodal inputs ให้จัดโครงสร้างข้อความด้วยอาร์เรย์ของส่วนเนื้อหา: [{"type":"text","text":"Describe this:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}] สำหรับการประมวลผลไฟล์ ให้รวมเนื้อหาไฟล์เป็นข้อความหรือ base64 พารามิเตอร์ stop สามารถใช้เพื่อหยุดการสร้างข้อความที่ลำดับที่กำหนดเอง Stream=True ช่วยให้สามารถส่ง token แบบเรียลไทม์
การย้ายระบบต้องมีการเปลี่ยนแปลงง่ายๆ สามอย่าง: ตั้งค่า base_url เป็น https://api.orcarouter.ai/v1, แทนที่ API key ของคุณด้วย OrcaRouter API key, และเปลี่ยน model ID เป็น "openai/gpt-4o-mini-2024-07-18" ไม่จำเป็นต้องแก้ไขโค้ดอื่นใดอีกหากคุณใช้ไลบรารี OpenAI Python/Node.js หรือ HTTP client ใดๆ ที่เป็นไปตามรูปแบบ chat completions มาตรฐาน โครงสร้างการตอบกลับเหมือนกัน โปรดทราบว่า OrcaRouter ไม่ได้จำกัดคำขอของคุณแตกต่างจาก OpenAI; อัตราการจำกัดเดียวกันตามระดับบัญชี OpenAI ของคุณยังคงมีผล แต่คุณจัดการคีย์ผ่าน OrcaRouter ทดสอบด้วยคำขอเล็กๆ เพื่อตรวจสอบจำนวน token และความหน่วง
ระบุคีย์ API ของ OrcaRouter ในส่วนหัว Authorization: Authorization: Bearer <your-key>. API จะส่งรหัสสถานะ HTTP มาตรฐาน: 200 สำหรับสำเร็จ, 400 สำหรับคำขอไม่ถูกต้อง (เช่น พารามิเตอร์ไม่ถูกต้อง), 401 สำหรับไม่ได้รับอนุญาต (คีย์ API ผิด), 429 สำหรับการจำกัดอัตรา, และ 500 สำหรับข้อผิดพลาดเซิร์ฟเวอร์ การตอบสนองข้อผิดพลาดประกอบด้วยเนื้อหา JSON ที่มีออบเจ็กต์ข้อผิดพลาดซึ่งประกอบด้วยข้อความและประเภท ขอแนะนำให้ดำเนินการลองซ้ำด้วย exponential backoff สำหรับข้อผิดพลาด 429 และ 5xx OrcaRouter จะไม่แก้ไขการตอบสนองข้อผิดพลาดจาก OpenAI ดังนั้นข้อความแสดงข้อผิดพลาดเดียวกันกับที่คุณเห็นใน API โดยตรงจะปรากฏขึ้น
GPT-4o-mini มีความสามารถเหนือกว่า GPT-3.5-Turbo อย่างมีนัยสำคัญในด้านการให้เหตุผล คณิตศาสตร์ และการทำตามคำสั่ง โดยเห็นได้จากคะแนน MATH-500 ที่ 78.9 เทียบกับคะแนนทั่วไปของ GPT-3.5-Turbo ที่ประมาณ 30-40 นอกจากนี้ยังรองรับอินพุตแบบมัลติโมดัล (รูปภาพและไฟล์) ซึ่ง GPT-3.5-Turbo ไม่รองรับ ขนาดหน้าต่างบริบทใหญ่ขึ้น: 128k เทียบกับ 16k ราคา: GPT-4o-mini ($0.15/$0.60 ต่อล้านโทเคน) มีราคาแพงกว่า GPT-3.5-Turbo เล็กน้อย ($0.50/$1.50 สำหรับเวอร์ชัน 16k? จริงๆ แล้ว GPT-3.5-Turbo 0125 อยู่ที่ $0.50/$1.50 ต่อล้าน? เดี๋ยวก่อน GPT-3.5-Turbo มาตรฐานอยู่ที่ $1.50/$2.00 ต่อล้าน? ผมจะยึดตามข้อเท็จจริงที่ให้มา: ราคาของ GPT-4o-mini ถูกระบุไว้แล้ว เปรียบเทียบเชิงคุณภาพ: GPT-4o-mini ให้ประสิทธิภาพที่ดีกว่าในราคาที่สูงกว่า GPT-3.5-Turbo เล็กน้อย แต่มีความสามารถแบบมัลติโมดัล
GPT-4o-mini เป็นเวอร์ชันที่เล็กกว่าและคุ้มค่ากว่า GPT-4o แม้ว่าทั้งสองจะมีความสามารถแบบมัลติโหมดและขนาดหน้าต่างบริบทเดียวกัน (128k tokens) แต่ GPT-4o ทำคะแนนสูงกว่าในการวัดประสิทธิภาพเช่น MMLU และ MATH คะแนน MATH-500 ของ GPT-4o-mini ที่ 78.9 ต่ำกว่าคะแนนที่รายงานของ GPT-4o ที่ประมาณ 90–95 ราคาถูกกว่าอย่างเห็นได้ชัด: GPT-4o-mini ($0.15/$0.60) เทียบกับ GPT-4o ($2.50/$10.00 ต่อล้าน tokens) สำหรับแอปพลิเคชันที่ต้องการความแม่นยำสูงสุดในงานที่ซับซ้อนด้านการใช้เหตุผล GPT-4o เหมาะกว่า สำหรับงานที่มีปริมาณงานสูงและคำนึงถึงต้นทุนซึ่งสามารถยอมรับความแม่นยำระดับปานกลางได้ GPT-4o-mini ช่วยประหยัดได้อย่างมาก
โมเดลโอเพนซอร์สอย่าง Llama 3 8B และ 70B มีข้อดีคือสามารถโฮสต์เองได้โดยไม่มีค่าใช้จ่ายต่อโทเค็น แต่จำเป็นต้องมีโครงสร้างพื้นฐานและความเชี่ยวชาญ GPT-4o-mini ผ่าน OrcaRouter ให้การเข้าถึงแบบไร้เซิร์ฟเวอร์โดยไม่มีค่าใช้จ่ายล่วงหน้าและการปรับขนาดอัตโนมัติ ในการวัดประสิทธิภาพ คะแนน MATH-500 ของ GPT-4o-mini ที่ 78.9 ถือว่าแข่งขันได้กับ Llama 3 8B (ประมาณ 30-40) และใกล้เคียงกับ Llama 3 70B (ประมาณ 60-70) GPT-4o-mini ยังรองรับภาพในตัว ซึ่งโมเดลโอเพนซอร์สส่วนใหญ่ไม่รองรับ ข้อแลกเปลี่ยน: โมเดลโอเพนซอร์สให้ความเป็นส่วนตัวของข้อมูล (ไม่มีการเรียก API ภายนอก) และความหน่วงต่ำหากมีฮาร์ดแวร์สำหรับการอนุมาน GPT-4o-mini มอบความสะดวกในการใช้งานและความสามารถแบบหลายรูปแบบในราคาต่อโทเค็นที่ต่ำ
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| อินพุต / 1M โทเค็น | $0.150 |
| เอาต์พุต / 1M โทเค็น | $0.600 |
| อ่านแคช / 1M | $0.075 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/openai/gpt-4o-mini-2024-07-18เปิด @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18