GPT-4o ("o" ย่อมาจาก "omni") เป็นโมเดล AI ล่าสุดของ OpenAI ที่รองรับทั้งอินพุตข้อความและรูปภาพพร้อมเอาต์พุตข้อความ โดยยังคงรักษาระดับความฉลาดของ [GPT-4 Turbo](/models/openai/gpt-4-turbo) ในขณะที่เร็วกว่าสองเท่า...
GPT-4o (2024-05-13) เป็นโมเดลภาษาหลายรูปแบบ (multimodal) จาก OpenAI ที่สามารถเข้าถึงได้ผ่าน API ของ OrcaRouter โดยประมวลผลข้อความ รูปภาพ และไฟล์ ทำให้เหมาะสำหรับงานที่ผสมผสานข้อมูลภาพและข้อความ…
GPT-4o สามารถวิเคราะห์ภาพที่ถูกป้อนเป็นส่วนหนึ่งของอินพุตได้ โดยสามารถอธิบายเนื้อหาที่มองเห็น ตอบคำถามเกี่ยวกับวัตถุ ข้อความภายในภาพ และความสัมพันธ์เชิงพื้นที่ได้ นอกจากนี้ยังสามารถดึงข้อมูลและถอดความข้อความจากเอกสารที่สแกนหรือรูปถ่ายได้อีกด้วย เนื่องจากมันประมวลผลภาพโดยตรง คุณจึงไม่จำเป็นต้องมี OCR หรือโมเดลการมองเห็นแยกต่างหาก ภาพจะถูกแปลงเป็นโทเค็นเพื่อให้พอดีกับหน้าต่างบริบท (context window) ตัวอย่างเช่น ผู้ใช้สามารถอัปโหลดภาพหน้าจอของกราฟและขอให้โมเดลตีความแนวโน้มต่างๆ ความเข้าใจของโมเดลไม่ได้จำกัดเพียงคำบรรยายแบบธรรมดา แต่สามารถใช้เหตุผลเกี่ยวกับเนื้อหา เปรียบเทียบภาพหลายภาพ และใช้สัญญาณภาพควบคู่กับคำแนะนำที่เป็นข้อความได้ ความสามารถนี้ถูกรวมไว้ในการเรียก API เดียวกัน โดยใช้รูปแบบข้อความเดียวกันกับคำขอที่ใช้ข้อความเท่านั้น บน OrcaRouter คุณส่งภาพเป็นข้อมูลที่เข้ารหัส base64 หรือ URL ในอาร์เรย์เนื้อหา (content array) รหัสโมเดลยังคงเป็น "openai/gpt-4o-2024-05-13"
GPT-4o รองรับการใช้ไฟล์เป็นอินพุต รูปแบบที่รองรับได้แก่ PDF, เอกสาร Microsoft Office (Word, Excel, PowerPoint), ไฟล์ข้อความ และรูปแบบรูปภาพ สำหรับไฟล์ PDF และ Office โมเดลจะแยกส่วนเนื้อหาที่เป็นข้อความและวิเคราะห์เค้าโครง โมเดลไม่ได้แสดงรูปแบบที่ซับซ้อนโดยตรง แต่อ่านเนื้อหาที่เป็นข้อความ มีประโยชน์สำหรับการประมวลผลรายงาน สัญญา สเปรดชีต หรืองานนำเสนอโดยไม่ต้องดึงข้อมูลด้วยตนเอง เนื้อหาไฟล์จะถูกแปลงเป็นโทเค็นและนับรวมในจำนวนโทเค็นอินพุตทั้งหมด โมเดลสามารถตอบคำถามเกี่ยวกับเนื้อหาไฟล์ สรุปเนื้อหา หรือคำนวณข้อมูลในตาราง เมื่อใช้ไฟล์ คุณต้องรวมไฟล์เหล่านั้นเป็นส่วนหนึ่งของเนื้อหาข้อความโดยใช้ฟิลด์ OpenAI API ที่เหมาะสม OrcaRouter จัดการการส่งข้อมูลโดยไม่มีการปรับเปลี่ยน โปรดทราบว่าความสามารถของโมเดลขึ้นอยู่กับคุณภาพของข้อความที่แยกออกมา ภาพที่ถูกสแกนใน PDF อาจไม่สามารถอ่านได้อย่างสมบูรณ์เว้นแต่จะมีชั้นข้อความฝังอยู่
GPT-4o เป็นโมเดลระดับพรีเมียมที่มีต้นทุนสูงกว่าตัวเลือกอื่นๆ เช่น GPT-4o-mini หรือ GPT-3.5 รุ่นก่อนหน้า หากงานของคุณไม่ต้องการความสามารถแบบมัลติโมดัล (เช่น งานที่ใช้ข้อความอย่างเดียว) บริบทขนาดใหญ่ (สูงสุด 128K) หรือระดับการใช้เหตุผลทางคณิตศาสตร์ที่วัดโดย MATH-500 (79.1) โมเดลที่ถูกกว่าอาจประหยัดกว่า ตัวอย่างเช่น การจำแนกประเภทอย่างง่าย การสร้างเนื้อหาสั้นๆ หรือการสนทนาพื้นฐาน สามารถจัดการได้โดยโมเดลราคาถูกที่ยังคงให้คุณภาพที่ยอมรับได้ นอกจากนี้ หากแอปพลิเคชันของคุณไวต่อความหน่วง และโมเดลที่เล็กกว่าเร็วกว่า การแลกเปลี่ยนอาจให้น้ำหนักกับความเร็วมากกว่าความแม่นยำที่สมบูรณ์แบบ สุดท้าย หากคุณไม่ค่อยต้องประมวลผลรูปภาพหรือไฟล์ ความสามารถมัลติโมดัลที่เพิ่มเข้ามาก็ไม่จำเป็น OrcaRouter มีโมเดลให้เลือกหลากหลายเพื่อให้คุณสามารถเลือกอัตราส่วนราคาต่อประสิทธิภาพที่ดีที่สุด ประเมินความต้องการของกรณีการใช้งานของคุณเทียบกับคะแนนมาตรฐานและราคา เพื่อพิจารณาว่าข้อดีของ GPT-4o คุ้มค่ากับต้นทุนที่เพิ่มขึ้นหรือไม่
GPT-4o สามารถสร้างโทเค็นได้สูงสุด 16,384 โทเค็นต่อคำขอ ซึ่งเป็นขีดจำกัดที่ให้พื้นที่มากพอสำหรับคำตอบแบบยาว โค้ดโดยละเอียด หรือการวิเคราะห์หลายย่อหน้า อย่างไรก็ตาม โทเค็นเอาต์พุตจะถูกคิดค่าใช้จ่ายในอัตรา $15.00 ต่อล้านโทเค็น ทำให้เอาต์พุตที่ยาวขึ้นมีราคาแพงขึ้น คุณสามารถควบคุมความยาวของเอาต์พุตได้โดยใช้พารามิเตอร์ max_tokens ในการเรียก API หากคุณคาดว่าจะต้องสร้างเอาต์พุตที่ยาวมาก ให้พิจารณาแบ่งคำขอหรือแยกเป็นชุด ขีดจำกัด 16,384 โทเค็นนี้ใช้กับผลลัพธ์ทั้งหมด รวมถึงขั้นตอนการให้เหตุผลหรือ chain-of-thought หากมีการร้องขอ สำหรับงานที่ซับซ้อนมากซึ่งต้องใช้การคิดที่ยาวนาน คุณอาจต้องใช้การเรียก API หลายครั้ง บน OrcaRouter จำนวนโทเค็นเอาต์พุตจะถูกรายงานในฟิลด์ usage ของการตอบกลับ API ดังนั้นคุณสามารถติดตามค่าใช้จ่ายได้อย่างแม่นยำ ไม่มีขีดจำกัดเพิ่มเติมจาก OrcaRouter โดยจะมีเพียงขีดจำกัดดั้งเดิมของโมเดลเท่านั้น
GPT-4o ได้คะแนน 79.1 ในการวัดประสิทธิภาพ MATH-500 MATH-500 ประกอบด้วยโจทย์คณิตศาสตร์ที่ท้าทายจำนวน 500 ข้อ ในหัวข้อต่างๆ เช่น พีชคณิต เรขาคณิต ทฤษฎีจำนวน และความน่าจะเป็น คะแนน 79.1 หมายความว่าโมเดลตอบคำถามได้ถูกต้อง 79.1% นี่เป็นผลลัพธ์ที่แข็งแกร่งซึ่งบ่งบอกถึงความสามารถในการให้เหตุผลทางคณิตศาสตร์ที่มั่นคง โดยเฉพาะอย่างยิ่งสำหรับโมเดล multimodal การวัดนี้ทดสอบทั้งการแก้ปัญหาและการให้เหตุผลทีละขั้นตอน คะแนนนี้สามารถใช้เป็นแนวทางสำหรับความคาดหวังในแอปพลิเคชันที่เกี่ยวข้องกับการสอนคณิตศาสตร์ การคำนวณทางวิทยาศาสตร์ หรือปริศนาตรรกะ โปรดทราบว่าประสิทธิภาพในการวัดไม่ได้รับประกันผลลัพธ์ที่เหมือนกันในงานจริง อาจจำเป็นต้องมีการปรับแต่งเฉพาะโดเมนหรือการออกแบบ prompt เมื่อพิจารณาโมเดลนี้ ให้เปรียบเทียบคะแนน MATH-500 กับโมเดลอื่นๆ ที่คุณประเมิน OrcaRouter ไม่ได้ให้ข้อมูลการวัดเพิ่มเติม ดังนั้นนี่จึงเป็นจุดอ้างอิงเดียวที่ให้ไว้สำหรับโมเดลนี้
ความหน่วงขึ้นอยู่กับหลายปัจจัย ได้แก่ ความยาวของอินพุต ความยาวของเอาต์พุตที่คาดหวัง โหลดปัจจุบันบนเซิร์ฟเวอร์ของ OpenAI และเส้นทางเครือข่ายระหว่างแอปพลิเคชันของคุณกับ OrcaRouter OrcaRouter ไม่ได้เพิ่มโอเวอร์เฮดที่มีนัยสำคัญเกินกว่าเวลาตอบสนองของผู้ให้บริการพื้นฐาน สำหรับคำขอทั่วไปที่มีอินพุตขนาดปานกลาง (ไม่กี่พันโทเค็น) และเอาต์พุตสั้น (ต่ำกว่า 1,000 โทเค็น) การตอบสนองมักจะมาถึงภายในไม่กี่วินาที เอาต์พุตที่ยาวขึ้น (ใกล้ 16,384 โทเค็น) จะใช้เวลามากขึ้นโดยธรรมชาติเนื่องจากโมเดลสร้างโทเค็นตามลำดับ อินพุตรูปภาพยังเพิ่มความหน่วงเนื่องจากการแปลงเป็นโทเค็นและการประมวลผล คุณสามารถปรับความหน่วงให้เหมาะสมโดยการลดความยาวเอาต์พุต ใช้พรอมต์ที่สั้นลง หรือการรวมคำขอเป็นชุด OrcaRouter มีปลายทาง API มาตรฐานที่ส่งคืนผลลัพธ์แบบอะซิงโครนัสผ่านสตรีมมิ่งหากต้องการ สำหรับแอปพลิเคชันแบบโต้ตอบแบบเรียลไทม์ ให้พิจารณาใช้โหมดสตรีมมิ่ง (stream: true) เพื่อเริ่มประมวลผลทันทีที่โทเค็นมาถึง ไม่มีการระบุตัวเลขความหน่วงที่เฉพาะเจาะจงในข้อมูลโมเดล ดังนั้นสิ่งเหล่านี้จึงเป็นประมาณการเชิงคุณภาพ
จุดแข็ง: การรับข้อมูลแบบหลายรูปแบบ (ข้อความ, รูปภาพ, ไฟล์), หน้าต่างบริบทขนาดใหญ่ 128K, ความสามารถในการให้เหตุผลทางคณิตศาสตร์ที่แข็งแกร่ง (MATH-500: 79.1), และขีดจำกัดโทเค็นเอาต์พุตสูง (16,384) รองรับเอกสารยาวและการสนทนาหลายรอบได้อย่างมีประสิทธิภาพ API เป็นมาตรฐานที่เข้ากันได้กับ OpenAI ทำให้การผสานรวมง่ายขึ้น ข้อจำกัด: ต้นทุนสูงกว่าเมื่อเทียบกับโมเดลขนาดเล็ก ไม่ได้รับการปรับให้เหมาะสมสำหรับงานที่ไม่ได้รับประโยชน์จากความหลายรูปแบบหรือบริบทขนาดใหญ่ ไม่มีข้อมูลเกี่ยวกับประสิทธิภาพในภาษาที่ไม่ใช่ภาษาอังกฤษหรือเกณฑ์มาตรฐานด้านความปลอดภัยเฉพาะ ความสามารถในการเข้าใจรูปภาพอาจมีจำกัดสำหรับฉากที่ซับซ้อนมากหรือรูปภาพความละเอียดต่ำ นอกจากนี้ โมเดลอาจให้คำตอบที่ไม่ถูกต้องสำหรับปัญหาที่อยู่นอกการกระจายการฝึก ไม่มีการรับประกันความหน่วงที่เปิดเผย สำหรับผู้ใช้ที่ต้องการความหน่วงต่ำมากหรือต้นทุนต่ำมาก อาจใช้โมเดลอื่นได้ดีกว่า คะแนนเกณฑ์มาตรฐานที่ 79.1 บน MATH-500 แสดงให้เห็นว่ายังมีพื้นที่ให้ปรับปรุงในปัญหาคณิตศาสตร์ที่ยากที่สุด ประเมินว่าข้อแลกเปลี่ยนเหล่านี้สอดคล้องกับข้อกำหนดของแอปพลิเคชันของคุณหรือไม่
GPT-4o คิดค่าบริการต่อ token โดยมีอัตราแยกสำหรับ input tokens และ output tokens input tokens อยู่ที่ $5.00 ต่อ 1 ล้าน token output tokens อยู่ที่ $15.00 ต่อ 1 ล้าน token นี่คืออัตราของผู้ให้บริการ ซึ่ง OrcaRouter ส่งผ่านโดยไม่มี markup ค่าใช้จ่ายต่อคำขอ = (input tokens/1e6 * 5) + (output tokens/1e6 * 15) ตัวอย่างเช่น การสนทนาที่มี input tokens 4,000 tokens และ output tokens 200 tokens จะมีค่าใช้จ่าย (0.004*$5) + (0.0002*$15) = $0.02 + $0.003 = $0.023 ไม่มีค่าธรรมเนียมเพิ่มเติมสำหรับการเรียก API เอง คุณจ่ายเฉพาะ token ที่ใช้เท่านั้น ราคาจะถูกอัปเดตแบบไดนามิกตามการเปลี่ยนแปลงของผู้ให้บริการ OrcaRouter จะส่งผ่านการปรับเปลี่ยนในอนาคตใดๆ เนื่องจากไม่มี markup ผู้ใช้จึงได้รับอัตราเดียวกับลูกค้า OpenAI โดยตรง แต่มีความสะดวกสบายจากการจัดการและการเรียกเก็บเงินแบบรวมศูนย์ของ OrcaRouter โปรดทราบว่ารูปภาพและไฟล์จะถูก tokenized และนับเป็นส่วนหนึ่งของ input token count ซึ่งมักจะเพิ่มค่าใช้จ่ายเมื่อเทียบกับ input ที่เป็นข้อความอย่างเดียว
ไม่ OrcaRouter ไม่มีส่วนลด โทเค็นที่ถูกแคช หรือราคาที่ลดลงสำหรับอินพุตซ้ำๆ ทุกโทเค็นจะถูกคิดค่าใช้จ่ายในอัตรามาตรฐานของผู้ให้บริการ ไม่มีค่าใช้จ่ายแยกต่างหากสำหรับการแคชหรือค่าธรรมเนียมเพิ่มเติมสำหรับปริมาณที่สูง อัตรา $5/$15 ต่อล้านโทเค็นเป็นอัตราคงที่ ผู้ใช้ที่ต้องการปริมาณงานที่สูงมากอาจสอบถามเกี่ยวกับการจัดการแบบกำหนดเอง แต่บริการมาตรฐานไม่รวมส่วนลดตามปริมาณ นอกจากนี้ ไม่มีค่าธรรมเนียมแอบแฝง เช่น ค่าธรรมเนียมการเชื่อมต่อหรือค่าขั้นต่ำรายเดือน ราคามีความโปร่งใสและเชื่อมโยงโดยตรงกับการใช้งานโทเค็น สำหรับการปรับต้นทุนให้เหมาะสม ให้พิจารณาลดขนาดอินพุต (เช่น การตัดทอนประวัติ การใช้พรอมต์ที่สั้นกว่า) และความยาวเอาต์พุต (เช่น การตั้งค่า max_tokens ให้ต่ำลง) นอกจากนี้ การใช้โมเดลเฉพาะเมื่อความสามารถของมันจำเป็น (มัลติโมดัล บริบทขนาดใหญ่) ช่วยควบคุมต้นทุน หากแอปพลิเคชันของคุณมีพรอมต์ซ้ำๆ ที่เหมือนกันทุกครั้ง การแคชในเลเยอร์แอปพลิเคชันอาจลดการใช้โทเค็น แต่ OrcaRouter เองไม่มีฟีเจอร์ดังกล่าว
GPT-4o มีราคาระดับพรีเมียม สำหรับหลายๆ งาน โมเดลที่ถูกกว่า (เช่น GPT-4o-mini หรือ GPT-3.5-turbo) อาจเพียงพอ ควรตัดสินใจโดยประเมินความซับซ้อนและความแม่นยำที่ต้องการ หากงานของคุณเกี่ยวข้องกับการดึงข้อมูลหรือการจำแนกประเภทอย่างง่ายที่มีบริบทจำกัด โมเดลที่ถูกกว่าอาจทำงานได้ใกล้เคียงในราคาที่ต่ำกว่ามาก ในทางกลับกัน หากงานต้องการความเข้าใจที่ละเอียดอ่อนในภาพ เอกสารยาว หรือความแม่นยำทางคณิตศาสตร์สูง (คะแนน MATH-500 ที่ 79.1 เทียบกับคะแนนที่ต่ำกว่าบนโมเดลที่ถูกกว่า) GPT-4o อาจคุ้มค่ากับราคาระดับพรีเมียม ใช้การทดสอบ A/B กับตัวอย่างที่เป็นตัวแทนเพื่อเปรียบเทียบคุณภาพและต้นทุน นอกจากนี้ โปรดทราบว่าราคาต่อล้านโทเค็นจะเท่ากันไม่ว่าจะมีความยาวข้อความเท่าใด คำขอที่สั้นกว่าจะมีต้นทุนที่ต่ำกว่า หากเวิร์กโฟลว์ของคุณใช้บริบท 128K เต็มบ่อยครั้ง ต้นทุนโทเค็นอินพุตสำหรับคำขอนั้นอาจสูง ควรตรวจสอบให้แน่ใจว่าจำเป็นต้องใช้บริบทนั้นจริงๆ OrcaRouter มีเมตริกการใช้งานเพื่อให้คุณสามารถตรวจสอบและปรับให้เหมาะสมได้
หากต้องการเรียกใช้ GPT-4o บน OrcaRouter ให้ใช้ปลายทาง API ที่เข้ากันได้กับ OpenAI: base_url = "https://api.orcarouter.ai/v1" ตั้งค่าพารามิเตอร์ model เป็น "openai/gpt-4o-2024-05-13" คุณจะต้องใช้คีย์ API จาก OrcaRouter รูปแบบคำขอเป็นไปตามมาตรฐาน OpenAI Chat Completions API: messages array พร้อมบทบาท (system, user, assistant), เนื้อหาเสริมสำหรับรูปภาพและไฟล์, และพารามิเตอร์ต่างๆ เช่น temperature, max_tokens, top_p, frequency_penalty, presence_penalty, และ stop ตัวอย่างเช่น คำขอข้อความธรรมดาจะถูกส่งเป็น POST ไปยัง /chat/completions สำหรับรูปภาพ ให้รวมเนื้อหาเป็นส่วนหนึ่งของ user message โดยมี type เป็น "image_url" สำหรับไฟล์ ให้รวมไว้ในเนื้อหาด้วย (รูปแบบเฉพาะเป็นไปตามข้อกำหนดของ OpenAI) การตอบกลับจะประกอบด้วยข้อความของผู้ช่วย, สถิติการใช้งาน (prompt_tokens, completion_tokens, total_tokens), และข้อมูลเมตาอื่นๆ ไม่จำเป็นต้องมีหัวพิเศษนอกเหนือจาก Content-Type และ Authorization มาตรฐาน การผสานรวมเหมือนกับการใช้ OpenAI โดยตรง
พารามิเตอร์มาตรฐานทั้งหมดของ OpenAI Chat Completions ได้รับการสนับสนุน: messages (จำเป็น), model (จำเป็น, ตั้งค่าเป็น "openai/gpt-4o-2024-05-13"), temperature (0–2, ค่าเริ่มต้น 1), top_p (0–1, ค่าเริ่มต้น 1), n (จำนวนการตอบกลับ, ค่าเริ่มต้น 1), stop (สตริงหรือรายการสตริง), max_tokens (ค่าเริ่มต้น 16,384, สูงสุดที่ 16,384), presence_penalty (−2 ถึง 2, ค่าเริ่มต้น 0), frequency_penalty (−2 ถึง 2, ค่าเริ่มต้น 0), logit_bias (แผนที่ของรหัสโทเค็นเป็นค่าความเอนเอียง), user (สตริงสำหรับการตรวจสอบการละเมิด), stream (บูลีน, ค่าเริ่มต้น false), และ functions/tools (สำหรับการเรียกฟังก์ชัน) สำหรับอินพุตแบบมัลติโมดัล เนื้อหาของ messages สามารถเป็นอาร์เรย์ของส่วนเนื้อหาที่มีประเภท "text" หรือ "image_url" นอกจากนี้ คุณสามารถรวมเนื้อหาประเภท "file" ตามเอกสารของ OpenAI (เช่น สำหรับไฟล์แนบ PDF) OrcaRouter ส่งต่อพารามิเตอร์เหล่านี้ไปยังผู้ให้บริการโดยตรงโดยไม่มีการปรับเปลี่ยน ตรวจสอบให้แน่ใจว่าคุณไม่เกินหน้าต่างบริบทของ 128K tokens API จะส่งคืนรหัสข้อผิดพลาดมาตรฐานสำหรับคำขอที่ไม่ถูกต้อง การจำกัดอัตรา หรือความล้มเหลวในการตรวจสอบสิทธิ์
การย้ายระบบทำได้ง่ายเพราะ API ของ OrcaRouter เข้ากันได้กับ OpenAI อย่างสมบูรณ์ สิ่งที่คุณต้องเปลี่ยนมีเพียงสองอย่าง: base URL จาก https://api.openai.com/v1 เป็น https://api.orcarouter.ai/v1 และรหัสโมเดลจาก "gpt-4o-2024-05-13" เป็น "openai/gpt-4o-2024-05-13" คีย์ API ของคุณจาก OrcaRouter จะแทนที่คีย์ OpenAI ของคุณ โค้ดที่มีอยู่ทั้งหมดที่ใช้ไลบรารี OpenAI Python/Node หรือคำขอ HTTP แบบ raw จะทำงานได้โดยไม่ต้องแก้ไขอื่น ๆ รูปแบบข้อความ ชื่อพารามิเตอร์ และโครงสร้างการตอบสนองเหมือนกัน สำหรับไลบรารีที่รับพารามิเตอร์ base URL เพียงแค่ตั้งค่าเป็น endpoint ของ OrcaRouter หากคุณใช้ client ของ OpenAI อยู่ คุณสามารถสร้าง instance โดยตั้งค่า base_url เป็น endpoint ของ OrcaRouter ไม่จำเป็นต้องเปลี่ยนแปลง prompt engineering หรือ caching logic OrcaRouter รองรับ streaming (stream: true) และ function calling เหมือนเดิมทุกประการ การทดสอบสามารถทำได้โดยใช้คำขอจำนวนน้อยเพื่อยืนยันว่าพฤติกรรมตรงกัน
OrcaRouter ไม่ได้ปรับเปลี่ยนพฤติกรรมของโมเดล มันทำหน้าที่เป็นเกตเวย์ล้วนๆ โดยส่งต่อคำขอของคุณไปยังเซิร์ฟเวอร์ของ OpenAI และส่งคืนคำตอบตามต้นฉบับทุกประการ ไม่มีการประมวลผลล่วงหน้า การประมวลผลภายหลัง หรือการกรองเนื้อหาเพิ่มเติมโดย OrcaRouter ในส่วนของการจัดการข้อมูล: OrcaRouter จะไม่จัดเก็บหรือบันทึกข้อมูล prompt หรือ completion เกินกว่าที่จำเป็นสำหรับการเรียกเก็บเงินและการตรวจสอบการดำเนินงาน นโยบายข้อมูลของ OpenAI เองมีผลกับการใช้งานโมเดลผ่าน OrcaRouter ตามข้อเท็จจริงที่ให้ไว้ ไม่มีการกล่าวถึงการเก็บรักษาข้อมูลโดย OrcaRouter นอกเหนือจากการบันทึก API มาตรฐาน ผู้ใช้ควรตรวจสอบทั้งนโยบายความเป็นส่วนตัวของ OrcaRouter และนโยบายของ OpenAI เพื่อทำความเข้าใจการจัดการข้อมูล หากคุณมีข้อกำหนดด้านการจัดเก็บข้อมูลเฉพาะ (data residency) ที่เข้มงวด โปรดปรึกษากับ OrcaRouter เกี่ยวกับตัวเลือกที่มี ไม่มีข้อบ่งชี้ว่า OrcaRouter แบ่งปันข้อมูลกับลูกค้ารายอื่น เฉพาะรหัสโมเดล (model ID) เท่านั้นที่ต้องปรับเปลี่ยน ไม่มีการแทรกคำสั่งที่กำหนดเอง
ความแตกต่างหลักระหว่าง GPT-4o และ GPT-4o-mini คือขนาดหน้าต่างบริบท ความสามารถหลายรูปแบบ (multimodal) ประสิทธิภาพการทดสอบมาตรฐาน และต้นทุน GPT-4o มีหน้าต่างบริบทขนาด 128K และรองรับการป้อนข้อมูลรูปภาพและไฟล์ GPT-4o-mini (ตามข้อเสนอของ OpenAI) โดยทั่วไปจะมีบริบทที่เล็กกว่า (เช่น 128K หรือ 16K ในบางเวอร์ชัน) และอาจไม่รองรับทุกโมดาลิตี้ ในการทดสอบ MATH-500 GPT-4o ได้คะแนน 79.1 ส่วน GPT-4o-mini จะได้คะแนนต่ำกว่า ราคา: GPT-4o ราคา $5/$15 ต่อล้านโทเค็น ในขณะที่ GPT-4o-mini ถูกกว่าอย่างเห็นได้ชัด (เช่น $0.15/$0.60 ต่อล้านโทเค็นในบางเวอร์ชัน) ดังนั้น GPT-4o-mini จึงเหมาะสำหรับงานที่ง่ายกว่า ซึ่งต้นทุนที่ต่ำกว่ามีความสำคัญที่สุด ในขณะที่ GPT-4o เหมาะสำหรับการใช้เหตุผลที่ซับซ้อน งานบริบทยาว และงานหลายรูปแบบมากกว่า เมื่อเลือกระหว่างทั้งสอง ให้พิจารณาข้อกำหนดด้านความแม่นยำและความจำเป็นในการใช้การมองเห็นหรือการจัดการไฟล์ OrcaRouter นำเสนอทั้งสองโมเดลภายใต้รหัสประจำตัวที่แตกต่างกัน หากปริมาณงานของคุณแทบไม่ใช้รูปภาพหรือบริบทขนาดใหญ่ GPT-4o-mini อาจเป็นตัวเลือกที่เหนือกว่าทางเศรษฐกิจ
GPT-4o (2024-05-13) เป็นโมเดล multimodal ที่มี context window ขนาด 128K ในขณะที่ GPT-4 รุ่นเก่า (เช่น gpt-4-0613) โดยทั่วไปจะมี context ขนาด 8K หรือ 32K และเป็น text-only (บางรุ่นหลังรองรับภาพผ่าน vision endpoints แยกต่างหาก) ราคาของ GPT-4o ($5/$15 ต่อล้าน tokens) โดยทั่วไปต่ำกว่าราคา GPT-4 Turbo ที่จุดสูงสุด (เช่น $10/$30 ต่อล้าน tokens) ผลการวัดประสิทธิภาพ: คะแนน MATH-500 ที่ให้มาคือ 79.1 สำหรับ GPT-4o; GPT-4 ไม่มีคะแนน MATH-500 อย่างเป็นทางการในข้อมูลที่ให้มา แต่เป็นที่รู้กันว่าได้คะแนนต่ำกว่าในการวัดประสิทธิภาพทางคณิตศาสตร์ที่คล้ายกัน GPT-4o ยังมีขีดจำกัดเอาต์พุตที่สูงกว่า (16K tokens) เมื่อเทียบกับ GPT-4 รุ่นเก่า (4K หรือ 8K ขึ้นอยู่กับรุ่น) โดยรวมแล้ว GPT-4o ให้คุณค่าที่ดีกว่าสำหรับแอปพลิเคชัน multimodal และ long-context อย่างไรก็ตาม GPT-4 รุ่นเก่าอาจถูก fine-tuned สำหรับงานเฉพาะ; ควรประเมินด้วยข้อมูลของคุณเอง ผ่าน OrcaRouter สามารถเข้าถึงทั้งสองตระกูลโมเดลได้
การเปรียบเทียบโดยตรงจำเป็นต้องมีข้อมูลเฉพาะของโมเดลซึ่งไม่ได้ระบุไว้ที่นี่ โดยทั่วไปแล้ว ทั้งสองโมเดลมีการแข่งขันด้านความสามารถในการใช้เหตุผลและความสามารถหลายรูปแบบ GPT-4o มีหน้าต่างบริบทขนาด 128K ซึ่งใกล้เคียงกับหน้าต่างบริบทขนาด 200K ของ Claude (สำหรับ Sonnet) ทั้งสองรองรับรูปภาพ คะแนนเกณฑ์มาตรฐานแตกต่างกัน: GPT-4o ให้คะแนน MATH-500 ที่ 79.1; ส่วนคะแนนของ Claude 3.5 Sonnet ในเกณฑ์มาตรฐานนั้นไม่ได้ระบุไว้ การกำหนดราคา: GPT-4o อยู่ที่ $5/$15 ต่อล้านโทเค็น; โดยทั่วไปราคาของ Claude Sonnet อยู่ที่ประมาณ $3/$15 ต่อล้านโทเค็น (อาจมีการเปลี่ยนแปลง) ดังนั้นต้นทุนอินพุตสำหรับ GPT-4o จึงสูงกว่า ความแตกต่างด้านประสิทธิภาพขึ้นอยู่กับงาน: ผู้ใช้บางคนพบว่า Claude เหนือกว่าสำหรับการเขียนแบบยาว ในขณะที่ GPT-4o โดดเด่นในด้านคณิตศาสตร์และการเขียนโค้ด หากไม่มีการประเมินแบบควบคุม ขอแนะนำให้ทดสอบทั้งสองโมเดลกับตัวอย่างที่เป็นตัวแทน OrcaRouter มีทั้งสองโมเดล คุณจึงสามารถเปรียบเทียบได้ง่ายโดยการเปลี่ยนรหัสโมเดล ท้ายที่สุด โมเดลที่ดีที่สุดขึ้นอยู่กับข้อกำหนดเฉพาะของคุณในด้านความแม่นยำ ความหน่วง และต้นทุน ข้อมูลที่ให้ไว้ไม่รวมคะแนนของ Claude ดังนั้นการเปรียบเทียบนี้จึงยังคงเป็นเชิงคุณภาพ
Llama 3 (เช่น Llama 3 70B) เป็นโมเดลโอเพนซอร์สที่สามารถโฮสต์เองได้ ในขณะที่ GPT-4o เป็นโมเดลแบบปิดและเข้าถึงผ่าน API GPT-4o รองรับอินพุตแบบมัลติโมดัล (ข้อความ รูปภาพ ไฟล์) ด้วยบริบท 128K ในขณะที่ Llama 3 โดยทั่วไปรองรับเฉพาะข้อความ (ยกเว้นจะถูกปรับแต่งสำหรับการมองเห็น) และมีบริบทที่เล็กกว่า (เช่น 8K หรือ 32K) คะแนน benchmark: คะแนน MATH-500 ของ GPT-4o คือ 79.1; Llama 3 70B ได้คะแนนประมาณ 70–75 ใน benchmark คณิตศาสตร์ที่คล้ายกัน (ไม่ได้ระบุในข้อเท็จจริง แต่เป็นความรู้ทั่วไป) ต้นทุน: ค่าใช้จ่าย API ต่อ token ของ GPT-4o คงที่; การโฮสต์ Llama 3 ด้วยตนเองเกี่ยวข้องกับต้นทุนโครงสร้างพื้นฐาน (GPU ค่าไฟฟ้า) ซึ่งสามารถต่ำกว่าได้เมื่อมีปริมาณมาก เวลาแฝง: GPT-4o ที่ใช้ API อาจเร็วกว่าสำหรับงานที่มีการใช้งานเป็นช่วง; โมเดลที่โฮสต์เองสามารถให้เวลาแฝงที่สม่ำเสมอหากมีการสำรองความจุ ความยืดหยุ่น: Llama 3 สามารถปรับแต่งได้; GPT-4o ไม่สามารถ สำหรับผู้ใช้ที่ต้องการหลีกเลี่ยงการผูกขาดกับผู้ให้บริการหรือจัดการข้อมูลที่ละเอียดอ่อนภายในองค์กรอย่างสมบูรณ์ โมเดลโอเพนซอร์สก็น่าสนใจ OrcaRouter ให้การเข้าถึงทั้งสองประเภท: คุณสามารถใช้ GPT-4o ผ่าน API และยังสามารถเข้าถึงโมเดลโอเพนซอร์สผ่าน OrcaRouter ได้หากมี
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-05-13",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamtemperaturetool_choicetoolstop_logprobstop_pweb_search_options| อินพุต / 1M โทเค็น | $5.00 |
|---|---|
| เอาต์พุต / 1M โทเค็น | $15.00 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
สิ่งที่นักพัฒนาพูดถึงในสัปดาห์นี้
GET /api/public/models/openai/gpt-4o-2024-05-13เปิด @misc{orcarouter_gpt_4o_2024_05_13,
title = {GPT-4o (2024-05-13) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13}
}OpenAI. (2024). GPT-4o (2024-05-13) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13