โมเดลข้อความที่คุ้มค่าจาก OpenAI ซึ่งมีคะแนน MMLU-Pro 46.2 และเข้าถึงผ่าน OrcaRouter API
openai/gpt-3.5-turbo-0125 เป็นโมเดลสร้างข้อความที่พัฒนาโดย OpenAI และใช้งานได้ผ่าน API ของ OrcaRouter เป็นส่วนหนึ่งของตระกูล GPT-3.5-Turbo…
GPT-3.5-Turbo-0125 มีความสามารถโดดเด่นในงานที่ใช้ข้อความหลากหลายประเภท รวมถึงการสนทนา การสรุปความ การแปล การตอบคำถาม และการสร้างเนื้อหา มันจัดการกับคำสั่งได้ดีและสามารถสร้างคำตอบที่สอดคล้องและเหมาะสมกับบริบทสำหรับการสนับสนุนลูกค้า การระดมสมอง และการติดป้ายกำกับข้อมูล ข้อมูลฝึกของมันครอบคลุมโดเมนที่หลากหลายจนถึงเดือนเมษายน 2023 ทำให้มีประสิทธิภาพที่สมเหตุสมผลในความรู้ทั่วไปและรูปแบบการเขียน สำหรับผลลัพธ์ที่มีโครงสร้าง มันสามารถจัดรูปแบบ JSON หรือทำตามแบบแผนที่กำหนดเองเมื่อได้รับคำสั่งที่ชัดเจน
ถ้าแอปพลิเคชันของคุณเกี่ยวข้องกับปริมาณงานที่สูงมากและมีงานที่เรียบง่ายซ้ำๆ เช่น การจำแนกประเภทตรงไปตรงมาหรือการสร้างประโยคเดี่ยว คุณอาจพิจารณาใช้โมเดลขนาดเล็กเช่น GPT-3.5-Turbo-Instruct หรือแม้แต่ทางเลือกโอเพนซอร์สที่โฮสต์บน OrcaRouter การประหยัดต้นทุนจะมีความสำคัญเมื่อจำนวนโทเค็นต่ำและข้อกำหนดด้านความแม่นยำมีน้อย อย่างไรก็ตาม GPT-3.5-Turbo-0125 ยังคงเป็นตัวเลือกที่คุ้มค่าสำหรับการใช้งานทั่วไปส่วนใหญ่ โดยเฉพาะอย่างยิ่งเมื่อพิจารณาจากคะแนนมาตรฐานที่แข็งแกร่งที่ 46.2 บน MMLU-Pro
ใช่ โมเดลนี้ได้รับการฝึกฝนด้วยข้อความหลายภาษา แม้ว่าประสิทธิภาพที่ดีที่สุดจะอยู่ในภาษาอังกฤษก็ตาม สามารถเข้าใจและสร้างข้อความในหลายภาษา เช่น สเปน ฝรั่งเศส จีน อาหรับ และอื่นๆ ความแม่นยำอาจลดลงสำหรับภาษาที่มีข้อมูลการฝึกจำกัดหรือสำหรับสำนวนที่มีความหมายเฉพาะตัว สำหรับงานที่ต้องการความคล่องแคล่วหลายภาษาในระดับสูง ควรพิจารณาเสริมด้วยการปรับแต่งเฉพาะภาษาหรือใช้โมเดลพื้นเมือง อินพุตและเอาต์พุตเป็นข้อความเสมอ ดังนั้นจึงรองรับอักขระที่ไม่ใช่ภาษาอังกฤษ
เนื่องจากหน้าต่างบริบททั้งหมดมี 16,385 โทเค็น (ข้อกำหนดสาธารณะที่เป็นที่รู้จักอย่างกว้างขวาง) โมเดลสามารถประมวลผลเอกสารที่มีความยาวปานกลางได้ในครั้งเดียว อย่างไรก็ตาม ผลลัพธ์ถูกจำกัดไว้ที่ 4096 โทเค็นต่อคำขอ สำหรับผลลัพธ์ที่ยาวขึ้น คุณต้องใช้แนวทางแบบ map-reduce หรือ sliding window กลไกความสนใจของโมเดลสามารถรักษาความสอดคล้องทั่วทั้งบริบท แต่ประสิทธิภาพอาจลดลงสำหรับงานที่ต้องการอ้างอิงถึงจุดเริ่มต้นของพรอมต์ที่ยาว แนะนำให้ใช้กลยุทธ์การแบ่งส่วนและการสรุปสำหรับข้อความที่ยาวมาก
MMLU-Pro เป็นเวอร์ชันที่ปรับปรุงของเกณฑ์ชี้วัด Massive Multitask Language Understanding ซึ่งวัดความสามารถของโมเดลในการตอบคำถามใน 57 หัวข้อ รวมถึงวิทยาศาสตร์ กฎหมาย และมนุษยศาสตร์ คะแนน 46.2 บ่งชี้ว่า GPT-3.5-Turbo-0125 สามารถตอบคำถามได้ถูกต้องประมาณ 46.2% ซึ่งถือว่าแข่งขันได้ในกลุ่มโมเดลขนาดเล็ก คะแนนนี้สะท้อนถึงความรู้ทั่วไปที่แข็งแกร่ง แต่ก็ยังมีช่องว่างให้ปรับปรุงเมื่อเทียบกับโมเดลขนาดใหญ่อย่าง GPT-4 สำหรับงานที่ต้องการความเชี่ยวชาญเชิงลึก ควรพิจารณาประเมินโมเดลบนเกณฑ์ชี้วัดเฉพาะด้าน
ความหน่วงที่แน่นอนขึ้นอยู่กับขนาดของคำขอ สภาพเครือข่าย และโหลดปัจจุบันบนโครงสร้างพื้นฐานของ OpenAI ในการใช้งานทั่วไป GPT-3.5-Turbo-0125 จะตอบกลับภายในไม่กี่วินาทีสำหรับพรอมต์สั้นๆ ซึ่งมักจะเร็วกว่าโมเดลขนาดใหญ่กว่า OrcaRouter ไม่เพิ่มโอเวอร์เฮดที่มีนัยสำคัญนอกเหนือจากเวลาตอบสนองของผู้ให้บริการ สำหรับแอปพลิเคชันแบบเรียลไทม์ ควรทดสอบกับปริมาณงานของคุณ ความเร็วและต้นทุนของโมเดลทำให้เป็นตัวเลือกยอดนิยมสำหรับแชทบอทแบบโต้ตอบและไปป์ไลน์การผลิตที่ความหน่วงต่อคำขอมีความสำคัญ
GPT-3.5-Turbo-0125 ถูกใช้งานอย่างแพร่หลายเนื่องจากความน่าเชื่อถือ การจัดรูปแบบที่สม่ำเสมอ และความสามารถในการทำตามคำสั่งที่แข็งแกร่ง แทบจะไม่เคยล้มเหลวในการสร้างคำตอบที่สอดคล้องกัน และจัดการกับคำที่พิมพ์ผิดหรือวลีที่ไม่ชัดเจนได้อย่างราบรื่น ข้อมูลที่ใช้ฝึกครอบคลุมถึงเดือนเมษายน 2023 ทำให้ตอบคำถามเกี่ยวกับเหตุการณ์ปัจจุบันในช่วงเวลานั้นได้อย่างแม่นยำ โมเดลยังรองรับข้อความระบบเพื่อกำหนดพฤติกรรม ทำให้ปรับแต่งได้ง่ายสำหรับการใช้งานที่แตกต่างกัน เช่น การสวมบทบาทหรือการสร้างข้อความภายใต้ข้อจำกัด
โมเดลนี้อาจประสบปัญหาในการใช้เหตุผลที่ซับซ้อน การคำนวณทางคณิตศาสตร์หลายขั้นตอน และคำแนะนำที่ละเอียดอ่อนมาก บางครั้งอาจสร้างคำตอบที่ฟังดูสมเหตุสมผลแต่ไม่ถูกต้อง (ภาพหลอน) และอาจไม่สามารถบังคับใช้กฎการจัดรูปแบบที่เข้มงวดได้อย่างสม่ำเสมอ ความยาวเอาต์พุตถูกจำกัดไว้ที่ 4096 โทเค็น ซึ่งอาจไม่เพียงพอสำหรับการสร้างเนื้อหารูปแบบยาว นอกจากนี้ ยังขาดการเข้าถึงอินเทอร์เน็ตตามค่าเริ่มต้น และไม่สามารถดึงข้อมูลแบบเรียลไทม์หรือดำเนินการใด ๆ นอกอินเทอร์เฟซการแชท สำหรับตรรกะขั้นสูงหรือข้อมูลที่ทันสมัย ควรพิจารณาใช้การสร้างแบบเสริมด้วยการดึงข้อมูล (RAG) หรือโมเดลที่มีความสามารถมากกว่า
OrcaRouter ใช้ราคาที่แน่นอนของ OpenAI โดยไม่คิดมาร์กอัปเพิ่มเติม: $0.50 ต่อ 1 ล้านโทเคนอินพุต และ $1.50 ต่อ 1 ล้านโทเคนเอาต์พุต ไม่มีค่าธรรมเนียมแพลตฟอร์ม ค่าสมัครสมาชิก หรือค่าใช้จ่ายต่อคำขอเพิ่มเติมนอกเหนือจากอัตราโทเคนเหล่านี้ โทเคนอินพุตรวมถึง prompt, ข้อความระบบ และประวัติการสนทนา ส่วนโทเคนเอาต์พุตคือคำตอบที่สร้างขึ้น การเรียกเก็บเงินขึ้นอยู่กับจำนวนโทเคนที่ประมวลผล ซึ่งวัดโดย tokenizer tiktoken สำหรับ GPT-3.5
แม้ว่า GPT-3.5-Turbo-0125 จะเป็นหนึ่งในโมเดลที่คุ้มค่าที่สุดจาก OpenAI อยู่แล้ว คุณยังสามารถปรับให้ดีขึ้นได้ด้วยการส่ง prompts ที่สั้นลง, ตัดแต่งประวัติการสนทนาเมื่อเป็นไปได้, และใช้ค่า max_tokens ที่เล็กลงหากกรณีการใช้งานของคุณอนุญาต หลีกเลี่ยงข้อความระบบที่ยาวเกินไปหากไม่จำเป็น สำหรับปริมาณที่สูงมาก ให้พิจารณาว่าโมเดลฟรีหรือโอเพนซอร์สบน OrcaRouter สามารถตอบสนองความต้องการความแม่นยำของคุณได้หรือไม่ ข้อแลกเปลี่ยนคือ โมเดลที่ถูกกว่าอาจต้องใช้การออกแบบ prompt หรือการ fine-tuning ที่เข้มงวดมากขึ้น
OrcaRouter ไม่มีกลไกการแคชในตัวสำหรับพรอมต์หรือการตอบสนองในขณะนี้ การเรียก API แต่ละครั้งจะถูกคิดค่าบริการตามจำนวนโทเค็นที่ส่งและรับในคำขอนั้น หากคุณใช้พรอมต์เดียวกันซ้ำในการเรียกหลายครั้ง (เช่น ข้อความระบบที่เหมือนกัน) คุณจะถูกเรียกเก็บเงินสำหรับโทเค็นเหล่านั้นทุกครั้ง เพื่อลดต้นทุน ให้พิจารณาแคชคำขอที่เหมือนกันในระดับแอปพลิเคชัน หรือรวมหลายๆ คำถามไว้ในพรอมต์เดียวที่มีข้อความผู้ใช้หลายข้อความ
ใช้ปลายทาง Chat Completions OpenAI มาตรฐานพร้อม base URL https://api.orcarouter.ai/v1 ตั้งค่าพารามิเตอร์ model เป็น 'openai/gpt-3.5-turbo-0125' รวมคีย์ API ของ OrcaRouter ไว้ในส่วนหัว Authorization ตัวอย่างการใช้ cURL: curl https://api.orcarouter.ai/v1/chat/completions -H 'Authorization: Bearer YOUR_API_KEY' -H 'Content-Type: application/json' -d '{"model":"openai/gpt-3.5-turbo-0125","messages":[{"role":"user","content":"Hello"}]}' รูปแบบการตอบสนองสอดคล้องกับข้อกำหนดของ OpenAI
พารามิเตอร์มาตรฐานทั้งหมดของ OpenAI chat completions สามารถใช้งานได้ รวมถึง: 'messages', 'max_tokens' (สูงสุด 4096), 'temperature', 'top_p', 'frequency_penalty', 'presence_penalty', 'stop', และ 'stream' 'n' (จำนวนการตอบกลับ) ยังรองรับด้วย ไม่มีระบบรองรับ 'logprobs' หรือ 'logit_bias' สำหรับโมเดลนี้บนเกตเวย์ OrcaRouter โปรดทราบว่าพารามิเตอร์ 'max_tokens' ถูกจำกัดไว้ที่ 4096 เพื่อให้สอดคล้องกับขีดจำกัดผลลัพธ์ของโมเดล สำหรับการสตรีม ให้ตั้งค่า 'stream': true เพื่อรับ delta ที่เพิ่มขึ้นทีละส่วน
หากคุณใช้งาน OpenAI โดยตรง การย้ายไปยัง OrcaRouter นั้นทำได้ง่ายดาย: เปลี่ยน base URL จาก https://api.openai.com/v1 เป็น https://api.orcarouter.ai/v1, อัปเดตรหัสโมเดลเป็น 'openai/gpt-3.5-turbo-0125' หากคุณเคยใช้นามแฝงทั่วไป, และเปลี่ยนคีย์ API ของคุณเป็นคีย์จาก OrcaRouter ไม่จำเป็นต้องเปลี่ยนแปลงโค้ดสำหรับรูปแบบข้อความหรือพารามิเตอร์แต่อย่างใด หากคุณใช้ผู้ให้บริการรายอื่น ตรวจสอบให้แน่ใจว่าไลบรารีไคลเอนต์ของคุณรองรับสคีมาที่เข้ากันได้กับ OpenAI OrcaRouter เป็นตัวแทนที่ใช้งานแทนได้ทันที
GPT-4 โดยทั่วไปมีประสิทธิภาพเหนือกว่า GPT-3.5-Turbo-0125 ในการใช้เหตุผลที่ซับซ้อน ความถูกต้องตามข้อเท็จจริง และการปฏิบัติตามคำสั่งที่ละเอียดอ่อน ดังที่สะท้อนให้เห็นจากคะแนนมาตรฐานที่สูงกว่าใน MMLU และการทดสอบอื่นๆ อย่างไรก็ตาม GPT-4 มีราคาแพงกว่าอย่างมาก (โดยทั่วไปมีค่าใช้จ่ายต่อโทเคนสูงกว่า 10 เท่า) และอาจมีความหน่วงสูงกว่า GPT-3.5-Turbo-0125 มอบจุดที่คุ้มค่าด้านราคาต่อประสิทธิภาพสำหรับงานที่ไม่ต้องการความลึกของ GPT-4 เลือกโมเดลที่ใหญ่กว่าสำหรับการวิเคราะห์ขั้นสูงหรือเมื่อส่วนต่างของข้อผิดพลาดแคบ
Anthropic's Claude 3 Haiku เป็นโมเดลที่มีต้นทุนต่ำในการแข่งขัน มีการอนุมานที่รวดเร็วและคุณสมบัติด้านความปลอดภัยที่แข็งแกร่ง โมเดลทั้งสองเป็นแบบข้อความเท่านั้นและออกแบบมาสำหรับแอปพลิเคชันที่มีปริมาณการใช้งานสูง แม้ว่าการเปรียบเทียบเกณฑ์วัดเฉพาะจะแตกต่างกันไป แต่ GPT-3.5-Turbo-0125 ได้รับการยอมรับอย่างกว้างขวางและได้รับประโยชน์จากเอกสารและระบบนิเวศที่ครอบคลุม Claude 3 Haiku อาจมีจุดแข็งที่แตกต่างในด้านการเขียนเชิงสร้างสรรค์และพฤติกรรมการปฏิเสธ การเลือกขึ้นอยู่กับความชอบของนักพัฒนาและข้อกำหนดในการผสานรวม OrcaRouter รองรับโมเดลทั้งสอง ดังนั้นคุณสามารถเปรียบเทียบได้โดยตรง
โมเดลโอเพนซอร์ส (เช่น Llama 3, Mistral) สามารถรันบนฮาร์ดแวร์ของคุณเองหรือผ่าน OrcaRouter เพื่อต้นทุนต่อโทเค็นที่อาจต่ำกว่า โดยเฉพาะเมื่อใช้งานในปริมาณมาก อย่างไรก็ตาม มักต้องมีการตั้งค่าเพิ่มเติม การปรับแต่ง prompt และอาจมีความสามารถในการทำตามคำสั่งที่อ่อนกว่า GPT-3.5-Turbo-0125 นำเสนอความน่าเชื่อถือแบบครบวงจร คุณภาพสม่ำเสมอ และไม่ต้องจัดการโครงสร้างพื้นฐานใด ๆ สำหรับทีมที่ไม่มีความเชี่ยวชาญด้าน ML API ที่มีการจัดการมักจะเหมาะกว่า ให้รันเกณฑ์วัดประสิทธิภาพกับปริมาณงานเฉพาะของคุณเพื่อตัดสินใจ
OpenAI อาจจะปล่อยเวอร์ชันใหม่ของ GPT-3.5-Turbo หรือเลิกใช้สแนปชอตเฉพาะนี้ OrcaRouter จะอัปเดตโมเดลที่มีอยู่ตามนั้น หากแอปพลิเคชันของคุณพึ่งพาพฤติกรรมที่สม่ำเสมอ คุณอาจต้องการปักหมุดเวอร์ชันโมเดลเฉพาะโดยใช้รหัสโมเดลที่แน่นอน OrcaRouter จะแจ้งให้ทราบล่วงหน้าเกี่ยวกับการเลิกใช้ สำหรับระบบการผลิตที่มีความเสี่ยงสูง ควรพิจารณาทดสอบกับเวอร์ชันใหม่ในสภาพแวดล้อม staging ก่อนที่จะเปลี่ยน
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-0125",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_pparallel_tool_calls| อินพุต / 1M โทเค็น | $0.500 |
| เอาต์พุต / 1M โทเค็น | $1.50 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/openai/gpt-3.5-turbo-0125เปิด @misc{orcarouter_gpt_3_5_turbo_0125,
title = {openai/gpt-3.5-turbo-0125 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125}
}openai. (n.d.). openai/gpt-3.5-turbo-0125 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125