โมเดลนี้มีความยาวของบริบทมากกว่า gpt-3.5-turbo ถึงสี่เท่า ทำให้สามารถรองรับข้อความประมาณ 20 หน้าในคำขอเดียว ด้วยต้นทุนที่สูงขึ้น ข้อมูลการฝึกอบรม: ถึง...
GPT-3.5 Turbo 16k เป็นเวอร์ชันที่มีบริบทขยายของโมเดล GPT-3.5 Turbo ของ OpenAI ซึ่งเปิดตัวครั้งแรกเพื่อรองรับงานที่ต้องมีการประมวลผลข้อความปริมาณมากโดยไม่ต้องแบ่งส่วน ขนาดหน้าต่างบริบท 16,385 โทเค็น…
GPT-3.5 Turbo 16k ทำงานได้ดีเยี่ยมในงานที่ใช้ข้อความเป็นหลักซึ่งต้องใช้บริบทยาว ได้แก่ การสรุปเอกสารหลายหน้า การรักษาความต่อเนื่องของการสนทนาหลายรอบ การตอบคำถามจากข้อความยาวๆ และการตรวจสอบโค้ดในฐานโค้ดขนาดใหญ่ หน้าต่างบริบท 16k ทำให้สามารถป้อนทั้งบทหรืออีเมลยาวๆ ได้ในครั้งเดียว ลดความจำเป็นในการแบ่งข้อความด้วยตนเอง โมเดลนี้ยังจัดการงานสร้างข้อความมาตรฐาน เช่น การร่างอีเมล การเขียนเนื้อหาสร้างสรรค์ และการให้คำอธิบาย เนื่องจากเป็นโมเดลคลาส GPT-3.5 จึงมีความชำนาญในการทำตามคำแนะนำและสร้างข้อความที่ลื่นไหล แต่อาจไม่เทียบเท่า GPT-4 ในด้านการให้เหตุผลที่ซับซ้อนหรือความรู้เฉพาะทางที่มีความละเอียดอ่อน
หากแอปพลิเคชันของคุณไม่จำเป็นต้องใช้ context window แบบขยาย โมเดล GPT-3.5 Turbo 4k มาตรฐาน (หรือตัวแปรที่ถูกกว่าอื่นๆ) อาจคุ้มค่ากว่า สำหรับงานที่ใช้ prompt สั้นและเอาต์พุตต่ำกว่า 4,000 tokens เวอร์ชัน 16k ไม่ได้ให้ข้อได้เปรียบใดๆ และมีต้นทุนต่อ token เท่ากัน คุณควรพิจารณาโมเดลที่เล็กหรือเร็วกว่า เมื่อไปป์ไลน์ของคุณทำงานกับข้อความที่แบ่งเป็นชิ้นๆ แล้ว และไม่ได้รับประโยชน์จาก context ขนาดใหญ่ บน OrcaRouter คุณสามารถสลับระหว่าง model ID ได้อย่างง่ายดาย — ตัวอย่างเช่น ใช้ "openai/gpt-3.5-turbo" (4k) เมื่อความต้องการ context มีน้อย ประเมินจำนวน token อินพุตโดยเฉลี่ยของคุณ และเลือกโมเดลที่ครอบคลุมคำขอมากกว่า 95% เพื่อหลีกเลี่ยงการจ่ายค่าความจุที่ไม่ได้ใช้
ข้อได้เปรียบหลักของบริบท 16k คือความสามารถในการประมวลผลอินพุตที่ยาวขึ้นในคำขอเดียว โดยคงความต่อเนื่องและขจัดปัญหาจากการแบ่งข้อความข้ามหน้าต่าง ตัวอย่างเช่น คุณสามารถป้อนเอกสารงานวิจัยขนาด 10,000 คำทั้งฉบับเข้าสู่โมเดล และขอให้แยกข้อค้นพบสำคัญได้โดยไม่ต้องเย็บส่วนต่างๆ ด้วยตนเอง ในการประยุกต์ใช้งานเชิงสนทนา โมเดลสามารถจดจำประวัติการสนทนาทั้งหมดจากการโต้ตอบกับฝ่ายบริการลูกค้าที่ยาวนาน ส่งผลให้การตอบกลับมีความเข้าใจบริบทมากขึ้น สำหรับงานโค้ด คุณสามารถรวมหลายไฟล์หรือชุดฟังก์ชันทั้งหมดไว้ในพรอมพ์ ทำให้โมเดลเข้าใจการพึ่งพาข้ามไฟล์ได้ ความสามารถนี้ช่วยลดภาระงานด้านวิศวกรรมในการสร้างตรรกะการแบ่งส่วนและการจัดการสถานะ
GPT-3.5 Turbo 16k สืบทอดข้อจำกัดทั่วไปของซีรีส์ GPT-3.5 มันสามารถสร้างข้อมูลที่ฟังดูน่าเชื่อถือแต่ไม่ถูกต้องหรือไม่มีหลักฐานสนับสนุน (ภาพหลอน) โดยเฉพาะในโดเมนเฉพาะทางหรือที่มีรายละเอียดสูงมาก โมเดลนี้รองรับเฉพาะข้อความเท่านั้น และไม่สามารถประมวลผลรูปภาพ เสียง หรือรูปแบบอื่นๆ ได้ ความลึกในการให้เหตุผลของมันต่ำกว่า GPT‑4 ดังนั้นมันอาจมีปัญหาในการจัดการกับตรรกะหลายขั้นตอนที่ซับซ้อน การพิสูจน์ทางคณิตศาสตร์ หรือการตีความทางกฎหมายที่ละเอียดอ่อน คะแนน MMLU‑Pro ที่ 46.2 แม้จะน่านับถือ แต่ต่ำกว่าคะแนนทั่วไป >80 ของ GPT‑4 อย่างมีนัยสำคัญ ซึ่งบ่งชี้ถึงความแม่นยำเชิงข้อเท็จจริงที่อ่อนแอกว่าในหัวข้อขั้นสูง นอกจากนี้ ขีดจำกัดบริบทที่ 16,384 โทเค็น แม้จะมาก แต่ก็ไม่มีที่สิ้นสุด เอกสารที่ยาวมากยังคงต้องใช้การออกแบบพรอมพ์หรือการแบ่งส่วนอย่างระมัดระวัง
GPT-3.5 Turbo 16k ทำคะแนนได้ 46.2 บนเกณฑ์วัด MMLU‑Pro MMLU‑Pro เป็นชุดย่อยที่ถูกคัดสรรมาจากชุดข้อมูล Massive Multitask Language Understanding ซึ่งออกแบบมาเพื่อประเมินความลึกของความรู้ของโมเดลใน 57 หัวข้อที่หลากหลาย รวมถึง STEM, สังคมศาสตร์, มนุษยศาสตร์, และกฎหมาย คะแนนนี้แสดงถึงสัดส่วนของคำถามที่ตอบถูก สำหรับการเปรียบเทียบ GPT-3.5 Turbo (4k) ที่เล็กกว่ามักจะทำคะแนนได้ประมาณ 43 บน MMLU (มาตรฐาน) ในขณะที่ GPT‑4 ทำคะแนนได้มากกว่า 80 ค่า 46.2 บ่งชี้ว่าโมเดลนี้มีความเข้าใจในระดับปานกลางเกี่ยวกับเนื้อหาข้อเท็จจริงที่ซับซ้อน แต่ไม่ใช่ระดับ state‑of‑the‑art ในการดึงความรู้ที่บริสุทธิ์ เหมาะที่สุดสำหรับงานที่การสร้างข้อความที่ลื่นไหลด้วยความถูกต้องตามข้อเท็จจริงที่ยอมรับได้มีความสำคัญมากกว่าการใช้เหตุผลระดับสูงสุด
แม้ว่าจะไม่ได้ให้เกณฑ์มาตรฐานการให้เหตุผลเฉพาะเจาะจงมา แต่ GPT-3.5 Turbo 16k มีพฤติกรรมคล้ายกับ GPT-3.5 Turbo มาตรฐานในด้านการอนุมานเชิงตรรกะ เลขคณิต และการใช้เหตุผลสามัญสำนึก สามารถแก้ปริศนาตรรกะง่าย ๆ และคำแนะนำหลายขั้นตอนได้ แต่อาจล้มเหลวในงานที่ต้องยึดมั่นตามข้อจำกัดหรือการใช้เหตุผลเชิงขัดแย้งอย่างเคร่งครัด การเพิ่มหน้าต่างบริบทไม่ได้ช่วยปรับปรุงความสามารถในการให้เหตุผลโดยตรง แต่อนุญาตให้พิจารณาข้อมูลนำเข้ามากขึ้นเท่านั้น ในทางปฏิบัติ ผู้ใช้รายงานว่าโมเดลทำงานได้อย่างน่าพอใจสำหรับการสรุปความ การแปล และแอปพลิเคชันแชทบอท แต่ไม่ควรนำไปพึ่งพาสำหรับการตัดสินใจที่มีความเสี่ยงสูงโดยไม่มีการตรวจสอบจากมนุษย์ คะแนน MMLU‑Pro ที่ 46.2 ตอกย้ำว่าความเชี่ยวชาญเฉพาะด้านอยู่ในระดับปานกลาง
เมตริกด้านความเร็วและความหน่วงของ GPT-3.5 Turbo 16k ไม่ได้ถูกระบุไว้อย่างชัดเจน แต่เนื่องจากเป็นโมเดลในคลาส GPT-3.5 โดยทั่วไปแล้วจะเร็วกว่า GPT‑4 และเหมาะสำหรับแอปพลิเคชันแบบเรียลไทม์ บน OrcaRouter เวลาตอบสนองขึ้นอยู่กับแบ็กเอนด์ของ OpenAI รวมถึงปัจจัยด้านเครือข่าย สำหรับอินพุตทั่วไปที่ต่ำกว่า 4,000 โทเค็น โมเดลมักจะคืนโทเค็นแรกภายในหลักร้อยมิลลิวินาทีถึงไม่กี่วินาที ผู้ใช้ควรคาดหวังความหน่วงที่คล้ายคลึงกับโมเดล GPT-3.5 Turbo (4k) มาตรฐาน เนื่องจากสถาปัตยกรรมพื้นฐานเหมือนกันยกเว้นขีดจำกัดบริบท โมเดล 16k อาจช้าลงเล็กน้อยเมื่อประมวลผลพรอมต์ที่ยาวมาก เพราะโมเดลต้องใส่ใจกับโทเค็นมากขึ้น แต่ความแตกต่างมักจะมีเพียงเล็กน้อย สำหรับกรณีการใช้งานที่ไวต่อความหน่วง เราแนะนำให้ทดสอบกับความยาวพรอมต์เฉพาะของคุณ
ราคาสำหรับ GPT-3.5 Turbo 16k บน OrcaRouter คือ $3.00 ต่อ 1M input tokens และ $4.00 ต่อ 1M output tokens คิดตามอัตราของผู้ให้บริการ OpenAI ที่แน่นอนโดยไม่มี markup เพิ่ม ไม่มีค่าธรรมเนียมแพลตฟอร์มเพิ่มเติม ระดับการสมัครสมาชิก หรือส่วนลดตามปริมาณ — อัตราคงที่และโปร่งใส ค่าบริการคำนวณจากจำนวน token ในแต่ละคำขอ: input tokens คือ token ทั้งหมดใน messages array และ output tokens คือ token ที่สร้างขึ้นในการตอบกลับ OrcaRouter ไม่เพิ่ม token overhead ใดๆ คุณจ่ายเฉพาะสิ่งที่คุณใช้ และการใช้งานของคุณจะถูกแจกแจงในแดชบอร์ด OrcaRouter ของคุณ
ข้อแลกเปลี่ยนต้นทุนหลักคือระหว่างการจ่ายเงินสำหรับหน้าต่างบริบทขนาดใหญ่กับการใช้โมเดลที่ถูกกว่าซึ่งมีบริบทขนาดเล็กกว่า หากอินพุตเฉลี่ยของคุณแทบจะไม่เกิน 4,000 โทเค็น GPT-3.5 Turbo (4k) มาตรฐาน — ซึ่งมีราคา $1.50 ต่ออินพุต / $2.00 ต่อเอาต์พุตต่อ 1M โทเค็นบน OpenAI — จะประหยัดกว่า อย่างไรก็ตาม เมื่ออินพุตเกิน 4,000 โทเค็นเป็นประจำ โมเดล 16k จะช่วยหลีกเลี่ยงการแบ่งส่วนและการค้นคืนที่มีค่าใช้จ่ายสูง ราคาต่อโทเค็นของ GPT-3.5 Turbo 16k เป็นสองเท่าของรุ่น 4k ดังนั้น คุณต้องประเมินการกระจายของโทเค็น: หากมากกว่า 50% ของคำขอต้องการ >4k โทเค็น โมเดล 16k อาจถูกกว่าโดยรวมเมื่อคำนึงถึงเวลาทางวิศวกรรมในการนำการแบ่งส่วนไปใช้
โดยค่าเริ่มต้น OrcaRouter จะไม่แคช output ของโมเดลหรือ prompt completions แต่ละคำขอจะถูกส่งไปยัง OpenAI อย่างสดใหม่ ซึ่งหมายความว่าคุณจะต้องเสียค่า token เต็มในทุกการเรียกใช้ รวมถึง input ที่ซ้ำกัน เพื่อลดต้นทุน ลองพิจารณาใช้การแคช prompt ในฝั่งของคุณ เช่น การแคช system message หรือการใช้ vector database เพื่อดึง context ที่เกี่ยวข้อง แทนที่จะส่งเอกสารทั้งฉบับซ้ำทุกครั้ง เนื่องจากราคาของโมเดลคิดตาม token และขึ้นอยู่กับจำนวน token ทั้งหมดที่ส่ง การลดความยาวของ input จะช่วยลดต้นทุนโดยตรง นโยบายการไม่คิดค่าบริการเพิ่ม (zero‑markup policy) ทำให้แน่ใจว่ากลยุทธ์การแคชใดๆ ที่คุณใช้จะให้ผลประหยัดในอัตราเดียวกันกับการใช้งาน OpenAI โดยตรง
OrcaRouter ใช้มาร์กอัปเป็นศูนย์สำหรับ GPT-3.5 Turbo 16k ราคาที่แจ้ง — $3.00 ต่อ 1M input tokens และ $4.00 ต่อ 1M output tokens — เป็นอัตราที่ OpenAI กำหนดไว้สำหรับโมเดลนี้พอดี OrcaRouter ไม่ได้คิดค่าธรรมเนียมเพิ่มเติมใดๆ นโยบายนี้ทำให้ OrcaRouter เป็นตัวแทนจำหน่ายแบบตรงไปตรงมา: คุณชำระในอัตราของผู้ให้บริการโดยไม่มีค่าธรรมเนียมแพลตฟอร์มเพิ่มเติม ไม่มีข้อกำหนดเรื่องยอดใช้ขั้นต่ำหรือข้อผูกมัด อย่างไรก็ตาม โปรดทราบว่าหาก OpenAI เปลี่ยนแปลงราคาในอนาคต OrcaRouter จะส่งผ่านการเปลี่ยนแปลงเหล่านั้น คุณสามารถติดตามค่าใช้จ่ายแบบเรียลไทม์ผ่านแดชบอร์ดของ OrcaRouter ซึ่งแสดงการใช้งานโทเค็นและต้นทุนต่อโมเดล
ในการใช้ GPT-3.5 Turbo 16k ผ่าน OrcaRouter ให้กำหนด base URL ของ API client ของคุณเป็น https://api.orcarouter.ai/v1 และใช้ model ID "openai/gpt-3.5-turbo-16k" พารามิเตอร์ของ OpenAI chat‑completion ทั้งหมดรองรับ เช่น messages, temperature, top_p, frequency_penalty, presence_penalty, max_tokens, stop, และ stream คุณต้องตรวจสอบสิทธิ์ด้วยรหัส API ของ OrcaRouter ที่ถูกต้องซึ่งระบุไว้ในส่วนหัว Authorization (Bearer <key>) ตัวอย่างการใช้ curl: curl https://api.orcarouter.ai/v1/chat/completions -H "Authorization: Bearer YOUR_KEY" -H "Content-Type: application/json" -d '{"model":"openai/gpt-3.5-turbo-16k","messages":[{"role":"user","content":"Hello"}],"max_tokens":1024}' OrcaRouter จะคืนค่า JSON structure เดียวกับ OpenAI
พารามิเตอร์ทั้งหมดของ OpenAI chat‑completion สามารถใช้งานได้เมื่อใช้ GPT-3.5 Turbo 16k ผ่าน OrcaRouter พารามิเตอร์หลักประกอบด้วย: messages (อาร์เรย์ของออบเจ็กต์ role/content), temperature (0‑2, ค่าเริ่มต้น 1), top_p (0‑1, ค่าเริ่มต้น 1), n (จำนวนการสร้างการตอบสนอง, ค่าเริ่มต้น 1), stream (บูลีน, ค่าเริ่มต้น false), max_tokens (สูงสุด 4096), stop (หนึ่งสตริงหรือมากกว่า), frequency_penalty (‑2‑2, ค่าเริ่มต้น 0), presence_penalty (‑2‑2, ค่าเริ่มต้น 0), และ logit_bias (แผนที่ของ token ID ไปยัง bias) รหัสโมเดลต้องเป็น "openai/gpt-3.5-turbo-16k" อย่างเคร่งครัด หมายเหตุ: max_tokens ต้องไม่เกิน 4096 และจำนวน tokens ทั้งหมดของ prompt + completion ต้องอยู่ใน 16,384 OrcaRouter จะตรวจสอบขีดจำกัดเหล่านี้และคืนค่า error หากเกิน
การย้ายจากการรวม OpenAI โดยตรงไปยัง OrcaRouter สำหรับ GPT-3.5 Turbo 16k ต้องเปลี่ยนแปลงเพียงสามอย่าง: อัปเดต URL ฐานจาก https://api.openai.com/v1 เป็น https://api.orcarouter.ai/v1, แทนที่คีย์ API ด้วยคีย์ OrcaRouter ของคุณ, และเปลี่ยนรหัสโมเดลจาก "gpt-3.5-turbo-16k" เป็น "openai/gpt-3.5-turbo-16k" โค้ดอื่นๆ ทั้งหมด รวมถึงการจัดรูปแบบข้อความ การจัดการพารามิเตอร์ และการแยกวิเคราะห์การตอบสนอง ยังคงเหมือนเดิมทุกประการ หากคุณเคยใช้เวอร์ชัน 4k มาก่อน คุณสามารถเปลี่ยนไปใช้โมเดล 16k ได้โดยการเปลี่ยนรหัสโมเดลเท่านั้น ไม่จำเป็นต้องแก้ไขสคีมาหรือข้อจำกัดอัตรา; OrcaRouter สะท้อนข้อกำหนด API ของ OpenAI การทดสอบสามารถทำได้โดยการส่งคำขอเดียวพร้อมข้อความสั้นเพื่อยืนยันการตรวจสอบสิทธิ์และโครงสร้างการตอบสนอง
GPT-3.5 Turbo 16k และ GPT-3.5 Turbo 4k (รหัสโมเดล "openai/gpt-3.5-turbo") ใช้สถาปัตยกรรมและความสามารถพื้นฐานเดียวกัน ความแตกต่างเพียงอย่างเดียวคือขนาดหน้าต่างบริบท (16,384 กับ 4,096 โทเคน) และราคา รุ่น 4k ถูกกว่า: บน OpenAI มีราคา $1.50/1M โทเคนนำเข้า และ $2.00/1M โทเคนส่งออก; ผ่าน OrcaRouter ใช้อัตราเดียวกัน รุ่น 16k มีราคาแพงเป็นสองเท่า ผลการทดสอบในเกณฑ์มาตรฐานเช่น MMLU (มาตรฐาน) เกือบจะเหมือนกัน — GPT-3.5 Turbo 4k ได้คะแนนประมาณ 43 ใน MMLU ขณะที่รุ่น 16k ได้ 46.2 ใน MMLU‑Pro (ซึ่งเป็นรูปแบบที่ยากกว่า) สำหรับงานที่อยู่ในช่วง 4k โทเคน รุ่น 4k ประหยัดกว่า สำหรับงานที่ยาวขึ้น รุ่น 16k จะช่วยหลีกเลี่ยงข้อผิดพลาดจากการตัดบริบท
เมื่อเปรียบเทียบกับ GPT‑4 (เช่น "openai/gpt-4") แล้ว GPT-3.5 Turbo 16k มีความสามารถในการใช้เหตุผล ความแม่นยำด้านข้อเท็จจริง และการจัดแนวด้านความปลอดภัยที่ต่ำกว่าอย่างมีนัยสำคัญ โดยทั่วไป GPT‑4 มีคะแนน >80 ใน MMLU และจัดการกับตรรกะหลายขั้นตอนที่ซับซ้อนและคำแนะนำที่ละเอียดอ่อนได้ดีกว่ามาก GPT‑4 ยังรองรับรูปภาพในบางรุ่นและมีหน้าต่างบริบทสูงสุดถึง 8,192 หรือ 32,768 โทเคน อย่างไรก็ตาม GPT‑4 ช้ากว่าและแพงกว่ามาก — มักจะแพงกว่า 10‑20 เท่าต่อโทเคน โมเดล Claude (เช่น "anthropic/claude-2") ก็มีหน้าต่างบริบทขนาดใหญ่ (100k โทเคน) และการให้เหตุผลที่แข็งแกร่ง แต่มีราคาสูงกว่า GPT-3.5 Turbo และอาจมีรูปแบบ API ที่แตกต่างกัน GPT-3.5 Turbo 16k เป็นทางเลือกที่คุ้มค่าเมื่อคุณต้องการบริบทที่ขยายเท่านั้นโดยไม่ต้องการการให้เหตุผลระดับสูงสุด OrcaRouter ช่วยให้คุณลองใช้โมเดลใดก็ได้อย่างง่ายดาย
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-16k",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_p| อินพุต / 1M โทเค็น | $3.00 |
| เอาต์พุต / 1M โทเค็น | $4.00 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/openai/gpt-3.5-turbo-16kเปิด @misc{orcarouter_gpt_3_5_turbo_16k,
title = {GPT-3.5 Turbo 16k API},
author = {OpenAI},
year = {2023},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-16k}
}OpenAI. (2023). GPT-3.5 Turbo 16k API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-16k