Gemini 2.5 Flash-Lite เป็นโมเดลการให้เหตุผลแบบน้ำหนักเบาในตระกูล Gemini 2.5 ที่ได้รับการปรับให้เหมาะสมเพื่อความหน่วงต่ำเป็นพิเศษและประสิทธิภาพด้านต้นทุน โดยมอบปริมาณงานที่เพิ่มขึ้น การสร้างโทเค็นที่เร็วกว่า และประสิทธิภาพที่ดีกว่า...
Google Gemini 2.5 Flash Lite เป็นรุ่นที่เล็กกว่า เร็วกว่า และมีราคาถูกกว่าของโมเดล Gemini 2.5 Flash จาก Google มันถูกออกแบบมาเพื่อรองรับอินพุตแบบมัลติโมดัลที่หลากหลาย—รวมถึงข้อความ รูปภาพ ไฟล์ เสียง…
Gemini 2.5 Flash Lite เหมาะอย่างยิ่งสำหรับสถานการณ์ที่ต้องการปริมาณงานสูงและต้นทุนต่ำ กรณีการใช้งานหลักได้แก่: การแก้ปัญหาและการสอนคณิตศาสตร์ (รองรับด้วยคะแนน MATH-500 ที่ 92.6); การสรุปความและการตอบคำถามจากเอกสารขนาดยาวมาก (สูงสุด 1 ล้านโทเค็น); งานแบบมัลติโหมด เช่น การวิเคราะห์ภาพพร้อมคำสั่งข้อความ หรือการดึงข้อมูลจากไฟล์เสียงและวิดีโอ; รวมถึงการประมวลผลแบบแบตช์ชุดข้อมูลขนาดใหญ่ที่คำนึงถึงต้นทุน ความหน่วงต่ำทำให้เหมาะสำหรับแอปพลิเคชันที่เผชิญหน้ากับผู้ใช้ซึ่งต้องการการตอบสนองที่รวดเร็ว สำหรับการเขียนเชิงสร้างสรรค์หรือการเขียนโค้ดที่ซับซ้อน ควรพิจารณาใช้โมเดลที่ใหญ่กว่า แต่สำหรับงานที่มีโครงสร้างและอิงข้อเท็จจริง Flash Lite คือตัวเลือกที่แข็งแกร่งและประหยัด
Gemini 2.5 Flash Lite เป็นหนึ่งในโมเดลที่ราคาย่อมเยาที่สุดอยู่แล้ว โดยมีราคา $0.10 ต่ออินพุตและ $0.40 ต่อเอาต์พุตต่อ 1M tokens ทางเลือกที่ถูกกว่า เช่น Gemini 1.5 Flash หรือ Llama 3.2 variants บน OrcaRouter อาจเพียงพอสำหรับงานที่ง่ายมาก เช่น การจำแนกประเภทพื้นฐาน การสร้างข้อความสั้น หรือการทดลองที่มีความเสี่ยงต่ำ หากแอปพลิเคชันของคุณไม่ต้องการอินพุตแบบ multimodal หรือบริบท 1M token ขนาดใหญ่ โมเดลที่เล็กกว่าก็สามารถลดต้นทุนลงได้อีก สำหรับงานที่เวลาแฝง (latency) เป็นปัจจัยหลักและคุณภาพเป็นรอง ให้พิจารณาโมเดลที่มี overhead ในการคำนวณต่ำกว่า ควรวัดประสิทธิภาพปริมาณงานเฉพาะของคุณเสมอเพื่อหาความสมดุลระหว่างราคาและประสิทธิภาพที่เหมาะสมที่สุด
ใช่ ด้วยหน้าต่างบริบท 1,048,576 โทเค็น Gemini 2.5 Flash Lite สามารถประมวลผลเอกสารที่ยาวมาก—เทียบเท่าหนังสือหลายเล่ม—ในการเรียก API เพียงครั้งเดียว ซึ่งช่วยให้คุณทำงานต่างๆ เช่น สรุปเอกสารทางกฎหมายทั้งฉบับ วิเคราะห์รายงานทางการเงินตลอดทั้งปี หรือรักษาบทสนทนาที่ยาวนานโดยไม่สูญเสียบริบทก่อนหน้า ผลลัพธ์สูงสุด 65,536 โทเค็นยังช่วยให้สร้างคำตอบที่ยาว เช่น รายงานฉบับเต็มหรือการวิเคราะห์ที่ขยายความได้ อย่างไรก็ตาม โปรดทราบว่าการประมวลผลบริบทที่ยาวมากอาจทำให้ค่าใช้จ่ายโทเค็นสูงขึ้นและเกิดความหน่วง โดยเฉพาะกับเนื้อหาหลายรูปแบบ (multimodal) สำหรับงานเอกสารยาวที่ใช้ข้อความเป็นส่วนใหญ่ โมเดลนี้มอบความสมดุลที่ใช้งานได้จริงระหว่างต้นทุนและความลึกของบริบท
โมเดลยอมรับอินพุตจากรูปแบบข้อความ รูปภาพ ไฟล์ เสียง และวิดีโอ ทำให้มีความหลากหลายสำหรับการวิเคราะห์สื่อผสม แม้ว่าจะไม่ได้ระบุเกณฑ์มาตรฐานแบบหลายโมดอลเฉพาะสำหรับรุ่น Lite นี้ แต่สถาปัตยกรรม Gemini ที่อยู่เบื้องหลังนั้นเป็นที่รู้จักในด้านความเข้าใจด้านภาพและภาษาที่แข็งแกร่ง จากคะแนน MATH-500 การใช้เหตุผลเชิงตรรกะเหนือปัญหาคณิตศาสตร์เชิงภาพน่าจะอยู่ในเกณฑ์ดี สำหรับงานต่างๆ เช่น การใส่คำบรรยายภาพ OCR เอกสารพร้อมการให้เหตุผล หรือการถอดเสียง Flash Lite ควรทำงานได้อย่างน่าเชื่อถือ แม้ว่าอาจมีความแม่นยำต่ำกว่าโมเดล Flash เต็มรูปแบบในฉากที่ซับซ้อนทางภาพหรือเสียงมากๆ OrcaRouter รองรับทุกโมดอลดั้งเดิม ดังนั้นคุณสามารถส่งผ่านโดยตรงในคำขอ API ของคุณ
Gemini 2.5 Flash Lite ทำคะแนนได้ 92.6 ในการวัดมาตรฐาน MATH-500 ซึ่งเป็นการประเมินการแก้ปัญหาทางคณิตศาสตร์ในสาขาพีชคณิต เรขาคณิต แคลคูลัส และอื่นๆ คะแนนนี้บ่งชี้ว่าโมเดลสามารถแก้ปัญหาทางคณิตศาสตร์ที่หลากหลายจำนวน 500 ข้อได้ถูกต้อง 92.6% ทำให้โมเดลนี้อยู่ในกลุ่มผู้ทำคะแนนสูงสุดสำหรับโมเดลระดับ Lite สะท้อนให้เห็นถึงความสามารถในการให้เหตุผลและการคำนวณที่แข็งแกร่ง แม้ว่าจะไม่สูงเท่ากับโมเดลขนาดใหญ่ (เช่น Gemini 2.5 Flash หรือ GPT-4o อาจทำคะแนนสูงกว่า) แต่ประสิทธิภาพนี้ยอดเยี่ยมสำหรับการใช้งานที่คำนึงถึงต้นทุนในด้านการศึกษา การเงิน และการวิเคราะห์ข้อมูล การวัดมาตรฐานนี้ดำเนินการภายใต้เงื่อนไขการประเมินมาตรฐาน ประสิทธิภาพในโลกแห่งความเป็นจริงอาจแตกต่างกันไปขึ้นอยู่กับการใช้คำสั่งและโดเมน
Gemini 2.5 Flash Lite ได้รับการออกแบบมาโดยเฉพาะสำหรับความหน่วงต่ำและปริมาณงานสูง ในฐานะที่เป็นรุ่น "Flash Lite" มันถูกปรับให้เหมาะสมเพื่อให้เร็วกว่าโมเดล Flash มาตรฐาน ทำให้เหมาะสำหรับแอปพลิเคชันแบบเรียลไทม์ แม้ว่าตัวเลขความหน่วงที่แน่นอนจะขึ้นอยู่กับความยาวของอินพุต ความยาวของเอาต์พุต และโหลดของเซิร์ฟเวอร์ ผู้ใช้สามารถคาดหวังเวลาตอบสนองที่ต่ำกว่าอย่างมีนัยสำคัญเมื่อเทียบกับซีรีส์ Pro OrcaRouter ไม่เพิ่มความหน่วงเพิ่มเติมนอกเหนือจาก API ของผู้ให้บริการ เพื่อประสิทธิภาพที่สม่ำเสมอ โดยเฉพาะอย่างยิ่งกับบริบทที่ยาว ให้พิจารณาใช้การตั้งค่า max_tokens ที่ต่ำกว่า ความเร็วและต้นทุนต่ำของโมเดลทำให้เป็นตัวเลือกที่ดีสำหรับแอปพลิเคชันที่ต้องการการตอบสนองที่รวดเร็ว เช่น แชทบอทแบบโต้ตอบหรือการถอดเสียงสด
จุดแข็ง: ต้นทุนต่อโทเคนต่ำมาก ($0.10 อินพุต, $0.40 เอาต์พุต), บริบทขนาดใหญ่ 1M โทเคน, รองรับหลายรูปแบบ, การให้เหตุผลทางคณิตศาสตร์ที่แข็งแกร่ง (92.6 ใน MATH-500), และความเร็วสูง เหมาะสำหรับงานที่มีข้อจำกัดด้านงบประมาณ ปริมาณงานสูง และงานเอกสารยาว ข้อจำกัด: ในฐานะตัวแปร Lite อาจมีประสิทธิภาพต่ำกว่าในการให้เหตุผลที่ซับซ้อน การเขียนเชิงสร้างสรรค์ การสร้างโค้ด และความเข้าใจภาษาในระดับละเอียดเมื่อเทียบกับโมเดลขนาดใหญ่ ไม่มีเกณฑ์มาตรฐานเฉพาะสำหรับโค้ดหรือความรู้ทั่วไป ดังนั้นให้ประเมินประสิทธิภาพตามงานของคุณ โมเดลอาจมีความสามารถลดลงในงานทำความเข้าใจภาพหรือเสียงที่ละเอียดอ่อนเมื่อเทียบกับ Flash เต็มรูปแบบ ควรทดสอบกับข้อมูลของคุณเองเพื่อยืนยันความเหมาะสม
แม้ว่าจะไม่มีเกณฑ์ชี้วัดเฉพาะด้านการเขียนโค้ดให้มา แต่คะแนน MATH-500 ที่สูงของแบบจำลองบ่งชี้ถึงความสามารถในการใช้เหตุผลเชิงตรรกะที่แข็งแกร่ง ซึ่งเป็นประโยชน์ต่องานเขียนโค้ดเชิงอัลกอริทึมและคณิตศาสตร์ สำหรับการสร้างโค้ด การดีบัก หรือการอธิบายในรูปแบบที่ตรงไปตรงมา Gemini 2.5 Flash Lite ควรทำงานได้อย่างเพียงพอสำหรับการใช้งานหลายกรณี อย่างไรก็ตาม สำหรับงานเขียนโปรแกรมที่ซับซ้อน เกี่ยวข้องกับหลายไฟล์ หรือต้องมีความคิดสร้างสรรค์สูง แบบจำลองขนาดใหญ่อย่าง Gemini 2.5 Flash หรือ GPT-4o อาจให้ผลลัพธ์ที่ดีกว่า การใช้เหตุผลในหัวข้อที่ไม่ใช่คณิตศาสตร์ (เช่น สามัญสำนึก การวิเคราะห์หลายขั้นตอน) น่าจะดีแต่ยังไม่ถึงระดับล้ำสมัยที่สุด ผู้ใช้ที่ต้องการการใช้เหตุผลระดับสูงสุดในทุกโดเมนควรพิจารณาอัปเกรดเป็นแบบจำลองเต็มรูปแบบ OrcaRouter ช่วยให้คุณสลับแบบจำลองได้ง่ายโดยการเปลี่ยนรหัสแบบจำลอง
การคิดราคาจะขึ้นอยู่กับโทเค็นที่ประมวลผล โดยมีอัตราแยกกันสำหรับโทเค็นอินพุตและเอาต์พุต สำหรับ Gemini 2.5 Flash Lite โทเค็นอินพุตมีราคา 0.10 ดอลลาร์ต่อ 1 ล้านโทเค็น และโทเค็นเอาต์พุตมีราคา 0.40 ดอลลาร์ต่อ 1 ล้านโทเค็น อัตราเหล่านี้เป็นราคาที่ผู้ให้บริการกำหนด และ OrcaRouter ไม่มีการบวกส่วนเพิ่มแต่อย่างใด โทเค็นจะถูกนับทั้งสำหรับข้อความและการแสดงแบบฝังของรูปแบบอื่นๆ (รูปภาพ เสียง วิดีโอ ไฟล์) ต้นทุนรวมของคำขอหนึ่งครั้งคือ (input_tokens * $0.10/1M) + (output_tokens * $0.40/1M) ไม่มีค่าธรรมเนียมเพิ่มเติมต่อคำขอหรือขั้นต่ำรายเดือน โดยทั่วไปการชำระเงินจะทำแบบชำระภายหลังผ่าน OrcaRouter และคุณสามารถติดตามการใช้งานโทเค็นได้ในแดชบอร์ด
Gemini 2.5 Flash Lite มีราคาถูกกว่าโมเดลขนาดใหญ่อย่าง Gemini 2.5 Flash (ซึ่งอาจมีราคาสูงกว่า 2-3 เท่า) และ Gemini 2.5 Pro (ซึ่งอาจมีราคาสูงกว่า 5-10 เท่า) อย่างมาก สำหรับงานที่ไม่จำเป็นต้องใช้ระดับการใช้เหตุผลที่ลึกซึ้งที่สุด Flash Lite ให้อัตราส่วนต้นทุนต่อผลประโยชน์ที่แข็งแกร่ง ตัวอย่างเช่น การประมวลผล 1 ล้าน input tokens ด้วย Flash Lite มีค่าใช้จ่าย $0.10 ในขณะที่การประมวลผลด้วยโมเดล Pro อาจมีค่าใช้จ่าย $1.00 หรือมากกว่า ข้อแลกเปลี่ยนคือคุณภาพที่ต่ำลงในงานที่ซับซ้อน หากแอปพลิเคชันของคุณสามารถยอมรับความแม่นยำที่ลดลงเล็กน้อยเพื่อแลกกับการประหยัดต้นทุนอย่างมหาศาล Flash Lite เป็นตัวเลือกที่ยอดเยี่ยม สำหรับแอปพลิเคชันที่สำคัญซึ่งทุกคำตอบต้องมีความแม่นยำสูงสุด ควรลงทุนในโมเดลขนาดใหญ่กว่า
ข้อเท็จจริงที่ให้มาไม่ได้กล่าวถึงโปรแกรมแคชหรือส่วนลดพิเศษใดๆ สำหรับ Gemini 2.5 Flash Lite บน OrcaRouter โดยปกติแล้ว OrcaRouter จะคิดค่าบริการตามอัตราของผู้ให้บริการโดยไม่บวกเพิ่ม ดังนั้นต้นทุนจึงเท่ากับราคาต่อโทเค็นที่ระบุไว้ หากคุณมีการใช้งานปริมาณมาก คุณอาจต้องการติดต่อฝ่ายสนับสนุนของ OrcaRouter เพื่อสอบถามเกี่ยวกับข้อตกลงสำหรับองค์กรที่เป็นไปได้ ในตอนนี้ การคิดราคาแบบมาตรฐานต่อโทเค็นยังคงมีผลใช้อยู่ เพื่อลดต้นทุน คุณสามารถลดความยาวของเอาต์พุต (max_tokens) และใช้พรอมพ์ที่สั้นลง เนื่องจาก Flash Lite มีราคาถูกอยู่แล้ว การแคชอาจไม่จำเป็นสำหรับกรณีการใช้งานส่วนใหญ่ แต่ระบบไม่ได้ให้ส่วนลดการแคชโดยธรรมชาติ
OrcaRouter ส่งต่อราคาจากผู้ให้บริการโดยไม่มีค่าธรรมเนียมเพิ่มเติมใดๆ ราคา $0.10 ต่อ 1M โทเค็นอินพุต และ $0.40 ต่อ 1M โทเค็นเอาต์พุตนั้นเป็นราคาที่ Google เรียกเก็บสำหรับ Gemini 2.5 Flash Lite เท่านั้น บทบาทของ OrcaRouter คือการให้บริการ API พื้นผิวที่เข้ากันได้กับ OpenAI แบบรวมศูนย์ ช่วยให้คุณเข้าถึงโมเดลนี้ได้โดยไม่ต้องใช้คีย์ Google API โดยตรง ไม่มีค่าธรรมเนียมแอบแฝง ค่าสมัครสมาชิก หรือการคิดราคาแบบหลายระดับ คุณจ่ายเฉพาะโทเค็นที่คุณใช้เท่านั้น ในราคาตามอัตราของผู้ให้บริการ ความโปร่งใสนี้ทำให้คุณประมาณการและควบคุมค่าใช้จ่ายได้ง่าย
ใช้ไคลเอนต์ที่เข้ากันได้กับ OpenAI (เช่น ไลบรารี Python openai, curl, Postman) โดยมี base URL เป็น https://api.orcarouter.ai/v1 ตั้งค่าพารามิเตอร์ model เป็น "google/gemini-2.5-flash-lite" ระบุคีย์ API ของ OrcaRouter ในส่วนหัว Authorization ตัวอย่าง Python ขั้นต่ำ: ```python from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your_key") response = client.chat.completions.create(model="google/gemini-2.5-flash-lite", messages=[{"role":"user","content":"What is 2+2?"}]) print(response.choices[0].message.content) ``` คุณยังสามารถส่งเนื้อหาแบบ multimodal โดยใช้รูปแบบ parts มาตรฐาน ไม่จำเป็นต้องกำหนดค่าเพิ่มเติม
API รองรับพารามิเตอร์มาตรฐานของ OpenAI ได้แก่: messages (พร้อม roles user/assistant/system), max_tokens (สูงสุด 65,536), temperature, top_p, n, stop, stream และอื่นๆ สำหรับอินพุตแบบ multimodal ให้รวมรายการส่วนประกอบเนื้อหา (เช่น text, image_url, audio_url, file_url) ไว้ในผู้ใช้ message โมเดลจะตีความรูปแบบต่างๆ โดยอัตโนมัติ หน้าต่างบริบทคือ 1,048,576 tokens; โมเดลจะตัดทอนหากคำขอเกินค่านี้ คุณสามารถตั้งค่า max_tokens ที่ต่ำกว่าเพื่อควบคุมต้นทุนและเวลาแฝง OrcaRouter ส่งพารามิเตอร์ไปยัง API ของ Google โดยตรง ดังนั้นพารามิเตอร์เฉพาะของ Gemini ส่วนใหญ่จึงได้รับการสนับสนุนเช่นกัน (เช่น safety settings, generationConfig) เมื่อรวมอยู่ใน body ของคำขอ
หากคุณกำลังย้ายจาก OpenAI, Anthropic หรือผู้ให้บริการอื่นที่มีปลายทางที่เข้ากันได้กับ OpenAI การย้ายข้อมูลนั้นทำได้ง่าย เพียงเปลี่ยน base URL ของคุณเป็น https://api.orcarouter.ai/v1 และอัปเดตฟิลด์ model เป็น "google/gemini-2.5-flash-lite" การจัดรูปแบบข้อความและโครงสร้างพารามิเตอร์ที่มีอยู่ของคุณจะยังคงเหมือนเดิมเป็นส่วนใหญ่ ตัวอย่างเช่น หากก่อนหน้านี้คุณใช้ "gpt-4o-mini" เพียงแค่เปลี่ยนสตริง model และชี้ไปที่ปลายทางของ OrcaRouter รูปแบบการตอบสนองจะเหมือนกัน รวมถึง choices, usage (prompt_tokens, completion_tokens, total_tokens) และ finish_reason ทดสอบด้วยตัวอย่างคำถามสองสามข้อเพื่อให้แน่ใจว่าสามารถทำงานร่วมกันได้ โดยเฉพาะกับเนื้อหาแบบ multimodal ซึ่งคุณอาจต้องปรับรูปแบบ content parts ให้ตรงกับความคาดหวังของผู้ให้บริการ
Gemini 2.5 Flash Lite เป็นเวอร์ชันที่คุ้มค่าและเร็วกว่า Gemini 2.5 Flash โมเดล Flash ที่ไม่ใช่ Lite มีแนวโน้มให้คะแนนมาตรฐานที่สูงกว่าในทั้งด้านคณิตศาสตร์และการใช้เหตุผลทั่วไป และอาจจัดการกับอินพุตแบบมัลติโมดัลที่ซับซ้อนได้แม่นยำกว่า อย่างไรก็ตาม ราคาของมันสูงกว่า (ไม่มีการระบุตัวเลขที่แน่นอน) รุ่น Lite จะลดทอนความลึกและความคิดสร้างสรรค์บางส่วนเพื่อแลกกับความหน่วงที่ต่ำกว่าและต้นทุนที่ต่ำกว่า ทั้งสองรุ่นใช้หน้าต่างบริบท 1M โทเค็นและการรองรับมัลติโมดัลแบบเดียวกัน สำหรับการปรับขนาดแอปพลิเคชันในระบบผลิตที่ต้นทุนเป็นปัจจัยหลัก Flash Lite คือตัวเลือกที่ดีกว่า สำหรับคุณภาพสูงสุด ให้อัปเกรดเป็นโมเดล Flash เต็มผ่าน OrcaRouter โดยเปลี่ยนรหัสโมเดลเป็น "google/gemini-2.5-flash"
GPT-4o mini เป็นโมเดลที่คุ้มค่าคุ้มราคาของ OpenAI โดยมีราคา $0.15 สำหรับอินพุตและ $0.60 สำหรับเอาต์พุตต่อ 1M tokens (อาจมีการเปลี่ยนแปลง) Gemini 2.5 Flash Lite ($0.10/$0.40) มีราคาถูกกว่าทั้งในส่วนอินพุตและเอาต์พุต ขนาดหน้าต่างบริบท: GPT-4o mini มี 128K tokens ขณะที่ Flash Lite ให้ 1M tokens ทำให้ Flash Lite เหนือกว่ามากสำหรับงานที่ต้องใช้บริบทยาว ในการทดสอบ MATH-500 Flash Lite ได้คะแนน 92.6 ส่วนคะแนนของ GPT-4o mini ไม่ได้ระบุไว้ แต่คาดว่าต่ำกว่า ในด้านความสามารถหลายรูปแบบ ทั้งสองรองรับรูปภาพและเสียง แต่ Gemini ยังรองรับวิดีโอและการป้อนไฟล์ด้วย GPT-4o mini อาจทำงานได้ดีกว่าในการสร้างโค้ดและการวัดประสิทธิภาพเชิงเหตุผลบางประการ การเลือกขึ้นอยู่กับความต้องการเฉพาะของคุณ: หากบริบทยาวและการใช้เหตุผลทางคณิตศาสตร์เป็นสิ่งสำคัญ Flash Lite จะแข็งแกร่งกว่า หากการเขียนโค้ดและข้อความเชิงสร้างสรรค์เป็นสิ่งที่ต้องให้ความสำคัญ GPT-4o mini อาจจะดีกว่า
Claude 3 Haiku ของ Anthropic เป็นอีกโมเดลหนึ่งที่มีต้นทุนต่ำและทำงานเร็ว มีราคาประมาณ $0.25 สำหรับอินพุตและ $1.25 สำหรับเอาต์พุตต่อ 1M โทเค็น (ณ ช่วงที่เปิดตัว) Gemini 2.5 Flash Lite มีราคาถูกกว่าอย่างมาก หน้าต่างบริบท: Claude 3 Haiku รองรับ 200K โทเค็น; Flash Lite รองรับ 1M โทเค็น มัลติโมดัล: Haiku รองรับข้อความและรูปภาพ; Flash Lite ยังรองรับไฟล์ เสียง และวิดีโอ ในด้านการให้เหตุผลทางคณิตศาสตร์ ไม่มีการระบุเกณฑ์มาตรฐานเฉพาะสำหรับ Haiku แต่คะแนน 92.6 ของ Flash Lite บน MATH-500 เป็นตัวบ่งชี้ที่ชัดเจน Haiku เป็นที่รู้จักในด้านการตอบสนองที่รวดเร็วและประสิทธิภาพที่แข็งแกร่งในงานที่มีโครงสร้าง Flash Lite ให้หน้าต่างบริบทที่ใหญ่กว่าในราคาที่ต่ำกว่า ทำให้เหมาะสำหรับงานเอกสารยาวและแอปพลิเคชันมัลติมีเดียมากกว่า สำหรับปริมาณงานที่สูงมากด้วยคุณภาพปานกลาง ทั้งสองรุ่นสามารถใช้งานได้; ด้านต้นทุน Flash Lite มีข้อได้เปรียบ
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| อินพุต / 1M โทเค็น | $0.100 |
| เอาต์พุต / 1M โทเค็น | $0.400 |
| อ่านแคช / 1M | $0.010 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
สิ่งที่นักพัฒนาพูดถึงในสัปดาห์นี้
GET /api/public/models/google/gemini-2.5-flash-liteเปิด @misc{orcarouter_gemini_2_5_flash_lite,
title = {Gemini 2.5 Flash Lite API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-lite}
}Google. (2025). Gemini 2.5 Flash Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-lite