Gemini 3.5 Flash-Lite เป็นโมเดล Gemini ที่คุ้มค่าที่สุดของ Google ออกแบบมาโดยเฉพาะสำหรับ workloads ที่มีปริมาณสูงมากและไวต่อเวลาแฝง ซึ่งต้นทุนต่อการเรียกใช้เป็นปัจจัยหลัก แม้จะมีราคาถูก แต่ก็เป็น multimodal โดยธรรมชาติ — รองรับข้อความ รูปภาพ วิดีโอ เสียง และไฟล์พร้อมเอาต์พุตข้อความ — และมีหน้าต่างบริบท 1M-token และเอาต์พุตสูงสุด 64K tokens เช่นเดียวกับ Flash ระดับที่ใหญ่กว่า ดังนั้นเอกสารยาวและอินพุตสื่อผสมยังคงเข้าถึงได้ ด้วยราคาประมาณหนึ่งในห้าของ 3.6 Flash จึงเป็นเครื่องมือที่เหมาะสมสำหรับการจำแนกประเภท การแยกข้อมูล การจัดเส้นทาง การสรุป เอเจนต์น้ำหนักเบา การสร้างข้อมูลสังเคราะห์ และไปป์ไลน์ใดๆ ที่ทำงานนับล้านครั้ง ยังคงรองรับการปรับระดับการใช้เหตุผล การเรียกใช้เครื่องมือแบบดั้งเดิม และเอาต์พุตที่มีโครงสร้าง และทำผลงานดีเกินขนาดในการวัดประสิทธิภาพด้านเอเจนต์และบริบทยาวสำหรับโมเดล Lite — เช่น 74.0% ใน OSWorld-Verified และ 72.2% ในการดึงเข็มหลายเข็มขนาด 128k เหนือกว่า 3.1 Flash-Lite รุ่นก่อนหน้าอย่างสบายๆ รองรับทั้งรูปแบบ chat-completions ของ OpenAI และ API generateContent ดั้งเดิมของ Gemini ดังนั้นคุณสามารถผสมกับโมเดลที่หนักกว่าเบื้องหลังการรวมระบบเดียว — ส่งเส้นทางการรับส่งข้อมูลง่ายและปริมาณสูงไปยัง Flash-Lite และส่งต่องานยากไปยัง 3.6 Flash หรือโมเดล Pro
Google Gemini 3.5 Flash-Lite เป็นโมเดลภาษาหลายรูปแบบ (multimodal) ที่พัฒนาโดย Google ให้บริการผ่าน API ที่เข้ากันได้กับ OpenAI ของ OrcaRouter รองรับอินพุตทั้งข้อความ รูปภาพ วิดีโอ ไฟล์ และเสียง…
Gemini 3.5 Flash-Lite มีความสามารถในการทำงานที่หลากหลาย ต้องขอบคุณอินพุตแบบมัลติโมดัลและการรองรับการใช้งานเครื่องมือ โดยสามารถจัดการงานที่ใช้ข้อความเพียงอย่างเดียว เช่น การสรุป การตอบคำถาม และการสร้างโค้ด ด้วยรูปภาพ สามารถอธิบายฉากต่างๆ ดึงข้อความจากเอกสาร หรือตีความไดอะแกรมได้ อินพุตวิดีโอช่วยให้สามารถจดจำกิจกรรม การสร้างคำบรรยาย และการใช้เหตุผลเชิงเวลาได้ อินพุตเสียงช่วยอำนวยความสะดวกในการถอดความ การระบุภาษา และการวิเคราะห์ตามคำพูด โมเดลนี้ยังรองรับการเรียกใช้เครื่องมือ โดยเห็นได้จากคะแนน CharXiv Reasoning ที่ 76.5 (พร้อมเครื่องมือ) ซึ่งหมายความว่าสามารถรวมเข้ากับเวิร์กโฟลว์แบบเอเยนต์ที่เรียกใช้ API หรือฐานข้อมูลภายนอกได้ อย่างไรก็ตาม โมเดลนี้ไม่ได้ออกแบบมาสำหรับการเขียนเชิงสร้างสรรค์ การใช้เหตุผลเชิงนามธรรมขั้นสูง หรืองานที่ต้องใช้ความเชี่ยวชาญเฉพาะด้านอย่างลึกซึ้ง จุดแข็งของมันอยู่ที่ความเร็ว ต้นทุน และความกว้างของการรองรับโหมดต่างๆ มากกว่าประสิทธิภาพดิบ
คุณควรเลือก Gemini 3.5 Flash-Lite เมื่อต้นทุนและปริมาณงานเป็นข้อกังวลหลัก และงานนั้นอยู่ในขีดความสามารถของมัน โมเดลนี้โดดเด่นในงานไปป์ไลน์ที่มีปริมาณสูง เช่น การจัดทำดัชนีเอกสารนับพัน การถอดเสียงเสียงเป็นเวลาหลายชั่วโมง หรือการจำแนกประเภทแบบเรียลไทม์บนสตรีมภาพ หน้าต่างบริบทขนาดใหญ่ (1M tokens) ทำให้เหมาะสำหรับงานที่ต้องใช้ความเข้าใจโดยรวมของอินพุตที่ยาว เช่น การวิเคราะห์คดีความทางตุลาการ หรือการปรับปรุงโค้ดเบส โมเดลที่ใหญ่กว่า (เช่น Gemini 3.5 Pro) อาจมีความแม่นยำสูงกว่าในการวัดประสิทธิภาพที่ซับซ้อน แต่มาพร้อมกับต้นทุนต่อโทเค็นที่สูงกว่าและปริมาณงานที่ต่ำกว่า หากแอปพลิเคชันของคุณสามารถยอมรับการลดทอนคุณภาพเล็กน้อยเพื่อลดต้นทุน 10‑100 เท่า โมเดลนี้เป็นตัวเลือกที่เหมาะสม ในทางกลับกัน สำหรับงานที่ต้องการความแม่นยำเชิงข้อเท็จจริง การสร้างสรรค์ หรือการใช้เหตุผลที่ล้ำสมัย ควรใช้โมเดลที่ใหญ่กว่า
ใช่ โมเดลรองรับการป้อนข้อมูลวิดีโอและเสียงโดยตรง พร้อมกับข้อความ รูปภาพ และไฟล์ การป้อนวิดีโอสามารถทำได้ในรูปแบบลำดับเฟรมหรือไฟล์วิดีโอ โมเดลจะประมวลผลเฟรมภาพและแทร็กเสียงที่เกี่ยวข้อง การป้อนเสียงทำงานกับรูปแบบทั่วไปเช่น WAV, MP3 หรือ FLAC หน้าต่างบริบทที่ใหญ่ทำให้สามารถประมวลผลการบันทึกยาวในคำขอเดียว – ตัวอย่างเช่น การถอดเสียงความละเอียดสูงหนึ่งชั่วโมงอาจใช้ประมาณ 10,000 โทเค็น ซึ่งมีประโยชน์สำหรับการสรุปการประชุม การวิเคราะห์พอดแคสต์ หรือการสนับสนุนลูกค้าด้วยเสียง หมายเหตุ: โมเดลไม่สร้างเอาต์พุตเสียงหรือวิดีโอ การตอบกลับจะเป็นข้อความเสมอ คุณภาพของความเข้าใจหลายรูปแบบตรงกับระดับ flash‑lite ของโมเดล: เพียงพอสำหรับการแยกและการจำแนก แต่อาจพลาดรายละเอียดเล็กน้อยเมื่อเทียบกับโมเดลหลายรูปแบบที่ใหญ่กว่า
Gemini 3.5 Flash-Lite รองรับการเรียกใช้เครื่องมือ (tool calling) ซึ่งเห็นได้จากประสิทธิภาพในการวัดผลบน CharXiv Reasoning with tools (คะแนน 76.5) ซึ่งหมายความว่าคุณสามารถกำหนดฟังก์ชันหรือ API ที่โมเดลสามารถเรียกใช้ระหว่างการสร้างคำตอบได้ กรณีการใช้งานทั่วไป ได้แก่ การค้นหาฐานข้อมูล การค้นหาเว็บ หรือการดำเนินการทางคณิตศาสตร์ โมเดลจะเลือกเวลาที่จะเรียกใช้เครื่องมือตามคำสั่งของผู้ใช้และบริบท การใช้เครื่องมือสามารถช่วยเพิ่มความถูกต้องตามข้อเท็จจริงและช่วยให้สามารถใช้เหตุผลแบบหลายขั้นตอนที่ซับซ้อนได้ อย่างไรก็ตาม เนื่องจากโมเดลนี้เป็นตัวแปรแบบ flash-lite ความน่าเชื่อถือในการเรียกใช้เครื่องมืออาจต่ำกว่าโมเดลเฉพาะทางที่ใหญ่กว่า หากแอปพลิเคชันของคุณพึ่งพาการจัดเรียงเครื่องมือที่ไร้ที่ติอย่างมาก คุณอาจต้องเพิ่มชั้นการตรวจสอบหรือตรรกะสำรอง OrcaRouter จะส่งผ่านคำจำกัดความของเครื่องมือในรูปแบบเดียวกับ API ของ OpenAI ทำให้การผสานรวมเป็นเรื่องตรงไปตรงมา
โมเดลได้คะแนน 76.5 ในการทดสอบ CharXiv Reasoning เมื่อประเมินด้วยเครื่องมือ (tools) CharXiv ทดสอบความสามารถในการใช้เหตุผลกับข้อมูลภาพที่มีแผนภูมิ โดยกำหนดให้โมเดลตีความภาพแผนภูมิและตอบคำถามเกี่ยวกับแผนภูมินั้น เงื่อนไข “พร้อมเครื่องมือ” หมายความว่าโมเดลสามารถเรียกใช้ฟังก์ชันภายนอก (เช่น เครื่องคิดเลข) เพื่อช่วยในการทำงาน คะแนนนี้บ่งชี้ถึงประสิทธิภาพในระดับปานกลาง – โมเดลสามารถใช้เหตุผลเกี่ยวกับแผนภูมิได้ แต่ยังไม่ถึงระดับของโมเดลเฉพาะทาง ยังไม่มีคะแนนมาตรฐานอื่นใดสำหรับโมเดลนี้ สำหรับการเปรียบเทียบ โมเดลขนาดใหญ่กว่า เช่น Gemini 3.5 Pro น่าจะทำคะแนนได้สูงกว่าในภารกิจนี้ คะแนนนี้มีประโยชน์ในฐานะจุดอ้างอิง: คุณสามารถคาดหวังการตีความแผนภูมิในระดับที่สมเหตุสมผล แต่ควรทดสอบอย่างละเอียดหากแอปพลิเคชันของคุณต้องการความแม่นยำสูงในงานด้านการใช้เหตุผลทางภาพ
มีเพียงคะแนน CharXiv Reasoning (พร้อมเครื่องมือ) เท่านั้นที่ให้มา: 76.5 ไม่มีข้อมูลเกณฑ์มาตรฐานเพิ่มเติม – เช่น MMLU, HumanEval หรือคะแนนการดึงข้อมูลบริบทระยะยาว – สำหรับ Gemini 3.5 Flash‑Lite ในข้อมูลที่ให้มา ซึ่งหมายความว่าการประเมินประสิทธิภาพของมันสำหรับงานอื่นๆ จำเป็นต้องทดสอบเชิงประจักษ์บนข้อมูลของคุณเอง เนื่องจากธรรมชาติของโมเดลแบบ flash‑lite คาดว่ามันจะมีประสิทธิภาพต่ำกว่าโมเดลขนาดเต็มในเกณฑ์มาตรฐานมาตรฐานส่วนใหญ่ อย่างไรก็ตาม ประสิทธิภาพและต้นทุนที่ต่ำของมันมักจะชดเชยข้อเสียเหล่านี้ในสภาพแวดล้อมการผลิต หากคุณต้องการประสิทธิภาพที่ได้รับการยืนยันบนเกณฑ์มาตรฐานเฉพาะ (เช่น การสร้างโค้ดหรือความเข้าใจภาษาหลายภาษา) คุณควรดำเนินการประเมินผลด้วยตัวเอง OrcaRouter ไม่ได้โฮสต์ผลลัพธ์เกณฑ์มาตรฐานแยกต่างหาก ตัวเลขที่อ้างถึงที่นี่มาจากผู้ให้บริการโดยตรง
ไม่มีรายละเอียดเกี่ยวกับเวลาแฝงในข้อมูลที่ให้มา ตามหลักทั่วไป โมเดล flash‑lite ได้รับการออกแบบให้มีเวลาแฝงต่ำเมื่อเทียบกับรุ่นใหญ่กว่า แต่เวลาตอบสนองจริงขึ้นอยู่กับหลายปัจจัย ได้แก่ ความยาวอินพุต ความยาวเอาต์พุต ภาระคำขอพร้อมกัน และฮาร์ดแวร์พื้นฐาน ด้วยหน้าต่างบริบท 1M การประมวลผลข้อความแจ้งเตือนที่ยาวมากอาจเพิ่มเวลาแฝงอย่างมากเนื่องจากการปรับสเกลแบบกำลังสองของแอตเทนชัน สำหรับอินพุตสั้น (เช่น ไม่กี่ร้อยโทเคน) คุณสามารถคาดหวังการตอบสนองภายในเสี้ยววินาที สำหรับอินพุตใกล้ขีดจำกัด 1M โทเคน เวลาแฝงอาจสูงถึงหลายสิบวินาที OrcaRouter ไม่รับประกัน SLA เวลาแฝงเฉพาะสำหรับโมเดลนี้ หากเวลาแฝงต่ำมีความสำคัญ ให้พิจารณาใช้บริบทที่เล็กลง (เช่น การตัดทอน) หรือเอนด์พอยต์เฉพาะ คุณสามารถตรวจสอบเวลาตอบสนองผ่านแดชบอร์ดของ OrcaRouter
Gemini 3.5 Flash-Lite ไม่ได้ออกแบบมาเพื่อความแม่นยำที่ล้ำสมัย จุดแข็งคือความเร็ว ต้นทุนต่ำ และบริบทขนาดใหญ่ ข้อจำกัดต่างๆ ได้แก่ ประสิทธิภาพที่ต่ำลงในการวัดความสามารถด้านการคิดเชิงซับซ้อน (complex reasoning benchmarks) การจดจำข้อเท็จจริงที่ลดลงเมื่อเทียบกับโมเดลขนาดใหญ่ และแนวโน้มที่จะ "เกิดภาพหลอน" (hallucinate) เมื่ออินพุตมีความคลุมเครือ โมเดลอาจประสบปัญหาเมื่อต้องทำงานที่ต้องใช้ความเชี่ยวชาญเฉพาะด้านสูง (เช่น การใช้เหตุผลทางกฎหมาย การวินิจฉัยทางการแพทย์) หรืองานสร้างสรรค์ที่ละเอียดอ่อน ความสามารถในการใช้เครื่องมือ (tool-use capability) แม้จะใช้งานได้ แต่ก็อาจไม่น่าเชื่อถือเท่ากับโมเดลที่ออกแบบให้เป็น agentic model โดยเฉพาะ นอกจากนี้ เนื่องจากมีคะแนน benchmark เพียงหนึ่งคะแนนให้ (CharXiv Reasoning 76.5 with tools) คุณจึงไม่ควรสมมติว่าโมเดลจะมีประสิทธิภาพดีในโดเมนอื่นๆ โดยไม่ผ่านการทดสอบ สำหรับแอปพลิเคชันที่สำคัญ ควรทำ benchmark บนข้อมูลของคุณเองเสมอ และพิจารณาใช้ fallback ไปยังโมเดลที่มีความสามารถสูงกว่าเมื่อความมั่นใจต่ำ
ราคาอยู่ที่ $0.30 ต่อ 1 ล้านโทเค็นอินพุต และ $2.50 ต่อ 1 ล้านโทเค็นเอาต์พุต อัตราเหล่านี้เป็นอัตราของผู้ให้บริการที่เรียกเก็บโดยไม่มีมาร์กอัปใดๆ จาก OrcaRouter โทเค็นอินพุตรวมโทเค็นทั้งหมดในพรอมพ์ (ข้อความ, โทเค็นรูปภาพ, เฟรมวิดีโอ, ตัวอย่างเสียง, เนื้อหาไฟล์) โดยไม่คำนึงถึงรูปแบบ โทเค็นเอาต์พุตคือโทเค็นข้อความที่สร้างขึ้น สำหรับคำค้นหาบริบทยาวทั่วไปที่ใช้ 100,000 โทเค็นอินพุตและ 1,000 โทเค็นเอาต์พุต ค่าใช้จ่ายจะอยู่ที่ประมาณ ($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325 ต่อคำขอ ในระดับขนาดใหญ่ โมเดลนี้สามารถประมวลผลคำขอหลายล้านครั้งด้วยเงินไม่กี่ร้อยดอลลาร์ เปรียบเทียบกับโมเดลขนาดใหญ่ที่มักมีต้นทุนสูงกว่า 10‑50x ต่อโทเค็น ราคาเอาต์พุตที่ต่ำนี้เป็นประโยชน์อย่างยิ่งสำหรับแอปพลิเคชันที่สร้างคำตอบยาวๆ (เช่น สรุปเอกสารทั้งฉบับ)
ข้อมูลที่ให้มาไม่ได้ระบุกลไกการแคชหรือราคาส่วนลดสำหรับโทเค็นที่ถูกแคชไว้ ดังนั้น คุณควรถือว่าโทเค็นทุกตัวที่ส่งไปยังโมเดลจะถูกเรียกเก็บในอัตราอินพุตมาตรฐานที่ $0.30 ต่อล้านโทเค็น โดยไม่คำนึงถึงการทำซ้ำ ผู้ให้บริการบางรายเสนอการแคชพรอมต์อัตโนมัติ โดยที่คำนำหน้าที่ซ้ำกันจะถูกเรียกเก็บในอัตราที่ต่ำกว่า (เช่น ลด 50%) สำหรับโมเดลนี้ ยังไม่มีการประกาศส่วนลดการแคชดังกล่าว หากคุณส่งบริบทเดียวกันซ้ำบ่อยๆ (เช่น พรอมต์ระบบขนาดใหญ่) คุณอาจต้องการตรวจสอบว่า OrcaRouter หรือ Google นำการแคชแบบโปร่งใสมาใช้หรือไม่ ในกรณีที่ไม่มีข้อมูลที่ชัดเจน วิธีที่ปลอดภัยที่สุดคือการจัดงบประมาณต้นทุนต่อโทเค็นเต็มสำหรับอินพุตทั้งหมด การปรับให้เหมาะสมโดยการตัดเนื้อหาที่ใช้ซ้ำออกสามารถลดค่าใช้จ่ายที่เกิดขึ้นจริงได้
การไม่มีมาร์กอัปหมายความว่า OrcaRouter คิดค่าบริการตามอัตราของผู้ให้บริการอย่างแน่นอน โดยไม่เพิ่มกำไรส่วนเพิ่มใดๆ สำหรับ Gemini 3.5 Flash-Lite ราคาอินพุตคือ $0.30/1M โทเค็น และราคาเอาต์พุตคือ $2.50/1M โทเค็น – ซึ่งเป็นราคาที่ Google เรียกเก็บ และ OrcaRouter ส่งผ่านโดยไม่เพิ่มขึ้น คุณไม่ต้องจ่ายค่าธรรมเนียมแพลตฟอร์มเพิ่มเติมต่อโทเค็นใดๆ ซึ่งถือเป็นเรื่องที่ผิดปกติเมื่อเทียบกับเกตเวย์ API ทั่วไปที่มักจะเพิ่มอีก 10-20% หรือมากกว่า การไม่มีมาร์กอัปทำให้โมเดลนี้คุ้มค่ามากยิ่งขึ้นเมื่อเข้าถึงผ่าน OrcaRouter คุณยังคงจ่ายค่าแบนด์วิดท์และโครงสร้างพื้นฐาน API แต่ค่าใช้จ่ายเหล่านั้นรวมอยู่ในอัตราของผู้ให้บริการแล้ว OrcaRouter ไม่ได้แยกรายการแยกต่างหาก โมเดลราคานี้โปร่งใส: ต้นทุนที่แสดงในแดชบอร์ดการใช้งานของคุณคือต้นทุนสุดท้าย
คุณเรียกใช้งานโดยใช้ API ที่เข้ากันได้กับ OpenAI ของ OrcaRouter ที่ URL พื้นฐาน https://api.orcarouter.ai/v1 กำหนดพารามิเตอร์ model เป็น "google/gemini-3.5-flash-lite" ทั้ง chat completions (POST /v1/chat/completions) และ embeddings (หากรองรับ) ก็ทำงานได้ สำหรับอินพุตแบบ multimodal คุณจัดโครงสร้างข้อความด้วยอาร์เรย์ roles และวัตถุ content ที่อาจมีฟิลด์ text, image_url หรือ file_url ตัวอย่างคำขอ cURL: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' คุณต้องใช้คีย์ API ของ OrcaRouter ไม่ใช่คีย์ API ของ Google
โมเดลรองรับพารามิเตอร์มาตรฐานที่เข้ากันได้กับ OpenAI: model, messages, max_tokens (สูงสุดถึงขีดจำกัด 65,536 ของโมเดล), temperature, top_p, stop, frequency_penalty, presence_penalty, และ tools (สำหรับการเรียกใช้ฟังก์ชัน) พารามิเตอร์เฉพาะของ Google (เช่น safety_settings) อาจไม่เปิดเผยโดยตรง หากคุณต้องการ ให้ตรวจสอบเอกสารของ OrcaRouter สำหรับค่าที่เทียบเท่า โมเดลจะเคารพขีดจำกัด max_tokens สำหรับอินพุตแบบหลายรูปแบบ ฟิลด์ type ใน content รองรับ: text, image_url, video_url (ถ้า OrcaRouter เปิดเผย), audio_url, และ file_url ประเภทไฟล์สามารถรับ PDF, CSV ฯลฯ โปรดทราบว่าไฟล์สื่อขนาดใหญ่อาจต้องเข้ารหัสล่วงหน้าเป็น data URIs หรือโฮสต์แบบสาธารณะ OrcaRouter อาจกำหนดให้ไฟล์มีขนาดไม่เกินที่กำหนด ควรตรวจสอบเอกสาร API ล่าสุดเสมอสำหรับการรองรับพารามิเตอร์ที่แน่นอน
ในการย้ายจากผู้ให้บริการ API รายอื่น (เช่น Google AI Studio, Vertex AI หรือเกตเวย์อื่นๆ) มายัง OrcaRouter ให้แทนที่ base URL ด้วย https://api.orcarouter.ai/v1 และตั้งค่า model ID เป็น "google/gemini-3.5-flash-lite" หากโค้ดที่มีอยู่ของคุณใช้ OpenAI Python client ให้ส่ง base_url และ api_key ตัวอย่าง: from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) คุณอาจต้องปรับรูปแบบข้อความแบบ multimodal หากผู้ให้บริการก่อนหน้านี้ใช้ schema ที่แตกต่างกัน (เช่น Anthropic) OrcaRouter คาดหวังรูปแบบ OpenAI อาร์เรย์เนื้อหาของผู้ใช้สามารถมีหลายส่วนได้ นิยามเครื่องมือก็เป็นสไตล์ OpenAI เช่นกัน ไม่มีค่าธรรมเนียมการย้ายเพิ่มเติม คุณจ่ายเฉพาะต่อ token ตามที่อธิบายไว้
ไม่มีข้อมูลเปรียบเทียบโดยตรงให้ แต่เราสามารถใช้เหตุผลเชิงคุณภาพได้ Gemini 2.0 Flash (ถ้ามี) น่าจะเป็นโมเดล Flash รุ่นก่อนหน้า Gemini 3.5 Flash‑Lite เป็นรุ่น Lite ที่ใหม่กว่า มี context window ที่ใหญ่กว่า (1M เทียบกับน่าจะ 128K) และราคาต่ำกว่า ราคาต่อ token ของ Gemini 3.5 Flash‑Lite คือ $0.30/$2.50 ต่อล้าน token ซึ่งต่ำมาก โมเดล Flash รุ่นเก่าอาจมีต้นทุนต่อ token สูงกว่าและ context window สั้นกว่า อย่างไรก็ตาม Gemini 2.0 Flash อาจมีความแม่นยำดิบที่ดีกว่าหากเป็นโมเดล Flash เต็มรูปแบบ而非 Lite variant หากงานของคุณต้องการคุณภาพสูงสุดและคุณรับต้นทุนที่สูงกว่าได้ โมเดล Flash เต็มรูปแบบรุ่นเก่าอาจดีกว่า หากคุณต้องการ context ขนาดใหญ่และต้นทุนต่ำ 3.5 Flash‑Lite คือตัวเลือกที่สมเหตุสมผล
GPT-4o mini จาก OpenAI เป็นโมเดล multimodal ที่มีต้นทุนต่ำคล้ายกัน มีหน้าต่างบริบทขนาด 128K โทเค็น (เล็กกว่าอย่างมีนัยสำคัญเมื่อเทียบกับ 1M) และมีราคาอยู่ที่ $0.15 ต่อล้านโทเค็นขาเข้า และ $0.60 ต่อล้านโทเค็นขาออก (ณ ต้นปี 2025; ราคาอาจมีการเปลี่ยนแปลง) Gemini 3.5 Flash‑Lite มีหน้าต่างบริบทที่ใหญ่กว่า 8 เท่า โดยมีราคาขาเข้าเป็น 2 เท่า และราคาขาออกเป็น 4 เท่า ดังนั้น Gemini จึงมีราคาต่อโทเค็นที่แพงกว่า แต่ให้ความจุบริบทที่ใหญ่กว่ามาก สำหรับงานที่ต้องการบริบทเต็ม 1M (เช่น การประมวลผลหนังสือทั้งเล่ม) Gemini Flash‑Lite จะคุ้มค่ากว่าการพยายามแบ่งอินพุตออกเป็นหลายส่วนในการเรียก GPT‑4o mini หลายครั้ง หากบริบทสั้น GPT‑4o mini จะถูกกว่าและอาจมีประสิทธิภาพในการวัดเกณฑ์ที่ดีกว่า คะแนนการวัดเกณฑ์ทั้งสองแบบไม่สามารถเปรียบเทียบกันโดยตรงได้หากไม่มีข้อมูล
ไม่มีการเปรียบเทียบเกณฑ์มาตรฐานใดๆ ให้ไว้ Llama 3.2 90B (สมมติว่าโมเดลนี้มีอยู่จริง) เป็นโมเดล open‑weights ขนาดใหญ่ที่มีหน้าต่างบริบทที่เล็กกว่า (โดยทั่วไป 128K tokens) และมีต้นทุนต่อ token สูงกว่าเมื่อเรียกใช้ผ่าน API Gemini 3.5 Flash‑Lite เป็นโมเดลกรรมสิทธิ์ที่มีหน้าต่างบริบทที่ใหญ่กว่ามากและราคาต่ำมาก – เป็นหนึ่งในโมเดล multimodal ที่ถูกที่สุดต่อ token ที่มีให้ใช้ Llama 3.2 90B อาจมีความแม่นยำสูงกว่าในเกณฑ์มาตรฐาน NLP หลายๆ ตัวเนื่องจากขนาดของมัน แต่ไม่ใช่ multimodal และมีข้อจำกัดด้านบริบทที่เข้มงวดกว่า หากงานของคุณเป็นข้อความอย่างเดียวและคุณต้องการความแม่นยำสูงสุด Llama 90B (หากเข้าถึงได้ผ่าน OrcaRouter) อาจดีกว่า สำหรับสถานการณ์ multimodal, บริบทยาว, หรือปริมาณงานสูง Gemini Flash‑Lite มีข้อได้เปรียบที่ชัดเจน การเลือกขึ้นอยู่กับข้อกำหนดเฉพาะของแอปพลิเคชันของคุณ
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| อินพุต / 1M โทเค็น | $0.300 |
| เอาต์พุต / 1M โทเค็น | $2.50 |
| อ่านแคช / 1M | $0.030 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/google/gemini-3.5-flash-liteเปิด @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite