Gemini 3.6 Flash เป็นโมเดลที่รวดเร็วและคุ้มค่าต้นทุนรุ่นล่าสุดของ Google ในตระกูล Gemini 3 — โมเดลที่รองรับหลายรูปแบบโดยธรรมชาติ อ่านข้อความ รูปภาพ วิดีโอ เสียง และไฟล์ และตอบกลับเป็นข้อความ พร้อมหน้าต่างบริบท 1M โทเค็นและเอาต์พุตสูงสุด 64K โทเค็น มันถูกสร้างขึ้นสำหรับทีมที่ต้องการคุณภาพใกล้เคียงกับโมเดลระดับแนวหน้า ด้วยความเร็วและราคาระดับ Flash และเป็นตัวเลือกเริ่มต้นที่แข็งแกร่งในด้านเอเจนต์การเขียนโค้ด การทำความเข้าใจเอกสารและสื่อ การสร้างข้อมูลเสริมจากการค้นคืน และระบบอัตโนมัติที่มีปริมาณงานสูง เมื่อเทียบกับรุ่นก่อนหน้าอย่าง 3.5 Flash แล้ว มันมีประสิทธิภาพด้านโทเค็นสูงกว่าอย่างเห็นได้ชัดและใช้คำน้อยกว่า — ให้คุณภาพเท่าเดิมหรือดีกว่าในขณะที่สร้างโทเค็นเอาต์พุตน้อยลง ซึ่งช่วยลดต้นทุนและเวลาแฝงโดยตรงในการทำงานแบบเอเจนต์ที่ยาวนาน รองรับการปรับระดับความพยายามในการใช้เหตุผล (เพื่อให้ผู้เรียกสามารถปรับความลึกเทียบกับความเร็วในแต่ละคำขอได้) การเรียกใช้เครื่องมือแบบเนทีฟ และเอาต์พุตที่มีโครงสร้าง และทำงานได้ดีในการประเมินบริบทระยะยาวและการเขียนโค้ดแบบเอเจนต์ในระดับเดียวกัน โดยได้ 91.8% ในการค้นคืนแบบหลายเข็มเฉลี่ย 128k และคะแนนที่แข่งขันได้บน SWE-Bench Pro, Terminal-Bench และ OSWorld Gemini 3.6 Flash รองรับทั้งรูปแบบ chat-completions ของ OpenAI และ API generateContent ดั้งเดิมของ Gemini ทำให้เป็นอัปเกรดแบบเปลี่ยนแทนที่ได้ทันทีสำหรับการผสานรวมที่มีอยู่กับ Gemini และระบบที่รองรับ OpenAI ใช้มันเป็นม้าทำงานประจำวันเมื่อคุณต้องการความฉลาดส่วนใหญ่ของโมเดลระดับแนวหน้าโดยไม่ต้องจ่ายในราคาระดับแนวหน้า
Google Gemini 3.6 Flash เป็นโมเดล multimodal ขนาดใหญ่ที่พัฒนาโดย Google ให้บริการผ่าน API ของ OrcaRouter ด้วยราคาโปร่งใส (ไม่มีมาร์กอัป) รองรับอินพุตแบบข้อความ รูปภาพ วิดีโอ ไฟล์ และเสียง…
Gemini 3.6 Flash โดดเด่นในการประมวลผลบริบทที่ยาว (สูงสุด 1,048,576 โทเค็น) และจัดการกับอินพุตแบบหลายรูปแบบ คะแนน benchmark ที่ 91.8 บน GDM-MRCR v2 8-needle (128k เฉลี่ย) บ่งชี้ถึงความสามารถในการดึงข้อมูลและทำความเข้าใจข้ามเข็มจำนวนมากในกองหญ้า หมายความว่ารุ่นนี้สามารถระบุข้อมูลเฉพาะในเอกสารขนาดใหญ่ได้อย่างแม่นยำ รุ่นนี้ยังรองรับอินพุตเสียงและวิดีโอ ทำให้สามารถใช้งานเช่นการถอดเสียงพูดจากวิดีโอ วิเคราะห์แผนภูมิ หรือตอบคำถามเกี่ยวกับลำดับภาพ การตั้งชื่อ Flash หมายถึงเวลาแฝงต่ำและประสิทธิภาพด้านต้นทุน ทำให้เหมาะสำหรับแอปพลิเคชันแบบเรียลไทม์หรือปริมาณสูง เนื่องจากให้บริการผ่าน OrcaRouter ในราคาของผู้ให้บริการโดยไม่มีส่วนเพิ่ม ต้นทุนทั้งหมดจึงโปร่งใสและคาดการณ์ได้
Gemini 3.6 Flash เป็นตัวแปร Flash ที่ปรับต้นทุนให้เหมาะสมจาก Google อยู่แล้ว อย่างไรก็ตาม หากกรณีการใช้งานของคุณไม่จำเป็นต้องใช้ข้อมูลนำเข้าแบบหลายรูปแบบ (เช่น งานที่เป็นข้อความล้วน) โมเดลข้อความล้วนที่มีขนาดเล็กกว่าและมีหน้าต่างบริบทสั้นกว่าอาจจะถูกกว่าและเร็วกว่า หากงานของคุณอยู่ในช่วง 8K–32K โทเค็น โมเดลอย่าง Gemini 1.5 Flash (หากมีให้ใช้ผ่าน OrcaRouter) หรือโมเดลน้ำหนักเบาอื่นๆ อาจเพียงพอด้วยต้นทุนต่อโทเค็นที่ต่ำกว่า นอกจากนี้ หากคุณไม่เคยใช้เสียง วิดีโอ หรือไฟล์เป็นข้อมูลนำเข้า คุณอาจจ่ายเงินสำหรับความสามารถที่คุณไม่จำเป็นต้องใช้ การตัดสินใจควรขึ้นอยู่กับรูปแบบข้อมูลนำเข้าที่แน่ชัด ความยาวบริบทที่ต้องการ และข้อกำหนดด้านคุณภาพ OrcaRouter แสดงราคาสำหรับแต่ละโมเดล คุณจึงสามารถเปรียบเทียบอัตราต่อโทเค็นและเลือกตัวเลือกที่ประหยัดที่สุดได้
งานที่ได้รับประโยชน์จาก Gemini 3.6 Flash ได้แก่: (1) การดึงข้อมูลบริบทระยะยาวและการตอบคำถามจากเอกสารที่มีมากกว่า 100K โทเค็น (2) การใช้เหตุผลแบบหลายรูปแบบซึ่งต้องรวมข้อมูลภาพ เสียง และข้อความเข้าด้วยกัน (3) การสรุปหรือวิเคราะห์วิดีโอ (4) การประมวลผลไฟล์ เช่น การแยกวิเคราะห์ PDF สเปรดชีต หรืองานนำเสนอที่มีรูปภาพและข้อความ และ (5) แอปพลิเคชันที่คำนึงถึงต้นทุนแต่ยังคงต้องการความสามารถหลายรูปแบบ ขีดจำกัดเอาต์พุต 65,536 โทเค็นช่วยให้สามารถสร้างสรุป รายงาน หรือโค้ดที่มีความยาวได้ โมเดลนี้เหมาะน้อยกว่าสำหรับงานที่ต้องการการอนุมานเชิงตรรกะที่เข้มงวดหรือการใช้เหตุผลทางคณิตศาสตร์ซึ่งอาจต้องใช้รุ่นที่ไม่ใช่ Flash กรณีการใช้งานดังกล่าวอาจได้ประโยชน์จากความแม่นยำที่สูงขึ้น แต่มีต้นทุนที่สูงกว่า ทดสอบงานเฉพาะของคุณเพื่อยืนยันคุณภาพเทียบกับทางเลือกอื่น
ผ่าน API ที่เข้ากันได้กับ OpenAI ของ OrcaRouter, Gemini 3.6 Flash รองรับการตอบกลับแบบสตรีม (โดยใช้พารามิเตอร์ `stream`) และการเรียกใช้ฟังก์ชัน (คือ การใช้เครื่องมือ) เมื่อกำหนดค่าอย่างถูกต้อง ความพร้อมใช้งานที่แน่นอนของคุณสมบัติเหล่านี้ขึ้นอยู่กับ Google API ที่อยู่เบื้องหลัง แต่ OrcaRouter จะแมปรูปแบบคำขอของ OpenAI ไปยังปลายทางของ Google สำหรับการสตรีม ให้ตั้งค่า `"stream": true` ในคำขอ สำหรับการเรียกใช้ฟังก์ชัน ให้กำหนดเครื่องมือในเนื้อหาคำขอโดยใช้สคีมามาตรฐานของ OpenAI คุณควรทดสอบคุณสมบัติเหล่านี้ด้วยรหัสโมเดล `google/gemini-3.6-flash` ที่ URL ฐานของ OrcaRouter หมายเหตุ: โมเดล Gemini ทุกรุ่นอาจไม่รองรับทุกความสามารถ โปรดดูเอกสารของ Google สำหรับรุ่นโมเดลเฉพาะที่อยู่ภายใต้นามแฝง
คะแนนเกณฑ์มาตรฐานที่ให้มาคือ 91.8 บน GDM-MRCR v2 8-needle โดยมีความยาวบริบทเฉลี่ย 128K โทเค็น GDM-MRCR (Google’s Multi-Context Retrieval) v2 วัดความสามารถของโมเดลในการดึงข้อมูลและให้เหตุผลเหนือข้อมูลหลายชิ้น ("เข็ม") ที่วางไว้ในบริบทที่ยาว คะแนน 91.8 บ่งชี้ว่าโมเดลสามารถค้นหาและตอบคำถามเกี่ยวกับเข็มได้ถูกต้องโดยเฉลี่ย 91.8% ของเข็มทั้งหมด ซึ่งเป็นผลลัพธ์ที่แข็งแกร่งสำหรับโมเดล Flash โดยแสดงให้เห็นว่า Gemini 3.6 Flash สามารถดึงข้อเท็จจริงจากเอกสารที่ยาวมากได้อย่างน่าเชื่อถือ เกณฑ์มาตรฐานไม่ครอบคลุมทั้งหมด พวกมันทดสอบสถานการณ์เฉพาะ ประสิทธิภาพในโลกจริงอาจแตกต่างกันไปขึ้นอยู่กับความซับซ้อนของงานดึงข้อมูล จำนวนตัวกวน และรูปแบบของข้อมูล
ข้อมูลเวลาแฝงไม่ได้ระบุสำหรับ Gemini 3.6 Flash แต่โดยทั่วไปแล้วโมเดล Flash ได้รับการปรับให้เหมาะสมสำหรับเวลาอนุมานที่ต่ำกว่าเมื่อเทียบกับรุ่นที่ไม่ใช่ Flash เวลาตอบสนองจริงขึ้นอยู่กับปัจจัยต่างๆ เช่น ความยาวของบริบทอินพุต จำนวนโทเค็นเอาต์พุตที่ร้องขอ ความซับซ้อนของการเข้ารหัสแบบมัลติโมดัล (เช่น จำนวนรูปภาพหรือเฟรมวิดีโอ) และโหลดของเซิร์ฟเวอร์ที่ผู้ให้บริการ เนื่องจาก OrcaRouter ทำหน้าที่เป็นเกตเวย์ เวลาแฝงจึงรวมทั้งการไป-กลับไปยังเซิร์ฟเวอร์ของ Google และค่าใช้จ่ายเพิ่มเติมจากการกำหนดเส้นทาง API ของ OrcaRouter สำหรับแอปพลิเคชันที่ต้องการเวลาแฝงต่ำมาก คุณอาจต้องการทดสอบด้วยพรอมต์ที่เป็นตัวแทนและวัดเวลาแบบ end-to-end โดยทั่วไปแล้ว โมเดล Flash ได้รับการออกแบบให้เร็วกว่าโมเดล Pro และการสตรีมสามารถลดเวลาแฝงที่รับรู้ได้
แม้ว่า Gemini 3.6 Flash จะทำงานได้ดีในเกณฑ์วัดบริบทระยะยาวที่กำหนดให้ แต่ Flash variant อาจมีความแม่นยำต่ำกว่าในงานที่เกี่ยวกับการใช้เหตุผล คณิตศาสตร์ หรือการสร้างโค้ด เมื่อเทียบกับโมเดลที่ใหญ่กว่าและมีราคาแพงกว่า คะแนนเปรียบเทียบที่แน่นอนสำหรับงานดังกล่าวไม่ได้ระบุไว้ นอกจากนี้ ขีดจำกัดเอาต์พุต 65,536 โทเค็น แม้จะมากพอสมควร แต่อาจไม่เพียงพอสำหรับการสร้างเอกสารที่ยาวมากหรือโค้ดเบสทั้งหมด โมเดลอาจมีอคติหรือข้อผิดพลาดเชิงข้อเท็จจริงที่พบได้ทั่วไปในโมเดลภาษาขนาดใหญ่ คุณภาพความเข้าใจแบบมัลติโมดัลอาจลดลงเมื่อมีรูปภาพจำนวนมากหรือวิดีโอที่ยาว เนื่องจากการบีบอัดโทเค็น ท้ายที่สุด เนื่องจากโมเดลเข้าถึงผ่าน OrcaRouter การหยุดชะงักของบริการใดๆ ที่ Google หรือ OrcaRouter อาจส่งผลต่อความพร้อมใช้งาน ควรทดสอบโมเดลกับข้อมูลเฉพาะของคุณเสมอเพื่อยืนยันคุณภาพ
Gemini 3.6 Flash มีหน้าต่างบริบท (context window) ขนาด 1,048,576 โทเค็น (ประมาณ 1 ล้านโทเค็น) สำหรับอินพุตทั้งหมด รวมถึงข้อความ รูปภาพ วิดีโอ ไฟล์ และเนื้อหาเสียงทั้งหมด จำนวนโทเค็นเอาต์พุตสูงสุดที่อนุญาตในการตอบกลับครั้งเดียวคือ 65,536 โทเค็น ซึ่งหมายความว่าคุณสามารถป้อนเอกสารที่ยาวมาก ภาพหลายภาพ หรือบันทึกการสนทนาที่ยาว และยังคงได้รับการตอบกลับที่มีเนื้อหาเพียงพอ หน้าต่างบริบทขนาดใหญ่เป็นจุดแข็งหลัก ทำให้สามารถทำงานต่างๆ เช่น การสรุปหนังสือ การตรวจสอบเอกสารทางกฎหมาย และการสนทนาหลายรอบที่มีประวัติที่กว้างขวาง อย่างไรก็ตาม บริบท 1M ทั้งหมดอาจทำให้เกิดเวลาการประมวลผลและค่าใช้จ่ายโทเค็นที่ไม่ใช่เรื่องเล็กน้อย โปรดทราบว่าการใช้บริบทขนาดใหญ่จะกินโทเค็นอินพุตในอัตรา $1.50 ต่อ 1M โทเค็น ดังนั้นอินพุต 1M จะมีค่าใช้จ่าย $1.50 ต่อคำขอ (บวกกับค่าใช้จ่ายเอาต์พุต)
ราคาคือ $1.50 ต่อ 1,000,000 token ขาเข้า และ $7.50 ต่อ 1,000,000 token ขาออก OrcaRouter คิดอัตราเหล่านี้ตามที่ Google ให้มา โดยไม่มีส่วนเพิ่ม (zero markup) ไม่มีค่าใช้จ่ายเพิ่มเติมต่อคำขอหรือค่าธรรมเนียมแพลตฟอร์ม Token ขาเข้ารวม token ทั้งหมดจากข้อความของผู้ใช้ (ประวัติระบบ, ผู้ใช้, และผู้ช่วย) รวมถึงเนื้อหามัลติมีเดียใดๆ ที่ถูกเข้ารหัสเป็น token Token ขาออกนับเฉพาะข้อความที่สร้างขึ้น ต้นทุนต่อคำขอขึ้นอยู่กับความยาวของ input และ output ของคุณ ตัวอย่างเช่น input 100K token กับ output 1K token จะมีต้นทุน $0.15 (input) + $0.0075 (output) = $0.1575 สำหรับการใช้งานปริมาณมาก การคิดราคาที่โปร่งใสนี้ช่วยให้สามารถคาดการณ์ต้นทุนได้อย่างแม่นยำ
OrcaRouter ไม่ได้โฆษณาส่วนลดแคชหรือส่วนลดปริมาณที่เฉพาะเจาะจงสำหรับ Gemini 3.6 Flash ในขณะนี้ ราคาเป็นแบบอัตราคงที่ต่อโทเค็นตามอัตราของผู้ให้บริการ แพลตฟอร์ม AI บางแห่งมีส่วนลดจากแคชสำหรับบริบทที่ซ้ำกัน แต่คุณสมบัติดังกล่าวไม่ได้ถูกกล่าวถึงสำหรับรุ่นนี้ผ่าน OrcaRouter คุณสามารถลดต้นทุนได้โดยการปรับความยาวของพรอมพ์ให้เหมาะสม จำกัดบริบทที่ไม่จำเป็น และใช้โทเค็นเอาต์พุตที่สั้นลง หากคุณต้องการอัตราต่อโทเค็นที่ต่ำกว่า ให้พิจารณาว่าโมเดลที่เล็กกว่า (เช่น Gemini 1.5 Flash) เพียงพอสำหรับงานของคุณหรือไม่ Google อาจเสนอระดับราคาที่แตกต่างกันสำหรับความจุที่สงวนไว้ แต่ไม่มีให้บริการผ่าน API แบบจ่ายตามการใช้งานของ OrcaRouter ตรวจสอบเอกสารของ OrcaRouter เสมอสำหรับข้อมูลอัปเดตเกี่ยวกับตัวเลือกการกำหนดราคา
เนื่องจาก OrcaRouter ส่งผ่านราคาของผู้ให้บริการโดยไม่มีส่วนเพิ่ม ต้นทุนต่อโทเค็นสำหรับ Gemini 3.6 Flash ผ่าน OrcaRouter ควรจะเท่ากับที่ Google คิดโดยตรง อย่างไรก็ตาม การใช้ OrcaRouter คุณจะได้รับ API ที่เข้ากันได้กับ OpenAI แบบรวมศูนย์ และอาจได้รับประโยชน์จากการเรียกเก็บเงินและการรวมระบบที่ง่ายขึ้น ไม่มีค่าใช้จ่ายเพิ่มเติมสำหรับบริการเกตเวย์ หากคุณมีสัญญาโดยตรงกับ Google Cloud คุณอาจได้รับส่วนลดตามปริมาณซึ่งอาจลดราคาลงต่ำกว่า $1.50/$7.50 ต่อ 1 ล้านโทเค็น OrcaRouter ไม่มีส่วนลดดังกล่าว ดังนั้นสำหรับปริมาณที่สูงมาก (>10B tokens/เดือน) การทำข้อตกลงโดยตรงอาจถูกกว่า สำหรับผู้ใช้ส่วนใหญ่ OrcaRouter มีราคาเท่ากันพร้อมความสะดวกของ API มาตรฐาน
เมื่อคุณรวมรูปภาพ วิดีโอ เสียง หรือไฟล์ใน prompt ของคุณ บริการจะแปลงสิ่งเหล่านี้เป็น tokens ซึ่งนับรวมในขีดจำกัด input token ของคุณ และถูกคิดอัตราค่าใช้จ่ายตามอัตรา input ($1.50 ต่อ 1M tokens) จำนวน tokens ที่ใช้ต่อรูปภาพหรือวินาทีของเสียงไม่ได้ระบุไว้ชัดเจน แต่เป็นแนวทางคร่าวๆ แต่ละรูปภาพอาจใช้ tokens ตั้งแต่หลายร้อยถึงสองสามพัน ขึ้นอยู่กับความละเอียด (ความละเอียดสูง = tokens มากขึ้น) วิดีโอโดยทั่วไปจะถูกประมวลผลเป็นลำดับของเฟรม แต่ละเฟรมมีค่าใช้จ่าย tokens ไฟล์เช่น PDF จะถูกแยกออกเป็นข้อความและรูปภาพ โดยรูปภาพจะถูกแปลงเป็น tokens ตามนั้น ในการประมาณค่าใช้จ่าย คุณควรทดสอบกับตัวอย่าง multimodal prompts และตรวจสอบการใช้งาน tokens ผ่านฟิลด์ `usage` ใน API response (ถ้ามี) การลดเนื้อหาภาพหรือใช้เวอร์ชันความละเอียดต่ำลงสามารถลดค่าใช้จ่ายได้
ในการใช้งาน Gemini 3.6 Flash ให้ส่งคำขอไปยังปลายทางที่รองรับ OpenAI ของ OrcaRouter ตั้งค่า base URL เป็น `https://api.orcarouter.ai/v1` ใน body ของคำขอ ให้ระบุโมเดลเป็น `"google/gemini-3.6-flash"` API รองรับปลายทาง chat completions เดียวกับ OpenAI: `POST /chat/completions` คุณสามารถใช้ SDK ใดก็ได้ของ OpenAI (Python, Node.js ฯลฯ) โดยกำหนดค่า `api_key` และ `base_url` ตัวอย่างใน Python: `client = OpenAI(api_key="your_orcarouter_key", base_url="https://api.orcarouter.ai/v1")` จากนั้น `response = client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...])` โมเดลรองรับพารามิเตอร์มาตรฐาน เช่น `temperature`, `max_tokens`, `stream` และ `tools`
พารามิเตอร์ที่รองรับประกอบด้วย `messages` (อาร์เรย์ของวัตถุข้อความที่มีบทบาทและเนื้อหา), `max_tokens` (สูงสุด 65536), `temperature`, `top_p`, ลำดับ `stop`, `stream` (บูลีน), `tools` (สำหรับการเรียกใช้ฟังก์ชัน) และ `tool_choice` เนื้อหามัลติโมดัลสามารถรวมอยู่ในฟิลด์ `content` ของข้อความโดยใช้อาร์เรย์ของส่วน (เช่น text, image_url, audio_data) รูปแบบที่แน่นอนเป็นไปตามหลักปฏิบัติของ OpenAI vision API OrcaRouter แปลพารามิเตอร์เหล่านี้ไปยัง Google API ที่อยู่เบื้องหลัง โปรดทราบว่าพารามิเตอร์เฉพาะ OCR บางตัว (เช่น `response_modalities`) อาจไม่พร้อมใช้งาน สำหรับรายละเอียดเกี่ยวกับรูปแบบภาพและเสียงที่รองรับ โปรดดูเอกสารของ OrcaRouter แต่โดยทั่วไปแล้ว JPEG, PNG, GIF, MP3 และ WAV ได้รับการยอมรับ ตั้งค่า `max_tokens` เป็นความยาวเอาต์พุตที่ต้องการภายในขีดจำกัด 65536
หากแอปพลิเคชันของคุณกำลังเรียกใช้ API ของ OpenAI (เช่น `gpt-4o`) การย้ายไปใช้ Gemini 3.6 Flash ผ่าน OrcaRouter จำเป็นต้องเปลี่ยนแปลงสองสิ่ง: base URL และชื่อโมเดล อัปเดตการกำหนดค่าไคลเอ็นต์ของคุณ: ตั้งค่า base URL เป็น `https://api.orcarouter.ai/v1` และใช้ model ID `"google/gemini-3.6-flash"` รูปแบบข้อความที่มีอยู่ของคุณ รวมถึงบทบาท system, user และ assistant ควรทำงานได้ตามเดิม สำหรับการรองรับมัลติโมดัล คุณสามารถปรับโค้ดของคุณเพื่อรวม URL รูปภาพหรือเสียงโดยใช้โครงสร้างข้อความแบบ OpenAI vision OrcaRouter จัดการแปล API ดังนั้นคุณไม่จำเป็นต้องปรับเปลี่ยนโครงสร้างคำขอนอกเหนือจากโมเดลและ base URL ทดสอบด้วยคำขอจำนวนน้อยก่อนเพื่อยืนยันพฤติกรรมที่คาดหวังและการใช้งานโทเค็น
ในการใช้ OrcaRouter คุณจำเป็นต้องมีคีย์ API ที่แพลตฟอร์มให้มา รวมคีย์นี้ในส่วนหัว `Authorization` เป็น `Bearer <your_key>` ข้อมูลที่ส่งผ่าน OrcaRouter จะถูกส่งต่อไปยังเซิร์ฟเวอร์อนุมานของ Google; OrcaRouter ไม่ได้ฝึกกับข้อมูลของคุณหรือจัดเก็บ prompts เกินกว่าที่จำเป็นสำหรับการประมวลผลคำขอ (เช่น การบันทึกเพื่อการเรียกเก็บเงิน) นโยบายการจัดการข้อมูลของ Google มีผลบังคับใช้กับผู้ให้บริการโมเดล OrcaRouter ไม่ได้เพิ่มการเก็บรักษาข้อมูลเพิ่มเติมใดๆ นอกเหนือจากบันทึกคำขอมาตรฐาน สำหรับข้อมูลที่ละเอียดอ่อน โปรดตรวจสอบนโยบายความเป็นส่วนตัวของ OrcaRouter และข้อกำหนดการใช้งานข้อมูลของ Google Gemini เนื่องจาก API เข้ากันได้กับ OpenAI คุณจึงสามารถใช้มาตรการรักษาความปลอดภัยมาตรฐาน เช่น การเข้ารหัสระหว่างการส่ง (HTTPS) และการหมุนคีย์
โมเดลทั้งสองรองรับอินพุตแบบหลายรูปแบบ (ข้อความ รูปภาพ เสียง) และมีหน้าต่างบริบทขนาดใหญ่ GPT-4o มีค่าเริ่มต้นที่ 128K (ขยายได้ถึง 256K) ในขณะที่ Gemini 3.6 Flash มี 1,048,576 โทเค็น (1M) ราคาแตกต่างกัน: GPT-4o คิดค่าอินพุต $2.50 ต่อ 1M และเอาต์พุต $10 ต่อ 1M (ณ ขณะเขียนนี้) ส่วน Gemini 3.6 Flash อยู่ที่ $1.50/$7.50 คะแนนการวัดประสิทธิภาพไม่สามารถเปรียบเทียบโดยตรงได้เนื่องจากใช้การทดสอบต่างกัน แต่คะแนน 91.8 ของ Gemini 3.6 Flash ในการวัดประสิทธิภาพการดึงข้อมูลเฉพาะบ่งชี้ถึงประสิทธิภาพที่แข็งแกร่ง GPT-4o อาจให้ความสามารถในการทำตามคำแนะนำและการให้เหตุผลที่เหนือกว่าในหลายงาน ในขณะที่ Gemini 3.6 Flash โดดเด่นในด้านการดึงข้อมูลบริบทยาวและความคุ้มค่า การเลือกขึ้นอยู่กับว่าคุณให้ความสำคัญกับความยาวบริบท ต้นทุน หรือความแม่นยำโดยรวมสำหรับกรณีการใช้งานเฉพาะของคุณหรือไม่
Claude 3.5 Sonnet (บริบท 200K) มีหน้าต่างบริบทที่สั้นกว่า 1M tokens ของ Gemini 3.6 Flash ราคาต่อ token: Claude 3.5 Sonnet อยู่ที่ $3.00 ต่อ input 1M และ $15.00 ต่อ output 1M ซึ่งสูงกว่า Gemini ที่ $1.50/$7.50 Claude อาจมีจุดแข็งในด้านการใช้เหตุผลแบบละเอียดอ่อนและการปฏิบัติตามข้อกำหนดด้านความปลอดภัย ในขณะที่ Gemini Flash เน้นความสามารถหลากหลายรูปแบบ (multimodal) และการดึงข้อมูลบริบทยาว การรองรับ input วิดีโอและเสียงของ Gemini ทำให้มีความได้เปรียบสำหรับงานที่เกี่ยวข้องกับรูปแบบเหล่านั้น อย่างไรก็ตาม output ของ Claude มักจะยาวกว่า (สูงสุด 8192 tokens เทียบกับ 65K ของ Gemini) สำหรับงานที่ต้องการ output ที่ยาวมาก (เช่น การสร้างรายงานทั้งฉบับ) Gemini 3.6 Flash อาจเหมาะสมกว่า ไม่มีการเปรียบเทียบ benchmark บนชุดข้อมูลมาตรฐาน ดังนั้นจึงแนะนำให้ทดสอบเชิงประจักษ์
เลือก Gemini 3.6 Flash เมื่อความต้องการหลักของคุณคือ: (ก) หน้าต่างบริบทที่ใหญ่กว่า 128K โทเค็น (สูงถึง 1M), (ข) จำเป็นต้องประมวลผลอินพุตเสียง วิดีโอ หรือไฟล์ และ (ค) ต้นทุนต่อโทเค็นต่ำในกลุ่มโมเดลหลายรูปแบบ (multimodal) โมเดลนี้มีความโดดเด่นเป็นพิเศษสำหรับการดึงข้อมูลเอกสารยาว (ดังที่เห็นจากคะแนนมาตรฐาน 91.8) หากงานของคุณเป็นข้อความล้วนและอยู่ในขอบเขต 128K โทเค็น โมเดลอย่าง GPT-4o mini หรือ Claude 3 Haiku อาจมีราคาถูกกว่า หากคุณต้องการความแม่นยำในการให้เหตุผลสูงสุดและงบประมาณเอื้ออำนวย โมเดล Pro (เช่น Gemini 3.6 Pro หากมีให้ใช้งานผ่าน OrcaRouter) อาจดีกว่าแม้จะมีต้นทุนสูงกว่า ใช้ข้อมูลมาตรฐานและการเปรียบเทียบราคาบน OrcaRouter เพื่อประกอบการเลือกของคุณ
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.6-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| อินพุต / 1M โทเค็น | $1.50 |
| เอาต์พุต / 1M โทเค็น | $7.50 |
| อ่านแคช / 1M | $0.150 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/google/gemini-3.6-flashเปิด @misc{orcarouter_gemini_3_6_flash,
title = {Gemini 3.6 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.6-flash}
}Google. (2026). Gemini 3.6 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.6-flash