Gemini 2.5 Flash คือโมเดลงานหนักระดับแนวหน้าของ Google ที่ออกแบบมาโดยเฉพาะสำหรับการให้เหตุผลขั้นสูง การเขียนโค้ด คณิตศาสตร์ และงานทางวิทยาศาสตร์ มันมาพร้อมกับความสามารถ "การคิด" ในตัว ทำให้สามารถให้คำตอบที่มี...
Google Gemini 2.5 Flash เป็นโมเดลภาษาหลายรูปแบบที่พัฒนาโดย Google มันอยู่ในซีรีส์ Gemini 2.5 ซึ่งออกแบบมาเพื่อประมวลผลข้อมูลนำเข้าแบบข้อความ รูปภาพ เสียง และวิดีโออย่างมีประสิทธิภาพ…
Gemini 2.5 Flash รองรับรูปแบบอินพุต 5 ประเภท: ไฟล์ (เช่น PDF, เอกสาร), รูปภาพ, ข้อความ, เสียง, และวิดีโอ ซึ่งช่วยให้ผู้ใช้สามารถส่งข้อมูลที่หลากหลายในคำขอเดียว ตัวอย่างเช่น คุณสามารถส่งคลิปวิดีโอ สคริปต์ข้อความประกอบ และเอกสารอ้างอิง PDF แล้วโมเดลจะวิเคราะห์ข้ามทุกรูปแบบ โมเดลจะประมวลผลอินพุตเหล่านี้โดยตรงโดยไม่ต้องเข้ารหัสหรือแบ่งส่วนแยกต่างหากสำหรับรูปแบบส่วนใหญ่ การรองรับหลายรูปแบบนี้มีประโยชน์อย่างยิ่งสำหรับงานต่างๆ เช่น การสรุปวิดีโอ การวิเคราะห์หลายเอกสาร และผู้ช่วยแบบโต้ตอบ
ด้วยหน้าต่างบริบทขนาด 1,048,576 โทเคน Gemini 2.5 Flash สามารถรับเข้าและประมวลผลหนังสือทั้งเล่ม ฐานโค้ดขนาดยาว หรือเสียงถอดความหลายชั่วโมงในครั้งเดียว ซึ่งขจัดความจำเป็นในการใช้เทคนิคหน้าต่างเลื่อนหรือหน่วยความจำภายนอก กรณีการใช้งานได้แก่ การตรวจสอบโปรเจกต์ซอฟต์แวร์ทั้งหมดเพื่อหาบั๊ก การวิเคราะห์เอกสารทางกฎหมายยาวที่มีการอ้างอิงจำนวนมาก หรือการสรุปการประชุมที่ใช้เวลาหลายชั่วโมง บริบทขนาดใหญ่ยังช่วยให้โมเดลรักษาความสอดคล้องในการสนทนาที่ยาวมากได้ แม้ว่าความยาวเอาต์พุตจะถูกจำกัดไว้ที่ 65,536 โทเคน
จากผลการทดสอบมาตรฐาน Gemini 2.5 Flash มีความเชี่ยวชาญในการให้เหตุผลทางคณิตศาสตร์ โดยได้คะแนน 93.2 ใน MATH-500 นอกจากนี้ยังแสดงประสิทธิภาพที่แข็งแกร่งในการสร้างโค้ดและความเข้าใจด้วยบริบทที่กว้างและการฝึกฝนแบบมัลติโมดัล ความสามารถของโมเดลในการจัดการเสียงและวิดีโอแบบเนทีฟช่วยลดขั้นตอนการประมวลผลล่วงหน้า ต้นทุนต่อโทเค็นที่ต่ำทำให้เหมาะสำหรับการประมวลผลแบบแบตช์และแอปพลิเคชันแบบเรียลไทม์ อย่างไรก็ตาม สำหรับงานที่ต้องการความคิดสร้างสรรค์สูงมากหรือความเชี่ยวชาญเฉพาะด้าน อาจเลือกใช้โมเดลที่เชี่ยวชาญเฉพาะหรือมีขนาดใหญ่กว่า
Gemini 2.5 Flash มีราคาที่แข่งขันได้อยู่แล้วที่ $0.30 ต่อ 1M input tokens และ $2.50 ต่อ 1M output tokens อย่างไรก็ตาม สำหรับงานที่เรียบง่ายมาก เช่น การจำแนกประเภทหรือการสร้างข้อความสั้น ๆ โมเดลที่เล็กกว่าอย่าง Gemini 1.5 Flash หรือทางเลือกจากบุคคลที่สามอาจเสนอราคาต่อ token ที่ถูกกว่า ประเมินการใช้งาน token ที่คาดหวังและข้อกำหนดด้านเวลาแฝงของคุณ หากภาระงานของคุณไม่จำเป็นต้องใช้ context 1M เต็มหรือ input แบบ multimodal โมเดลที่ใช้เฉพาะข้อความที่มี context window เล็กกว่าสามารถลดค่าใช้จ่ายได้ แคตตาล็อกของ OrcaRouter มีตัวเลือกสำหรับการเปรียบเทียบต้นทุน
MATH-500 เป็นชุดเกณฑ์มาตรฐานที่ประกอบด้วยโจทย์คณิตศาสตร์ที่ท้าทายจำนวน 500 ข้อ ครอบคลุมพีชคณิต เรขาคณิต ความน่าจะเป็น และทฤษฎีจำนวน คะแนน 93.2 หมายความว่าโมเดลสามารถแก้โจทย์เหล่านี้ได้ถูกต้อง 93.2% ซึ่งบ่งบอกถึงความสามารถในการให้เหตุผลทางคณิตศาสตร์และการแก้ปัญหาที่แข็งแกร่ง คะแนนนี้ทำให้ Gemini 2.5 Flash อยู่ในกลุ่มโมเดลที่มีประสิทธิภาพสูงสุดสำหรับงานด้านคณิตศาสตร์ เกณฑ์มาตรฐานนี้ทดสอบทั้งความแม่นยำในการคำนวณและการให้เหตุผลเชิงตรรกะ นักพัฒนาที่ทำงานเกี่ยวกับเครื่องมือทางการศึกษา การคำนวณทางวิทยาศาสตร์ หรือเวิร์กโฟลว์ที่เน้นคณิตศาสตร์สามารถใช้คะแนนนี้เป็นข้อมูลอ้างอิงได้
ความเร็วขึ้นอยู่กับความซับซ้อนของคำขอ ความยาวของโทเค็น และภาระของเซิร์ฟเวอร์ Google ยังไม่ได้เผยแพร่ตัวเลขความหน่วงที่เฉพาะเจาะจงสำหรับ Gemini 2.5 Flash อย่างไรก็ตาม การกำหนดชื่อ “Flash” บ่งชี้ถึงการปรับให้เหมาะสมสำหรับความหน่วงต่ำเมื่อเทียบกับรุ่น Pro ในการใช้งานทั่วไปผ่าน OrcaRouter เวลาตอบสนองนั้นแข่งขันได้สำหรับแอปพลิเคชันแบบเรียลไทม์ สำหรับสถานการณ์ที่มีปริมาณงานสูง ให้พิจารณาการรวมคำขอเป็นชุดหรือใช้เอาต์พุตแบบสตรีมมิ่ง OrcaRouter รองรับการตอบสนองแบบสตรีมมิ่งผ่าน API ที่เข้ากันได้กับ OpenAI ซึ่งสามารถลดความหน่วงที่รับรู้ได้
เมื่อเปรียบเทียบกับโมเดลราคาประหยัดอย่าง GPT-4o mini หรือ Claude 3 Haiku แล้ว Gemini 2.5 Flash มีหน้าต่างบริบทที่ใหญ่กว่า (1M เทียบกับปกติ 128K-200K) และรองรับการป้อนข้อมูลแบบหลายรูปแบบ คะแนน MATH-500 ที่ 93.2 ของมันสูงกว่าตัวเลือกอื่นๆ ที่ราคาใกล้เคียงกันหลายตัว ต้นทุนนั้นแข่งขันได้ โดยเฉพาะสำหรับ token เอาต์พุตที่ $2.50 ต่อ 1M token อย่างไรก็ตาม สำหรับงานที่เน้นการเขียนเชิงสร้างสรรค์หรือความคล่องแคล่วในการสนทนา โมเดลอื่นอาจทำงานได้ดีกว่า ไม่มีการให้ข้อมูลเกณฑ์มาตรฐานสำหรับงานที่ไม่ใช่คณิตศาสตร์ ดังนั้นการเปรียบเทียบโดยตรงจึงมีข้อจำกัด
แม้ว่า Gemini 2.5 Flash จะทำงานได้ดีในด้านคณิตศาสตร์และโค้ด แต่ประสิทธิภาพในมิติอื่นๆ เช่น การเรียกคืนข้อเท็จจริง ความเข้าใจภาษาที่ละเอียดอ่อน หรือการสร้างเนื้อหาที่สร้างสรรค์นั้น ไม่ได้ถูกครอบคลุมโดยเกณฑ์มาตรฐานที่ให้มา เนื่องจากเป็นโมเดลแบบ "Flash" จึงอาจมีการแลกเปลี่ยนความลึกในการใช้เหตุผลเพื่อความเร็ว ปริมาณเอาต์พุตสูงสุดที่ 65,536 โทเคนอาจไม่เพียงพอสำหรับการสร้างรายงานที่ยาวมากหรือสรุปข้อมูลจากอินพุตที่มีความยาวมาก นอกจากนี้ ยังไม่มีการระบุจุดตัดของข้อมูลฝึกอบรมของโมเดลและอคติที่อาจเกิดขึ้น ผู้ใช้ควรตรวจสอบความถูกต้องของเอาต์พุตสำหรับการใช้งานที่สำคัญ
การตั้งราคาเรียบง่าย: $0.30 ต่อ 1 ล้านโทเค็นสำหรับอินพุต และ $2.50 ต่อ 1 ล้านโทเค็นสำหรับเอาต์พุต อัตราเหล่านี้คิดตามอัตราของผู้ให้บริการของ Google โดยไม่มีมาร์กอัปเพิ่มเติมจาก OrcaRouter ไม่มีค่าธรรมเนียมแอบแฝงหรือค่าบริการเพิ่มเติม ตัวอย่างเช่น การประมวลผลอินพุต 10 ล้านโทเค็นจะมีค่าใช้จ่าย $3.00 และการสร้างเอาต์พุต 1 ล้านโทเค็นจะมีค่าใช้จ่าย $2.50 ราคานี้ใช้กับทุกรูปแบบอินพุตที่รองรับ จำนวนโทเค็นรวมถึงข้อความทั้งหมด ส่วนย่อยของรูปภาพ (หลังการแปลง) และส่วนของเสียง/วิดีโอตามรูปแบบการแบ่งโทเค็นของ Google
การแคชข้อความแจ้ง (prompt caching) สามารถลดต้นทุนอินพุตเมื่อมีการใช้บริบทเดียวกันซ้ำในหลายคำขอ โมเดล Google Gemini รองรับการแคชโทเค็นนำหน้าที่ซ้ำกันโดยอัตโนมัติ บน OrcaRouter พฤติกรรมการแคชเป็นไปตามนโยบายของ Google หากแอปพลิเคชันของคุณส่งคำแนะนำระบบหรือเอกสารอ้างอิงเดียวกันบ่อยครั้ง การแคชอาจลดต้นทุนโทเค็นอินพุตที่เกิดขึ้นจริง การประหยัดที่แน่นอนขึ้นอยู่กับอัตราการ hit ของแคช ไม่มีส่วนลดการแคชเฉพาะที่ระบุไว้ในข้อมูลราคา แต่ผู้ใช้ควรศึกษาเอกสารของ Google เพื่อดูคุณสมบัติในการรับสิทธิ์แคช
Gemini 2.5 Pro โดยทั่วไปมีต้นทุนต่อโทเค็นสูงกว่า Flash (ไม่ได้ระบุราคาที่แน่นอนของ Pro) แต่อาจให้ผลลัพธ์คุณภาพสูงกว่าในงานที่ต้องใช้การให้เหตุผลที่ซับซ้อน Flash ออกแบบมาสำหรับแอปพลิเคชันที่ให้ความสำคัญกับความเร็วและความคุ้มค่า สำหรับการผลิตที่มีปริมาณสูง ต้นทุนต่อโทเค็นที่ต่ำกว่าของ Flash สามารถนำไปสู่การประหยัดที่สำคัญ อย่างไรก็ตาม หากงานต้องการความแม่นยำสูงสุด (เช่น ในเชิงกฎหมายหรือทางการแพทย์) ต้นทุนที่เพิ่มขึ้นของ Pro อาจคุ้มค่า ควรประเมินทั้งสองรุ่นกับตัวอย่างข้อมูลของคุณเพื่อกำหนดจุดสมดุลระหว่างประสิทธิภาพและต้นทุนที่เหมาะสมที่สุด
OrcaRouter ไม่ได้เพิ่มเครื่องหมายใดๆ ดังนั้นราคาต่อโทเค็นจึงยังคงเป็นไปตามอัตราของผู้ให้บริการของ Google ส่วนลดปริมาณอาจมีให้โดยตรงจาก Google สำหรับองค์กร แต่จะไม่สะท้อนในราคาแบบจ่ายตามการใช้งานมาตรฐานที่ระบุไว้ OrcaRouter เสนอรูปแบบราคาแบบต่อโทเค็นอย่างง่ายโดยไม่มีข้อผูกพันขั้นต่ำ ผู้ใช้สามารถติดต่อ OrcaRouter เพื่อขอข้อมูลเกี่ยวกับข้อตกลงตามปริมาณที่อาจมีได้ แม้ว่าจะไม่มีโครงสร้างส่วนลดเฉพาะที่ให้ไว้ในข้อเท็จจริง
เรียกใช้ Gemini 2.5 Flash ผ่าน API ที่เข้ากันได้กับ OpenAI ของ OrcaRouter ตั้งค่า base URL เป็น https://api.orcarouter.ai/v1 และรหัสโมเดลเป็น "google/gemini-2.5-flash" ใช้ OpenAI SDK หรือ HTTP client ใดก็ได้ การตรวจสอบสิทธิ์ต้องใช้ API key จาก OrcaRouter ส่งคำขอ POST ไปยัง /chat/completions พร้อมพารามิเตอร์ model ตัวอย่างใน python: client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_KEY"); response = client.chat.completions.create(model="google/gemini-2.5-flash", messages=[{"role":"user","content":"Hello"}]) API รองรับ streaming, function calling, และพารามิเตอร์ OpenAI มาตรฐานอื่นๆ
รองรับพารามิเตอร์การสนทนา OpenAI มาตรฐานทั้งหมด รวมถึง: messages (อาร์เรย์ของออบเจ็กต์ข้อความ), temperature (0-2), top_p, max_tokens (สูงสุด 65536), frequency_penalty, presence_penalty, stop, stream (บูลีน), และ logprobs สำหรับอินพุตแบบหลายรูปแบบ ให้ใช้โครงสร้างเนื้อหาที่มีส่วนประกอบของ text และ image_url หรือ file_url อินพุตเสียงและวิดีโอสามารถระบุเป็น data URIs ที่เข้ารหัส base64 หรือ URLs ขึ้นอยู่กับขนาดไฟล์ API ยังรองรับ response_format ด้วยโหมด JSON หากจำเป็น โปรดดูเอกสารของ OrcaRouter สำหรับรายละเอียดรูปแบบที่แน่นอน
การย้ายระบบนั้นตรงไปตรงมา เนื่องจาก OrcaRouter ใช้ปลายทางที่เข้ากันได้กับ OpenAI หากคุณกำลังใช้ OpenAI, Anthropic หรือผู้ให้บริการอื่น ๆ ให้เปลี่ยน base URL เป็น https://api.orcarouter.ai/v1 และคีย์ API เป็นคีย์ของ OrcaRouter อัปเดตรหัสโมเดลเป็น "google/gemini-2.5-flash" ไม่จำเป็นต้องเปลี่ยนแปลงรูปแบบข้อความ การสตรีม หรือโครงสร้างการเรียกอื่น ๆ สำหรับผู้ใช้ที่มาจาก Vertex AI ดั้งเดิมของ Google หรือ Generative AI SDK คุณจะต้องปรับให้เข้ากับรูปแบบข้อความของ OpenAI แต่ไลบรารีหลายแห่งมีเครื่องมือแปลง
OrcaRouter เปิดเผยรหัสข้อผิดพลาด HTTP มาตรฐาน: 401 สำหรับไม่ได้รับอนุญาต, 429 สำหรับการจำกัดอัตรา, 500 สำหรับข้อผิดพลาดเซิร์ฟเวอร์ การจำกัดอัตราขึ้นอยู่กับแผน OrcaRouter ของคุณ Google อาจกำหนดการจำกัดอัตราของตัวเองต่อคีย์ API API จะส่งคืนข้อผิดพลาดในรูปแบบ OpenAI สำหรับคำขอขนาดใหญ่ที่เกินหน้าต่างบริบท 1M หรือเอาต์พุต 65K คุณจะได้รับข้อผิดพลาด 400 เอกสารของ OrcaRouter ให้ระดับการจำกัดอัตราเฉพาะ หากคุณพบการจำกัดอัตรา ให้ลองลองอีกครั้งด้วยการถอยหลังแบบเอ็กซ์โปเนนเชียล
GPT-4o mini เป็นโมเดลที่เล็กกว่าและถูกกว่าจาก OpenAI โดยมีหน้าต่างบริบท 128K โทเคน (เล็กกว่า Gemini 2.5 Flash ถึง 8 เท่า) GPT-4o mini รองรับเฉพาะข้อความ ในขณะที่ Gemini 2.5 Flash รองรับไฟล์ รูปภาพ เสียง และวิดีโอ ในการทดสอบ MATH-500 GPT-4o mini ได้คะแนนประมาณ 70-80 (ไม่มีตัวเลขที่แน่นอนสำหรับการเปรียบเทียบนี้) ในขณะที่ Gemini 2.5 Flash ได้ 93.2 ราคาของ GPT-4o mini อยู่ที่ประมาณ $0.15/$0.60 ต่อ 1 ล้านโทเคน (อินพุต/เอาต์พุต) – ถูกกว่า Gemini Flash สำหรับอินพุต แต่แพงกว่าสำหรับเอาต์พุต เลือก Gemini Flash สำหรับงานมัลติโมดัลและงานที่มีบริบทยาว เลือก GPT-4o mini สำหรับแอปพลิเคชันเฉพาะข้อความที่มีต้นทุนต่ำมาก
Gemini 2.0 Flash (รุ่นก่อนหน้า) มีหน้าต่างบริบท 1M โทเค็นและรองรับมัลติโมดัลในลักษณะเดียวกัน อย่างไรก็ตาม Gemini 2.5 Flash ปรับปรุงการใช้เหตุผลทางคณิตศาสตร์ โดยเห็นได้จากคะแนน MATH-500 ที่ 93.2 เทียบกับคะแนนของ 2.0 Flash (ไม่ได้ระบุ แต่คาดว่าต่ำกว่า) ราคาสำหรับ 2.5 Flash อยู่ที่ $0.30/$2.50 ต่อ 1M โทเค็น ในขณะที่ 2.0 Flash อยู่ที่ $0.15/$0.60 ต่อ 1M โทเค็น ดังนั้น 2.5 Flash มีราคาต่อโทเค็นที่แพงกว่า การแลกเปลี่ยนคือความแม่นยำที่ดีกว่า สำหรับโปรเจกต์ที่คำนึงถึงต้นทุนซึ่งไม่ต้องการประสิทธิภาพทางคณิตศาสตร์สูง 2.0 Flash อาจเป็นตัวเลือกที่เหมาะสมกว่า OrcaRouter มีทั้งสองเวอร์ชัน
โมเดล multimodal ระดับราคาประหยัดอื่นๆ ได้แก่ Claude 3 Haiku (บริบท 200K, ข้อความ+รูปภาพ) และ Llama 3.2 90B (บริบท 128K, ข้อความ+รูปภาพ) Gemini 2.5 Flash มีหน้าต่างบริบทที่ใหญ่ที่สุด (1M) และรองรับเสียง/วิดีโอโดยตรง ซึ่งหาได้ยากในระดับราคานี้ คะแนน MATH-500 ที่ 93.2 สูงกว่าโมเดลที่เทียบเคียงได้หลายตัว อย่างไรก็ตาม สำหรับการสร้างข้อความล้วนๆ โมเดลอย่าง Mistral Small อาจให้เวลาแฝงที่ต่ำกว่า ตัวเลือกที่ดีที่สุดขึ้นอยู่กับข้อกำหนดด้านรูปแบบโมดอลเฉพาะของคุณ และบริบทที่ใหญ่กว่านั้นคุ้มกับต้นทุนหรือไม่
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| อินพุต / 1M โทเค็น | $0.300 |
| เอาต์พุต / 1M โทเค็น | $2.50 |
| อ่านแคช / 1M | $0.030 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/google/gemini-2.5-flashเปิด @misc{orcarouter_gemini_2_5_flash,
title = {Gemini 2.5 Flash API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash}
}Google. (2025). Gemini 2.5 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash