Gemma 4 26B A4B เวอร์ชันไม่มีการเซ็นเซอร์แบบไม่สูญเสียข้อมูล ออกแบบมาเพื่อรักษาความสามารถของโมเดลดั้งเดิมในขณะที่ลดพฤติกรรมการปฏิเสธให้เหลือน้อยที่สุด ปรับให้เหมาะสมสำหรับนักพัฒนา นักวิจัย AI และแอปพลิเคชันขั้นสูงที่ต้องการคำตอบคุณภาพสูงโดยมีข้อจำกัดน้อยที่สุด ตัวแปร Balanced เหมาะสำหรับงานส่วนใหญ่ โดยให้คำตอบที่สมบูรณ์ในขณะที่รักษาเหตุผลที่เสถียรและพฤติกรรมการสนทนาที่เป็นธรรมชาติ ในสถานการณ์ที่ละเอียดอ่อนบางสถานการณ์ โมเดลอาจวางกรอบเหตุผลสั้นๆ ก่อนให้คำตอบเต็มรูปแบบ แต่มันถูกออกแบบมาเพื่อหลีกเลี่ยงการระงับเนื้อหา เมื่อเทียบกับตัวแปรที่ไม่มีการเซ็นเซอร์ที่รุนแรงกว่า Balanced ให้การสุ่มตัวอย่างที่สม่ำเสมอกว่า ความเสถียรในบริบทยาวที่แข็งแกร่งกว่า และการล่องลอยของหัวข้อที่ลดลงในการสนทนาที่ยาวนาน เหมาะอย่างยิ่งสำหรับการเขียนเชิงสร้างสรรค์ การสวมบทบาท ผู้ช่วยหลายภาษา การใช้เหตุผลในบริบทยาว และแอปพลิเคชัน AI ทั่วไปที่คุณภาพ ความสอดคล้อง และความน่าเชื่อถือเป็นลำดับความสำคัญหลัก การเข้าถึงโมเดลนี้ถูกจำกัดและมีไว้สำหรับนักวิจัยด้านความปลอดภัย ทีมสีแดง นักวิจัยด้านความปลอดภัย AI และผู้เชี่ยวชาญที่มีคุณสมบัติอื่นๆ ที่ดำเนินการวิจัย ประเมินผล และทดสอบที่ถูกต้องตามกฎหมาย
Gemma 4 26B A4B Uncensored เป็นโมเดลภาษาแบบ mixture-of-experts (MoE) จากซีรีส์ Gemma 4 ของ Google ซึ่งโฮสต์โดยผู้ให้บริการ Obsidian และสามารถเข้าถึงได้ผ่าน OrcaRouter มีพารามิเตอร์ทั้งหมด 26…
Gemma 4 26B A4B Uncensored โดดเด่นในงานที่ต้องการการให้เหตุผลในระยะยาวเหนือบริบทขนาดใหญ่ เช่น การสรุปหนังสือ การสนทนาหลายรอบที่มีประวัติยาวนาน และการวิเคราะห์ฐานโค้ด สถาปัตยกรรม MoE ของมันทำให้มีประสิทธิภาพสำหรับการประมวลผลแบบแบตช์ที่ต้องจัดการพร้อมกันหลายคำสั่ง ความสามารถแบบมัลติโมดัลทำให้มันสามารถให้เหตุผลเกี่ยวกับรูปภาพ เช่น การตีความกราฟ มีม หรือรูปถ่ายสินค้า พฤติกรรมแบบไม่ถูกเซ็นเซอร์นั้นเหมาะสำหรับการเขียนเชิงสร้างสรรค์ที่สำรวจธีมสำหรับผู้ใหญ่ การสวมบทบาทสำหรับผู้ใหญ่ หรือการสร้างนิยายโดยไม่มีข้อจำกัดด้านเนื้อหา มันยังทำงานได้ดีบนเกณฑ์มาตรฐาน NLP สำหรับการให้เหตุผล คณิตศาสตร์ และการเขียนโค้ด คล้ายกับรุ่นอื่นๆ ของ Gemma 4
หากงานของคุณไม่จำเป็นต้องใช้บริบทที่ยาว (เช่น ต่ำกว่า 8K โทเค็น) หรืออินพุตแบบหลายรูปแบบ (multimodal) คุณอาจใช้โมเดลแบบ dense ที่เล็กกว่าเช่น Gemma 2 9B หรือ Llama 3 8B ซึ่งเร็วกว่าและถูกกว่าต่อโทเค็น สำหรับงานที่ต้องการฟิลเตอร์ด้านความปลอดภัย โมเดลแบบไม่ถูกเซ็นเซอร์อาจสร้างผลลัพธ์ที่ไม่เหมาะสม — ให้เลือกโมเดลที่ปรับแต่งด้านความปลอดภัยแทน นอกจากนี้ หากคุณต้องการความหน่วงต่ำมากสำหรับการแชทแบบเรียลไทม์ โมเดล MoE นี้อาจช้ากว่าโมเดล dense ขนาดเล็กเนื่องจากโอเวอร์เฮดของการกำหนดเส้นทางผู้เชี่ยวชาญ (expert routing overhead) พิจารณาความต้องการด้านปริมาณงาน: สำหรับคำขอปริมาณสูงที่มีบริบทสั้น โมเดลที่ถูกกว่าเช่น Gemma 2 27B (dense) อาจคุ้มค่ากว่า
การออกแบบแบบผสมผสานผู้เชี่ยวชาญ (Mixture-of-Experts) จะเปิดใช้งานเฉพาะพารามิเตอร์บางส่วนต่อโทเค็น (4 พันล้านจากทั้งหมด 26 พันล้าน) ซึ่งช่วยลดต้นทุนการคำนวณต่อฟอร์เวิร์ดพาสเมื่อเทียบกับโมเดลหนาแน่นขนาด 26B ทำให้มีปริมาณงานสูงขึ้นบนฮาร์ดแวร์เดียวกัน อย่างไรก็ตาม การจัดเส้นทาง (routing) ทำให้เกิดค่าใช้จ่ายด้านเวลาแฝงเล็กน้อยต่อโทเค็น และอาจทำให้เกิดความไม่สมดุลของโหลดของผู้เชี่ยวชาญหากพรอมต์มีความเชี่ยวชาญสูง ในทางปฏิบัติ โมเดล MoE เช่นนี้ให้การแลกเปลี่ยนที่ดี: คุณภาพที่แข่งขันได้ในสัดส่วนของ FLOPs ที่น้อยกว่า พารามิเตอร์ที่ทำงานอยู่ 4B นั้นเทียบได้กับโมเดลหนาแน่นขนาด 4B ในแง่ของการคำนวณต่อโทเค็น แต่โมเดลได้รับประโยชน์จากความรู้ที่เก็บไว้ในพารามิเตอร์ทั้งหมด 26B
ใช่ โมเดลรองรับทั้งอินพุตข้อความและรูปภาพ คุณสามารถส่งรูปภาพเดี่ยวหรือหลายภาพในคำขอเดียว พร้อมกับคำแนะนำที่เป็นข้อความ รูปภาพจะถูกเข้ารหัสและประมวลผลร่วมกับข้อความภายในหน้าต่างบริบทขนาด 262,144 โทเคน สิ่งนี้ช่วยให้สามารถตอบคำถามเชิงภาพ ทำความเข้าใจเอกสาร และทำงานที่ต้องวิเคราะห์แผนภูมิ ไดอะแกรม หรือภาพถ่าย โมเดลใช้ตัวเข้ารหัสภาพ (โดยทั่วไปเป็นส่วนประกอบคล้าย ViT) เพื่อแปลงรูปภาพเป็นโทเคน แม้ว่ารายละเอียดที่แน่ชัดของสถาปัตยกรรมจะไม่ได้เปิดเผยต่อสาธารณะ แต่ก็รองรับรูปแบบภาพมาตรฐาน โปรดทราบว่ารูปภาพใช้โทเคนตามสัดส่วนของความละเอียด ดังนั้นรูปภาพที่มีความละเอียดสูงจะลดบริบทข้อความที่มีอยู่
ในฐานะที่เป็นตัวแปรของ Gemma 4 โมเดลพื้นฐาน (ที่มีการปรับจูนด้านความปลอดภัย) แสดงประสิทธิภาพที่แข็งแกร่งในการวัดผลเชิงตรรกะ เช่น MMLU, GSM8K และงานเขียนโค้ด เช่น HumanEval และ MBPP รุ่นที่ไม่ถูกเซ็นเซอร์น่าจะยังคงความสามารถเหล่านี้ไว้ เนื่องจากน้ำหนักของโมเดลหลักไม่เปลี่ยนแปลง อย่างไรก็ตาม คะแนนการวัดผลเฉพาะสำหรับตัวแปรที่ไม่ถูกเซ็นเซอร์นี้ยังไม่ได้รับการเผยแพร่ ผู้ใช้สามารถคาดหวังผลลัพธ์ที่แข่งขันได้ในการให้เหตุผลทางคณิตศาสตร์ การสร้างโค้ด และงานหลายภาษา หน้าต่างบริบท 262K ยังช่วยให้ประสิทธิภาพที่เหนือกว่าในการดึงเอกสารยาวและการสรุปความ เมื่อเทียบกับโมเดลที่มีบริบทสั้นกว่า สำหรับการวัดผลแบบหลายรูปแบบ โมเดลควรจัดการกับชุดข้อมูลการตอบคำถามเชิงภาพได้อย่างเหมาะสม
ความหน่วง (Latency) สำหรับโมเดล Gemma 4 26B A4B โดยทั่วไปจะต่ำกว่าโมเดลแบบ Dense ที่มีพารามิเตอร์ 26B เนื่องจากมีพารามิเตอร์ที่ทำงานอยู่เพียง 4B ต่อโทเค็น อย่างไรก็ตาม กลไกการจัดเส้นทางของ MoE จะเพิ่มค่าใช้จ่ายเล็กน้อยให้กับแต่ละโทเค็นที่สร้างขึ้น ดังนั้นความหน่วงรวมต่อโทเค็นอาจสูงกว่าโมเดล Dense ขนาด 4B เล็กน้อย สำหรับการอนุมานแบบแบตช์ที่มีลำดับยาว ปริมาณงาน (Throughput) อาจสูงขึ้นเนื่องจากความต้องการแบนด์วิธหน่วยความจำที่ลดลง บน OrcaRouter ความหน่วงจะขึ้นอยู่กับฮาร์ดแวร์พื้นฐานที่จัดหาโดยผู้ให้บริการ Obsidian ด้วย ประสิทธิภาพในโลกจริงควรทดสอบกับภาระงานที่เป็นตัวแทนเพื่อพิจารณาว่าตรงตามข้อกำหนดด้านความเร็วของคุณหรือไม่
แม้จะมีจุดแข็ง แต่โมเดลนี้ก็มีข้อจำกัด พารามิเตอร์แอ็กทีฟ 4B หมายความว่าสำหรับการใช้เหตุผลที่ซับซ้อนมากหรือความรู้เฉพาะโดเมน โมเดลอาจทำงานได้ด้อยกว่าโมเดลขนาดใหญ่อย่าง Gemma 4 47B (แบบหนาแน่น) หรือโมเดลชั้นแนวหน้า ลักษณะที่ไม่ถูกเซ็นเซอร์หมายความว่าผลลัพธ์อาจเป็นพิษ มีอคติ หรือไม่สอดคล้องกับค่านิยมของมนุษย์หากใช้โดยไม่มีการกลั่นกรอง นอกจากนี้ยังอาจสร้างเนื้อหาที่เป็นอันตรายซึ่งละเมิดนโยบายการใช้งานของ OpenAI เมื่อเข้าถึงผ่าน OrcaRouter—ผู้ใช้มีหน้าที่รับผิดชอบในการปฏิบัติตาม นอกจากนี้ สถาปัตยกรรม MoE อาจทำให้คุณภาพไม่สม่ำเสมอในแต่ละโทเคนหากการจัดเส้นทางผู้เชี่ยวชาญไม่เหมาะสมที่สุด สุดท้าย ความเข้าใจแบบมัลติโมดัลแม้จะมีอยู่ ก็อาจไม่เทียบเท่ากับโมเดลภาษา-วิทัศน์โดยเฉพาะ
การกำหนดราคาสำหรับโมเดลนี้ถูกกำหนดโดยผู้ให้บริการ Obsidian และส่งผ่านโดย OrcaRouter โดยไม่มีส่วนเพิ่มใดๆ คุณจ่าย $0.25 ต่อล้านโทเค็นนำเข้า และ $2.90 ต่อล้านโทเค็นส่งออก โทเค็นนำเข้ารวมถึงโทเค็นข้อความและรูปภาพ (รูปภาพจะถูกแปลงเป็นโทเค็นก่อนการประมวลผล) โทเค็นส่งออกครอบคลุมการตอบกลับที่สร้างขึ้น ไม่มีค่าธรรมเนียมเพิ่มเติมสำหรับการเรียก API หรือการใช้งานหน้าต่างบริบทนอกเหนือจากต้นทุนต่อโทเค็น การกำหนดราคานี้มีการแข่งขันสำหรับโมเดล MoE ขนาด 26B โดยเฉพาะอย่างยิ่งเมื่อพิจารณาจากหน้าต่างบริบทขนาดใหญ่ ค่าใช้จ่ายจะถูกคำนวณต่อคำขอและแสดงในใบแจ้งหนี้ OrcaRouter ของคุณ
โทเค็นเอาต์พุตมีราคาแพงกว่าโทเค็นอินพุตอย่างมีนัยสำคัญ (2.90 ดอลลาร์เทียบกับ 0.25 ดอลลาร์ต่อล้านโทเค็น) ซึ่งเป็นเรื่องปกติสำหรับโมเดลภาษา เนื่องจากการสร้างโทเค็นต้องใช้การคำนวณมากกว่าการประมวลผลอินพุต เพื่อลดต้นทุน คุณสามารถจัดโครงสร้างพรอมต์ให้ลดจำนวนโทเค็นเอาต์พุต เช่น โดยขอคำตอบที่สั้นลง หรือใช้คำแนะนำของระบบเพื่อจำกัดการใช้คำฟุ่มเฟือย นอกจากนี้ เนื่องจากต้นทุนอินพุตต่ำ คุณจึงสามารถใส่บริบทขนาดใหญ่ (สูงสุด 262K โทเค็น) ได้โดยไม่ทำให้งบประมาณพัง ถ้ากรณีการใช้งานของคุณเกี่ยวข้องกับพรอมต์สั้นจำนวนมากแต่การตอบสนองยาว ต้นทุนโทเค็นเอาต์พุตจะครอบงำ
OrcaRouter ไม่มีระบบแคชในตัวสำหรับโมเดลนี้ การคิดราคาเป็นแบบต่อ tokens และต่อคำขอ อย่างไรก็ตาม คุณสามารถใช้แคชฝั่งไคลเอนต์สำหรับลำดับอินพุตที่พบได้บ่อย เพื่อหลีกเลี่ยงการส่ง prompt ที่ซ้ำกัน นอกจากนี้ หากคุณใช้ system message เดิมซ้ำในหลายการสนทนา คุณอาจพิจารณารวมไว้ใน context ที่ยาวและใช้ session เดียวกันซ้ำผ่าน chat completions API เพื่อหลีกเลี่ยง tokens อินพุตที่ซ้ำซ้อน ผู้ให้บริการบางรายอาจมี prompt caching ของตัวเอง แต่ราคาของ Obsidian ตามที่ระบุไว้ไม่มีตัวเลือกการแคช โปรดตรวจสอบเอกสารของผู้ให้บริการเพื่อดูส่วนลดที่เป็นไปได้สำหรับ prompt ที่ซ้ำกัน
ในการใช้โมเดลนี้ ให้ส่งคำขอไปยัง endpoint ที่เข้ากันได้กับ OpenAI ที่ https://api.orcarouter.ai/v1 กำหนดพารามิเตอร์ model เป็น "obsidian/gemma-4-26B-A4B" คีย์ API ของคุณจาก OrcaRouter ควรรวมไว้ในส่วนหัว Authorization เป็น Bearer token API รองรับทั้ง endpoints text completions และ chat completions สำหรับแชท ให้ใช้ endpoint /v1/chat/completions พร้อมอาร์เรย์ messages ซึ่งรวมถึงบทบาท user, assistant และ system สำหรับคำขอแบบ multimodal ให้รวม URL รูปภาพหรือข้อมูล base64 ในฟิลด์ content ตัวอย่างเนื้อหาคำขอใน Python จะใช้ไลบรารี openai โดยกำหนด base_url เป็น endpoint ของ OrcaRouter และรหัสโมเดลดังกล่าว
API รองรับพารามิเตอร์มาตรฐานของ OpenAI: temperature (0-2, ค่าเริ่มต้น 1), top_p (0-1), max_tokens (สูงสุดถึงหน้าต่างบริบท), presence_penalty, frequency_penalty, ลำดับหยุด และ n (จำนวนคำตอบ) สำหรับโหมดหลายรูปแบบ ฟิลด์ content ยอมรับอาร์เรย์ที่ประกอบด้วย type "text" และ type "image_url" คุณยังสามารถตั้งค่า stream=true สำหรับการตอบสนองแบบสตรีมได้ โมเดลรองรับข้อความระบบ หน้าต่างบริบทคือ 262,144 โทเคนรวมอินพุตและเอาต์พุต พารามิเตอร์บางตัวอาจไม่ได้รับการสนับสนุนตามที่เขียนไว้ทุกประการ ตรวจสอบเอกสารของ OrcaRouter สำหรับข้อจำกัดเฉพาะผู้ให้บริการ เพื่อผลลัพธ์ที่ดีที่สุด ให้ตั้งค่า temperature ระหว่าง 0.7 ถึง 1.0 สำหรับงานสร้างสรรค์ และต่ำกว่านั้นสำหรับผลลัพธ์ที่กำหนดแน่นอน
การโยกย้ายเป็นเรื่องง่ายเนื่องจาก API ที่เข้ากันได้กับ OpenAI หากคุณกำลังใช้ OpenAI Python client อยู่ ให้เปลี่ยน base_url เป็น https://api.orcarouter.ai/v1 และตั้งค่า API key เป็น OrcaRouter key ของคุณ อัปเดตพารามิเตอร์ model จากชื่อโมเดลเดิมเป็น "obsidian/gemma-4-26B-A4B" ไม่จำเป็นต้องเปลี่ยนแปลงโค้ดอื่นๆ สำหรับกรณีการใช้งานส่วนใหญ่ สำหรับคำขอแบบ multimodal รูปแบบของภาพอาจแตกต่างกัน ให้ใช้โครงสร้างเดียวกันกับ OpenAI's vision API ทดสอบคำขอสองสามครั้งเพื่อให้แน่ใจว่าทำงานร่วมกันได้ โปรดทราบว่าข้อจำกัดอัตรา (rate limits) และการจัดการข้อผิดพลาดอาจแตกต่างกัน ศึกษาคู่มือของ OrcaRouter สำหรับแนวทางปฏิบัติที่ดีที่สุด
URL ฐานสำหรับการเรียก API ทั้งหมดคือ https://api.orcarouter.ai/v1 ตัวระบุรุ่นที่แน่นอนที่ต้องใช้ในคำขอคือ "obsidian/gemma-4-26B-A4B" ID นี้จะต้องถูกส่งเป็นพารามิเตอร์ model ในการเรียก chat completions หรือ completions calls ไม่มี ID รุ่นอื่นสำหรับรุ่นย่อยนี้ ตรวจสอบให้แน่ใจว่าคุณรวมคำนำหน้าเต็ม 'obsidian/' เพื่อกำหนดเส้นทางไปยังผู้ให้บริการ Obsidian อย่างถูกต้อง หากคุณพยายามใช้ ID ทั่วไป 'gemma-4-26B-A4B' โดยไม่มีคำนำหน้าผู้ให้บริการ อาจไม่สามารถแก้ไขได้ คำนำหน้าผู้ให้บริการเป็นสิ่งที่จำเป็นเนื่องจาก OrcaRouter รองรับผู้ให้บริการหลายรายที่เสนอรุ่นพื้นฐานเดียวกัน
ในตระกูล Gemma 4 นั้น Google มีให้เลือกทั้งแบบ dense และ MoE รุ่น dense (เช่น Gemma 4 47B) จะมีพารามิเตอร์ทั้งหมดทำงานอยู่ ให้คุณภาพต่อโทเค็นที่ดีกว่า แต่มีต้นทุนการคำนวณสูงกว่า ส่วนรุ่น MoE ที่มีทั้งหมด 26B และทำงาน 4B นั้นเป็นจุดสมดุลที่คุ้มค่าด้านต้นทุน เมื่อเทียบกับ Gemma 4 2B หรือ 9B แบบ dense โมเดลนี้มีความรู้กว้างกว่าจากจำนวนพารามิเตอร์ทั้งหมดที่มากกว่า ในบรรดาโมเดล MoE นั้น Gemma 4 26B A4B มีขนาดเล็กกว่าโมเดล MoE ขนาดใหญ่อย่าง Mixtral 8x22B (รวม 141B ทำงาน 39B) ส่วนที่ไม่มีการเซ็นเซอร์นั้นเป็นจุดเด่นเฉพาะของรุ่น Obsidian นี้ ส่วน Gemma 4 รุ่นอื่นๆ มีการปรับแต่งด้านความปลอดภัย
โมเดลแบบไร้เซ็นเซอร์ เช่นจากซีรีส์ Llama 3-Uncensored หรือ Wizard โดยทั่วไปจะลบตัวกรองความปลอดภัยออกจากโมเดลพื้นฐาน รุ่น Gemma 4 นี้เป็นหนึ่งในตัวเลือกไร้เซ็นเซอร์แบบ MoE ไม่กี่รุ่น ที่มีจำนวนพารามิเตอร์รวมมากขึ้น (26B) แต่พารามิเตอร์ที่ทำงานจริงน้อยกว่า (4B) เมื่อเทียบกับ Llama 3 70B Uncensored แล้ว มันมีขนาดเล็กกว่าและราคาถูกกว่ามาก แต่อาจมีขีดจำกัดที่ต่ำกว่าในงานที่ซับซ้อน หน้าต่างบริบทขนาด 262K ของมันใหญ่กว่าโมเดลไร้เซ็นเซอร์ส่วนใหญ่อย่างมาก ซึ่งมักจำกัดที่ 8K-32K การรองรับมัลติโมดัลก็เป็นจุดที่แตกต่าง: โมเดลไร้เซ็นเซอร์ส่วนใหญ่เป็นข้อความเท่านั้น
GPT-4o และ Claude 3.5 Sonnet เป็นโมเดลที่มีขนาดใหญ่กว่า เป็นกรรมสิทธิ์เฉพาะ มีการปรับแต่งด้านความปลอดภัยอย่างกว้างขวางและความสามารถหลายรูปแบบ โดยทั่วไปแล้วพวกมันมีประสิทธิภาพเหนือกว่า Gemma 4 26B A4B ในการวัดประสิทธิภาพและงานจริง โดยเฉพาะอย่างยิ่งในด้านการให้เหตุผล ความคิดสร้างสรรค์ และความสม่ำเสมอ อย่างไรก็ตาม มันมีราคาแพงกว่ามากต่อโทเค็น (GPT-4o: $5/M input, $15/M output; Claude: $3/M input, $15/M output) โมเดล Gemma เหมาะสำหรับแอปพลิเคชันที่คำนึงถึงต้นทุนซึ่งต้องการบริบทขนาดใหญ่ แต่ไม่มีข้อจำกัดด้านความปลอดภัย มันจะไม่สามารถเทียบเท่าโมเดลชั้นนำในด้านการปฏิบัติตามคำแนะนำที่ละเอียดอ่อนหรือความถูกต้องตามข้อเท็จจริง แต่อาจเพียงพอสำหรับงานสร้างสรรค์หลายอย่าง
เลือกโมเดลนี้แทนโมเดลที่ใหญ่กว่า (เช่น GPT-4o หรือ Claud Opus) เมื่อ: (1) คุณต้องการหน้าต่างบริบทขนาดใหญ่พิเศษ (262K) โดยไม่ต้องจ่ายราคาระดับพรีเมียม; (2) คุณต้องการเอาต์พุตที่ไม่มีข้อจำกัดสำหรับกรณีการใช้งานที่อนุญาต; (3) ปริมาณงานของคุณสูงและประสิทธิภาพต้นทุนของ MoE มีความสำคัญ; (4) งานของคุณอยู่ในความสามารถของโมเดลพารามิเตอร์แบบทำงานอยู่ 4B หลีกเลี่ยงโมเดลนี้หากคุณต้องการคุณภาพสูงสุดสำหรับการตัดสินใจที่สำคัญ, การปรับความปลอดภัยที่เคร่งครัด, หรือการให้เหตุผลที่ซับซ้อนมาก สำหรับงานทั่วไปหลายอย่าง เช่น การสรุปความ, การแปล, หรือถามตอบในเอกสารยาว โมเดลนี้ให้อัตราส่วนราคาต่อประสิทธิภาพที่แข็งแกร่ง
| อินพุต / 1M โทเค็น | $0.250 |
| เอาต์พุต / 1M โทเค็น | $2.90 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/obsidian/gemma-4-26B-A4Bเปิด @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B