
Solar Mini 4 กับ Granite 4.2 3B: โมเดลที่คุณเรียกใช้ และเช็กพอยต์ที่คุณดาวน์โหลด
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 ต่อ 1 ล้านโทเค็น
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 ต่อ 1 ล้านโทเค็น · 159 tok/s
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 220 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
วาง Solar Mini 4 ไว้ข้าง Granite 4.2 3B แล้วตัวเลขที่น่าสนใจไม่ใช่ช่องว่างของ benchmark แต่มันคือความจริงที่ว่า Granite 4.2 3B ซึ่งเป็นโมเดลให้เหตุผลแบบ Apache-2.0 ของ IBM ที่เปิดตัวเมื่อ 25 สิงหาคม 2026 จะรันบนแล็ปท็อปได้ฟรี ๆ คืนนี้ ขณะที่ Solar Mini 4 ซึ่งเป็นโมเดลแบบ proprietary ของ Upstage ที่เปิดตัวเมื่อ 22 กันยายน 2026 จะไม่รันบนอุปกรณ์ใด ๆ ที่คุณเป็นเจ้าของ และคิดเงิน $0.10 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $0.40 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน เพื่อตอบคำถามหนึ่งข้อ ทั้งคู่เปิดใช้งานพารามิเตอร์ประมาณสามพันล้านพารามิเตอร์ของการประมวลผลต่อโทเคน อันหนึ่งคือไฟล์ อีกอันคือมิเตอร์
ความแตกต่างนั้นตัดสินเกือบทุกอย่างเกี่ยวกับการเปรียบเทียบนี้ รวมถึงว่าการทดสอบมาตรฐานใดบ้างที่คุ้มค่าจะนำมาเปรียบเทียบกันด้วยซ้ำ Granite 4.2 3B ได้รับการประเมินอิสระมานานก่อนที่ Solar Mini 4 จะได้รับการประเมิน — Artificial Analysis ให้คะแนน 9 แก่ Granite 4.2 3B บน Intelligence Index v4.3.2 จากชุดการประเมินเดียวกันและองค์กรเดียวกันที่ให้คะแนน Solar Mini 4 ที่ 24 ซึ่งหมายความว่าช่องว่าง 15 คะแนนตรงนี้มีพื้นฐานที่มั่นคงอย่างผิดปกติ: มันคือห้องแล็บเดียว วิธีการเดียว และโมเดลสองตัวที่ไม่มีใครต้องเชื่อโดยไม่ตั้งคำถาม
ข้อมูลจำเพาะ ในมิติที่ทำให้มันแตกต่างกันจริง ๆ
• สถาปัตยกรรม — Solar Mini 4 เป็น sparse mixture-of-experts: พารามิเตอร์รวม 35B, ทำงาน 3B ต่อโทเคน ตามข้อมูลจาก Upstage ส่วน Granite 4.2 3B เป็นแบบ dense มีพารามิเตอร์ราว 3B โดยรวมประมาณ 4B เมื่อนับ embeddings ตาม metadata ของ safetensors งบการทำงานเท่ากัน แต่ใช้คนละวิธี
• น้ำหนักโมเดล — Solar Mini 4 เป็นแบบเฉพาะกิจและปิด ขณะที่ Granite 4.2 3B เผยแพร่ภายใต้ Apache 2.0 พร้อมสูตรการฝึกที่จัดทำเอกสารไว้ละเอียดถึงสัดส่วนของข้อมูล
• บริบท — Upstage ระบุในเอกสารว่า 512K โทเค็น พร้อมเอาต์พุตสูงสุด 128K; Artificial Analysis ระบุ 1.0M สำหรับโมเดลเดียวกัน ดังนั้นให้ถือว่าขีดจำกัดสูงสุดยังไม่แน่นอน Granite 4.3 รัน 131,072 โทเค็นแบบเนทีฟ และขยายเป็น 512K ด้วยระยะพรีเทรนระยะที่ห้า
• ราคา — Solar Mini 4 อยู่ที่ $0.10 / $0.01 สำหรับแคช / $0.40 ต่อล้านโทเคน ปัจจุบันลด 50% ถึงวันที่ 22 ตุลาคม 2026 Granite 4.2 3B ไม่มีตารางราคาจากผู้จำหน่ายเพราะไม่มีอะไรให้เช่า; ปลายทางโฮสต์ที่ Artificial Analysis ติดตามอยู่ตั้งราคาไว้ประมาณ $0.03 / $0.12 และการโฮสต์เองมีต้นทุนคือค่าไฟฟ้า
• Intelligence Index — 24 สำหรับ Solar Mini 4, 9 สำหรับ Granite 4.2 3B ทั้งสองมาจาก Artificial Analysis v4.3.2
• ความเร็ว — 204 โทเคนเอาต์พุตต่อวินาทีสำหรับ Solar Mini 4 และ 223 สำหรับ Granite 4.2 3B ทั้งคู่วัดโดยแล็บเดียวกัน โดยมีเวลาไปยังชิ้นส่วนแรก (time-to-first-chunk) ที่ 1.5 วินาที และ 0.5 วินาที ตามลำดับ โมเดลแบบ dense เป็นตัวที่เร็วกว่าในทั้งสองด้าน
ช่องว่าง 15 จุดนั้นแท้จริงแล้วประกอบขึ้นจากอะไร

การประเมินรายบุคคลบอกเรื่องราวที่ไม่น่าชื่นชมเท่าพาดหัวสำหรับ Granite 4.2 3B และบอกเรื่องราวที่ซับซ้อนกว่าสำหรับ Solar Mini 4 บน AA-LCR v1.1 ซึ่งเป็นเกณฑ์มาตรฐานการให้เหตุผลแบบบริบทยาว Solar Mini 4 ได้คะแนน 83% และ Granite 4.2 3B ได้คะแนน 24% การประเมินเพียงครั้งเดียวนั้นคิดเป็นสัดส่วนมหาศาลของความแตกต่างของดัชนี และนั่นไม่ใช่เรื่องบังเอิญของขนาดสเกล — มันคือสิ่งที่คุณได้มาโดยแลกกับบริบท 512K ถึง 1M โทเคน และการฝึกฝนให้ใช้มัน หน้าต่างของ Granite 4.2 3B รับได้สูงสุดที่ 131K โดยธรรมชาติ; เฟสขยาย 512K มีอยู่จริง แต่โมเดลนี้ไม่ได้ถูกปรับจูนให้ใช้เหตุผลข้ามหน้าต่างนั้นเหมือนที่ Solar Mini 4 ถูกปรับจูน
ในด้านความรู้ทั่วไป ช่องว่างแคบลงแล้วจากนั้นก็กลับทิศในเชิงลักษณะ Granite 4.2 3B ทำคะแนนได้ 55.9% บน GPQA และ Solar Mini 4 ไม่มีตัวเลข GPQA เลย ส่วนบน Humanity's Last Exam ทั้งสองได้ 6.6% และ 25.8% ตามลำดับ ซึ่งเป็นการเปรียบเทียบที่ตรงกว่า และเป็นสิ่งที่ความแตกต่างของขนาดคาดการณ์ไว้ สิ่งที่ Granite 4.2 3B ไม่ทำ ตามข้อมูลของ Artificial Analysis คือการกุเรื่อง: อัตราการไม่เกิดฮาลูซิเนชันของ AA-Omniscience อยู่ที่ 73.7% สูงกว่า 64.2% ของ Solar Mini 4 โมเดลที่เล็กกว่ามีโอกาสน้อยกว่าที่จะคิดคำตอบที่มันไม่มีขึ้นมา
การเขียนโค้ดแบบเอเจนต์คือจุดที่โมเดลทั้งสองล้มเหลว และการอ่านตัวเลขก็สำคัญ Solar Mini 4 ได้ 1% บน Terminal-Bench 4.0 และ 22.3% บน AutomationBench-AA ส่วน Granite 4.2 3B ได้ 0% บน Terminal-Bench 4.0, 13.9% บน Terminal-Bench 2.1 เวอร์ชันเก่า และ 5.6% บน τ³-Banking ไม่มีโมเดลใดเป็นเครื่องมือที่เหมาะสมสำหรับงานเทอร์มินัลแบบอัตโนมัติ สมาชิกขนาด 8B และ 30B ในตระกูล Granite 4.2 ได้รับการเรียนรู้แบบเสริมกำลังเชิงเอเจนต์ของ IBM และมีผลลัพธ์ SWE-Bench และ Terminal-Bench ส่วนขนาด 3B ข้ามบล็อกการฝึกนั้นไปอย่างชัดเจน และโมเดลของ Upstage ถูกวางราคาไว้สำหรับ retrieval, structuring และ policy application มากกว่าสำหรับการขับเคลื่อนเชลล์
ที่ Granite 4.2 3B ยังคงเป็นคำตอบที่ถูกต้อง
น้ำหนักโมเดลเจ็ดกิกะไบต์กับอีกหนึ่งในสามในรูปแบบ bfloat16 ต่ำกว่าสี่กิกะไบต์เมื่อทำควอนไทเซชันแบบใช้งานจริง และสัญญาอนุญาต Apache 2.0 ที่ให้คุณปรับแต่งโมเดลนี้ให้ละเอียดขึ้นด้วยข้อมูลของคุณเอง แล้วนำผลลัพธ์ออกเผยแพร่ได้โดยไม่ต้องขออนุญาตใครสักคน นักศึกษาที่มี GPU สำหรับผู้ใช้ทั่วไปเพียงตัวเดียว โรงพยาบาลที่ไม่สามารถส่งข้อความของผู้ป่วยให้บุคคลที่สาม ผลิตภัณฑ์ที่ต้องทำงานบนเครื่องบินหรือในห้องใต้ดินของโรงงาน ทีมที่ต้องการเป็นเจ้าของโมเดลแทนที่จะเช่าปลายทาง API — ทุกกรณีเหล่านี้เลือก Granite 4.2 3B และไม่หันกลับไปมองอีก เอนจินนี้ทำงานผ่าน vLLM, SGLang, Transformers และ GGUF และ Ollama มีบิลด์ granite4.2:3b อยู่ในรายการ
ตัวเลขที่ผู้ขายรายงานมาสมควรถูกมองด้วยความระมัดระวังตามปกติ การ์ดของ IBM อ้างว่า 78.33 บน AIME 2025, 66.67 บน HMMT February 2025 และ 69.71 บน LiveCodeBench v6 — โดยยังไม่มีบุคคลที่สามรายใดทำซ้ำได้ทั้งหมด และสำหรับโมเดล dense ขนาด 3B ตัวเลข AIME นั้นอยู่สูงกว่าช่วงตามประวัติศาสตร์มาก ดัชนี Artificial Analysis ที่ค่า 9 ประเมินว่าโมเดลนี้มีประโยชน์อย่างแท้จริงและไม่ได้ใกล้ระดับแนวหน้าเลย ซึ่งเป็นสัญญาณที่น่าเชื่อถือยิ่งกว่า เพราะ IBM ไม่ได้เป็นผู้เผยแพร่มันเอง
ที่ไหน Solar Mini 4 คือคำตอบที่ถูกต้อง
งานใดก็ตามที่งานนั้นเป็นเอกสารยาว การสกัดข้อมูลแบบมีโครงสร้างที่ทำซ้ำ หรือเป็นนโยบายที่ต้องนำไปใช้อย่างสม่ำเสมอในปริมาณมาก — และเป็นงานที่ยอมรับความหน่วงเก้าสิบวินาทีได้ โปรไฟล์ของ Solar Mini 4 คือโปรไฟล์ของผู้เชี่ยวชาญเฉพาะทาง: 83% ด้านการให้เหตุผลแบบบริบทยาว, 48% ด้านการเขียนโค้ดเชิงวิทยาศาสตร์, 64% ด้านการไม่สร้างข้อมูลเท็จ และมีแนวโน้มที่ได้รับการบันทึกไว้ชัดเจนว่าจะงดตอบมากกว่าเดา นอกจากนี้ยังรองรับภาษาเกาหลีในฐานะภาษาชั้นนำ ควบคู่กับอังกฤษและญี่ปุ่น ซึ่งสำหรับการติดตั้งใช้งานในตลาดเกาหลีแล้วไม่ใช่เรื่องเล็กน้อย
สิ่งที่ผู้ซื้อไม่ควรทำคือนำราคาของโทเค็นทั้งสองมาเปรียบเทียบแล้วสรุปว่า Solar Mini 4 แพงกว่าสามเท่า Artificial Analysis วัด Solar Mini 4 อยู่ที่ $0.36 ต่องาน Intelligence Index ที่ทำสำเร็จหนึ่งงาน — และบนชุดทดสอบเดียวกัน Granite 4.2 3B อยู่ที่ $0.006 นั่นคือปัจจัยต่างกันถึงหกสิบเท่า ซึ่งเกิดจากสิ่งเดียวกับที่ทำให้ Solar Mini 4 ดูแพงเมื่อเทียบกับ GPT-6 Luna (max): 88,300 โทเค็นเอาต์พุตต่องาน เทียบกับ 18,600 ของ Granite และโครงสร้างต้นทุนที่การเขียนแคชพรอมป์คิดเป็น $0.30 จาก $0.36 ของ Solar Mini 4 เทียบกับ $0.0006 จาก $0.006 ของ Granite ราคาเอาต์พุตที่ถูกบนโมเดลที่พูดเยอะไม่ได้หมายความว่างานจะถูก

ไม่มีโมเดลใดในสองตัวนี้อยู่บน OrcaRouter — เราไม่ได้จัดเส้นทางให้ทั้ง Granite และ Upstage — ดังนั้นถ้าคุณต้องการ Granite 4.2 3B มันมาจาก Hugging Face และถ้าคุณต้องการ Solar Mini 4 มันมาจาก API ของ Upstage เองและแพลตฟอร์มของบุคคลที่สาม แต่รูปแบบการใช้สองโมเดลที่การเปรียบเทียบนี้ชี้ให้เห็นคือสิ่งที่เราเตอร์ถูกสร้างขึ้นมาเพื่อรองรับ และนี่คือเหตุผลที่ OrcaRouter นำโมเดลกว่า 200 รายการมารวมไว้หลังคีย์เดียว โดยบวกเพิ่ม 0% จากราคาที่ผู้ให้บริการประกาศ: จับงานเอกสารยาวและงานภาษาเกาหลีไปรันกับโมเดลใดก็ตามที่คุ้มค่าต้นทุนจริง ๆ เก็บขั้นตอนการสกัดข้อมูลแบบดีเทอร์มินิสติกไว้บนสิ่งที่คุณโฮสต์เอง และปล่อยให้การจัดเส้นทางและการสลับเมื่อเกิดข้อขัดข้องย้ายคำขอระหว่างโมเดลเหล่านั้นแบบต่อครั้ง ไม่ใช่ต่อสัญญา

หมายเหตุสุดท้ายเกี่ยวกับตัวเลขข้างต้น ทุกตัวเลขของ Solar Mini 4 ที่มาจาก Artificial Analysis เป็นข้อมูลอิสระ ส่วนทุกตัวเลขของ Granite 4.2 3B จากโมเดลการ์ดของ IBM เป็นคำกล่าวอ้างของผู้ขายที่ยังไม่มีบุคคลที่สามรายใดทำซ้ำได้ คะแนนดัชนี Artificial Analysis ที่ 24 และ 9 เป็นตัวเลขเพียงสองตัวในที่นี้ที่ผลิตโดยห้องแล็บเดียวกันภายใต้เงื่อนไขเดียวกัน — และเป็นสองตัวเลขที่ควรใช้เป็นพื้นฐานในการตัดสินใจ
