
Solar Mini 4 ทำคะแนนได้ 24 บนดัชนี Artificial Analysis — และมีค่าใช้จ่ายต่อหนึ่งงานสูงกว่า GPT-6 Luna ถึงห้าเท่า
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 ต่อ 1 ล้านโทเค็น
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 ต่อ 1 ล้านโทเค็น · 159 tok/s
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 220 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Solar Mini 4 คิดค่าบริการต่อโทเคนอินพุตเท่ากับ GPT-6 Luna และคิดแพงกว่าราวห้าเท่าเมื่อต้องทำงานให้เสร็จจริง ๆ นั่นคือเนื้อหาทั้งหมดของการประเมินอิสระครั้งแรกของโมเดลใหม่จาก Upstage และไม่ใช่เรื่องราวที่สื่อเปิดตัวบอกไว้ Solar Mini 4 เปิดตัวเมื่อวันที่ 22 กันยายน 2026 ในฐานะ sparse mixture-of-experts ขนาด 35,000 ล้านพารามิเตอร์ที่เปิดใช้งานพารามิเตอร์ประมาณ 3,000 ล้านตัวต่อโทเคน ราคา $0.10 ต่อโทเคนอินพุต 1 ล้านโทเคน และ $0.40 ต่อ 1 ล้านโทเคนเอาต์พุต GPT-6 Luna ซึ่งเป็นระดับที่เน้นประสิทธิภาพของ OpenAI ระบุราคาไว้ที่ $0.10 และ $0.50 โดยมีระดับบริบทแบบยาวที่เกิน 272,000 โทเคนซึ่งทำให้ราคาทั้งสองเพิ่มขึ้นราวสองเท่า บนตารางราคา ทั้งสองดูเหมือนเป็นการซื้อแบบเดียวกัน ใน Intelligence Index ของ Artificial Analysis ซึ่งทั้งสองโมเดลถูกทดสอบผ่านชุดการประเมินสิบรายการเดียวกัน Solar Mini 4 มีค่าใช้จ่าย $0.36 ต่องานที่ทำสำเร็จ เทียบกับ $0.07 สำหรับ GPT-6 Luna (max) — คิดเป็นอัตราส่วน 5.4 เท่าที่มาจากพฤติกรรมของทั้งสองโมเดลระหว่างการทำงานทั้งหมด ไม่ใช่จากราคาที่คิดต่อโทเคน
เมื่อวันที่ 30 กันยายน 2026 Artificial Analysis ได้เผยแพร่บทวิเคราะห์ของโมเดลนี้ ซึ่งได้คะแนน 24บน Intelligence Index v4.3.2 ทุกสิ่งในบทความนี้ที่ระบุว่าเป็นข้อมูลจาก Artificial Analysis คือผลการวัดขององค์กรนั้นเอง ส่วนทุกสิ่งที่ระบุว่าเป็นข้อมูลจาก Upstage คือคำกล่าวอ้างของผู้จำหน่าย ความแตกต่างนี้สำคัญกว่าปกติในกรณีนี้ เพราะชุดตัวเลขทั้งสองชุดไม่ได้สอดคล้องกันเสมอไป
สิ่งที่การทดสอบอิสระนั้นพูดจริง ๆ

Solar Mini 4 อยู่ที่ 24.05 บน Intelligence Index เทียบกับค่ามัธยฐานที่ 12 ในบรรดาโมเดลการให้เหตุผลในระดับราคาของมัน สิ่งนี้ทำให้มันอยู่สูงกว่าค่าเฉลี่ยอย่างมากสำหรับระดับขนาดของมัน และการวางกรอบของ Upstage เอง — "คะแนนรวมสูงสุดในบรรดาโมเดลที่แอ็กทีฟ 3B ในการเปรียบเทียบ Artificial Analysis Intelligence Index" — ยังคงผ่านการทดสอบอิสระในประเด็นเฉพาะนั้น Qwen3.6 35B A3B ซึ่งเปิดใช้งานพารามิเตอร์ 3B เช่นกัน ได้คะแนน 18.2 บนดัชนีเดียวกัน K2 Horizon MoVA 36B A4B ซึ่งมี 4B ที่แอ็กทีฟ ได้คะแนน 25.3 — และทำได้บนบริบทที่สั้นกว่า 524K โทเคน เทียบกับ 1.05M ของ Solar Mini 4 เมื่อเทียบกับ Inkling ซึ่งเป็น MoE น้ำหนักเปิดขนาด 975 พันล้านพารามิเตอร์ที่เปิดตัวในเดือนกรกฎาคม Solar Mini 4 ได้ 24.1 เทียบกับ 25.0 — ห่างกันภายในหนึ่งคะแนนจากโมเดลที่มีขนาดใหญ่เกือบสามสิบเท่าของมัน ซึ่งมีค่าใช้จ่าย $1.00/$4.05 ต่อล้านโทเคน
โปรไฟล์ภายในสกอร์นั้นไม่สม่ำเสมอ และความไม่สม่ำเสมอนั่นแหละคือส่วนที่มีประโยชน์:
• การให้เหตุผลแบบบริบทยาวถือเป็นจุดแข็งเชิงเปรียบเทียบ Solar Mini 4 ทำคะแนน 83% บน AA-LCR v1.1 ทัดเทียมกับ MiniMax-M3 และ GPT-6 Luna (max) และนำหน้า Gemini 3.8 Flash (high) และ GPT-6 Astra (max) ที่ 81%
• การเขียนโค้ดเชิงวิทยาศาสตร์ยังคงทำได้ดี 48% บน SciCode นำหน้า MiniMax-M3 และ Inkling (xhigh) อยู่หนึ่งจุด
• การเขียนโค้ดแบบเอเจนติกพังทลายลง 1% บน Terminal-Bench 4.0 ไม่ใช่แค่ “อ่อนแอ” — แค่ 1% บน AutomationBench-AA ซึ่งรันเวิร์กโฟลว์หลายขั้นตอนข้ามแอปพลิเคชัน SaaS จริง ได้ 22.3%
• ความแม่นยำของความรู้อยู่ในระดับต่ำ แต่โมเดลรู้ตัวว่ากำลังเดา AA-Omniscience ให้คะแนน −11 ด้วยความแม่นยำ 18% โมเดลจะงดตอบประมาณครึ่งหนึ่งของคำถามที่ถูกถาม อัตราการไม่สร้างข้อมูลเท็จของมันอยู่ที่ 64% ซึ่งนำหน้า Inkling (xhigh) ที่ 32% และ GPT-6 Luna (max) ที่ 23% อย่างชัดเจน โมเดลที่พูดว่า "ฉันไม่รู้" ครึ่งหนึ่งของเวลา และตอบถูกสองในสามของเวลาที่ตอบนั้น ถือเป็นเครื่องมือที่แตกต่างจากโมเดลที่แต่งเรื่องขึ้นมาอย่างมั่นใจ
สำหรับงานองค์ความรู้แบบเอเจนต์ ตัวเลขอยู่ที่ 1072 Elo บน GDPval-AA และ 872 Elo บน AA-Briefcase โดยทั้งสองค่าใกล้เคียงกับ Inkling (xhigh)
ตัวเลขห้าเท่า ฉบับแยกให้เห็นชัด
ตัวเลขต้นทุนต่องานของ Artificial Analysis คือตัวเลขที่จะชี้ขาดบทสนทนาเรื่องการจัดซื้อจัดจ้างส่วนใหญ่ และตัวเลขนี้สมควรที่จะถูกอ่านในฐานะการแจกแจงองค์ประกอบ มากกว่าที่จะถูกยกมาเป็นพาดหัวข่าว มีสองสิ่งที่เป็นตัวขับเคลื่อน
อย่างแรก ปริมาณ Solar Mini 4 ปล่อยโทเคนเอาต์พุตประมาณ 88,300 โทเคนต่องาน Intelligence Index หนึ่งงาน โดย 71,600 โทเคนในนั้นเป็นโทเคนการให้เหตุผล ที่ราคา 0.40 ดอลลาร์ต่อล้านโทเคนเอาต์พุต นั่นคิดเป็นประมาณ 0.035 ดอลลาร์ของบิล — ถูก เพราะเอาต์พุตถูก สิ่งที่ต้องแลกไปแทนคือเวลา: ด้วยอัตราที่วัดได้ 204 โทเคนต่อวินาที Artificial Analysis บันทึกเวลาทำงาน 430 วินาทีสำหรับงาน index เฉลี่ย หรือประมาณ 7.2 นาที GPT-6 Luna (max) ปล่อยโทเคนเอาต์พุต 50,000 โทเคนต่องาน ที่ 127 โทเคนต่อวินาที และใช้เวลา 396 วินาที Inkling (xhigh) โมเดล open-weights ขนาด 975 พันล้านพารามิเตอร์ ปล่อย 34,700 โทเคน และเสร็จใน 169 วินาที Solar Mini 4 ช้ากว่าทั้งสอง แต่ด้วยส่วนต่างที่ไม่เกี่ยวข้องกับช่องว่างต้นทุนที่ต่างกันห้าเท่า
ประการที่สอง — และนี่คือเรื่องทั้งหมด — อินพุตจากการเขียนแคช การแจกแจงต้นทุนของ Artificial Analysis ระบุว่า ประมาณ $0.30 จาก $0.36 ต่องานของ Solar Mini 4 เป็นค่าโทเคนที่เขียนลงในแคชพรอมป์ เทียบกับ $0.03 สำหรับการอ่านแคช, $0.035 สำหรับเอาต์พุต และเศษเสี้ยวจากการปัดเศษสำหรับอินพุตที่ไม่ได้แคชจริง ๆ สำหรับ GPT-6 Luna (max) การเขียนแคชอยู่ที่ $0.012 จาก $0.068 — ประมาณ 17% ของบิล เทียบกับ 82% สำหรับ Solar Mini 4 อินพุตที่แคชไว้เป็นรายการที่ถูกที่สุดบนตารางราคาของ Upstage ที่ $0.01 ต่อล้าน และโมเดลของ Artificial Analysis ก็ใช้มันจริง ปัญหาคือจะต้องเขียนมากแค่ไหนก่อนที่มันจะอ่านได้ เอเจนต์ที่ส่งบทสนทนาที่ขยายขึ้นเรื่อย ๆ ซ้ำในทุกเทิร์นต้องจ่ายค่าการเขียนบ่อยกว่ามากเมื่อเทียบกับโมเดลที่ตอบในเทิร์นสั้น ๆ ที่จบในตัว
นั่นคือข้อค้นพบที่ควรค่าแก่การนำไปใช้ในโปรดักชัน สำหรับโมเดลแบบนี้ ราคาต่อโทเคนแทบไม่ช่วยทำนายค่าใช้จ่ายต่อหนึ่งงานเลย แต่พฤติกรรมของแคชต่างหากที่ทำนายได้
จุดที่ตัวเลขของ Upstage เองแตกต่างออกไป

โพสต์เปิดตัวของ Upstage ซึ่งเผยแพร่เมื่อวันที่ 1 ตุลาคม 2026 ภายใต้ชื่อ "Solar Mini 4: สร้างมาเพื่อเวิร์กโหลดเอเจนต์ปริมาณสูง" รายงานค่า 24.1 บน Artificial Analysis Intelligence Index — ซึ่งในทางปฏิบัติเป็นตัวเลขเดียวกัน — และกล่าวอ้างหลายประการที่วางอยู่เคียงข้างข้อมูลอิสระ มากกว่าที่จะอยู่เหนือข้อมูลนั้น
ผู้ขายอ้างอิง 22.3% บน AutomationBench-AA ซึ่งตรงกับ Artificial Analysis อย่างแม่นยำ และ 47.2 บน τ³-Banking ซึ่งเป็นเกณฑ์มาตรฐานด้านนโยบายและการใช้เครื่องมือที่ชุดดัชนีได้ยกเลิกไปแล้ว รายงานว่า 83.3% บน AA-LCR และ 47.6% บน SciCode ทั้งสองค่าต่างจากตัวเลขอิสระเพียงความคลาดเคลื่อนจากการปัดเศษ บน Humanity's Last Exam รายงาน 19.6% ในขณะที่หน้า Artificial Analysis ระบุ 25.8% สำหรับโมเดลเดียวกัน ทั้งสองเป็นค่าที่เป็นไปได้ของการประเมินที่ผันผวนจนขึ้นชื่อ แต่ไม่ใช่ตัวเลขเดียวกัน และไม่ควรนำเสนอค่าหนึ่งเป็นอีกค่าหนึ่ง
สองบรรทัดสเปกก็ยังขัดแย้งกันด้วย Upstage ระบุหน้าต่างบริบท 512K โทเคน พร้อมเอาต์พุตได้ถึง 128K โทเคน ส่วน Artificial Analysis ระบุหน้าต่างบริบท 1.0M โทเคน และเอาต์พุตสูงสุด 262K บล็อกของ Upstage ระบุชัดเจนว่าตัวเลข 512K คือสัญญาที่ส่งมอบจริง ความคลาดเคลื่อนแบบนี้เป็นเรื่องที่ควรไขให้กระจ่างเทียบกับผลตอบกลับจาก API ก่อนที่ใครจะสร้างไปป์ไลน์ค้นคืนข้อมูลบนพื้นฐานของมัน
ผู้ขายยังทำการเปรียบเทียบเพียงอย่างเดียวที่ทำได้ตามเงื่อนไขของตนเอง นั่นคือการทดสอบภายในจากงานเอเจนต์ภาษาเกาหลีสามงาน โดยรันงานละสามครั้งต่อโมเดล ซึ่งการทำชุดสามงานจำนวน 1,000 ชุดให้เสร็จมีค่าใช้จ่ายประมาณ $1.25 ด้วย Solar Mini 4 และ $2.20 ด้วย MiMo-V2.5 นั่นเป็นการทดสอบที่ผู้ขายเป็นผู้รัน บนงานที่ผู้ขายเลือก และไม่นับรวมเวลาแฝง และมันชี้ไปในทิศทางตรงข้ามกับผลลัพธ์ของ Artificial Analysis มันไม่ได้ผิด — งานที่ต่างกันต้องใช้งบโทเค็นที่ต่างกัน — แต่มันเป็นตัวเลขทางการตลาด และส่วนลดเปิดตัวที่เผยแพร่ของโมเดลก็เป็นอีกเหตุผลหนึ่งที่ควรคำนวณตัวเลขของคุณเองใหม่ แทนที่จะนำของใครก็ตามมาใช้
ราคา ตามเอกสารคอนโซล Upstage ฉบับปัจจุบัน: $0.10 ต่อหนึ่งล้านโทเคนอินพุต, $0.01 ต่อหนึ่งล้านโทเคนอินพุตที่แคชไว้, $0.40 ต่อหนึ่งล้านโทเคนเอาต์พุต โดยมีส่วนลดเปิดตัวซึ่งปัจจุบันประกาศไว้ที่ 50% ถึงวันที่ 22 ตุลาคม 2026 UTC ซึ่งทำให้อัตราที่มีผลจริงอยู่ที่ $0.05 สำหรับอินพุต, $0.005 สำหรับอินพุตที่แคชไว้ และ $0.20 สำหรับเอาต์พุต จนถึงตอนนั้น
สิ่งนี้หมายความว่าอย่างไรหากคุณเป็นคนจ่ายเงิน
สิ่งที่น่าสนใจเกี่ยวกับ Solar Mini 4 ไม่ใช่ว่ามันเป็นโมเดลที่แย่ แต่เป็นเพราะมันเป็นโมเดลขนาดเล็กที่ดีจริง ๆ ซึ่งเศรษฐศาสตร์ของมันถูกครอบงำด้วยพฤติกรรมที่ตารางราคาไม่สามารถแสดงให้คุณเห็นได้ คะแนน 24 บนดัชนีด้วยพารามิเตอร์ที่ใช้งานเพียงสามตัวถือเป็นผลลัพธ์ทางวิศวกรรมที่แท้จริง และภาระงานภาษาเกาหลี — จุดแข็งที่โมเดลระบุไว้ ควบคู่กับภาษาอังกฤษและภาษาญี่ปุ่น — คือจุดที่ผลลัพธ์นั้นมีแนวโน้มที่จะคุ้มค่ากับราคามากที่สุด
ส่วนที่น่าอึดอัดคือทุกสิ่งหลังจาการเรียกครั้งแรก เทิร์นการตอบกลับของผู้ช่วยที่ยาว การใช้แคชซ้ำต่ำ และงานที่ใช้เวลา decode เจ็ดนาทีต่อการรัน index หนึ่งครั้ง รวมกันแล้วได้ตัวเลขที่ไม่ใกล้เคียงกับ $0.10/$0.40 เลย หากคุณกำลังประเมินมันอยู่ การทดลองที่ซื่อสัตย์คือการทดสอบต้นทุนต่องานที่เสร็จสมบูรณ์บนเวิร์กโหลดของคุณเอง โดยเปิดใช้ prompt caching ในแบบที่ production stack ของคุณจะใช้จริง — ไม่ใช่การเปรียบเทียบราคาต่อโทเคน
นี่ก็เป็นประเภทของปัญหาที่เราเตอร์ถูกสร้างขึ้นมาเพื่อแก้เช่นกัน และเป็นเหตุผลที่ OrcaRouter ส่งต่อราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายปรับราคา บิลของคุณก็จะสะท้อนการเปลี่ยนแปลงนั้นภายในวันเดียวกัน เราไม่ได้ให้บริการ route โมเดลของ Upstage ดังนั้นทั้ง Solar Mini 4 และ Solar Pro 4 จึงไม่มีให้ใช้ผ่านเรา — ทั้งสองมาจาก API ของ Upstage เองและแพลตฟอร์มของบุคคลที่สาม สิ่งที่เรา route คืออีกครึ่งหนึ่งของการเปรียบเทียบนี้: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash และ โมเดลอื่น ๆ อีกกว่า 200 โมเดลที่อยู่เบื้องหลังคีย์เดียว ซึ่งนี่คือสิ่งที่ทำให้การเก็บทั้งโมเดลราคาถูกและโมเดลราคาแพงไว้ใช้งานเดียวกันเป็นเรื่องที่ทำได้จริง และปล่อยให้ระบบสำรองอัตโนมัติและ Per-Request Routing เป็นตัวตัดสินว่าโมเดลไหนจะตอบ เมื่อความแตกต่างระหว่างสองโมเดลคือช่องว่างต้นทุนต่อภารกิจถึงห้าเท่าซึ่งไม่มีตารางราคาใดเผยให้เห็น ความสามารถในการย้ายคำขอเดียวไปมาระหว่างสองโมเดลนั้นสำคัญกว่าตาราง Benchmark ใด ๆ

ฉบับสั้น: Solar Mini 4 คือจุดพาเรโต (Pareto point) จุดใหม่ที่ Artificial Analysis วาดไว้สำหรับโมเดลที่มีพารามิเตอร์ที่ใช้งานจริงต่ำกว่าสามพันล้าน และมันมีราคาแพงกว่าต่องานที่ทำสำเร็จประมาณห้าเท่า เมื่อเทียบกับโมเดลที่ตั้งราคาอินพุตเท่ากัน ทั้งสองข้อความนั้นเป็นจริง และข้อที่สองคือข้อที่ปรากฏบนใบแจ้งหนี้
