การ์ดชื่อเรื่องหลักที่สร้างขึ้นสำหรับ Solar Mini 4 ซึ่งพาดหัวว่า 'Solar Mini 4 — การรันอิสระ' พร้อมคำโปรย 'Intelligence Index 24 และมีต้นทุนต่องานราวห้าเท่าของ GPT-6 Luna' และป้ายสองป้ายที่ระบุว่า 'เปิดตัว 22 กันยายน 2026' และ 'การประเมินโดยบุคคลที่สามครั้งแรก, 30 กันยายน 2026'
Guides & Insights

Solar Mini 4 ทำคะแนนได้ 24 บนดัชนี Artificial Analysis — และมีค่าใช้จ่ายต่อหนึ่งงานสูงกว่า GPT-6 Luna ถึงห้าเท่า

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Solar Mini 4 คิดค่าบริการต่อโทเคนอินพุตเท่ากับ GPT-6 Luna และคิดแพงกว่าราวห้าเท่าเมื่อต้องทำงานให้เสร็จจริง ๆ นั่นคือเนื้อหาทั้งหมดของการประเมินอิสระครั้งแรกของโมเดลใหม่จาก Upstage และไม่ใช่เรื่องราวที่สื่อเปิดตัวบอกไว้ Solar Mini 4 เปิดตัวเมื่อวันที่ 22 กันยายน 2026 ในฐานะ sparse mixture-of-experts ขนาด 35,000 ล้านพารามิเตอร์ที่เปิดใช้งานพารามิเตอร์ประมาณ 3,000 ล้านตัวต่อโทเคน ราคา $0.10 ต่อโทเคนอินพุต 1 ล้านโทเคน และ $0.40 ต่อ 1 ล้านโทเคนเอาต์พุต GPT-6 Luna ซึ่งเป็นระดับที่เน้นประสิทธิภาพของ OpenAI ระบุราคาไว้ที่ $0.10 และ $0.50 โดยมีระดับบริบทแบบยาวที่เกิน 272,000 โทเคนซึ่งทำให้ราคาทั้งสองเพิ่มขึ้นราวสองเท่า บนตารางราคา ทั้งสองดูเหมือนเป็นการซื้อแบบเดียวกัน ใน Intelligence Index ของ Artificial Analysis ซึ่งทั้งสองโมเดลถูกทดสอบผ่านชุดการประเมินสิบรายการเดียวกัน Solar Mini 4 มีค่าใช้จ่าย $0.36 ต่องานที่ทำสำเร็จ เทียบกับ $0.07 สำหรับ GPT-6 Luna (max) — คิดเป็นอัตราส่วน 5.4 เท่าที่มาจากพฤติกรรมของทั้งสองโมเดลระหว่างการทำงานทั้งหมด ไม่ใช่จากราคาที่คิดต่อโทเคน

เมื่อวันที่ 30 กันยายน 2026 Artificial Analysis ได้เผยแพร่บทวิเคราะห์ของโมเดลนี้ ซึ่งได้คะแนน 24บน Intelligence Index v4.3.2 ทุกสิ่งในบทความนี้ที่ระบุว่าเป็นข้อมูลจาก Artificial Analysis คือผลการวัดขององค์กรนั้นเอง ส่วนทุกสิ่งที่ระบุว่าเป็นข้อมูลจาก Upstage คือคำกล่าวอ้างของผู้จำหน่าย ความแตกต่างนี้สำคัญกว่าปกติในกรณีนี้ เพราะชุดตัวเลขทั้งสองชุดไม่ได้สอดคล้องกันเสมอไป

สิ่งที่การทดสอบอิสระนั้นพูดจริง ๆ

A scoreboard titled 'Solar Mini 4 — the scoreboard' with the rows: Intelligence Index 24.05 against a median of 12; Cost per index task $0.36 against GPT-6 Luna (max) at $0.07; Rate card $0.10 in / $0.01 cached / $0.40 out per 1M; Output per index task 88,300 tokens, 71,600 of them reasoning; Output speed 204 tokens per second and 430 seconds per index task; Context Upstage says 512K while Artificial Analysis lists 1.05M; Weakest result Terminal-Bench 4.0 at 1%.

Solar Mini 4 อยู่ที่ 24.05 บน Intelligence Index เทียบกับค่ามัธยฐานที่ 12 ในบรรดาโมเดลการให้เหตุผลในระดับราคาของมัน สิ่งนี้ทำให้มันอยู่สูงกว่าค่าเฉลี่ยอย่างมากสำหรับระดับขนาดของมัน และการวางกรอบของ Upstage เอง — "คะแนนรวมสูงสุดในบรรดาโมเดลที่แอ็กทีฟ 3B ในการเปรียบเทียบ Artificial Analysis Intelligence Index" — ยังคงผ่านการทดสอบอิสระในประเด็นเฉพาะนั้น Qwen3.6 35B A3B ซึ่งเปิดใช้งานพารามิเตอร์ 3B เช่นกัน ได้คะแนน 18.2 บนดัชนีเดียวกัน K2 Horizon MoVA 36B A4B ซึ่งมี 4B ที่แอ็กทีฟ ได้คะแนน 25.3 — และทำได้บนบริบทที่สั้นกว่า 524K โทเคน เทียบกับ 1.05M ของ Solar Mini 4 เมื่อเทียบกับ Inkling ซึ่งเป็น MoE น้ำหนักเปิดขนาด 975 พันล้านพารามิเตอร์ที่เปิดตัวในเดือนกรกฎาคม Solar Mini 4 ได้ 24.1 เทียบกับ 25.0 — ห่างกันภายในหนึ่งคะแนนจากโมเดลที่มีขนาดใหญ่เกือบสามสิบเท่าของมัน ซึ่งมีค่าใช้จ่าย $1.00/$4.05 ต่อล้านโทเคน

โปรไฟล์ภายในสกอร์นั้นไม่สม่ำเสมอ และความไม่สม่ำเสมอนั่นแหละคือส่วนที่มีประโยชน์:

• การให้เหตุผลแบบบริบทยาวถือเป็นจุดแข็งเชิงเปรียบเทียบ Solar Mini 4 ทำคะแนน 83% บน AA-LCR v1.1 ทัดเทียมกับ MiniMax-M3 และ GPT-6 Luna (max) และนำหน้า Gemini 3.8 Flash (high) และ GPT-6 Astra (max) ที่ 81%

• การเขียนโค้ดเชิงวิทยาศาสตร์ยังคงทำได้ดี 48% บน SciCode นำหน้า MiniMax-M3 และ Inkling (xhigh) อยู่หนึ่งจุด

• การเขียนโค้ดแบบเอเจนติกพังทลายลง 1% บน Terminal-Bench 4.0 ไม่ใช่แค่ “อ่อนแอ” — แค่ 1% บน AutomationBench-AA ซึ่งรันเวิร์กโฟลว์หลายขั้นตอนข้ามแอปพลิเคชัน SaaS จริง ได้ 22.3%

• ความแม่นยำของความรู้อยู่ในระดับต่ำ แต่โมเดลรู้ตัวว่ากำลังเดา AA-Omniscience ให้คะแนน −11 ด้วยความแม่นยำ 18% โมเดลจะงดตอบประมาณครึ่งหนึ่งของคำถามที่ถูกถาม อัตราการไม่สร้างข้อมูลเท็จของมันอยู่ที่ 64% ซึ่งนำหน้า Inkling (xhigh) ที่ 32% และ GPT-6 Luna (max) ที่ 23% อย่างชัดเจน โมเดลที่พูดว่า "ฉันไม่รู้" ครึ่งหนึ่งของเวลา และตอบถูกสองในสามของเวลาที่ตอบนั้น ถือเป็นเครื่องมือที่แตกต่างจากโมเดลที่แต่งเรื่องขึ้นมาอย่างมั่นใจ

สำหรับงานองค์ความรู้แบบเอเจนต์ ตัวเลขอยู่ที่ 1072 Elo บน GDPval-AA และ 872 Elo บน AA-Briefcase โดยทั้งสองค่าใกล้เคียงกับ Inkling (xhigh)

ตัวเลขห้าเท่า ฉบับแยกให้เห็นชัด

ตัวเลขต้นทุนต่องานของ Artificial Analysis คือตัวเลขที่จะชี้ขาดบทสนทนาเรื่องการจัดซื้อจัดจ้างส่วนใหญ่ และตัวเลขนี้สมควรที่จะถูกอ่านในฐานะการแจกแจงองค์ประกอบ มากกว่าที่จะถูกยกมาเป็นพาดหัวข่าว มีสองสิ่งที่เป็นตัวขับเคลื่อน

อย่างแรก ปริมาณ Solar Mini 4 ปล่อยโทเคนเอาต์พุตประมาณ 88,300 โทเคนต่องาน Intelligence Index หนึ่งงาน โดย 71,600 โทเคนในนั้นเป็นโทเคนการให้เหตุผล ที่ราคา 0.40 ดอลลาร์ต่อล้านโทเคนเอาต์พุต นั่นคิดเป็นประมาณ 0.035 ดอลลาร์ของบิล — ถูก เพราะเอาต์พุตถูก สิ่งที่ต้องแลกไปแทนคือเวลา: ด้วยอัตราที่วัดได้ 204 โทเคนต่อวินาที Artificial Analysis บันทึกเวลาทำงาน 430 วินาทีสำหรับงาน index เฉลี่ย หรือประมาณ 7.2 นาที GPT-6 Luna (max) ปล่อยโทเคนเอาต์พุต 50,000 โทเคนต่องาน ที่ 127 โทเคนต่อวินาที และใช้เวลา 396 วินาที Inkling (xhigh) โมเดล open-weights ขนาด 975 พันล้านพารามิเตอร์ ปล่อย 34,700 โทเคน และเสร็จใน 169 วินาที Solar Mini 4 ช้ากว่าทั้งสอง แต่ด้วยส่วนต่างที่ไม่เกี่ยวข้องกับช่องว่างต้นทุนที่ต่างกันห้าเท่า

ประการที่สอง — และนี่คือเรื่องทั้งหมด — อินพุตจากการเขียนแคช การแจกแจงต้นทุนของ Artificial Analysis ระบุว่า ประมาณ $0.30 จาก $0.36 ต่องานของ Solar Mini 4 เป็นค่าโทเคนที่เขียนลงในแคชพรอมป์ เทียบกับ $0.03 สำหรับการอ่านแคช, $0.035 สำหรับเอาต์พุต และเศษเสี้ยวจากการปัดเศษสำหรับอินพุตที่ไม่ได้แคชจริง ๆ สำหรับ GPT-6 Luna (max) การเขียนแคชอยู่ที่ $0.012 จาก $0.068 — ประมาณ 17% ของบิล เทียบกับ 82% สำหรับ Solar Mini 4 อินพุตที่แคชไว้เป็นรายการที่ถูกที่สุดบนตารางราคาของ Upstage ที่ $0.01 ต่อล้าน และโมเดลของ Artificial Analysis ก็ใช้มันจริง ปัญหาคือจะต้องเขียนมากแค่ไหนก่อนที่มันจะอ่านได้ เอเจนต์ที่ส่งบทสนทนาที่ขยายขึ้นเรื่อย ๆ ซ้ำในทุกเทิร์นต้องจ่ายค่าการเขียนบ่อยกว่ามากเมื่อเทียบกับโมเดลที่ตอบในเทิร์นสั้น ๆ ที่จบในตัว

นั่นคือข้อค้นพบที่ควรค่าแก่การนำไปใช้ในโปรดักชัน สำหรับโมเดลแบบนี้ ราคาต่อโทเคนแทบไม่ช่วยทำนายค่าใช้จ่ายต่อหนึ่งงานเลย แต่พฤติกรรมของแคชต่างหากที่ทำนายได้

จุดที่ตัวเลขของ Upstage เองแตกต่างออกไป

A screenshot of Upstage's Console documentation page for Solar Mini 4, showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate, the description of a cost-efficient compact language model at 35B total and 3B active parameters built for agentic use cases, English, Japanese and Korean language support, tool calling, a 128K max output, the platforms Upstage Console and on-premises, and the version string solar-mini4-260922 with a training data cut-off of February 2026.

โพสต์เปิดตัวของ Upstage ซึ่งเผยแพร่เมื่อวันที่ 1 ตุลาคม 2026 ภายใต้ชื่อ "Solar Mini 4: สร้างมาเพื่อเวิร์กโหลดเอเจนต์ปริมาณสูง" รายงานค่า 24.1 บน Artificial Analysis Intelligence Index — ซึ่งในทางปฏิบัติเป็นตัวเลขเดียวกัน — และกล่าวอ้างหลายประการที่วางอยู่เคียงข้างข้อมูลอิสระ มากกว่าที่จะอยู่เหนือข้อมูลนั้น

ผู้ขายอ้างอิง 22.3% บน AutomationBench-AA ซึ่งตรงกับ Artificial Analysis อย่างแม่นยำ และ 47.2 บน τ³-Banking ซึ่งเป็นเกณฑ์มาตรฐานด้านนโยบายและการใช้เครื่องมือที่ชุดดัชนีได้ยกเลิกไปแล้ว รายงานว่า 83.3% บน AA-LCR และ 47.6% บน SciCode ทั้งสองค่าต่างจากตัวเลขอิสระเพียงความคลาดเคลื่อนจากการปัดเศษ บน Humanity's Last Exam รายงาน 19.6% ในขณะที่หน้า Artificial Analysis ระบุ 25.8% สำหรับโมเดลเดียวกัน ทั้งสองเป็นค่าที่เป็นไปได้ของการประเมินที่ผันผวนจนขึ้นชื่อ แต่ไม่ใช่ตัวเลขเดียวกัน และไม่ควรนำเสนอค่าหนึ่งเป็นอีกค่าหนึ่ง

สองบรรทัดสเปกก็ยังขัดแย้งกันด้วย Upstage ระบุหน้าต่างบริบท 512K โทเคน พร้อมเอาต์พุตได้ถึง 128K โทเคน ส่วน Artificial Analysis ระบุหน้าต่างบริบท 1.0M โทเคน และเอาต์พุตสูงสุด 262K บล็อกของ Upstage ระบุชัดเจนว่าตัวเลข 512K คือสัญญาที่ส่งมอบจริง ความคลาดเคลื่อนแบบนี้เป็นเรื่องที่ควรไขให้กระจ่างเทียบกับผลตอบกลับจาก API ก่อนที่ใครจะสร้างไปป์ไลน์ค้นคืนข้อมูลบนพื้นฐานของมัน

ผู้ขายยังทำการเปรียบเทียบเพียงอย่างเดียวที่ทำได้ตามเงื่อนไขของตนเอง นั่นคือการทดสอบภายในจากงานเอเจนต์ภาษาเกาหลีสามงาน โดยรันงานละสามครั้งต่อโมเดล ซึ่งการทำชุดสามงานจำนวน 1,000 ชุดให้เสร็จมีค่าใช้จ่ายประมาณ $1.25 ด้วย Solar Mini 4 และ $2.20 ด้วย MiMo-V2.5 นั่นเป็นการทดสอบที่ผู้ขายเป็นผู้รัน บนงานที่ผู้ขายเลือก และไม่นับรวมเวลาแฝง และมันชี้ไปในทิศทางตรงข้ามกับผลลัพธ์ของ Artificial Analysis มันไม่ได้ผิด — งานที่ต่างกันต้องใช้งบโทเค็นที่ต่างกัน — แต่มันเป็นตัวเลขทางการตลาด และส่วนลดเปิดตัวที่เผยแพร่ของโมเดลก็เป็นอีกเหตุผลหนึ่งที่ควรคำนวณตัวเลขของคุณเองใหม่ แทนที่จะนำของใครก็ตามมาใช้

ราคา ตามเอกสารคอนโซล Upstage ฉบับปัจจุบัน: $0.10 ต่อหนึ่งล้านโทเคนอินพุต, $0.01 ต่อหนึ่งล้านโทเคนอินพุตที่แคชไว้, $0.40 ต่อหนึ่งล้านโทเคนเอาต์พุต โดยมีส่วนลดเปิดตัวซึ่งปัจจุบันประกาศไว้ที่ 50% ถึงวันที่ 22 ตุลาคม 2026 UTC ซึ่งทำให้อัตราที่มีผลจริงอยู่ที่ $0.05 สำหรับอินพุต, $0.005 สำหรับอินพุตที่แคชไว้ และ $0.20 สำหรับเอาต์พุต จนถึงตอนนั้น

สิ่งนี้หมายความว่าอย่างไรหากคุณเป็นคนจ่ายเงิน

สิ่งที่น่าสนใจเกี่ยวกับ Solar Mini 4 ไม่ใช่ว่ามันเป็นโมเดลที่แย่ แต่เป็นเพราะมันเป็นโมเดลขนาดเล็กที่ดีจริง ๆ ซึ่งเศรษฐศาสตร์ของมันถูกครอบงำด้วยพฤติกรรมที่ตารางราคาไม่สามารถแสดงให้คุณเห็นได้ คะแนน 24 บนดัชนีด้วยพารามิเตอร์ที่ใช้งานเพียงสามตัวถือเป็นผลลัพธ์ทางวิศวกรรมที่แท้จริง และภาระงานภาษาเกาหลี — จุดแข็งที่โมเดลระบุไว้ ควบคู่กับภาษาอังกฤษและภาษาญี่ปุ่น — คือจุดที่ผลลัพธ์นั้นมีแนวโน้มที่จะคุ้มค่ากับราคามากที่สุด

ส่วนที่น่าอึดอัดคือทุกสิ่งหลังจาการเรียกครั้งแรก เทิร์นการตอบกลับของผู้ช่วยที่ยาว การใช้แคชซ้ำต่ำ และงานที่ใช้เวลา decode เจ็ดนาทีต่อการรัน index หนึ่งครั้ง รวมกันแล้วได้ตัวเลขที่ไม่ใกล้เคียงกับ $0.10/$0.40 เลย หากคุณกำลังประเมินมันอยู่ การทดลองที่ซื่อสัตย์คือการทดสอบต้นทุนต่องานที่เสร็จสมบูรณ์บนเวิร์กโหลดของคุณเอง โดยเปิดใช้ prompt caching ในแบบที่ production stack ของคุณจะใช้จริง — ไม่ใช่การเปรียบเทียบราคาต่อโทเคน

นี่ก็เป็นประเภทของปัญหาที่เราเตอร์ถูกสร้างขึ้นมาเพื่อแก้เช่นกัน และเป็นเหตุผลที่ OrcaRouter ส่งต่อราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายปรับราคา บิลของคุณก็จะสะท้อนการเปลี่ยนแปลงนั้นภายในวันเดียวกัน เราไม่ได้ให้บริการ route โมเดลของ Upstage ดังนั้นทั้ง Solar Mini 4 และ Solar Pro 4 จึงไม่มีให้ใช้ผ่านเรา — ทั้งสองมาจาก API ของ Upstage เองและแพลตฟอร์มของบุคคลที่สาม สิ่งที่เรา route คืออีกครึ่งหนึ่งของการเปรียบเทียบนี้: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash และ โมเดลอื่น ๆ อีกกว่า 200 โมเดลที่อยู่เบื้องหลังคีย์เดียว ซึ่งนี่คือสิ่งที่ทำให้การเก็บทั้งโมเดลราคาถูกและโมเดลราคาแพงไว้ใช้งานเดียวกันเป็นเรื่องที่ทำได้จริง และปล่อยให้ระบบสำรองอัตโนมัติและ Per-Request Routing เป็นตัวตัดสินว่าโมเดลไหนจะตอบ เมื่อความแตกต่างระหว่างสองโมเดลคือช่องว่างต้นทุนต่อภารกิจถึงห้าเท่าซึ่งไม่มีตารางราคาใดเผยให้เห็น ความสามารถในการย้ายคำขอเดียวไปมาระหว่างสองโมเดลนั้นสำคัญกว่าตาราง Benchmark ใด ๆ

A screenshot of the Artificial Analysis article dated September 30, 2026, headlined 'Korean AI Lab Upstage has released Solar Mini 4 which scores 24 on the Artificial Analysis Intelligence Index, but costs ~5x as much per task as GPT-6 Luna (max) despite similar per-token prices'. The visible key-results text covers the 3B-active Pareto claim, the 6-point lead over Qwen3.6 35B A3B at the same active size, 83% on AA-LCR v1.1 matching MiniMax-M3 and GPT-6 Luna (max), 48% on SciCode, and fast output at 208 tokens per second with slow tasks.

ฉบับสั้น: Solar Mini 4 คือจุดพาเรโต (Pareto point) จุดใหม่ที่ Artificial Analysis วาดไว้สำหรับโมเดลที่มีพารามิเตอร์ที่ใช้งานจริงต่ำกว่าสามพันล้าน และมันมีราคาแพงกว่าต่องานที่ทำสำเร็จประมาณห้าเท่า เมื่อเทียบกับโมเดลที่ตั้งราคาอินพุตเท่ากัน ทั้งสองข้อความนั้นเป็นจริง และข้อที่สองคือข้อที่ปรากฏบนใบแจ้งหนี้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube