
Solar Mini 4 vs. LFM2.5 2.6B Base: Dreimal so hoher Index und ein Kostenvergleich, den es nicht gibt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 pro 1 Mio. Tokens
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 pro 1 Mio. Tokens · 159 tok/s
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 220 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Die ehrliche Art, Solar Mini 4 und LFM2.5 2.6B Base zu vergleichen, ist, gleich zu Beginn zuzugeben, dass sie nicht denselben Markt bedienen. Solar Mini 4 ist Upstages Sparse-Mixture-of-Experts mit 35 Milliarden Parametern, veröffentlicht am 22. September 2026, aktiviert etwa 3 Milliarden Parameter pro Token, ist proprietär und wird mit 0,10 US-Dollar pro Million Eingabe-Token und 0,40 US-Dollar pro Million Ausgabe-Token abgerechnet. LFM2.5 2.6B Base ist Liquid AIs vortrainierter Checkpoint mit 2,69 Milliarden Parametern, Anfang August 2026 auf Hugging Face unter der LFM Open License v1.0 veröffentlicht, klein genug, um im Speicher eines Telefons zu liegen. Das eine ist ein Endpunkt. Das andere ist eine Gewichtsdatei, und wenn Sie dies lesen, weil Sie ein Modell ausführen statt es aufzurufen, ist der Vergleich bereits entschieden.
Was die Gegenüberstellung überhaupt erst einen Artikel wert macht, ist die eine Dimension, in der sie sich tatsächlich überschneiden: Beide wurden an demselben unabhängigen Maßstab gemessen, und die Form dieses Vergleichs entspricht nicht dem, was die Parameterzahlen vorhersagen. Artificial Analysis bewertet Solar Mini 4 mit 24 Punkten auf dem Intelligence Index v4.3.2 und stuft die LFM2.5 2.6B-Generation mit 8,4 ein — doch die zweite Zahl ist eine Schätzung, und sie misst nicht den Checkpoint aus dem Titel dieses Artikels. Beide Vorbehalte sind wichtig, und sie sind das Erste, was geklärt werden muss.
Das Datenblatt, Seite an Seite
• Parameter — Solar Mini 4 hat insgesamt 35B, davon 3B aktiv; LFM2.5 2.6B Base ist dicht mit 2,69B, nichts wird zurückgehalten. Dreizehnmal so viele Gewichte auf der Upstage-Seite für ungefähr dasselbe Rechenbudget pro Token.
• Architektur — Solar Mini 4 ist ein dünnbesetztes Mixture-of-Experts. LFM2.5 2.6B Base hat 30 Layer, 22 davon doppelt gegatete Short-Convolution-Blöcke und 8 Grouped-Query-Attention, das hybride Design, das Liquid für CPU- und Edge-Inferenz entwickelt hat.
• Training — Upstage veröffentlicht kein Token-Budget. Liquids Karte dokumentiert 34 Billionen Tokens und ein Vokabular von 128.000 Tokens über 16 Sprachen, darunter Koreanisch und Japanisch.
• Lizenz — Solar Mini 4 ist proprietär. LFM2.5 2.6B Base wird unter der LFM Open License v1.0 bereitgestellt — permissiv für die kommerzielle Nutzung unter Bedingungen und für Fine-Tuning geeignet.
• Kontext — Upstage dokumentiert 512K Token, Artificial Analysis listet 1,05 Mio. für dasselbe Modell, also ist die Obergrenze als ungeklärt zu betrachten. LFM2.5 2.6B Base läuft mit 131.072.
• Modalität — beide sind Text-in, Text-out. Keines von beiden nimmt Bilder oder Audio entgegen.
• Preis — Solar Mini 4 zu 0,10 $ / 0,01 $ für Cache / 0,40 $ pro Million Tokens, derzeit 50 % Rabatt bis zum 22. Oktober 2026. LFM2.5 2.6B Base hat überhaupt keine Preisliste; der Host Artificial Analysis führt die Preise für die LFM2.5 2.6B-Generation mit 0,00 $.
Was „8.4, geschätzt" misst und was nicht

Der Eintrag von Artificial Analysis für die LFM2.5 2.6B-Generation – das nachtrainierte Modell, nicht das vortrainierte Base – trägt einen Index von 8,4, der als Schätzung gekennzeichnet ist, wobei die meisten seiner Komponentenbewertungen ebenso gekennzeichnet sind. Das ist eine Platzierung in einer Bestenliste, keine Spezifikation, an der man sich beim Entwickeln orientieren sollte, und sie sollte niemals so zitiert werden, als hätte jemand den Base-Checkpoint durch die Testsuite laufen lassen. Das hat niemand getan. Die eigene Modellkarte von Liquid veröffentlicht für LFM2.5 2.6B Base überhaupt keine Benchmark-Tabelle: Es ist ein vortrainierter Checkpoint zur Textvervollständigung, und die Karte sagt unmissverständlich, dass er nur für umfangreiches Fine-Tuning empfohlen wird.
Das bewertete Schwestermodell ist ein anderes Artefakt. Die Benchmark-Tabelle von Liquid für das nachtrainierte LFM2.5 2.6B zeigt IFStruct bei 85,5 und Multi-IF bei 80,1, AIME25 bei 51,9, LiveCodeBench v6 bei 59,4, BFCLv4 bei 56,9 und τ³-Banking bei 5,7 — alle vom Anbieter durchgeführt, alle auf dem instruction-getunten Build, und der τ³-Wert ist derjenige, der sich wie eine Warnung liest.
Das Profil von Solar Mini 4 hat eine gänzlich andere Form. Es erzielt 83,3 % auf AA-LCR v1.1 für Long-Context-Reasoning, 47,6 % auf SciCode und −10,8 auf AA-Omniscience mit 18,4 % Genauigkeit und einer Nicht-Halluzinationsrate von 64,2 %. Es erzielt außerdem 1 % auf Terminal-Bench 4.0 und 22,3 % auf AutomationBench-AA. Beide Familien sind schwach bei agentischer Arbeit; das Modell von Upstage ist schwach bei agentischer Arbeit und dabei teuer, was eine schlechtere Ausgangslage ist, als schwach bei agentischer Arbeit und dabei kostenlos zu sein.
Was Solar Mini 4 seinen Preis wert macht, ist die Skalierung des Schlussfolgerns. Bei 88.300 Ausgabe-Tokens pro Index-Aufgabe – 71.600 davon für Schlussfolgern – setzt es Rechenleistung auf eine Weise ein, die ein dichtes 2,6B-Modell nicht nachahmen kann, indem man ihm einen längeren Prompt übergibt. Einem Modell mit 2,69B Parametern kann man sagen, es soll Schritt für Schritt denken; man kann ihm nicht sagen, es soll 35B Parameter haben. Das ist das eigentliche Produkt.
Das Dreifache des Index, und keine vergleichbare Kostenangabe
Artificial Analysis veranschlagt Solar Mini 4 mit 0,36 $ pro abgeschlossener Index-Aufgabe, gegenüber 0,006 $ für Granite 4.2 3B, und die LFM2.5 2.6B Generation wird mit null bepreist, sodass keine Kosten-pro-Aufgabe-Zahl existiert, die daraus ein faires Verhältnis machen würde. Die Formulierung „Solar Mini 4 kostet um ein Vielfaches mehr als LFM2.5 2.6B Base“ ist daher wahr und geht leicht am Thema vorbei. Die relevante Frage ist, ob die koreanischsprachige, auf lange Dokumente ausgerichtete, strukturierte Extraktionsarbeit, für die Solar Mini 4 gebaut ist, überhaupt von einem vortrainierten 2,69B-Checkpoint geleistet werden kann. Üblicherweise kann sie das nicht, und dann lautet der Vergleich Solar Mini 4 gegen einen Frontier-Generalisten statt Solar Mini 4 gegen ein Telefonmodell.
Der Fall, in dem LFM2.5 2.6B Base gewinnt, ist nicht der Fall, in dem es günstiger ist. Es ist der Fall, in dem die Aufgabe eng genug ist, dass Fine-Tuning die Lücke schließt. Strukturierte Feldextraktion aus einem bekannten Dokumentformat, Klassifizierung anhand einer festen Taxonomie, ein On-Device-Assistent, der ohne Netzwerk funktionieren muss – das sind Aufgaben, bei denen ein 2.69B-Checkpoint plus Ihre eigenen Trainingsdaten einen 35B-Generalisten plus eine Preisliste schlägt und eine GPU-Instanz statt eines Token-Zählers kostet. Liquid liefert den Basis-Checkpoint mit Continued-Pretraining-, LoRA-SFT-, DPO- und GRPO-Rezepten über Unsloth und TRL genau für diese Vorgehensweise.
Welchen anrufen?
Greifen Sie zu Solar Mini 4, wenn der Input lang ist, der Output erschlossen werden muss und der Sprachenmix Koreanisch oder Japanisch umfasst – und wenn sieben Minuten Decodierung pro schwieriger Aufgabe vertretbar sind. Greifen Sie zu LFM2.5 2.6B Base, wenn die Gewichte Ihnen gehören müssen, das Gerät kein Netzwerk hat und die Aufgabe eng genug für ein Fine-Tuning ist. Die interessanten Deployments nutzen beides, denn sie sind keine Alternativen: Ein kleines lokales Modell übernimmt Routing, Schwärzung und Extraktion, und ein gehostetes Modell wird nur für den Bruchteil der Anfragen aufgerufen, die tatsächlich 35B Parameter benötigten.
Liquids Modell ist nicht auf OrcaRouter, und das von Upstage auch nicht, also ist keine der beiden Routen etwas, das wir Ihnen verkaufen können. Was wir tun können, ist der Teil, der diesen Vergleich von einer Entscheidung in eine Konfiguration verwandelt: mehr als 200 Modelle mit einem Schlüssel bei 0 % Aufschlag auf den Listenpreis des Anbieters, mit automatischem Failover über Anbieter hinweg und eine Routing-DSL, mit der Sie mehrere Modelle zu einem einzigen Aufruf kombinieren können. Wenn die richtige Antwort „das Günstige die meiste Zeit und das Gute, wenn es darauf ankommt“, lautet, dann ist das ein Routing-Problem, und es ist der Grund, warum die Routing-DSL existiert.

Die Zahl, die kein Anbieter auf eine Folie schreiben wird
Latenz. Solar Mini 4 verbraucht 88.300 Ausgabe-Tokens pro Intelligence-Index-Aufgabe bei gemessenen 204 Tokens pro Sekunde, sodass es durchschnittlich 430 Sekunden – etwas mehr als sieben Minuten – für jede schwierige Aufgabe benötigte. Die LFM2.5 2.6B Generation lief auf dem von Artificial Analysis getesteten Host mit 45,7 Tokens pro Sekunde und einer Wartezeit von 2,8 Sekunden auf den ersten Chunk, aber das ist ein Rechenzentrums-Host, der mit einem Modell spricht, das normalerweise auf Ihrem Schreibtisch laufen würde. Liquids eigene Messungen beziffern dieselbe Architektur auf 220 Tokens pro Sekunde auf einem M5 Max, 113 auf einem Ryzen AI Max+ 395 und etwa 30 Tokens pro Sekunde auf einem Telefon – was einen brauchbaren Agenten-Loop auf einem Gerät ohne Netzwerk darstellt.
Wenn Ihre Workload interaktiv ist, ist der Vergleich eindeutig, und kein Benchmark-Score wird daran etwas ändern. Wenn Ihre Workload Batch ist und das, was wartet, ein Cron-Job ist, sind sieben Minuten in Ordnung, und die Reasoning-Tiefe ist es wert.

Zum Schluss zwei Anmerkungen zur Quellenlage. Jeder hier genannte Wert von Artificial Analysis ist die unabhängige Messung dieser Organisation auf einer gemeinsamen Testsuite; der LFM2.5 2.6B-Index ist ausdrücklich eine Schätzung und bezieht sich auf das nachtrainierte Modell statt auf den oben genannten vortrainierten Base-Checkpoint. Jeder Wert von Liquid AI ist ein eigener Lauf des Anbieters auf dessen eigenen Benchmarks, nicht reproduziert – und der Base-Checkpoint selbst hat überhaupt keine veröffentlichten Scores, was eine Tatsache über vortrainierte Modelle ist und keine Kritik an diesem.
