
Ember-1 vs. LFM2.5 2.6B Base: Ein fertig ausgebildetes Verhalten gegenüber einem rohen Substrat
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Weder Ember-1 noch LFM2.5 2.6B Base ist ein Modell, das man einfach nehmen und verwenden kann, und sie sind aus entgegengesetzten Gründen unbrauchbar. Ember-1, veröffentlicht von Fireworks Research am 23. September 2026, ist ein spezialisiertes Derivat des Kimi K3 von Moonshot AI, das das Labor neu trainiert hat, um die Genauigkeit von K3 mit etwa 40 % weniger Tokens zu erreichen — ein fertiges Verhalten, das nur als Forschungsvorschau auf der eigenen serverlosen Plattform des Anbieters verfügbar ist, ohne Gewichte und ohne veröffentlichten Preis. LFM2.5 2.6B Base, veröffentlicht von Liquid AI am 4. August 2026, ist ein vortrainierter Checkpoint mit 2,69B Parametern unter der LFM Open License v1.0, der überhaupt nicht instruktionsoptimiert wurde und Ihren Text fortsetzen wird, anstatt Ihre Frage zu beantworten — ein rohes Substrat, heute herunterladbar, bewusst unfertig. Sie nebeneinander zu lesen ist eine gute Möglichkeit, die beiden Argumente zu sehen, die darüber gemacht werden, woher die Effizienzgewinne jetzt kommen.
Die Frage, die beide Modelle beantworten
Beide Veröffentlichungen gehen von derselben Prämisse aus: dass die billigen Erfolge durch das Vergrößern eines Modells weitgehend abgeschöpft sind und dass die interessante Arbeit sich dahin verlagert hat, wie ein Modell das einsetzt, was es bereits hat. Die beiden Labore antworten darauf unterschiedlich. Fireworks Research nahm ein bestehendes Frontier-Modell und änderte dessen Verhalten. Liquid AI baute ein kleines Modell von Grund auf und änderte den Maßstab. Bei keiner der beiden geht es um eine neue Architektur, und keine versucht, an der Spitze einer Bestenliste zu landen.
Antwort von Ember-1: Modell behalten, Verhalten neu trainieren
Ember-1 lässt die Architektur von Kimi K3 unangetastet und greift eine bestimmte Ineffizienz an. Reasoning-Modelle können mehr als 90 % ihrer generierten Tokens für interne Abwägungen verbrauchen, und in einer mehrzügigen Agentenschleife werden diese Spuren bei jedem folgenden Zug erneut abgespielt und erneut abgerechnet – Fireworks Research beschreibt das daraus resultierende Kontextwachstum als ungefähr quadratisch in der Anzahl der Züge. Die Behauptung des Labors ist, dass K3s Reasoning länger ist als für die Aufgabe nötig und dass der Überschuss entfernt werden kann, ohne die Antworten zu verändern. Es berichtet, mehr als 50 Trainingsexperimente und über 200 Evaluierungen auf seinem eigenen serverlosen Trainings-Stack durchgeführt zu haben, und sagt, die Reasoning-Länge sei um 35–50 % gesunken, ohne Genauigkeitsverlust über sieben Benchmarks und zwei Produktionsverkehrsdatensätze von Kunden hinweg. All das ist vom Anbieter berichtet und nicht reproduziert.
Die Ergebnisse sind uneinheitlich, und die Schlagzeile verdeckt das. Ember-1s Token-Reduzierungen reichen von 51,9 % bei Terminal Bench 2.1 bis 5,9 % bei τ-2 Bench Airline. In einem Produktions-Coding-A/B-Test eines Kunden sanken die Output-Tokens von 49,3K auf 29,9K, während der Score mit 0,753 gegenüber 0,751 gehalten wurde – eine Reduktion der Reasoning-Tokens um 71,3 %. Das ist ein großer Effekt bei einer Workload-Form und ein nahezu unsichtbarer bei einer anderen, was man von einem Modell erwarten würde, das darauf trainiert wurde, mit dem Überdenken aufzuhören, statt weniger zu denken.

Antwort von LFM2.5 2.6B Base: Skalierung ändern, Rezept beibehalten
LFM2.5 2.6B Base ist eine andere Art von Wette. Sie ist die Hybridarchitektur von Liquid AI im kleinen Maßstab: 30 Schichten, von denen 22 doppelt gegatete Short-Convolution-Blöcke und 8 Grouped-Query-Attention-Schichten sind, trainiert auf rund 34 Billionen Token über 16 Sprachen hinweg, mit einem Kontextfenster von 131.072 Token. Der gesamte Checkpoint umfasst 2,69B dichte Parameter – klein genug, dass sich die Diskussion über Kosten nicht mehr um Token dreht, sondern darum, welche einzelne GPU man noch übrig hat.
Das Ungewöhnliche daran ist, was es bewusst nicht tut. Es gibt kein Instruction-Tuning, und genau das ist der Sinn des Suffixes „Base“: Gib ihm eine Frage, und es setzt den Text im Stil der Frage fort, statt sie zu beantworten. Die eigene Model Card von Liquid AI empfiehlt es für Aufgaben, die umfangreiches Fine-Tuning erfordern. Es gibt außerdem keine veröffentlichte Evaluierung davon, und das ist kein Versehen – einen Base-Checkpoint anhand von Instruction-Following-Benchmarks zu evaluieren, würde nichts messen, weil das gemessene Verhalten noch nicht antrainiert wurde.
Der Kontrast, eine Zeile pro Dimension
• Was es ist — Ember-1: ein retrainiertes Derivat von Kimi K3 mit verkürztem Reasoning. LFM2.5 2.6B Base: ein von Grund auf vortrainierter Checkpoint ohne Instruction-Tuning.
• Parameter — Ember-1: nicht offengelegt; übernommen von Kimi K3. LFM2.5 2.6B Base: 2,69B dense.
• Gewichte — Ember-1: keine veröffentlicht. LFM2.5 2.6B Base: verfügbar unter der LFM Open License v1.0.
• Preis — Ember-1: keine veröffentlicht; für Benchmark-Dollar wird die Preisliste von Kimi K3 verwendet. LFM2.5 2.6B Base: kostenlos zum Herunterladen; die Hardware stellen Sie selbst.
• Kontext — Ember-1: nicht für die Vorschau veröffentlicht. LFM2.5 2.6B Base: 131.072 Token.
• Veröffentlichte Evaluierung — Ember-1: sieben Benchmarks und zwei A/B-Tests, alle vom Anbieter durchgeführt. LFM2.5 2.6B Base: keine, bewusst.
• Was Sie am Ende erhalten — Ember-1: ein Endpunkt, der kürzere Schlussfolgerungen mit Genauigkeit auf K3-Niveau erzeugt. LFM2.5 2.6B Base: ein Ausgangspunkt, dessen Verhalten genau das ist, was Sie ihm antrainieren.
Zwei verschiedene Arten des Fehlenden
Die Lücken in diesen beiden Releases wirken symmetrisch, sind es aber nicht. Die fehlende Evaluation von LFM2.5 2.6B Base ist eine Eigenschaft des Artefakts: Ein Base-Checkpoint hat kein Verhalten, das bewertet werden könnte, und das fehlende Instruction-Tuning ist ein dokumentiertes Merkmal und kein Mangel. Das Fehlen erzeugt keine kommerzielle Unsicherheit, denn was Sie kaufen, ist eine Datei mit einer beigefügten Lizenz, und das Lieferergebnis ist vollständig, sobald der Download abgeschlossen ist.
Die fehlenden Teile von Ember-1 sind wirklich ungelöst. Es gibt keinen veröffentlichten Preis, die Kostenbehauptung ist also reine Rechnerei anhand der Preisliste von Kimi K3 und kein Satz, auf den man ein Budget stützen kann. Es gibt keine Veröffentlichung der Gewichte, also kann das Modell nicht über die Entscheidung des Anbieters hinaus Bestand haben, es weiterhin bereitzustellen. Und das Zugriffsfenster wird als vorübergehend beschrieben: Fireworks Research beschreibt seine Forschungsveröffentlichungen als zweiwöchige serverlose Fenster, deren Fortbestand von der Nachfrage aus der Community abhängt. Eine Vorschau, die es nächsten Monat möglicherweise nicht mehr gibt, ist etwas anderes als eine Vorschau, die lediglich unbewiesen ist, und der zweite Kunden-A/B-Test in der Ankündigung – rund 35 % weniger Tokens pro Aufgabe – sagt Ihnen, was das Labor erwartet, nicht, was im November noch erreichbar sein wird.
Diese Asymmetrie ist die ehrliche Antwort auf die Frage „Welche von diesen ist eher bereit?“ Keines von beiden ist in dem Sinne bereit, dass es sich als direkt einsetzbare Produktionsabhängigkeit verwenden ließe. LFM2.5 2.6B Base ist als Rohmaterial fertig und als Modell unfertig. Ember-1 ist als Modell fertig und als Dienst unfertig.

Was in diesem Quartal mit jedem zu tun ist
Wenn Sie eine Fine-Tuning-Pipeline und eine eng umrissene Aufgabe mit sauberen Labels haben, ist LFM2.5 2.6B Base die berechenbarere der beiden. Der Checkpoint ist klein, die Lizenz ist permissiv, die Architektur ist auf effiziente Inferenz ausgelegt, und die Arbeit, daraus etwas Nützliches zu machen – überwachtes Fine-Tuning, ein Evaluationsset, ein Serving-Stack –, ist Arbeit, die Sie bereits vollständig selbst verantworten. Sie werden so oder so Ihre eigenen Evals durchführen, denn Liquid AI hat keine veröffentlicht.
Wenn Sie eine gehostete Agent-Workload haben, deren Rechnung von Reasoning-Tokens dominiert wird, adressiert Ember-1 einen realen Posten in Ihrer Kostengleichung, und es ist die zwei Wochen wert. Der richtige Test ist Shadow-Traffic gegen Ihren bisherigen Anbieter: Senden Sie einen Teil der echten Anfragen an beide, vergleichen Sie die Ausgaben, lassen Sie Live-Ergebnisse unangetastet. Das ist auch der Rat, den unabhängige kritische Berichterstattung über das Release gab, zusammen mit einer fairen Warnung — das Komprimieren von Abwägung riskiert, einen Schritt zu verlieren, den das Modell brauchte, und bei einem Agenten zeigt sich das später als ein falscher Tool-Aufruf statt als ein falscher Satz.
Keines der beiden Modelle ist auf OrcaRouter verfügbar. Wenn Sie das Muster testen möchten statt diese beiden Artefakte – ein kleines feinabstimmbares Modell und ein großer gehosteter Reasoner in einer Pipeline –, dann ist genau dafür die Routing-DSL da: mehrere Modelle zu einem einzigen Aufruf zusammensetzen und jedes den Teil übernehmen lassen, in dem es gut ist, hinter einem Schlüssel und einer Rechnung. Der Vergleich lohnt sich hier auf der Architekturebene, auch wenn beide konkreten Endpunkte weiterhin außer Reichweite bleiben.
Der Handel, einmal genannt
Ember-1 verkauft Sicherheit des Verhaltens und Unsicherheit der Verfügbarkeit: ein Modell, dessen Qualität sorgfältig begründet wird und dessen Verfügbarkeit ausdrücklich bedingt ist. LFM2.5 2.6B Base verkauft Sicherheit der Verfügbarkeit und Unsicherheit des Verhaltens: eine Datei, die Sie immer haben werden und deren Kompetenz vollständig eine Funktion des Trainings ist, das Sie hineinstecken. Teams mit einem Serving-Problem und ohne Trainingskapazität sollten die Preview im Auge behalten und hoffen, dass sie dauerhaft wird. Teams mit Trainingskapazität und einer eng umrissenen Aufgabe sollten die Base herunterladen und aufhören, auf irgendjemandes Roadmap zu warten.

Was die Gegenüberstellung wirklich zeigt, ist, dass „Effizienz“ nicht mehr nur eines bedeutet. Für Ember-1 bedeutet es weniger Tokens bei gleicher Qualität auf der Hardware von jemand anderem. Für LFM2.5 2.6B Base bedeutet es ein ausreichend kleines Modell, dass die Hardware überhaupt nicht mehr die von jemand anderem ist. Das sind beides gute Antworten, und sie sind nicht austauschbar.
