
Ember-1 vs LFM2.5 2.6B Base: Ett färdigt beteende mot ett rått substrat
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 177 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
Varken Ember-1 eller LFM2.5 2.6B Base är en modell som man bara kan ta och använda, och de är oanvändbara av motsatta skäl. Ember-1, publicerad av Fireworks Research den 23 september 2026, är en specialiserad derivatmodell av Moonshot AI:s Kimi K3 som labbet tränade om för att nå K3:s noggrannhet med ungefär 40 % färre tokens – ett färdigt beteende, endast tillgängligt som en forskningsförhandsvisning på leverantörens egen serverlösa plattform, utan vikter och utan publicerat pris. LFM2.5 2.6B Base, publicerad av Liquid AI den 4 augusti 2026, är en förtränad checkpoint med 2,69 miljarder parametrar under LFM Open License v1.0 som inte alls har instruktionstränats och kommer att fortsätta din text i stället för att besvara din fråga – ett rått substrat, nedladdningsbart i dag, medvetet ofärdigt. Att läsa dem sida vid sida är ett bra sätt att se de två argument som framförs om varifrån effektivitetsvinsterna nu kommer.
Frågan som båda modellerna besvarar
Båda lanseringarna utgår från samma premiss: att de enkla vinsterna med att göra en modell större till stor del redan har skördats, och att det intressanta arbetet har flyttat till hur en modell använder det den redan har. De två labben svarar olika på det. Fireworks Research tog en befintlig frontiermodell och ändrade dess beteende. Liquid AI byggde en liten modell från grunden och ändrade skalan. Ingen av dem är en berättelse om ny arkitektur, och ingen av dem försöker nå toppen av en resultattavla.
Ember-1:s svar: behåll modellen, träna om beteendet
Ember-1 lämnar Kimi K3:s arkitektur i fred och angriper en specifik ineffektivitet. Resonemangsmodeller kan bränna mer än 90 % av sina genererade tokens på intern överläggning, och i en multi-turn-agentloop spelas dessa spår upp och debiteras igen varje efterföljande tur – Fireworks Research beskriver den resulterande kontexttillväxten som ungefär kvadratisk i antalet turer. Labbets påstående är att K3:s resonemang är längre än uppgiften kräver och att överskottet kan tas bort utan att svaren ändras. Det rapporteras ha kört fler än 50 träningsexperiment och över 200 utvärderingar på sin egen serverlösa träningsstack, och säger att resonemangslängden sjönk med 35–50 % utan noggrannhetsförlust över sju benchmarks och två kunders produktionsdatamängder. Allt detta är leverantörsrapporterat och oreproducerat.
Resultaten är ojämna på ett sätt som rubriknumret döljer. Ember-1:s tokenreduktioner sträcker sig från 51,9 % på Terminal Bench 2.1 till 5,9 % på τ-2 Bench Airline. I en kunds produktions-A/B för kodning sjönk utdatatokens från 49,3K till 29,9K medan poängen låg kvar på 0,753 mot 0,751 – en minskning av resonemangstoken med 71,3 %. Det är en stor effekt på en typ av arbetsbelastning och en nästan osynlig sådan på en annan, vilket är vad man kan förvänta sig av en modell som tränats att sluta övertänka snarare än att tänka mindre.

LFM2.5 2.6B Base:s svar: ändra skalan, behåll receptet
LFM2.5 2.6B Base är en annan sorts satsning. Det är Liquid AI:s hybridarkitektur i liten skala: 30 lager, varav 22 är dubbelgrindade kortkonvolutionsblock och 8 är grupperade query-attention-lager, tränad på cirka 34 biljoner token på 16 språk, med ett kontextfönster på 131 072 token. Hela checkpointen är 2,69 miljarder densa parametrar – tillräckligt liten för att diskussionen om kostnad ska sluta handla om token och börja handla om vilken enskild GPU du har över.
Det som gör den ovanlig är vad den medvetet inte gör. Det finns ingen instruktionsträning, vilket är hela poängen med suffixet "Base": ge den en fråga och den fortsätter texten i frågans stil i stället för att besvara den. Liquid AI:s eget modellkort rekommenderar den för uppgifter som kräver tung finjustering. Det finns inte heller någon publicerad utvärdering av den, och det är inte ett förbiseende – att utvärdera en bascheckpoint på riktmärken för instruktionsföljning skulle inte mäta någonting, eftersom det beteende som mäts ännu inte har tränats in.
Kontrasten, en rad per dimension
• Vad det är — Ember-1: en omtränad derivata av Kimi K3 med förkortat resonemang. LFM2.5 2.6B Base: en från grunden förtränad checkpoint utan instruktionstrimning.
• Parametrar — Ember-1: ej angivna; ärvda från Kimi K3. LFM2.5 2.6B Base: 2,69B dense.
• Vikter — Ember-1: inga publicerade. LFM2.5 2.6B Base: tillgänglig under LFM Open License v1.0.
• Pris — Ember-1: inget publicerat; benchmark-siffror i dollar utgår från Kimi K3:s prislista. LFM2.5 2.6B Base: gratis att ladda ner; du tillhandahåller hårdvaran.
• Kontext — Ember-1: inte publicerad för förhandsvisningen. LFM2.5 2.6B Base: 131 072 tokens.
• Publicerad utvärdering – Ember-1: sju benchmarks och två A/B-tester, alla utförda av leverantören. LFM2.5 2.6B Base: inga, avsiktligt.
• Det du får i slutändan — Ember-1: en slutpunkt som producerar kortare resonemang med K3-nivåns noggrannhet. LFM2.5 2.6B Base: en utgångspunkt vars beteende är vad du än tränar in i den.
Två olika typer av saknad
Luckorna i dessa två utgåvor ser symmetriska ut och är det inte. Den saknade utvärderingen av LFM2.5 2.6B Base är en egenskap hos artefakten: en bascheckpoint har inget beteende att poängsätta, och den saknade instruktionsfinjusteringen är en dokumenterad funktion snarare än en brist. Frånvaron skapar inte kommersiell osäkerhet, eftersom det du köper är en fil med en licens bifogad, och leveransen är komplett i samma stund som nedladdningen slutförs.
Ember-1:s saknade delar är verkligen olösta. Det finns inget publicerat pris, så kostnadspåståendet är aritmetik utifrån Kimi K3:s prislista snarare än ett pris du kan budgetera mot. Det finns inget släpp av modellvikter, så modellens livslängd kan inte överstiga leverantörens beslut att fortsätta tillhandahålla den. Och åtkomstfönstret beskrivs som tillfälligt: Fireworks Research beskriver sina forskningssläpp som två veckor långa serverlösa fönster vars beständighet beror på efterfrågan från communityt. En förhandsvisning som kanske inte finns nästa månad är en annan sak än en förhandsvisning som bara är obevisad, och den andra kund-A/B-testningen i tillkännagivandet – ungefär 35 % färre tokens per uppgift – säger vad labbet förväntar sig, inte vad som fortfarande kommer att vara nåbart i november.
Den asymmetrin är det ärliga svaret på ”vilken av dessa är mer redo”. Ingen av dem är redo i bemärkelsen att vara ett produktionsberoende som kan sättas in direkt. LFM2.5 2.6B Base är färdig som råmaterial och ofärdig som modell. Ember-1 är färdig som modell och ofärdig som tjänst.

Vad du ska göra med var och en det här kvartalet
Om du har en pipeline för finjustering och en snäv uppgift med rena etiketter är LFM2.5 2.6B Base det mer förutsägbara av de två. Checkpointen är liten, licensen är tillåtande, arkitekturen är utformad för att vara effektiv vid inferens, och arbetet med att göra den till något användbart – övervakad finjustering, en utvärderingsuppsättning, en serving-stack – är arbete du redan äger från början till slut. Du kommer att köra dina egna utvärderingar hur som helst, eftersom Liquid AI inte publicerade några.
Om du har en hostad agent-arbetsbelastning vars räkning domineras av resonemangstokens, så adresserar Ember-1 en verklig term i din kostnadsekvation, och det är värt de två veckorna. Rätt test är skuggtrafik mot din befintliga lösning: skicka en andel av verkliga förfrågningar till båda, jämför utdata, rör inte live-resultaten. Det är också rådet som oberoende kritisk bevakning av lanseringen gav, tillsammans med en rimlig varning — att komprimera överläggning riskerar att tappa ett steg som modellen behövde, och i en agent visar det sig senare som ett felaktigt verktygsanrop snarare än en felaktig mening.
Ingen av modellerna finns på OrcaRouter. Om du vill testa mönstret snarare än dessa två artefakter – en liten finjusterbar modell och en stor hostad resonemangsmodell i en och samma pipeline – är det precis vad routnings-DSL:en är till för: komponera flera modeller till ett enda anrop och låt var och en hantera den del den är bra på, bakom en nyckel och en faktura. Jämförelsen här är värd att göra på arkitekturnivå även medan båda de specifika slutpunkterna förblir utom räckhåll.
Traden, sagt en gång
Ember-1 säljer säkerhet i beteende och osäkerhet i utbud: en modell vars kvalitet noggrant argumenteras för och vars tillgänglighet uttryckligen är villkorad. LFM2.5 2.6B Base säljer säkerhet i utbud och osäkerhet i beteende: en fil du alltid kommer att ha och vars kompetens helt och hållet är en funktion av den träning du lägger in i den. Team med ett serveringsproblem och ingen träningskapacitet bör titta på förhandsvisningen och hoppas att den blir permanent. Team med träningskapacitet och en smal uppgift bör ladda ner basen och sluta vänta på någons färdplan.

Vad parkopplingen egentligen visar är att "effektivitet" har slutat betyda en enda sak. För Ember-1 innebär det färre tokens med samma kvalitet på någon annans hårdvara. För LFM2.5 2.6B Base innebär det en tillräckligt liten modell för att hårdvaran inte längre ska vara någon annans alls. Båda är bra svar, och de är inte utbytbara.
