
ARTEMIS vs LFM2.5-2.6B-Base: checkpointen som inte klarar jobbet, och testramverket som behöver den för att göra det
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Fyra punkter finns på Googles ARTEMIS-färdplan, och exakt en av dem kräver en modell som uppenbarligen ännu inte existerar: lättviktiga vision-språkmodeller på enheten, för automatisering med låg latens och integritet i första hand. Den självklara kandidaten för ett sådant jobb är något i storleksklassen LFM2.5-2.6B-Base – Liquid AI:s förtränade checkpoint med 2,69 miljarder parametrar, publicerad som öppna vikter med en kontext på 131 072 tokens och ett avtryck litet nog för en telefon. Den är också, i levererat skick, oförmögen att fylla den platsen, och anledningarna är värda att förstå innan någon ställer de två i en jämförelsetabell. Googles ARTEMIS är ett Android-automatiseringsramverk för naturligt språk, med öppen källkod under Apache 2.0 i augusti 2026, som styr en riktig telefon via ADB och uppger en slutförandegrad på över 99 % i Google Researchs AndroidWorld-benchmark. LFM2.5-2.6B-Base är rått förtränat material utan instruktionsträning, utan chattmall och – medvetet – utan publicerade benchmarkresultat, avsett för team som själva ska efterträna den. Den ena är färdig programvara med ett oavslutat modellproblem. Den andra är oavslutade vikter med ett avslutat licensproblem. Ingen av dem är en ersättning för den andra, och platsen där de verkligen möts är inte den plats du skulle gissa.
Vad LFM2.5-2.6B-Base egentligen är
Ta bort varumärket, och det är en noggrant uppbyggd grund för arbete på enheten, med specifikationer som låter som om någon har optimerat för minnesbandbredd snarare än placering på en resultattavla.
• Storlek — 2,69 miljarder parametrar i bfloat16 i en enda shard på ~5,39 GB, marknadsförd som "2.6B".
• Arkitektur — 30 lager i en hybrid uppdelning: 22 dubbelgrindade kortkonvolutionsblock över 8 grupperade query-attentionslager, dold bredd 2048, 32 attention-huvuden mot 8 KV-huvuden, bundna inbäddningar. Samma code>Lfm2ForCausalLM/code> klass som föregående generation, så ingen anpassad modelleringskod krävs.
• Träning — ungefär 34 biljoner tokens, med en dedikerad mitträningfas för kontextutökning.
• Vokabulär — 128 000 tokens, dubbelt så många i den här generationen för att bättre hantera icke-latinska skriftsystem. Cirka 262 miljoner parametrar, ungefär en tiondel av modellen, finns i den bundna inbäddningen.
• Kontext — modellkortet och konfigurationen stämmer inte överens här, och det är värt att veta: dokumentationen uppger 131 072 tokens medan code>config.json/code> anger code>max_position_embeddings/code> till 128 000. Budgetera för 128K och behandla allt över det som overifierat.
• Språk — sexton: engelska, arabiska, kinesiska, franska, tyska, hindi, indonesiska, italienska, japanska, koreanska, polska, portugisiska, ryska, spanska, thailändska, vietnamesiska.
• Riktmärken — inga. Liquid publicerar ingen utvärdering av bascheckpointen, och modellkortet framställer utelämnandet som avsiktligt: denna artefakt finns för att eftertränas, inte för att mätas i sitt råa tillstånd.
Den sista raden är hela poängen med lanseringen, och den är också anledningen till att en "X vs LFM2.5-2.6B-Base"-jämförelse måste hanteras försiktigt. En bascheckpunkt har ingen åsikt om någonting. Be den planera ett Android-arbetsflöde och den fortsätter din text probabilistiskt, eftersom den aldrig har tränats att svara. Kortet rekommenderar den bara för fall som kräver omfattande finjustering: en språkspecifik assistent, en domänspecifik sådan inom en reglerad sektor, träning på proprietär data eller som en destillationselev. För allt som fungerar direkt ur lådan, inklusive verktygsanrop, hänvisar Liquid dig till den eftertränade LFM2.5-2.6B i stället.

Vad ARTEMIS behöver från en modell, vilket inte är vad en bascheckpoint erbjuder
ARTEMIS är en reglerslinga med två lägen. Flash är en reaktiv observera-och-agera-cykel på ungefär 3–5 sekunder per steg. Pro är en multiagentgraf på ungefär 15–40 sekunder per steg, med en Planerare som håller en levande Markdown-plan, en Operatör med den fullständiga verktygsuppsättningen och en skrivskyddad Kontrollant som verifierar kontrollpunkter på fyra nivåer från code>off/code> till code>strict/code>. Båda lägena ber samma sak av den underliggande modellen: titta på en skärmbild, välj en åtgärd från en fast verktygsuppsättning och gör om det igen inom en sekund eller två, hundra gånger, utan att tappa tråden.
Det är en krävande uppgift – att följa instruktioner enligt ett strikt schema, förankrad visuell förståelse och koherens över långa horisonter – och det är precis den uppsättning färdigheter som en bascheckpoint inte har fått. ARTEMIS egna testade backends är hostade modeller: Gemini, Claude, GPT-4o, Qwen-VL. Var och en av dem är instruktionstränad för verktygsanvändning, och var och en av dem är stor.
Så gapet handlar inte om storlek. En eftertränad modell på 2,6B kan hålla en verktygsanropsloop – Liquids egen eftertränade syskonmodell uppges överträffa Gemma 4 E2B-it och E4B-it i samtliga av sina utvärderingar av instruktionsföljning och nästan alla av sina utvärderingar av verktygsanvändning, även om det är siffror som leverantören själv rapporterat utan oberoende verifiering. Gapet är att en bascheckpoint inte har fått någon av den träningen tillämpad, så den kan inte alls stoppas in i ett testramverk.
Licensen är den skarpare skillnaden
Det är här matchen faktiskt avgörs, och det är den delen som de flesta jämförelser hoppar över.
• ARTEMIS — Apache 2.0. Använd det kommersiellt, forka det, leverera det inuti en produkt, inget intäktsvillkor. Den enda skyldigheten är att bevara meddelanden och ange dina ändringar, en skyldighet som projektet självt tvingades åtgärda offentligt i september 2026 efter att Minitap hävdade att 228 av ARTEMIS 229 filer matchade dess eget Apache-2.0 code>mobile-use/code>-projektet och att författarnamn hade tagits bort genom force-push. Repositoriet innehåller nu en kreditrad till Minitap.
• LFM2.5-2.6B-Base — LFM Open License, en anpassad licens snarare än Apache eller MIT. Under 10 miljoner USD i årliga intäkter är beviljandet brett, evigt och royaltyfritt. Vid eller över den tröskeln omfattar licensen inte kommersiell användning alls, och du måste kontakta Liquid. Den viktiga detaljen för alla som bygger på den: derivatverk ärver samma villkor. Checkpointen du eftertränar är inte något nytt som du äger helt och hållet — den för den intäktsvillkorade licensen vidare, med ett undantag för kvalificerade ideella organisationer.
Sätter man de två fakta bredvid varandra inverteras beslutet beroende på vem du är. Ett finansierat företag som vill leverera en telefonbaserad agent har ett Apache-2.0-testramverk som det fritt kan använda och en checkpoint som det kanske inte kan använda kommersiellt över huvud taget. En enskild utvecklare eller en startup under tröskeln har båda, och licensen är en fotnot. Ingen av leverantörerna agerar orimligt — Liquid är ett företag som skyddar sin kommersiella nivå, Google gör testverktyg till öppen källkod — men "öppna vikter" och "öppna vikter" är inte samma tillåtelse, och en jämförelse som stannar vid parameterantal kommer inte att tala om för dig vilken du har.

Familjen, eftersom bascheckpointen är fel dörr in i den
Om målet är en Android-agent på enheten spelar tre syskon större roll än basen, och den som ARTEMIS-färdplanen faktiskt behöver är inte den uppenbara.
• LFM2.5-2.6B — den eftertränade agentiska syskonmodellen. Leverantörens rapporterade genomströmning är cirka 30 tokens per sekund på hårdvara i telefonklass, 113 på en Ryzen AI Max+ 395 och 220 på en Apple M5 Max, och körs på under 2,5 GB.
• LFM2.5-VL-3B — edge-modellen för vision och språk, byggd på samma bas med en SigLIP2 400M NaFlex-kodare, med tillverkarens rapporterade grounding-precision@1 höjd från 57,1 till 87,9 på RefCOCO och, enligt Liquid, prestanda på UI-element på skärmen som slår mycket större Gemma-modeller och ligger inom 0,7 % av en 4,7B Qwen 3.5. Overifierat, men det är den enda medlemmen i den här familjen som kan se en skärm.
• LFM2.5-230M — extraherings- och klassificeringsnivån, rekommenderas uttryckligen inte för resonemangstungt arbete.
Vilken är den obekväma slutsatsen för bascheckpointen i den här matchningen: ARTEMIS:s roadmap-post är ett visionskrav, basen är endast text, och familjemedlemmen som fyller platsen är VL-varianten som redan har fått både visionskodaren och efterträningen applicerade. Bascheckpointens roll i en Android-automatiseringsstack är inte att styra telefonen. Den ska vara råmaterialet under vilken liten modell som helst som så småningom gör det.
Där de faktiskt möts: svänghjulet som ingen ännu har byggt
Här är den enda kopplingen som är verklig snarare än retorisk, och den går baklänges från den vanliga riktningen. ARTEMIS mest underskattade funktion är inte agenten — det är avgaserna. Varje körning fångar kraschstackar, skärmbilder av nyckelbilder, en sessionsliggare över komprimerade steg och en diagnostikrapport, och Pro öppnar en "exekveringsincident" när en åtgärd misslyckas och håller den i kontexten tills ett senare lyckat resultat löser den. Det är ett etiketterat korpus av precis de ögonblick där en UI-agents uppfattning var fel.
Kombinera det med en checkpoint vars hela syfte är efterträning och du har en uppenbar loop: kör testramverket på en hostad modell, samla in spåren där den snubblade på din app och finjustera en 2,6B-modell på just dessa frames. Det är den typ av proprietära dataset som Liquids eget modellkort anger som motiveringen till att överhuvudtaget släppa en bas-checkpoint – ”träning på dina egna data” – och den intäktsgränsade licensen innebär att det är en väg som är rimlig för team under tröskeln och kräver ett samtal för team över den.
För att vara tydlig om statusen för den idén: ingen har publicerat denna loop, ingen av leverantörerna föreslår den, och det finns inga bevis för att någon av sidorna har testat den. Det är ett förslag, inte ett resultat, och det bör läsas som ett sådant. Men det är den enda inramning där dessa två artefakter är samarbetspartners snarare än ett kategorimisstag.
Om du kommer så långt som till finjustering är jämförelseuppsättningen den andra halvan av problemet. LFM2.5-2.6B-Base finns inte i vår katalog – ingen LFM2.5-variant gör det – så den checkpointen kommer från Liquids egen distribution och de vanliga tredjepartsvärdarna. Där en routad katalog förtjänar sin plats är när du benchmarkar din finjustering mot de modeller som den måste slå när det gäller verktygsanvändning, med en nyckel och en faktura, med failover så att en leverantörs dåliga eftermiddag inte blir din utvärderings dåliga eftermiddag. Det är en genuint användbar sak att ha när hela poängen med övningen är en direkt jämförelse som du tänker agera utifrån.

Så vilket av dem är ditt problem?
Om du har en Android-app och vill få den testad automatiskt det här kvartalet, vill du ha ARTEMIS, och LFM2.5-2.6B-Base är inte en del av svaret — du kommer att köra ARTEMIS mot en hostad visionsmodell, betala per steg, och roadmap-punkten om VLM:er på enheten kommer så småningom och löser ett kostnadsproblem som du ännu inte har mätt.
Om du bygger en produkt som måste köras på en handenhet utan nätverk vill du ta småmodellvägen, och LFM2.5-2.6B-Base är början på det projektet snarare än någon del av dess lösning: du kommer att efterträna den, du kommer att läsa LFM Open License mot din intäktsprognos innan du skriver det första träningsskriptet, och om din agent behöver se en skärm kommer du i stället att hamna på VL-varianten.
Det enda man inte ska göra är att ställa dessa två sida vid sida, hävda att harnessen är mer kapabel och gå vidare. Den användbara jämförelsen är mellan de två kompletta stackarna – hostad modell plus harness, kontra finjusterad liten modell plus ett ramverk du bygger – och bara en av dem har en publicerad framgångsfrekvens på ett offentligt benchmark, vilket är värt precis lika mycket som det faktum att den andra inte har någon molnfaktura alls.
Där en routad katalog förtjänar sin plats är när du benchmarkar din finjusterade modell mot de modeller den måste slå när det gäller verktygsanvändning, på en nyckel och en faktura, med failover så att en leverantörs dåliga eftermiddag inte blir din utvärderings dåliga eftermiddag.
LFM2.5-2.6B-Base finns inte i vår katalog — ingen LFM2.5-variant gör det — så den checkpunkten kommer från Liquids egen distribution och de vanliga tredjepartsvärdarna.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
