
ARTEMIS so với LFM2.5-2.6B-Base: checkpoint không thể làm nổi công việc, còn harness lại cần nó làm được
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Bốn hạng mục nằm trên lộ trình ARTEMIS của Google, và đúng một trong số đó đòi hỏi một mô hình mà rõ ràng vẫn chưa tồn tại: mô hình thị giác - ngôn ngữ nhẹ chạy trên thiết bị, dành cho tự động hóa độ trễ thấp, ưu tiên quyền riêng tư. Ứng viên hiển nhiên cho một công việc như vậy là một thứ thuộc cùng lớp kích thước với LFM2.5-2.6B-Base — checkpoint tiền huấn luyện 2,69 tỷ tham số của Liquid AI, được công bố dưới dạng trọng số mở với ngữ cảnh 131.072 token và kích thước đủ nhỏ để vừa một chiếc điện thoại. Đồng thời, ở trạng thái được phát hành, nó cũng không thể lấp vào vị trí đó, và những lý do đáng để hiểu trước khi ai đó đặt hai thứ lên một bảng so sánh. ARTEMIS của Google là một bộ khung tự động hóa Android bằng ngôn ngữ tự nhiên, được mã nguồn mở theo Apache 2.0 vào tháng 8 năm 2026, điều khiển một thiết bị cầm tay thật thông qua ADB và tuyên bố tỷ lệ hoàn thành trên 99% trên benchmark AndroidWorld của Google Research. LFM2.5-2.6B-Base là nguyên liệu tiền huấn luyện thô, không tinh chỉnh theo chỉ dẫn, không có mẫu chat, và — một cách có chủ đích — không có benchmark nào được công bố, dành cho những nhóm sẽ tự hậu huấn luyện nó. Một bên là phần mềm đã hoàn thiện với một bài toán mô hình chưa hoàn thiện. Bên kia là trọng số chưa hoàn thiện với một bài toán giấy phép đã hoàn thiện. Không bên nào thay thế được bên kia, và nơi chúng thực sự gặp nhau không phải là nơi bạn sẽ đoán.
LFM2.5-2.6B-Base thực sự là gì
Bóc lớp thương hiệu đi, nó là một nền tảng được xây dựng kỹ lưỡng cho công việc trên thiết bị, với các thông số kỹ thuật đọc lên như thể ai đó đã tối ưu cho băng thông bộ nhớ thay vì vị trí trên bảng xếp hạng.
• Kích thước — 2,69 tỷ tham số ở bfloat16 trong một shard ~5,39 GB duy nhất, được quảng cáo là "2.6B".
• Kiến trúc — 30 lớp theo cách phân chia hybrid: 22 khối tích chập ngắn có cổng kép trên 8 lớp attention truy vấn nhóm, chiều rộng ẩn 2048, 32 đầu attention so với 8 đầu KV, embedding chia sẻ trọng số. Cùng lớp code>Lfm2ForCausalLM/code> như thế hệ trước, nên không cần mã mô hình tùy chỉnh.
• Huấn luyện — khoảng 34 nghìn tỷ token, với một giai đoạn huấn luyện trung gian chuyên biệt để mở rộng ngữ cảnh.
• Từ vựng — 128.000 token, tăng gấp đôi trong thế hệ này để xử lý các hệ chữ viết phi Latinh tốt hơn. Khoảng 262M tham số, chiếm chừng một phần mười mô hình, nằm trong lớp nhúng liên kết.
• Ngữ cảnh — thẻ mô hình và cấu hình không khớp nhau ở đây, và điều này đáng để biết: tài liệu công bố 131.072 token trong khi code>config.json/code> đặt code>max_position_embeddings/code> thành 128.000. Dự trù cho 128K và coi bất cứ thứ gì vượt quá mức đó là chưa được xác minh.
• Ngôn ngữ — mười sáu: tiếng Anh, tiếng Ả Rập, tiếng Trung, tiếng Pháp, tiếng Đức, tiếng Hindi, tiếng Indonesia, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Ba Lan, tiếng Bồ Đào Nha, tiếng Nga, tiếng Tây Ban Nha, tiếng Thái, tiếng Việt.
• Điểm chuẩn — không có. Liquid không công bố bất kỳ đánh giá nào cho checkpoint cơ sở, và thẻ mô hình trình bày việc thiếu sót này như một chủ đích: sản phẩm này tồn tại để được huấn luyện tiếp, chứ không phải để được đo lường ở trạng thái nguyên bản.
Dòng cuối cùng đó chính là điểm mấu chốt của bản phát hành, và đó cũng là lý do một phép so sánh "X so với LFM2.5-2.6B-Base" phải được xử lý cẩn thận. Một checkpoint cơ sở không có quan điểm về bất cứ điều gì. Hãy yêu cầu nó lập kế hoạch cho một quy trình làm việc Android và nó sẽ tiếp tục văn bản của bạn theo xác suất, bởi vì nó chưa từng được dạy để trả lời. Thẻ này chỉ đề xuất nó cho những trường hợp cần tinh chỉnh nặng: một trợ lý chuyên biệt theo ngôn ngữ, một trợ lý chuyên biệt theo lĩnh vực trong một ngành dọc được quản lý chặt chẽ, huấn luyện trên dữ liệu độc quyền, hoặc như một học trò chưng cất. Đối với bất cứ thứ gì sẵn dùng ngay, bao gồm cả gọi công cụ, Liquid hướng bạn đến LFM2.5-2.6B đã được huấn luyện hậu kỳ thay vào đó.

Điều ARTEMIS cần ở một mô hình, vốn không phải là thứ mà một checkpoint cơ sở cung cấp
ARTEMIS là một vòng điều khiển với hai chế độ. Flash là một chu trình quan sát-và-hành động mang tính phản ứng với khoảng 3–5 giây mỗi bước. Pro là một đồ thị đa tác tử với khoảng 15–40 giây mỗi bước, với một Planner nắm giữ một kế hoạch Markdown sống, một Operator với bộ công cụ đầy đủ, và một Checker chỉ đọc xác minh các điểm kiểm tra ở bốn cấp độ từ code>off/code> đến code>strict/code>. Cả hai chế độ đều yêu cầu cùng một điều ở mô hình bên dưới: nhìn vào ảnh chụp màn hình, chọn một hành động từ một bộ công cụ cố định, và làm lại trong một hoặc hai giây, một trăm lần, mà không mất mạch.
Đó là một yêu cầu đòi hỏi cao — tuân theo chỉ dẫn dưới một schema cứng nhắc, hiểu thị giác có căn cứ, và tính mạch lạc dài hạn — và đó chính xác là tập kỹ năng mà một checkpoint cơ sở chưa được cung cấp. Các backend đã được kiểm thử của chính ARTEMIS đều là những mô hình được lưu trữ: Gemini, Claude, GPT-4o, Qwen-VL. Mỗi mô hình trong số đó đều được tinh chỉnh theo chỉ dẫn để sử dụng công cụ, và mỗi mô hình trong số đó đều lớn.
Vậy khoảng cách không nằm ở kích thước. Một mô hình 2,6B đã qua huấn luyện hậu kỳ có thể duy trì một vòng lặp gọi công cụ — người anh em đã qua huấn luyện hậu kỳ của chính Liquid tuyên bố vượt trội so với Gemma 4 E2B-it và E4B-it trên toàn bộ các đánh giá về khả năng tuân theo chỉ dẫn và gần như toàn bộ các đánh giá về sử dụng công cụ, dù đó là những con số do nhà cung cấp tự báo cáo và không có kiểm chứng độc lập. Khoảng cách nằm ở chỗ một base checkpoint chưa hề được áp dụng bất kỳ phần huấn luyện nào như vậy, nên nó hoàn toàn không thể được thả vào một harness.
Giấy phép là điểm khác biệt rõ rệt hơn
Đây chính là lúc cuộc đối đầu thực sự được định đoạt, và đây là phần mà hầu hết các so sánh đều bỏ qua.
• ARTEMIS — Apache 2.0. Dùng nó cho mục đích thương mại, tạo bản fork, đưa nó vào một sản phẩm, không có điều kiện về doanh thu. Nghĩa vụ duy nhất là giữ nguyên các thông báo và nêu rõ những thay đổi của bạn, một nghĩa vụ mà chính dự án đã phải khắc phục công khai vào tháng 9 năm 2026 sau khi Minitap cáo buộc rằng 228 trong số 229 tệp của ARTEMIS trùng khớp với dự án Apache-2.0 code>mobile-use/code> của riêng họ và rằng tên tác giả đã bị xóa bằng force-push. Kho lưu trữ hiện mang một dòng ghi công Minitap.
• LFM2.5-2.6B-Base — Giấy phép Mở LFM, một giấy phép tùy chỉnh thay vì Apache hay MIT. Dưới 10 triệu USD doanh thu hằng năm, quyền cấp phép rộng, vĩnh viễn và miễn phí bản quyền. Ở hoặc trên ngưỡng đó, giấy phép hoàn toàn không mở rộng cho mục đích thương mại, và bạn phải liên hệ với Liquid. Chi tiết quan trọng đối với bất kỳ ai xây dựng dựa trên nó: các tác phẩm phái sinh kế thừa các điều khoản tương tự. Checkpoint bạn hậu huấn luyện không phải là một thứ mới mà bạn sở hữu hoàn toàn — nó tiếp tục mang theo giấy phép có điều kiện theo doanh thu, với một ngoại lệ dành cho các tổ chức phi lợi nhuận đủ điều kiện.
Đặt hai sự thật đó cạnh nhau và quyết định sẽ đảo ngược tùy thuộc vào bạn là ai. Một công ty đã gọi được vốn, muốn tung ra một agent chạy trên điện thoại, có một harness Apache-2.0 mà nó có thể dùng thoải mái và một checkpoint mà nó có thể hoàn toàn không được dùng cho mục đích thương mại. Một lập trình viên cá nhân hay một startup dưới ngưỡng thì có cả hai, và giấy phép chỉ là một chú thích nhỏ. Không nhà cung cấp nào hành xử vô lý — Liquid là một công ty đang bảo vệ tầng thương mại của mình, Google thì mở mã nguồn công cụ kiểm thử — nhưng "open weights" và "open weights" không phải là cùng một sự cho phép, và một so sánh chỉ dừng ở số lượng tham số sẽ không cho bạn biết mình đang có cái nào.

Họ mô hình, bởi vì checkpoint cơ sở là cánh cửa sai để đi vào nó.
Nếu mục tiêu là một tác nhân Android chạy trên thiết bị, ba người anh em cùng dòng quan trọng hơn bản cơ sở, và cái mà lộ trình ARTEMIS thực sự cần lại không phải là cái hiển nhiên.
• LFM2.5-2.6B — người anh em agentic đã qua huấn luyện hậu kỳ. Thông lượng do nhà cung cấp báo cáo vào khoảng 30 token mỗi giây trên phần cứng cấp điện thoại, 113 trên Ryzen AI Max+ 395 và 220 trên Apple M5 Max, chạy trong dưới 2,5 GB.
• LFM2.5-VL-3B — mô hình biên ngôn ngữ-thị giác, được xây dựng trên cùng nền tảng với bộ mã hóa SigLIP2 400M NaFlex, với độ chính xác grounding precision@1 do nhà cung cấp báo cáo tăng từ 57.1 lên 87.9 trên RefCOCO và, theo Liquid, hiệu suất trên các phần tử UI trên màn hình vượt trội so với các mô hình Gemma lớn hơn nhiều và chỉ kém 0.7% so với Qwen 3.5 4.7B. Chưa được xác minh, nhưng đây là thành viên duy nhất của dòng này có thể nhìn thấy màn hình.
• LFM2.5-230M — tầng trích xuất và phân loại, không được khuyến nghị rõ ràng cho các công việc nặng về suy luận.
Kết luận không thoải mái cho checkpoint cơ sở trong cặp đối đầu này là: mục trong lộ trình của ARTEMIS là một yêu cầu thị giác, bản cơ sở chỉ có văn bản, và thành viên trong họ đảm nhận vị trí đó là biến thể VL vốn đã được áp dụng cả bộ mã hóa thị giác lẫn hậu huấn luyện. Vai trò của checkpoint cơ sở trong một ngăn xếp tự động hóa Android không phải là điều khiển điện thoại. Nó là nguyên liệu thô bên dưới bất kỳ mô hình nhỏ nào cuối cùng sẽ đảm nhận việc đó.
Nơi chúng thực sự gặp nhau: bánh đà mà chưa ai từng xây dựng
Đây là mối liên hệ duy nhất có thật chứ không chỉ mang tính tu từ, và nó đi ngược lại hướng thông thường. Tính năng bị đánh giá thấp nhất của ARTEMIS không phải là agent — mà là dữ liệu thải ra. Mỗi lần chạy đều ghi lại ngăn xếp lỗi, ảnh chụp màn hình keyframe, sổ nhật ký phiên gồm các bước nén và báo cáo chẩn đoán, còn Pro mở một “sự cố thực thi” mỗi khi một hành động thất bại và giữ nó trong ngữ cảnh cho đến khi một lần thành công sau đó giải quyết nó. Đó là một kho ngữ liệu được gán nhãn về đúng những khoảnh khắc mà nhận thức của một agent UI đã sai.
Ghép điều đó với một checkpoint mà toàn bộ mục đích là post-training và bạn có một vòng lặp hiển nhiên: chạy harness trên một mô hình được host, thu thập các trace tại những chỗ nó vấp phải trên ứng dụng của bạn, rồi fine-tune một mô hình 2.6B trên chính xác những frame đó. Đó là kiểu bộ dữ liệu độc quyền mà chính card của Liquid viện dẫn làm lý lẽ biện minh cho việc phát hành một base checkpoint ngay từ đầu — “huấn luyện trên dữ liệu của chính bạn” — và giấy phép ràng buộc theo doanh thu nghĩa là đó là một hướng đi hợp lý cho các đội dưới ngưỡng và đòi hỏi một cuộc trao đổi với các đội trên ngưỡng.
Để nói rõ về trạng thái của ý tưởng đó: chưa ai công bố vòng lặp này, cả hai nhà cung cấp đều không đề xuất nó, và không có bằng chứng nào cho thấy bên nào đã kiểm thử nó. Đó là một đề xuất, không phải một kết quả, và cần được đọc như vậy. Nhưng đó là cách định khung duy nhất mà trong đó hai tạo tác này là cộng sự của nhau thay vì một lỗi phạm trù.
Nếu bạn tiến xa được đến bước tinh chỉnh, thì tập hợp so sánh chính là nửa còn lại của vấn đề. LFM2.5-2.6B-Base không có trong danh mục của chúng tôi — không có bất kỳ biến thể LFM2.5 nào — nên checkpoint đó đến từ bản phân phối của chính Liquid và các nhà lưu trữ bên thứ ba quen thuộc. Chỗ mà một danh mục định tuyến khẳng định được giá trị của nó là khi đánh giá bản tinh chỉnh của bạn so với những mô hình mà nó phải vượt qua về khả năng sử dụng công cụ, trên một khóa và một hóa đơn, với cơ chế chuyển đổi dự phòng để một buổi chiều tệ hại của nhà cung cấp không trở thành buổi chiều tệ hại của quá trình đánh giá. Đó là một thứ thực sự hữu ích khi toàn bộ mục đích của bài tập này là một cuộc đối đầu trực tiếp mà bạn dự định sẽ hành động dựa trên kết quả.

Vậy cái nào là vấn đề của bạn
Nếu bạn có một ứng dụng Android và muốn nó được kiểm thử tự động trong quý này, bạn muốn ARTEMIS, và LFM2.5-2.6B-Base không nằm trong câu trả lời — bạn sẽ chạy ARTEMIS với một mô hình thị giác được host, trả phí theo từng bước, và mục lộ trình về các VLM trên thiết bị rồi sẽ đến vào một lúc nào đó và giải quyết một vấn đề chi phí mà bạn chưa đo lường.
Nếu bạn đang xây dựng một sản phẩm phải chạy trên điện thoại không có mạng, bạn sẽ muốn đi theo hướng mô hình nhỏ, và LFM2.5-2.6B-Base là điểm khởi đầu của dự án đó chứ không phải là bất kỳ phần nào trong lời giải của nó: bạn sẽ hậu huấn luyện nó, bạn sẽ đọc LFM Open License đối chiếu với dự phóng doanh thu của mình trước khi viết script huấn luyện đầu tiên, và nếu agent của bạn cần nhìn thấy màn hình thì cuối cùng bạn sẽ chuyển sang biến thể VL thay vào đó.
Điều duy nhất không nên làm là đặt hai thứ này cạnh nhau, tuyên bố harness có năng lực cao hơn, rồi bỏ qua. So sánh hữu ích là giữa hai stack hoàn chỉnh — mô hình được host cộng với harness, so với mô hình nhỏ đã tinh chỉnh cộng với một framework bạn tự xây — và chỉ một trong hai có tỷ lệ thành công được công bố trên một benchmark công khai, thứ đáng giá đúng bằng việc cái còn lại không hề có hóa đơn đám mây nào.
Chỗ mà một danh mục định tuyến khẳng định được giá trị của mình chính là việc đánh giá bản fine-tune của bạn so với những mô hình mà nó phải đánh bại về khả năng sử dụng công cụ, với một khóa duy nhất và một hóa đơn duy nhất, cùng cơ chế failover để một buổi chiều tồi tệ của nhà cung cấp không trở thành buổi chiều tồi tệ của bài đánh giá bạn.
LFM2.5-2.6B-Base không có trên danh mục của chúng tôi — không có biến thể LFM2.5 nào — nên checkpoint đó đến từ bản phân phối riêng của Liquid và các máy chủ bên thứ ba thông thường.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
