Một thẻ tiêu đề được tạo, mang tiêu đề 'TwIL-LM3-Pro vs LFM2.5 2.6B Base', có phụ đề 'Một cái đã hoàn thiện, cái kia là điểm khởi đầu', với hai thẻ bo tròn ghi 'TwIL-LM3-Pro - được hậu huấn luyện và hợp nhất' và 'LFM2.5 2.6B Base - checkpoint tiền huấn luyện'. Logo OrcaRouter được ghép vào góc dưới bên phải.
Guides & Insights

TwIL-LM3-Pro so với LFM2.5 2.6B Base: Một bên đã hoàn thiện, bên kia là điểm khởi đầu

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điều tiết lộ rõ nhất về bản so sánh đã công bố giữa TwIL-LM3-Pro và LFM2.5 2.6B Base là việc webAI hoàn toàn không công bố bản so sánh nào với 2.6B. Các bảng Track A và Track B của webAI đặt chuyên gia logic hình thức 3,66B của mình đối đầu với một loạt đối thủ — Granite base của chính họ, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — và mục Liquid AI mà họ chọn là LFM2.5-8B-A1B, không phải 2.6B. Mô hình 2.6B thực sự xuất hiện trong bảng là `LFM2-2.6B`, thế hệ trước, một mô hình khác với một lần tiền huấn luyện khác. Việc bỏ sót đó không phải là sơ suất. LFM2.5 2.6B Base là một checkpoint đã được tiền huấn luyện, không có tinh chỉnh theo chỉ dẫn, và các benchmark tuân theo chỉ dẫn không phải là bài kiểm tra mà nó được tạo ra để thực hiện.

Vậy nên trang này so sánh một sản phẩm hoàn chỉnh với một nguyên liệu thô. Cách đóng khung kiểu Aion — một mô hình có điểm số còn mô hình kia thì không — là phù hợp, nhưng lý do cụ thể hơn và thú vị hơn: một mô hình đã qua huấn luyện hậu kỳ và được hợp nhất, mô hình kia cố tình dừng lại trước giai đoạn huấn luyện hậu kỳ, và hai tài liệu mô tả chúng đang cố ý trả lời những câu hỏi khác nhau.

Hai số đếm tham số không phải là cùng một phép đo

TwIL-LM3-Pro có 3,66 tỷ tham số, dạng dense, tất cả đều hoạt động trên mỗi token. Nó bắt nguồn từ `ibm-granite/granite-4.2-3b` thông qua tinh chỉnh LoRA, chưng cất đa nhánh, hợp nhất checkpoint, một lần hợp nhất WiSE-FT trở lại về phía base, và một giai đoạn GRPO có trọng số entropy — và artifact mà webAI phát hành là policy đã hợp nhất, không phải adapter LoRA, nên nó chạy độc lập.

LFM2.5 2.6B Base có 2,69 tỷ tham số trên 30 lớp: 22 khối tích chập ngắn cổng kép xen kẽ với 8 lớp attention truy vấn nhóm. Thiết kế lai conv/attention đó là kiến trúc trên thiết bị của Liquid, và đó là lý do các con số thông lượng của dòng mô hình này là như vậy thay vì chỉ là hàm của số lượng tham số. Nó được huấn luyện trên 34 nghìn tỷ token với từ vựng 128.000 token và có cửa sổ ngữ cảnh 131.072 token.

Hai con số này chênh lệch nhau khoảng 36% và đạt được thông qua các kiến trúc hoàn toàn khác nhau, vì vậy cả việc "3.66B đánh bại 2.69B" lẫn điều ngược lại đều không có ý nghĩa gì như một tuyên bố về chất lượng. Thẻ mô hình của chính webAI đưa ra quan điểm này một cách gián tiếp khi nó từ chối so sánh perplexity của ngữ liệu giữa các tokenizer — từ vựng của TwIL-LM3-Pro là 100,352, của LFM2.5-2.6B là 128,000, và perplexity được tính trên mỗi token.

Những gì "Base" loại bỏ, và tại sao nó thay đổi bảng điểm

Liquid AI công bố LFM2.5 2.6B dưới hai dạng: checkpoint hậu huấn luyện, được tinh chỉnh cho các khối lượng công việc agentic trong những agent harness phổ biến, và Base, được mô tả trong card riêng của nó là "checkpoint văn bản thuần túy đã được tiền huấn luyện, dùng để tạo ra mọi biến thể LFM2.5-2.6B." Base là đầu vào cho quá trình tinh chỉnh, không phải một sản phẩm. Nó không có instruction tuning, không có chat template đáng gọi là như vậy, và không có đánh giá nào được công bố — bởi vì đánh giá một mô hình base trên các tác vụ tuân theo chỉ dẫn là đo lường sai thứ.

Vị thế của TwIL-LM3-Pro thì ngược lại. Toàn bộ giá trị của nó nằm ở ngăn xếp hậu huấn luyện: webAI báo cáo rằng trên harness riêng của mình, pipeline đã nâng cổng macro trong miền từ 0.4313 của base lên 0.5539, với macro 10 bộ dữ liệu held-out giữ nguyên mức (0.7942 đến 0.7901) thay vì sụp đổ. Duy trì hiệu suất trên held-out là phần khó của hậu huấn luyện chuyên biệt, và đó là phần mà Base không thể trả lời.

Đây cũng là chỗ mà phép so sánh kích thước trong các bảng của webAI phát huy tác dụng. TwIL-LM3-Pro được báo cáo là dẫn trước LFM2.5-8B-A1B trên cả hai chỉ số macro held-out — 0.7901 so với 0.7884 trên bộ mười tập dữ liệu, 0.7425 so với 0.7378 trên bộ mười bốn tập — với ít hơn một nửa số tham số của mô hình MoE đó. Đó là một kết quả so sánh cùng điều kiện thực sự, và nó có được chính xác là vì LFM2.5-8B-A1B là một mô hình đã qua huấn luyện hậu kỳ, có thể chạy qua một khung đánh giá theo chỉ dẫn. Mô hình Base thì không thể, đó là lý do vì sao 2.6B không bao giờ có một cột.

Những phương diện đáng để thống nhất

• Tham số — TwIL-LM3-Pro 3.66B dense so với LFM2.5 2.6B Base 2.69B (30 lớp: 22 conv + 8 GQA).

• Hậu huấn luyện — LoRA SFT, chưng cất, hợp nhất WiSE-FT và GRPO ở bước 2580 so với không có; Base vốn dĩ là đầu ra của tiền huấn luyện theo thiết kế.

• Cửa sổ ngữ cảnh — 131.072 token cho cả hai, được kế thừa từ các mô hình cơ sở tương ứng của chúng.

• Từ vựng — 100,352 token so với 128,000, đó là lý do độ hỗn loạn của chúng không thể so sánh được với nhau.

• Ngôn ngữ — chỉ tiếng Anh so với mười bảy ngôn ngữ, bao gồm tiếng Ả Rập, tiếng Trung, tiếng Nhật, tiếng Hàn, tiếng Tây Ban Nha và tiếng Thái.

• Định dạng Thinking — TwIL-LM3-Pro mặc định phát ra một khối `<think>` và suy luận dài (trung bình 1.902 token trong miền, 24,2% số lượt sinh chạm giới hạn độ dài) so với một checkpoint cơ sở hoàn toàn không có định dạng chỉ dẫn.

• Giấy phép — Giấy phép Phi Thương mại webAI phiên bản 1.0 so với Giấy phép Mở LFM v1.0 của Liquid.

• Nó dùng để làm gì — một điểm cuối suy luận logic hình thức so với một điểm khởi đầu để tinh chỉnh.

Các dòng ngữ cảnh xứng đáng có một chú thích mà cả hai mô hình đều cung cấp: mỗi mô hình mang 131.072 token xuyên suốt từ quá trình tiền huấn luyện, và không nhà cung cấp nào xác thực hành vi ngữ cảnh dài — thẻ của TwIL-LM3-Pro nói rằng mọi điểm số đã công bố đều được đo bên trong cửa sổ 8.192 token. Những con số trùng khớp ở đây là được kế thừa, chứ không phải được chứng minh.

Giấy phép, và mỗi loại được dùng hợp pháp cho mục đích gì

Giấy phép Non-Commercial webAI của TwIL-LM3-Pro cho phép sử dụng cho mục đích nghiên cứu và cá nhân, đồng thời yêu cầu một thỏa thuận riêng với webAI đối với việc triển khai nhằm tạo doanh thu. LFM2.5 2.6B Base được phát hành theo LFM Open License v1.0 của chính Liquid, mà API của Hugging Face báo cáo là `license: other` thay vì một mã định danh SPDX tiêu chuẩn — hãy đọc tệp giấy phép trước khi lên kế hoạch dựa trên nó, bởi vì các điều khoản là của riêng Liquid chứ không phải một mẫu được công nhận.

Không giấy phép nào là Apache 2.0, và thật sai lầm khi coi "trọng số mở" là đồng nghĩa với "cho phép dùng cho mục đích thương mại". Sự khác biệt thực tế giữa hai loại nằm ở thứ mà các giấy phép đang bảo vệ: một nhà nghiên cứu phi thương mại có thể dùng cả hai, một công ty đang xây dựng sản phẩm cần kiểm tra cả hai, và toàn bộ mục đích của Base — được tinh chỉnh để trở thành sản phẩm của người khác — khiến các điều khoản chính xác của nó trở nên quan trọng hơn vẻ ngoài của chúng.

Vị trí của từng thứ trong một ngăn xếp

Base là lựa chọn đúng đắn khi bạn có ý định huấn luyện. Nếu bài toán của bạn là một tác vụ gán nhãn hẹp, một classification head chuyên biệt theo miền, hay một bản fine-tune trên vài nghìn ví dụ đã gán nhãn, thì việc bắt đầu từ một checkpoint đã tiền huấn luyện 2,69B với từ vựng đa ngữ rộng và kiến trúc conv lai được thiết kế để đạt thông lượng là một quyết định kỹ thuật hợp lý, và chi phí của giai đoạn hậu huấn luyện mà bạn sẽ bỏ qua chính là chi phí mà bạn chủ động trả thay vào đó.

TwIL-LM3 là lựa chọn đúng khi bạn không có ý định và nhiệm vụ là logic hình thức. Nhãn kéo theo, hình thức hóa phát biểu trong Lean, phân tích ngữ nghĩa và phê bình chứng minh là những nhiệm vụ mà toàn bộ pipeline của nó hướng tới, và việc bắt đầu từ một checkpoint đã trải qua giai đoạn hợp nhất và tăng cường giúp tiết kiệm phần khó tái tạo nhất trong số này — giữ nguyên mức của bộ kiểm thử held-out trong khi vẫn cải thiện trong miền.

Sai lầm là đọc “3.66B post-trained specialist” như thể tốt hơn hẳn “2.69B base checkpoint”. Chúng ở những giai đoạn khác nhau của cùng một dây chuyền sản xuất.

Phục vụ họ, hay phục vụ quanh họ

Cả hai mô hình đều không phải là một route trong danh mục của OrcaRouter hiện nay, và lý do thì khác nhau ở mỗi mô hình. TwIL-LM3-Pro được cấp phép phi thương mại và không có endpoint được host sẵn; LFM2.5 2.6B Base là một sản phẩm phục vụ fine-tuning mà không ai lại cố ý dùng nó như một endpoint suy luận. Vị trí mà một router khẳng định được giá trị của mình là ở tầng cao hơn một bậc, trong phần công việc bao quanh một mô hình chuyên biệt: tạo và lọc dữ liệu huấn luyện mà bạn sẽ dùng để fine-tune Base, mở rộng các prompt mà bạn sẽ đưa vào một mô hình logic hình thức, và chấm điểm các đầu ra. Đó đều là những lời gọi văn bản, và chúng chạy qua một endpoint tương thích OpenAI duy nhất để truy cập hơn 200 mô hình với mức giá niêm yết của nhà cung cấp, cộng thêm 0% markup, nhờ đó việc nhà cung cấp giảm giá có hiệu lực ngay trong ngày, và việc đổi từ mô hình tạo dữ liệu này sang mô hình khác chỉ là một chỉnh sửa cấu hình thay vì phải tạo thêm một mối quan hệ nhà cung cấp thứ hai.

Chuyển đổi dự phòng tự động quan trọng hơn mức thông thường trong một pipeline tinh chỉnh, vì một tác vụ theo lô chết ở 80% sẽ lãng phí toàn bộ lượt chạy. Một khóa dùng chung cho các mô hình sinh, với cơ chế dự phòng gửi lại khi nhà cung cấp gặp lỗi, là một phần hạ tầng nhỏ hơn so với ba tích hợp API.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs LFM2.5 2.6B Base - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Post-training SFT, merge, GRPO; Context 131,072 tokens; Vocabulary 100,352; Languages English; Licence non-commercial. LFM2.5 2.6B Base: Parameters 2.69B (30 layers); Post-training none by design; Context 131,072 tokens; Vocabulary 128,000; Languages 17; Licence LFM Open License v1.0. A footer line reads 'Both vendor-reported; neither model has a third-party evaluation.' The OrcaRouter logo is composited in the bottom-right corner.

Cái nào, được quyết định bởi ý định của bạn

Nếu bạn đang huấn luyện, hãy chọn Base. Nếu bạn đang suy luận trên logic hình thức và giấy phép cho phép bạn sử dụng, hãy chọn TwIL-LM3-Pro. Nếu hôm nay bạn cần một mô hình nhỏ biết tuân theo chỉ dẫn và không điều kiện nào trong hai điều kiện trên phù hợp, hãy dùng phiên bản anh em đã qua post-training của LFM2.5 2.6B — mô hình mà Liquid thực sự phát hành cho mục đích đó — và để Base lại cho việc tinh chỉnh mà dù sao bạn cũng đã định làm.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, the 16-languages tag, the LFM2 and liquid tags, and the card's opening description of LFM2.5 as a family of hybrid models designed for on-device deployment, built on the LFM2 architecture with extended pre-training and reinforcement learning.A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B, the post-trained sibling, showing the 16-languages and LFM2 tags and the card's description of LFM2.5-2.6B as part of the LFM2.5 family with a 128K context window and agentic post-training.