
Intern-Decision-0.8B vs LFM2.5 2.6B Base: Hai cách để tự mình xây dựng điều gì đó
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 592 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Đặt Intern-Decision-0.8B bên cạnh LFM2.5 2.6B Base, và nhận xét đầu tiên trung thực là không cái nào trong hai là một sản phẩm theo nghĩa mà người mua thường hiểu. Intern-Decision-0.8B là checkpoint mà InternLM đã tải lên Hugging Face vào ngày 26 tháng 9 năm 2026 mà không có bất kỳ thông báo nào — một bản tinh chỉnh 852.985.920 tham số của Qwen3.5-0.8B, trả lời các câu hỏi được nhập và không xuất ra văn bản, được phát hành theo Apache 2.0 với một liên kết GitHub bị lỗi 404. LFM2.5 2.6B Base là checkpoint văn bản được tiền huấn luyện 2,69 tỷ tham số của Liquid AI, được đăng vào ngày 1 tháng 8 năm 2026 như nền tảng cho dòng LFM2.5, và thẻ của chính nó nói rằng nó "chỉ được khuyến nghị cho các tác vụ đòi hỏi phải tinh chỉnh nhiều." Một cái đã hoàn thiện và hẹp. Cái kia thì chưa hoàn thiện và tổng quát. Cả hai đều giả định rằng bạn là người làm công việc đó — và công việc không phải là cùng một công việc.
Sự phân biệt đó chính là toàn bộ phép so sánh, và đó là lý do một bảng thông số kỹ thuật thuần túy sẽ gây hiểu lầm. Câu hỏi mà người đọc thực sự có là "tôi nên tải cái nào trong số này", và câu trả lời phụ thuộc vào việc thứ bạn cần xây dựng là một lớp quyết định hay một năng lực ngôn ngữ. Đó là những dự án khác nhau với những khung thời gian khác nhau.
Những gì mỗi mô hình đưa cho bạn
Intern-Decision-0.8B ra mắt dưới dạng một hệ thống hoạt động được. Kho lưu trữ cung cấp inference.py/, một DecisionEngine/ lớp, một lược đồ yêu cầu được ghi tài liệu và một lược đồ phản hồi, cùng một ví dụ minh họa mà bạn có thể chạy sau khi cài đặt bốn phụ thuộc Python được ghim phiên bản. Bạn cung cấp một trạng thái, từ một đến mười sáu câu hỏi có tên với tối đa 62 lựa chọn mỗi câu, và tùy chọn tối đa tám hình ảnh, rồi bạn nhận lại một phân phối đã hiệu chỉnh cùng nhãn argmax cho mỗi trường. Công cụ đọc logits tại các vị trí cố định trong một bộ khung được kết xuất trước thay vì sinh ra bất cứ thứ gì, nên không có bước giải mã, không có token đầu ra và không có JSON cần sửa. Nó chạy từ khoảng 1,73 GB tệp.
LFM2.5 2.6B Base mang đến cho bạn điều ngược lại: năng lực thô mà không có giao diện. Đây là một mô hình ngôn ngữ nhân quả chỉ dành cho văn bản với 30 lớp được sắp xếp thành 22 khối tích chập ngắn có cổng kép và 8 lớp chú ý truy vấn nhóm, được tiền huấn luyện trên khoảng 34 nghìn tỷ token thuộc 16 ngôn ngữ, với vốn từ vựng 128.000 token và cửa sổ ngữ cảnh 131.072 token. Nó không có quá trình tinh chỉnh theo chỉ dẫn riêng và không có điểm chuẩn tác vụ nào trên thẻ mô hình, bởi vì một checkpoint nền không được chấm điểm — những mô hình bạn huấn luyện từ nó mới được chấm điểm. Pipeline hậu huấn luyện của chính Liquid là thứ biến nó thành LFM2.5-2.6B dạng tác tử, và pipeline đó chính là thứ bạn được yêu cầu tái tạo, một phần hoặc toàn bộ, cho lĩnh vực của riêng bạn.
Vậy trục phân biệt không phải là kích thước. Mà là việc phần còn thiếu là một hợp đồng quyết định hay một lần chạy huấn luyện.
Bảng điểm, kèm theo những lưu ý đi kèm
• Thời gian để có kết quả đầu tiên — Intern-Decision-0.8B: một buổi chiều, tải một checkpoint và gọi predict()/. LFM2.5 2.6B Base: tùy vào việc quá trình continued pre-training hoặc SFT của bạn mất bao lâu, cộng thêm cả công việc chuẩn bị dữ liệu.
• Tham số — Intern-Decision-0.8B: 852.985.920, trải trên một phân đoạn ngôn ngữ 1,50 GB, một phân đoạn thị giác 176 MB và một bộ chiếu 25 MB. LFM2.5 2.6B Base: 2,69B, khoảng 2,5 GB trọng số.
• Các phương thức đầu vào — Intern-Decision-0.8B: văn bản cùng tối đa tám hình ảnh, với trọng số thị giác có trong repo. LFM2.5 2.6B Base: chỉ văn bản, theo thiết kế — công việc đa phương thức trong dòng LFM2.5 nằm ở các biến thể VL.
• Bối cảnh thực tế — Intern-Decision-0.8B: 8.192 token, bị từ chối thay vì bị cắt ngắn, mặc dù cấu hình có embedding vị trí tối đa 262.144. LFM2.5 2.6B Base: 131.072 token gốc.
• Đầu ra — Intern-Decision-0.8B: một phân phối xác suất đã hiệu chỉnh và nhãn argmax cho mỗi trường, mang tính tất định. LFM2.5 2.6B Base: văn bản tiếp nối, được lấy mẫu.
• Điểm chuẩn — Intern-Decision-0.8B: một bảng đầy đủ của nhà cung cấp trên bảy benchmark, không ai tái lập được. LFM2.5 2.6B Base: không có bản công bố nào cho chính bản base, theo thiết kế.
• Giấy phép — Intern-Decision-0.8B: Apache 2.0, kèm một LICENSE-QWEN/ được giữ nguyên cho các trọng số thượng nguồn. LFM2.5 2.6B Base: LFM Open License v1.0.

Hàng giấy phép xứng đáng có một mục riêng.
Cả hai thẻ đều ghi "open", và hai từ này mang ý nghĩa khác nhau về bản chất. Intern-Decision-0.8B là Apache 2.0 — không có điều kiện doanh thu, không hạn chế lĩnh vực sử dụng, không có thỏa thuận cấp phép thương mại riêng cần đàm phán. Tệp giấy phép thứ hai trong kho là giấy phép Qwen được giữ nguyên vì mô hình là một dẫn xuất của Qwen3.5-0.8B, đây là cách xử lý đúng đắn chứ không phải một hạn chế.
LFM2.5 2.6B Base được phát hành theo LFM Open License v1.0, và mục 5 của giấy phép đó đáng để đọc trọn vẹn trước khi bất kỳ kế hoạch thương mại nào phụ thuộc vào nó. Các quyền được cấp cho Sử dụng Thương mại được ràng buộc với điều kiện là bạn hoặc pháp nhân của bạn không vượt quá một ngưỡng được định nghĩa trong giấy phép, cụ thể là doanh thu hằng năm từ 10 triệu đô la Mỹ trở lên. Trên ngưỡng đó, việc sử dụng thương mại tác phẩm hoặc một tác phẩm phái sinh không được cấp phép theo thỏa thuận. Việc sử dụng phi lợi nhuận và nghiên cứu được miễn trừ. Đó là một ranh giới có thật và có thể thực thi, và vì nó cũng gắn với các tác phẩm phái sinh, nó lan truyền sang bất cứ thứ gì bạn tinh chỉnh từ bản nền — vốn là toàn bộ mục đích sử dụng của checkpoint này.
Có một cách hiểu rõ ràng ở đây: nếu bạn đang xây dựng vì mục đích thương mại và thực thể của bạn đạt mốc 10 triệu USD doanh thu hằng năm, thì LFM2.5 2.6B Base không phải là cùng loại tài sản như Intern-Decision-0.8B, bất kể hai bên hoạt động ra sao. Nếu bạn ở dưới ngưỡng đó, đang nghiên cứu, hoặc tinh chỉnh cho mục đích phi thương mại, thì sự phân biệt ấy không thành vấn đề. Dù thế nào đi nữa, đó là câu hỏi cần trả lời trước khi chạy huấn luyện, chứ không phải sau đó.
Mỗi cái ở đâu
LFM2.5 2.6B Base là lựa chọn đúng đắn khi năng lực bạn cần vẫn chưa tồn tại ở một mô hình hoàn thiện. Thẻ của Liquid liệt kê rõ ràng các trường hợp dự kiến: trợ lý chuyên biệt cho từng ngôn ngữ như tiếng Nhật, trợ lý chuyên biệt theo lĩnh vực như y tế, huấn luyện trên dữ liệu độc quyền mà bạn không thể gửi đến API, hoặc thử nghiệm các phương pháp hậu huấn luyện mới lạ. Lý do đằng sau danh sách đó là 34 nghìn tỷ token tiền huấn luyện đa ngôn ngữ rất tốn kém để tái tạo và gần như miễn phí để kế thừa — bạn đang mua một điểm khởi đầu vốn đã đủ năng lực trên 16 ngôn ngữ và ngữ cảnh 128K, rồi dành phần tính toán của riêng bạn cho phần đặc thù với bạn.
Sự hỗ trợ hệ sinh thái cho kế hoạch đó đầy đủ một cách bất thường đối với một mô hình mới như vậy. Liquid có tài liệu về tiền huấn luyện tiếp nối, SFT, DPO và GRPO thông qua Unsloth và TRL, cùng notebook cho từng phần, và checkpoint được Transformers, vLLM, SGLang, llama.cpp, MLX và ML Studio hỗ trợ. Đó không phải là nội dung quảng cáo — đó là sự khác biệt giữa một base model bạn có thể tinh chỉnh trong tuần này và một mô hình mà bạn phải dành cả hai tuần để gắn vào trình huấn luyện.
Intern-Decision-0.8B là lựa chọn đúng khi năng lực bạn cần đã thực sự tồn tại và vấn đề nằm ở hình dạng của nó. Nếu tác vụ của bạn là một quyết định có giới hạn với một tập câu trả lời đóng — định tuyến ticket này, chấm điểm yêu cầu này, phân loại bản ghi này theo một rubric — thì mô hình sinh là một cách vụng về để lấy nhãn, còn mô hình cơ sở thì hoàn toàn không phải là cách để lấy được nhãn. Thứ bạn muốn là một cái gì đó trả về phân phối, cho bạn biết độ tin cậy của nó, và làm việc đó trong cùng 34 mili-giây mỗi lần. Độ trễ đo được của InternLM trên một RTX 4090 là trung bình 33.98 ms với p95 là 37.50 ms, và các con số của chính card đó cho thấy người anh em 2B ở mức trung bình 33.28 ms — một lời nhắc rằng ở những độ dài prompt này, chi phí nằm ở việc đọc schema, chứ không phải ở việc chạy trọng số.
Sự đánh đổi bạn đang thực hiện là lấy tính linh hoạt để đổi lấy một hợp đồng. Một mô hình cơ sở cuối cùng có thể trở thành bất cứ thứ gì, nếu bạn có dữ liệu và năng lực tính toán. Một đầu quyết định thì đã là chính thứ đó, và nó sẽ không bao giờ trở thành bất cứ thứ gì khác. Nếu schema của bạn thay đổi hình dạng mỗi tháng, đó là một chi phí thực sự. Nếu không, nó chẳng phải là chi phí gì cả.
Điều không ai có thể nói với bạn về bảng Intern-Decision
Mọi con số hiệu năng cho Intern-Decision-0.8B đều do nhà cung cấp báo cáo, và lưu ý ở đây nặng hơn thường lệ vì bản phát hành mới ra được một tuần và hoàn toàn không có tài liệu. Không có bài báo nào, không có bộ sưu tập nào tập hợp ba kích cỡ, không có kho GitHub hoạt động được, và không có đánh giá độc lập. Tìm kiếm trên Artificial Analysis không trả về kết quả nào cho mô hình này.
InternLM đã chọn các benchmark, chọn các mô hình so sánh — một tập hợp bị chi phối bởi các mô hình quyết định, bao gồm Jev của TypeSafe, Laya và Kev của Convai — và công bố bảng mà không có bài đăng ra mắt.

Với nhãn đó được gắn kèm, hình dạng đó vẫn đáng để đọc. Intern-Decision-0.8B đạt 97.92 / 80.56 / 52.25 trên ba phần chia của Jevbench, 77.35 trên Typed Decision và 94.52 trên ToolACE, trung bình 79.38. Hồ sơ hiệu chuẩn của nó là mục thú vị nhất: chỉ số Brier 0.530 và sai số hiệu chuẩn kỳ vọng 0.066, tức ECE tốt hơn mức 0.095 của Jev dù Brier tệ hơn. Nói đơn giản, nó kém chính xác hơn nhưng trung thực hơn về mức độ chính xác của mình, và với một quy trình dựa trên ngưỡng, thứ tự đó quan trọng hơn mức trung bình. Cột lẽ ra phải chặn việc triển khai là WildJailBreak ở 64.48 so với 96.29 của Jev. Mức thiếu hụt độ bền từ chối lớn đến vậy là một thuộc tính của bản tinh chỉnh, và việc nó thuộc về nền tảng Qwen3.5-0.8B, mục tiêu tinh chỉnh quyết định hay số lượng tham số thì không được ghi lại ở đâu trên thẻ mô hình.
Trên trục này, việc so sánh với LFM2.5 2.6B Base không phải là "ai đạt điểm cao hơn," vì bản base không có điểm số. Mà là số liệu của một mô hình chưa được kiểm toán, còn số liệu của mô hình kia thì không tồn tại, và người đọc lựa chọn giữa chúng là đang lựa chọn xem sẽ làm việc với loại ẩn số nào.
Quy trình mà hầu hết mọi người thực sự cuối cùng vẫn xây dựng
Có một cấu hình sử dụng cả hai, và đáng để gọi tên vì đó là nơi hầu hết các hệ thống production dừng lại. Tầng quyết định xử lý các bài toán đóng — phân loại ưu tiên, định tuyến, chấm điểm theo rubric — nơi tập câu trả lời đã biết, độ trễ tích lũy qua một triệu bản ghi, và token đầu ra hoàn toàn là chi phí phụ trội. Tầng ngôn ngữ xử lý mọi thứ cần văn xuôi, tổng hợp hoặc ngữ cảnh dài: tóm tắt chuyển cấp, phần giải thích gắn với nhãn, bản nháp để con người chỉnh sửa. LFM2.5 2.6B Base là một nền tảng khả thi cho nửa sau nếu bạn có dữ liệu miền đáng để huấn luyện; một đầu quyết định là hình dạng tự nhiên của nửa đầu.
Việc kết hợp cả hai chính là phần khó nhằn, và đó là phần đáng để không tự xây dựng thủ công. DSL định tuyến của OrcaRouter diễn đạt routing như code — YAML với các điều kiện CEL, được triển khai mà không cần redeploy — nên một pipeline gửi một lớp request tới một endpoint ra quyết định và một lớp khác tới một mô hình ngôn ngữ chỉ là một quy tắc định tuyến, chứ không phải một bộ cân bằng tải mà bạn phải tự duy trì. Gateway này bao phủ hơn 200 mô hình sau một key tương thích OpenAI, với giá niêm yết của nhà cung cấp được chuyển nguyên qua ở mức markup bằng không, và nó không cộng thêm markup cho mô hình bạn chọn. Để nói chính xác về ranh giới: cả Intern-Decision-0.8B lẫn LFM2.5 2.6B Base đều không phải là mô hình của chúng tôi — cả hai đều là các checkpoint mà bạn tải về và chạy cục bộ, và trong cả hai trường hợp đó chính là điểm mấu chốt, bởi lý do chọn một mô hình 2 GB là nó chạy ngay tại nơi dữ liệu của bạn đã ở đó. Còn mục đích của một gateway là phần nửa của stack mà nếu không có nó, bạn sẽ phải gọi ra ngoài.
Nếu lớp quyết định là phần bạn muốn kiểm thử mà không cần cam kết một lượt huấn luyện cho nó, thì một mô hình quyết định được lưu trữ là thử nghiệm rẻ hơn, và Jev 1.13 của TypeSafe là mô hình mà InternLM đã đối sánh — có thể gọi ngay hôm nay thông qua một endpoint duy nhất tương thích OpenAI với giá $0.042 cho mỗi triệu token đầu vào và đầu ra được tính phí bằng 0.

Vậy thì cái nào?
Chọn LFM2.5 2.6B Base nếu năng lực đó chưa tồn tại và bạn có cả dữ liệu miền lẫn sự sẵn sàng cho một lần tinh chỉnh, đồng thời hãy kiểm tra ngưỡng doanh thu $10M trong LFM Open License trước khi xây dựng thương mại dựa trên nó. Chọn Intern-Decision-0.8B nếu năng lực đó đã tồn tại, các câu trả lời đã có thể liệt kê được ngay trong prompt của bạn, và thứ bạn cần là một cách nhanh, xác định, sạch về giấy phép để lấy nhãn — chấp nhận rằng tài liệu của nó bị thiếu, các benchmark của nó chưa được kiểm toán, và hành vi từ chối trước đầu vào đối kháng chưa từng được bất kỳ ai ngoài phòng thí nghiệm đã tinh chỉnh nó kiểm thử. Cái thứ hai là con đường ngắn hơn và ẩn số lớn hơn. Cái thứ nhất là con đường dài hơn và được tài liệu hóa nhiều hơn, và không có sự thật nào trong số đó đồng nghĩa với tốt hơn.
