Một thẻ tiêu đề được tạo với nội dung "Ember-1 vs LFM2.5 2.6B Base" cùng tiêu đề phụ "Một hành vi hoàn thiện so với một nền tảng thô", phía trên hai thẻ: Ember-1 — "Kimi K3 được huấn luyện lại" và "được phục vụ, không phải tải xuống"; LFM2.5 2.6B Base — "checkpoint dày đặc 2.69B" và "không tinh chỉnh chỉ dẫn".
Guides & Insights

Ember-1 so với LFM2.5 2.6B Base: Một hành vi hoàn thiện đối đầu với một nền tảng thô

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cả Ember-1 lẫn LFM2.5 2.6B Base đều không phải là mô hình bạn có thể lấy ra và dùng ngay, và chúng không dùng được vì những lý do trái ngược nhau. Ember-1, được Fireworks Research công bố ngày 23 tháng 9 năm 2026, là một dẫn xuất chuyên biệt của Kimi K3 do Moonshot AI phát triển, được phòng thí nghiệm này huấn luyện lại để đạt độ chính xác của K3 với số token ít hơn khoảng 40% — một hành vi đã hoàn thiện, chỉ có sẵn dưới dạng bản xem trước nghiên cứu trên nền tảng serverless của chính nhà cung cấp, không có trọng số và không có giá công bố. LFM2.5 2.6B Base, được Liquid AI công bố ngày 4 tháng 8 năm 2026, là một checkpoint đã tiền huấn luyện với 2,69 tỷ tham số theo Giấy phép Mở LFM v1.0, chưa được tinh chỉnh theo chỉ dẫn chút nào và sẽ tiếp tục văn bản của bạn thay vì trả lời câu hỏi của bạn — một nền tảng thô, có thể tải xuống ngay hôm nay, cố ý chưa hoàn thiện. Đọc chúng cạnh nhau là một cách tốt để thấy hai luận điểm đang được đưa ra về việc lợi ích hiệu quả giờ đến từ đâu.

Câu hỏi mà cả hai mô hình đang trả lời

Cả hai bản phát hành đều dựa trên cùng một tiền đề: rằng những thắng lợi ít tốn kém từ việc làm cho một mô hình lớn hơn phần lớn đã được tận dụng hết, và phần việc thú vị đã chuyển sang cách một mô hình sử dụng những gì nó đã có. Hai phòng thí nghiệm trả lời điều đó theo cách khác nhau. Fireworks Research lấy một mô hình tiên phong sẵn có và thay đổi hành vi của nó. Liquid AI xây dựng một mô hình nhỏ từ đầu và thay đổi quy mô. Cả hai đều không phải là câu chuyện về một kiến trúc mới, và cả hai cũng không cố gắng đứng đầu bảng xếp hạng.

Câu trả lời của Ember-1: giữ nguyên mô hình, đào tạo lại hành vi

Ember-1 giữ nguyên kiến trúc của Kimi K3 và tấn công vào một điểm kém hiệu quả cụ thể. Các mô hình suy luận có thể đốt hơn 90% số token được tạo ra cho việc cân nhắc nội bộ, và trong vòng lặp tác nhân đa lượt, những dấu vết đó bị phát lại và tính phí lại ở mọi lượt tiếp theo — Fireworks Research mô tả mức tăng ngữ cảnh thu được là gần như bậc hai theo số lượt. Tuyên bố của phòng thí nghiệm là suy luận của K3 dài hơn mức nhiệm vụ yêu cầu và phần dư thừa có thể được loại bỏ mà không làm thay đổi câu trả lời. Họ báo cáo đã chạy hơn 50 thí nghiệm huấn luyện và hơn 200 đánh giá trên stack huấn luyện serverless của riêng mình, đồng thời cho biết độ dài suy luận giảm 35–50% mà không mất độ chính xác trên bảy benchmark và hai tập lưu lượng sản xuất của khách hàng. Tất cả những điều đó đều do nhà cung cấp báo cáo và chưa được tái lập.

Kết quả không đồng đều theo cách mà con số nổi bật che giấu. Mức giảm token của Ember-1 dao động từ 51,9% trên Terminal Bench 2.1 đến 5,9% trên τ-2 Bench Airline. Trong một thử nghiệm A/B viết mã trong môi trường production của một khách hàng, token đầu ra giảm từ 49,3K xuống 29,9K trong khi điểm số giữ nguyên ở mức 0,753 so với 0,751 — tức mức cắt giảm 71,3% token suy luận. Đó là một hiệu ứng lớn trên một dạng khối lượng công việc và gần như vô hình trên một dạng khác, đúng như điều bạn có thể kỳ vọng ở một mô hình được huấn luyện để ngừng suy nghĩ quá nhiều thay vì suy nghĩ ít hơn.

A two-column scoreboard titled "Ember-1 vs LFM2.5 2.6B Base — the scoreboard" comparing six dimensions. Ember-1: a retrained Kimi K3 derivative; parameters undisclosed; no published weights; context not published (base model 1M); published evaluation is seven benchmarks plus two A/B tests, vendor-run; obtained only as a serving preview. LFM2.5 2.6B Base: a pretrained base checkpoint with no instruction tuning; 2.69B dense parameters; weights under the LFM Open License v1.0; 131,072-token context; no published evaluation, by design; obtained by downloading and fine-tuning.

Câu trả lời của LFM2.5 2.6B Base: thay đổi quy mô, giữ nguyên công thức

LFM2.5 2.6B Base là một kiểu đặt cược khác. Đây là kiến trúc lai của Liquid AI ở quy mô nhỏ: 30 lớp, trong đó 22 lớp là khối tích chập ngắn cổng kép và 8 lớp là grouped-query attention, được huấn luyện trên khoảng 34 nghìn tỷ token thuộc 16 ngôn ngữ, với cửa sổ ngữ cảnh 131.072 token. Toàn bộ checkpoint chỉ có 2,69 tỷ tham số dense — đủ nhỏ để cuộc trò chuyện về chi phí không còn xoay quanh token nữa, mà bắt đầu xoay quanh việc bạn còn dư đúng một chiếc GPU nào.

Điều khiến nó khác thường là những gì nó chủ đích không làm. Không có tinh chỉnh theo chỉ dẫn, và đó chính là toàn bộ ý nghĩa của hậu tố "Base": đưa nó một câu hỏi và nó sẽ tiếp tục văn bản theo phong cách của câu hỏi thay vì trả lời câu hỏi đó. Thẻ mô hình của chính Liquid AI khuyến nghị dùng nó cho các tác vụ cần tinh chỉnh chuyên sâu. Cũng không có đánh giá nào được công bố về nó, và đó không phải là sự sơ suất — đánh giá một checkpoint nền trên các bài kiểm chuẩn về khả năng tuân theo chỉ dẫn sẽ không đo được gì, bởi vì hành vi đang được đo lường vẫn chưa được huấn luyện vào mô hình.

Sự tương phản, mỗi chiều một dòng

• Nó là gì — Ember-1: một dẫn xuất được huấn luyện lại của Kimi K3 với suy luận được rút ngắn. LFM2.5 2.6B Base: một checkpoint được tiền huấn luyện từ đầu, không có tinh chỉnh theo chỉ dẫn.

• Tham số — Ember-1: không được tiết lộ; kế thừa từ Kimi K3. LFM2.5 2.6B Base: 2.69B dense.

• Trọng số — Ember-1: không công bố. LFM2.5 2.6B Base: có sẵn theo LFM Open License v1.0.

• Giá — Ember-1: không công bố mức nào; chi phí đô-la benchmark dùng bảng giá của Kimi K3. LFM2.5 2.6B Base: miễn phí tải về; bạn tự lo phần cứng.

• Ngữ cảnh — Ember-1: không được công bố cho bản xem trước. LFM2.5 2.6B Base: 131.072 token.

• Đánh giá đã công bố — Ember-1: bảy bài đánh giá chuẩn và hai thử nghiệm A/B, tất cả đều do nhà cung cấp thực hiện. LFM2.5 2.6B Base: không có, theo thiết kế.

• Những gì bạn nhận được ở cuối — Ember-1: một endpoint tạo ra lập luận ngắn hơn với độ chính xác ngang mức K3. LFM2.5 2.6B Base: một điểm khởi đầu mà hành vi của nó là bất cứ thứ gì bạn huấn luyện vào.

Hai kiểu thiếu vắng khác nhau

Những khoảng trống trong hai bản phát hành này trông có vẻ đối xứng, nhưng thực tế không phải vậy. Việc LFM2.5 2.6B Base thiếu phần đánh giá là một đặc tính của chính artifact: một checkpoint base không có hành vi nào để chấm điểm, còn việc thiếu tinh chỉnh theo chỉ dẫn là một tính năng đã được ghi nhận rõ ràng chứ không phải là thiếu sót. Sự thiếu vắng đó không tạo ra bất định về mặt thương mại, bởi thứ bạn đang mua là một tệp có kèm giấy phép, và sản phẩm bàn giao đã hoàn tất ngay khi quá trình tải xuống kết thúc.

Những mảnh còn thiếu của Ember-1 thực sự vẫn chưa được giải quyết. Không có mức giá nào được công bố, nên tuyên bố về chi phí chỉ là phép tính dựa trên bảng giá của Kimi K3 chứ không phải một mức giá bạn có thể lập ngân sách dựa vào. Không có bản phát hành trọng số, nên mô hình không thể tồn tại lâu hơn quyết định tiếp tục cung cấp nó của nhà cung cấp. Và cửa sổ truy cập được mô tả là tạm thời: Fireworks Research định hình các bản phát hành nghiên cứu của mình là những cửa sổ serverless kéo dài hai tuần, mà sự tồn tại lâu dài của chúng phụ thuộc vào nhu cầu cộng đồng. Một bản xem trước có thể không còn tồn tại vào tháng sau là một chuyện khác hẳn với một bản xem trước chỉ mới chưa được kiểm chứng, và phép A/B khách hàng thứ hai trong thông báo — giảm khoảng 35% token mỗi tác vụ — cho bạn biết phòng thí nghiệm kỳ vọng điều gì, chứ không phải điều gì vẫn sẽ còn truy cập được vào tháng Mười Một.

Sự bất đối xứng đó chính là câu trả lời trung thực cho câu hỏi “cái nào trong số này sẵn sàng hơn”. Cả hai đều chưa sẵn sàng theo nghĩa có thể thay thế trực tiếp như một phụ thuộc trong sản xuất. LFM2.5 2.6B Base đã hoàn thiện với tư cách nguyên liệu thô và chưa hoàn thiện với tư cách một mô hình. Ember-1 đã hoàn thiện với tư cách một mô hình và chưa hoàn thiện với tư cách một dịch vụ.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing 16,541 downloads in the last month, a safetensors model size of 3B parameters in BF16, the LFM1.0 licence, 16 languages, and a Model Details table listing LFM2.5-2.6B-Base as the pre-trained base model for fine-tuning alongside LFM2.5-2.6B for post-trained agentic workloads.

Cần làm gì với từng thứ trong quý này

Nếu bạn có một pipeline tinh chỉnh và một tác vụ hẹp với nhãn sạch, LFM2.5 2.6B Base là lựa chọn dễ dự đoán hơn trong hai. Checkpoint nhỏ, giấy phép thoáng, kiến trúc được thiết kế để suy luận hiệu quả, và công việc biến nó thành thứ hữu ích — tinh chỉnh có giám sát, một bộ đánh giá, một serving stack — là công việc bạn đã làm chủ từ đầu đến cuối. Dù sao thì bạn cũng sẽ tự chạy các đánh giá của mình, vì Liquid AI đã không công bố bất kỳ đánh giá nào.

Nếu bạn có một khối lượng công việc agent được lưu trữ mà hóa đơn của nó bị chi phối bởi các token suy luận, thì Ember-1 giải quyết một hạng mục thực sự trong phương trình chi phí của bạn, và nó đáng để bỏ ra hai tuần. Phép thử đúng đắn là lưu lượng bóng (shadow traffic) đối chứng với hệ thống hiện tại của bạn: gửi một phần yêu cầu thực đến cả hai, so sánh đầu ra, và để yên kết quả trực tiếp. Đó cũng là lời khuyên mà các bài đánh giá phê bình độc lập về bản phát hành đưa ra, cùng với một lời cảnh báo chính đáng — việc nén bớt quá trình cân nhắc có nguy cơ làm mất đi một bước mà mô hình cần, và trong một agent, điều đó về sau sẽ biểu hiện thành một lệnh gọi công cụ sai thay vì một câu sai.

Cả hai mô hình đều không có trên OrcaRouter. Nếu bạn muốn kiểm thử mô thức này thay vì hai sản phẩm cụ thể kia — một mô hình nhỏ có thể tinh chỉnh và một mô hình suy luận lớn chạy trên nền tảng lưu trữ, trong cùng một pipeline — thì đó chính xác là mục đích của DSL định tuyến: kết hợp nhiều mô hình vào một lời gọi duy nhất và để mỗi mô hình đảm nhận phần việc mà nó làm tốt, phía sau một khóa duy nhất và một hóa đơn duy nhất. Việc so sánh ở đây vẫn đáng để thực hiện ở cấp độ kiến trúc, ngay cả khi cả hai điểm cuối cụ thể vẫn nằm ngoài tầm với.

Giao dịch, được nêu một lần

Ember-1 đem lại sự chắc chắn về hành vi và sự bất định về nguồn cung: một mô hình mà chất lượng được lập luận kỹ lưỡng và tính sẵn có được nêu rõ là có điều kiện. LFM2.5 2.6B Base đem lại sự chắc chắn về nguồn cung và sự bất định về hành vi: một tệp bạn sẽ luôn có và năng lực của nó hoàn toàn phụ thuộc vào quá trình huấn luyện bạn đưa vào nó. Các đội có vấn đề về phục vụ và không có năng lực huấn luyện nên theo dõi bản xem trước và hy vọng nó trở thành thường trực. Các đội có năng lực huấn luyện và một tác vụ hẹp nên tải bản base về và ngừng chờ đợi lộ trình của bất kỳ ai.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

Điều mà sự kết hợp này thực sự cho thấy là "hiệu quả" đã không còn chỉ mang một nghĩa. Với Ember-1, nó có nghĩa là ít token hơn ở cùng chất lượng trên phần cứng của người khác. Với LFM2.5 2.6B Base, nó có nghĩa là một mô hình đủ nhỏ để phần cứng không còn là của người khác nữa. Cả hai đều là những câu trả lời tốt và chúng không thể hoán đổi cho nhau.