생성된 타이틀 카드에는 'Clef vs LFM2.5 2.6B Base'라는 제목이 적혀 있고, 'H200의 55 GB 대 노트북의 5.4 GB'라는 부제가 붙어 있으며, '27B 의사결정 모델'과 '2.69B 사전 학습 베이스'라고 적힌 칩이 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Engineering & Research

Clef vs LFM2.5 2.6B Base: H200에서는 55 GB, 노트북에서는 5.4 GB

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

다음은 모델이 결정하기도 전에 하드웨어가 논쟁의 승자를 정하는 비교입니다. Cloudflare/clef는 Qwen3.8-27B에서 후속 학습된 270억 개의 매개변수를 가진 멀티모달 의사결정 모델로, 저장소 크기는 12개의 백본 샤드와 작은 조인트 스키마 헤드를 합쳐 55GB가 조금 넘습니다. LiquidAI/LFM2.5-2.6B-Base는 26억 9천만 개의 매개변수를 가진 텍스트 전용 체크포인트이며, 가중치가 단일 5.4GB 파일이고, Liquid AI가 2026년 8월 1일 LFM Open License에 따라 공개했습니다. Cloudflare가 자체 공개한 Clef의 지연 시간 — 중앙값 209.3ms, p95 238.6ms — 은 단일 H200에서 측정되었습니다. Liquid AI가 LFM2.5 제품군에 의도한 배포 환경은 노트북, 휴대폰 또는 Ryzen 핸드헬드입니다. 두 공급업체 모두 자신들의 모델을 작고 빠르며 효율적이라고 설명하는데, 둘 다 서로 다른 기계에 대해 진실을 말하고 있습니다.

첫 번째 뒤에는 두 번째 격차가 있고, 그것이 실제로 계획을 바꾸는 격차입니다. 둘 중 어느 쪽도 Clef도LFM2.5 2.6B Base도 당신이 아마 기대하는 방식으로 별도 설정 없이 질문에 답하지 않습니다. Clef는 벗어날 수 없는 한 가지 작업을 위해 완전히 훈련된 채 도착합니다. 즉 입력된 질문에 답하며, 그 외에는 아무것도 하지 않습니다. Liquid 체크포인트는 어떤 것에 대해서도 전혀 훈련되지 않은 채 도착합니다. 그것은 의도적으로 인스트럭션 튜닝이 없는 베이스 모델이며, Liquid AI의 자체 카드에는 고강도 파인튜닝에만 권장된다고 나와 있습니다. 따라서 진짜 질문은 어느 쪽이 실행 비용이 더 저렴한가가 아닙니다. 그것은 완성된 구성 요소를 사는 것인지 아니면 출발 물질을 사는 것인지이며, 답은 각각 다릅니다.

각각이 어디에서 실행되는지, 그리고 왜 그것이 비교의 전부인지

배포 형태는 이 두 모델에게 곁다리 같은 이야기가 아니다. 의사결정 모델에게 그것은 곧 아키텍처다. 209 ms의 순전파와 "바로 눈앞의 기계에서 돌아간다"는 이야기는 같은 주장을 서로 다른 끝에서 말한 것일 뿐이기 때문이다.

• 파라미터 — Clef의 경우 27B이며 Qwen3.8-27B 비전 인코더가 유지됩니다. LFM2.5 2.6B Base의 경우 텍스트 전용 2.69B입니다.

• 디스크 — Clef용 55GB 저장소입니다. Liquid 체크포인트용 5.4GB safetensors 파일 하나가 있으며, 양자화된 GGUF, ONNX 및 MLX 빌드가 함께 공개됩니다.

• 하드웨어 — Cloudflare는 단일 H200에서 torch 2.11과 transformers 5.10.2로 Clef를 테스트했으며, 지연 시간 수치는 그 실행에서 나온 것입니다. Liquid AI가 포스트 트레이닝한 이 체크포인트의 형제 모델은 Apple M5 Max에서 초당 220토큰, AMD Ryzen CPU에서 113 tok/s로, 2.5GB 미만의 메모리에서 실행되며, 벤더는 휴대폰에서도 30 tok/s가 가능하다고 언급합니다.

• 컨텍스트 — Workers AI 모델 페이지와 출시 게시물에 따르면 Clef는 65,536 토큰, LFM2.5 2.6B Base는 131,072 토큰입니다.

• Input — Clef는 텍스트, JSON, 이미지, 비디오 프레임을 읽고 이를 함께 평가합니다. Liquid 체크포인트는 텍스트 전용입니다.

• 라이선스 — Clef는 Apache-2.0입니다. LFM2.5는 LFM Open License v1.0을 따르는데, 이는 OSI 오픈 소스라기보다 소스 공개(source-available) 라이선스입니다. 상업적 사용은 조직의 연간 매출이 1,000만 달러 미만을 유지한다는 조건부이며, 그 기준을 넘으면 이 라이선스는 상업적 사용을 허여하지 않습니다. 이 임계값은 각주가 아니라 조달상의 사실입니다.

A two-column comparison scoreboard titled 'Clef vs LFM2.5 2.6B Base — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; On disk: 55 GB repository; Context: 65,536 tokens; Output: probability per option, no text; Hardware: H200 class, 209.3 ms median; Licence: Apache 2.0. The right column 'LFM2.5 2.6B Base' reads: Parameters: 2.69B text-only; On disk: 5.4 GB single file; Context: 131,072 tokens; Output: untuned text continuation; Hardware: laptop, 220 tok/s on M5 Max; Licence: LFM 1.0, $10M revenue threshold. A footer reads 'Clef figures per Cloudflare; LFM figures per Liquid AI's cards. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

결정당 비용은 토큰당 비용과 같은 질문이 아니다

여기서 유혹적인 선택은 두 가격을 나누고 승자를 선언하는 것이다. 그것은 두 모델이 실제로 하는 일과 맞닥뜨리면 살아남지 못한다.

Clef는 Cloudflare의 Workers AI에서 입력 토큰 백만 개당 $0.24입니다. 그 출력은 산문이 아니므로, 일반적인 출력 토큰 항목은 존재하지 않습니다. 상태에 대해 한 번 비용을 지불하고 분포를 돌려받습니다. 하루에 수백만 개의 작은 결정을 내리는 라우팅 계층에게 그 숫자는 전체 운영 비용이며, 그것은 자체 전기 요금 청구서가 아니라 공급업체로부터만 얻을 수 있는 숫자입니다.

LFM2.5 2.6B Base는 호출당 비용이 들지 않고 결정을 내릴 수도 없다. 여기서 결정당 비용을 얻으려면 먼저 해당 작업에 맞게 파인튜닝해야 하며, 그 말은 데이터를 모으고, 학습 작업을 실행하고, 결과를 평가한 다음에야 kVA와 엔지니어링 시간으로 얼마가 드는지 알게 된다는 뜻이다. 2.6B 체크포인트의 매력적인 경제성은 실재하지만, 그것은 아직 일어나지 않은 작업의 뒤에 달려 있으며, 토큰당 가격을 비교하는 사람은 그 부분을 그냥 건너뛰고 지나갔다.

솔직히 말하자면, 이것은 서로 다른 두 가지 구매입니다. Clef는 정가와 호스팅 비용이 있는 구성 요소입니다. Liquid 체크포인트는 원재료로, 그 비용은 어느 쪽이든 지불하게 될 학습 실행이며, 그 보상은 이후에 그 결과물을 완전히 소유하게 된다는 것입니다. 그 시점에서 의사결정의 한계비용은 정말로 전기료입니다. 범위가 좁고 대량이며 안정적인 작업에서는 그 선택이 대개 옳습니다. 아직 명세하지 않은 작업에서는 이는 거꾸로입니다. 설명할 수 없는 목표를 향해 파인튜닝할 수는 없기 때문입니다.

훈련되지 않은 베이스는 더 나쁜 모델이 아니라, 다른 출발선이다

Liquid 체크포인트에 벤치마크 표가 없는 것을 숨은 약점으로 해석하고 싶어지기 쉽다. 하지만 그렇지 않다. 사전 학습된 베이스 모델을 지시 따르기 벤치마크로 채점하는 것은 기반의 품질이 아니라 파인튜닝의 부재를 측정하는 셈이며, 바로 그렇기 때문에 Liquid AI는 post-training을 거친 LFM2.5-2.6B를 벤치마킹하고 베이스 모델은 평가하지 않은 채 둔다. 그 빈칸은 당신 쪽에서 검증할 수 있으며, 그게 바로 핵심이다: 5.4GB를 다운로드하고, 당신의 과제에 대해 직접 평가를 실행하고, 무엇이든 서비스하기로 결정하기 전에 답을 알아내라.

Clef의 표는 증거의 형태가 정반대이고 문제도 정반대다. Cloudflare는 40여 개의 벤치마크 행과 전체 워크플로 평가 세트, 지연 시간 분포를 공개하는데, 그 하나하나가 Cloudflare가 자사의 Decision Index에서 산출한 것이며 어떤 제3자도 이를 재현하지 않았다. Clef 열은 Liquid 열보다 훨씬 더 많은 정보를 제공하지만, 그 안의 어떤 수치도 다른 누구도 검증한 적이 없다. 그것은 빈칸보다는 강한 주장이고, 보기보다는 약한 주장이다.

직접 측정할 수 있는 것도 같은 방식으로 나뉩니다. Liquid 체크포인트의 경우, 모든 것을 측정할 수 있습니다 — 자체 디스크에서 5.4 GB입니다. Clef의 경우, Apache-2.0 가중치는 마찬가지로 다운로드해 실행할 수 있는 여러분의 것이지만, Cloudflare의 209 ms 중앙값을 맞추려면 Cloudflare가 사용한 등급의 GPU가 필요하므로, 실제로 대부분의 팀은 호스팅 엔드포인트를 통해 이를 측정하게 되고 지연 시간과 함께 공급업체의 가용성까지 물려받게 됩니다.

각각에 대해 라우팅 계층이 어디에 맞는지

Clef도, 어떤 LFM2.5 변형도 OrcaRouter의 라우트가 아니며, 이 글은 가용성 주장이 아닙니다 — 카탈로그는 둘 모두에 대해 404를 반환하므로, Clef는 Cloudflare의 Workers AI 또는 자체 GPU에서 오고, Liquid 체크포인트는 자체 배포본에서 옵니다.

여기서 라우팅 레이어가 진정으로 맡는 역할은 두 모델이 함께 암시하는 패턴이다. 결정을 내리는 작고 경계가 정해진 스코어러와, 그 결정에 따라 행동하는 더 큰 범용 모델은 구조적으로 2-모델 아키텍처다. 그리고 Clef 자체의 백본이 그 후반부를 구체적으로 보여주는데, Cloudflare가 후속 학습을 진행한 모델인 Qwen3.8 27B는 262,144 토큰 컨텍스트에서 입력 100만 토큰당 $0.33, 출력 100만 토큰당 $2.40의 등록된 라우트다. 200개가 넘는 모델 앞에 놓인 하나의 엔드포인트는 값싼 결정자와 유능한 실행자가 같은 키 뒤에 자리한다는 뜻이며, 라우팅 DSL을 통해 단일 호출로 구성되는 것이지 손으로 직접 엮는 것이 아니다. 자동 장애 조치가 있어 특정 공급자의 안 좋은 오후가 결정 경로까지 함께 끌어내리지 않는다. 대신 Liquid 체크포인트를 자체 호스팅하면서 자신의 파인튜닝을 그것이 반드시 이겨야 할 모델들과 비교하고 있다면, 바로 이 동일한 엔드포인트 덕분에 그 비교가 조달 주기가 아니라 구성 변경 한 번으로 끝난다.

TypeSafe의 Jev 1.13은 특히 자체 호스팅 사례에서 언급할 가치가 있습니다: 이는 Cloudflare가 벤치마크 대상으로 삼은 결정 모델이며, 의도적으로 동일한 POST /v1/systemone 요청 형태를 Clef와 같이 사용하며, 65,536토큰 컨텍스트에서 입력 토큰 백만 개당 $0.042에 책정된 라우트로 등록되어 있고, 존재할 필요가 없을 수도 있는 기반에 학습 실행을 투자하기 전에 제한된 결정 모델이 파이프라인에 도움이 되는지 알아보는 저비용 방법입니다.

A headless capture of the OrcaRouter model page for qwen/qwen3.8-27b, showing the Qwen breadcrumb, the Qwen3.8 27B title with a 262K context marker, the text, image and video input modalities, and the site's Code samples, Pricing, Performance, Public benchmarks and FAQ navigation tabs.

어느 것, 무엇을 위해

작업이 좁고, 대량이며, 학습 데이터를 작성할 수 있을 만큼 충분히 구체적으로 명세되어 있고, 라우팅된 API가 해결할 수 없는 두 가지 강한 제약 중 하나에 묶여 있을 때 Liquid 체크포인트를 선택하세요: 데이터가 자체 인프라를 벗어날 수 없거나, 실행해야 하는 머신이 바로 책상 위에 있는 머신인 경우입니다. LFM 1.0 매출 임계값은 가장 먼저 확인해야 할 항목입니다. 그것이 해당 라이선스를 이용할 수 있는지 자체를 결정하기 때문입니다.

결정이 이미 열거 가능하고, 상태가 64K 이내에 있고, 답이 문장보다는 보정된 확률을 필요로 하며, 핫 패스에서 209ms가 구매하려는 속성일 때 Clef를 선택하세요. 고정 스키마가 바로 기능입니다 — 감사 가능하고 재현 가능하며 파서가 필요 없는 출력 형태 — 그리고 55GB 풋프린트는 훈련 실행 후가 아니라 첫 시도에 정확하게 만드는 백본의 대가입니다.

여러분이 해서는 안 되는 일은 매개변수 수로 고르는 것이다. 답변할 수 있으려면 훈련을 거쳐야 하는 2.69B 모델은 이미 답할 수 있는 27B 모델의 더 작은 버전이 아니며, 제목에 나오는 두 숫자 — 55 GB와 5.4 GB — 는 하나의 척도 위에 있는 두 점이 아니라 서로 다른 두 예산을 나타낸다.

A headless capture of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the model title, the TextGeneration and Transformers and Safetensors tags, a 16-languages marker, the Liquid AI organisation, and the opening line describing the LFM2.5 family as hybrid models designed for on-device deployment.

미해결된 질문, 그리고 그것은 둘 모두에게 같은 질문이다.

어느 벤더도 독립적 검증을 견뎌 낼 증거를 공개하지 않았다. Cloudflare의 Decision Index 실행은 자체 수행되었고 재현되지 않았다. Liquid AI의 처리량 수치는 자사가 선택한 하드웨어에서 벤더가 직접 측정한 값이다. LFM2.5 2.6B Base에는 설계상 벤치마크가 전혀 없으며, Clef 표에는 선택에 따라 아주 많은 벤치마크가 있다.

Liquid 체크포인트의 경우, 빠진 증거는 해결하는 데 비용이 적게 들고 전적으로 여러분 손에 달려 있습니다 — 파일이 노트북으로 한나절이면 평가할 수 있을 만큼 작습니다. Clef의 경우는 다릅니다: 209 ms 중앙값을 재현하려면 Cloudflare가 사용한 하드웨어와 Cloudflare 밖의 누구도 구성하지 못한 상태가 필요합니다. 그 비대칭성이, 두 명세서 중 어느 것에 있는 그 무엇보다도, 이번 달에 이 둘 중 어느 쪽을 중심으로 계획할지를 좌우해야 합니다.