
AREX-2 vs. LFM2.5 2.6B Base: Ein leeres Repo und ein Checkpoint ohne Anweisungen
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 507 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 194 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Setzt man AREX-2 neben LFM2.5 2.6B Base, ist das Erste, was sie gemeinsam haben, dass keines von beiden ein Produkt ist, das man heute nutzen kann — aus Gründen, die nichts miteinander zu tun haben. AREX-2 ist ein Hugging Face-Repository, das BAAI am 29. September 2026 um 17:56 UTC erstellt hat; es enthält eine .gitattributes-Datei, speichert null Bytes an Modelldaten und trägt weder eine Modellkarte noch ein Lizenz-Tag noch irgendeine Ankündigung. LFM2.5 2.6B Base, veröffentlicht von Liquid AI im August 2026, ist die entgegengesetzte Art von Unfertigkeit: ein vollständiger, herunterladbarer Text-Only-Checkpoint mit 2,69 Milliarden Parametern unter der LFM Open License (lfm1.0), der bewusst ohne Instruction-Tuning ausgeliefert wird, weil er zum Fine-Tuning gedacht ist und nicht dazu, Fragen zu beantworten.
Das eine ist das Fehlen eines Artefakts. Das andere ist ein Artefakt, dem ein Schritt fehlt, den es nie hätte haben sollen. Das ist nur dann dieselbe Kategorie, wenn man flüchtig liest, und sie als dieselbe Kategorie zu behandeln, führt genau dazu, dass ein Team auf das Falsche wartet. Der nützliche Vergleich zwischen diesen beiden ist nicht die Fähigkeit – es gibt kein AREX-2, das man messen könnte –, sondern wofür jedes Einzelne ein Rohmaterial ist, und was es kostet, herauszufinden, ob es etwas taugt.
Der Unterschied der Art, zuerst genannt
LFM2.5 2.6B Base ist ein. Es ist der vortrainierte Checkpoint von Liquid AIs LFM2.5: 30 Schichten, davon 22 dual-gated Short-Convolution-Blöcke und 8 Grouped-Query-Attention, trainiert auf rund 34 Billionen Tokens in 16 Sprachen, mit einem Kontextfenster von 131.072 Tokens und einem quantisierten Build, der bei Q4_K_M bei etwa 1,67 GB landet. Es hat kein Instruction-Tuning. Gib ihm eine Frage, und es setzt den Text fort; es antwortet nicht. Die eigene Model Card von Liquid AI verweist auf umfangreiches Fine-Tuning als vorgesehenen Einsatzzweck, und es gibt ein nachtrainiertes Geschwistermodell für alle, die ein Modell wollen, das auf Prompts reagiert. Es ist ein Substrat, und die Tatsache, dass es bei Prompt-Following-Benchmarks schlecht abschneidet, ist kein Defekt — sie ist die Definition der Sache.
AREX-2 ist weder eine Substanz noch ein Produkt; es ist ein Namespace. Die einzigen verfügbaren Fakten sind die Organisation (BAAI), der Erstellungszeitstempel (29. September 2026) und der Name. Es wurde nichts hochgeladen und nichts gesagt. Der Name selbst gehört zu einer Familie, die tatsächlich existiert: Am 23. Juli 2026 veröffentlichte BAAI AREX-Base, ein 122-Milliarden-Parameter-Mixture-of-Experts mit 10 Milliarden aktiven Parametern, basierend auf Qwen3.5-122B-A10B, und AREX-Turbo, ein dichtes 4B-Modell basierend auf Qwen3.5-4B — beide unter Apache 2.0, beide Deep-Research-Agenten mit einem Zwei-Schleifen-Design, das Beweise sammelt, eine Kandidatenantwort mit einer Konfidenzzahl erzeugt, diese Antwort dann anhand der ursprünglichen Einschränkungen überprüft und sie verfeinert oder neu startet. Die veröffentlichten Zahlen, vom Anbieter gemeldet und nicht unabhängig reproduziert, reichen bis 82,5 bei BrowseComp und 85,4 bei GAIA für die Base sowie 70,7 / 81,6 für die Turbo.
• Verfügbarkeit — LFM2.5 2.6B Base ist jetzt herunterladbar. AREX-2 hat keine Dateien in seinem Repository.
• Größe — 2,69B dichte Parameter für das Liquid-Modell, alle im Checkpoint sichtbar. Für AREX-2 unbekannt; die Familie umfasst ein 122B-MoE und ein dichtes 4B, sodass die „2“ nichts vorhersagt.
• Kontext — 131.072 Tokens für LFM2.5 2.6B Base. Für AREX-2 ist nichts veröffentlicht.
• Lizenz — LFM Open License v1.0, unter 10 Mio. USD Jahresumsatz, und bei oder über dieser Grenze ist eine separate Lizenz erforderlich. AREX-2 hat noch kein Lizenz-Tag; die erste AREX-Generation war Apache 2.0.
• Was es ist — ein Fine-Tuning-Substrat gegenüber, wenn die Familie ein Hinweis ist, einem gehosteten Agenten, dessen Wert in einer Such-und-Verifizieren-Schleife liegt statt in seinen Gewichten.

Leere Scorecards, die Gegensätzliches bedeuten
Keines der beiden Modelle hat einen Benchmark, an dem man seine Planung ausrichten sollte, und die Gründe dafür gehen völlig auseinander.
Liquid AI verbirgt nichts, indem es sein Base unbenotet lässt. Einen vortrainierten Checkpoint anhand von Instruction-Following-Benchmarks zu bewerten, würde das Fehlen von Fine-Tuning messen, nicht die Qualität des Substrats – weshalb das Unternehmen das nachtrainierte Geschwistermodell benchmarkt und das Base unbewertet lässt. Diese Lücke ist von Ihrer Seite aus überprüfbar, und genau darum geht es: Sie können 1,67 GB herunterladen, Ihre eigene Evaluation auf Ihrer eigenen Aufgabe ausführen und die Antwort kennen, bevor Sie irgendetwas für das Serving ausgeben.
Die Leerstelle bei AREX-2 ist keine Designentscheidung, sondern ein Noch-nicht. Es gibt nichts herunterzuladen, also gibt es nichts zu testen, und keine Evaluation, die man diese Woche durchführen könnte, würde irgendetwas darüber sagen. Wer in den nächsten Tagen AREX-2-Benchmark-Zahlen veröffentlicht, veröffentlicht etwas, das er nicht gemessen haben kann.

Zwei verschiedene Fragen zum Fine-Tuning
Da es sich bei beiden um Ausgangspunkte und nicht um fertige Dienste handelt, lohnt es sich, genau zu bestimmen, wofür jedes von ihnen ein Ausgangspunkt wäre, denn genau hier hören sie wirklich auf, einander zu ähneln.
Ein 2,69B-Hybrid-Checkpoint ist ein Werkzeug, um ein kleines, günstiges, spezialisiertes Modell zu erstellen. Die interessanten Einsatzmöglichkeiten sind die unspektakulären: ein Klassifikator, der in einem regulierten Workflow einen Dokumenttyp liest, ein Extraktionsmodell, das ein Formular in strukturiertes JSON umwandelt, ein domänenspezifischer Rewriter, der auf einer einzelnen Karte nahe an den Daten läuft. Der Wert entsteht dadurch, dass Sie das Artefakt anschließend besitzen und die Grenzkosten eines Aufrufs Strom sind. Die Trainingsschleife ist die Arbeit, und es ist Arbeit, die Sie heute beginnen können.
AREX-2 weist in die andere Richtung. Die AREX-Familie ist nicht dafür ausgelegt, zu einem Produkt feinabgestimmt zu werden; sie ist dafür ausgelegt, als Agent zu fungieren, der Suchvorgänge ausführt, Belege integriert und seine eigenen Antworten anhand von Randbedingungen verifiziert. Wenn eine zweite Generation das fortsetzt, wäre das, was Sie bewerten würden, eine Trajektorie – wie viele Schritte sie benötigt, ob sie einen Widerspruch bemerkt, ob die Konfidenzangabe zu ihrer Kandidatenantwort etwas bedeutet. Das ist keine Frage des Fine-Tunings und keine Frage der Gewichte. Es ist eine Serving-Frage, und sie beginnt damit, dass jemand Gewichte und eine Modellkarte veröffentlicht.
Diese sind in keiner Größe ein Ersatz. Ein Team, das ein Modell braucht, das es selbst besitzen und neu trainieren kann, wartet nicht auf AREX-2. Ein Team, das einen Research-Agenten braucht, wird nicht ein 2,6B-Hybridmodell zu einem solchen fine-tunen.
Wo die Routing-Schicht, für jedes von ihnen
Der praktische Unterschied zwischen diesen beiden zeigt sich in dem Moment, in dem ein Modell in eine Anwendung gelangt, weil die beiden gegensätzliche Beziehungen zum Hosting haben.
LFM2.5 2.6B Base ist nicht im Katalog von OrcaRouter und keine LFM2.5-Variante ist gelistet, also stammt es aus Liquid AIs eigener Distribution und den üblichen Drittanbieter-Hosts — ein lokales Artefakt statt eines gerouteten Endpunkts. AREX-Base und AREX-Turbo sind auch nicht in unserem Katalog. Wofür eine Routing-Schicht in diesem Bild wirklich da ist, ist die andere Seite der Architektur: An dem Tag, an dem du dein Fine-Tuning mit den Modellen vergleichst, die es schlagen muss, möchtest du, dass dieser Vergleich eine Konfigurationsänderung kostet statt eines Beschaffungszyklus. Eine API vor über 200 Modellen, Anbieter-Listenpreis durchgereicht, ohne Aufschlag pro Token, ein Schlüssel für das gesamte Panel und Failover, damit ein schlechter Nachmittag eines Anbieters nicht zu einem schlechten Nachmittag deiner Evaluierung wird. Das sind die Bedingungen, unter denen ein A/B-Test mit einem nicht bewährten Modell günstig genug ist, um tatsächlich durchgeführt zu werden.
Das ist auch die ehrliche Einordnung für AREX-2 selbst. Wenn es erscheint – vorausgesetzt, es erscheint mit offenen Gewichten, wie seine beiden Vorgänger –, ist der vernünftige Weg, einen brandneuen Agenten an einer echten Arbeitslast auszuprobieren, ein Nebenpfad, hinter Failover, nicht als der einzige Anbieter, von dem Ihre Produktionsschleife abhängt.
Was eine vernünftige Person diese Woche mit jedem macht
Wenn Sie eine kleine, eng gefasste Aufgabe und Daten haben, die Ihre Infrastruktur nicht verlassen dürfen, ist der Liquid-Checkpoint verfügbar, klein, permissiv lizenziert unterhalb einer Umsatzschwelle und heute Nachmittag testbar. Laden Sie ihn herunter, führen Sie ihn auf Ihrem eigenen Evaluierungsdatensatz aus, und lassen Sie das Ergebnis entscheiden. Nichts an AREX-2 ändert diesen Plan.
Wenn Sie heute Verhalten für langfristige Forschung brauchen, ist das Modell, zu dem Sie greifen sollten, das, das bereits existiert: AREX-Base, im Juli ausgeliefert, mit veröffentlichten Agenten-Benchmarks, die Sie zumindest gegen ein Paper abgleichen können. AREX-2 ist ein Name mit einem Zeitstempel, und die zwei Dinge, die seinen Status ändern würden, sind von außen sichtbar — ob Dateien im Tree auftauchen und ob zusammen mit ihnen eine Karte mit Parameteranzahl und Lizenz erscheint.
Der Fehlermodus, den dieser Artikel verhindern soll, ist der, bei dem ein reservierter Name als Roadmap-Eintrag behandelt wird. Er ist keiner. Er ist ein Repository, das BAAI gestern angelegt hat, und der richtige Umfang an Planung, den man jetzt dafür betreiben sollte, ist keiner.
