
Perceptron Mk1.5 vs. Qwen 3.8: Der Roboter braucht beide, und keines von beiden ist ein Ersatz.
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 610 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 189 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Ein Roboter, der etwas aufnehmen muss, braucht zwei Dinge von einem Modell, und kein einzelnes Modell in dieser Paarung liefert beides. Perceptron Mk1.5 liefert Geometrie zurück: Aus Videoframes kann es einen Punkt, eine Box, ein Polygon oder ein zeitgestempeltes <track>-Element zurückgeben, und sein Kontextfenster umfasst 36.864 Tokens. Qwen 3.8 – der Name, der für den Open-Weights-Kern Qwen3.8-2.4T-A95B des Anbieters steht – ist ein Mixture-of-Experts-Reasoner mit 2,4 Billionen Parametern und einem nativen 262K-Fenster, das sich in Richtung einer Million erstreckt, und es ist textbasiert, kann also gar nicht auf die Frames schauen. Eines ist eine Wahrnehmungsschicht, die 0,15 $ und 1,50 $ pro Million Tokens kostet; das andere ist ein Reasoning-Kern, der beim Input etwa dreizehnmal so viel und beim Output viermal so viel kostet und im Artificial Analysis Intelligence Index eine unabhängige Punktzahl von 40 hat, während das Wahrnehmungsmodell nirgendwo eine unabhängige Punktzahl besitzt.
Wenn man sie als konkurrierende Produkte nebeneinanderstellt, verlieren sie in entgegengesetzte Richtungen gegeneinander, und der Vergleich liefert nichts Brauchbares. Wenn man sie als die beiden Hälften einer einzigen Pipeline nebeneinanderstellt, erklären sie nahezu jede Kosten- und Zuverlässigkeitsentscheidung in einem verkörperten Stack: wo die Frames interpretiert werden, wo der Plan entsteht und was mit Ihrer Rechnung passiert, wenn die Reasoning-Hälfte mehr Tokens schreibt, als die Aufgabe benötigt.
Die Aufteilung, die diese Paarung sinnvoll macht
Perceptron Mk1.5 wurde am 25. September 2026 als Nachfolger von Perceptron Mk1 ausgeliefert, und seine Aufgabe ist eng definiert. Es akzeptiert Text, Bilder, Video und Audio und gibt Text plus optionale strukturierte Annotationen zurück – Punkte, Bounding Boxes, Polygone, Clips und Tracks. Die <track>-Ausgabe enthält sowohl eine räumliche Beobachtung als auch den Zeitstempel, zu dem sie gehört, sodass ein 60-Sekunden-Clip als Positionen über die Zeit zurückkommt statt als eine gemittelte Schätzung. Ein asset_idx-Feld ermöglicht es, mit einer einzigen Anfrage mehrere Bilder oder Videos getrennt zu adressieren, was ein Vergleich zwischen Referenz-Frame und Live-Frame benötigt. Eingeschränkte Antworten gibt es in zwei Varianten, JSON Schema und Regex, und der ganze Sinn beider ist, dass die Ausgabe typisiert ist.
Qwen 3.8 ist ein Instrument der entgegengesetzten Art. Der 2,4T-Kern ist ein feinkörniges MoE — 92 Schichten, 512 Experten pro Schicht mit 10 gerouteten plus einem geteilten, und 69 dieser 92 Schichten mit linearer Attention — so erreicht eine derart große Architektur ihren langen Kontext. Seine Stärke ist das Reasoning über viel Text: komplexe mehrstufige Analysen, lange Herleitungen, agentische Planung. Seine Schwäche ist die Eingabeseite. Der offene Kern ist reiner Text, und sein Reasoning lässt sich nicht abschalten: Jede Antwort beginnt mit einem Denkblock, ob man einen wollte oder nicht.
Das ist kein Mangel eines Reasoning-Modells; es ist ein Mangel eines Wahrnehmungsmodells, und Qwen 3.8 ist keines. Reiht man die beiden aneinander, ist das Muster offensichtlich — Mk1.5 beantwortet „Wo ist der Gabelstapler und wann hat er sich bewegt“, Qwen 3.8 beantwortet „Was sollte der Arm angesichts dessen tun“. Keine der beiden Fragen ist durch das jeweils andere Modell beantwortbar.

Was jede Hälfte kostet – zu den Sätzen, die tatsächlich abgerechnet werden
• Eingabe — Perceptron Mk1.5 0,15 $ pro Million Tokens. Qwen 3.8 2,00 $ pro Million auf dem gehosteten Build, den der unabhängige Harness misst, mit einem angewendeten Cache-Rabatt von 88 %, wodurch ein Cache-Treffer auf etwa 0,24 $ kommt.
• Output — Mk1.5 1,50 $ pro Million. Qwen 3.8 6,00 $ pro Million.
• Cache — Der gecachte Input von Mk1.5 kostet 0,0375 $ pro Million, ein pauschales Viertel seines Standard-Input-Tarifs. Der Rabatt von Qwen 3.8 ist prozentbasiert, aber höher, bei 88 %, sodass sein Cache-Tarif in absoluten Zahlen der günstigere der beiden Tarife ist und sein Nicht-Cache-Tarif mehr als zehnmal so hoch ist wie der von Mk1.5.
• Kosten pro abgeschlossener Aufgabe — hier kehrt sich das Ranking um. Artificial Analysis beziffert die Kosten von Qwen 3.8 pro Aufgabe des Intelligence Index auf 2,16 $; das Modell liegt damit auf Platz 32 von 115 in seiner Klasse und wird in der Kategorie Kosten mit vier von vier Einheiten bewertet — günstig pro erledigter Aufgabe trotz teurer Tokens, weil das Modell über die Index-Läufe hinweg 170 Mio. Output-Tokens generierte, gegenüber einem Teilnehmerfeld, das noch stärker ausschweift. Für Mk1.5 hat niemand eine vergleichbare Zahl veröffentlicht.
• Kontext — 36.864 Token für Mk1.5 gegenüber nativen 262K für den Qwen-Kern, erweiterbar auf eine Million mit der richtigen Serving-Konfiguration.
• Reasoning-Steuerung — Mk1.5 stellt reasoning_effort mit high, medium, low, minimal oder none bereit und verwendet standardmäßig high. Qwen 3.8 erzwingt aktiviertes Denken, sodass du bei jedem Aufruf für die Thinking-Tokens bezahlst.
Lies dir diese Liste zweimal durch, denn bei den Kosten verhalten sich die beiden Modelle genau umgekehrt. Pro Token ist Mk1.5 dramatisch günstiger. Pro erledigter Aufgabe in einem unabhängigen Benchmark wird Qwen 3.8 als günstig gemessen, während Mk1.5 nicht gemessen wird. Diese beiden Aussagen sind nur dann widersprüchlich, wenn man annimmt, dass sie dieselbe Aufgabe erledigen, und das tun sie nicht.

Hier weist die Beweislage in die andere Richtung.
In den meisten Vergleichen in diesem Batch steht auf der Seite der offenen Gewichte ein Stapel von vom Anbieter gemeldeter Zahlen, während die geschlossene API diejenige mit einer Drittanbieter-Seite ist. Hier ist es umgekehrt, und diese Umkehrung sollte man ausdrücklich benennen, gerade weil sie verändert, was sich verifizieren lässt und was nicht.
Qwen 3.8 verfügt über eine unabhängige Messung. Der Artificial Analysis Intelligence Index ordnet den 2,4T-Kern bei 40 ein, was zum Zeitpunkt des Verfassens Rang 5 von 115 Modellen seiner Klasse entspricht, bei einer Ausgabegeschwindigkeit von 39,6 Token pro Sekunde – Rang 56 von 115, also im Mittelfeld, was man wissen sollte, bevor jemand eine interaktive Schleife darum herum plant. Index-Revisionen verschieben sich zwischen Momentaufnahmen, und der ehrliche Weg, eine dieser Zahlen zu lesen, ist, sie als richtungsweisend zu verstehen, aber der Punkt bleibt: Jemand außerhalb von Alibaba hat dieses Modell laufen lassen und eine Zahl veröffentlicht.
Perceptron Mk1.5 hat nichts dergleichen. Es gibt keinen Artificial-Analysis-Eintrag und keinen Arena-Score für Mk1.5 oder dessen Vorgänger, sodass jede existierende Leistungskennzahl von Perceptron über Perceptrons eigenes Modell erstellt wurde. Diese Datenmenge ist ungewöhnlich spezifisch, was zu ihren Gunsten spricht — 0.9433 bei egocentric hand_box gegenüber 0.4467 für Gemini 3.1 Pro im eigenen Durchlauf des Anbieters; EgoSchema 80.40 gegenüber 81.20 für denselben Wettbewerber, eine knappe Niederlage beim breiten Verständnis-Benchmark neben einem behaupteten Vorsprung von 12 % beim schwierigeren EgoSchema-Subset mit 63.75; 0.647 Centre-F1 und 0.628 Point-HOTA bei Molmo2-Track — doch spezifisch und unabhängig verifiziert sind zwei verschiedene Eigenschaften, und nur die zweite sagt Ihnen, was mit Ihrem Material passieren wird.
Zwei Vorsichtsmaßnahmen beim Lesen von Perceptrons Tabelle, die beide für jedes Zitat daraus gelten. Der LiveVQA-W-Wert von 56,0 mit aktivierten Tools stammt aus einer Mehrheitsentscheidung über vier Stichproben, während die 53,2, gegen die er für Gemini 3.8 Flash mit Google-Search-Grounding gesetzt wird, keine Mehrheitsentscheidung ist; die Technik ist legitim und sie lässt einen Wert im Vergleich zu einem einzelnen Greedy-Durchlauf besser aussehen. Und die Tracking-Zeile führt Qwen3-VL-8B mit 0,180 centre-F1 auf, entnommen aus dem Paper dieses Modells, und steht dabei in derselben Spalte wie gemessene Zahlen für eine andere Checkpoint-Familie. Ein Paper-Wert in einer gemessenen Spalte ist keine vergleichbare Zeile, und genau das ist die Art von Zeile, die ohne ihre Herkunft zitiert wird.
Der 2.4T-Kern ist nichts, das Sie von uns aus aufrufen können – aber seine Architektur ist es.

Das ist der Teil des Vergleichs, bei dem die ehrliche Antwort von dem abweicht, was der Ruhm des Modells nahelegt. Qwen 3.8 wird als Name weithin verwendet, um den Open Core zu bezeichnen, und der Open Core ist ein Download, kein Endpunkt: 2,4 TB BF16-Gewichte unter Alibabas eigener Qwen3.8-Max-Lizenz, veröffentlicht im August 2026. Wir stellen es nicht bereit, und es gibt heute keinen Anbieter, der es auf unserer Seite des Zauns bereitstellt – der Katalogeintrag existiert als angekündigte, noch nicht verfügbare Tracking-Seite statt als Live-Route.
Was wir sehr wohl anbieten, ist die Flaggschiff-API, die auf derselben 2,4T-Architektur aufbaut. Sie ist live als qwen/qwen3.8-max für 2,00 $ und 6,00 $ pro Million Tokens – Alibabas eigener Tarif, direkt durchgereicht, mit nichts pro Token aufgeschlagen, mit dem multimodalen 1-Mio.-Token-Fenster – Text-, Bild- und Videoeingabe – und demselben hybriden Attention-Design wie der offene Kern. Wenn Ihre Reasoning-Hälfte etwas sehen muss, ist das die Route, und es ist auch die Route, auf der eine Tarifänderung eines Anbieters noch am selben Tag bei uns ankommt statt erst in Ihrem nächsten Abrechnungszyklus. Daneben bieten wir Alibabas dichtes Geschwistermodell qwen/qwen3.8-27b auf unserer eigenen Infrastruktur für 0,33 $ und 2,40 $ pro Million an, mit einem Fenster von 262.144 Tokens sowie Text-, Bild- und Videoeingabe, für die Fälle, in denen ein 27B-Reasoner ausreicht und der Index von 40 des 2,4T mehr ist, als die Aufgabe braucht.
Die beiden Hälften ohne einen zweiten Vertrag verdrahten
Der praktische Grund, warum diese Paarung mehr zählt als das Benchmark-Argument, ist, dass ein embodied Stack bereits zwei Modelle umfasst, und die Integrationskosten eines dritten sind das, was das Design still und leise killt. Mk1.5 ist nicht in unserem Katalog, also führt der Weg dorthin über die API des Anbieters selbst — pip install "perceptron>=0.4.0", Schlüssel in PERCEPTRON_API_KEY, Endpoint api.perceptron.inc. Die Qwen-Hälfte ist nur einen Schlüssel entfernt.
Wo ein Gateway seinen Platz verdient, ist an der Nahtstelle. Eine Routing-Regel, die jeden Frame mit einer Frage an das Wahrnehmungsmodell und jeden reinen Textplan an das Reasoning-Modell schickt, ist eine Konfigurationszeile, wenn beide hinter einem OpenAI-kompatiblen Endpunkt liegen, und automatisches Failover bedeutet, dass eine Anbieter-Störung auf einer der beiden Seiten in einen Fallback mündet statt in einen blockierten Roboter. Eine einzige API, die über 200 Modelle abdeckt und Listenpreise mit 0 % Aufschlag durchreicht, ist außerdem der günstigste Weg, die Frage zu beantworten, die dieser Artikel nicht beantworten kann: ob Ihre Objektverfolgungsaufgabe überhaupt die Koordinaten von Mk1.5 braucht oder ob ein allgemeines Vision-Modell mit einem viel größeren Fenster und einer unabhängigen Bewertung ausgereicht hätte. Einen Teil des echten Traffics zwischen Kandidaten zu routen und auf Ihren eigenen Frames zu messen, kostet weniger als jede Benchmark-Studie, die Sie in Auftrag geben könnten.
Was soll man konkret damit machen?
Wenn Sie Wahrnehmung in ein physisches System integrieren, ist Perceptron Mk1.5 das einzige Modell in dieser Paarung, das in Koordinaten antwortet, und das ist eine Fähigkeit und kein Score — testen Sie die Hand-Box-Behauptung an Ihrem eigenen Video, setzen Sie reasoning_effort bewusst, statt den hohen Standardwert zu akzeptieren, und kalkulieren Sie das 36.864-Token-Fenster als harte statt weiche Einschränkung ein. Wenn Sie die Reasoning-Schicht darüber bauen, wird Qwen 3.8 dort gemessen, wo Mk1.5 nicht gemessen wird, und seine Kosten pro abgeschlossener Aufgabe sind die Größe, mit der Sie planen sollten, statt der 2,00-$-Schlagzeile — mit dem Vorbehalt, dass sein Denken nicht abgeschaltet werden kann, sodass eine Aufgabe, die keine Gedankenkette benötigt, trotzdem für eine bezahlt.
Die Teams, die das falsch machen, sind diejenigen, die versuchen, ein einziges Modell beides tun zu lassen. Ein auf Wahrnehmung spezialisiertes Modell mit 36.864 Token wird die operative Historie nicht fassen, und ein rein textbasierter 2,4T-Reasoner wird den Frame nie sehen. Die Paarung ist kein Kompromiss zwischen zwei Produkten. Sie ist die eigentliche Arbeitsteilung, und die nützliche Frage ist nur, auf welcher Seite davon jeder Ihrer Aufrufe gehört.
