
Kimi K3 vs Fable 5, GPT-5.6 & Opus 4.8: Vi testade hypen
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Kimi K3 är Moonshot AI:s nya flaggskepp, och under några dagar i juli 2026 var det den mest testade modellen på internet. Det dök först upp på Arena-utvärderingssajten som en mystisk modell med kodnamnet "Kivine" — som beskrev sig själv som "från Moonshot labs" med en kunskapsgräns i januari 2025 — innan Moonshot officiellt tillkännagav den 16 juli 2026, med öppna vikter utlovade före 27 juli. Den återkommande rubriken från testare: Kimi K3 hamnar någonstans runt Claude Fable 5, och ofta före GPT-5.6 på kreativa och 3D-arbeten. Denna första-intrycksrecension samlar specifikationerna, benchmark-ryggraden och ett dussintal community-tester på ett ställe.
En notis till byggare: dessa är tidiga, okontrollerade gemenskapstester, så behandla dem som vägledande, inte som poäng. OrcaRouter placerar API-tillgängliga modeller bakom en OpenAI-kompatibel slutpunkt, så när Kimi K3's API är live så du kan prova det mot Fable 5 och GPT-5.6 utan att koppla ihop flera SDK:er.
TL;DR-dom. Kimi K3 är den första open-weight-modellen som trovärdigt når Fable 5-nivå på frontend, 3D och kreativa one-shots – den toppar Arena frontend-listan och ligger på #4 på Artificial Analysis Index. Men den är pratig och långsam (en frontend-bygg tog 35 minuter), halkar efter Fable på agentbaserad kodning, och de 'vunna' domarna är tidiga Arena-intryck, inte granskade riktmärken. Imponerande, inte avgjort.
Viktiga slutsatser
• Kimi K3 är en 2.8T-parameter MoE, positionerad som den största open-weight-modellen hittills, med open-weights som kommer före den 27 juli.
• I neutrala tredjepartsutvärderingar rankas den #4 av 189 på AA Intelligence Index (57) och #1 på Arenas frontend-kodtavla (1679), ovanför Fable 5:s 1631.
• Priset är $3 / $15 per 1M tokens — Moonshot's dyraste modell någonsin, men fortfarande ungefär en tredjedel av Fable 5's $10 / $50.
• Testare kallar det upprepade gånger för "Fable level"; skeptiker säger att jämförelserna är utvalda och att det fortfarande ligger efter på flerstegs agentiska uppgifter.
• Observera varningarna: utförlig utdata (~2x peer-median tokens), ~34s latens för första token, och det ligger fortfarande efter Fable på FrontierSWE och DeepSWE.
Specifikationerna och riktmärkesstommen
Här är hårddata, varje siffra tillskriven sin källa.
• Arkitektur — Kimi K3: 2.8T MoE (896 experter, 16 aktiva), Kimi Delta Attention, 1M kontext, inbyggd vision; Jämförelsepunkt: Största öppenviktsmodellen hittills (Moonshot, leverantörsrapporterad)
• Varianter — Kimi K3: K3 Max (chatt/agent), K3 Swarm Max (parallell); Jämförelsepunkt: —
• Priser (in/ut) — Kimi K3: $3 / $15 per 1M; cache-träff ~$0.30; Jämförelsepunkt: Fable 5 för $10 / $50 (~3.3x mer)
• AA Intelligence Index — Kimi K3: 57 — #4 av 189; Jämförelsepunkt: Bakom två Fable 5-konfigurationer + GPT-5.6 Sol; över Opus 4.8, Sonnet 5, GLM-5.2 (Artificial Analysis)
• Arena frontend-kod — Kimi K3: #1 på 1679, vann 6 av 7 kategorier; Jämförelsepunkt: Över Fable 5:s 1631; upp från K2.6:s #18 (Arena / LMArena)
• GDPval-AA v2 / AA-Briefcase — Kimi K3: 1687 (#3) / 1527 (#2); Jämförelsepunkt: Artificial Analysis
• GPQA Diamond — Kimi K3: 93.5% (starkaste öppna modellen); Jämförelsepunkt: Leverantörsrapporterad
• BrowseComp / HLE med verktyg — Kimi K3: 91.2% / 56.0%; Jämförelsepunkt: Leverantörsrapporterad
• Agentic SWE — Kimi K3: FrontierSWE 81.2, DeepSWE 67.5; Jämförelsepunkt: Bakom Fable 5:s 86.6 / 70.0
• Terminal-Bench 2.1 — Kimi K3: 88.3; Jämförelsepunkt: Över Fable 5:s 84.6 (förbehåll om harness-mixing nedan)
Två saker dämpar vinsterna. För det första äts prisfördelen delvis upp av ordrikedom — K3 avger ungefär dubbelt så många output-tokens som medianen för jämförbara modeller — plus en ~34 sekunders första-token-latens. Andra punkten: Terminal-Bench-fördelen kommer med en varning från @ChrissGPT: Moonshot's benchmarks "använder ofta Terminal 2 istället för 2.1," så var försiktig med jämförelser över olika testmiljöer. Oberoende, innan det officiella indexet släpptes, uppskattade @teortaxesTex "~55ish AA… runt Opus 4.8 eller GPT 5.5."

Sammanfattning av community-test
Bevisen som gjorde Kimi K3 till en story är översvämningen av Arena one-shots. Här är ett representativt urval — testare, uppgift och utlåtande, var och en länkad till originalinlägget.
• @synthwavedd — Uppgift: Allmän stresstestning; Omdöme: "Ännu ett DeepSeek R1-ögonblick… ofta Fable-nivå, kanske lite sämre, men konsekvent bättre än 5.6. Ett odjur."
• @chetaslua — Uppgift: Kodning, direkt jämförelse med Fable; Slutsats: "Överträffar alla open source-modeller… i nivå med Fable, ibland bättre kvalitet"
• @Gc_qube — Uppgift: 3D / spel vs Fable 5; Slutsats: "Kimi K3 vann… den första modellen som har kommit ikapp Fable"
• @abhinavflac — Uppgift: Sakura bonsai-rendering; Dom: "Besegrade Claude Fable — lyckades med den vridna stammen och det skiktade lövverket"
• @testingcatalog — Uppgift: Universe-sim vs Fable 5; Slutsats: "Fable avslutades snabbare med mer robust UX; K3 mycket mer komplex och visuellt tilltalande… mycket nära"
• @israfill — Uppgift: Samma universe-sim prompt; Bedömning: "K3 vinner på tät kreativ produktion och 'hur byggde den det'-ögonblick… förvånad över hur nära detta är"
• @mirochill — Uppgift: Frontend one-shot (Franska); Bedömning: "Likvärdig med 5.6 Pro, bättre än Fable 5, i ett enda försök" (belysningsproblem noterade)
• @jun_song — Uppgift: Flappy Bird vs Opus 4.8; Dom: "Betydligt bättre än Opus… Opus-5 nivå"
• @JustinGorya — Uppgift: Single-file HTML Minecraft; Dom: "En ny milstolpe… otrolig på 3D och front-end" (svar: "Det här är en enda tagning. Galetttt")
• @redkendl — Uppgift: 3D-pappersflygplansspel; Dom: "One-shotted… Fable 5 / GPT-5.6-nivå utdata. Kinesiska labb är inte längre 8 månader efter"
• @noctus91 — Uppgift: Interaktiva 3D-upplevelser; Omdöme: "Detaljnivån, poleringen och den övergripande kvaliteten är ärligt talat vilda."
• @Lentils80 — Uppgift: Frontendsida; Omdöme: "MYCKET långsam — tog 35 minuter — men ett av de bästa resultaten jag någonsin sett från denna prompt"

Förespråkare vs skeptiker
Den optimistiska bedömningen är tydlig: en öppen-viktsmodell som matchar en stängd flaggskeppsmodell på kreativt och frontend-arbete, till en tredjedel av priset, är genuint nytt. @notjazii kallade en tidig utskrift "a new SOTA model dropping today, moonshot cooked," och @chetaslua beskrev det som "deepseek moment again for OSS."
Skeptikerna slår tillbaka hårt, och deras invändningar är samma tre varje gång:
• Noggrant utvalda demonstrationer. I bonsai-testet svarade @Heeseon "vem som helst kan se att Fable 5 vann," och @sebuzdugan noterade "ett bonsai-prov visar stil kontroll, inte tillförlitlighet över olika frön."
• Fable är bara bättre. På Gc_qube's tråd sa @victor_vibing rakt på sak: "Fable är mycket bättre. Ojämförligt så."
• Samma estetik, inte verklig räckvidd. @_everythingism hävdade att utdatan "alla har 'Claude-estetiken'… genererar en specifik typ av design om och om igen," och på Opus-tester sa @MCharles10581 helt enkelt "det verkar som att opus är bättre."
Den mest användbara ramen kommer från @teortaxesTex, som inte ens hade testat K3 själv. Hans poäng handlar om ett ansträngnings-/smakgap, inte en förmågebarriär: "till och med Fable och Sol producerar så mycket SKRÄP… Kimi misslyckas inte så mycket med saker som att den skapar mindre intressanta och detaljerade saker, går inte den extra milen." För agentisk kodning med människan i loopen för objektiva uppgifter förväntar han sig att K3 "borde komma orimligt nära." Och den strategiska knorren: "varje kinesisk modell som bara *upprätthåller* gapet… är en heroisk bedrift." Det är den ärliga tolkningen – K3 minskar avståndet på mätbara uppgifter och tappar lite på smak, vilket är precis vad dess riktmärken visar.
FAQ
Är Kimi K3 lika bra som Fable 5?
Inom frontend och 3D-enkelskott säger testare ja – det toppar Arenas frontend-lista (1679 mot 1631) och flera direkta jämförelser kallade det en vinst eller oavgjort. Inom agentisk kodning ligger det fortfarande efter (FrontierSWE 81.2 mot 86.6), och skeptiker hävdar att Fable har en fördel i fråga om putsning och tillförlitlighet över olika seedningar.
Är Kimi K3 öppen källkod?
Det är öppen vikt: Moonshot lovade att släppa vikterna före 27 juli 2026. Vid lanseringen var det endast API/webb. Som den största öppna viktmodellen hittills (2,8T MoE) är den releasen huvudhändelsen.
Hur mycket kostar Kimi K3?
3 $ / 15 $ per 1 miljon in-/utdatatokens, med cacheträffar runt 0,30 $. Det är Moonshots dyraste modell någonsin (K2.6 var 0,95 $ / 4 $), men fortfarande ungefär en tredjedel av Fable 5:s 10 $ / 50 $ — även om utförlig utdata minskar den verkliga skillnaden.
Är Kimi K3 bättre än GPT-5.6?
Testare lutar åt ja när det gäller kreativt och 3D-arbete — @synthwavedd kallade det "konsekvent bättre än 5.6" och @mirochill placerade det i nivå med 5.6 Pro. Men på AA Index rankas GPT-5.6 Sol fortfarande över K3, och Fable 5 och 5.6 Sol leder på Terminal 2.1.
När släpptes Kimi K3?
Officiellt tillkännagiven den 16 juli 2026, efter att ha dykt upp på Arena som "Kivine" runt den 14 juli. Öppna vikter utlovades före den 27 juli 2026.
Slutsats
Kimi K3 är det starkaste första intrycket en öppen-viktsmodell har gjort sedan det ursprungliga DeepSeek-ögonblicket: Fable-5-klassens kreativa och frontend-utdata, toppen av Arenas frontend-topplista, till ungefär en tredjedel av Fables pris. Håll entusiasmen på "directional" – den är ordrik, långsam, fortfarande efter i agentisk kodning, och varje "vinst" ovan är ett tidigt Arena-intryck, inte ett granskat riktmärke. När vikterna släpps före den 27 juli kommer de kontrollerade testerna att berätta för oss om hypen höll.

Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
