Data premiery DeepSeek V4 Pro: już 14 razy tańszy niż Kimi K3, ale wciąż nie tak mądry
Guides & Insights

Data premiery DeepSeek V4 Pro: już 14 razy tańszy niż Kimi K3, ale wciąż nie tak mądry

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

31 lipca 2026 r. firma opublikowała wpis w dzienniku zmian, w którym ogłosiła, że jej tani model pobił drogi. Wpis dotyczył DeepSeek V4 Flash, warstwy wydajnościowej 284B, a główne stwierdzenie brzmiało: „znacznie ulepszone możliwości agentowe, z wynikami benchmarków znacznie przewyższającymi V4-Pro-Preview." V4-Pro-Preview to DeepSeek V4 Pro — flagowy model o 1,6 biliona parametrów, ten, który kosztuje trzy razy więcej za token. Ten sam wpis kończył się jednym zdaniem na ten temat: „Oficjalna premiera DeepSeek-V4-Pro nastąpi wkrótce." To jest kontekst dla krążącej obecnie prognozy, że gdy prawdziwy V4 Pro trafi na rynek, będzie na poziomie Kimi K3, ale dziesięć razy tańszy. Jedna połowa tego jest już mierzalna i jest błędna w kierunku, którego prawie nikt się nie spodziewa.

Uwaga o tym, czym ten artykuł jest, a czym nie. Nie ma tu żadnego wyciekłego system card, żadnego wewnętrznego benchmarku, żadnej daty. Krążąca prognoza pochodzi od @scaling01 na X — „DeepSeek-V4 Pro będzie petardą, prawdopodobnie na poziomie Kimi-K3, ale 10 razy tańszy” — i jest to przewidywanie praktyka z dużą liczbą obserwujących, a nie ujawnienie kogokolwiek z dostępem. Traktowanie tego jak wycieku to sposób, w jaki powstają złe artykuły o dacie premiery. Zamiast tego możemy wziąć dwie dające się sprawdzić części tego twierdzenia i porównać je z liczbami, które już istnieją, bo build podglądowy można wywoływać od trzech miesięcy i zarówno on, jak i Kimi K3 były testowane przez niezależne laboratorium. Wszystko poniżej jest oznaczone źródłem: dokumentacją samej firmy, pomiarami Artificial Analysis albo arytmetyką, którą sami wykonaliśmy i pokazujemy.

Co DeepSeek faktycznie powiedział, a czego nie

Potwierdzona powierzchnia jest większa, niż sugerowałoby określenie „niewydany model”. V4 Pro to nie widmo — można go zamówić już teraz. To, czego nie było, to premiera, którą sama firma uważa za oficjalną.

Architektura — model mixture-of-experts z 1.6T parametrów łącznie i 49B aktywnych na token, potwierdzony przez firmę i wymieniony identycznie na Artificial Analysis jako 1600B/49B.

Kontekst i wynik — okno wejściowe o pojemności 1M tokenów (1 048 576) z wyjściem do 384K tokenów. Tekst na wejściu, tekst na wyjściu; brak obrazów, dźwięku lub wideo na wejściu.

Licencja i wagi — MIT, z wagami opublikowanymi na Hugging Face. To flagowy model o otwartych wagach, co jest całym powodem, dla którego porównanie z Kimi K3 jest interesujące.

Cena katalogowa — $0.435 za milion tokenów wejściowych przy braku trafienia w cache, $0.003625 przy trafieniu w cache oraz $0.87 za milion tokenów wyjściowych, według własnej strony cenowej firmy.

Interfejsy — punkty końcowe w stylu OpenAI ChatCompletions i formacie Anthropic, a także poziomy wysiłku rozumowania, wywoływanie narzędzi oraz wyniki strukturalne.

Dotychczasowa oś czasu — rodzina V4 zadebiutowała w wersji zapoznawczej 24 kwietnia 2026 roku; przestarzałe deepseek-chat i deepseek-reasoner nazwy modeli zostały wycofane 24 lipca 2026 roku; Flash otrzymał oficjalny build 31 lipca 2026 roku; Pro nie.

6 sierpnia 2026DeepSeek poinformował programistów, że planuje podnieść ogólne ceny usług DeepSeek API „w najbliższej przyszłości, spodziewany jest znaczny wzrost” i powtórzył, że oficjalna premiera V4 Pro nastąpi w dalszej kolejności. Nie opublikowano żadnych nowych stawek ani daty wejścia w życie.

I części, które pozostają naprawdę nieznane, co stanowi większość tego, czego ludzie szukają:

Data GA — wciąż nieogłoszona. „Nastąpi wkrótce” pozostaje całokształtem oficjalnego zobowiązania firmy. Niepotwierdzone doniesienia prasowe wskazują na połowę sierpnia — jedno z mediów podało 10–20 sierpnia, a strona cenowa resellera przesunęła ceny pamięci podręcznej V4 Pro 3 sierpnia w sposób, który historycznie poprzedza premierę — ale żadne z nich nie pochodzi od firmy. Żadna data nie została potwierdzona.

Co zmieni wydanie GA — nieujawnione. Firma nie poinformowała, czy oficjalny V4 Pro to ponowny post-trening tych samych wag, nowy pretrening, czy też zmiana ceny.

Czy cena to przetrwa — nierozstrzygnięte, a istnieje konkretny powód do niepokoju w tej sprawie, do którego przejdziemy poniżej.

Jedna korekta, którą warto wyraźnie wprowadzić, ponieważ wyniki wyszukiwania dla tego pytania są zanieczyszczone: znajdziesz strony twierdzące, że rodzina V4 osiągnęła ogólną dostępność 20 lipca 2026 r. Własny rejestr zmian firmy, jedenaście dni po tej dacie, mówi, że oficjalna premiera V4 Pro wciąż oczekuje, i dodaje, że aktualizacja z 31 lipca „tylko ulepsza API DeepSeek-V4-Flash. API DeepSeek-V4-Pro oraz modele APP/WEB pozostają niezmienione”. Gdy zewnętrzne podsumowanie i główny rejestr zmian dostawcy są sprzeczne, wygrywa rejestr zmian.

Twierdzenie o cenie: „10x cheaper” to konserwatywna interpretacja.

Kimi K3 kosztuje 3,00 USD za milion tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych, z trafieniami cache po 0,30 USD. V4 Pro kosztuje 0,435 USD i 0,87 USD, z trafieniami cache po 0,003625 USD. Zestawienie tych wartości pokazuje, że „10x" to dolna granica zakresu, a nie nagłówek:

Tokeny wejściowe — 3,00 USD wobec 0,435 USD, więc V4 Pro jest 6,9x tańszy. To jedyny wymiar, w którym twierdzenie jest przesadzone.

Tokeny wyjściowe — 15,00 USD wobec 0,87 USD, czyli 17,2 razy taniej. To właśnie na tokenach wyjściowych modele rozumujące wydają najwięcej, dlatego ta liczba ma największe znaczenie.

Mieszanka wejściowo-wyjściowa 70/30 — 6,60 USD za milion w porównaniu z 0,5655 USD, czyli 11,7x.

Mieszanka Artificial Analysis 7:2:1 trafień w cache / danych wejściowych / wyjściowych — 2,31 USD wobec 0,18 USD, czyli 12,8x.

Wejście z pamięci podręcznej — 0,30 USD wobec 0,003625 USD, czyli około 83x. Cena odczytu z pamięci podręcznej tej firmy zajmuje 4. miejsce wśród 101 modeli śledzonych przez Artificial Analysis, przy 99% zniżce względem jej własnej stawki za brak trafienia w pamięci podręcznej.

Hipotetyczne połączenia są dyskusyjne, więc oto jedno zmierzone. Artificial Analysis publikuje, ile faktycznie wydało na uruchomienie swojego pełnego Intelligence Index dla każdego modelu — ten sam zestaw ewaluacyjny, ten sam harness, rzeczywiste liczby tokenów zamiast zakładanego przelicznika. Ocena Kimi K3 kosztowała 2437,41 dolara. Ocena V4 Pro kosztowała 176,34 dolara. To 13,8x, przy identycznym obciążeniu, w dolarach, które ktoś naprawdę zapłacił.

Warto zrozumieć, dlaczego ten współczynnik jest niższy niż współczynnik tokenów wyjściowych do ceny wynoszący 17,2x, ponieważ to właśnie tutaj taniość V4 Pro jest częściowo zawiniona przez niego samego. V4 Pro jest gadatliwy: spalił 180 mln tokenów wyjściowych na przebycie indeksu, podczas gdy Kimi K3 zużył 130 mln, a mediana dla tej klasy wynosi 100 mln. Zużywa więc około 38% więcej tokenów, aby przekazać to, co ma do przekazania, co uszczupla przewagę w przeliczeniu na token. Współczynnik 13,8x już to uwzględnia; współczynnik 17,2x nie. Jeśli układasz budżet, użyj tego zmierzonego.

To także część tej historii, którą łatwo sprawdzić samemu, zamiast przyjmować na wiarę. Ponieważ OrcaRouter przekazuje ceny z listy dostawców bezpośrednio, z 0% marżą, liczby za token na stronach modeli deepseek/deepseek-v4-pro i kimi/kimi-k3 to własne stawki obu dostawców — K3 widnieje jako $3.00/$15.00 na naszej stronie i $3.00/$15.00 na stronie Moonshot — a nie odsprzedawana cena z ukrytym narzutem — co oznacza, że powyższe wyliczenia odtwarzają się na jednym rachunku, a jeśli którykolwiek z dostawców zmieni cenę, zmiana trafia na naszą stronę tego samego dnia, a nie po cyklu kontraktowym.

Twierdzenie o inteligencji: 13 punktów, nie parytet

"Poziom Kimi K3" to połowa prognozy, która nie przetrwa kontaktu z bieżącymi liczbami. W indeksie inteligencji Artificial Analysis, stan na 5 sierpnia 2026 r., Kimi K3 uzyskuje 57 punktów, a DeepSeek V4 Pro (reasoning, max effort) 44 punkty — zajmując 6. miejsce wśród 101 modeli, co jest naprawdę mocną pozycją, wciąż jednak brakuje 13 punktów. Oba modele są mierzone przez to samo laboratorium na tym samym wskaźniku zbiorczym, oba przy maksymalnym wysiłku rozumowania, oba w kontekście 1 mln tokenów.

Benchmarki sprzedawców opowiadają inną, bardziej pochlebną historię, i właśnie dlatego potrzebują etykietowania. Firma raportuje V4 Pro-Preview na 80.6% w SWE-bench Verified i 90.1% w GPQA Diamond. Moonshot raportuje Kimi K3 na 76.8% w SWE-bench Verified i 93.5% w GPQA Diamond. Biorąc te liczby za dobrą monetę, V4 Pro wygrywa benchmark kodowania wprost. Żaden z tych wyników nie został niezależnie potwierdzony, powstały na różnych środowiskach testowych przez zespoły zainteresowane rezultatem, a w jedynym porównaniu zbiorczym, w którym strona trzecia uruchomiła oba modele, kolejność się odwraca. To jest cały argument za nieufnością wobec porównań między sprzedawcami opartych na pojedynczych benchmarkach.

Dwie kwestie dotyczące wartości indeksu zasługują na osobne zastrzeżenia. Po pierwsze, jeśli natkniesz się na starsze publikacje podające V4 Pro jako 52 zamiast 44, nie są one błędne — kwietniowy artykuł inauguracyjny samej Artificial Analysis faktycznie umieścił V4 Pro (Max) na 52 i nazwał go modelem nr 2 wśród modeli rozumujących o otwartych wagach. Indeks bywa rewidowany, a rewizje zmieniają wyniki wszystkich modeli. Praktyczna zasada jest taka, że znaczenie mają tylko porównania w obrębie tego samego stanu indeksu; 52 z kwietnia i 57 z sierpnia nie powinny znaleźć się w tym samym zdaniu. Po drugie, strona Artificial Analysis jest opatrzona datą „Wydano w kwietniu 2026” i nie rozróżnia wersji preview od przyszłej oficjalnej, więc jej 44 to pomiar tego, co endpoint serwował w chwili testowania.

Tam, gdzie V4 Pro wyraźnie pokonuje Kimi K3, są osie, które nie dotyczą inteligencji. Generuje 66,5 tokenów na sekundę wobec 37,6 dla K3, w klasie, której mediana wynosi 65,9 — więc V4 Pro wypada mniej więcej średnio w swojej klasie, a Kimi K3 jest wyjątkowo wolne. Czas do pierwszego tokena wynosi 1,61 sekundy wobec 2,85. W przypadku interaktywnej pętli agenta ta różnica jest odczuwalna przy każdym kroku i jest to najsilniejszy argument za wersją preview w obecnym kształcie.

Co oficjalna wersja Flasha mówi nam o Pro

Oto rzecz najbardziej zbliżona do prawdziwego dowodu na temat niewydanego modelu, a pochodzi ona od rodzeństwa, które już przeszło przez ten proces.

Dziennik zmian firmy z 31 lipca stwierdza, że „DeepSeek-V4-Flash-0731 zachowuje tę samą architekturę modelu i rozmiar co DeepSeek-V4-Flash-Preview, a jedynie został ponownie poddany post-trainingowi". Ta sama liczba wag, ta sama architektura, ta sama cena — tylko post-training. Artificial Analysis oceniło wynik na 50, wobec 40 dla poprzedniej wersji Flash. Dziesięć punktów w indeksie złożonym, wyłącznie z post-treningu, bez dodatkowych kosztów za token. Zużycie tokenów wyjściowych w indeksie również spadło o 12%, z ~234M do ~206M, więc jego działanie stało się tańsze przy tej samej cenie katalogowej.

Zastosuj ten precedens do Pro, a arytmetyka jest nieunikniona: 44 plus 10 to 54. Kimi K3 jest na 57. Nawet jeśli oficjalny V4 Pro powtórzy najbardziej udane uaktualnienie potreningowe, jakie firma publicznie zademonstrowała, to osiągnie wynik o około trzy punkty niższy od „poziomu Kimi K3” — kosztując przy tym mniej więcej jedną czternastą. To niezwykły wynik i nie jest to wynik przewidywany w prognozie.

Uczciwe zastrzeżenia co do tej ekstrapolacji, która jest arytmetyką, a nie prognozą: zysk +10 w modelu 284B niewiele mówi o tym, co jest dostępne w modelu 1.6T, a zapas może być większy lub znacznie mniejszy. Firma nie powiedziała, że wersja Pro będzie oparta wyłącznie na post-treningu. A indeks jest złożony, więc trzy punkty mogą oznaczać jeden benchmark. Powód, dla którego warto mimo wszystko przeliczyć tę liczbę, jest taki, że to jedyny skwantyfikowany, potwierdzony przez dostawcę precedens, jaki istnieje, i to znacznie więcej, niż na czym opiera się prognoza.

Jeszcze jeden szczegół z tego dziennika zmian zasługuje na wyeksponowanie, a nie tylko powtórzenie: wyniki agentowe Flasha zostały wygenerowane przy użyciu „minimalnego trybu Harness" (which will be released soon) przy maksymalnym wysiłku, topp=0,95, temperature=1,0. Harness, który wygenerował te liczby, nie został jeszcze publicznie udostępniony — wszedł w zamkniętą betę na początku sierpnia — więc tych wyników nikt spoza firmy nie może odtworzyć nawet w teorii, nie dlatego, że są błędne, ale dlatego, że narzędzie jest niedostępne. Należy się spodziewać, że wersja Pro pojawi się z tą samą gwiazdką.

Klauzule, które mogą podważyć tezę o tanim modelu

W dokumentacji cenowej firmy ukryta jest polityka, która prawie nie obejmuje cen linii V4. Jak mówi firma, API „wkrótce przyjmie” harmonogram, zgodnie z którym „w godzinach szczytu ceny będą wynosić 2x ceny regularne, co ma zastosowanie do wszystkich pozycji rozliczeniowych”. Godziny szczytu zdefiniowano jako 09:00–12:00 i 14:00–18:00 czasu pekińskiego, codziennie — siedem godzin dziennie, każdego dnia. Data wejścia w życie jest „uzależniona od oficjalnego ogłoszenia”, a w chwili pisania tego tekstu opłata dodatkowa nie jest aktywna.

Zwróć uwagę na kierunek. Firma historycznie oferowała pozaszczytowe zniżki na V3 i R1; to jest szczytowa dopłata do standardowej stawki. Jeśli zadziała przy podanym mnożniku, dzienna cena V4 Pro wyniesie 0,87 $ na wejściu i 1,74 $ na wyjściu, a porównanie zmieni kształt: 11,7-krotna przewaga mieszana nad Kimi K3 spadnie do 5,8x, a zmierzona 13,8x spadnie do 6,9x. Wciąż tanio. Już nie „10x taniej” i już nie tanio w godzinach, kiedy europejski lub azjatycki zespół faktycznie pracuje.

6 sierpnia spadł większy but. Firma DeepSeek ogłosiła na swojej platformie deweloperskiej, że planuje podnieść ogólne ceny usług API DeepSeek „w najbliższej przyszłości, z oczekiwanym znacznym wzrostem”. Nie opublikowano ani nowych stawek, ani daty wejścia w życie, a firma nie podała, czy podwyżka jest oddzielona od cennika godzin szczytu, czy też wejdzie w życie razem z nim. Prasa opisująca firmę odczytała to ogłoszenie jako sygnał, że oficjalna premiera V4 Pro jest blisko — niewydanego flagowca nie wycenia się agresywnie w reżimie rabatowym, który właśnie zamierza się opuścić. Każdy, kto dziś buduje model kosztów dla V4 Pro, powinien uwzględnić oba scenariusze, a każdy, kto czyta nagłówek „firma jest 14x tańsza” — w tym ten tutaj — powinien wiedzieć, że opisuje on cennik, do którego dołączono ogłoszony warunek wygaśnięcia. To najbardziej prawdopodobny sposób, w jaki ta połowa prognozy, która dotyczy cen, przestaje być prawdziwa, i nie ma to nic wspólnego z modelem.

Jak będziesz wiedzieć, że oficjalna kompilacja została wydana

Jest pewien szczegół w tym, jak firma realizuje wysyłki, który jest ważniejszy niż data — i stanowi prawdziwe zagrożenie operacyjne.

Identyfikator modelu API to deepseek-v4-pro. Nie deepseek-v4-pro-preview, i nie jest to datowany ciąg znaków wersji — mimo że oficjalny dziennik zmian firmy określa obecną wersję jako V4-Pro-Preview, a wydaną wersję Flash jako V4-Flash-0731. Gdy Flash stał się oficjalny, instrukcja brzmiała: „Sposób wywoływania API pozostaje bez zmian — wystarczy ustawić nazwę modelu na deepseek-v4-flash, aby korzystać z najnowszej wersji.” Innymi słowy, przypięcie identyfikatora modelu nie przypina wersji. Ten sam ciąg znaków po cichu zaczął obsługiwać inny zestaw wag, o istotnie odmiennym zachowaniu i dziesięć punktów indeksu więcej.

Tak więc praktyczna odpowiedź na pytanie „kiedy ukaże się V4 Pro” jest taka: jeśli wywołujesz deepseek-v4-pro w produkcji, możesz się o tym przekonać, obserwując zmiany własnych wyników. Konkretnie rzeczy, na które należy zwracać uwagę, to: nowy opatrzony datą wpis w firmowym dzienniku zmian API, gdzie po raz pierwszy pojawiła się informacja o premierze Flasha; przyrostek kompilacji, taki jak V4-Pro-0731 w treści tego wpisu, nawet gdy identyfikator wywołania pozostaje bez sufiksu; ponowne przeliczenie wyniku na stronie V4 Pro w Artificial Analysis, które będzie pierwszym niezależnym potwierdzeniem, jakie otrzymasz; przekształcenie się zapowiedzianej podwyżki cen w rzeczywiste stawki, ponieważ GA to naturalny moment zarówno na nią, jak i na wejście w życie harmonogramu godzin szczytu; oraz firmowy Responses API, którego dokumentacja mówi, że wsparcie dla deepseek-v4-pro jest planowane na początek sierpnia — zniknięcie modelu z listy „planowanych” i pojawienie się na liście obsługiwanych to niemal tak oficjalny sygnał premiery, jaki firma publikuje. Dwa sygnały, których nie możemy potwierdzić, warto mimo to znać: strona cenowa resellera zmieniła 3 sierpnia ceny pamięci podręcznej V4 Pro według schematu, który historycznie poprzedza premierę, a wewnętrzne narzędzie ewaluacyjne firmy jest w zamkniętej becie, co oznacza, że jej własne benchmarki będą wreszcie możliwe do sprawdzenia, gdy narzędzie zostanie udostępnione. Ciąg znaków przypominający deepseek-v4-pro-202606 również pojawił się w obiegu jako wyciekły identyfikator kompilacji; nie mogliśmy go zweryfikować na podstawie żadnych materiałów firmy i nie powinien mieć żadnego znaczenia, dopóki ktoś tego nie zrobi.

Czy powinieneś już dziś budować na wersji zapoznawczej?

Dla większości osób oceniających ten model, data wydania to nie to pytanie, które należy zadać. Wersja zapoznawcza jest wywoływalna, płatna, na licencji MIT i niezależnie oceniona na 6. miejscu spośród 101 pod względem inteligencji. Prawdziwe pytanie brzmi: co nadchodzące GA zrobi z pracą, którą budujesz teraz — i są dwie różne odpowiedzi.

Jeśli wybierasz między V4 Pro a Kimi K3 pod kątem możliwości, obecne dowody wskazują, że Kimi K3 wygrywa w zestawieniu o 13 punktów, a V4 Pro wygrywa pod względem szybkości, opóźnień i kosztu z dużą przewagą — a oczekująca aktualizacja po treningu może zmniejszyć lukę w inteligencji, ale jej nie zamknie. Jeśli twoja praca jest na granicy trudnego rozumowania, te 13 punktów to cała gra, a cena jest rozpraszaczem. Jeśli twoja praca jest wysokonakładowa i jedynie trudna, płacenie 14x za nią jest trudne do uzasadnienia.

Jeśli już wybrałeś V4 Pro, ryzykiem do zarządzania nie jest data premiery, lecz cicha zamiana: build kryjący się za tym ID modelu zmieni się pod Tobą, dokładnie tak jak w przypadku Flasha, a Twoje ewaluacje powinny być w stanie to wykryć. Trzymaj zestaw regresyjny, który możesz uruchomić ponownie na żądanie, i miej drugi model osiągalny bez zmiany kodu. To przyziemny powód, dla którego zbudowaliśmy failover w taki sposób — V4 Pro, V4 Flash i Kimi K3 wszystkie siedzą za jednym kluczem OrcaRouter na kompatybilnym z OpenAI endpointzie, więc „uruchom ewaluację na wszystkich trzech, potem przesuń ruch" to edycja konfiguracji, a nie ćwiczenie z zaopatrzenia, a zły build GA to decyzja routingu, a nie incydent. Wypróbowanie niesprawdzonego flagowca jest znacznie łatwiejsze, gdy odwrócenie tej decyzji nic nie kosztuje.

Pytania, które ludzie naprawdę zadają

Czy DeepSeek V4 Pro został wydany czy nie?

Jedno i drugie, w zależności od tego, co masz na myśli, dlatego wyniki wyszukiwania są sprzeczne. Model jest publicznie wywoływalny od premiery wersji zapoznawczej V4 24 kwietnia 2026 r., z opublikowanymi cenami, otwartymi wagami na licencji MIT i niezależnymi testami porównawczymi. Jednak własny dziennik zmian firmy z 31 lipca 2026 r. wprost stwierdza, że API V4 Pro jest „niezmienione” i że jego oficjalne wydanie „nastąpi wkrótce”, a 6 sierpnia DeepSeek ponownie powiedział, że oficjalna wersja zostanie wydana tak szybko, jak to możliwe, ogłaszając jednocześnie dużą podwyżkę cen API. A zatem: dostępny, ale jeszcze nieoficjalny. Nie potwierdzono żadnej daty; niepotwierdzone doniesienia wskazują na połowę sierpnia, co oznaczałoby krótkie oczekiwanie.

Czy oficjalna wersja będzie tak dobra jak Kimi K3?

Na podstawie jedynego dostępnego wymiernego precedensu — prawdopodobnie nie do końca. Oficjalna wersja Flasha zyskała 10 punktów w Indeksie Inteligencji Artificial Analysis wyłącznie dzięki post-trainingowi; V4 Pro plasuje się na 44, a Kimi K3 na 57, więc identyczny wzrost dałby 54. Ta ekstrapolacja może być błędna w którąkolwiek stronę — model 1.6T może mieć inny potencjał poprawy niż model 284B, a firma nie ogłosiła, że wydanie Pro będzie obejmować wyłącznie post-training. Ale każdy, kto dziś twierdzi, że osiągnięto parytet, twierdzi coś, czego nie potwierdza żaden opublikowany pomiar.

Dlaczego tani model DeepSeek obecnie osiąga wyższe wyniki niż jego flagowy model?

Z powodu kolejności wydań, nie dlatego, że Flash jest lepszym modelem. Flash otrzymał aktualizację po treningu 31 lipca, która podniosła go z 40 do 50 w indeksie; Pro nie otrzymał swojego odpowiednika, więc nadal jest oceniany na podstawie kwietniowego post-treningu. Sama firma zresztą to przyznaje, opisując wyniki agentowe Flash-0731 jako „znacznie przewyższające V4-Pro-Preview”. Ta inwersja jest migawką niedokończonego wdrożenia, a oczekiwane wydanie Pro jest dokładnie tym, co położyłoby jej kres.

Czy cena 0,435 $ / 0,87 $ jest bezpieczna, aby oprzeć na niej model kosztów?

Warunkowo i mniej bezpiecznie niż tydzień temu. Jest to obecna opublikowana cena katalogowa firmy i już odzwierciedla dużą trwałą obniżkę w porównaniu ze stawkami z premiery V4. Jednak 6 sierpnia DeepSeek ogłosił, że planuje ogólnie podnieść cennik API, „spodziewany jest znaczący wzrost”, a nowe stawki ani data nie zostały jeszcze opublikowane — oprócz ogłoszonej, ale nieaktywnej polityki godzin szczytu, która podwajałaby wszystkie pozycje rozliczeniowe przez siedem godzin dziennie. Zamodeluj oba scenariusze i zauważ, że nawet podwojony przypadek jest nadal około 6 razy tańszy niż Kimi K3.

Uczciwa ocena

Prognoza, która to zapoczątkowała, była w połowie trafna, a ta połowa, która okazała się trafna, jest właśnie tą, w którą ludziom będzie najtrudniej uwierzyć. „10x cheaper" to niedopowiedzenie: przy tym samym zmierzonym obciążeniu ewaluacyjnym wersja preview DeepSeek V4 Pro kosztowała 176,34 USD, podczas gdy Kimi K3 — 2437,41 USD, a przy danych z pamięci podręcznej różnica nie jest dziesięciokrotna, lecz mniej więcej osiemdziesięciokrotna. „Kimi K3 level" to część, której jeszcze nie osiągnięto — 44 wobec 57 w jedynym teście zbiorczym, jaki niezależne laboratorium przeprowadziło na obu modelach, a optymistyczna ekstrapolacja z najlepszego dotychczasowego wyniku firmy wypada na poziomie 54.

To, co mogłoby zmienić tę ocenę, jest konkretne i warto na to uważać. Jeśli oficjalna wersja V4 Pro pojawi się jako aktualizacja potreningowa, a Artificial Analysis przyzna jej ponownie wynik powyżej 57, prognoza okaże się w pełni słuszna, a kluczowa liczba w tym artykule będzie nieaktualna. Jeśli pojawi się wraz z dopłatą za godziny szczytu lub podwyżką cen ogłoszoną 6 sierpnia, argument cenowy osłabnie o połowę, a interesującym pytaniem stanie się, czy 6-krotny rabat rekompensuje 13-punktową stratę. A jeśli firma udostępni swój zestaw ewaluacyjny — już w zamkniętej becie — benchmarki producenta, które obecnie faworyzują V4 Pro w kodowaniu, będzie można po raz pierwszy zweryfikować. Dopóki żadne z tych wydarzeń nie nastąpi, trafne podsumowanie DeepSeek V4 Pro brzmi: to najlepszy pod względem stosunku jakości do ceny poważny model rozumujący, którego wagi można pobrać; nie jest najmądrzejszy, a jego producent poinformował nas, że nie jest ukończony.

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube