RWKV-7 Goose-1
Engineering & Research

RWKV-7 (Goose): 마침내 Transformers에서 이를 로드하게 될 Pull Request 내부

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

지난달 Hugging Face에서 가장 많이 다운로드된 RWKV 모델은 RWKV-7(Goose)이 아니었다. RWKV-7은 이 프로젝트가 2025년 3월부터 배포해 온 아키텍처이며, 그 위에 훈련된 추론 시리즈인 RWKV7-G1도 아니었다. 가장 많이 다운로드된 것은 RWKV/rwkv-4-169m-pile이었다. 2023년 5월에 만들어진 1억 6,900만 파라미터 규모의 RWKV-4 체크포인트로, 2026년 8월 5일까지 30일간 8,824회 다운로드되었다. 같은 기간 1.5B RWKV-7 Goose World-3 릴리스는 215회, 2.9B는 316회였다. 2023년 모델이 더 나은 것은 아니다. 이 모델은 다른 무엇도 설치하지 않고 단순한 from_pretrained 호출만으로 로드되는 모델일 뿐이다.

2026년 8월 4일, Hakureirm이라는 기여자가 huggingface/transformers 저장소에 "Add RWKV-7 (Goose)"라는 제목의 풀 리퀘스트 #47780을 열었다. 8월 5일 현재 이 PR은 열려 있고, 리뷰도 머지도 되지 않았으며, 이는 두 번째 시도다 — 이전 제안인 #46984는 거절되었다. 아직 아무것도 반영되지 않았으므로, 이 글을 릴리스 발표로 읽어서는 안 된다. 하지만 diff는 공개되어 있고, 그 diff는 가장 오래 지속된 attention-free LLM 계열과 대부분의 팀이 실제로 사용하는 스택 사이를 가로막는 가장 지루하면서도 가장 중요한 것, 즉 로더를 다룬다.

다음 내용은 RWKV에 관한 보도가 대개 여러 종류의 주장을 한데 섞어 다루기 때문에, 그 주장들을 세 가지로 구분합니다. 풀 리퀘스트(pull request)와 Hub에서 검증 가능한 내용이 있는데, 이는 직접 확인할 수 있습니다. RWKV 프로젝트가 자체 평가에서 자기 모델에 대해 보고하는 내용도 있습니다. 그리고 아무도 공개적으로 답하지 않은 방대한 질문들이 있는데, 대부분의 흥미로운 위험은 바로 여기에 있습니다.

pull request에 실제로 무엇이 들어 있나요?

RWKV-7 Goose-2

2026년 8월 5일에 PR 페이지와 GitHub API에서 읽은 기계적 사실:

범위 — 커밋 3개, 변경된 파일 12개, 추가된 줄 4,423개, 삭제된 줄 0개. add-rwkv7-upstream 브랜치에서 huggingface:main으로. "새 모델"로 표시됨. 담당자 없음, 마일스톤 없음.

추가 내용 — RWKV-7을 두 개의 공개 클래스(Rwkv7Model 및 Rwkv7ForCausalLM)로 제공하며, 라이브러리의 LinearAttentionLayer를 기반으로 구축된 Rwkv7Cache도 함께 제공합니다. WKV 상태 dtype은 모델 dtype과 독립적으로 구성할 수 있는데, 이는 순환 상태가 이 계열에서 수치적 드리프트가 누적되는 지점이기 때문에 중요합니다.

실행 방식타사 런타임 의존성이 없는 휴대용 PyTorch. Prefill은 순환의 청크 병렬 형태를 사용하고, 디코드는 순차적 단일 토큰 경로로 실행됩니다. 파라미터 이름은 트랜스포머처럼 보이도록 변경되지 않고 업스트림 RWKV 참조 구현을 따릅니다.

테스트 태세 — 표준 모델 믹스인을 넘어, BlinkDL 자체 런타임과 토큰 단위로 정확히 일치하는 통합 테스트, 그리고 모델링 파일과 코드를 공유하지 않는 NumPy 참조 구현이 포함됩니다. 저장소의 CI 요약 봇은 최신 실행을 성공으로 보고합니다: 작업 16개, 테스트 179,151개, 실패 0건, 컴퓨팅 시간 16시간 9분.

현재 상황 — ArthurZucker와 Rocketknight1에게 리뷰가 요청되었습니다. 페이지에는 병합하려면 최소한 하나의 승인 리뷰가 필요하다고 명시되어 있으며, 아직 그 어느 것도 주어지지 않았습니다. GitHub의 API는 우리가 확인했을 때 병합 상태를 여전히 "불안정"으로 설명했고, 유지 관리자용 봇은 병합 전에 느린 테스트 스위트(auto 및 rwkv7)를 실행하도록 요청했습니다. 즉, 빠른 CI에서는 통과했지만 아직 사람의 승인을 받지 못했습니다.

설명에서 가장 흥미로운 부분은 인정하는 대목입니다. 이전 시도인 #46984는 게시된 RWKV-7 체크포인트가 Transformers 규칙을 따르지 않아 거부되었으며, 작성자 자신도 "그 반대 의견이 옳았다"고 밝히고 있습니다. PR에 설명된 문제는 Hub의 RWKV-7 가중치가 라이브러리에서 사용할 수 없는 두 가지 형태로 제공된다는 것입니다:

PTH 저장소 — safetensors가 아닌 원시 .pth 파일입니다. 라이브러리 구현으로는 이를 로드할 수 없으며, PyTorch pickle 파일은 대기업의 보안 검토에서 거부당하는 바로 그 대상입니다.

HF 리포지토리 — 이들은 model.safetensors를 포함하지만, 각각 modeling_rwkv7.py와 auto_map도 함께 제공하므로 로드하려면 trust_remote_code가 필요합니다. 이는 추론의 조건으로서 원격 코드 실행을 의미하며, 그래서 많은 기업 체크리스트가 거기서 멈추는 이유입니다.

따라서 이 PR은 한 번에 두 가지 작업을 수행합니다. 모델링 파일을 추가하고, 표준 레이아웃을 따르는 정식 BlinkDL .pth 릴리스에서 직접 생성된 새로운 변환 세트를 가리킵니다. 즉 safetensors만 사용하고 pickle이나 원격 코드가 없으며, architectures와 model_type을 담은 일반적인 config.json을 포함해 0.1B에서 7.2B까지를 아우릅니다. 가장 작은 모델인 Hakureirm/rwkv7-168m-pile-hf는 399개 텐서 전체가 원본 .pth와 비트 단위로 동일함을 표본 검사가 아닌 전수 검사로 확인했습니다. 해당 체크포인트는 Pile 모델이므로 토크나이저는 RWKV World 어휘가 아닌 일반적인 GPT-NeoX-20B fast 토크나이저를 사용합니다. 이는 라이브러리의 기존 RWKV 페이지에서도 Pile 체크포인트를 문서화하는 것과 같은 이유입니다.

왜 2023년의 체크포인트가 현재 아키텍처보다 더 많이 다운로드될까

RWKV-7 Goose-3

Transformers는 버전 5.14.1이며 2026년 7월 16일에 출시되었습니다. 문서에서 RWKV를 검색하면 정확히 하나의 모델 페이지가 표시됩니다. 이 페이지는 수년 전에 기여된 'RWKV 모델(버전 4)'을 설명하며, RWKV/rwkv-4-169m-pile을 예시로 사용하고 기본 어휘는 50,277개의 토큰입니다. RWKV-5, RWKV-6 또는 RWKV-7에 대한 페이지는 없습니다. 라이브러리의 RWKV 지원이 작성된 이후로 세 가지 아키텍처 세대가 출시되었지만, 그중 어느 것도 포함되어 있지 않습니다.

다운로드 수치는 생태계가 그 문제에 대해 어떻게 대응했는지 보여줍니다. 즉, 라이브러리를 우회한 것입니다. 최근 30일 다운로드 기준으로 정렬하면, 상위 RWKV-7 저장소는 BlinkDL의 원시 .pth 릴리스(rwkv7-g1 8,288회, rwkv-7-world 4,489회)와 13.3B G1의 커뮤니티 GGUF 양자화 파일들로 이루어진 두터운 층입니다 — 각각 월 1,000~3,000회 다운로드를 올리는 여러 업로더들이 있습니다. 공식 transformers 형식 미러는 원시 가중치보다 두 자릿수 아래에 있습니다. 2.9B G1의 flash-linear-attention 미러는 1,843회를 기록합니다.

그 패턴에는 간단한 설명이 있다. llama.cpp는 2025년 3월 17일에 RWKV v7 지원을 병합했다. CPU, CUDA, SYCL, Vulkan, Metal 백엔드를 갖춘 GGML_OP_RWKV_WKV7 커널이었으며, 논문이 올라온 지 약 하루 만의 일이었다. 자신의 머신에서 RWKV-7을 실행하려 했다면 빠른 경로는 GGUF였고, 그 상태가 16개월째 지속되었다. 존재하지 않았던 경로는 모든 파인튜닝 스크립트, 모든 PEFT 어댑터, 모든 평가 하네스, 모든 내부 서빙 래퍼가 전제하는 경로, 즉 플래그 없는 AutoModelForCausalLM.from_pretrained였다.

RWKV-7 (Goose)가 실제로 무엇인가

RWKV-7은 순환 신경망으로, 더 저렴한 어텐션 커널을 갖춘 트랜스포머가 아니며, 그 명칭 때문에 사람들이 끊임없이 혼동합니다. RWKV-7은 과거 키와 값의 캐시가 점점 커지는 대신, 고정 크기의 상태를 시퀀스 전체에 걸쳐 전달합니다. 구체적으로, 표준 어텐션 모델과 비교하면:

컨텍스트가 커지면 메모리도 증가 — 트랜스포머의 KV 캐시는 처리 중인 토큰 수에 따라 선형적으로 증가하는 반면, RWKV-7은 대화가 아닌 아키텍처에 의해 크기가 결정되는 상태를 유지한다. 이것이 효율성 논거의 전부다.

토큰당 비용 — 어텐션은 컨텍스트가 길어질수록 토큰당 비용이 증가합니다. RWKV-7의 토큰당 추론 비용은 일정하며, 이것이 엣지 및 상시 스트리밍 제안에서 계속 등장하는 이유입니다.

훈련 형태 — 고전적인 RNN과 달리, 순환은 청크 단위로 병렬화할 수 있으므로 사전 학습이 순차적 크롤링으로 퇴화하지 않습니다. 이것이 PR의 청크 병렬 프리필 경로가 구현하는 바입니다.

컨텍스트 상한 — 캐시가 터질 일이 없으므로 프로젝트는 사실상 무제한 컨텍스트를 홍보한다. 고정 상태가 담을 수 없는 것은 무제한의 세부 정보이며, 이는 각주가 아니라 실제 한계다.

2025년 3월 18일 Bo Peng, Yu Zhang, Songlin Yang, Ruichong Zhang이 LF AI & Data Foundation 산하 RWKV Project에서 발표한 논문의 아키텍처 주장은, 벡터 값 게이팅(vector-valued gating), 문맥 내 학습률(in-context learning rates), 완화된 값 대체 규칙(relaxed value-replacement rule)을 갖춘 일반화된 델타 규칙(generalized delta rule)과 단순화된 MLP(게이팅 행렬 제거, 은닉 차원 확대로 보완)를 포함한다. 여기에 딸린 이론적 결과가 더 도발적인 측면이다: RWKV-7은 상태 추적(state tracking)을 수행하고 모든 정규 언어(regular languages)를 인식할 수 있으면서도 훈련 시 병렬화가 가능하며, 저자들은 이것이 표준 복잡성 가설(standard complexity conjectures) 하에서 트랜스포머가 할 수 있는 것보다 뛰어난 것이라고 주장한다.

모든 것은 Apache 2.0입니다. 다운로드할 수 있는 제품군은 0.1B(12개 레이어, 폭 768), 0.4B(24/1024), 1.5B(24/2048), 2.9B(32/2560), 7.2B(32/4096), 13.3B(61개 레이어, 폭 4096) 크기로 제공되며, 모두 65,536토큰 World 어휘와 헤드 크기 64를 사용합니다. 기본 World 시리즈는 3.1조 토큰 규모의 다국어 코퍼스로 학습되었습니다. G1 "GooseOne" 시리즈는 더 많은 소설, 웹 텍스트, 수학, 코드 및 추론 데이터를 포함하는 확장된 5.16조 토큰 혼합 데이터인 World v3.5에서 해당 학습을 계속합니다. G1 체크포인트는 think 태그 추론 모드, JSON 함수 호출, 그리고 G1c부터 fill-in-the-middle(중간 채우기) 기능을 추가합니다. 이름 짓기는 정말 난감한데, G0는 1에포크 미만, G1은 1에포크 이상을 의미하며, 접미사 문자는 데이터 개정판을 나타내고 나중 문자일수록 더 나은 데이터를 담고 있습니다.

그 숫자들, 그리고 그 숫자들이 누구의 숫자인지

여기 증거의 솔직한 상태가 있습니다. 헤드라인 벤치마크 주장 — 2.9B 모델이 다국어 작업에서 새로운 3B 최고 수준을 세웠고, 훨씬 적은 학습 토큰으로 영어 3B 최고 수준에 맞먹었다는 것 — 은 논문 자체의 주장으로, 2025년 3월에 발표되었고 그 시기의 3B 모델들을 기준으로 평가되었습니다. 이는 OpenReview를 거쳤는데, 이는 공급업체 블로그 게시물이 받는 것보다 더 엄격한 검토이며, 그럼에도 15개월 된 비교 세트에 대한 자체 보고 결과입니다.

프로젝트의 또 다른 공개 측정 지표인 UncheatableEval은 리더보드의 한 줄보다 더 흥미로운데, 거의 주목을 받지 못한다. 훈련 세트로 새어 들어가는 객관식 벤치마크를 채점하는 대신, 이 지표는 모델이 훈련될 당시에는 존재하지 않았던 데이터, 즉 새로운 arXiv 논문, 최신 GitHub 저장소, 최근 뉴스에 대한 압축률을 측정한다. 이러한 설계 덕분에 오염이 훨씬 어려워지며, RWKV는 동일한 크기의 트랜스포머와 경쟁력 있는 성능을 보인다고 보고한다. 여전히 프로젝트가 자체적으로 수행하는 평가이다.

{{1}}우리가 찾을 수 있는 한, 어떤 RWKV-7 체크포인트에도 독립적인 제3자 지수 점수는 존재하지 않습니다. 중립적인 집계 기관이 프런티어 모델에 적용하는 평가 체계에 7.2B나 13.3B를 통과시킨 적이 없기 때문입니다.{{/1}} {{2}}따라서 DeepSeek V4 FlashQwen3.8-Max 같은 모델과의 비교는 두 가지 측면에서 범주 오류입니다. 누구도 RWKV-7을 동일한 평가로 돌린 적이 없고, 13.3B 밀집 RNN이 프런티어 시스템과 같은 작업에서 경쟁하는 것도 아니기 때문입니다.{{/2}} {{3}}방어 가능한 주장은 더 좁고 더 유용합니다: 1.5B에서 13.3B, 상수 메모리, 열두 개 정도의 언어, 허용적 가중치에서 말이죠.{{/3}}

오늘날 RWKV-7을 실행한다는 것, 그리고 그것이 당신에게 드는 비용

RWKV-7 Goose-4

RWKV/RWKV7-Goose-World3-1.5B-HF의 Hub 페이지는 현재의 마찰을 잘 보여주는 예시입니다. 이 모델은 1.52B 매개변수 BF16 모델로, RWKV World 토크나이저를 사용하며, Apache 2.0 라이선스이고, custom_code 태그가 지정되어 있으며, 영어, 중국어, 일본어, 한국어, 프랑스어, 아랍어, 스페인어, 포르투갈어를 지원합니다. 모델의 지침은 로드하기 전에 flash-linear-attention과 최신 transformers를 설치하라고 안내합니다. 그리고 사이드바에서 호스팅된 모델이 제공자를 표시하는 자리에는 이렇게 명확하게 적혀 있습니다. 이 모델은 어떤 Inference Provider에서도 배포되지 않았습니다.

그래서 오늘 선택지는 전부 셀프 서비스입니다:

flash-linear-attention plus trust_remote_code — 일반적인 Hub 사용 방식에 가장 가깝지만, 저장소 코드를 실행하고 Triton 커널을 가져오므로 하드웨어와 보안 검토가 필요한 모든 환경에서 제약이 따릅니다.

GGUF via llama.cpp — 실질적으로 가장 잘 지원되는 경로이며, 13.3B 모델도 포함합니다. 다운로드 수가 보여주듯 사람들이 실제로 선택하는 방식이기도 합니다. 로컬 추론에는 훌륭하지만, 훈련이나 파인튜닝 경로는 아닙니다.

프로젝트 자체 런타임 — rwkv pip 패키지와 참조 저장소로, 표준 구현에 가장 가깝고 팀이 이미 보유한 도구와는 가장 거리가 먼 것입니다.

그중 어느 것도 호출할 수 있는 API가 아니며, 그 함의에 대해 직접적으로 말할 가치가 있습니다. RWKV-7은 OrcaRouter에 없습니다. 우리가 찾을 수 있는 어디에도 호스팅된 엔드포인트가 아니기 때문입니다. RWKV-7을 원한다면 RWKV-7을 직접 실행해야 합니다. 우리가 정직하게 말할 수 있는 것은 그 상황이 나머지 스택을 어떤 처지에 놓이게 하는가입니다. 검증되지 않은 아키텍처를 평가하는 것은 프로덕션 경로가 그 결과에 의존하지 않을 때에만 저렴합니다. 그리고 그 상태를 유지하는 가장 저렴한 방법은 다른 어떤 것을 위해서도 공급업체별 통합을 만들지 않는 것입니다. 200개 이상의 모델에 걸쳐 작동하는 하나의 OpenAI 호환 키, 0% 마크업으로 그대로 전달되는 공급업체 정가, 공급업체 성능이 저하될 때의 자동 장애 조치(failover). 그러면 상수 메모리가 실제로 이점을 제공하는 두 워크로드, 즉 장기 실행 스트림, 온디바이스 어시스턴트, 멈추지 않는 요약기에서 자체 호스팅 RWKV-7 실험을 하는 것은 마이그레이션이 아니라 실험입니다. 이것이 대부분의 팀이 여기서 원해야 할 형태입니다. 라우팅되는 기본값, 그리고 특정 작업에서 자격을 증명하며 자리 잡는 상태 기반 모델.

아직 이 착륙을 막을 수 있는 것이 무엇일까

선례를 진지하게 받아들이십시오: 이 정확한 아키텍처를 추가하자는 제안은 이미 한 번 거절된 적이 있으며, 그 거절 근거는 저자도 타당하다고 인정한 것이었습니다. 새 제안은 논증이 더 탄탄하고 테스트도 더 잘 되어 있지만, 여전히 커뮤니티 PR로서, 승인할 경우 이후 영원히 유지보수해야 할 아키텍처를 수용하는 데 의도적으로 보수적인 저장소를 대상으로 합니다.

이 작업을 완료로 간주하기 전에 답변을 원하는 구체적인 미해결 질문은 다음과 같습니다:

리뷰, CI 아님 — 자동화된 테스트 스위트는 통과했지만, 두 명의 메인테이너에게 요청했고 아무도 승인하지 않았습니다. Transformers는 승인 리뷰 한 건이 필요하며, 느린 테스트는 실행되지 않았습니다.

의존성 없는 경로의 속도 — 순수 PyTorch와 순차적 단일 토큰 디코딩은 이식성이 있으며, 이식성이 바로 핵심입니다. 하지만 PR은 flash-linear-attention의 Triton 커널과 비교한 처리량을 공개하지 않습니다. 네이티브 디코딩이 현저히 더 느리다면, 라이브러리는 호환성 경로가 되고 실제 서빙은 다른 곳에 남게 됩니다.

어떤 체크포인트가 도착하는가 — 컨벤션을 준수하는 변환은 0.1B에서 7.2B까지를 다룹니다. 사람들이 실제로 원하는 13.3B G1은 그 집합에 포함되어 있지 않으며, 문서화된 예시는 World 어휘를 사용하는 채팅 모델이 아닌 GPT-NeoX 토크나이저를 사용하는 Pile 모델입니다. 뒤에 플래그십 체크포인트가 없는 병합된 로더는 겉보기만큼 큰 변화를 가져오지 않습니다.

움직이는 표적 — 프로젝트는 멈춰 있지 않습니다. BlinkDL의 G1 저장소는 이 PR이 열린 같은 주에 업데이트되었고, 커뮤니티 양자화는 G1c보다 더 최신 데이터 리비전으로 진행되었으며, RWKV-8 "Heron"은 ROSA라는 접미사 자동자(suffix automaton) 메커니즘으로 공개적으로 프리뷰되었습니다. Heron은 아직 출시되지 않았고 벤치마크도 없습니다. 우리는 단지 세대의 수명이 끝나갈 무렵에 도착하는 라이브러리 통합은 수명이 짧기 때문에 언급할 뿐입니다.

사양서가 답하지 못하는 네 가지 질문

지금 Transformers에서 RWKV-7을 사용할 수 있나요, 아니면 안 되나요?

짜증나게도, 둘 다입니다. 그리고 그 구분이 핵심입니다. 오늘날 transformers API를 통해 RWKV-7 체크포인트를 로드할 수 있습니다. flash-linear-attention을 설치하고 trust_remote_code를 전달하면 저장소의 자체 모델링 파일이 실행됩니다. 하지만 라이브러리 자체에서 로드하는 것은 불가능합니다. 바로 이 점이 라이브러리 위에 구축된 도구들(학습 및 정렬 스크립트, 어댑터, 평가 하네스, 내보내기 경로)에서 기본적으로 작동하게 하는 것이며, 원격 코드를 금지하는 정책을 통과하게 하는 것입니다. 그 두 번째 것은 #47780이 담당합니다.

병합이 모델을 더 좋게 만드나요?

어떤 벤치마크에서도 단 한 점도 바뀌지 않았다. 그것은 품질이 아니라 배포를 바꾼다. 그리고 품질이 문제였던 적이 없는 아키텍처에게 배포가 핵심 제약 조건이다. 이 글의 맨 위에 있는 비교가 바로 그것이다: 2023년의 169M 모델이 현재 세대의 가중치보다 40대 1로 더 많이 다운로드되는데, 전적으로 플래그 없이 로딩되는 덕분이다.

KV 캐시가 없다면, 무제한 컨텍스트를 무료로 얻을 수 있나요?

무제한 컨텍스트 길이를 메모리 폭증 없이 얻을 수 있지만, 이는 무제한 회상과는 다릅니다. 고정 크기 상태는 고정된 정보 용량을 가지므로, 백만 개의 토큰을 입력해도 백만 개의 토큰만큼의 검색 가능한 세부 정보를 담을 수 없습니다. 전체 캐시를 갖춘 어텐션은 담을 수 있지만, 그 비용은 내내 증가합니다. RWKV-7의 장기 컨텍스트에 대한 이야기는 "저렴하게 영원히 스트리밍하면서 가는 동안 압축한다"는 뜻으로 받아들이고, "무한"이라는 단어를 믿기보다 필요한 특정 검색을 테스트하십시오.

프론티어 모델들이 수천억 파라미터 규모일 때, 13.3B 모델에 신경 쓸 가치가 있을까요?

상수 메모리가 당신에게 어떤 가치가 있는지에 전적으로 달려 있습니다. 호스팅된 API를 호출하고 토큰당 비용을 지불하는 경우라면, 거의 확실히 그렇지 않습니다 — 최첨단 모델은 성능 면에서 훨씬 앞서 있고 KV 캐시에 대해 직접 비용을 지불하지 않기 때문입니다. 통제할 수 없는 하드웨어에 추론을 배포하거나, 커지는 캐시가 결국 프로세스를 죽이는 원인이 되는 지속적 스트림을 실행하는 경우라면, 메모리 사용량이 변하지 않는 아키텍처는 다른 질문에 대한 다른 종류의 답변입니다. 바로 그러한 워크로드에서 2.9B RWKV-7이 조용히 경쟁력을 유지해 왔으며, 네이티브 로더가 가장 중요하게 작용하는 곳도 바로 그런 작업들입니다.

우리가 다음에 볼 것

우리의 판단을 얼마나 바꿀지에 따른 대략적인 순서로, 네 가지 구체적인 신호가 있다. ArthurZucker 또는 Rocketknight1의 승인 리뷰는 이것을 희망적인 diff에서 예정된 기능으로 바꿔준다. World 토크나이저를 사용한 13.3B G1의 규약 준수 변환은 로더를 가질 가치가 있게 만드는 요소다. Triton 커널과 비교한 의존성 없는 디코드 경로의 공개된 처리량 수치는 네이티브 지원이 서빙 옵션인지 호환성 쉼인지를 결정한다. 그리고 RWKV-8의 어떤 조짐은 이 통합이 세대의 시작에 도래하는지 끝에 도래하는지를 알려줄 것이다.

적어도 그중 첫 번째가 일어나기 전까지는, 올바른 요약은 그다지 화려하지 않은 것이다: RWKV-7(Goose)은 실제이며, 허용적 라이선스가 적용되어 있고, 최대 13.3B까지 다운로드할 수 있지만, 생태계 대부분이 기반을 둔 라이브러리에는 여전히 네이티브로 로드할 수 없다. 2026년 8월 4일에 열린 풀 리퀘스트가 이를 해결하자고 제안한다. 그 풀 리퀘스트는 병합되지 않았으며, transformers에 아키텍처를 추가하는 풀 리퀘스트는 실제로 닫히기도 한다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube