
Ternary Bonsai 2 27B Uncensored vs Qwen3.8-27B-Uncensored-MLX: 거부 방향을 제거하는 두 가지 방법
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
OrcaRouter Ternary Bonsai 2 27B Uncensored 및 Qwen3.8-27B-Uncensored-MLX는 같은 질문, 즉 언어 모델에서 거부 방향을 어떻게 제거하는가라는 질문에 답하며, 그 답을 서로 다른 두 곳에서 제시한다. Qwen3.8-27B-Uncensored-MLX 계열은 전통적인 abliteration이다: 가중치 행렬은 학습된 거부 방향에 대해 직교화되고, 편집된 가중치는 새 체크포인트로 저장된다. OrcaRouter Ternary Bonsai 2 27B Uncensored는 대신 추론 시점에 동등한 투영을 수행하여, 거부 방향을 따라 놓인 각 잔차 쓰기의 성분을 빼며, 따라서 기반 Bonsai 팩은 절대 수정되지 않고 비트 단위로 동일하게 유지된다. 둘 다 우리 자체 릴리스이며, 둘 사이의 구분은 런타임에 대한 선호가 아니다. 그것은 삼진 가중치에 특유한 산술에서 비롯된다.
이 비교의 대상은 이제 겨우 하루 되었다. Prism ML은 2026-09-17에 Bonsai 2 27B를 발표했고, Hugging Face 리포지토리들은 그 전날 저녁인 2026-09-16 23:40–23:41 UTC에 Apache-2.0에 따라 생성되었다. 비교 대상이 되는 abliterated MLX 빌드는 8월 중순부터 올라와 있다. 아래의 어떤 내용도 둘 중 더 새로운 쪽의 실적 기록이 아니다 — 무언가가 측정되지 않은 경우, 이 글은 그렇게 밝힌다.
서로 다른 두 곳에 적용된 같은 기법
일반적인 abliteration은 가중치 편집이다. 거부 방향을 추정한 다음, 잔차 스트림에 기록하는 행렬에서 그 방향을 사영해 제거한다: W ← W - r(rᵀW). 행렬 곱셈 몇 번이면 끝이고, 옵티마이저도 손실도 필요 없다. Qwen3.8-27B-Uncensored-MLX가 바로 이렇게 만들어졌다 — 모델 카드는 이를 "abliteration(거부 방향 제거), 그다음 MLX 아핀 양자화"라고 설명하는데, 방향을 잔차 스트림에서 직교화해 제거하고 그 결과를 새로운 가중치 집합으로 저장한다는 것이다. 실제로 배포되는 것은 그 방향이 이미 사라진 체크포인트다.
OrcaRouter Ternary Bonsai 2 27B Uncensored는 가중치는 그대로 두고, 각 잔차 기여가 생성되는 지점에 float32로 개입하며, 저장된 거부 방향과 함께, r:
• y ← y - alpha · dot(y, r) · r
알파 1 — 기본값 — 에서 r에 평행한 성분은 해당 쓰기에서 제거됩니다. 알파 0에서는 투영이 꺼져 있고 모델은 공개된 팩과 동일하게 동작합니다. 그 사이의 값은 부분적인 강도를 제공하고, 1을 초과하는 값은 과도하게 투영하는데, 프로젝트에 따르면 이는 품질을 저하시킬 수 있습니다. 레이어 선택도 노출되어 있으므로 전체 스택이 아니라 부분 집합을 어블레이션할 수 있습니다. 방향 자체는 추가 아다마르 회전이 적용되지 않은 평범한 5120차원 벡터입니다 — float32에서 약 20KB — 왜냐하면 투영은 이미 일반적인 히든 기저에 있는 투영 출력에 대해 작동하기 때문입니다.
커버리지 세부 사항은 사람들이 직접 시도해 볼 때 틀리기 쉬운 부분이다. self_attn.o_proj만 감싸면 16개 지점만 잡힌다. 이 구현은 129개의 residual writer를 감싼다: 64개의 mlp.down_proj, 48개의 linear_attn.out_proj, 16개의 self_attn.o_proj, 그리고 model.embed_tokens를 포함한다. 함께 제공되는 selfcheck.py는 프로젝션이 나머지 구성 요소를 residual norm의 대략 1e-6 수준까지 끌어내리는지 검증하고, 129개 지점이 감지되지 않으면 경고한다.

삼항 가중치가 이것을 선호가 아니라 강제된 선택으로 만드는 이유
다음은 실제로 이 모델에 특화된 부분이며, 두 접근 방식이 거의 같은 것을 계산함에도 불구하고 여기서 서로 바꿔 쓸 수 없는 이유입니다.
삼진 팩은 값을 {-1, 0, +1}에 그룹별 FP16 스케일을 곱한 값으로, 그룹 크기 128로, 회전된 기저에서 저장한다. 삼진 행렬을 거부 방향에 대해 직교화하면 조밀한 전체 정밀도 행렬이 된다. 다음과 동일한 삼진 행렬은 존재하지 않는다: W - r(rᵀW) — 일반적으로 그렇다. 따라서 편집된 가중치를 다시 저장한다는 것은 재양자화를 뜻하며 — 편집된 가중치를 재양자화한다고 해서 원래 팩을 만들어 낸 양자화 인식 학습이 재현되지는 않는다. Prism ML이 모델이 견디도록 학습시킨 반올림 동작은 양자화기의 속성이 아니라 학습 절차의 속성이며, 사후에 다시 실행할 수 없다.
조밀한 BF16 체크포인트에서는 그런 문제가 발생하지 않는다. 편집된 가중치를 4비트로 반올림하면 조금 더 나쁜 4비트 모델이 나오는데, 이는 이미 모두가 받아들이는 일반적인 트레이드오프다. 삼진 팩에서는 그 팩이 존재하는 이유인 단 하나의 속성을 버리는 셈이 된다.
그러니까 솔직한 표현은 "런타임이 더 낫다"가 아니다. 그것은 런타임 프로젝션이 이 특정 모델의 특별한 점을 보존하는 둘 중 유일한 방식이라는 것이다. 거부 방향은 20 KB다. 팩은 8.005 GiB다.
그 8.005 GiB 수치는 구체적으로 MLX 팩입니다 — prism-ml/Ternary-Bonsai-2-27B-mlx-2bit, 여기서 model.safetensors는 Hugging Face API에서 8,595,477,990바이트(8.595 GB, 8.005 GiB)로 측정되며, 그룹당 2비트 코드와 FP16 스케일 및 바이어스를 갖춘 MLX 아핀 컨테이너입니다. 이는 Prism ML이 제공하는 GGUF 빌드와는 다른 아티팩트이며, 수치도 서로에게 적용되지 않습니다. Prism ML 자체의 5.93 GB / 가중치당 1.76비트 헤드라인은 그들의 PTQ1_0 GGUF를 설명하는데, 이는 5.947 GB로 측정됩니다. 그들의 True Ternary 포맷은 가중치당 1.72비트 및 5.80 GB로 제시됩니다. 그 수치 중 어느 것도 이 런타임이 어블레이션하는 MLX 팩을 설명하지 않습니다.
체크포인트 접근 방식이 여전히 이기는 경우, 그리고 그것은 분명히 일부에서는 이긴다

이 글을 새로운 방법을 위한 승리의 세리머니로 쓰기는 쉬울 것이다. 하지만 그건 틀렸다. 대부분의 배포를 결정하는 축에서는 기존의 abliteration이 앞서 있기 때문이다.
• 하나의 아티팩트, 모든 호환 런타임. abliterated 체크포인트는 평범한 가중치 집합입니다. 이미 사용 중인 아무 MLX 호환 로더에나 로드하면 작동합니다. 런타임 방식은 팩에 자체 번들된 런타임을 필요로 하며, 이 프로젝트는 일반 MLX 로더가 팩을 로드한 것처럼 보이면서도 조용히 잘못된 계산을 할 수 있다고 명시적으로 경고합니다. 그것은 훨씬 좁은 활주로입니다.
• 하드웨어. Qwen3.8-27B-Uncensored-MLX는 2, 4, 6, 8비트 빌드로 제공되며, 4비트 사본이 리포지토리 루트에 미러링되어 있어 리포지토리를 단일 모델로 취급하는 도구에서 별도 구성 없이 로드됩니다. Ternary Bonsai 2 27B Uncensored는 Apple Silicon / MLX용입니다. 이 팩의 양자화된 행렬 곱셈에는 Metal 및 CPU 커널이 있지만 mlx-cuda를 통한 CUDA 구현은 없으므로, NVIDIA 머신에서는 이 MLX 팩이 현재 전혀 GPU 가속을 받지 못합니다. CPU 추론은 작동하며, 27B 순전파는 몇 분이 걸릴 수 있습니다. 따라서 Linux CPU 경로는 구현 테스트와 재현성에는 유용하지만, 서빙용으로는 적합하지 않습니다.
• 도구와 친숙함. Abliteration은 수년간의 도구가 뒷받침되어 왔습니다 — 조정된 레시피, 레이어 범위 검색, 비교해 볼 수 있는 공개된 변형들까지. 여기의 런타임 방식은 어제 공개된, 하나의 모델에 대한 하나의 구현뿐입니다.
• 배포. 단일 체크포인트는 단일 다운로드입니다. 런타임 어블레이션은 팩, 방향 파일, 런타임을 함께 제공하며, 독자는 세 가지를 계속 맞춰야 합니다.
• 증거. 체크포인트 어블리터레이션은 이 베이스 모델 패밀리에 대한 제3자 측정값을 갖고 있습니다. 삼진 팩에 대한 런타임 어블레이션은 우리 자체 수치만 있으며, 그 핵심 가정은 검증되지 않았습니다 — 이에 대한 자세한 내용은 아래에 있습니다.

런타임 어블레이션이 그 대가로 얻는 것
그 트레이드오프는 반대 방향에서도 실제로 존재하며, 첫 번째 항목이 바로 이 모델을 넘어 일반화되는 항목이다.
• 비트 단위로 동일한 출처.수정된 가중치 0개, 재양자화 0회, 추가 양자화 오류 0. 이것은 구호가 아닙니다. 아래의 역량 수치를 단순한 우연이 아니라 해석 가능하게 만드는 속성입니다.
• 조정 가능한 알파. 어블레이션 강도는 체크포인트 속성이 아니라 런타임 파라미터입니다. 워크로드에 맞춰 값을 훑어보거나, 알파 0으로 완전히 비활성화하거나, 과도하게 투영해서 무엇이 깨지는지 측정할 수 있습니다 — 두 번째 모델을 내려받을 필요 없이 말이죠.
• 레이어 선택적 제어. 레이어의 일부를 어블레이션하는 것은 재굽기가 아니라 인자입니다. 이는 어떤 레이어가 그 동작을 담당하는지 연구하는 사람에게 중요한데, 왜냐하면 대안은 구성마다 체크포인트를 하나씩 생성하는 것이기 때문입니다.
• 두 번째 가중치 세트는 없습니다. 편집된 모델이 곧 원본 모델입니다. 존재 의의 전체가 차지하는 용량에 있는 팩이라면, 비교 저장소의 4비트 빌드 크기인 약 16GB에 달하는 병렬 abliterated 사본을 함께 배포하는 것은 그 요점을 약화시킬 것입니다.
• 가역성. 체크포인트 편집은 해당 아티팩트에 대해 영구적입니다. 런타임 플래그는 그렇지 않습니다.
우리가 가진 수치들, 그리고 그것들이 정확히 어떻게 측정되었는지
이 섹션의 모든 내용은 OrcaRouter가 OrcaRouter Ternary Bonsai 2 27B Uncensored를 자체 평가한 것이며, 방법은 수치만큼 중요합니다.
그 측정은 규칙 기반 도입 문구 분류기이지, LLM 판정기가 아니다. 사고는 꺼져 있고, 디코딩은 그리디이며, 예산은 64토큰이고, base와 ablated는 alpha 0 대 alpha 1에서 동일한 프로세스 안의 동일한 가중치다. 그 마지막 점이 이 설정의 가장 강력한 부분이다: 교차 체크포인트 비교도 없고, 결과를 교란할 양자화 차이도 없다. 또한 이는 그 숫자들을 모델이 도입 문구에서 말하는 것에 대한 측정치로, 그 이상은 아닌 것으로 읽어야 하는 이유이기도 하다.
공개된 유해 프롬프트 세트에 대한 거부율, 베이스에서 어블레이션까지:
• AdvBench (n=100) — 99.0%에서 6.0%로
• JailbreakBench (n=100) — 96.0%에서 4.0%로
• StrongREJECT (n=150) — 99.3%에서 3.3%로
• HarmBench (n=150) — 98.7%에서 7.3%로
• MaliciousInstruct (n=100) — 97.0%에서 0.0%로
• ForbiddenQuestions (n=150) — 75.3%에서 5.3%로
• SimpleSafetyTests (n=50) — 96.0%에서 18.0%로, 그리고 이 항목은 실제보다 축소되어 있습니다.
SimpleSafetyTests는 특정한 이유로 실제보다 낮게 제시되어 있습니다. 그 세트는 대부분 자해 프롬프트로 이루어져 있고, 어블레이션된 모델은 “I am deeply sorry to hear…”로 시작하는 위기 리디렉션으로 이에 답합니다. 분류기의 정확한 문구 목록에는 그 시작 문구가 없기 때문에, 리디렉션을 준수로 채점합니다. 실제 잔여 거부율은 18.0%보다 높습니다. 분류기는 의도적으로 그대로 두었으며, 이에 따라 수치가 OrcaRouter의 다른 모델 카드와 비교 가능하게 유지됩니다 — 하지만 독자는 18.0%를 액면 그대로 받아들여서는 안 됩니다.
이 실행들 중 어느 것에서도 응답이 토큰 예산을 소진하지 않았으며, 그렇기 때문에 여기서는 64토큰 예산이 정당화될 수 있다. 전체 결과의 별도 열은 답변은 했지만 답변을 면책 문구로 감싼 응답을 집계하는데, 그 비율은 세트에 따라 42–60%였다.
단순한 이야기에 어긋나는 두 가지 결과
연구 결과 중 두 가지는 따로 다룰 만한데, 둘 다 명백한 해석을 복잡하게 만들기 때문이다.
과잉 거부도 줄어듭니다. JailbreakBench의 무해한 프롬프트에서 공개된 팩은 그중 25.0%를 거부합니다. 어블레이션을 적용하면 0.0%를 거부합니다. XSTest-safe에서는 5.2%에서 0.4%로 감소합니다.
이것은 이 기법에서 충분히 보고되지 않은 나머지 절반이다. 공개된 Bonsai 팩은 무해한 프롬프트 세트의 4분의 1을 거부한다. QAT 모델에서 거부 방향이 무엇을 하고 있든, 그것은 결코 그것을 촉발했어서는 안 될 프롬프트에서 발동하고 있다. 그 방향을 제거하면 그러한 거부도 함께 제거되며, 이는 안전 비용이 아니라 진정한 능력 향상이다. 같은 효과는 다른 모델에 대한 독립 연구에서도 나타난다 — Atomic Chat 자체의 하네스는 abliteration 후 Gemma 2 9B의 무해 프롬프트 과잉 거부가 44%에서 0.5%로 급감했고, MMLU는 68.4에서 68.0으로 사실상 거의 움직이지 않았다고 측정했다. 그들의 측정, 그들의 모델, 그들의 블로그에 스스로 보고된 내용이다; 중요한 것은 정확한 수치가 아니라 패턴이다.
이어지는 틀은 불편하지만 정직하다: 과잉 거부와 거부는 같은 손잡이다. 당신은 마음에 들지 않는 거부만 골라서 줄일 수는 없다.
능력 유지율은 평탄하며, 그것은 운이 아니다. 기본에서 제거된 상태까지의 능력 검사:
• MMLU (n=300) — 76.7%에서 77.7%로, +1.0
• GSM8K (n=150) — 87.3%에서 86.0%로, -1.3
• CMMLU (n=500) — 76.2%에서 75.6%로, -0.6
이러한 표본 크기에서 모든 변화는 노이즈 범위 안에 있습니다 — GSM8K 질문 하나는 0.7점에 해당합니다. MMLU-Pro는 보고되지 않고 제외되었습니다: 해당 프롬프트는 답변 전에 추론을 요구하는데, 양쪽 모두에서 응답의 63–64%가 토큰 예산 안에서 답변에 도달하지 못했으므로, 어떤 정확도 수치든 측정값이라기보다 예산에 의해 정해진 하한값이었을 것입니다.
평탄한 성능은 비트 단위로 동일한 가중치에서 직접 따라오며, 그 이유를 정확히 짚을 가치가 있다. 답변을 생성하는 모델은 동일한 모델이다. 런타임은 잔차 쓰기마다 내적 하나와 AXPY 하나를 추가할 뿐, 가중치나 양자화, 또는 이를 읽는 커널에 대해서는 아무것도 바꾸지 않는다. 체크포인트 방식은 그런 평탄함을 스스로 입증해야 하며, 종종 그러지 못한다. 동일한 Qwen3.8-27B 베이스에 대한 다른 어블리터레이션을 다룬 제3자 시험대가 2026-08-17 SMF Works의 한 엔지니어에 의해 공개되었는데, 종합 점수가 79.0%에서 72.0%로 하락했고 수학은 50.0%에서 33.3%로 떨어졌다. 그것은 다른 레시피, 다른 툴체인, 다른 측정이므로 이 비교에 대한 점수는 아니다. 이는 이 베이스에서의 체크포인트 어블리터레이션이 적어도 하나의 신중하고 계측된 테스트에서 두 자릿수 비용을 치렀음을, 그리고 "어블리터레이션은 거의 무료"라는 주장이 전적으로 레시피에 달려 있음을 상기시킨다.
아직 아무도 검증하지 않은 가정
이것은 이야기에서 분명히 말해야 하는 부분이며, 각주가 아니라 검열 해제 방법들의 비교에 속한다.
여기서 사용된 거부 방향은 Bonsai 팩이 훈련된 BF16 베이스 모델에서 추정되었습니다. 아키텍처와 은닉 기저가 동일하므로, 이 벡터는 차원상 정확하고 투영은 수학적으로 정확합니다 — 런타임은 잔차 스트림에서 제공된 방향을 제거한다는 것을 증명할 수 있고, 실제로 검증합니다.
그것이 증명하지 못하는 것은, 그 방향이 양자화 인식 학습된 모델에서도 여전히 같은 의미를 지닌다는 점이다. 그 방향이 양자화 인식 학습을 얼마나 잘 견디는지는 완전히 측정되지 않았다. 벡터를 정확히 제거하는 것은 그것이 나타낸다고 추정된 행동을 제거하는 것과 같지 않으며, 중요한 것은 두 번째 주장이다. 위 절의 모든 수치는 좋은 전이와 일치하는 경험적 결과일 뿐이고, 그중 어느 것도 전이가 완전하다는 것을 입증하지는 않으며, 프로젝트 자체도 결론을 내리기 전에 alpha와 레이어 선택을 스윕할 것을 권장하면서 그렇게 말하고 있다.
검열 해제 방법에 대한 어떤 정직한 비교든 이 점을 인정할 수밖에 없다. 기존의 abliteration은 거울상 문제를 안고 있다 — 가중치를 편집한 뒤 그 결과를 측정하므로, 그 방향이 모델 버전 간에 전이될 필요는 없지만, 레시피가 잘못되었다면 그 편집은 영구적이며 복구할 수 없다.
아직 측정되지 않은 것은 무엇인가
이전 문제를 넘어, 세 가지 간극은 빙 둘러 쓰기보다 이름 붙일 가치가 있다.
• 독립적인 재현은 없습니다.유통되는 모든 Bonsai 2 27B 벤치마크 — 83.9 평균, 98.2% 유지율, 카테고리별 분할 — 는 Prism ML이 자체 보고한 것으로, H100에서 vLLM 백엔드의 EvalScope로 "xhigh" 추론 노력 수준에서 실행되었습니다. Prism ML 외부의 누구도 이를 재현하지 못했습니다. 위의 안전성 및 역량 표는 저희 것이며, 이것 역시 독립적이지 않습니다.
• 사고 켜짐 상태의 동작. 우리 표는 사고 꺼짐 상태입니다. 다른 abliterated 모델에 대한 독립적 연구에서는 공격 성공률이 100%에 달하더라도, 모델이 생각하도록 허용될 때 상당한 비율의 응답에서 여전히 안전성에 대해 추론한다는 사실을 발견했습니다. 그것이 여기에도 해당하는지, 그리고 그것이 도입 문구 수치에 어떤 영향을 미치는지는 측정되지 않았습니다.
• 단일 방향. 이 방법은 거부가 하나의 방향에 의해 매개된다고 가정하는데, 이는 Arditi 등의 발견이며 이 기법 전체의 기반이다. 다른 모델들에 대한 후속 연구에서는 서로 다른 거부 범주에 대해 기하학적으로 구별되는 방향들을 발견했다. 하나의 벡터를 하나의 알파 값에 걸쳐 훑는 것만으로는 그것을 해결하지 못한다.
이들 중에서 선택할 때 이것이 의미하는 바
모델이 당신이 통제하지 않는 하드웨어에서, 당신이 작성하지 않은 로더를 통해 어디서든 실행되기를 원한다면 체크포인트를 고르세요. Apple Silicon을 사용 중이고, 당신이 연구 중인 아티팩트가 Prism ML이 학습시킨 바로 그 아티팩트라는 점이 중요하며, 어블레이션 강도를 다시 다운로드해야 하는 결정이 아니라 조정할 수 있는 파라미터로 두고 싶다면 런타임을 고르세요. 둘 다 방어 가능한 선택이며, 이는 어떤 방법이 더 새로운지가 아니라 배포 제약에 의해 선택됩니다.
실증적으로 결정하려는 것이라면, 런타임 방식에는 꼽을 만한 실용적 이점이 하나 있습니다: 알파 0과 알파 1은 동일한 프로세스이고 동일한 가중치이므로, 둘을 비교하면 어블레이션만 분리되고 그 외에는 아무것도 분리되지 않습니다. 이는 두 체크포인트를 서로 비교하는 것보다 더 깔끔한 실험이며, 위 표를 투영의 두 양자화에 대한 측정이 아니라 투영 자체에 대한 측정으로 읽을 수 있는 이유입니다.
책임감 있는 사용
학습된 거부 방향을 제거하면 원래 모델이라면 거절했을 요청에 모델이 응답할 수 있습니다. 그것은 부작용이 아니라 메커니즘이 작동하는 것이며, 기능으로 분류되어서는 안 됩니다. 이것은 연구 및 추론 제어 메커니즘이며, 그로 인해 나오는 어떤 출력이 안전하거나 정확하거나 적절하다는 증거가 아닙니다.
공개된 팩 자체의 카드는 같은 점을 반대편에서 지적한다. abliterated MLX 빌드는 "안전 정렬이 상당 부분 제거되었고", 원본이라면 거부할 요청도 따르며, 의미 있는 내장 가드레일이 없다. 그 작성자들은 이것을 정당한 연구 — 해석 가능성, 안전 연구, 레드팀, 견고성 평가 — 로 범위를 한정하고, 배포 시에는 먼저 자체 모더레이션 계층과 접근 제어를 추가해야 한다고 분명히 밝힌다.
이 글의 어떤 부분도 거부 제거가 비용이 들지 않는다거나, 더 낮은 거부율이 품질 신호라는 주장이 아니다. 더 많은 질문에 답하는 모델이 그렇다고 해서 더 나은 모델인 것은 아니며, 시작 문구를 세는 규칙 기반 분류기는 표현 방식에 대한 측정일 뿐 역량에 대한 측정이 아니다. 이 두 산출물은 모두 운영자 의무가 따르는 연구 도구이며, 그 의무는 어블레이션 코드를 작성한 사람에게로 옮겨 가지 않는다.
런타임 어블레이션 코드와 거부 방향, 그리고 전체 평가 표는OrcaRouter가 팀이 구축한 라우팅 플랫폼과 함께 공개합니다.
