
GPT-6 Astra vs Tencent HY4 Preview: 한 모델은 감사 추적을, 다른 모델은 벤치마크 표를 갖고 있다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Tencent HY4 Preview와 GPT-6 Astra는 벤더 자체 평가를 읽으면 최전선에 근접한 에이전트 코딩 모델 중 가장 저렴한 두 모델이고, 다른 사람들의 평가를 읽으면 그 계층에서 가장 성능이 낮은 두 모델이다. Tencent HY4 Preview는 2026년 8월 28일 Apache 2에 따라 공개·오픈소스화되었으며, 백만 입력 토큰당 $0.834, 백만 출력 토큰당 $2.501, 7,700억 파라미터의 전문가 혼합 아키텍처, 백만 토큰을 넘는 컨텍스트 윈도, 64,000 토큰의 출력 상한을 갖는다. GPT-6 Astra는 2026년 9월 3일 공개되었고 $10.00과 $50.00, 1,000,000토큰 윈도, 최대 출력을 제공한다. Astra의 장점은 여덟 개의 공개된 제3자 평가로 뒷받침되며, HY4 Preview의 장점은 Tencent 자체 터미널, 토큰 및 블라인드 평가 실행으로만 뒷받침되고 그 외에는 아무것도 없다. 이 두 비교 중 하나는 검증할 수 있고 다른 하나는 믿어야 하며, 실무적 결정은 달라진다.
Apache 2.0 릴리스가 실제로 제공하는 것
라이선스는 이번 비교에서 가격표가 표현할 수 없는 부분이다. Tencent HY4 Preview는 오픈 웨이트 브랜딩을 붙인 호스팅 티저가 아니다. 가중치는 Hugging Face, GitHub, ModelScope, GitCode에서 내려받을 수 있으며, 이는 텐센트가 자체 가격이나 자체 엔드포인트, 또는 이 모델을 계속 서비스하려는 의지에 관해 내리는 어떤 결정이든 이 모델은 그대로 살아남는다는 뜻이다.
• 아키텍처 — 총 770B 파라미터, 토큰당 49B 활성, 78개 레이어, 256개의 라우팅된 전문가에 더해 하나의 공유 전문가, 그리고 추측 디코딩을 위한 네이티브 다중 토큰 예측 레이어br /> • 서빙 특성 — 초당 54.6 출력 토큰, 첫 토큰까지 중앙값 6.26초, 7일 롤링 윈도우 동안 OrcaRouter의 라우트 전반에서 측정br /> • 컨텍스트와 상한 — 1,048,576 토큰 윈도우 대 최대 출력 64,000 토큰br /> • 입력 표면 — 텍스트 전용, 이미지 없음, 파일 없음, 오디오 없음br /> • 추론 제어 — high, low, none 세 가지 수준, 기본값은 high, 그리고 temperature 0.9와 top_p 1.0이라는 문서화된 샘플링 권장 사항br /> • 신뢰성 — 동일한 7일 윈도우에서 2.8% 오류율, Astra 라우트의 10.3%와 대비
마지막 두 숫자는 이 페이지에서 가장 실행 가능한 정보이며, 이는 어떤 공급업체도 자사 모델에 대해 공개하지 않는 종류의 수치다. Astra의 독립 벤치마크 점수는 더 높고, 지난 한 주 동안 그 경로는 대략 열 번의 요청 중 한 번 실패해 왔으며, 독립 점수가 전혀 없는 모델은 서른다섯 번 중 한 번 실패해 왔다. 두 수치 모두 모델 자체에 대한 진술은 아니다 — 오류율은 가중치가 아니라 경로, 속도 제한, 업스트림을 측정한다 — 하지만 이는 프로덕션 시스템이 실제로 경험하는 숫자다.

Tencent의 수치를 다른 곳의 수치와 대조해 확인할 수 있는 곳
이것은, 공개된 바로는, 정말로 진정한 기회입니다: 그리고 HY4 Preview 둘 다 Terminal-Bench 2.1 수치를 가지고 있으며, 그중 하나만이 진정한 것입니다.
• Terminal-Bench 2.1, 실제 터미널 구동 — GPT-6 Astra 88.4, 독립 평가; Tencent HY4 Preview 85.4, 공급업체 보고br /> • 도구 호출 — τ²-Banking에서 Astra 41.4, 독립 평가; 다른 테스트인 Toolathlon-Verified에서 HY4 Preview 74.1, 공급업체 보고br /> • 소프트웨어 엔지니어링 — DeepSWE에서 HY4 Preview 64.3, 이전 모델 Hy3의 28.0에서 상승, 공급업체 보고br /> • 에이전트 작업 — APEX-Agents에서 HY4 Preview 37.1 pass@1, 공급업체 보고br /> • 인간 선호도 — 163명의 전문가가 채점한 203개 엔지니어링 작업에서 평균 4.00점 만점에 2.99점, 공급업체 주관, GLM-5.3의 2.92 및 Kimi K3의 2.94와 비교br /> • 독립 지수 — GPT-6 Astra 54.7 Intelligence Index 및 96.1 GPQA Diamond, 제3자; HY4 Preview에 대한 동등한 지수는 존재하지 않음
Terminal-Bench 행은 특히 곱씹어 볼 만하다. 독립적인 88.4와 벤더가 보고한 85.4 사이의 3점 차이는 다른 하네스, 다른 스캐폴드, 또는 다른 샘플링 온도가 만들어낼 수 있는 범위 안에 충분히 들어온다. 즉, 정직한 해석은 "Astra가 3점 더 낫다"가 아니라 "이 티어에서 가장 저렴한 오픈 웨이트 모델이 동등성을 주장하고 있으며, 그 주장은 적어도 그럴듯하다"이다. Tencent의 자체 표현은 이 점에서 신중하다. DeepSWE가 "점진적으로 격차를 좁혀 가고 있다"고 묘사할 뿐, 격차를 닫았다고는 하지 않는다. 그리고 단 하나의 깔끔한 동등성 주장 — 다른 벤더의 최상위 폐쇄형 모델과 Terminal-Bench에서 동점을 이뤘다는 주장 — 은 바로 두 번째 측정이 가장 절실히 필요한 주장이다.
점수보다는 경제성을 바꾸는 변화이기 때문에 알아 둘 만한 변화가 하나 더 있습니다. 2026년 9월 7일 텐센트는 라이브 프리뷰 빌드에 최적화를 적용했는데, 이는 복잡한 작업에서 추론 턴과 작업당 토큰 소비를 줄인다고 합니다. 모델은 토큰당 과금되므로, 완료된 작업당 토큰이 적으면 토큰당 단가가 변하지 않았더라도 작업 비용이 낮아집니다. 그 절감 규모는 텐센트 자체 측정치이며 텐센트 외부에서 이를 재현한 사람은 없습니다. 하지만 그 메커니즘은 실제이며, 8월에 공개된 프리뷰가 출시 당시 설명이 시사했던 것보다 10월에는 운영 비용이 실질적으로 더 저렴할 수 있는 이유입니다.
64,000토큰 상한은 배포를 결정하는 사양입니다.
스펙 시트 중간쯤에 가장 먼저 발목을 잡는 제약이 있는데, 그것은 품질이 아닙니다. HY4 Preview의 최대 출력은 64,000 토큰으로, 코딩 에이전트와 긴 도구 사용 체인을 표방하는 모델에서 Astra의 128,000 토큰과 맞섭니다. 생성된 파일, 여러 파일 패치, 긴 구조화 보고서 — 이런 출력이 한계에 부딪히며, 에이전트 실행에서 실패는 조금 더 나쁜 답변이 아니라 주변 파이프라인이 감지하고 처리해야 하는 잘린 답변입니다.
두 모델 모두 입력으로 약 100만 토큰을 받으므로, 문서 읽기 사례는 정말로 무승부입니다. 차이는 전적으로 생성 측면에 있으며, 이는 반올림 오차가 아니라 두 배 차이입니다. 여기에 입력 표면 차이 — Astra는 이미지와 파일을 받아들이고, HY4 Preview는 텍스트 전용입니다 — 를 더하면, 드러나는 그림은 순위라기보다 깔끔한 역할 분담입니다: 산출물이 도구 호출이나 diff인 텍스트 입력, 텍스트 출력 에이전트 루프에는 오픈웨이트 모델을, 무언가를 봐야 하거나 긴 글을 써야 하는 모든 작업에는 클로즈드 모델을.
20배 처리량이 가져오는 것, 한 줄 한 줄
• 입력 가격 — Tencent HY4 Preview 1M당 $0.834 vs GPT-6 Astra $10.00, 약 12배br /> • 출력 가격 — HY4 Preview 1M당 $2.501 vs Astra $50.00, 약 20배br /> • 캐시된 입력 — HY4 Preview 1M당 $0.042 vs Astra $1.00, 약 24배br /> • 장문 요청 단계 — Astra는 272,000 입력 토큰을 초과하는 전체 요청을 $20.00 및 $75.00로 재가격 책정합니다; HY4 Preview의 카드에는 이에 상응하는 단계가 없습니다br /> • 400,000토큰 프롬프트의 실효 입력 단가 — HY4 Preview는 $0.834로 동일 vs Astra $20.00, 약 24배br /> • 일반 에이전트 루프의 백만 토큰당 비용, 입력 대 출력 4:1 — HY4 Preview 약 $1.17 vs Astra 약 $18.00br /> • 동일한 비율에서 월 1억 토큰 비용 — HY4 Preview 약 $117 vs Astra 약 $1,800
캐시된 입력 항목은 비싼 쪽에서 확장성이 가장 나쁩니다. 에이전트 루프는 매 턴마다 동일한 시스템 프롬프트와 대화 접두사를 다시 전송하기 때문입니다. $0.042 대 $1.00의 가격에서, 긴 루프의 가장 저렴한 토큰은 Tencent 모델에서 24배 더 저렴한데, 이는 토큰당 작은 차이가 가장 빠르게 누적되는 바로 그 워크로드입니다. 이를 깔끔하게 판가름할 지표인 작업당 비용은 Tencent가 전혀 공개하지 않으므로, 중요한 숫자를 얻는 유일한 방법은 두 모델을 자체 작업 세트로 실행하고 usage 객체를 읽는 것입니다.

라우터가 여기서 더하는 것, 오류율을 손에 쥔 상태에서
두 모델 모두 OrcaRouter 카탈로그에 있습니다 — tencent/hy4-preview 및 openai/gpt-6-astra — 하나의 OpenAI 호환 엔드포인트 뒤에 있으며, 각각 제공자의 자체 정가로 0% 마크업만 붙여 그대로 전달됩니다. 그 마지막 세부 사항은 대부분의 경우보다 이 조합에서 더 중요합니다. 왜냐하면 Tencent 모델의 정가는 위안화로 공표되기 때문입니다: 위의 달러 수치는 실제로 보게 되는 환산 요율이며, 리셀러 스프레드가 아닙니다. 그리고 Tencent가 가격을 변경하면, 그 변경은 다음 계약 갱신 때가 아니라 같은 날 여기에서 바로 적용됩니다.
라우팅 DSL은 두 모델이 더 이상 대안이 아니게 되는 지점이다. 이 조합에 자연스러운 규칙은 출력 기반 에스컬레이션이다. 즉 루프를 저렴한 모델로 보내고, 응답이 64,000토큰 상한에 걸려 잘려서 돌아오거나 스키마 검사를 통과하지 못하면 해당 단계를 openai/gpt-6-astra로 다시 시도하는 것이다. 이 모델은 출력 여유가 두 배다. 자동 페일오버는 이 논리의 나머지 절반이며, 지난 한 주 동안 두 경로 중 하나가 요청 열 번에 한 번꼴로 오류를 내고 있었다면 이는 이론에 그치지 않는다. 단일 모델에 고정된 긴 에이전트 실행은 누적된 컨텍스트와 함께 죽어버리는데, 이 두 모델 중 어느 것도 실수로 처음부터 다시 돌리기에는 충분히 저렴하지 않다.

이 비교를 바꾸는 것은 무엇일까?
판세를 얼마나 바꿀 수 있는지 순서대로 세 가지. HY4 Preview에 대한 독립적 평가 — 이 모델은 공개된 지 6주가 되었지만 제3자 지수도, 재현된 Terminal-Bench 수치도, 작업당 비용 수치도 없으며, 공급업체가 수행한 단 한 번의 블라인드 평가가 현존하는 유일한 인간 선호도 데이터다. 두 모델 모두에 대해 완료된 작업당 비용을 공개하는 것 — 그러면 이 글의 모든 비율이 단 하나의 숫자로 대체될 것이다. 그리고 제3자 추론에 대한 Tencent의 결정 — Apache 2.0 가중치는 누구나 서빙할 수 있기 때문이며, 경쟁 호스트들이 HY4 Preview를 서비스하기 시작하는 순간 이 비교에서 더 저렴한 쪽의 가격은 정가표가 아니라 시장이 된다.
그때까지, 쓸 만한 요약은 어느 벤더의 출시 글보다도 범위가 좁고 점수판보다도 정직하다: GPT-6 Astra는 능력 주장이 검증된 모델로, 출력 상한이 두 배이며, 요청 10건 중 1건이 실패해 온 경로를 갖고 있다. Tencent HY4 Preview는 능력 주장이 검증되지 않은 모델로, 아키텍처가 공개되어 있고, 오픈 라이선스이며, 가격은 3분의 1이고, 같은 기간 동안 오류율은 훨씬 낮다. 당신의 작업이 텍스트 입력, 텍스트 출력이고 64,000개의 생성 토큰 안에 들어간다면, 더 저렴한 모델은 타협이 아니다 — 그것이 정답이며, 당신이 포기하는 유일한 것은 감사 추적이다.
이 쌍에 대한 자연스러운 규칙은 출력 에스컬레이션입니다: 루프를 저렴한 모델로 보내고, 응답이 64,000토큰 한도에 걸려 잘린 채 반환되거나 스키마 검사에 실패하면, 해당 단계를 openai/gpt-6-astra로 재시도하세요. 이 모델은 출력 여유가 두 배입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
