Tencent의 파운데이션 LLM 모델 Hy4-preview
참고: Introducing Hy4 preview | Tencent Hy, 2026.08.28 | tencent/Hy4-preview | Hugging Face
Tencent의 파운데이션 모델 Hy3가 공개된 지 얼마 지나지 않아 후속 모델인 Hy4-preview가 2026년 8월 28일 공개됐습니다. 오픈소스, 오픈웨이트 형태입니다. Hugging Face와 GitHub, ModelScope, AtomGit에 모델 가중치를 비롯한 주요 정보가 공개돼 있어 누구나 직접 모델을 내려받아 사용해볼 수 있습니다.
개인적으로는 지난여름 공식 출시 전 진행된 비공개 블라인드 베타 테스트에 참여할 기회가 있었습니다. 당시에는 모델의 구체적인 정보가 공개되지 않은 상태였지만 여러 테스트를 진행하면서 전반적인 성능에는 상당히 좋은 인상을 받았던 기억이 있습니다.
정식 공개 이후에는 코딩을 비롯해 문서 작성, 분석 등 다양한 업무에서 Hy4-preview를 직접 사용해보고 있습니다. 실제 활용 과정에서 느낀 모델의 특성과 강점도 꽤 분명한 편이었습니다.
이번 글에서는 개인적인 사용 경험과 함께 Hy4-preview 공식 리서치 페이지, Hugging Face 모델 카드, 공개된 기술 자료를 바탕으로 모델의 구조와 주요 특징, 성능을 살펴보겠습니다. 기존 모델들과 비교했을 때 Hy4-preview가 어떤 위치에 있는 모델인지도 정리해보려 합니다.
Hy4-preview란
Hy4-preview는 770B 파라미터 규모의 모델이지만 토큰당 실제로 활성화되는 파라미터는 49B입니다. 컨텍스트는 최대 1M 토큰까지 처리할 수 있습니다. 소프트웨어 엔지니어링처럼 여러 단계를 거쳐야 하는 작업, 문서가 많은 사무 업무, 과학 연구처럼 난이도가 높은 영역에서 성능이 가장 큰 폭으로 올랐다는 게 공식 리서치 페이지의 설명입니다.
Tencent는 이번 모델을 모델 크기, 컨텍스트 길이, 학습 데이터 세 방향에서 동시에 확장했다고 밝혔습니다. 사전 학습을 강화하고 사후 학습 단계도 이전보다 훨씬 크게 돌렸습니다. 그 결과 지금까지 측정한 세대 간 성능 향상 중 가장 큰 폭의 개선이 나왔고 이 정도면 오픈소스 모델 중 최상위권(오픈소스 프론티어)에 올라선다고 자평합니다.
공개 방식도 지난 Hy3와 같습니다. Tencent Cloud와 OpenRouter에서 API 형태로 바로 쓸 수 있고 CodeBuddy와 WorkBuddy, Yuanbao, ima 같은 Tencent 제품 안에도 이미 Hy4-preview가 적용됐습니다. 동시에 Hugging Face, GitHub, ModelScope, AtomGit에 모델 가중치가 공개돼 있어 직접 서버에 올려 돌려보는 것도 가능합니다. 라이선스는 Apache License 2.0입니다.
아키텍처: 어디서 계산량을 아꼈나
770B라는 총 파라미터 수만 보면 굉장히 무거운 모델처럼 보이지만 실제로 매 토큰마다 계산에 관여하는 파라미터는 49B뿐입니다. 이 차이를 만드는 게 Mixture-of-Experts(MoE, 여러 개의 작은 전문가 네트워크 중 일부만 골라 쓰는 구조) 설계입니다.
Hy4-preview는 총 78개 레이어로 이뤄져 있습니다. 첫 번째 레이어는 표준 FFN이고 나머지 77개가 MoE 레이어입니다. 각 MoE 레이어에는 라우팅 전문가 256개와 공유 전문가 1개가 있습니다. 토큰 하나가 들어올 때마다 상위 8개의 라우팅 전문가와 공유 전문가만 활성화됩니다. 나머지 248개 전문가는 그 토큰에 대해서는 아예 계산에 참여하지 않는 셈입니다. 여기에 MTP 레이어 1개가 별도로 붙습니다. 전체 10B 파라미터 중 0.7B만 활성화되는 구조입니다.
어텐션 쪽에는 Gated DeepSeek Sparse Attention(Gated DSA)이라는 구조를 씁니다. 어텐션 헤드는 64개, 여기에 헤드 차원 128짜리 Indexer 헤드 32개가 따로 붙어서 어떤 토큰끼리 서로 주의를 기울일지 미리 골라냅니다. IndexCache라는 캐시를 둬서 이 인덱스 계산 결과를 레이어를 넘나들며 재사용하기 때문에 컨텍스트가 1M 토큰까지 길어져도 어텐션 비용이 감당 가능한 수준으로 유지됩니다. 레이어 사이의 정보 흐름은 iHC라는 구조로 보강했다고 설명합니다. 은닉 크기는 6144, 어휘 크기는 120,832입니다.
정리하면 큰 모델의 표현력은 유지하면서 실제 추론 비용은 작은 모델 수준으로 눌러 담은 구조입니다. 참고로 서빙은 transformers 라이브러리뿐 아니라 vLLM, SGLang, Docker Model Runner에서도 지원합니다. AngelSlim 툴킷으로 만든 FP8 양자화 모델도 함께 제공됩니다.
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("tencent/Hy4-preview")
model = AutoModelForCausalLM.from_pretrained(
"tencent/Hy4-preview", device_map="auto"
)벤치마크로 본 성능
공식 리서치 페이지에는 Hy3와 Hy4-preview, 그리고 Qwen 3.8 Max, DeepSeek V4 Pro(0813), GPT 5.6 Sol, GLM 5.3, Kimi K3, Claude Opus 5까지 총 여덟 개 모델을 비교한 벤치마크 결과가 실려 있습니다. 그중 세대 간 상승폭이 특히 크게 나타난 여섯 개를 추려봤습니다.
Terminal Bench 2.1은 터미널 환경에서 명령을 실행하며 문제를 해결하는 과제인데 70.8점에서 85.4점으로 올랐습니다. 실제 소프트웨어 저장소를 고치는 DeepSWE에서는 28.0점에서 64.3점이 됐습니다. 에이전트형 작업을 평가하는 APEX-Agents(pass@1)는 24.4점에서 37.1점으로, 사후 학습 능력을 재는 PostTrainBench는 14.5점에서 35.6점으로 뛰었습니다. BioMysteryBench는 생물학 관련 추론을 다룹니다. 54.9점에서 71.3점으로 올랐습니다. 어려운 수학 문제를 겨루는 HorizonMath(pass@4)는 3.5점에서 8.8점으로 개선됐습니다.
경쟁 모델과 비교한 수치도 함께 공개했습니다. Tencent는 CodeBuddy와 WorkBuddy 같은 실제 제품에 이 모델이 어떻게 반영되는지 확인하려고 블라인드 평가를 진행했습니다. 내부 전문가 163명이 실제 엔지니어링 작업 203개를 대상으로 결과물을 채점했습니다. 그 결과 Hy4-preview는 GLM 5.3(평균 2.99 대 2.92, 46.8% 승 / 12.8% 무 / 40.4% 패)과 Kimi K3(2.99 대 2.94, 51.2% 승 / 7.9% 무 / 40.9% 패)를 근소하게 앞섰습니다.
흥미로운 실험도 하나 소개합니다. Hy4-preview가 코딩 에이전트인 Codex의 여러 세션을 동시에 관리하면서 결과가 나올 때마다 연구 방향을 스스로 조정하도록 한 실험입니다. 소형 모델의 사후 학습 과제에서 Hy4-preview가 연구자 역할을 맡아 Codex를 조율해 여러 평가 지표를 동시에 최적화하게 했습니다. Codex가 혼자 탐색했을 때보다 8개 벤치마크 전부에서 더 나은 결과가 나왔습니다. IFBench는 6.7점, HMMT Feb 2025는 20.9점, ERQA는 5.3점, GPQA Diamond는 10.3점, MMMU-Pro는 1.1점, MMLU는 2.7점 올랐습니다. 모델이 스스로 판단하고 실험을 설계하며 반복 개선하는 능력을 보여주는 사례라는 설명입니다.
데모로 보여준 것들
Tencent는 이번 발표에서 네 가지 영역의 실제 사용 사례를 영상과 이미지로 함께 공개했습니다.
소프트웨어 엔지니어링 데모는 자금성을 비롯한 중국 고건축물 일곱 곳을 다루는 데스크톱 3D 뷰어입니다. Hy4-preview가 직접 구현한 결과물입니다. 화면은 세 칼럼으로 고정된 레이아웃에 한지 느낌의 배경과 세리프 서체, 남색 계열 포인트 색 하나만 쓴 절제된 디자인입니다. Three.js로 만든 중앙 3D 스테이지에서는 마우스로 건물을 돌리고 확대할 수 있습니다. 화려한 다크 테크 느낌이나 불필요한 스크롤 없이 모델이 만든 결과물 자체에 시선이 가도록 짠 구성이 인상적이었습니다.
사무 및 분석 영역 데모는 WorkBuddy 위에서 경비 정산 내역 24건을 검토합니다. 여러 버전의 사규 중 어떤 게 적용되는지 직접 확인하고 인사 명부와 예산, 영수증 대장, 이메일까지 뒤져가며 각 건을 승인, 감액, 반려로 분류합니다. 결과물로는 요약표와 근거를 딴 건별 판단, 의심되는 부정 사용 목록, 추가로 확인해야 할 문서 목록까지 함께 내놓습니다.
펭귄 캐릭터가 눈밭을 돌아다니며 열매를 모으고 상자를 열고 몬스터와 싸우다 도망칩니다. 게임 개발 데모는 Unity(중국 내수용으로는 Tuanjie)로 만든 3인칭 캐주얼 3D 게임입니다. 메뉴와 로딩, 일시정지, 결과 화면은 물론 애니메이션 블렌드 트리와 인벤토리, 퀘스트 HUD, 배경음까지 갖췄습니다. 게임의 손맛에 관련된 수치는 전부 에디터에서 조절 가능한 파라미터로 빼놓아 이후 개발자가 직접 다듬을 수 있게 했습니다.
과학 연구 데모에서는 사후 학습 실험을 Hy4-preview가 주도한 결과를 레이더 차트와 막대 그래프로 정리해 보여줬습니다. 그 옆으로 인지질 이중층을 구성하는 원자 2만여 개를 다루는 분자동역학 시뮬레이션 결과도 함께 소개했습니다.
실제로 써본 인상
정식 공개 이후 코드 작성과 리팩터링, 긴 문서 요약과 초안 작성, 데이터 분석까지 여러 업무에 Hy4-preview를 붙여서 써봤습니다. 가장 먼저 체감한 건 컨텍스트가 길어져도 앞부분 지시사항을 놓치지 않는다는 점이었습니다. 여러 파일에 걸친 코드를 한 번에 넣고 리팩터링을 시켜도 이전에 정해둔 함수 이름이나 스타일 규칙을 끝까지 유지하는 편이었습니다.
에이전트로 여러 단계를 맡겼을 때도 중간에 방향을 잃지 않고 스스로 계획을 다시 세우는 모습을 자주 봤습니다. 다만 공식 문서에서도 밝히듯 복잡한 작업일수록 필요 이상으로 오래 추론하고 자기 검증을 반복하는 경향은 저도 실제로 느꼈습니다. 간단한 질문에도 여러 번 되짚어보느라 답이 늦게 나오는 경우가 종종 있었습니다. Tencent 스스로도 이 부분을 알려진 한계로 인정했고 빠르게 개선하겠다고 밝혔으니 다음 업데이트를 기다려볼 만합니다.
어떻게 써볼 수 있나
Hy4-preview는 Tencent Cloud API와 OpenRouter에서 바로 호출할 수 있습니다. CodeBuddy, WorkBuddy, Yuanbao, ima 같은 Tencent 제품에도 이미 기본 모델로 들어갔습니다. API 요금은 1M 토큰 기준으로 캐시된 입력 $0.042, 일반 입력 $0.834, 출력 $2.501입니다.
직접 서버에 올려 돌려보고 싶다면 Hugging Face, GitHub, ModelScope, AtomGit 어디서든 가중치를 받을 수 있습니다. 권장 추론 설정은 temperature 0.9, top_p 1.0입니다. reasoning_effort는 기본값이 high라 별도 설정 없이도 깊이 있는 추론 모드로 동작합니다.
마치며
Hy4-preview는 Tencent 스스로도 아직 이른 버전(early version)이라고 못 박는 모델입니다. 사전 학습과 사후 학습 양쪽에 여전히 개선 여지가 남아 있고 필요 이상으로 오래 추론하거나 자기 검증을 과도하게 반복하는 문제도 알려진 채로 공개됐습니다. Hy3 preview 때도 먼저 내놓고 어디가 부족한지 빠르게 피드백을 받는 방식으로 모델을 다듬었는데 이번에도 같은 방식을 택했다고 밝혔습니다.
실제로 써본 입장에서는 알려진 한계를 감안하더라도 긴 컨텍스트를 다루는 코딩과 문서 작업에서는 이미 실무에 바로 투입할 만한 수준이라고 느꼈습니다. 오픈웨이트로 공개돼 있어 직접 받아 써볼 수 있다는 점도 매력적입니다. Hy3에서 Hy4-preview로 넘어오면서 보여준 상승폭을 생각하면 다음 정식 버전이 어느 수준까지 올라갈지 궁금해집니다.