이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
텐센트가 다른 오픈 모델에도 지역 제한 없는 라이선스를 적용한다
HunyuanVideo 등 기존 모델은 EU·영국·한국을 뺀 커뮤니티 라이선스를 쓰고 있습니다.
제3자 평가에서도 Hy3가 실무 과제에서 GLM-5.1보다 높게 평가된다
전문가 270명 블라인드 평가는 텐센트가 직접 설계했습니다.
Hy3 정식판은 아파치 2.0이라 지역 제한 없이 상업 이용과 수정, 재배포가 가능합니다. 4월 프리뷰와 HunyuanVideo 같은 기존 모델은 EU·영국·한국을 뺀 커뮤니티 라이선스를 씁니다.
총 2,950억 파라미터가 모두 메모리에 올라가서 BF16 가중치만 590GB 안팎입니다. 텐센트는 GPU 8장으로 서빙할 때 H20-3e처럼 메모리가 큰 GPU를 권했고, FP8판을 따로 공개했습니다.
모델 카드 표에서 DeepSeek V4 Pro보다 12개 벤치마크 중 10개에서 높았지만, 코딩 과제에서는 GLM-5.2가 앞섰고 Claude Opus 4.8과는 11~24점 차이가 났습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
딥시크가 2차 투자 라운드에서 최소 800억 위안(약 120억 달러)을 모읍니다. 처음 목표는 500억 위안이었고, CNBC는 1,000억 위안까지 늘리는 방안을 검토 중이라고 전했습니다. 상장 시점은 2027년 초로 보도됐습니다.

알리바바 Qwen 팀이 9월 20일 생성부 7B의 이미지 생성·편집 모델 Qwen-Image-2.1 가중치를 공개했습니다. 자체 채점표 29개 모델 가운데 7위로 Nano Banana 2.0보다 0.46점 높았고, 상업 이용에는 별도 라이선스가 필요합니다.
텐센트가 8월 28일 Hy4 프리뷰를 아파치 2.0으로 공개했습니다. 31일 동안 나온 다섯 번째 중국 대형 오픈웨이트이고, 알리바바가 사업자에게 별도 계약을 요구하는 동안 텐센트는 조건 없는 라이선스를 택했습니다. 생각이 너무 긴 한계도 적었습니다.
딥시크가 2차 투자 라운드에서 최소 800억 위안(약 120억 달러)을 모읍니다. 처음 목표는 500억 위안이었고, CNBC는 1,000억 위안까지 늘리는 방안을 검토 중이라고 전했습니다. 상장 시점은 2027년 초로 보도됐습니다.

알리바바 Qwen 팀이 9월 20일 생성부 7B의 이미지 생성·편집 모델 Qwen-Image-2.1 가중치를 공개했습니다. 자체 채점표 29개 모델 가운데 7위로 Nano Banana 2.0보다 0.46점 높았고, 상업 이용에는 별도 라이선스가 필요합니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@TencentHunyuanX 게시물 · 원문 보기
텐센트가 그동안 공개한 모델은 대부분 자체 커뮤니티 라이선스를 달았습니다. 2024년 12월 공개한 영상 생성 모델 HunyuanVideo의 라이선스도, 올해 4월 Hy3 프리뷰의 라이선스도 첫 문장이 같습니다. 이 계약은 EU와 영국, 한국에는 적용되지 않으며 계약이 정한 지역으로 명시적으로 한정된다는 문장입니다. 계약서는 그 지역을 전 세계에서 EU와 영국, 한국을 뺀 곳으로 정의하고, 사용과 복제, 수정, 배포 권리를 모두 그 지역 안에서만 허락했습니다.
한국 개발자에게는 허락받은 사용 방법이 없었습니다. 가중치를 내려받아 사내 서버에 올리는 일도, 호스팅된 API로 모델을 부르는 일도 계약상 권리 밖이었습니다. 계약서는 호스팅 서비스를 통해 쓰는 경우도 계약을 받아들인 것으로 본다고 적었는데, 정작 그 계약이 한국에서는 적용되지 않으니 한국 사용자가 기댈 근거가 없는 구조였습니다.
텐센트는 이 조항의 이유를 밝히지 않았습니다. 다만 세 지역 가운데 EU는 2025년 8월부터 범용 AI 모델 제공자에게 AI 법 의무를 지웠고, 한국은 2026년 1월 AI 기본법을 시행했습니다. 규제가 있는 시장에서 모델 제공자로서 지게 될 의무를 라이선스 문구로 비켜 간 모양새였습니다.
라이선스에는 지역 말고도 제한이 있었습니다.
| 조항 | Hy3 프리뷰 (텐센트 Hy 커뮤니티 라이선스) | Hy3 정식판 (아파치 2.0) |
|---|---|---|
| 적용 지역 | 전 세계에서 EU·영국·한국 제외 | 제한 없음 |
| 대형 사업자 | 월간 이용자가 1억 명을 넘으면 텐센트에 별도 허가 요청 | 제한 없음 |
| 결과물 활용 | 모델이나 결과물로 다른 AI 모델을 개선하는 일 금지 | 제한 없음 |
은 상업적 이용과 수정, 재배포를 지역이나 이용자 규모 조건 없이 허락하고, 기여자가 가진 특허의 사용 권리도 명시적으로 줍니다. 다른 모델을 학습시키는 데 결과물을 쓰는 일도 막지 않습니다. 기업 법무팀이 오픈웨이트 모델을 검토할 때 먼저 걸러 내는 조항이 지역 제한과 규모 제한인데, 두 가지가 한꺼번에 사라졌습니다. 텐센트도 공식 계정 발표에서 아파치 2.0을 상업 이용에 친화적인 라이선스로 앞세웠고, 2주 동안 무료 API를 열었습니다.
| 항목 | 값 |
|---|---|
| 구조 | 전문가 혼합(MoE), 전문가 192개 중 8개 활성 |
| 총 파라미터 | 2,950억 |
| 활성 파라미터 | 210억 |
| MTP 레이어 | 38억 |
| 레이어 수 | 80개 (MTP 제외) |
| 어텐션 | GQA, KV 헤드 8개 |
| 문맥 길이 | 256K 토큰 |
| 공개 형식 | BF16, FP8 양자화판 별도 |
Hy3는 전문가 192개 가운데 토큰마다 8개만 골라 계산합니다. 전체 크기는 2,950억이어도 토큰 하나에 드는 계산은 210억짜리 모델 수준이라, 추론 원가가 덩치에 비해 낮습니다. 텐센트는 비슷한 크기의 모델을 앞서고 파라미터가 2~5배 큰 오픈소스 플래그십과 겨룬다고 밝혔습니다. 4월 프리뷰 뒤 50개 넘는 제품에서 받은 피드백을 바탕으로 사후학습 데이터를 늘렸다는 설명도 붙였습니다.
반대쪽 사정도 있습니다. 켜지는 파라미터는 210억이지만, 메모리에는 2,950억이 모두 올라갑니다. BF16 기준으로 가중치만 590GB 안팎이고, 텐센트는 GPU 8장으로 서빙하려면 H20-3e처럼 메모리가 큰 GPU를 쓰라고 권했습니다. 라이선스가 열렸다고 곧바로 사내 서버 한 대에 올릴 수 있는 크기는 아닙니다. 텐센트는 FP8 양자화판을 따로 올렸고, 압축 도구 AngelSlim도 함께 안내했습니다.
MTP 레이어 38억 파라미터는 투기적 디코딩용입니다. 다음 토큰 여러 개를 미리 추측해 두고 본 모델이 한 번에 검증해 맞은 만큼 채택하는 방식이라, 같은 GPU에서 생성 속도가 오릅니다. 보통은 초안을 뽑을 작은 모델을 따로 두는데 Hy3는 그 역할을 모델 안의 레이어로 넣었고, 텐센트가 안내한 vLLM 실행 설정도 이 레이어로 토큰 2개를 미리 뽑게 되어 있습니다.

모델 카드의 벤치마크 표는 Hy3를 프리뷰와 GLM-5.2, 바이트댄스 Seed 2.1 Pro, DeepSeek V4 Pro, Qwen 3.7 Max, GPT-5.5, Claude Opus 4.8과 함께 비교했습니다. 프리뷰 대비 개선 폭이 크고, 경쟁 모델과의 위치는 과제마다 갈립니다.
| 벤치마크 | Hy3 | Hy3 프리뷰 | GLM-5.2 | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Pro | 57.9 | 46.0 | 62.1 | 69.2 |
| Terminal Bench 2.1 | 71.7 | 58.0 | 81.0 | 85.0 |
| NL2repo | 45.6 | 35.3 | 48.9 | 69.7 |
| BrowseComp | 84.2 | 67.1 | 79.3 | 84.3 |
| ClawEval (pass^3) | 68.5 | 55.0 | 62.4 | 72.1 |
| SkillsBench | 55.3 | 29.1 | 51.9 | 64.6 |
코딩 과제에서는 같은 중국 오픈웨이트인 GLM-5.2가 앞섰습니다. SWE-bench Pro에서 4.2점, Terminal Bench 2.1에서 9.3점 차이입니다. DeepSeek V4 Pro와 견주면 12개 벤치마크 가운데 10개에서 Hy3가 높았습니다. Hy3가 앞선 곳은 웹 탐색(BrowseComp)과 세 번 연속 성공률을 재는 에이전트 과제(ClawEval), 스킬 활용(SkillsBench)이었습니다. 폐쇄형 최상위인 Claude Opus 4.8과는 코딩 과제에서 11~24점 벌어져 있습니다.
텐센트가 성능의 근거로 앞세운 것은 이 표보다 블라인드 평가였습니다. 공개 벤치마크 점수가 전부를 보여 주지 않는다며, 전문가 270명에게 자기 업무에서 나온 과제로 두 모델을 비교하게 했습니다. Hy3는 4점 만점에 2.67점으로 GLM-5.1의 2.51점을 앞섰고, 프런트엔드 개발과 데이터·스토리지, CI/CD에서 차이가 컸습니다. 비교 상대는 한 세대 앞 모델인 GLM-5.1이었고, 같은 모델 카드의 표에서 후속작 GLM-5.2는 코딩 과제 대부분에서 Hy3보다 높았습니다. 평가도 텐센트가 직접 설계했기 때문에, 제3자가 재현하기 전까지는 텐센트의 주장입니다.
정식판에서 가장 많이 손본 것은 제품에 넣었을 때 드러나는 문제였습니다. 도구 호출과 출력 형식의 안정성을 고쳤고, 호출 오류에서 회복하는 능력도 높였다고 밝혔습니다. 근거로 든 것이 에이전트 실행 틀을 바꿔 끼웠을 때의 편차입니다. SWE-bench Verified에서 CodeBuddy와 Cline, KiloCode로 틀을 바꿔도 정확도 차이가 4% 안이었습니다.
같은 모델도 어떤 실행 틀에 얹느냐에 따라 에이전트 점수가 크게 달라집니다. 편차가 작다는 것은 특정 틀에 맞춰 끌어올린 점수와 거리가 멀다는 근거이고, 여러 도구를 섞어 쓰는 기업에게는 순위표의 몇 점보다 이 성질이 도입 판단에 더 직접적입니다.
사실성 수치도 함께 냈습니다. 근거가 있으면 답하고, 근거가 없으면 없다고 말하고, 출처를 섞거나 데이터를 지어내지 않는다는 원칙을 세우고 데이터 정제와 학습 제약으로 고쳤다는 설명입니다.
| 항목 | 개선 전 | 정식판 |
|---|---|---|
| 환각 발생률 (내부 평가) | 12.5% | 5.4% |
| 상식 오류율 (내부 평가) | 25.4% | 12.7% |
| 멀티턴 문제 발생률 (내부 평가) | 17.4% | 7.9% |
| MRCR | 42.9% | 75.1% |
MRCR은 긴 대화 속에서 여러 번 반복된 요청 가운데 특정 하나를 정확히 짚어내는 과제입니다. 256K 토큰 문맥을 내세우는 모델이라도 대화가 길어질수록 앞의 지시를 놓치면 긴 문맥의 쓸모가 줄어듭니다. 다만 표의 앞 세 줄은 텐센트 내부 시나리오 평가라, 절대값보다 오류가 절반 안팎으로 줄었다는 방향으로 읽는 편이 안전합니다.
라이선스가 바뀌면서 국내 팀이 할 수 있는 일은 세 갈래로 늘었습니다. 첫 갈래는 설치형 도입으로, 외부 API로 데이터를 내보내기 어려운 금융·공공 기관이 모델을 내부 서버에 직접 올리는 방식입니다. 이 정도 성능에 상업 이용 제한이 없는 모델은 그동안 선택지가 많지 않았습니다. 앞서 본 GPU 8장이라는 조건은 남지만, 법무 검토에서 걸러질 이유는 사라졌습니다.
두 번째 갈래는 고쳐서 다시 파는 일입니다. 아파치 2.0은 수정한 모델을 자기 조건으로 배포하는 것도 허락합니다. 라이선스 사본과 고지를 남기고 수정 사실을 표시하면, 한국어 데이터로 미세조정한 파생 모델을 제품에 넣어 팔 수 있습니다. 텐센트는 미세조정 절차와 verl 기반 강화학습 사후학습 안내도 모델 카드에 함께 올렸습니다.
세 번째 갈래가 가장 크게 달라진 대목입니다. 프리뷰 라이선스는 Hy3나 그 결과물로 다른 AI 모델을 개선하는 일을 막았지만, 아파치 2.0에는 그런 조항이 없습니다. 자체 모델을 만드는 국내 팀이 Hy3의 답변으로 학습 데이터를 만들어 자기 모델을 가르치는 일이 계약상 가능해졌습니다. 직접 쓰지 않더라도 호스팅된 API로 부를 수 있고, 모델 중개 서비스 OpenRouter에도 7월 6일 정식판이 올라왔습니다.
Hy3는 중국 오픈웨이트 모델이 잇따라 공개되는 가운데 나왔습니다.
| 모델 | 공개 | 라이선스 |
|---|---|---|
| DeepSeek V4 Pro·Flash | 4월 | MIT |
| GLM-5.2 | 6월 | MIT |
| LongCat-2.0 | 7월 5일 | MIT |
| Hy3 | 7월 6일 | 아파치 2.0 |
메이투안의 LongCat-2.0은 총 1조 6,000억 파라미터에 토큰마다 약 480억을 켜는 모델이고, GLM-5.2는 100만 토큰 문맥을 내세웠습니다. 표의 다른 세 모델은 모두 MIT로 풀렸습니다. 성능이 비슷한 모델끼리 겨루는 시장에서 지역을 가려 받는 라이선스는 후보에서 먼저 빠지는 이유가 됐고, 텐센트는 그 조건을 걷어 냈습니다.
미국 쪽은 반대 방향으로 움직였습니다. 6월 12일 앤트로픽의 Fable 5와 Mythos 5에 미국 수출통제가 걸리면서 두 모델은 6월 30일 해제될 때까지 전 세계에서 한 차례 끊겼고, 그 과정은 앤트로픽 모델에 걸린 수출통제가 풀리기까지의 기록에 정리했습니다. 가장 강한 폐쇄형 모델은 정부 결정에 따라 접근이 막힐 수 있고, 공개된 가중치는 한 번 풀리면 거둘 수 없습니다.
국내 기업이 오픈웨이트를 고르는 순서도 이 흐름과 맞물립니다. 성능표보다 법무 검토가 먼저이고, 지역 제외 조항이 있는 모델은 후보 목록에 오르지도 못했습니다. 정부가 독자 파운데이션 모델을 키우는 동안 기업 현장의 선택지는 누가 공개한 가중치를 쓸지로 넓어졌고, Hy3는 그 목록에 새로 들어온 모델입니다.

블라인드 평가와 환각 수치는 모두 텐센트가 직접 설계한 평가라 제3자의 재현이 남아 있습니다. HunyuanVideo 같은 기존 모델은 여전히 지역을 뺀 커뮤니티 라이선스를 쓰고 있어서, 아파치 2.0 전환이 텐센트 오픈 모델 전반으로 넓어질지도 지켜볼 대목입니다. 가중치는 허깅페이스의 Hy3 모델 카드에서 받을 수 있고, FP8판은 Hy3-FP8에 따로 올라와 있습니다.
읽어 주셔서 고맙습니다.
초이 드림