


독립 연구자 모임 스웜체이서스(Swarmchasers)가 10월 5일 예비 보고서를 내고, 텐센트의 Hy 계열로 보이는 에이전트 무리가 웹 검사 서비스 urlquery.net을 거쳐 알리바바 지도 서비스 가오더(Amap)의 데이터를 모았다고 밝혔습니다.
에이전트들은 공원과 박물관, 동물원, 병원의 출입구별 이용 비율을 수집했고, 4일에는 장소 213곳에 대한 검사 기록 1,810건을 남겼으며 한때 작업 14개가 동시에 돌았습니다.
연구자들은 작업끼리 신호를 주고받은 흔적을 찾지 못해 이 무리를 '에이전트 플리트(fleet)'라고 불렀습니다.
Choi
보고서에 따르면 첫 가오더 검사는 오픈AI가 도구 사용 학습·평가를 멈췄다고 밝힌 지 3일 뒤인 9월 28일에 나왔고, 검사 기록 211건에 'claude' 표시가 붙었지만 코드 특징은 텐센트 Hy4와 지푸 GLM에 가까웠습니다. 에이전트는 사이트에 직접 접속하지 못하면 urlquery 같은 검사 서비스로 페이지를 불러오는데, 이때 남는 공개 기록이 추적 단서가 됐습니다.
WorldCrafter는 3D 공간을 따로 만들지 않고, 카메라 위치에 맞춰 기억 속 정보를 꺼내 영상을 생성합니다.
그래서 다른 곳을 보다가 돌아와도 앞서 본 공간과 물체가 비교적 일관되게 유지됩니다.
이미지 한 장이나 글만으로 몇 분 동안 공간을 둘러볼 수 있고, 기본 모델과 빠른 생성용 증류 모델의 가중치가 코드와 함께 공개됐습니다.
Choi
텐센트 ARC 랩과 베이징대 연구진은 논문에서, 깊이 정보로 시점을 맞추는 대신 요청한 시점에 맞춰 과거 관측을 정해진 수의 토큰으로 압축해 생성기에 넘긴다고 설명했습니다.
텍스트로 이미지를 만드는 기능과 이미지를 넣어 새 이미지를 만드는 기능을 모두 지원하고, 최대 2K 해상도로 출력합니다.
사람 평가에서 이전 Hy Image3.0보다 승률이 30% 높았다고 밝혔습니다.
텐센트 클라우드 API 기준 가격은 이미지 1장당 0.024달러이고 참고 이미지에는 요금을 매기지 않습니다.
Choi
참고 이미지를 과금하지 않아, 기준 이미지를 여러 장 넣고 같은 인물이나 제품을 반복해 그리는 작업에서도 결과물 장수만큼만 돈이 나갑니다.
에이전트가 새 브라우저를 띄우는 대신 이미 로그인된 사용자의 브라우저 탭을 그대로 씁니다.
기존 브라우저 에이전트는 로그인과 인증을 다시 해야 하는 경우가 많았지만, BrowserSkill은 현재 로그인 상태를 그대로 활용합니다.
CAPTCHA나 확인 창이 뜨면 사용자에게 넘겼다가 다시 이어서 작업합니다.
CLI 방식이라 Cursor, Claude Code, Codex 등 셸 명령을 실행할 수 있는 에이전트에서 사용할 수 있고, 모든 작업은 로컬에서 실행됩니다.
또 에이전트가 탭을 빌리기 전 사용자 승인을 요구하도록 설계됐으며 MIT 라이선스 오픈소스로 공개됐습니다.
Choi
로그인 상태를 그대로 빌리는 방식은 편의를 키우는 만큼 권한 범위도 같이 키웁니다. 탭을 빌리기 전 승인을 요구하도록 둔 설계가 최소한의 안전장치입니다.
오디오계의 나노바나나가 등장했습니다.
Tencent Hunyuan이 음성 생성·편집 모델 AuK를 오픈소스로 공개했습니다.
텍스트 한 줄로 음성을 만들고, 특정 단어만 바꾸거나 화자 목소리·감정·속도·음높이를 수정할 수 있습니다.
노이즈 제거와 여러 화자 분리까지 하나의 1.5B 모델에서 처리하며, AuK-Flash는 4단계 추론으로 기존 버전보다 약 4.5배 빠르게 동작합니다.
음성 편집도 이미지 편집처럼 “말로 수정하는” 방향으로 가는 것 같습니다.
Choi
음성 생성, 단어 단위 편집, 노이즈 제거, 화자 분리를 1.5B 모델 하나가 처리해, 작업마다 다른 도구를 이어 붙이던 음성 편집 과정이 짧아집니다.
Tencent·NUS·PolyU 연구진이 MiniMax-H3를 World Model로 바꾼 H3-World를 발표했습니다.
W·A·S·D 같은 입력을 짧은 영어 명령으로 변환해 H3가 이해하도록 만들고, 캐릭터 이동과 카메라 움직임을 영상에 반영합니다.
별도의 액션 모듈은 만들지 않았습니다.
약 8천 개 데이터와 전체 파라미터의 0.199%만 학습했는데도, 학습하지 않은 움직임 조합과 새로운 환경까지 제어할 수 있었습니다.
연구진 설명대로라면 상당한 제어 능력이 이미 MiniMax-H3 안에 있었다는 이야기입니다.
영상 모델을 새로 만드는 것보다 기존 모델에 숨어 있는 능력을 꺼내 쓰는 연구가 더 많아질 것 같습니다.
Choi
전체 파라미터의 0.199%만 학습해 제어 능력을 꺼냈다면, 큰 영상 모델 하나를 게임처럼 조작하는 월드 모델로 바꾸는 비용이 크게 내려갑니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.