

.jpg)
문서 추출은 작은 Luna 모델로 정확도를 거의 그대로 두고 비용을 18분의 1로 줄였고, 3개월 전 33달러 들던 검색 벤치마크는 이제 같은 성능에 1.3달러면 됩니다.
특히 ARC-AGI-3 실험에서는 모델은 그대로 두고 추론 보존과 컨텍스트 압축 두 설정만 켰더니 점수가 13.3%에서 38.3%로 뛰었습니다.
출력 토큰은 오히려 6분의 1로 줄었습니다.
가이드의 요지는 판단이 필요한 일만 모델에 맡기고, 데이터를 나르고 거르는 일은 코드로 빼고, 매번 최상위 모델을 부르는 습관을 버리라는 겁니다.
Choi
같은 모델이라도 앞 단계의 추론을 다음 호출에 남기고 쌓인 컨텍스트를 압축하면, 다시 생각하느라 쓰던 토큰이 줄고 긴 과제에서 점수가 오릅니다.
Sand.ai가 공개한 MAGI-2 Preview는 총 114B 규모의 MoE(토큰마다 일부 전문가만 계산하는 구조) 모델로, 토큰당 약 6B만 활성화합니다.
텍스트·영상·오디오를 하나의 구조에서 처리하고, 영상과 소리를 함께 생성할 수 있습니다.
Sand.ai는 자체 MagiMoE, Head Parallelism 등을 통해 대규모 MoE의 연산과 통신 비용을 줄였다고 설명합니다.
Artificial Analysis 영상 생성 순위에서는 6위를 기록했으며, Apache 2.0으로 모델과 기술 보고서가 공개됐습니다.
다만 체크포인트가 약 307GB이고 8개의 Hopper GPU가 필요한 만큼 개인용으로 가볍게 돌리는 모델은 아닙니다.
Choi
MoE 구조라 토큰마다 114B 가운데 약 6B만 계산에 들어가고, 그만큼 같은 크기의 밀집 모델보다 생성 한 번에 드는 연산이 적습니다.
Codex 할당량을 다 써서 API로 돌려쓰는데 비용이 차감되지 않았고, 세션을 새로 열어 진행해도 사용량이 줄지 않았습니다.
구조적 혜택인지, 어딘가에서 비용이 새는 것인지, 캐시 적중률이 높아 차감이 체감되지 않는 것인지, 계산 반영이 늦는 것인지 확인되지 않았습니다.
이후 구조적 문제로 보고 버그 바운티에 올렸습니다.
Choi
과금이 늦게 반영되면 쓰는 쪽은 한도를 잘못 읽습니다. 확인되기 전까지는 사용량을 따로 세어 두는 편이 안전합니다.
그는 "우리가 데이터센터를 짓는 곳마다 인프라 개발 비용을 전액 부담하고 있다"며 오픈AI의 전력 인프라 투자 철학을 밝혔습니다.
데이터센터 건설이 지역 전력망의 전기를 빼앗는 대신, 가스·태양광·수력 발전 설비 및 송전망 확충에 직접 투자하여 기존 전력망 부담을 완화하고 전 세계 인프라의 질을 높인다는 설명입니다.
전력 수급 한계에 도달한 지역에서는 가스터빈 등을 활용한 '현장 자체 발전 시스템'을 도입해 데이터센터의 전력 자급자족을 추진하고 있습니다.
또한, 가장 밀도 높고 깨끗한 에너지원인 원자력 발전의 중요성을 강조하며 "원전은 데이터센터에 크게 늘려 쓸 수 있는 최고의 에너지원"이라고 평가했습니다.
다만 프랑스를 제외한 국가들은 여전히 원전 인프라 구축이 다소 늦어지고 있는 만큼 빠르게 따라잡을 필요가 있다고 지적했습니다.
Choi
오픈AI는 지역 전력망을 나눠 쓰는 대신 가스·태양광·수력 발전과 송전망에 직접 투자한다는 입장입니다. 전력이 모자란 지역에는 가스터빈 같은 현장 자체 발전을 들입니다.
AI 생태계에서 에너지는 지능과 직결되기 때문입니다.
그는 “말 그대로 와트가 돈, 토큰(AI 처리 단위)이 된다”라며, 비용 대비 데이터 연산 효율을 높이는 것이 미래 산업의 생존 조건이라고 분석했습니다.
일각에서는 데이터 센터의 폭발적인 전력 소비가 기후 변화를 악화시킬 것이라 우려하지만, 그는 이를 ‘본질을 벗어난 걱정’으로 일축했습니다.
오히려 AI가 청정에너지 시대를 앞당기는 주요 동력이 될 것으로 전망했습니다.
딥마인드는 현재 핵융합, 혁신적 소재 설계, 고효율 태양광 기술 등 기후 위기를 근본적으로 해결할 과학 연구에 AI를 투입하고 있습니다.
하사비스는 탄소 배출을 1~2% 줄이려는 미봉책을 넘어, 새로운 르네상스 시대를 열어 기후 문제의 판도를 완전히 바꿀 기술을 AI가 완성할 것이라고 강조했습니다.
Choi
하사비스는 와트가 곧 토큰이라는 논리로 전력 단가를 AI 경쟁력에 연결했습니다. 딥마인드는 핵융합·소재 설계·고효율 태양광 연구에 AI를 투입하고 있습니다.
그래프는 2일 만에 조회 80만을 넘겼습니다.
결론은 단순합니다.
큰 모델을 이름만 보고 고르는 것보다, 작은 모델에 추론 강도를 올려 쓰는 조합이 대부분 구간에서 앞섭니다.
제일 작은 Luna를 최고 강도로 돌리면 중형 Sol의 Medium급 성능이 나오는데 비용은 3분의 1 수준입니다.
같은 돈이면 큰 모델의 한 번 응답보다 작은 모델이 더 오래 생각하게 만드는 쪽이 정확합니다.
업데이트판에 추가된 Grok 4.5도 이 가성비 곡선 위에 올라왔습니다.
다만 구독 요금제에선 사용량 차감이 API 단가와 다르다는 실사용 보고도 있어, 체감 가성비는 다를 수 있습니다.
5.5에서 5.6까지 80일 만에 곡선이 이만큼 내려왔습니다.
모델 고르는 공식도 그 주기로 바뀔 것 같습니다.
Choi
큰 모델을 이름으로 고르던 습관에 추론 강도라는 변수가 끼어들었습니다. 모델 선택 공식의 수명이 그만큼 짧아집니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.