InternLumina-U2, 텍스트·이미지·비디오·3D를 단일 16B 모델에 담고 두 세트의 가중치를 공개하다

통합 멀티모달 모델은 대개 한 가지를 포기한다. 많은 작업을 다루는 대신 어느 하나도 잘하지 못한다는 것이다. InternLumina-U2는 작은 파라미터 예산 안에서 그런 통념을 시험하려는 시도이며, 모델이 공개된 방식 자체도 아키텍처 못지않게 전략을 말해준다.
InternLM은 이 모델을 Apache 2.0 라이선스로 Hugging Face에 공개했다. 토큰당 활성 파라미터가 1B인 16B 파라미터 전문가 혼합(MoE) 모델로, 16B-A1B로 표기된다. 희소 백본에 AToken이라 불리는 것을 기반으로 한 8개 코드북의 완전 이산 시각 표현을 결합했으며, 하나의 모델로 텍스트 질의응답, 텍스트-이미지 생성, 이미지 이해, 이미지 편집, 비디오 이해, 3D 이해를 처리한다.
흥미로운 대목은 작업 목록 아래에 있다. 이번 공개에는 화웨이 어센드(Ascend) NPU용과 NVIDIA GPU용 체크포인트가 각각 따로 포함되어 있다.
통합 모델이 실제로 절약해 주는 것
통합의 명분은 유지보수 비용이다. 이미지를 이해하고 생성하는 제품을 만드는 팀은 보통 이해용 모델 하나와 생성용 모델 하나를 운영한 뒤, 두 개의 추론 경로와 두 세트의 프롬프트, 두 개의 업그레이드 주기를 관리해야 한다. 이해와 생성을 하나의 프레임워크로 합치면 이런 부담의 일부가 사라지고, 같은 프레임워크를 비디오와 3D로 확장하면 이점은 더 커진다.
어떻게 그렇게 되는지에는 메커니즘이 중요하다. 완전 이산 시각 표현이란 이미지가 학습된 코드북 집합, 여기서는 AToken을 기반으로 한 8개의 코드북으로 토큰화된다는 뜻이다. 이는 이미지와 비디오 이해를 언어 모델이 이미 처리할 줄 아는 토큰 스트림에 더 가까운 형태로 밀어 넣는 일이며, 바로 이것이 하나의 백본으로 그렇게 많은 모달리티를 감당할 수 있게 해주는 근거다.

이 규모에서 통합 접근이 전문 모델과 어깨를 나란히 할 수 있는지는 아직 결론이 나지 않은 문제다. Apache 2.0은 법적 마찰을 없애주지만, 관대한 라이선스가 1B 활성 파라미터 단일 경로가 전용 이미지 모델만큼 이미지를 잘 생성하는지에 대한 답을 주지는 않는다. 기술 보고서는 '곧 공개'로 표시되어 있고, 현재 제공된 벤치마크는 예비적이며 회사가 자체 보고한 수치다. 독립적인 평가가 나오기 전까지 이 주장은 입증되지 않은 상태다.
두 하드웨어 체크포인트가 겉보기보다 중요한 이유
어센드와 NVIDIA 체크포인트를 나란히 내놓는 것은 편의 기능이 아니라 배포에 대한 선언이다.
중국의 AI 연구소들은 최첨단 칩에 대한 접근이 제한된 상황에서 모델을 만들어 왔고, 그 대응은 확보할 수 있는 하드웨어에 맞춰 공격적으로 최적화하는 것이었다. 화웨이 어센드 NPU와 NVIDIA GPU 양쪽에서 돌아가는 가중치를 공개한다는 것은 중국 밖의 팀이 NVIDIA 하드웨어에서 시작해 나중에 모델을 바꾸지 않고 어센드로 옮길 수 있다는 뜻이다. 이미 어센드로 운영 중인 중국 국내 기업이 새 가속기를 사지 않고도 이 모델을 도입할 수 있다는 뜻이기도 하다.
이는 들리는 것보다 전환 비용이 낮다는 의미다. 하드웨어 결정은 쉽게 바뀌지 않으며, 두 스택을 모두 지원하는 모델은 팀을 기존 벤더에 묶어 두는 장벽 하나를 없애준다. 어느 쪽이든 기존 인프라를 갖춘 기업에게 이번 공개는 벤치마크보다, 이미 랙에 꽂혀 있는 것들에 그대로 끼워 넣을 수 있는지의 문제에 가깝다.
맥락을 보면 이 점은 더 선명해진다. 중국 연구소들은 폐쇄형 API만 판매하는 대신 오픈 가중치를 공개하는 방식으로 점점 더 경쟁해 왔고, 그 전략적 논리는 두 방향으로 작동한다. 오픈 가중치는 폐쇄형 엔드포인트보다 채택과 표준 설정 영향력을 빠르게 퍼뜨린다. 또한 국내 하드웨어 벤더가 자사 실리콘에서 잘 돌아가는 실제 모델을 내세울 수 있게 해주는데, 그렇지 않으면 이를 공허한 속에서 입증해야 한다는 점을 생각하면 유용한 일이다.
더 엄격한 라이선스와의 비교
유용한 대조 사례는 최근 공개된 또 다른 이미지 모델이다. Qwen-Image-2.1은 텍스트-이미지 생성과 편집을 통합하고, 알파 채널을 포함한 네이티브 RGBA 출력을 생성하며, 최대 10장의 참조 이미지를 받는 7B 체크포인트를 내놓았다. 두 개의 Artificial Analysis 리더보드에서 오픈 가중치 모델 중 1위를 차지했다. 하지만 그 가중치는 엄격한 비상업적 라이선스로 공개되어, 상업적 프로젝트는 공식 API를 거쳐야 한다.
InternLumina-U2는 Apache 2.0으로 반대 방향을 택했다. 덕분에 상업적 제품에 바로 사용할 수 있고, 모델의 경쟁적 위치도 달라진다. 리더보드 정상에 서지 못하더라도, 라이선스 협상 없이 기업이 합법적으로 그 위에 제품을 만들 수 있는 가중치라는 뜻이다.
이해할 가치가 있는 아키텍처 선택
무게의 대부분을 차지하는 설계 결정은 두 가지다.
첫째는 희소 전문가 혼합(MoE) 백본이다. 총 16B 파라미터 중 토큰당 1B만 활성화되므로, 추론 비용은 전체 모델이 아니라 활성 집합을 따라간다. 주어진 입력에 대해 네트워크의 상당 부분이 유휴 상태로 남기 때문에, 폭넓은 멀티태스크 모델을 감당할 만한 비용으로 서빙할 수 있는 이유가 여기에 있다.
둘째는 이산 시각 표현이다. AToken 기반의 8개 코드북 방식은 모델링 결정인 동시에 압축 결정이다. 코드북이 더 적고 더 잘 정리되어 있다는 것은 단계마다 예측할 시각 정보가 적다는 뜻이며, 연산으로 품질을 살 수 없는 작은 활성 파라미터 규모에서 도움이 된다.
두 선택 모두 그 자체로 새로운 것은 아니다. 이 규모에서 둘을 결합하면, 실제 업무에서 밀려나는 만능 잡식 모델이 아니라 여러 모달리티에 걸쳐 진짜 쓸모 있는 모델이 나온다는 것이 이번 베팅이다.
공개 형식 자체가 메시지인 이유
작업 목록은 야심 차지만, 무엇을 기반으로 만들지 결정하는 사람에게는 공개 형식이 더 많은 신호를 담고 있다. 세 가지 선택이 눈에 띈다.
첫째는 크기다. 활성 파라미터 1B의 16B 모델은 최전선 연구소들이 744B, 심지어 2.8조 파라미터 모델까지 내놓고 있는 현재의 오픈 가중치 경쟁 기준으로 보면 작다. 접근 가능한 하드웨어에서 저렴하게 돌아가는 작은 모델은 클러스터가 필요한 큰 모델과는 다른 제품이다. 이는 자본으로 성능을 사올 수 없고 경제적으로 서빙할 수 있는 무언가가 필요한 팀을 겨냥한다.
둘째는 라이선스다. Apache 2.0은 협상 없이 상업적 사용을 허용하는 관대한 라이선스로, 모델 위에 제품을 출시할 수 있는지 판단하는 기업에게는 벤치마크 점수보다 더 중요하다. 점수는 높지만 제한적인 라이선스의 모델은 API를 거쳐 쓰는 모델이다. 관대한 라이선스의 모델은 직접 내장할 수 있는 모델이다.
셋째는 모달리티 구성이다. '통합'이라는 이름을 단 대부분의 모델은 텍스트와 이미지를 다룬다. 같은 프레임워크에 비디오와 3D 이해를 더하는 것이야말로 그 이름값을 하게 하는 부분이며, 동시에 위험이 도사리는 지점이기도 하다. 작은 활성 파라미터 집합이 감당해야 할 모달리티가 많을수록 그 사이에 분산되는 용량은 얇아지기 때문이다.
종합하면 이번 공개는 리더보드 순위가 아니라 배포 현실에 걸린 베팅으로 읽힌다. 서빙할 만큼 작고, 출시할 만큼 관대하며, 파이프라인에서 여러 모델을 대체할 만큼 넓다.
지켜볼 것
이번 공개에 대한 평가를 좌우할 세 가지가 있다. 기술 보고서가 나오면 전체 벤치마크 표를 담아야 하고, 그 수치들은 무게를 갖기 전에 독립적인 재현이 필요하다. 둘째는 통합 경로가 특히 생성에서 버텨낼 수 있는지다. 전문 모델의 기존 입지가 가장 강한 영역이기 때문이다. 셋째는 하드웨어다. 어센드 체크포인트가 실전에서 경쟁력이 있다는 것이 입증되면 이중 하드웨어 공개는 하나의 템플릿이 되고, 더 많은 중국 연구소가 두 스택 모두에서 돌아가는 가중치를 기본으로 내놓게 될 것이다.
지금으로서는 이번 공개를 의도 선언으로 읽는 것이 가장 좋다. 중국의 연구소들은 오픈 가중치, 하드웨어 유연성, 관대한 라이선싱을 동시에 놓고 경쟁하고 있으며, InternLumina-U2는 이 세 가지를 하나의 모델 카드에 담았다.
관련 글
AI 비디오 도구, 사용 편의성은 10점 만점에 9점. 컴플라이언스 점수는 다른 이야기다.
사용자들은 AI 비디오 생성기를 좋아한다. 법무팀은 아직 검토 요청을 받지 않았다.
HappyOyster는 보는 클립이 아니라 걸어 들어갈 수 있는 세계를 판다
대부분의 비디오 모델은 파일 하나를 건네줍니다. 이 모델은 문이 있는 방을 건네줍니다.
Luma Ray3 Modify, 연기는 그대로 두고 주변 세계를 다시 협상하다
AI 영상 편집에서 가장 어려운 문제는 효과가 아니다. 이미 비용을 치른 테이크를 망가뜨리지 않는 일이다.
Vidu Q3, 레퍼런스-투-비디오를 세 가지 제품으로 분할. 이는 모델 결정만큼이나 패키징 결정이다.
동일한 가격의 세 가지 모델 ID는 마케팅 결정이라기보다 조달 결정에 가깝다.