언어와 비전을 위한 단일 프레임워크: Horizon의 16억 파라미터 오픈 모델

화중과기대(Huazhong University of Science and Technology), 베이징교통대학(Beijing Jiaotong University), 그리고 Horizon Robotics의 논문이 너무 기본적이라 새롭다고 하기 어려울 만한 무언가를 제안한다. 바로 언어와 이미지를 같은 종류의 것으로 취급하는 단일 모델이다.
이 프레임워크의 이름은 Multimodal Flow, 줄여서 MF-1이며 완전히 공개되어 있다. 가장 큰 버전은 16억 개의 파라미터를 갖고 1,500억 개의 사전 학습 토큰으로 훈련되었다. GenEval에서 82.8점, DPG-Bench에서 75.3점을 기록해, 적당한 크기의 모델을 훨씬 거대한 멀티모달 시스템들과 나란히 세웠다.
한 문장으로 요약한 아이디어
대부분의 멀티모달 모델은 조립품이다. 텍스트 모델과 이미지 모델, 또는 별도의 비전 구성 요소를 덧붙인 언어 백본이 이산 토큰이나 개별 인코더를 통해 표현을 주고받는다. MF-1은 그렇게 하지 않는다. 텍스트와 이미지를 공유 임베딩 공간에서 함께 모델링하고, Flow Matching을 두 가지 모두를 위한 단일 생성 목표이자 샘플링 절차로 사용한다.

이것이 흥미로운 주장이다. 경계에서 모달리티 간 변환을 하는 대신, 모델은 언어와 비전이 근본적으로 다른 대상이 아닌 하나의 연속적 표현 위에서 작동한다. 저자들은 이 접근이 현재 주류인 이산적 접근과 하이브리드 접근의 약점을 우회한다고 주장한다.
만약 이 주장이 유지된다면, 그 보상은 범용성이다. 언어 모델링, 시각 이해, 이미지 생성, 편집, 비디오 시퀀스를 모두 다루는 단일 프레임워크는 전문가들로 구성된 파이프라인보다 훨씬 단순하게 훈련하고, 확장하고, 추론할 수 있는 것이다. 또한 다른 모달리티, 즉 정렬된 연속 블록으로 표현할 수 있는 모든 입력이 설계 변경 없이 같은 구조에 들어맞는 미래를 가리킨다.
우아함 외에도 이것을 원할 실용적인 이유가 있다. 시스템에 새로운 모달리티를 덧붙일 때마다 유지해야 할 새로운 인터페이스와 오류가 쌓일 새로운 지점이 생긴다. 비전 인코더를 언어 모델에 연결한다는 것은 이미지를 언어 모델이 이해하는 토큰으로 요약해야 한다는 뜻이며, 그 요약 과정에서 정보가 손실된다. 공유 표현은 변환 단계를 건너뛰는데, 바로 그곳에서 멀티모달 시스템의 미묘한 품질이 다량 새어 나간다.
저자 목록에 있는 이름
저자 목록에서 한 가지 세부 사항은 다시 볼 가치가 있다. 저자 중에는 Horizon Robotics의 창립자이자 한때 바이두의 딥러닝 작업을 설계한 위카이(Yu Kai)와 공동 창립자 황창(Huang Chang)이 있다. 교신저자는 화중과기대 비전 연구소의 왕싱강(Wang Xinggang)이다.
논문에 위의 이름이 올라가는 것은 일상적인 일이 아니다. 그는 2016년 이후로 논문을 거의 발표하지 않았는데, 그해 그는 자연 장면에서 텍스트 검출을 통합하려는 초기 시도에 참여했다. 언어와 비전을 통합하는 것에 관한 논문에서 그가 지금 다시 나타난 것은, 업계가 그것을 의미 있게 만들 컴퓨팅 파워와 데이터를 갖춘 시점에, 그가 10년 전에 다뤘던 문제로 의도적으로 돌아왔다는 것으로 읽힌다.
그의 이전 강연에서 나온 것으로 알려진 시사하는 바가 큰 문장이 있다. VLA, VLM, 엔드투엔드, 월드 모델 같은 유행어는 기술적으로보다 상업적으로 더 의미 있는 경우가 많고, 진지한 팀들은 대체로 비슷한 일을 하고 있다는 것이다. 그 범주들 몇 가지를 하나의 생성 프레임워크로 접어 넣은 논문은 그러한 관점과 일치한다. 이는 라벨이 기반 메커니즘보다 덜 중요하다는 주장이다.
작고 개방적이라는 것이 핵심인 이유
경쟁력 있는 성적을 내는 16억 파라미터 모델이 주목할 만한 이유는 다른 연구소에서 나오는 소형 모델들이 주목할 만한 이유와 같다. 파라미터당 성능은 무엇이 로컬에서 실행되고, 무엇이 휴대폰에서 실행되며, 작은 팀이 무엇을 파인튜닝할 여유가 있는지를 결정하는 지표다.
1,500억 개의 학습 토큰 역시 최전선 기준으로는 적은 편이며, 이는 이 접근이 무식하게 밀어붙인 것이 아니라 효율적임을 시사한다. 그 효율성이 더 큰 규모에서도 유지되는지는 미해결 질문이다. 잘 작동하는 작은 모델은 한 가지 방법에 대해 무언가를 말해주지만, 모든 것을 말해주지는 않는다.
여기서 가중치 공개가 중요한 데에는 구체적인 이유가 있다. 통합 생성 프레임워크는 다른 사람들이 그것을 확장하고, 저자들이 시도하지 않은 모달리티에서 테스트하고, 공유 표현 위에 쌓아 올릴 수 있을 때 가장 유용하다. 닫힌 버전이라면 흥미로운 논문이었을 것이다. 열린 버전은 도구다.
벤치마크가 다루지 않는 것
GenEval과 DPG-Bench는 모델이 프롬프트를 이미지로 얼마나 충실하게 바꾸는지를 측정한다. 이들은 통합 표현이 텍스트와 이미지를 함께 추론하는 모델의 능력을 향상시키는지에 대해서는 아무것도 말하지 않는데, 그것이 바로 실제 주장이다. 어떤 모델이 이미지 충실도에서 좋은 점수를 받으면서도 두 모달리티를 숫자 형식만 공유하는 별개의 하위 시스템으로 취급할 수도 있다. 저자들도 이 간극을 인식하고 있으며, 논문의 진짜 논거는 점수가 아니라 아키텍처에 있다. 이 연구를 평가하는 사람이라면 올바른 질문은 공유 표현이 두 모달리티를 동시에 요구하는 작업에서 동작을 바꾸는지 여부이며, 그것이 바로 벤치마크가 측정하지 않고 남겨두는 부분이다.
솔직한 미지수
모달리티를 하나의 공간에서 통합한다는 것은 강한 주장이고, 강한 주장은 검증을 부른다. 벤치마크 점수는 실제지만, 그것은 이미지 생성 충실도를 측정할 뿐, 공유 표현이 프레이밍이 암시하는 방식으로 모달리티를 넘나드는 추론에 실제로 도움이 되는지는 측정하지 않는다. 좋은 GenEval 점수를 받으면서도 텍스트와 이미지를 진정으로 같은 재료가 아니라 임베딩에서 서로 이웃한 것으로 취급하는 모델이 나올 수도 있다.
또 다른 미지수는 규모다. 연속적 통합 표현은 역사적으로 이론에서는 매력적이었지만 실무에서는 고집스러웠는데, 학습 신호가 이산적 설정보다 안정화하기 더 어려울 수 있기 때문이다. 16억 규모의 성공은 고무적이지만 아직 결정적이지는 않다.
다음이 가리키는 곳
명백한 확장은 비디오와 오디오이며, 둘 다 연속 신호이므로 연속 표현 위에 세워진 프레임워크에 자연스럽게 들어맞는다. 저자들도 이를 언급하며, 정렬된 연속 블록으로 표현할 수 있는 모든 모달리티를 대상으로 삼는다. 이 접근이 유지된다면 보상은 팀이 원래 저자들이 건드리지 않은 모달리티로 확장할 수 있는 단일 파이프라인이다. 이것이 여기서 가중치 공개가 약속하는 바다. 완성된 제품이 아니라, 다른 사람들이 자기 문제에 맞게 구부릴 수 있는 토대다.
더 큰 그림
이것을 주목할 만하게 만드는 것은 모델 자체보다 방향성이다. 이 분야는 수년 동안 분리된 텍스트와 비전 시스템 사이에 점점 더 정교한 다리를 놓아왔다. MF-1은 그 다리들이 불필요하다는, 즉 언어와 이미지를 서로 이질적인 것으로 취급하는 것을 멈추고 하나의 기반 위에서 모델링하는 것이 올바른 움직임이라는 내기다.
그 내기가 맞다면, 실질적인 결과는 가장 좋은 의미에서 지루하다. 하나의 프레임워크, 하나의 학습 목표, 하나의 도구 세트를 다음에 필요한 모달리티에 적용하면 된다. 틀렸다 해도, 이 분야에서 오랜 역사를 가진 팀이 수행한 잘 짜인 실험이며, 검증할 수 있도록 공개적으로 공개된 것이다.
어느 쪽이든 흥미로운 부분은 이 문제를 10년 동안 지켜봐 온 사람들이 지금 다시 그것을 공략하기로 선택했고, 거대한 모델이 아니라 개방적이고 작은 모델로 하기로 선택했다는 점이다. 그런 조합은 보통 규모가 아니라 방법이 그동안 빠져 있던 것이라고 누군가 믿고 있다는 신호다.
관련 글
바퀴 달린 세미휴머노이드, 도움 없이 한 시간 동안 세탁 마쳐
개별 작업은 성공해도 워크플로는 여전히 실패할 수 있다. Dyna는 측정 지표를 바꿨다.
LTX 2.5, 투박한 블렌더 초안을 완성된 샷으로 렌더링하려 한다
텍스트-투-비디오에서는 무슨 일이 일어날지 통제할 수 없다. 이것이 그 문제를 해결하려 한다.
ServiceNow, 에이전트 실패를 학습 데이터로 전환하다
검증 없는 생성은 잡음이다. 게이트가 제품이다.
포토닉 메모리 벽: 볼란티스가 방금 건 8,800만 달러의 승부수
모두가 당연하게 여기며 살아온 트레이드오프, 볼란티스가 없애려는 바로 그것이다.