앤트 그룹의 Ling 3.1 Flash, 560B 매개변수 중 25B 활성화하며 41점 기록

--- title: 앤트 그룹의 Ling 3.1 Flash, 560B 매개변수 중 25B 활성화하며 41점 기록 meta_title: Ling 3.1 Flash, 25B 비용으로 560B 매개변수 구현 meta_description: 앤트 그룹의 Ling 3.1 Flash는 총 560B 매개변수 중 25B 활성 매개변수로 Intelligence Index에서 41점을 기록하며, 희소 MoE가 얼마나 확장될 수 있는지 보여준다. ---
앤트 그룹의 AntLingAGI는 10월 6일 Ling 3.1 Flash를 공개했다. 눈에 띄는 숫자는 모델이 실행될 때 실제로 활성화되는 매개변수가 총 5,600억 개 중 250억 개라는 점이다.
이 모델은 Artificial Analysis Intelligence Index에서 41점을 기록해 전작보다 확실히 향상되었다. 평가는 에이전트 기능을 가장 큰 개선 영역으로 꼽았는데, 이는 엔터프라이즈 구매자들이 가장 비중 있게 보기 시작한 범주다.
아키텍처가 곧 주장이다
Ling 3.1 Flash는 전문가 혼합(mixture-of-experts) 모델이다. 총 5,600억 개의 매개변수를 보유하지만 토큰당 약 250억 개만 활성화하며, 최대 100만 토큰의 컨텍스트 창을 지원한다.
그 비율이 바로 이 모델의 핵심이다. 비슷한 성능의 밀집 모델은 생성되는 모든 토큰마다 모든 매개변수를 옮겨야 한다. 각 토큰을 소수의 전문가에게만 라우팅함으로써 희소 모델은 훨씬 적은 연산으로 비슷한 출력을 낸다. 대가는 메모리다. 5,600억 개의 매개변수 전부는 여전히 어딘가에 상주해야 하며, 대부분은 특정 순전파에서 유휴 상태로 남는다.

실질적인 결과는 팀이 가중치를 보유할 하드웨어만 갖추면, 같은 품질 수준의 밀집 모델에 비해 훨씬 적은 비용으로 서빙할 수 있는 모델이 나온다는 점이다. 이는 올해 대부분의 프런티어 오픈 가중치 릴리스를 이끈 것과 같은 엔지니어링 이야기이며, 흥미로운 지표가 총 매개변수에서 활성 매개변수로 이동한 이유다.
벤치마크가 다루는 범위
앤트 그룹은 다양한 평가 결과를 공개했다: GDPVal-AA v2.1에서 1673 Elo, FrontierSWE에서 75.16, HealthBench에서 65.35, 그리고 모바일 애플리케이션과 SVG 생성 부문에서 최상위권에 오른 Design Arena다.
Intelligence Index 41점이 헤드라인이며, 이는 이 모델을 훨씬 더 큰 연구소들의 릴리스와 같은 반열에 올려놓는다. 앤트 그룹은 전체 모델을 오픈소스로 공개할 예정이며 문서는 이미 공개됐다고 밝혔다. 그동안 2주간 무료 체험이 진행 중이다.
엔지니어링 시연이 점수보다 더 많은 것을 말해준다
앤트 그룹은 세 가지 구체적인 예시도 설명했는데, 이는 리더보드보다 의도된 사용 사례에 대해 더 많은 것을 말해준다.
첫째: Lua-to-x86 컴파일러를 처음부터 구축해 182개 테스트 중 178개를 통과했다. 이는 모델이 방대한 명세를 기억하고, 여러 파일에 걸쳐 내부적으로 일관된 코드를 생성하며, 전반적으로 엣지 케이스를 추적해야 하는 작업이다. 이 작업은 긴 문맥 처리 능력이 약한 모델에게 불리하다.
둘째: 대규모 Python 코드베이스에서 타입 검사 속도를 높였다. 이는 그린필드 작업이 아니라 유지보수 작업이며, 실제 엔지니어링 시간의 대부분이 여기에 들어간다. 기존 리포지토리의 타입 관계를 추론할 수 있는 모델은 새로운 함수를 작성하는 모델과는 다른 방식으로 유용하다.
셋째: 브라우저, 로컬 파일, 터미널 도구를 조율하는 데스크톱 에이전트를 구축했다. 멀티툴 오케스트레이션은 에이전트 작업의 현재 프런티어이며, 벤치마크 상승이 가리키는 능력이다.
세 가지 모두 회사가 보고한 것이며 독립적으로 재현되지 않았다. 특히 182개 테스트 컴파일러 주장은 외부 검증이 필요하다. 테스트 통과는 테스트가 대표성을 가질 때만 의미가 있기 때문이다. 일반적인 구문은 처리하지만 특이한 사례에서 실패하는 컴파일러도 모델과 같은 주에 작성된 테스트 스위트에서는 좋은 점수를 받을 수 있다.
여기서 더 넓은 패턴도 주목할 만하다. 중국 연구소들은 벤치마크 점수보다 엔지니어링 시연을 주요 마케팅 수단으로 점점 더 많이 사용해 왔다. 벤치마크는 모호해졌고 시연은 구체적이기 때문이다. 대가는 시연이 문제 공간을 통과하는 하나의 경로를 보여줄 뿐, 결과의 분포에 대해서는 아무것도 말해주지 않는다는 점이다.
더 긴 흐름: 중국 오픈 가중치가 계속해 온 일
Ling 3.1 Flash는 올해 내내 유지된 패턴에 들어맞는다. 중국 연구소들은 서구 연구소가 따라오지 못한 속도로 허용적인 라이선스의 프런티어 규모 오픈 가중치를 공개하며, 원시 규모보다 효율성으로 경쟁한다.
맥락을 분명히 말할 가치가 있다. 이런 모델 중 하나를 실행하는 개발자는 추론 스택을 소유하게 되며, 이는 토큰당 API 비용이 없고, 데이터가 건물 밖으로 나가지 않으며, 제3자가 모델 변경 시점을 결정하지 않는다는 뜻이다. 프라이버시 제약이 있거나 예측 가능하지만 워크로드가 무거운 팀에게 이는 실제로 돈이 되는 가치다.
Victor Taelin은 이번 달 Artificial Analysis 순위 상위 25위 안에 오픈 모델이 하나도 남아 있지 않으며, 가장 좋은 Xiaomi의 MiMo가 26위에 머물러 있다고 지적했다. Intelligence Index에서 Ling 3.1 Flash의 41점은 순위가 아니라 지능 점수이므로 두 수치는 서로 다른 것을 측정하며, 최고 오픈 모델과 최고 클로즈드 모델 사이의 격차는 여전히 실재한다. 달라진 점은 이제 그 격차가 오픈 모델이 일을 할 수 있느냐가 아니라 점수로 측정된다는 것이다.
모델을 선택하는 사람에게 이것이 의미하는 바
매개변수 비율보다 더 중요한 세 가지 고려 사항이 있다.
라이선스 및 배포 조건. 앤트 그룹은 모델이 공개될 것이라고 말하지만, 구체적인 라이선스가 상업적 사용을 제한 없이 허용하는지를 결정한다. "오픈 가중치"와 "허용적 라이선스"가 같은 것이 아닌데도 서로 바꿔 쓰이는 경우가 많다는 점을 고려하면, 프로덕션 의존성을 만들기 전에 조건을 주의 깊게 읽을 필요가 있다. 릴리스 전에 공개된 문서에도 같은 주의가 적용된다. 이 문서는 의무보다는 기능을 설명하기 때문이다.
컨텍스트 창 주장. 100만 토큰은 큰 숫자지만, 실제 사용 가능한 컨텍스트는 보통 광고된 것보다 짧다. 모델이 전체 창에 걸쳐 품질을 유지하는지, 아니면 훨씬 전에 저하되는지가 장문 문서와 대규모 리포지토리 작업에서 유용성을 결정하는 질문이다. 앤트 그룹 자체의 긴 문맥 시연은 모델이 큰 입력을 처리함을 시사하지만, 이 역시 벤더 테스트다.
메모리 요구 사항. 560B 희소 모델은 노트북 배포가 아니다. 활성 매개변수 이야기는 가중치의 크기가 아니라 토큰당 연산을 줄여준다. 자체 호스팅을 계획하는 사람은 활성 개수가 아니라 전체 크기에 맞춰 하드웨어를 산정해야 한다. 이 구분은 사람들을 자주 헷갈리게 한다. 25B 매개변수를 활성화한다고 설명되는 모델은 작아 보이지만, 실제로 로드하려고 하면 전체 560B가 어딘가에 들어가야 한다.
실용적인 지원 문제도 있다. 자주 출시하는 연구소의 모델은 곧 대체될 것이므로 팀은 마이그레이션 경로를 계획해야 한다. 앤트 그룹의 릴리스 주기를 보면 Ling 3.2나 Ling 4는 몇 달 안에 나올 것이며, 이는 능력 면에서는 좋지만 한 버전을 기준으로 파인튜닝이나 배포 스크립트를 만든 사람에게는 곤란하다.
Ling 3.1 Flash는 꾸준히 출시해 온 연구소의 유능한 릴리스다. 진짜 뉴스는 구조적이다. 25B 활성 모델이 이제 훨씬 더 큰 밀집 시스템과 같은 대화에 설득력 있게 설 수 있다. 이는 전체 희소 MoE 계열 작업이 내내 주장해 온 바이며, 벤치마크가 마침내 이를 뒷받침하기 시작했다.
관련 글
구글 Flow와 Adobe Firefly, AI 비디오를 채팅창 밖으로 꺼내다
기본 모델 품질이 충분히 수렴하면서 차별화 요소는 모델을 둘러싼 것들로 옮겨갔습니다.
구글, 나노 바나나 2.1 출력 가격을 절반으로 인하하고 가장 취약한 기능을 개선하다
가장 중요한 세부 사항은 기능 목록 밖에 있으며, 바로 가격입니다.
Vida, AI 에이전트 요금을 사용량이 아닌 성과 기준으로 청구하려 한다
사용량 기반 청구는 에이전트가 더 오래 걸릴수록 공급업체의 수익이 늘어나게 합니다. 성과 기반 가격은 이를 뒤집습니다.
Decagon의 Voice 3와 PACT, 상대편에 있는 에이전트를 위한 고객 지원을 준비하다
고객 지원 시스템은 수십 년 동안 인간 행동을 모델링해 왔다. 이제 들어오는 요청 중 일부는 사람을 대신해 행동하는 기계다.