← 블로그로
Ai약 13 분 읽기

중국의 새로운 오픈 모델들은 에이전트 기반으로 훈련되고 있다

게시일 2026년 10월 3일
중국의 새로운 오픈 모델들은 에이전트 기반으로 훈련되고 있다

지난주 중국 연구소에서 공개된 세 가지 모델 릴리스는 파라미터 수 목록으로 읽으면 놓치기 쉬운 설계 본능을 공유합니다. 그중 어느 것도 대화를 잘하기 위해 만들어진 것이 아닙니다.

그들은 에이전트가 실행되는 기반이 되도록 만들어졌습니다. 그것은 다른 목표이며, 더 나은 챗봇이 목표라고 가정하면 그로부터 이어지는 훈련 선택은 이상해 보입니다.

과제와 그 주변 세계를 함께 훈련하기

가장 명확한 예는 즈즈 혁신 연구소(ZhiZhi Innovation Research Institute)가 9월 29일에 공개한 IQuest-Q1입니다. 이는 총 3,200억 개 파라미터, 활성 150억 개, 524,288토큰 컨텍스트 윈도우를 갖춘 희소 전문가 혼합(mixture-of-experts) 모델입니다. 아키텍처는 훈련 방법에 비하면 별다를 게 없습니다.

인간 대화 기록이나 정적 지시 세트에 미세 조정하는 대신, 팀은 과제와 그 과제가 일어나는 환경을 함께 합성했습니다. 그런 다음 모델은 여러 가지 서로 다른 에이전트 스캐폴드에 걸쳐 훈련되었습니다. 각 스캐폴드의 기본 도구와 컨텍스트 관리를 그대로 유지했고, 모델 자체의 실수만을 학습 신호로 취급했습니다. 하네스가 교훈이 되도록 허용되지 않았습니다. 이후 네 개의 전문가 모델이 다중 교사 온-폴리시 증류(multi-teacher on-policy distillation)를 통해 하나로 병합되었습니다.

이는 에이전트를 구축하는 사람이라면 누구나 겪어봤을 문제 때문에 중요합니다. 벤치마크에서 좋은 점수를 받는 모델도 자신의 도구로 감싸면 무너질 수 있는데, 이는 다른 사람의 하네스 특성을 학습했기 때문입니다. 하네스를 일정하게 유지한 채 여러 스캐폴드에 걸쳐 훈련하는 것은 바로 그 특정 실패를 공략합니다. 보고된 결과는 자연어를 저장소(repository)로 변환하는 과제에서 Claude Opus 5에 바로 뒤처지는 모델이며, 이는 잘하기에는 이상한 능력이고 코딩 에이전트에게 꼭 필요한 바로 그 능력입니다.

같은 단계에서 보고 결정하기

두 번째 릴리스는 같은 목표를 향해 다른 경로를 택합니다. 같은 날 상하이 AI 연구소는 0.8B, 2B, 4B의 세 가지 크기로 슈성 밍줴(Shusheng Mingjue)라는 결정 모델을 소개했습니다. 이는 의도적으로 작습니다.

설계 원칙은 지각과 결정이 별개의 단계가 되어서는 안 된다는 것입니다. 대부분의 에이전트 스택은 스크린샷을 찍어 비전 모델에 넘기고, 설명을 받아 플래너에게 전달한 뒤 행동합니다. 각 단계는 지연을 더하고 세부 정보를 잃습니다. Mingjue는 기본 시각 지각과 지시 따르기를 융합하여 모델이 화면을 보고 한 번에 판단을 내립니다. 연구소는 이 모델이 결정 품질에서 Jev 및 비교 가능한 오픈 모델을 능가한다고 보고합니다. 동적 환경 안에서 행동해야 하는 에이전트에게 크기는 핵심입니다. 4B 모델은 루프 가까이에서 실행될 수 있지만 320B 모델은 그럴 수 없습니다.

백만 토큰에 도달하기 위해 어텐션 계층 삭제하기

세 번째 릴리스는 아키텍처적으로 가장 공격적입니다. 베이징 연구소 NaiveAI의 Naive N0.5 Flash는 3,090억 개 파라미터의 전문가 혼합 모델로, 활성 파라미터는 155억 개이며 샤오미의 MiMo-V2.5를 기반으로 구축되었습니다. 기본적으로 100만 토큰 컨텍스트를 지원하며 MIT 라이선스로 제공됩니다.

흥미로운 부분은 제거한 것입니다. 이 모델은 슬라이딩 윈도우 어텐션과 DeepSeek의 희소 어텐션을 혼합해 사용하며, 전체 어텐션 계층이 전혀 없습니다. 표준 트랜스포머 어텐션은 시퀀스 길이에 따라 이차적으로 증가하기 때문에 긴 컨텍스트가 역사적으로 비쌌습니다. 전체 어텐션을 제거하는 것은 긴 시퀀스의 유용한 정보가 구조적 희소성을 통해 도달할 수 있다는 베팅이며, 그것이 사실로 입증되면 에이전트가 한 번에 볼 수 있는 범위를 바꿉니다. 100만 토큰은 대략 대형 저장소나 긴 작업 세션 정도의 기록을 잘림 없이 유지할 수 있는 양입니다.

더 작은 릴리스들도 같은 방향을 가리킵니다

이 패턴은 이 세 가지를 넘어서 나타납니다. 칭화대의 Puro-2B는 약 4,400달러에 훈련되었고 평균적으로 15개 과제에서 더 큰 Qwen 모델을 능가합니다. 한 통신 연구소는 문서 이해 벤치마크에서 1위를 차지한 1.2B 문서 파싱 모델 TeleOCR을 출시했습니다. 스탠퍼드와 NVIDIA는 추론이 아닌 임베딩 정렬을 통해 최적의 후보 행동을 선택하는 대조 검증기를 공개했으며, 비슷한 판정 모델에 비해 큰 속도 향상을 보고했습니다.

이들 각각은 에이전트의 구성 요소이지 사용자의 목적지가 아닙니다. 후보 행동을 저렴하게 순위 매기는 검증기, 문서를 파싱하는 작은 모델, 무엇을 클릭할지 결정하는 아주 작은 모델. 조각들은 전문화되고 작아지는 반면, 전체 세션의 컨텍스트를 보유하는 하나의 모델은 매우 커집니다.

아무도 해결하지 못한 평가 문제

이 모든 것에는 구멍이 하나 있습니다. 에이전트 기반 모델을 위한 벤치마크는 여전히 대부분 챗봇 평가에서 차용한 것으로, 잘못된 것을 측정합니다. 모델이 추론 테스트에서 좋은 점수를 받아도 에이전트의 기반으로는 부족할 수 있는데, 중요한 속성은 세션 전반에 걸쳐서만 드러나기 때문입니다. 컨텍스트가 저하되기까지 몇 턴이 지나는지, 실패한 도구 호출이 합리적으로 재시도되는지, 모델이 원래 목표를 놓쳤다는 것을 인지하는지 등입니다.

여기 보고된 수치 대부분은 연구소 자체에서 나온 것이며, 그들이 정의를 도운 벤치마크에서 나온 것입니다. 자연어-저장소 과제에서 IQuest-Q1이 "Claude Opus 5에 바로 뒤처진다"는 것은 공급업체 비교입니다. Mingjue가 "Jev를 능가한다"는 것은 공급업체 주장입니다. Naive N0.5 Flash의 전체 어텐션 부재는 검증하기 쉬운 아키텍처적 사실이며, 그 실질적 결과는 아직 대규모로 측정되지 않았습니다. 그렇다고 해서 방향이 잘못된 것은 아닙니다. 이는 솔직한 현황이 우리에게 세 가지 흥미로운 설계가 있고, 에이전트가 6시간 동안 실행될 때 어느 것이 견딜지에 대한 독립적 증거는 거의 없다는 것을 의미합니다.

그 격차는 이제 인정받기 시작했습니다. 독립적인 그룹들은 코드 생성이 아니라 프로덕션 서빙을 목표로 하고, 모델 안전성이 아니라 에이전트 하이재킹을 목표로 하는 벤치마크를 구축해 왔으며, 이는 해당 분야가 잘못된 계층을 측정해 왔다는 것을 알고 있음을 시사합니다. 그것들이 성숙할 때까지, 이런 릴리스에서 유용한 신호는 점수가 아닙니다. 그것은 훈련 방법입니다. 왜냐하면 에이전트의 알려진 실패 모드를 해결하는 방법이 리더보드를 겨냥한 숫자보다 실제일 가능성이 더 높기 때문입니다.

이 전환에는 놓치기 쉬운 또 하나의 결과가 있습니다. 중요한 모델이 큰 목적지가 아니라 작은 구성 요소가 되면, 연구소의 이점은 가장 큰 모델을 보유하는 데서 나오지 않고 조각들이 어떻게 맞물리는지 아는 데서 나오기 시작합니다. 빠른 결정 모델, 저렴한 문서 파서, 검증기를 훈련하고 이를 적당한 하드웨어에서 실행되는 루프에 연결할 수 있는 팀은 단일 거대 체크포인트가 따라올 수 없는 무언가를 갖습니다. 그것은 스케일링보다 시스템 엔지니어링에 더 가까운 다른 종류의 경쟁이며, 이번 달에 나온 릴리스들은 적어도 몇몇 중국 팀이 이미 그쪽으로 방향을 바꿨음을 시사합니다.

2년 동안 오픈 웨이트 경쟁은 무료 모델이 프런티어 챗봇에 얼마나 가까워질 수 있는지로 측정되었습니다. 그 프레이밍은 힘을 잃고 있습니다. 채팅 품질은 기본선이 되었고, 소프트웨어가 작동하는지를 결정하는 질문들은 다른 영역으로 옮겨갔습니다. 컨텍스트가 저하되기까지 몇 턴이 걸리는지, 모델이 루프 안에서 얼마나 빠르게 행동할 수 있는지, 다른 사람의 도구에 던져졌을 때 얼마나 잘 견디는지 등입니다.

그 질문들에 답하는 모델은 많은 리더보드에서 이기지 못할 것입니다. 그들은 챗봇이 이미 할 일을 마쳤고 실제 작업이 이루어져야 할 때 개발자가 어느 것을 선택하는지에 대한 덜 눈에 띄는 경쟁에서 이길 것입니다. 그 경쟁은 이번 주에 조용히 펼쳐졌습니다. 대화로 누군가를 감탄시키려 하지 않은 세 가지 릴리스에서 말입니다.

관련 글