알리바바의 Qwen3.8-Max, 2주 동안 스스로 코딩할 수 있다고 주장

10월 2일, 알리바바의 Qwen 팀은 2.4조 파라미터의 전문가 혼합(mixture-of-experts) 모델인 Qwen3.8-Max를 공개했다. 이 모델은 법률, 금융, 디자인을 포함한 수백 가지 작업 유형에서 유능하다고 회사 측은 설명한다. 가장 많은 주목을 받은 주장은 파라미터 수보다 더 좁은 범위에 관한 것이었다. 발표에 따르면 이 모델은 프로그래밍 작업을 12일 넘게 자율적으로 수행해 완전한 프로젝트를 완성할 수 있다.
파라미터 수는 이미 오래전부터 뉴스거리가 아니게 되었다. 주목할 만한 숫자는 “12일”이다. 이는 대부분의 모델이 함께 선보이는 데모와는 다른 종류의 능력을 설명하기 때문이다.
하나의 작업 대 하나의 프로젝트
대부분의 코딩 모델 벤치마크는 단일 작업 단위를 측정한다. 함수 작성하기, 버그 수정하기, 저장소에 관한 질문에 답하기 등이다. 시간 지평은 몇 분에 불과하다. 이런 테스트를 통과하는 모델은 문제가 완전히 명시되고 결과를 한 단계에서 검증할 수 있을 때 올바른 출력을 낼 수 있음을 보여준 것이다.
12일이 걸리는 프로젝트는 더 긴 함수가 아니다. 각 결정이 다음 결정을 제약하고, 모델이 수천 번의 편집에 걸쳐 설계를 머릿속에 유지해야 하는 일련의 결정들이다. 실패 양상도 달라진다. 단계마다 95퍼센트 정확한 모델은 5분짜리 작업에서는 뛰어난 조수지만 2주짜리 작업에서는 부담이 된다. 오류가 누적되고 아무도 각 편집을 지켜보지 않기 때문이다.
그래서 시간 지평에 관한 주장이 파라미터 수보다 더 중요하다. 이는 질문을 능력에서 신뢰성으로 옮긴다.
긴 시간 지평이 실제로 요구하는 것
세 가지가 작동해야 하며, 그중 어느 것도 순전히 모델의 속성은 아니다.
메모리와 상태 관리가 첫 번째다. 12일간의 작업은 컨텍스트 창이 아무리 커도 담을 수 없다. 시스템은 작업 상태를 외부화하고, 중간 결과를 디스크에 쓰고, 중단 후 체크포인트에서 재개해야 한다. 이는 모델 주변의 인프라이며, 그 정확성이 장기 실행이 재시작을 견뎌낼 수 있는지를 결정한다.
자기 교정이 두 번째다. 긴 시간 지평에서는 모델이 잘못된 방향으로 갈 수 있다. 사람이 각 단계를 검토하지 않는다면, 접근 방식이 실패하고 있음을 알아차리고 실패가 퍼지기 전에 수정할 방법이 필요하다. 이는 모델이 자신의 중간 출력을 원래 목표에 비추어 평가해야 한다는 뜻이며, 이는 애초에 출력을 생성하는 것보다 더 어려운 작업이다.
도구 안정성이 세 번째다. 여러 날에 걸친 프로젝트는 코드베이스, 테스트 러너, 문서, 그리고 아마도 패키지 관리자를 건드리게 된다. 모든 도구 호출은 모델이 기대하는 것과 환경이 반환하는 것 사이의 불일치가 생길 기회다. 수천 번의 호출에서 실행을 끝내는 것은 그 분포의 꼬리다.
종합하면, 12일 주장은 전체 시스템, 즉 모델과 하네스와 환경에 관한 주장이다. 이는 유용한 해석 방식이다. 실패했을 때 어디를 봐야 하는지 알려주기 때문이다.
하네스 논쟁이 숨은 맥락이다
이번 발표 시점은 우연이 아니다. 강력한 모델이 여전히 얼마나 많은 스캐폴딩을 필요로 하는지에 관해 에이전트 연구자들 사이에서 활발한 논쟁이 있다. 더 나은 모델이 정교한 에이전트 프레임워크를 쓸모없게 만드는지, 아니면 신뢰성이 프레임워크에서 나오는지가 문제다.
12일에 걸친 자율 작업 주장은 그 논쟁의 한쪽 편에 서 있다. 이는 모델이 부담을 감당할 수 있고 프레임워크는 조연이라는 뜻이다. 그러나 위의 세 가지 요건은 반대를 시사한다. 프레임워크가 시간 지평을 가능하게 하는 것이며, 모델은 그 안의 구성 요소라는 것이다.
두 해석이 동시에 참일 수 있으며, 아마 그것이 가장 공정한 표현일 것이다. 더 강력한 모델은 작업에 필요한 일일이 챙겨주는 일을 줄이고, 잘 만들어진 하네스가 달성할 수 있는 상한도 높인다. 긴 시간 지평에 걸쳐 계획할 수 있는 모델은 좋은 하네스 안에서 더 가치가 크지, 덜하지 않다.
주장의 사무 작업 측면
이번 발표는 코딩을 사무 작업과 함께 내세우는데, 그 조합은 우연이 아니다. 둘 다 출력을 검증할 수 있는 범주이며, 이것이 자율성을 실행 가능하게 만든다. 수식 오류가 있는 스프레드시트는 테스트할 수 있다. 조항이 빠진 계약서는 체크리스트와 대조해 검토할 수 있다. 모델은 세상 전반에 대해 옳을 필요가 없고, 검증 가능한 답이 있는 작업에 대해서만 옳으면 된다.
그래서 이 주장은 처음 들리는 것보다 범위가 좁다. 코드베이스에서 2주 동안 자율적으로 실행할 수 있는 모델은 개방형 연구 질문에서 2주 동안 자율적으로 실행할 수 있는 모델과 같지 않다. 후자의 경우 한참 뒤까지 아무도 작업이 올바른지 알 수 없다. 발표된 프레이밍은 약속을 피드백이 존재하는 영역 안에 붙잡아 둔다.
그렇게 읽으면 12일이라는 숫자는 능력만큼이나 검증에 관한 진술이 된다. 시간 지평이 길수록 시스템은 자신의 작업을 확인할 수 있는 능력에 더 의존하게 된다.
이 두 영역을 선택한 데에는 상업적 논리가 있다. 코딩과 사무 작업은 기업이 이미 예산을 배정해 둔 곳이며, 전문가 없이도 출력을 평가할 수 있는 곳이다. 2주짜리 개발 작업을 자동화하는 모델은 측정 가능한 수익을 낸다. 시를 쓰는 모델은 그렇지 않다.
이 주장을 평가하는 방법
파라미터 수는 무시하고 세 가지 구체적인 점을 살펴보라.
“자율적”이 실제로 무엇을 뜻하는지 물어보라. 때때로 사람이 확인하는 체크포인트가 있는 12일 실행은 무인으로 진행되는 실행과 다른 제품이다. 기업들은 체크포인트가 어디인지 좀처럼 밝히지 않으며, 그 세부 사항이 총 기간보다 유용성을 더 크게 좌우한다.
그 실행이 무엇을 만들어냈는지 물어보라. 완성된 프로젝트는 테스트 가능한 산출물이다. 저장소, 통과하는 테스트 스위트, 작동하는 배포는 검증할 수 있다. 스크린샷과 내레이션이 붙은 데모는 검증할 수 없다.
실패했을 때 무슨 일이 일어났는지 물어보라. 장기 실행은 실패하며, 흥미로운 정보는 그 방식에 있다. 막다른 길을 감지하고 되돌아가는 모델은 계속 밀어붙여 그럴듯해 보이지만 실행되지 않는 결과를 내는 모델보다 훨씬 유용하다.
이것이 시장에 말해주는 것
알리바바가 범용 채팅이 아니라 코딩과 사무 작업을 겨냥한 플래그십 모델을 내놓은 것은 가치가 어디에 있는지에 관한 선언이다. 소비자 챗봇 시장은 붐비고 수익화하기 어렵다. 기업이 비용을 지불할 작업은 시간을 대체하거나 보강하는 작업이며, 그런 작업은 긴 시간 지평을 가진다.
12일 주장이 부분적으로라도 사실이라면, 실질적인 효과는 작은 팀이 이전에는 더 큰 팀이 필요했던 프로젝트를 시도할 수 있다는 것이다. 그렇지 않다면 이 모델은 여전히 큰 컨텍스트를 갖춘 강력한 코딩 조수이며, 12일이라는 문구는 마케팅에서 스스로 사라질 것이다. 어느 쪽이든 유용한 부분은 프레이밍이다. 이제 능력은 한 번에 무엇을 할 수 있는지만큼이나, 감독 없이 얼마나 오래 계속 작업할 수 있는가로 측정된다.
관련 글
아무도 홍보하지 않는 비디오 모델 리더보드: 요청은 실제로 어디로 가는가
매주 새로운 비디오 생성 순위가 나오고, 그 거의 전부가 같은 방식으로 만들어진다.
Ai2가 오픈소스로 공개한 것은 또 다른 가중치가 아니라 학습 스택이다
가중치는 나누기 쉽지만 배우기는 어렵다.
PixelUMM, 모든 비주얼 AI 모델이 의존하는 두 가지 구성 요소를 버리다
픽셀 수준 확산은 이전에도 제안되었지만 반복적으로 연산 한계에 부딪혔습니다.
AI 데이터센터는 이제 칩 배송이 아니라 전력선을 기다린다
2027년에 제때 문을 여는 프로젝트는 연결과 메모리 할당을 먼저 해결한 곳이 될 것이다.