Naive AI와 포스트 트레이닝에 걸린 14억 달러 베팅

칭화대학교 교수가 설립한 신생 연구 스타트업이 14억 달러의 기업가치를 달성했다고 알려졌다. 그런데 이 회사가 파는 것은 새로운 파운데이션 모델이 아니다. Naive AI는 이미 존재하는 모델 위에 구축한다. 이 회사의 베팅은 파이프라인에서 더 저렴한 절반, 즉 사전 학습 이후 단계에서 다음 라운드의 성과가 결정될 것이라는 데 있다.
이 소식은 10월 10일 발표된 Dealroom 보고서에서 나왔으며, Naive AI를 처음부터 모델을 학습시키기보다 중간 학습과 고급 포스트 트레이닝에 집중하는 젊은 연구소로 설명한다. 대표 모델인 Naive-N0.5-Flash는 MIT 라이선스로 공개되는데, 이는 오픈소스 라이선스 중에서도 가장 허용적인 편에 속한다. "이미 있는 것을 개선한다"는 것이 전부인 회사에 붙은 14억 달러라는 숫자가 흥미로운 부분이며, 모델 자체가 아니다.
포스트 트레이닝이 더 저렴한 지렛대인 이유
사전 학습은 자본의 문제다. 수천 개의 가속기가 필요하고, 수조 토큰 단위로 측정되는 데이터 파이프라인과 몇 달 동안 손실 곡선을 지켜볼 인내가 필요하다. 미스트랄은 새 플래그십 모델을 약 4,000개의 엔비디아 Grace Blackwell GPU로 약 두 달에 걸쳐 학습시켰다. 그런 규모의 학습은 소수 기업만이 할 수 있다. 좋은 아이디어를 가진 연구 그룹이 할 수 있는 일이 아니다.
포스트 트레이닝은 예산이 다르다. 베이스 모델을 쓸모 있는 무언가로 바꾸는 작업, 즉 행동을 형성하는 중간 학습, 인스트럭션 튜닝, 피드백 기반 강화학습, 그리고 그것이 도움이 되었는지 알려주는 평가 루프를 포함한다. 컴퓨팅이 제한된 소규모 팀도 오픈 웨이트 베이스 위에서 이 작업을 수행하고 사람들이 쓰고 싶어 하는 모델을 만들 수 있다. 이것이 Naive AI가 노리는 틈새이자 투자자들이 기꺼이 돈을 지불할 이유다.
이 제안에는 재귀적 자기 개선도 포함되는데, 이는 회의적으로 봐야 할 표현이다. 소박한 형태로는 모델을 사용해 다음 버전의 학습 데이터와 보상 신호를 생성하는 데 활용하고 이를 반복하는 것을 뜻한다. 거창한 형태로는 인간의 입력 없이 스스로를 개선하는 시스템에 대한 꿈이다. 보고서는 소박한 버전을 설명한다. 여기서 주말 사이에 초지능으로 부트스트랩하는 기계를 암시하는 내용은 없으며, 독자들은 그렇게 프레이밍하는 것은 마케팅으로 취급해야 한다.
포스트 트레이닝이 주목받는 두 번째 이유는 사전 학습과 달리 측정 가능하다는 점이다. 베이스 모델을 개선하면 동일한 벤치마크로 실행해 차이를 볼 수 있다. 처음부터 학습하면 모델 전체가 한 번에 바뀌기 때문에 비교가 더 흐릿해진다. 포스트 트레이닝에 집중하는 팀은 자신이 무엇을 더했는지에 대해 명확하고 반복 가능한 주장을 할 수 있는데, 이는 바로 투자자와 엔지니어 모두를 설득하는 종류의 주장이다.
또한 연구소가 싸울 전장을 고를 수 있게 해준다. 포스트 트레이닝 방법마다 겨냥하는 행동이 다르다: 더 나은 지시 수행, 더 강한 추론, 더 안전한 거부, 더 긴밀한 도구 사용. 소규모 팀은 그중 하나나 둘을 골라 경쟁할 수 있다. 모든 곳에서 이기려 하지 않아도 된다. 이런 집중은 사람들이 실제로 채택하는 니치 모델과 아무도 갈아타지 않는 범용 모델 사이의 차이인 경우가 많다.

이미 보이는 패턴과 맞아떨어진다
Naive AI만 후반 단계가 순수한 규모를 이긴다고 베팅하는 것이 아니다. 지난 두 달 동안 일련의 오픈 웨이트 공개가 서로 다른 방식으로 같은 점을 보여주었다. 여러 연구소가 새로운 아키텍처를 발명하기보다 기존 아키텍처를 개선해 경쟁력 있는 모델을 내놓았고, 그들의 대표 주장은 대개 같다: 훨씬 적은 학습 비용으로 비슷한 결과.
시장 데이터도 이 압력을 뒷받침한다. 10월 초 BenchLM 분석에 따르면 선택된 추론 벤치마크에서 오픈 웨이트 모델과 독점 모델 간 격차가 좁아지고 있으며, 프리미엄 독점 API 비용은 40% 감소했다고 보고됐다. 이 분석은 오픈 웨이트 배포가 백만 토큰당 0.50달러 미만의 비용으로 대용량 워크로드를 처리하고 있다고 지적한다. 이 수치들은 맥락이 필요하다. API 가격은 모델, 워크로드, 서비스 등급, 시점에 따라 변동하며, 벤치마크 점수가 실제 환경의 신뢰성을 입증하지는 않는다. 그러나 방향은 명백하다: 성능의 가격이 떨어지고 있으며, 그 하락은 더 큰 사전 학습만큼이나 더 나은 포스트 트레이닝에 의해 이끌리고 있다.
포스트 트레이닝 전략의 위험은 다른 사람의 베이스 모델에 의존한다는 것이다. 기반으로 삼은 오픈 웨이트 베이스가 라이선스를 바꾸거나, 통제할 수 없는 방식으로 바뀐 버전을 내놓으면 제품이 노출된다. 이는 실제 제약이며, 이런 길을 택한 연구소들이 자신들의 방법을 공개적으로 발표하는 경향이 있는 이유다. 단일 연구소가 떠나더라도 커뮤니티가 작업을 이어갈 수 있도록 하기 위해서다.
기업가치가 실제로 값을 매기는 것
신생 스타트업에 대한 14억 달러 기업가치는 모델 개발의 미래에 대한 선언이며, 명확한 가정을 담고 있다: 우위가 얼마나 많은 컴퓨팅을 살 수 있는지에서 이미 가진 것을 얼마나 잘 학습시키고 평가하는지로 이동하고 있다는 것이다. 이것이 유지된다면 자본은 더 이상 유일한 해자가 아니게 되고, 강력한 방법을 가진 작은 팀들이 테이블에 앉을 자리를 얻는다.
가정이 틀렸다면 이야기는 반대로 흐른다. 다른 사람의 베이스 모델에 대한 포스트 트레이닝 작업은 방법이 공개되면 따라 하기 쉽다. 보통 공개되기 때문이다. 그런 작업만으로 세워진 연구소는 방어할 독점적 베이스가 없고, 모든 경쟁자가 그 레시피를 재현할 수 있다면 우위는 사라진다. 이 기업가치는 방법과 데이터에서 지속 가능한 우위를 가정하는데, 방법만으로는 오래 비밀로 유지되기 어렵다. 그것이 헤드라인 숫자 아래의 조용한 위험이다.
솔직한 단서는 이 중 어느 것도 아직 검증되지 않았다는 점이다. 기업가치는 보고된 것이지 확인된 것이 아니다. 모델이 주장하는 성능은 누구든 그 위에 제품을 계획하기 전에 독립적인 벤치마크와 재현 가능한 비용 측정이 필요하다. 패턴은 고무적이지만, 패턴은 증명이 아니다.
이 이야기를 따라갈 가치가 있게 만드는 것은 돈이 아니다. 한 교수의 연구소가 소수의 인원과 제한된 예산으로, 정부가 인프라에 쓰듯 컴퓨팅에 돈을 쓰는 기업들 옆에 서서, 처음이 아니라 마지막 1마일에서 더 똑똑해지는 방식으로 해내겠다고 생각한다는 점이다. 그것은 검증 가능한 주장이다. 앞으로 몇 달간의 오픈 웨이트 공개가 그것이 유지되는지 보여줄 것이다.
더 넓은 변화가 계속된다면, 그것은 누가 만들 수 있는가에 관한 것이다. 유능한 모델을 만드는 비싼 부분이 포스트 트레이닝을 통해 임대할 수 있는 것이 된다면, 유용한 무언가를 만들 수 있는 팀의 수가 늘어난다. 그렇다고 가장 큰 연구소들이 지는 것은 아니다. 분야가 더 넓어지고, 더 넓은 분야는 더 많은 다양성, 더 많은 니치 도구, 가격 경쟁을 낳는 경향이 있다. Naive AI가 옳은 베팅인지와 무관하게, 이 회사는 AI를 만드는 입장권이 오늘 보이는 것보다 작아진 미래에 베팅하고 있다.
관련 글
Decagon의 PACT 프로토콜, '동의'를 표준으로 만들려 한다
Decagon은 개인 에이전트의 신원과 고객이 부여한 권한을 검증하는 프로토콜을 오픈소스로 공개했다. 지루한 배관이지만, 에이전트 경제가 작동할지를 결정한다.
AI '재회' 물결: 중국이 아직 어떻게 느껴야 할지 정하지 못한 논쟁
AI 추모 영상이 세상을 떠난 공인을 중국의 화면으로 데려와 수십만 개의 좋아요를 모았다. 그리고 반발이 왔다. 쟁점은 '동의'였다.
애플이 오픈 멀티모달 모델을 공개했지만 거의 아무에게도 알리지 않았다
연구 우선의 이번 릴리스는 주류 시야를 조용히 지나갔다. 그러나 세밀한 시각 그라운딩은 애플의 AI 스택이 어디로 가는지 말해 준다.
OpenCut과 '오픈소스 CapCut'의 순간
무료 MIT 라이선스 영상 편집기가 GitHub 트렌드를 계속 오르고, 로드맵에는 AI 에이전트용 MCP 서버가 들어 있다. AI 미디어를 둘러싼 도구가 모델을 따라잡고 있다.