← 블로그로
Ai약 9 분 읽기

Kimi K3, OpenAI 기업 유료 체계에 진입: 중국산 오픈소스 대형 모델의 해외 진출 경로가 바뀌고 있다

게시일 2026년 10월 5일
Kimi K3, OpenAI 기업 유료 체계에 진입: 중국산 오픈소스 대형 모델의 해외 진출 경로가 바뀌고 있다

10월 1일, 미국 AI 인프라 기업 Baseten은 한 가지 사실을 공식 확인했다: 기업 개발자는 OpenAI의 코딩 도구 Codex에서 문샷 AI의 Kimi K3를 직접 호출할 수 있으며, 발생한 비용은 기업이 이미 보유한 OpenAI 구매 한도에 바로 청구된다. 새로운 공급업체 주체를 추가할 필요도, 조달 승인 절차를 다시 거칠 필요도 없다. 이는 중국 국내 오픈소스 대형 모델이 처음으로 OpenAI의 기업 유료 결제 체계에 진입한 사례다.

이 일의 무게는 파라미터나 리더보드 순위에 있는 게 아니라, 기업 조달의 경로 의존성을 바꿨다는 데 있다.

조달 절차 자체가 문턱이다

대기업이 새로운 모델 공급업체를 도입할 때 골치 아픈 것은 언제나 기술 연동이 아니라 컴플라이언스와 재무 절차다. 신규 공급업체는 진입 심사를 거쳐야 하고, 청구 및 결제 체계를 별도로 구축해야 하며, 법무와 조달을 처음부터 다시 통과해야 한다. 단지 어떤 모델이 쓸 만한지 검증하려는 팀에게 이 절차의 비용은 종종 모델 자체보다 훨씬 비싸다.

Kimi K3가 OpenAI의 한도로 결제되는 것은 이 모든 마찰을 우회하는 것과 같다. 기업에서 이미 승인된 AI 예산을 Kimi K3에 바로 쓸 수 있고, 재무팀이 보는 것은 여전히 OpenAI 청구서 한 장이다. Baseten은 하위 접점으로서 문샷 AI의 모델 역량을 OpenAI 생태계 채널에 연결했다.

이전에 Kimi K3는 이미 아마존 클라우드 Amazon Bedrock 플랫폼에 올라갔고, 문샷 AI는 이로써 중국 최초로 글로벌 선도 클라우드 사업자와 수익 배분 모델로 협력한 AI 기업이 됐다. 하나는 클라우드 플랫폼의 수익 배분, 다른 하나는 개발자 도구의 한도 차감이며, 두 경로는 같은 결과를 가리킨다: 중국산 대형 모델이 기술 시연 단계에서 규모화된 상업적 실행 단계로 들어가기 시작했다.

모델 자체는 어느 수준인가

Kimi K3는 올해 7월 공개됐으며 파라미터 규모는 2조 8천억으로, 공개 당시 전 세계에서 가장 큰 오픈소스 대형 모델이었다. 100만 토큰의 컨텍스트 윈도를 지원하고, 네이티브 시각 이해 능력을 갖췄으며, 코드 개발, 심층 연구, 복잡한 지식 처리를 위해 특별 최적화됐다.

공개 당일 Kimi K3는 국제 코드 평가 리더보드 Arena에서 1위에 올랐으며, 해당 1위를 차지한 최초의 중국 대형 모델이다. 테슬라 CEO 일론 머스크도 이 성과가 인상적이라고 공개 평가했다.

더 주목할 점은 아키텍처 사상이다. Kimi K3는 Kimi Delta Attention과 Attention Residuals를 사용해 긴 시퀀스에서의 정보 흐름을 개선했고, Stable LatentMoE 구조를 채택해 896개 전문가 중 16개만 활성화하며, 공식적으로는 이전 세대 대비 확장 효율을 약 2.5배 높였다고 밝혔다. 이 설계 방향은 최근 몇 달간 중국 연구소들의 집단적 움직임과 일치한다: 누가 파라미터가 더 큰지를 겨루는 게 아니라, 각 연산 자원이 얼마나 많은 사용 가능한 능력을 만들어내는지를 겨루는 것이다.

48시간의 자율 칩 설계

Codex 진입이 상업적 측면의 일이라면, 또 다른 진전은 기술 자체에 더 가깝다.

공개 정보에 따르면 Kimi K3는 이미 AI가 자율적으로 칩을 설계하는 개념 검증을 한 차례 완료했다. 48시간 연속 무중단 에이전트 테스트에서 오픈소스 EDA 도구와 45nm 공정 라이브러리를 기반으로, 적합한 칩의 설계, 반복, 전 과정 검증을 독립적으로 완수했다. 결과물은 4제곱밀리미터의 경량화 칩으로, 146만 개 표준 셀과 0.277MB SRAM을 탑재했고, 100MHz 주파수에서 안정적인 타이밍 수렴을 달성했으며, 최대 디코딩 처리량은 초당 8700 토큰 이상에 달한다.

핀셋이 무지갯빛 반사가 나는 정사각형 실리콘 조각을 집고, 따뜻한 색조의 실험대 위에 떠 있다

이런 결과는 신중하게 봐야 한다. 개념 검증은 양산 가능한 칩과 같지 않고, 45nm도 첨단 공정이 아니다. 하지만 그것이 검증하는 것은 프로세스 폐쇄 루프다: 모델이 사람의 단계적 개입 없이 여러 차례 시행착오가 필요한 엔지니어링 작업을 처음부터 끝까지 해낼 수 있는가. 에이전트를 만드는 사람에게는 이것이 단일 이미지가 예쁜지보다 더 많은 것을 말해준다.

경쟁의 층위는 어디로 가고 있나

Kimi K3의 해외 진출 움직임은 다른 축과 병행하고 있다.

같은 주에 지푸(Zhipu)는 오픈소스 모델 GLM-4.6을 발표하며 에이전트형 코딩 능력을 중점 업그레이드했고, 캄브리콘(Cambricon), 무어 스레드(Moore Threads) 등 중국산 칩에 대한 적응을 완료해 FP8+Int4 혼합 양자화 추론을 중국산 하드웨어에서 안정적으로 배포할 수 있게 했다. DeepSeek도 10월 2일 데스크톱 에이전트 실행 프레임워크 Harness v0.2를 오픈소스로 공개했으며, “모든 것이 플러그인” 아키텍처를 채택하고 파일 정리, 데이터 분석, 문서 초안 작성, 코드 수정 등의 기능을 내장했으며 MIT 라이선스로 개방했다.

이것들을 함께 놓고 보면 한 방향이 분명해진다: 모델 자체가 인프라가 되어가고 있으며, 진정한 차별화는 두 곳으로 이동하기 시작했다. 하나는 실행 프레임워크, 즉 모델 바깥의 레이어로, 누가 개발자와 기업이 모델을 자체 워크플로에 낮은 비용으로 접목하게 할 수 있는가다. 다른 하나는 하드웨어 적응, 즉 누가 추론을 더 저렴하고 자체 통제 가능한 연산력 위에서 돌릴 수 있는가다.

Kimi K3는 이미 K3.1을 예고했으며, 100만 토큰 컨텍스트를 지원하고 Low, High, Max 세 단계 추론 강도를 제공해 사용자가 작업 복잡도에 따라 선택할 수 있다. 긴 텍스트와 선택 가능한 추론 단계는 중국산 오픈소스 모델이 개발자를 확보하기 위한 표준 구성이 되어가고 있다.

중국산 대형 모델의 해외 진출은 과거 대부분 해외 고객과 일대일 직접 연결하는 방식이었고, 대기업이 도입하려면 신규 공급업체 자격 심사를 추가해야 해 진입 문턱이 매우 높았다. Kimi K3의 이 두 걸음은 문턱을 한 단계 낮췄다. 기업이 기꺼이 비용을 지불할지는 앞으로 몇 분기가 답을 줄 것이다.

관련 글