← 블로그로
News약 12 분 읽기

DeepSeek, 조 단위 모델을 돌린 엔지니어링 경험을 오픈소스로 공개: 이번에 국산 컴퓨팅이 보강한 것은 소프트웨어 계층

게시일 2026년 10월 3일
DeepSeek, 조 단위 모델을 돌린 엔지니어링 경험을 오픈소스로 공개: 이번에 국산 컴퓨팅이 보강한 것은 소프트웨어 계층

9월 30일, DeepSeek은 공식 웨이신 계정을 통해 코드 한 묶음을 공개하며 화웨이 어센드(Ascend) 플랫폼에 여섯 개 모듈을 오픈소스로 제공했다: TileLang, DeepGEMM-Ascend, DeepEP-Ascend, TileKernels, FlashMLA, DeepSelect. 이름만 들으면 조각조각 흩어진 것 같지만, 실제로 포괄하는 범위는 꽤 정연하다. 프로그래밍 언어 하나, 연산 커널 한 묶음, 그리고 분산 통신까지다.

이 일은 흔한 오픈소스 공개와는 좀 다르다. 공개한 것은 모델이 아니라, 모델을 돌리는 데 필요한 토대 계층이다.

칩이 충분해진 다음, 발목을 잡는 건 다른 것

국산 컴퓨팅은 최근 몇 년간 연산량 수치로 가장 많이 논의됐다. 스펙표는 해마다 좋아지지만, 실제로 모델을 옮겨 본 엔지니어라면 문제가 좀처럼 피크 연산력에서 나오지 않는다는 걸 안다.

엔비디아의 CUDA 생태계는 20년 넘게 구축돼 왔다. 컴파일러, 수학 라이브러리, 통신 라이브러리가 층층이 쌓여 있어 개발자는 카드를 받으면 바로 쓸 수 있고, 문서와 커뮤니티, 삽질 기록까지 다 갖춰져 있다. 다른 하드웨어로 옮기면 같은 연산자 하나도 직접 짜야 할 수 있고, 스케줄링도 직접 조정해야 하며, 다중 노드·다중 카드 통신 라이브러리도 직접 구현을 들여다봐야 한다. 칩 벤치마크 점수는 낮지 않지만, 모델을 그 위에 올리는 일 자체의 비용이 터무니없이 높다.

이 격차에는 잘 언급되지 않는 층위가 하나 더 있다. 하드웨어는 한 번에 투자해 사면 되지만, 소프트웨어 생태계는 사람이 해마다 갈고닦아야만 만들어진다. 카드 구매는 조달 문제고, 툴체인을 갖추는 건 시간 문제이며, 그 시간은 실제 프로젝트로만 벌 수 있다. 누군가의 모델이 어떤 플랫폼에서 먼저 돌아가고, 안정적으로 돌아가고, 규모까지 커지면 그제야 재사용 가능한 경험이 쌓인다. 이번 오픈소스가 따로 다뤄 볼 가치가 있는 이유도 여기 있다. 무엇을 샀다는 게 아니라, 누군가 쌓아둔 것을 내놨다는 것이다.

그래서 국산 컴퓨팅의 장기적인 진짜 약점은 소프트웨어다. 칩은 계산할 수 있지만 쓰기 불편하다. DeepSeek이 이번에 오픈소스로 공개한 것들은 바로 이 공백 위에 놓인다.

여섯 모듈 중 가장 볼 만한 것은 TileLang

여섯 모듈 가운데 비중이 가장 큰 것은 TileLang이다. DeepSeek이 자체 개발한 고수준 프로그래밍 언어로, 이전에는 주로 엔비디아 백엔드를 대상으로 했는데 이번에 어센드 950을 정식 지원하며 네이티브 코드 생성, 자동 스케줄링과 동기화를 제공한다. DeepSeek이 내세우는 위치는 아주 직설적이다. CUDA의 대안이며, "프로그래밍 모델이 더 단순하다"는 것이다.

함께 제공되는 TileKernels는 또 다른 오랜 문제를 해결한다. 엔비디아나 화웨이 백엔드를 자동으로 선택하고, 상위에는 동일한 Python API를 노출한다. 다시 말해 같은 코드가 두 하드웨어 플랫폼에서 돌아가며, 전환 비용이 커널을 다시 쓰는 수준이 아니라 설정 수준으로 눌러졌다.

공개된 내부 테스트 데이터도 모호하지 않다. 일부 커널은 어센드 950DT에서 표기 하드웨어 상한의 매우 높은 비율에 도달했다. BF16 덴스 행렬 곱은 99.8%, FP8은 약 99.5%다. DeepSeek V4.1을 겨냥한 희소 어텐션 구현은 프리필 단계에서 410 TFLOPS를 기록해 이론값의 약 95%에 이르렀다. 양사는 또 어센드 950 128개 기반의 슈퍼노드 방안을 공동 최적화해 연산과 데이터 이동 사이의 균형을 맞추는 데 특화했다.

이 숫자들의 가치는 이 길이 통한다는 걸 증명한다는 데 있다. 예전에 국산 컴퓨팅을 논할 때는 쓸 수 있느냐를 물었는데, 이제는 하드웨어를 극한까지 짜내는 경험을 기꺼이 공개하려는 팀이 나오기 시작했다는 것은, 적어도 누군가는 공유할 수 있을 정도로 활용했다는 뜻이다.

하나의 API로 두 벤더 백엔드를 동시에, 가치는 어디에

TileLang과 TileKernels를 함께 보면 용도가 더 분명해진다. TileKernels는 엔비디아나 화웨이 백엔드를 자동으로 선택하고 상위에 동일한 Python API를 노출한다. 이는 팀이 두 벌이 아니라 한 벌의 코드를 유지한다는 뜻이다.

현실에서 제대로 된 추론 서비스 하나는 보통 여러 하드웨어에서 동시에 돌아가야 한다. 클라우드는 여전히 엔비디아일 수 있고, 자체 구축이나 신촹(信创) 시나리오는 국산 카드이며, 엣지 디바이스는 또 다른 세트다. 하드웨어를 바꿀 때마다 커널을 다시 짜야 한다면, 팀은 여러 병렬 구현을 유지해야 하고 테스트도 각각 돌려야 한다. 동일한 API가 이 일을 "다시 쓰기"에서 "설정 바꾸기"로 낮춰주면, 아껴지는 건 인력만이 아니라 실수할 기회이기도 하다.

어두운 회로 기판 위의 발광 칩, 가느다란 배선을 따라 빛이 바깥으로 퍼지는 차가운 청록색 톤

그저 제품을 만들어 내고 싶은 팀에게 이런 변화는 어떤 릴리스 노트에도 적히지 않지만, 그들이 국산 하드웨어를 시도할 의향이 있는지를 결정한다.

진짜 변화는 마이그레이션 비용에서 일어난다

일반 개발자에게 이번 오픈소스의 가장 현실적인 영향은 마이그레이션 비용이다.

과거에 학습이나 추론을 어센드로 옮기려면 저수준 연산자를 직접 보완하고 도구를 직접 맞춰야 했으며, 한 프로젝트가 그 일에 몇 달을 쓰는 경우도 드물지 않았다. 이제 이런 툴체인이 곧바로 오픈소스로 풀려, 많은 함정이 이미 누군가에 의해 밟히고 고쳐져 바로 재사용할 수 있다. 진입 장벽은 "연산자 적응 전담 팀이 있어야 한다"에서 "팀 안에 이 도구를 읽을 줄 아는 사람이 있어야 한다"로 내려간다.

이번 발표가 개발자 커뮤니티에서 적지 않은 반응을 얻은 이유이기도 하다. 요즘 모델은 이미 충분히 많이 나왔다. 정말 귀한 건 한 걸음 덜 돌아가는 일이다.

다음에 봐야 할 것은 남들이 쓰느냐다

이번 오픈소스의 무게를 판단하려면 DeepSeek이 스스로 뭐라고 했는지만 볼 게 아니라, 앞으로 반년 동안 남들이 무엇을 하는지를 봐야 한다.

툴체인이 자리를 잡을 수 있느냐는 제3자가 그 위에 투자할 의향이 있느냐에 달려 있다. TileLang이 DeepSeek 자사 모델만을 위해 쓰인다면 그 의미는 이 회사 안에서 멈춘다. 다른 팀이 그것으로 연산자를 짜고, 이슈를 올리고, 하드웨어 백엔드를 확장해 나가면 그때부터 공공 인프라가 되기 시작한다. 수치가 아무리 예뻐도 몇 달간 실제 부하를 통과해야 검증된 셈이 된다.

또 다른 변수는 다른 국산 칩들이 뒤이어 접속하느냐다. 현재 공개된 정보는 어센드에 집중돼 있다. 이 고수준 언어가 같은 논리로 더 많은 플랫폼에 옮겨갈 수 있다면 그 가치는 한 단계 더 올라간다. 이 점은 아직 답이 없다.

토대를 오픈소스로 만드는 일은 모델을 오픈소스로 만드는 일보다 느리다

지난 2년간 국산 오픈소스의 주 전장은 줄곧 모델 가중치였다. 파라미터, 리더보드, 다운로드 수는 모두 즉시 볼 수 있는 것들이다. 저수준 툴체인은 다르다. 리더보드에 나오지 않고, 단기적으로 화제도 되지 않는다. 하지만 이 계층이 없으면 그 위에 모델을 아무리 쌓아도 불안하다.

DeepSeek이 어센드에서 조 단위 모델을 돌린 엔지니어링 경험을 내놓은 것은, 바로 이런 눈에 띄지 않지만 업계가 앞으로 나아갈 수 있느냐를 결정하는 보충 수업이다.

지금 당장 손에 쥔 엔비디아 프로젝트를 어센드로 옮겨야 하느냐의 답은 여전히 구체적인 시나리오에 달려 있고, 팀에 저수준에 시간을 쓸 사람이 있느냐에도 달려 있다. 하지만 적어도 이날부터는 "생태계가 쓰기 불편하다"는 이유가 그렇게까지 설득력을 갖기는 어려워지기 시작했다. 그리고 생태계가 쓰일 수 있기 시작하면, 이후에 벌어지는 일은 대개 예상보다 빠르다.

관련 글