← 블로그로
Ai약 12 분 읽기

포토닉 메모리 벽: 볼란티스가 방금 건 8,800만 달러의 승부수

게시일 2026년 10월 4일
포토닉 메모리 벽: 볼란티스가 방금 건 8,800만 달러의 승부수

볼란티스의 제안은 말하기는 쉽지만 믿기는 어렵다. 메모리 벽을 사라지게 만드는 추론 시스템을 구축하겠다는 것이다.

샌프란시스코의 반도체 기업 볼란티스는 10월 1일 8,800만 달러 규모의 시리즈 A 라운드를 마감했다. 래치 그룸과 Abstract Ventures가 공동 주도했고, 존 도어, VXI Capital, Triatomic, Susa Ventures가 참여했다. 엔젤 투자자 명단은 추론 비용 논의의 명사들이 총출동한 듯하다. 드워케시 파텔, 나빈 라오, 숄토 더글러스 등이 포함됐다. 창립팀은 엔비디아, AMD, 브로드컴, 아야 랩스 출신이며, 첫 CoWoS 제품과 대량 생산형 튜너블 VCSEL, 초기 코패키지드 옵틱스 개발에 참여한 이력이 있다.

모두가 당연하게 여기게 된 트레이드오프

대형 모델을 빠르게 실행하려면 하드웨어가 함께 제공하지 못했던 두 가지가 필요하다. 가중치를 담을 막대한 용량과, 이를 연산 엔진에 끊임없이 공급할 막대한 대역폭이다. 오늘날 양산되는 모든 아키텍처는 둘 중 하나를 선택한다.

온칩 SRAM은 용량 없이 대역폭을 제공하므로 모델 크기와 컨텍스트 윈도가 제한되고, 토큰당 비용과 에너지 소비가 높아진다. HBM과 GPU 메모리는 용량은 주지만, 가장 큰 모델을 빠르게 서비스할 만큼의 대역폭은 부족하다. 3D DRAM 같은 최신 접근법도 같은 곡선 위에서 더 앞선 지점에 머물 뿐이다.

볼란티스는 첫 시스템인 A-1이 용량과 대역폭을 함께 거의 100배 수준으로 끌어올리도록 설계됐다고 말한다. 그렇게 되면 20조 개 이상의 파라미터를 가진 모델을 사용자당 초당 최대 10,000토큰으로 실행할 수 있다. 이는 회사가 발표한 설계 목표일 뿐 독립적인 검증은 없다. 벤치마크가 아니라 의도 선언으로 받아들여야 한다.

이 트레이드오프가 이토록 오래 지속된 이유는 물리학이다. 대역폭은 메모리와 연산 사이의 경계를 넘을 수 있는 데이터의 양에 제한되며, 대형 모델에서 실제로 소비되는 에너지의 대부분은 바로 그 경계에서 나온다. 가중치를 메모리에서 산술 연산 장치로 옮기는 데는 산술 연산 자체보다 훨씬 많은 전력이 든다. 그 비용을 함께 높이지 않으면서 대역폭을 높이는 아키텍처는 두 번 이긴다.

어두운 브러시드 메탈을 배경으로 중심부가 빛나는 광섬유 커넥터

더 어려운 문제를 겨눈 포토닉스

포토닉스는 이미 데이터센터 내부에서 데이터를 이동시킨다. 오늘날 존재하는 것은 대부분 칩 간 연결이다. 연산을 메모리에 연결하는 것은 다른 문제다. 훨씬 짧은 거리에서 100배 넘게 많은 데이터가 이동해야 하기 때문이다. 그 규모에서는 에너지와 비용이 다르게 작동한다.

볼란티스는 바로 그 환경을 위해 플랫폼을 만들었다. 외부 레이저 대신 자체 제작한 마이크로 VCSEL을 사용하며, 기존 갈륨비소(GaAs) VCSEL 공급망을 활용하고 다른 광학 설계의 병목이 되어 온 인듐인화물(InP) 제약을 우회한다. 회사는 그 결과로 만들어진 링크가 비트당 1피코줄 미만을 소비한다고 말한다.

광학 패브릭은 여러 메모리 칩을 하나의 논리적 자원으로 풀링한다. 따라서 메모리를 추가하면 용량만이 아니라 대역폭도 늘어난다. 이것이 핵심 기술이다. 동시에 전체 시스템의 작동 여부를 결정할 부분이기도 하다. 광 인터커넥트를 가로질러 메모리를 풀링하는 일은 지연 시간과 결함 허용이 진짜로 어려워지는 지점이기 때문이다. 느린 링크 하나가 전체 풀을 지연시킬 수 있고, 메모리 모듈 하나를 다운시켰을 결함이 이제 훨씬 큰 피해 범위를 갖는다.

이 타이밍이 우연이 아닌 이유

이 제안을 둘러싼 시장은 지난 1년 사이 형태가 바뀌었다. 모델이 질문에 답하던 시절에는 추론이 저렴했고 버스트도 짧았다. 에이전트가 한 번에 몇 분에서 몇 시간씩 실행되는 더 긴 작업을 맡으면서, 추론 속도는 편의 기능이 아니라 처리량 배수가 된다. 코딩 에이전트가 작업을 30분이 아니라 2분에 끝낸다면 단지 더 빠르게 느껴지는 것이 아니다. 개발자가 하루에 테스트할 수 있는 아이디어의 수를 바꾼다.

이런 변화 때문에 추론 경제성을 고민하는 투자자들이 이런 라운드에 계속 나타난다. 에이전트 워크로드가 기반 하드웨어의 속도에 따라 확장된다면, 하드웨어는 더 이상 배경 비용이 아니라 기업의 운영 속도를 결정하는 요소가 된다. 그런 세계에서 메모리 대역폭은 스펙시트의 숫자가 아니다. 기업이 얼마나 빠르게 행동할 수 있는지를 좌우하는 항목이다.

누구와 경쟁하는가

볼란티스만 추론 병목을 공략하는 것이 아니며, 대안들은 이 베팅을 어떻게 평가해야 하는지에 영향을 준다. GPU 제조사들은 새로운 메모리 유형과 패키징으로 대역폭을 계속 밀어붙이며 같은 곡선을 더 세게 짜낸다. 칩 설계 회사들은 특정 모델 형태에 맞춘 특화 가속기를 좇는다. 포토닉스 대전환은 이 모두와 경쟁하며, 곡선 위의 한 점이 아니라 곡선 자체를 움직일 때만 승리한다. 이는 높은 허들이다. 바로 그래서 이번 라운드가 눈에 띈다. 진지한 투자자들은 기존 접근법이 한계에 가깝다고 믿지 않는 한 곡선을 움직이는 쪽에 투자하는 일이 드물다.

솔직히 남는 격차

어떤 공정한 해석에도 두 가지 단서가 따라붙는다. 첫째, A-1은 아직 존재하지 않는다. 볼란티스는 2027년에 첫 통합 추론 엔진을 고객에게 인도할 계획이며, 이는 투자 라운드와 실제 출하 제품 사이에 많은 것이 잘못될 여지를 남긴다. 둘째, 수치는 회사 자체 수치이며 설계 목표로 설명된다. 제3자 벤치마크도, 시스템을 운용하는 고객도 없다.

그렇다고 해서 이 베팅이 불합리한 것은 아니다. 다만 시기상 이르다는 뜻이다. 반도체 일정은 길고, 이 자금은 제품 마케팅이 아니라 엔지니어링 인력과 첫 배포로 가는 경로에 쓰인다. 8,800만 달러는 증명이 아니라 런웨이다.

메모리 벽을 쉽게 말하면

메모리 벽은 프로세서가 연산할 수 있는 속도와, 연산 대상 데이터를 가져올 수 있는 속도 사이의 격차다. 현대 AI에서는 산술 연산이 병목인 경우가 드물다. 가중치가 도착하기를 기다리는 것이 병목이다. 그 결과, 더 빠른 칩 하나만으로는 스펙시트가 시사하는 것보다 훨씬 적은 것을 얻는다. 칩이 상당 시간 유휴 상태로 있기 때문이다. 추론 하드웨어의 모든 진지한 시도는 어떤 형태로든 이 유휴 시간을 공격한다. 볼란티스는 연산 쪽이 아니라 메모리 쪽에서 이를 공격하는데, 이는 덜 붐비는 접근법이자 더 어려운 접근법이다. 메모리-연산 경로에서 대역폭을 짜내려면 양 끝에 있는 것을 조율하는 게 아니라 경로 자체를 다시 지어야 하기 때문이다.

무엇이 이를 증명할까

지켜볼 이정표는 발표가 아니다. 달리 감당할 수 없었던 모델을, 자신이 할 수 있는 일 자체를 바꾸는 속도로 실행하는 고객이다. A-1이 출하되고 메모리 대역폭 주장이 실제 워크로드와 맞닥뜨려도 살아남는다면, 메모리 벽은 삶의 사실이기를 그치고 벤더가 붙은 해결된 문제가 된다.

그때까지 솔직한 요약은 이렇다. 볼란티스는 문제를 이해하는 사람들로부터 상당한 자금을 유치해 추론 하드웨어에서 가장 어려운 단일 제약을 공략하고 있으며, 도착한다면 대단히 중요한 시스템을 약속했다. 반도체에서는 중요한 모든 일이 대략 이렇게 시작된다. 값비싼 일들이 끝나는 방식도 대개 이렇다.

관련 글