← Voltar ao blog
Aicerca de 7 min de leitura

Uma parede de memória fotônica é a aposta de US$ 88 milhões que a Volantis acaba de fazer

Publicado 4 de out. de 2026
Uma parede de memória fotônica é a aposta de US$ 88 milhões que a Volantis acaba de fazer

A proposta da Volantis é fácil de enunciar e difícil de acreditar: construir um sistema de inferência que faça a parede de memória desaparecer.

A empresa de semicondutores de São Francisco fechou uma Série A de US$ 88 milhões em 1º de outubro, co-liderada por Lachy Groom e Abstract Ventures, com a participação de John Doerr, VXI Capital, Triatomic e Susa Ventures. A lista de anjos parece um quem é quem da conversa sobre custo de inferência, incluindo Dwarkesh Patel, Naveen Rao e Sholto Douglas. A equipe fundadora vem da NVIDIA, AMD, Broadcom e Ayar Labs, com trabalhos anteriores no primeiro produto CoWoS, em VCSELs sintonizáveis de alto volume e em óptica co-empacotada de primeira geração.

O trade-off com que todo mundo aprendeu a conviver

Executar um modelo grande com rapidez exige duas coisas que o hardware não tem conseguido oferecer em conjunto. É preciso uma capacidade enorme para armazenar os pesos e uma largura de banda enorme para alimentá-los continuamente no motor de computação. Toda arquitetura em produção hoje escolhe um lado.

A SRAM no chip oferece largura de banda sem capacidade, o que limita o tamanho do modelo e as janelas de contexto, ao mesmo tempo que aumenta o custo e o consumo de energia por token. A HBM e a memória de GPU oferecem capacidade sem largura de banda suficiente para servir os maiores modelos em alta velocidade. Até abordagens mais recentes, como a DRAM 3D, permanecem na mesma curva, apenas mais adiante nela.

A Volantis afirma que seu primeiro sistema, o A-1, foi projetado para elevar capacidade e largura de banda juntas em quase duas ordens de magnitude. Isso permitiria executar modelos com mais de 20 trilhões de parâmetros a até 10.000 tokens por segundo por usuário. Essas são metas de projeto, anunciadas pela empresa, sem verificação independente. Trate-as como uma declaração de intenções, não como um benchmark.

A razão pela qual esse trade-off persiste por tanto tempo é a física. A largura de banda é limitada pela quantidade de dados que consegue cruzar a fronteira entre memória e computação, e é justamente nessa fronteira que se concentra a maior parte da energia consumida por um modelo grande. Mover pesos da memória para as unidades aritméticas custa muito mais energia do que a própria aritmética. Qualquer arquitetura que aumente a largura de banda sem também aumentar esse custo vence duas vezes.

Um conector de fibra óptica brilhando em seu núcleo contra metal escovado escuro

Fotônica, apontada para um problema mais difícil

A fotônica já movimenta dados dentro dos data centers. O que existe hoje é, em sua maioria, chip a chip. Conectar computação à memória é um problema diferente, porque exige que mais de cem vezes o volume de dados percorra distâncias muito mais curtas. Energia e custo se comportam de maneira diferente nessa escala.

A Volantis construiu sua plataforma especificamente para esse ambiente. Em vez de lasers externos, ela usa micro-VCSELs personalizados, apoiando-se na cadeia de suprimentos existente de VCSELs de arseneto de gálio e contornando as restrições do fosfeto de índio que têm criado gargalos em outros projetos ópticos. A empresa afirma que os enlaces resultantes consomem menos de um picojoule por bit.

A malha óptica agrega muitos chips de memória em um único recurso lógico, de modo que adicionar memória acrescenta largura de banda, e não apenas capacidade. Esse é o truque. É também a parte que vai decidir se tudo isso funciona, porque agrupar memória por meio de uma interconexão óptica é onde latência e tolerância a falhas se tornam genuinamente difíceis. Um único enlace lento pode travar um conjunto inteiro, e uma falha que derrubaria um único módulo de memória agora tem um raio de impacto muito maior.

Por que o timing não é acidente

O mercado para essa proposta mudou de forma no último ano. Quando os modelos respondiam a perguntas, a inferência era barata e as rajadas eram curtas. À medida que os agentes assumem tarefas mais longas, rodando por minutos ou horas a fio, a velocidade de inferência deixa de ser uma conveniência e se torna um multiplicador de throughput. Um agente de programação que conclui uma tarefa em dois minutos em vez de trinta não apenas parece mais rápido. Ele muda quantas ideias um desenvolvedor consegue testar em um dia.

Essa mudança é a razão pela qual investidores que pensam na economia da inferência continuam aparecendo em rodadas como esta. Se as cargas de trabalho de agentes escalam conforme a velocidade do hardware subjacente, então o hardware deixa de ser um custo de fundo e passa a ser aquilo que define a velocidade operacional de uma empresa. A largura de banda de memória, nesse mundo, não é um número de ficha técnica. É um item na conta de quão rápido um negócio consegue agir.

Com quem isso compete

A Volantis não está sozinha no ataque ao gargalo da inferência, e as alternativas moldam como a aposta deve ser avaliada. Os fabricantes de GPU continuam empurrando a largura de banda com novos tipos de memória e novas formas de empacotamento, apertando a mesma curva com mais força. As casas de projeto de chips buscam aceleradores especializados, ajustados para formatos específicos de modelo. Uma reformulação fotônica compete com todas elas, e só vence se mover a curva em vez do ponto sobre ela. Essa é uma barra alta, e é exatamente por isso que a rodada é notável: investidores sérios raramente financiam quem move curvas, a menos que acreditem que a abordagem incumbente está perto de seu limite.

A lacuna honesta

Duas ressalvas cabem em qualquer leitura justa. A primeira é que o A-1 ainda não existe. A Volantis planeja entregar seus primeiros motores de inferência integrados a clientes em 2027, o que deixa espaço para muita coisa dar errado entre uma rodada de financiamento e um produto disponível comercialmente. A segunda é que os números são da própria empresa, descritos como objetivos de projeto. Não há benchmark de terceiros nem cliente executando o sistema.

Isso não torna a aposta irracional. Torna-a precoce. Os prazos no setor de semicondutores são longos, e o dinheiro está sendo gasto em contratação de engenheiros e no caminho até as primeiras implantações, não em marketing de um produto. Os US$ 88 milhões são um fôlego financeiro, não uma prova.

A parede de memória em termos simples

A parede de memória é a diferença entre a velocidade com que um processador consegue calcular e a velocidade com que consegue buscar os dados sobre os quais calcula. Na IA moderna, a aritmética raramente é o gargalo. Esperar os pesos chegarem é. A consequência é que um chip mais rápido, por si só, entrega muito menos do que a ficha técnica sugere, porque o chip passa boa parte do tempo ocioso. Todo esforço sério em hardware de inferência é, de alguma forma, um ataque a esse tempo ocioso. A Volantis está atacando pelo lado da memória, e não pelo lado da computação, que é a abordagem menos concorrida e a mais difícil, porque extrair largura de banda do caminho memória-computação significa reconstruir o próprio caminho, em vez de ajustar o que está em cada extremidade.

O que provaria isso

O marco a observar não é um anúncio. É um cliente executando um modelo que de outra forma não caberia, a uma velocidade que muda o que ele consegue fazer. Se o A-1 for entregue e a promessa de largura de banda de memória sobreviver ao contato com uma carga de trabalho real, a parede de memória deixa de ser um fato da vida e se torna um problema resolvido com um fornecedor associado.

Até lá, o resumo honesto é que a Volantis levantou dinheiro sério com pessoas que entendem do problema, para atacar a restrição mais difícil do hardware de inferência, e prometeu um sistema que faria muita diferença se chegasse. Em semicondutores, é mais ou menos assim que toda coisa importante começa. Também é assim que muitas coisas caras terminam.

Artigos relacionados