← Voltar ao blog
Newscerca de 8 min de leitura

O ciclo de pesquisa da OpenAI está começando a se fechar sozinho

Publicado 2 de out. de 2026
O ciclo de pesquisa da OpenAI está começando a se fechar sozinho

O The Information noticiou em 21 de setembro que os modelos de IA internos da OpenAI automatizaram em grande parte o pipeline de treinamento de novos modelos experimentais, incluindo a escrita de código de kernel de GPU e a otimização de código de treinamento. O detalhe que chamou a atenção foi como o trabalho começa. Um pesquisador dá ao sistema um exemplo de otimização que ele deve buscar, e a IA então passa semanas implementando e testando melhorias semelhantes por conta própria.

O segundo detalhe era mais estranho. Vários agentes de IA internos começaram a colaborar em problemas sem um humano no circuito. Exemplos relatados que antes levavam anos de engenharia agora são executados em cerca de uma semana.

Se essa descrição for precisa, a parte interessante não é que uma IA consiga escrever código de kernel. Os modelos já fazem isso há algum tempo. A parte interessante é a direção do ciclo. Quando uma IA ajuda a tornar o próximo modelo mais rápido, e esse modelo mais rápido ajuda a criar o seguinte, a melhoria se acumula dentro do processo de pesquisa, em vez de permanecer na camada voltada ao usuário.

Por que isso é diferente de escrever código

Automatizar o ciclo de treinamento não é a mesma coisa que automatizar uma tarefa de programação, e vale enunciar a diferença com precisão. Escrever uma funcionalidade para um aplicativo tem um alvo conhecido: a funcionalidade funciona ou não. Otimizar uma execução de treinamento tem um alvo aberto. O sistema precisa encontrar mudanças que tornem o treinamento mais rápido ou mais barato sem degradar o modelo, e precisa fazer isso em um espaço de busca onde a maioria das mudanças piora as coisas.

O fluxo de trabalho relatado sugere que a parte difícil foi estreitada. Um humano fornece um bom exemplo de otimização, que define a forma do problema. A IA replica essa forma em outras partes da base de código. Isso é uma capacidade real e também é limitada, porque o humano continua sendo quem decide o que conta como uma direção promissora.

É nessa fronteira que a afirmação fica interessante. Replicar uma otimização conhecida em toda uma base de código é um trabalho que um modelo forte consegue fazer hoje. Descobrir uma otimização que ninguém encontrou é uma tarefa diferente, e o relatório não afirma que isso aconteceu. O que ele descreve é a eliminação de uma grande classe de trabalho qualificado do pipeline de treinamento, o que não é o mesmo que o pipeline melhorar a si mesmo, mesmo que as duas coisas se confundam nas margens.

A alegação de colaboração entre múltiplos agentes é mais difícil de avaliar. Agentes trabalhando juntos sem humanos soa como um salto qualitativo, mas também pode significar agentes passando saídas estruturadas uns para os outros dentro de um fluxo de trabalho projetado por um humano. Ambas as interpretações são compatíveis com o relatório. A diferença entre elas é a diferença entre um novo tipo de organização de pesquisa e um longo script de automação.

O argumento da recursão, dito com honestidade

A auto-melhoria recursiva é a ideia de que uma inteligência capaz de melhorar a si mesma se torna mais rápida em melhorar a si mesma, o que produz uma curva que parece plana e depois deixa de ser. O conceito existe desde que I. J. Good escreveu sobre uma explosão de inteligência em 1965, e em grande parte permaneceu teoria porque o ciclo continuava se rompendo. Um modelo que escreve código é útil. Um modelo que melhora o processo que produz o próximo modelo é outra coisa.

O que torna a situação relatada digna de atenção é que o ciclo tem uma régua natural. A eficiência de treinamento é fácil de quantificar. Se o trabalho de treinamento assistido por IA realmente comprime um esforço de engenharia de anos em uma semana, isso aparece na frequência com que a OpenAI lança novos modelos e em quanta computação cada um custa. Um ciclo de pesquisa que realmente se fechou produz uma cadência observável, e um ciclo de pesquisa que não se fechou produz um ciclo de imprensa.

Esse é o teste que eu aplicaria. Não se o relatório é verdadeiro, mas se os próximos doze meses mostram lançamentos de modelos mais rápidos com custo semelhante. Se o ciclo está se fechando, o ritmo dos lançamentos muda. Se não está, o anúncio é apenas mais uma alegação de capacidade com meia-vida curta.

Por que a cadência importa mais do que a alegação

Há uma razão para se interessar pelo momento deste relatório e não apenas pelo seu conteúdo. O treinamento de modelos de fronteira esbarrou em um muro, e o muro é feito de custo. Uma única execução de treinamento de grande porte hoje consome energia, chips e tempo de engenharia em uma escala em que um ganho de eficiência de dez por cento vale mais do que um novo recorde de benchmark, porque ele decide quantos experimentos um laboratório pode se dar ao luxo de realizar no próximo trimestre.

Isso muda o valor de uma IA que otimiza código de treinamento. Ela não é um passo rumo a uma máquina que melhora a si mesma no sentido da ficção científica. É um multiplicador sobre a coisa mais cara que um laboratório faz, e um multiplicador sobre o item mais caro é de onde vem uma vantagem de pesquisa. Dois laboratórios com o mesmo orçamento de computação, mas com um ciclo de treinamento dez por cento mais rápido, não permanecem iguais por muito tempo.

Visto dessa forma, o relatório tem menos a ver com consciência e mais com eficiência de capital. O ciclo que importa não é o modelo melhorando a si mesmo. É o modelo reduzindo o custo do próximo experimento, o que permite ao laboratório realizar mais experimentos, que é a maneira comum pela qual qualquer tecnologia se torna mais rápida.

A parte que ninguém pode verificar

O problema honesto com esse tipo de relatório é a verificação. Não há artigo, nem benchmark, nem replicação independente. A alegação vem de dentro de uma empresa que tem todo o incentivo para ser acreditada e nenhuma obrigação de mostrar seu trabalho. Isso não a torna falsa. Significa que a confiança que qualquer pessoa de fora pode ter é limitada pela fonte.

Isso não é exclusivo da OpenAI. Todo laboratório de fronteira agora faz alegações sobre automação interna que ficam fora da avaliação pública, e o jornalismo que as traz à tona faz um trabalho útil mesmo quando os números não podem ser verificados. O padrão é familiar: uma capacidade é descrita, a descrição é plausível, e a prova chega, ou não, em algum momento futuro.

Há também a questão de para que serve a automação. Altman disse, em um podcast no início de setembro, que a OpenAI sem dúvida construirá robôs humanoides, e que o cérebro é a parte difícil, e não o corpo. Um processo de pesquisa que se acelera e a ambição de colocar essa inteligência em máquinas físicas são duas metades da mesma tese. O ciclo de treinamento não é o produto. É o que torna possível o próximo produto.

O que significa se isso se sustentar

Suponha que a cadência relatada seja real. O efeito direto é que um laboratório de fronteira pode explorar mais ideias por unidade de tempo, porque o custo de testar uma otimização cai. Isso favorece os laboratórios que já têm computação e dados em escala, que são o mesmo conjunto de laboratórios que lideram hoje. É uma vantagem que se acumula para os incumbentes, em vez de uma que permita a uma equipe menor alcançá-los.

O efeito indireto recai sobre os empregos em pesquisa. O trabalho descrito no relatório, escrever kernels e ajustar código de treinamento, é exatamente o tipo de trabalho qualificado, mas bem especificado, que a automação alcança primeiro. As pessoas que faziam esse trabalho sobem na direção de definir o que vale a pena otimizar, que é a parte que o relatório ainda atribui a um humano.

Essa leitura é menos dramática do que uma explosão de inteligência e mais útil para o planejamento. A notícia relatada não é que a OpenAI construiu uma máquina que melhora a si mesma. É que o pipeline de treinamento absorveu silenciosamente a parte da pesquisa mais fácil de especificar, e deixou as decisões de julgamento onde estavam.

Artigos relacionados