Huawei Cloud reconstruiu sua stack em torno de agentes e depois definiu uma data para as cobranças

A Huawei Cloud usou sua conferência anual Connect, em setembro, para afirmar que seu portfólio de IA empresarial está agora totalmente disponível no mercado e que o centro de design desse portfólio são os agentes. O CEO da Huawei Cloud, Zhou Yuefeng, enquadrou a mudança como a construção de uma "Agentic Cloud" para uma era de agentes de indústria, e os anúncios que a acompanharam eram, em sua maioria, sobre infraestrutura de base.
Quatro componentes de infraestrutura, para ser preciso. A Huawei Cloud descreveu seu novo paradigma de infraestrutura como tokens eficientes, memória aprimorada, agendamento integrado de cargas de trabalho gerais e de IA, e autonomia segura. A empresa afirmou que a plataforma resultante já atende mais de 3.500 clientes em todo o mundo. A frase soa como marketing até você olhar para o que cada peça visa, porque cada uma responde a uma falha que os agentes encontram em produção e os chatbots não.
Tokens, memória e a recuperação em dez minutos
A camada de computação é o serviço de cluster Lingqu Ascend 950. A Huawei Cloud diz que ele usa um mecanismo de recuperação rápida de cinco níveis com observabilidade de link completo, que trabalhos de treinamento nele já rodaram por 40 dias sem interrupção e que uma falha é recuperada em até dez minutos. A empresa afirma que a taxa de transferência de tokens é 20% superior à da geração anterior. O serviço entrou em operação comercial na China em 30 de setembro, com lançamento no exterior marcado para 30 de novembro.

Uma meta de recuperação em dez minutos é uma especificação diferente de uma pontuação de benchmark. Execuções longas de treinamento falham, e o custo de uma falha é medido em horas de GPU perdidas e sobrecarga de reinicialização, então o tempo de recuperação é o número com que a equipe financeira de um cliente realmente se importa.
A camada de memória é voltada para um modo de falha específico de agentes de longa duração. A Huawei Cloud chama o produto de armazenamento de memória CMS e o descreve como algo que fornece espaço de memória em escala de petabytes, aproximadamente o dobro da capacidade de ofertas comparáveis, com velocidades de leitura em nível de terabytes para acesso de alta velocidade e uma melhoria de desempenho de 50%. O argumento é que um agente trabalhando em uma tarefa longa precisa de algum lugar para manter o que aprendeu que não seja a janela de contexto, porque uma janela de contexto que cresce sem limites é cara e não confiável.
Depois há a camada de acesso a modelos. O AgenticMaaS é descrito como algo que permite aos desenvolvedores chamar modelos mainstream de ponta com um clique e sem trabalho de implantação. A MiniMax demonstrou um modelo multimodal rodando na plataforma no mesmo evento, o que é um lembrete de que, na China, os fornecedores de modelos e os provedores de nuvem frequentemente vendem para o mesmo comprador empresarial.
Comercial e open source, vendidos juntos
A camada de aplicação é onde a abordagem da Huawei Cloud difere de uma jogada de infraestrutura pura. Ela segue uma estratégia dupla: a plataforma comercial ZhiGuo AgentArts e sua contraparte open source chamada openJiuwen. Entre elas, a empresa diz ter publicado mais de 5.000 ativos gerais e mais de 1.000 ativos do setor, significando habilidades, templates e conectores reutilizáveis, em vez de modelos brutos.
A plataforma está em uso em mais de cem órgãos governamentais, bancos, instituições de pesquisa e empresas, incluindo o governo do distrito de Longgang, em Shenzhen, o Postal Savings Bank of China, a China Southern Power Grid e a Kingsoft Office. A Kingsoft construiu agentes focados em escritório na plataforma combinando seu centro de documentos WPS 365 com seu assistente Comate, que é o tipo de integração que um fornecedor de nuvem não consegue construir sozinho e um fornecedor de aplicativos não consegue hospedar sozinho.
O ZhiGuo AgentArts está programado para lançamento comercial em mercados internacionais em 30 de dezembro. A comunidade open source em torno do openJiuwen relata mais de 50.000 estrelas e 3,29 milhões de downloads. Lançar tanto uma plataforma comercial quanto uma versão aberta é uma forma de semear a base de desenvolvedores com pessoas que eventualmente precisarão do nível pago, e é um padrão que vários fornecedores chineses agora seguem.
O outro argumento para on-premises
A Huawei Cloud não é a única empresa vendendo infraestrutura para agentes na China, e um conjunto mais discreto de eventos em setembro mostra o resto do mercado. A Mitac, trabalhando com a AMD, realizou seminários de implantação em Wuxi e Guiyang para um dispositivo de agente empresarial chamado Agent Builder, construído em torno dos processadores Ryzen AI Max da AMD e comercializado com base na soberania de dados. O argumento ali é o oposto de uma nuvem pública: manter o modelo, a computação, a base de conhecimento e os sistemas de negócios dentro da empresa, e executar o agente em uma caixa no escritório.
Ambas as abordagens respondem à mesma objeção de compra. As empresas querem agentes que toquem processos de negócios reais, e processos de negócios reais contêm dados que elas não se sentem confortáveis em colocar atrás do endpoint de outra pessoa.
Os quatro números que um comprador já acompanha
Os quatro pilares de infraestrutura correspondem a quatro custos. Tokens são o preço de cada inferência, e é por isso que o anúncio lidera com taxa de transferência em vez de uma pontuação de benchmark. Memória é o que uma tarefa de longa duração custa quando a janela de contexto deixa de ser suficiente. Agendamento é a penalidade de utilização de executar cargas de trabalho gerais e de IA em hardware compartilhado. Segurança é o que um departamento de conformidade pergunta antes que qualquer coisa toque dados de produção.
A alegação da Huawei Cloud é que ela abordou todos os quatro em uma única stack, e que pode fazê-lo porque possui o silício. Essa é uma promessa mais difícil de um concorrente igualar, e mais fácil de um cliente verificar, porque o resultado aparece em três lugares que uma equipe de compras já mede: custo por milhão de tokens, a taxa de execuções longas com falha e a parcela do tempo de GPU que realmente está fazendo trabalho.
Por que a infraestrutura é a história, e não os modelos
A afirmação interessante que surge da discussão chinesa sobre agentes deste ano é que a capacidade dos modelos convergiu, e que o valor se deslocou para o que os cerca. Um professor de prática da Shanghai Advanced Institute of Finance fez a versão econômica do argumento em um fórum em Xangai em setembro: diferentemente das plataformas de internet, onde o custo marginal se aproxima de zero e os efeitos de rede são fortes, um grande modelo consome recursos a cada inferência, e um usuário pode trocar de modelo em minutos. Um fosso construído apenas sobre o modelo é fino.
Se essa leitura estiver correta, a camada defensável é aquela que é cara de mover, e isso significa tokens, memória, agendamento e segurança, em vez de pesos.
A vantagem da Huawei nesse enquadramento é vertical. Ela possui o chip, a interconexão, a nuvem e a plataforma de modelos, e é por isso que o anúncio do Ascend 950 lidera com tempo de recuperação e taxa de transferência de tokens, em vez de uma posição em ranking. Concorrentes sem um negócio de chips estão vendendo uma história de integração, e histórias de integração são mais fáceis de copiar.
O contra-argumento é que estar integrado também o torna um ponto único de falha, e que as empresas querem cada vez mais uma camada de agentes portátil, em vez de uma moldada pelo fornecedor. Essa tensão é o que os próximos dois trimestres vão testar, começando pela data comercial de 30 de setembro na China e pelo lançamento no exterior no final de novembro. O prazo internacional importa mais que o doméstico, porque uma stack construída em torno de silício nacional precisa provar que pode atender um cliente cujos dados não podem sair de sua própria jurisdição.
Artigos relacionados
Xiaomi lançou um modelo omnimodal que iguala a fronteira, além da receita de treino
Os pesos permitem executar um modelo. Os ambientes permitem retreiná-lo.
Cadence colocou agentes dentro do design de chips e reduziu um ciclo de verificação de cinco semanas para um dia
Os agentes, portanto, chamam mais os mecanismos subjacentes, não menos.
O Roblox Build Publicou 9.000 Jogos em Seis Semanas. O Número Interessante É 71
Leia isso como um número de recrutamento, e não de qualidade.
Dois agentes entraram em produção em setembro. Eis o que eles tinham em comum
Os agentes que sobreviveram ao contato com a produção em setembro foram os que se encaixaram em um processo existente.