O modelo de confiança do MCP permitiu que um agente envenenado alcançasse outro

O protocolo que se tornou a forma padrão de conectar agentes de IA tem um problema de confiança, e vale a pena entender seu formato antes do próximo incidente.
A Ars Technica noticiou em 5 de outubro que um pesquisador independente, Syed Anas Mohiuddin, demonstrou uma classe de ataque que ele chama de “protocol pivoting” (pivotagem de protocolo). A ideia é simples. Dentro de uma rede, os agentes conversam entre si por meio do Model Context Protocol, ou MCP. As barreiras de proteção são mais fracas justamente no ponto em que um agente entrega uma tarefa a outro, porque o segundo agente confia no primeiro por padrão. Plante uma instrução maliciosa em um agente de tradução ou de análise de dados que careça de validação estrita de entrada, e ele repassará a instrução adiante. O destinatário obedece, porque por que um colega de confiança mentiria.
A prova de conceito de Mohiuddin atravessou cinco organizações sem relação entre si: Google, JPMorgan Chase, Weviate, Rapid7, a diretoria interministerial digital da França e uma agência federal dos EUA. Essas organizações têm pouco em comum além do uso intenso de agentes. E é exatamente essa a questão. A fraqueza está na infraestrutura de base, não em qualquer produto isolado.
Duas CVEs e uma discrepância de pontuação
Os bugs concretos são comuns, e isso é parte do que torna a história desconfortável. O servidor MCP da Rapid7 carrega a CVE-2026-97228, que a empresa corrigiu em setembro de 2026, ainda que a falha tivesse pontuação 2,7 de 10. O problema do Google recebeu nota mais alta, 8, e afetava o googleapis/mcp-toolbox. Seu cliente HTTP não tinha uma política CheckRedirect nem validação de IP de destino, de modo que um parâmetro de caminho manipulado podia redirecionar uma requisição para um endpoint interno. O Google adicionou listas de permissão e de bloqueio de IP e fez o toolbox rejeitar URLs de base inseguras na inicialização.
A disparidade nas pontuações de severidade é uma lição por si só. Duas organizações encontraram fraquezas comparáveis no mesmo protocolo e as classificaram de formas muito diferentes, o que sugere que o setor ainda não definiu quanto deve custar uma lacuna de confiança entre agentes.
Nem todos aceitam “protocol pivoting” como uma nova categoria. Markus Vervier, pesquisador da X41 D-Sec, disse à Ars Technica que interpreta o caso como injeção indireta de prompt, a mesma técnica que equipes de segurança acompanham há dois anos. Esse enquadramento é justo, e também aguça o problema prático: o manual de defesa contra injeção de prompt pressupõe que a entrada chega de fora. Aqui, ela chega de dentro, vestindo uma credencial interna.
A lacuna é arquitetural, não um patch
Um relatório separado da fornecedora de segurança ClawSecure leva a análise uma camada mais fundo. Seus pesquisadores testaram Linear, Notion e Dropbox Dash e argumentam que a falha está na especificação do MCP, e não na implementação de qualquer fornecedor. No Notion e no Linear, encontraram servidores MCP que buscam automaticamente links controlados pelo atacante no momento em que o conteúdo é criado, sem nenhum modelo no circuito. Qualquer pessoa com acesso de escrita a um espaço de trabalho pode transformá-lo em um canal de vazamento, dispensando a necessidade de um prompt bem elaborado.
Seus números são diretos. De 20 técnicas de ofuscação, incluindo Unicode de largura zero e homoglifos, 17 sobreviveram ao percurso completo. Em 14 modelos de cinco laboratórios, nenhum bloqueou as ameaças de forma consistente; o de melhor desempenho, o Claude Opus 4.7, ainda seguiu instruções maliciosas em cerca de 26,7% das vezes.
A ClawSecure vende produtos de segurança e o relatório não foi replicado de forma independente, então trate a alegação sobre a camada de plataforma com a devida cautela. As condições subjacentes, porém, são fáceis de verificar. O MCP registra mais de 500 milhões de downloads mensais de SDK e cerca de 16.000 servidores públicos, e, segundo uma contagem, apenas 8,5% desses servidores usam OAuth. A adoção correu à frente do endurecimento.
A AWS apresentou suas próprias evidências em um boletim publicado em 2 de outubro. Três falhas em sua plataforma open-source de orquestração de agentes, a Loom, podiam permitir tomada de controle administrativa não autenticada, divulgação de credenciais OAuth2 e acesso a serviços internos. A mais grave, CVE-2026-103956, permitia que qualquer cliente de rede alcançasse o plano de controle de agentes em implantações sem provedor de identidade configurado. As versões 1.6.1 e 1.7.0 do Loom fecham essas brechas.
Por que a suposição de confiança padrão é a verdadeira descoberta
Retire as CVEs e uma escolha de design se destaca. Agentes são feitos para cooperar, então eles se autenticam mutuamente e depois agem como se uma credencial válida significasse também uma requisição válida. O zero trust clássico diz o oposto: comprove cada requisição por seus próprios méritos, mesmo vinda de dentro do perímetro.

Os ataques de Mohiuddin funcionam explorando essa inversão. A instrução maliciosa ultrapassa a fronteira de autorização entre sistemas justamente porque nunca cruza uma fronteira no código. Ela se move de agente em agente dentro de uma mesma malha de confiança, e não sobra nenhuma camada para perguntar se a requisição fazia sentido.
O que as equipes podem fazer esta semana
As correções imediatas são pouco glamourosas e já estão disponíveis. Trate qualquer instrução que chegue de um modelo de linguagem como entrada hostil, não importa qual agente a produziu. Imponha tratamento estrito de redirecionamentos e valide os IPs de destino. Exija autenticação por agente antes que um agente delegue a outro, e registre a delegação para que uma cadeia de repasses possa ser reconstruída depois.
No longo prazo, espere que os órgãos de padronização codifiquem a pivotagem de protocolo como uma classe de ameaça nomeada, o que pressionaria os fornecedores a entregar verificações de zero trust dentro do MCP, e não ao lado dele. Os auditores virão em seguida, e perguntas sobre barreiras de proteção entre agentes começarão a aparecer em revisões de conformidade como as regras de firewall apareceram uma geração atrás.
A parte desconfortável desta história é que o truque funciona melhor quando os agentes confiam uns nos outros. Toda organização que corre para conectar suas ferramentas via MCP está construindo essa malha de confiança agora mesmo, e a maior parte dela está sendo erguida sem um plano para o que acontece quando um membro da equipe se revela mentiroso.
Por que isso chegou agora
Nenhuma das técnicas subjacentes é nova. Falhas de server-side request forgery e de injeção estão na lista da OWASP há anos. O que mudou é onde elas rodam. Os agentes deram a esses bugs antigos uma nova rota de entrega, porque um agente age sem hesitar diante de uma frase em um documento, de um campo em uma linha de banco de dados ou de uma linha na saída de outro agente. A instrução não precisa ser digitada por um atacante. Basta que ela acabe em algum lugar que o modelo leia.
É por isso que a divulgação abrange um banco, um mecanismo de busca, uma fornecedora de segurança e uma diretoria de governo. Eles não compartilhavam código nem fornecedor. Compartilhavam uma arquitetura, e a arquitetura carrega a suposição de que todo participante é confiável. O MCP passou de ideia nova a infraestrutura crítica em cerca de um ano, com downloads medidos em centenas de milhões por mês, e a revisão de segurança que normalmente acompanharia esse crescimento, em grande parte, não aconteceu.
Existe uma versão desta história com final feliz. Os bugs estão sendo corrigidos, os responsáveis pelo protocolo são receptivos, e os ataques exigem acesso de escrita ou um ponto de apoio dentro da rede, o que é uma barreira significativa. Mas a correção que importa é cultural, não técnica. Equipes que adotam agentes precisam parar de tratar uma credencial interna válida como prova de que uma requisição é legítima e começar a validar cada requisição como se ela viesse de um estranho. Essa é uma mudança mais difícil de implementar do que qualquer patch, e é ela que a próxima rodada de incidentes vai testar.
Artigos relacionados
O dinheiro está migrando para a IA física: os US$ 1,45 bilhão da SiMa.ai e agentes que projetam hardware
O capital está chegando antes das evidências. As implantações ao longo do próximo ano dirão se a aposta estava certa.
Um tribunal do Arizona anulou uma sentença porque um vídeo de IA falou pela vítima
Reproduzir o que uma pessoa fez é uma coisa. Falar em nome dela é outra, e a linha entre as duas agora está registrada em um processo judicial.
OpenAI vai aplicar marca d'água ao texto do ChatGPT na UE. Seus próprios números mostram o quão frágil isso é
Um marcador que a paráfrase de rotina consegue remover pode satisfazer a letra do Artigo 50 enquanto falha na tarefa para a qual o artigo foi escrito.
Drama em quadrinhos com IA recebe o primeiro certificado de propriedade intelectual de dados: como o processo criativo se transforma em prova de defesa de direitos
Quando o custo marginal da reescrita tende a zero, o que mais falta ao criador não é criatividade, mas um registro que prove de onde a criatividade veio.