VOLTAR AO BLOG

Como modelos de IA podem escapar de seus limites e abrir portas para ataques

COMPARTILHE
XFACEBOOKWHATSAPPLINKEDIN

Modelos de inteligência artificial não “invadem sistemas” por vontade própria. O risco surge quando são conectados a ferramentas, arquivos, bancos de dados, APIs e ambientes capazes de executar ações. Nessa configuração, uma falha no modelo, no software ao redor ou nas permissões concedidas pode transformar uma resposta aparentemente inofensiva em acesso a informações e operações que deveriam estar protegidas.

A própria IA também passou a ser usada na descoberta e na exploração de vulnerabilidades. Um levantamento atribuído ao Grupo de Inteligência de Ameaças do Google (GTIG), citado pelo Google Discovery, aponta que as divulgações mensais de falhas de software passaram de 5.045 em janeiro para 10.740 em agosto de 2026. O aumento não significa, sozinho, que os ataques tenham dobrado: parte dele está associada à forma como projetos de código aberto catalogam vulnerabilidades. Ainda assim, preocupa a velocidade entre a divulgação de uma falha e sua exploração.

A “fuga” começa no contexto

Um modelo de linguagem recebe instruções e contexto para produzir uma saída. Se esse contexto inclui documentos internos, mensagens de usuários ou resultados de sistemas externos, o modelo pode ser induzido a tratar conteúdo não confiável como uma ordem legítima.

É o que ocorre em ataques conhecidos como prompt injection. Um texto escondido em uma página, arquivo ou e-mail pode tentar convencer o agente a ignorar suas regras, revelar dados ou executar uma ação. O modelo não precisa quebrar criptografia nem encontrar uma senha: basta interpretar uma instrução maliciosa como prioritária, sobretudo quando o sistema foi projetado para agir automaticamente.

A fuga também pode ocorrer no sentido oposto: informações que deveriam permanecer em um ambiente são incluídas indevidamente na resposta, em logs, relatórios ou chamadas a serviços externos. Por isso, não basta proteger apenas o modelo. É necessário controlar o que ele pode ler, fazer e como suas saídas são utilizadas.

Quando a IA ganha mãos

Um chatbot que apenas responde a perguntas tem uma superfície de risco diferente de um agente que acessa o calendário, consulta um sistema corporativo, altera registros ou executa código. Quanto maior a autonomia, mais importante é separar tarefas e limitar permissões.

A implantação comercial desses sistemas já alcança situações cotidianas. Uma reportagem da Janela Publicitária descreveu um projeto piloto de anúncios no ChatGPT envolvendo o Grupo Bradesco Seguros, a OpenAI e a AlmapBBDO. Segundo a matéria, os anúncios seriam identificados como patrocinados, exibidos em áreas separadas e não alterariam as respostas geradas. O texto também afirma que os dados das conversas não seriam compartilhados com anunciantes.

O caso não é evidência de invasão, mas mostra por que as fronteiras importam. Quando uma aplicação reúne conversa, publicidade, ferramentas e dados de uso, o usuário precisa saber o que influencia a resposta, quais informações são armazenadas e que partes do sistema têm acesso a elas. Separar conteúdo patrocinado de resposta automatizada é uma salvaguarda de produto; não substitui controles técnicos, auditoria e transparência.

A IA acelera a corrida das vulnerabilidades

De acordo com o material citado pelo Google Discovery, entre janeiro e agosto de 2026 invasores exploraram 141 vulnerabilidades recém-divulgadas, contra 127 durante todo o ano de 2025. O levantamento destaca que criminosos podem usar modelos para comparar versões de software, analisar mudanças introduzidas por uma correção e acelerar a transformação de uma vulnerabilidade conhecida em ataque funcional.

Isso é especialmente relevante para as chamadas n-days: falhas já públicas e, em muitos casos, com atualização disponível. O problema é reduzir o intervalo até a exploração. Um exemplo mencionado na reportagem é a CVE-2026-1731, cuja exploração teria começado quatro dias após a divulgação.

A automação também muda o perfil da descoberta. O GTIG afirma que, entre vulnerabilidades provavelmente identificadas por agentes de IA, 58% estavam na faixa moderada de risco e cerca de metade permitia execução remota de código. Nas demais divulgações, a execução remota aparecia em 26% dos casos. Esses números não provam que todo agente de IA seja um invasor autônomo, mas indicam uma seleção mais eficiente de falhas capazes de oferecer acesso direto a sistemas.

A infraestrutura de IA também é alvo

O chamado efeito de espelho é importante: a IA ajuda a encontrar falhas, mas seus próprios componentes também precisam ser protegidos. O levantamento citado identificou 2.076 vulnerabilidades em softwares relacionados à inteligência artificial desde o início de 2025, mais de 1.500 delas divulgadas em 2026. Frameworks usados para orquestrar aplicações, como Flowise e Langflow, representariam aproximadamente metade do conjunto mencionado.

Esses componentes podem controlar conexões com modelos, bancos de dados, ferramentas e fluxos de trabalho. Uma falha neles pode permitir que um atacante altere instruções, roube credenciais, acesse documentos ou faça o agente operar fora do objetivo original. Dispositivos de borda e equipamentos de segurança também merecem atenção: o GTIG atribui a eles cerca de 14% das vulnerabilidades exploradas em 2026.

O que isso significa para pessoas e empresas

Para o usuário, o risco mais concreto é a exposição de dados pessoais, credenciais, documentos ou conversas. Para negócios, uma invasão pode interromper operações, comprometer informações de clientes, gerar custos de resposta e afetar a confiança na marca. O perigo aumenta quando funcionários conectam ferramentas de IA a ambientes corporativos sem compreender os limites de retenção, acesso e execução.

A resposta não deve ser corrigir tudo indiscriminadamente. O material atribuído ao GTIG recomenda priorizar falhas com maior probabilidade de exploração, combinando atualizações com inteligência de ameaças. Também são relevantes permissões mínimas, autenticação forte, isolamento entre ambientes, revisão humana para ações sensíveis, registros de auditoria e testes específicos contra injeção de comandos.

Fornecedores precisam revisar código e configurações antes do lançamento, monitorar comportamentos anômalos e explicar claramente o que seus agentes podem fazer. A tendência é uma disputa de velocidade: atacantes usando IA para explorar falhas e defensores empregando sistemas semelhantes para encontrar, classificar e corrigir problemas. O limite decisivo continuará sendo humano e organizacional: nenhuma automação deve receber mais acesso do que o necessário para cumprir sua tarefa.

Fontes