logotipo

informações sensíveis à filtragem por IA

18 de setembro de 2026

A forma mais comum pela qual um sistema de IA expõe informações sensíveis não é por meio de um ataque sofisticado: trata-se de um funcionário que faz uma pergunta legítima e recebe uma resposta que não deveria poder ver. O sistema não falhou tecnicamente. Ele simplesmente cumpriu sua função dentro das permissões que lhe foram concedidas, que eram mais amplas do que as da pessoa que fez a pergunta.

A OWASP identifica esse risco como LLM02, divulgação de informações sensíveis, entre as 10 principais aplicações de modelagem de linguagem até 2025. E é a que mais se materializa em ambientes empresariais, justamente por não exigir que ninguém aja com intenções maliciosas.

As quatro maneiras reais de filtrar

O que realmente é e o que não é.

A licença herdada. O assistente consulta o repositório de documentos usando uma conta de serviço com acesso total. Qualquer usuário que interaja com o assistente efetivamente obtém acesso a tudo o que essa conta vê. Esta é a maneira mais comum e fácil de obter acesso inadvertidamente.

O índice indiscriminado. Ao construir a base de conhecimento, uma pasta inteira é indexada "para fornecer contexto". Dentro dela, podem estar registros de folha de pagamento, um acordo de confidencialidade ou um relatório sobre uma transação em andamento. O sistema não discrimina: ele recupera tudo o que se encaixa na consulta.

A saída para o exterior. Alguém cola um rascunho de contrato ou um trecho de código proprietário em uma ferramenta pública para que ela seja aprimorada. Esse é o caminho da IA paralela, que já discutimos em [referência]. IA paralela, o risco que advém do cartão corporativo.

A inferência cumulativa. Nenhuma resposta isolada revela nada crucial, mas a combinação de várias permite reconstruir informações que não deveriam ser acessíveis: a estrutura salarial a partir de fragmentos, a margem de lucro de um cliente a partir de comparações.

O quarto tipo de vazamento é o mais difícil de controlar e o menos previsto, pois não há um momento específico em que se possa afirmar que algo vazou.

A falha de projeto que causa quase todos eles

Abordagem

Como ele se comporta

Risco

Permissões do aplicativo

O sistema tem acesso a tudo, e a interface filtra o que é exibido.

Qualquer rota alternativa ignora o filtro.

Permissões na consulta

Os documentos que podem ser obtidos são restritos dependendo de quem os solicita.

Isso mesmo, mas depende de metadados bem mantidos.

Permissões sobre os dados

O acesso é resolvido na origem, utilizando a identidade do usuário.

A única resistente a novas formas de acesso.

 

A maioria dos sistemas empresariais foi construída com permissões de aplicativos porque, durante vinte anos, o único caminho para os dados era através da tela. Um assistente de IA é um novo caminho para os mesmos dados, e esse caminho não passa pela tela.

Portanto, a regra que aplicamos é: O sistema de IA deve consultar a identidade do usuário, não a sua própria.. Se isso exigir uma reformulação do modelo de permissões, significa que o modelo de permissões já era frágil e o assistente simplesmente tornou isso visível.

O que precisa ser decidido antes de indexar qualquer coisa?

Construir uma base de conhecimento é uma decisão de segurança disfarçada de tarefa técnica. Quatro perguntas antes de começar:

  1. O que é indexado e o que não é? Uma lista explícita de fontes, não uma pasta raiz. Elimine tudo o que não agrega valor e representa um risco.
  2. Cada documento possui seu próprio nível de acesso? Se os metadados de permissão não forem acompanhados pelo conteúdo, não haverá como filtrá-lo posteriormente.
  3. Como faço para remover algo do índice? Quando um documento muda de classificação ou alguém deixa a empresa, deve haver um procedimento e um prazo definidos.
  4. O que é registrado para cada consulta? Quem perguntou o quê e quais documentos foram usados para responder? Sem essas informações, um vazamento é indetectável e impossível de investigar.

O quarto ponto é frequentemente omitido devido a preocupações com a privacidade dos funcionários. Essa é uma preocupação legítima que pode ser abordada com uma política de retenção e acesso restrito ao registro, e não com a exclusão do registro.

O caso do fornecedor: o que perguntar

Ao contratar uma ferramenta para ler documentação interna, há três perguntas que não admitem respostas vagas:

Nossos dados são usados para treinar modelos? A resposta deve estar no contrato, não em uma página de marketing, e deve abranger tanto o conteúdo quanto as dúvidas.

Como são processadas as licenças? Se a resposta for que a ferramenta se conecta com uma conta de administrador, existe um problema de projeto, não um problema de configuração.

Onde são armazenados os dados incorporados e os registros? Os vetores derivados de um documento confidencial ainda contêm informações desse documento. A OWASP dedica uma categoria específica — LLM08, vulnerabilidades em vetores e incorporações — a esse ponto.

O que fazer se já estiver implantado?

Não é necessário desligar nada. A ordem que funciona é:

  1. Verifique qual identidade o sistema utiliza para realizar a consulta. É uma verificação que leva apenas alguns minutos e costuma ser reveladora.
  2. Verifique o que está indexado. Pesquise na base de conhecimento por termos como "confidencial", "folha de pagamento", "acordo" ou os nomes de transações em andamento. Qualquer coisa que aparecer não deveria estar lá.
  3. Ativar registro de consultas. Embora o restante possa demorar mais, isso permite a detecção.
  4. Restringir antes de refinar. Restringir o escopo do índice ao que oferece valor claro e, em seguida, expandi-lo criteriosamente, é mais rápido e seguro do que tentar classificar tudo de uma vez.

A questão que revela a verdadeira exposição

Existe um teste que leva cinco minutos e organiza a conversa melhor do que qualquer auditoria formal: Peça ao assistente algo que você não deveria conseguir ver..

O salário médio de um departamento. Os termos de um contrato com um cliente que você não gerencia. O conteúdo de uma agenda de contatos. Se houver resposta, você já sabe que o modelo de permissões está no aplicativo, não nos dados, e já sabe qual é a primeira tarefa.

Se a negação estiver correta, verifique também se ela não responde à mesma pergunta formulada de maneira diferente. A consistência diante da reformulação é o que distingue o verdadeiro controle de uma mera instrução.

Perguntas frequentes

Como um sistema de IA pode vazar informações confidenciais?

Por meio de quatro vias: permissões herdadas de uma conta de serviço com acesso total, indexação indiscriminada de pastas contendo documentos confidenciais, envio de informações para ferramentas externas não autorizadas e inferência cumulativa a partir de várias respostas individualmente inócuas.

Utilize a conta do usuário, nunca sua própria conta de serviço com amplos privilégios de acesso. Se o sistema realizar consultas com permissões superiores às do usuário e a interface filtrar o conteúdo exibido, qualquer método de acesso alternativo contornará esse filtro.

Quais fontes são explicitamente incluídas e quais não são, se cada documento possui um nível de acesso associado, como o conteúdo é removido do índice quando sua classificação muda e o que é registrado em cada consulta para detectar e investigar um vazamento.

Se os dados e as consultas forem usados para treinar modelos, como as permissões de acesso são resolvidas e onde os embeddings e os logs são armazenados? Vetores derivados de um documento confidencial ainda contêm informações desse documento.

Solicite informações que a pessoa que as solicita não deveria ter acesso: detalhes de salários, termos de contratos de outras pessoas ou o conteúdo de arquivos de gestão. Se ela responder afirmativamente, o controle de acesso reside no aplicativo, não nos dados em si. Também é recomendável repetir a pergunta de forma reformulada.

Trata-se da reconstrução de informações sensíveis a partir de diversas respostas que, individualmente, não revelam nada de crítico. É difícil de controlar porque não há um momento específico e identificável em que o vazamento ocorre e, portanto, o registro de consultas é o único meio de detecção.

Você sabe o que seu assistente de IA consegue ver? Analisamos a identidade da consulta, o escopo do índice, as permissões e o registro, e informamos quais informações estão expostas atualmente. Solicitar uma avaliação →

Risco de vazamento de dados confidenciais por meio da Inteligência Artificial.
Inteligência Artificial na Europa: Regulamentação, Inovação e Estratégia Empresarial
A equipe executiva analisa dados e produtos de inteligência de negócios para unificar informações e aprimorar a tomada de decisões com Inteligência Artificial.