No. 004Governança8 min de leitura

Reproduza o Que Seu Agente Respondeu: Trilhas de Auditoria de IA Que Resistem

Apenas 17% das organizações conseguem reconstruir o que seus agentes fizeram. A partir de 2 de agosto de 2026, o EU AI Act exige que o registro exista. A reprodução é o que o sustenta.

Em algum lugar da sua stack, um agente já produziu o número que um dia estará diante de um auditor. Ele calculou o valor — ou o gerou; você pode não saber qual — alguém colou em uma apresentação, e a apresentação foi enviada. Meses depois chega a pergunta que todo sistema de IA em produção eventualmente recebe: de onde veio esse número, e chegaríamos ao mesmo resultado hoje?

A maioria das equipes responde com uma transcrição. Em uma pesquisa do primeiro trimestre de 2026 com 420 organizações que executam agentes de IA em produção, apenas 17% conseguiram reconstruir a sequência completa de chamadas de ferramentas, entradas e saídas por trás de uma tarefa específica do agente após o fato (AgentNode, 2026). Os outros 83% tinham logs parciais, nenhum log, ou logs que capturavam o raciocínio do modelo mas não o que ele realmente invocou. Uma transcrição e uma impressão.

17% full tool-call sequence reconstructable 83% partial logs · no logs · reasoning without invocations 0 25 50 75 100%
Organizações capazes de reconstruir uma tarefa completa de agente — cada chamada de ferramenta, entrada, saída — após o fato. n = 420 · AgentNode, T1 2026.

O registro está se tornando lei

Por um tempo, isso foi uma vergonha de engenharia. Em breve será uma vergonha jurídica.

O EU AI Act exige que sistemas de IA de alto risco permitam tecnicamente — projetado desde o início, não adicionado depois — "o registro automático de eventos (logs) ao longo da vida útil do sistema" (European Commission, 2024). O registro manual não satisfaz o Artigo 12. Os logs devem ser suficientemente bons para identificar situações que possam apresentar risco ou modificação substancial, para apoiar o monitoramento pós-mercado e para monitorar como o sistema realmente opera. Para identificação biométrica remota, o artigo nomeia o mínimo diretamente: cada período de uso, o banco de dados de referência consultado, os dados de entrada que levaram a uma correspondência, as pessoas físicas que verificaram o resultado. Isso não é "mantenha alguns logs." É reconstrua a decisão.

As datas estão próximas. O Ato entrou em vigor em 1º de agosto de 2024; as proibições se aplicaram a partir de fevereiro de 2025, as obrigações de modelos de uso geral a partir de agosto de 2025 — e as obrigações de alto risco, o Artigo 12 entre elas, se aplicam a partir de 2 de agosto de 2026 (Future of Life Institute, 2026). Oito dias a partir da data desta publicação. Sistemas de alto risco incorporados em produtos regulamentados (Anexo I) seguem em agosto de 2027.

Aug 2024 · in force Feb 2025 · prohibitions Aug 2025 · GPAI rules Aug 2026 · high-risk logging (Art. 12) Aug 2027 · Annex I products today · 25 Jul 2026 · 8 days out
Datas de aplicação sob o Regulamento (UE) 2024/1689 — o registro de alto risco do Anexo III é obrigatório a partir de 2 ago 2026. Fonte: artificialintelligenceact.eu.

A retenção também tem um piso. Os fornecedores devem manter os logs gerados automaticamente por pelo menos seis meses, e o Artigo 26(6) impõe o dever espelhado aos implantadores — por mais tempo quando outra lei, como o GDPR, exigir, e em todo caso adequado à finalidade pretendida do sistema, não apenas ao mínimo (artificialintelligenceact.eu, 2024).

Nada disso chega no vácuo. O Artigo 30 do GDPR exige registros escritos de tratamento — finalidades, categorias de dados, destinatários, prazos de eliminação, medidas de segurança — desde 2018, apresentáveis à autoridade supervisora mediante solicitação (gdpr-info.eu, 2016). O CC7.2 do SOC 2 exige que você monitore componentes do sistema em busca de anomalias e analise o que encontrar; o CC7.3 exige que você avalie se um evento comprometeu seus objetivos (AICPA, 2022). Em uma auditoria Tipo II, esses critérios são testados contra evidências de log abrangendo todo o período de revisão — tipicamente doze meses (AgentNode, 2026) — não uma captura de tela do dia em que o auditor visitou.

Por que "registrar mais" falha

O reflexo é a verbosidade: ativar o rastreamento, armazenar tudo, comprar um painel. Três problemas sobrevivem a isso.

Transcrições registram o que foi dito, não o que executou. Um log de chat é o modelo narrando seu próprio comportamento. Entre os 83% acima, um grupo é exatamente esse: raciocínio capturado, invocações de ferramentas não. Quando a narração e a execução divergem, a transcrição mantém a compostura — calculado e gerado leem de forma idêntica na página. Não são a mesma coisa.

Um log que você não pode re-executar é testemunho, não evidência. Mesmo equipes que capturam cada chamada de ferramenta geralmente não conseguem executá-la novamente e comparar, porque nada fixou o mundo em que ela rodou. O SQL foi gerado naquele dia, contra um banco de dados que desde então mudou; a aritmética foi amostrada de um modelo que nunca foi estável para começar. Reter isso por seis meses — ou doze — significa armazenar afirmações por mais tempo, não torná-las verificáveis. A redação do Artigo 12 é precisa: o sistema deve tecnicamente permitir o registro. Reprodutibilidade que não foi projetada desde o início não pode ser adicionada retroativamente por uma biblioteca de logging.

Metadados não são correção. O registro de auditoria mínimo viável — seis campos essenciais, entre eles ID de rastreamento, timestamp e identidade do agente (AgentNode, 2026) — estabelece quem e quando. Não diz nada sobre se o número estava correto, ou se chegaria ao mesmo resultado hoje. A pesquisa sobre observabilidade de agentes LLM chega ao mesmo lugar: a rastreabilidade deve cobrir os artefatos de todo o ciclo de vida do agente, não apenas as mensagens (CSIRO Data61, 2024).

A falha é estrutural. A execução de forma livre — um modelo emitindo strings que outra coisa executa — não produz nada estável o suficiente para registrar, independentemente de quanto você escreva.

Proveniência como parte do resultado

A resposta do SQAI é tornar o registro uma propriedade da execução, e não uma funcionalidade do logging. Cada resultado executado carrega quatro hashes, cada um respondendo a uma pergunta de auditoria distinta:

  • contract_hash — o que poderia executar: o contrato de capacidade exato em vigor (sha256:79f1c5a6c716…).
  • plan_hash — para o que a solicitação foi resolvida: o plano validado, com sua resolução registrada (decision_path: "exact_spec").
  • invocation_hash — o que executou, sobre o quê: a capacidade mais as entradas canonicalizadas, incluindo um input_hash dos dados como estavam.
  • computation_hash — o que resultou: vinculado à invocação e ao valor juntos.

As construções são separadas por domínio, de modo que nenhum artefato pode se passar por outro:

invocation_hash  = sha256("sqai:invocation:v1\0" + canonicalJson(identity))
computation_hash = sha256("sqai:computation:v1\0" + invocation_hash + canonicalJson(value))

Junto com os hashes vem o envelope de determinismo — o ambiente de execução registrado: runtime_bundle_version 0.1.0 e seu sha256, plataforma e arquitetura, precision_mode: float64, thread_count: 1, e a semente onde uma é necessária. As dez capacidades de simulação que precisam de uma recusam-se a executar sem ela — seed_required, não uma resposta silenciosamente diferente. Tudo que poderia alterar o número está fixado ou registrado.

contract_hash plan_hash invocation_hash computation_hash what could run what it resolved to what ran, on what what came out sha256:79f1c5a6c716… decision_path: exact_spec includes input_hash bound to invocation + value envelope: runtime_bundle 0.1.0 · sha256-pinned · platform · arch · float64 · thread_count 1 · seed?
Quatro hashes separados por domínio acompanham cada resultado executado; o envelope registra o ambiente que o produziu.

Eis o que isso oferece, concretamente. Em março, um agente calcula um valor presente líquido:

finance.npv(0.1, [-1000, 300, 420, 560, 680])
→ 505.020148896933
computation_hash b74f67d0d7a594aa…

Em julho, o auditor pergunta. Você reproduz a invocação — mesma especificação tipada, mesmo runtime fixado — e compara os hashes: b74f67d0d7a594aa… novamente, byte a byte idêntico. Não importa se a reprodução roda em TypeScript ou Python. canonicalJson e canonical_json são um contrato de serialização entre linguagens — chaves ordenadas, -0 normalizado para 0, escape unicode fixo — de modo que o mesmo valor produz os mesmos bytes e o mesmo hash em ambos. A página de determinismo mostra dois desses envelopes, com meses de diferença, lado a lado.

E quando a reprodução não corresponde, isso é sinal. Uma fonte alterada falha explicitamente com schema_revision_mismatch — o motor recusa-se a calcular silenciosamente um número diferente contra dados diferentes e deixar que você o atribua ao passado. A divergência nomeia o que mudou.

Mapeie isso de volta às obrigações. Registro automático ao longo da vida útil do sistema: cada resultado executado se registra por construção — não há caminho não registrado, porque a superfície de execução são 4.574 capacidades somente leitura com entradas tipadas, não strings de forma livre. Seis ou doze meses de retenção: armazene os envelopes de resultado; a retenção torna-se uma decisão de armazenamento em vez de arqueologia. Evidências abrangendo um período de revisão SOC 2: os artefatos são a evidência — a resposta ao auditor é uma reprodução, não uma investigação. O mesmo pipeline produz o registro para cada capacidade, e a trilha de auditoria persistente é fornecida com o nível Pro do SQAI.

Oito dias, depois cada auditoria seguinte

A data de agosto vincula formalmente os sistemas de alto risco na UE. Mas prazos como este definem o modelo para cada revisão que se segue — o auditor do SOC 2, o questionário de aquisição, seu próprio CFO em março perguntando sobre um número de janeiro. Os agentes serão solicitados a justificar suas respostas da forma como os funcionários são: com registros. A maioria das stacks não consegue produzi-los, porque SQL gerado e aritmética amostrada não deixam nada estável o suficiente para registrar — um problema que começa muito antes da auditoria.

Uma resposta que você pode reproduzir é uma resposta que você pode defender. Todo o resto é uma captura de tela.