Pular para o conteúdo

Níveis de sensibilidade do Guardrail

Com o Guardrail ativo, a aba Segurança mostra três níveis de rigor. Todos usam o mesmo classificador — o que muda é o quão agressivamente ele interpreta uma mensagem ambígua.

Bloqueia qualquer indício de manipulação, mesmo parafraseado ou indireto. É o comportamento original do Guardrail, mantido como padrão para não afrouxar silenciosamente a proteção de agentes que já estavam configurados antes dos níveis existirem.

Use quando o agente lida com informação sensível no próprio prompt (regras de negócio internas, por exemplo) e falsos positivos ocasionais são um custo aceitável.

Não bloqueia o uso legítimo de ferramentas/funcionalidades já disponíveis para o agente (por exemplo, um pedido para “verificar minha agenda” ou “enviar um e-mail de confirmação”) nem perguntas diretas sobre o produto/serviço. Só bloqueia quando a intenção de manipular o próprio agente/sistema é clara — em caso de dúvida, deixa passar.

Ponto de partida recomendado para a maioria dos agentes: reduz falsos positivos do nível Rigoroso sem abrir mão da proteção contra tentativas óbvias.

Só bloqueia tentativas inequívocas e diretas — nunca uma suspeita ou possibilidade remota. Qualquer caso ambíguo, indireto ou que possa ser uma pergunta legítima é deixado passar.

Use quando o agente já sofreu falsos positivos nos níveis mais rigorosos e a prioridade é não atrapalhar conversas legítimas, aceitando que tentativas mais sutis de manipulação têm mais chance de passar.

Antes de trocar de nível, vale checar o card Mensagens bloqueadas recentemente (na mesma aba) — se as mensagens ali forem claramente tentativas de manipulação, o nível atual está funcionando como esperado; se houver pedidos legítimos bloqueados por engano, é sinal de que vale afrouxar. Nenhum nível é uma garantia absoluta — o ajuste de prompt reduz a frequência de falsos positivos, não elimina o risco em nenhuma direção.