VolundOS

Classificação e avaliação de execuções

Duas leituras automáticas sobre o que o agente fez, com finalidades diferentes: a classificação responde "o que aconteceu nesta execução"; a avaliação responde "a saída foi boa".

Atualizado em 10 de agosto de 2026

Classificação e avaliação de execuções

Duas leituras automáticas sobre o que o agente fez, com finalidades diferentes: a classificação responde "o que aconteceu nesta execução"; a avaliação responde "a saída foi boa".

Classificação de execuções

Por que existe

Contagens simples — número de execuções, latência, taxa de erro — não respondem a certas perguntas importantes: a execução precisou repetir o mesmo passo várias vezes até dar certo? A pessoa abandonou a conversa frustrada? Houve um laço de tentativa repetida no mesmo fluxo? Essas perguntas exigem entender o sentido da execução, não só contar eventos.

Como funciona

Um processo automático gera, para cada execução, uma leitura estruturada do que de fato aconteceu ali: quantas tentativas reais existiram (em vez de aproximar pelo número de passos dados), e quais falhas vieram de uma integração externa em vez de um erro do próprio agente, entre outros indicadores no mesmo espírito.

  • Cadência: roda automaticamente a cada 15 minutos, e também pode ser disparada sob demanda para uma execução específica.
  • Teto: até 50 classificações por agente por dia — acima disso, a leitura automática pausa até o dia seguinte.
  • Privacidade: o conteúdo passa por um filtro que remove informação sensível antes de qualquer envio ao modelo que faz a leitura.

Onde aparece

Na aba de métricas do agente, e no histórico de classificações de cada execução e de cada conversa.

Lista de classificações recentes de um agente, uma linha por execução, com o resultado e a leitura automática do que aconteceu em cada uma

Avaliação automática de saídas

Para que serve

Um mecanismo separado avalia a qualidade da saída — não se a execução terminou, mas se o resultado foi bom. Está ligado à governança de IA da organização e nasceu de exigências de conformidade que se aplicam a esse tipo de uso.

O que é avaliado

Quatro tipos de tarefa: sumarização, geração de conteúdo, extração de informação, e perguntas e respostas com base em documentos.

Cada tarefa é avaliada por um conjunto de critérios de qualidade — alguns medidos de forma determinística, outros atribuídos por um modelo agindo como avaliador. Cada critério pode ter um limite definido; cruzá-lo aciona uma resposta de política configurada para aquele agente.

Cadência

Roda automaticamente quatro vezes por hora, e também pode ser disparada sob demanda para uma execução específica.

Classificação versus avaliação

ClassificaçãoAvaliação
Perguntao que aconteceu na execuçãoa saída foi boa
Origemnecessidade de métrica de produtorequisito de governança/conformidade
Cadênciaa cada 15 minutosquatro vezes por hora
Onde é consumidoaba de métricas do agentepainel de governança

Limites conhecidos

  • Teto diário por agente na classificação: um agente com muito volume não tem todas as execuções classificadas — é uma métrica derivada, por amostra, não um censo completo.
  • Toda leitura automática deste tipo consome uma chamada de modelo, e por isso existem tetos: número de execuções classificadas ou avaliadas não é igual ao número total de execuções.

On this page