Classificação e avaliação de execuções
Duas leituras automáticas sobre o que o agente fez, com finalidades diferentes: a classificação responde "o que aconteceu nesta execução"; a avaliação responde "a saída foi boa".
Classificação e avaliação de execuções
Duas leituras automáticas sobre o que o agente fez, com finalidades diferentes: a classificação responde "o que aconteceu nesta execução"; a avaliação responde "a saída foi boa".
Classificação de execuções
Por que existe
Contagens simples — número de execuções, latência, taxa de erro — não respondem a certas perguntas importantes: a execução precisou repetir o mesmo passo várias vezes até dar certo? A pessoa abandonou a conversa frustrada? Houve um laço de tentativa repetida no mesmo fluxo? Essas perguntas exigem entender o sentido da execução, não só contar eventos.
Como funciona
Um processo automático gera, para cada execução, uma leitura estruturada do que de fato aconteceu ali: quantas tentativas reais existiram (em vez de aproximar pelo número de passos dados), e quais falhas vieram de uma integração externa em vez de um erro do próprio agente, entre outros indicadores no mesmo espírito.
- Cadência: roda automaticamente a cada 15 minutos, e também pode ser disparada sob demanda para uma execução específica.
- Teto: até 50 classificações por agente por dia — acima disso, a leitura automática pausa até o dia seguinte.
- Privacidade: o conteúdo passa por um filtro que remove informação sensível antes de qualquer envio ao modelo que faz a leitura.
Onde aparece
Na aba de métricas do agente, e no histórico de classificações de cada execução e de cada conversa.
Avaliação automática de saídas
Para que serve
Um mecanismo separado avalia a qualidade da saída — não se a execução terminou, mas se o resultado foi bom. Está ligado à governança de IA da organização e nasceu de exigências de conformidade que se aplicam a esse tipo de uso.
O que é avaliado
Quatro tipos de tarefa: sumarização, geração de conteúdo, extração de informação, e perguntas e respostas com base em documentos.
Cada tarefa é avaliada por um conjunto de critérios de qualidade — alguns medidos de forma determinística, outros atribuídos por um modelo agindo como avaliador. Cada critério pode ter um limite definido; cruzá-lo aciona uma resposta de política configurada para aquele agente.
Cadência
Roda automaticamente quatro vezes por hora, e também pode ser disparada sob demanda para uma execução específica.
Classificação versus avaliação
| Classificação | Avaliação | |
|---|---|---|
| Pergunta | o que aconteceu na execução | a saída foi boa |
| Origem | necessidade de métrica de produto | requisito de governança/conformidade |
| Cadência | a cada 15 minutos | quatro vezes por hora |
| Onde é consumido | aba de métricas do agente | painel de governança |
Limites conhecidos
- Teto diário por agente na classificação: um agente com muito volume não tem todas as execuções classificadas — é uma métrica derivada, por amostra, não um censo completo.
- Toda leitura automática deste tipo consome uma chamada de modelo, e por isso existem tetos: número de execuções classificadas ou avaliadas não é igual ao número total de execuções.
Capacidades do agente
Capacidade é o que o agente pode fazer: mexer em conhecimento, conectar integrações, criar gatilhos, delegar para outro agente ou gerir a própria plataforma.
Compartilhamento e visibilidade do agente
Um agente nasce do dono e pode ser compartilhado com pessoas específicas, com times ou com a organização inteira, cada caminho com um nível de acesso diferente.