Upload, extração de texto e resumo
Sobe-se um arquivo — PDF, Word, Excel, texto — e ele vira um documento markdown na base, com um resumo curto que aparece no índice para o agente consultar.
Upload, extração de texto e resumo
Camada funcional
Sobe-se um arquivo — PDF, Word, Excel, texto — e ele vira um documento markdown na base, com um resumo curto que aparece no índice. O agente lê esse markdown; o arquivo original não é o que ele consulta.
Que arquivos entram (mudou em 03/09/2026)
Qualquer tipo de arquivo. Até então valia uma lista fechada de nove extensões, e o que estava
fora dela era recusado na porta — um .csv, um .json, um arquivo de código ou um arquivo sem
extensão nenhuma não entrava, mesmo sendo texto que o agente leria sem dificuldade. Pior: a recusa
era muda, o arquivo simplesmente saía da fila sem explicação.
Agora quem decide é o conteúdo, não o nome do arquivo:
| O que é o arquivo | O que acontece |
|---|---|
| Já é texto legível | entra como está |
| Não é texto direto — PDF, Word, Excel, apresentação, e afins | passa por uma extração, que cobre até PDF digitalizado |
| A extração não consegue ler | o documento entra marcado com erro, e o motivo fica à vista |
A última linha é a mudança de postura: é mais honesto deixar o arquivo entrar e dizer que não deu para ler do que nunca deixá-lo entrar. Se o serviço de extração estiver fora do ar, o erro também é explícito — nunca um documento vazio fingindo sucesso.
Dá para mandar vários arquivos de uma vez, e a tela informa o tamanho máximo por arquivo antes de você escolher — em vez de aceitar o envio e recusar depois.
Resumo automático
Cada documento ganha um resumo de uma a três frases em português, usado no índice da base para o agente decidir se vale abrir o arquivo.
Três decisões de projeto valem registrar:
- O resumo só precisa dizer do que o documento trata, não resumir o conteúdo inteiro.
- A entrada é truncada para limitar custo, com o argumento de que o começo de um documento é quase sempre a parte mais descritiva.
- É best-effort: qualquer falha devolve um resumo truncado derivado do próprio conteúdo — a entrada do documento na base nunca trava por causa do resumo.
O fluxo completo do upload
O arquivo passa pela extração de texto — direta, quando já é texto legível, ou pelo serviço de extração — vira markdown, recebe o resumo automático e é salvo como documento pronto na base. A entrada é registrada com um estado provisório assim que o upload começa e só passa para o estado final depois que todo o processamento termina — por isso o status do documento pode aparecer como "em processamento" por um instante.
Onde fazer isso
Dá para subir um arquivo direto na tela de uma base de conhecimento, ou por uma ferramenta/API equivalente; e para ler o conteúdo já extraído de um documento processado.
Limites e modos de falha conhecidos
- A conversão é um caminho só: o que fica guardado é o texto extraído. Formatação, layout e planilha com fórmulas se perdem — o que importa é o texto.
- Arquivo que ninguém consegue ler entra marcado com erro, e não some em silêncio. É o caso de uma imagem sem texto dentro, por exemplo.
- Falha dura de upload interrompe a operação; quem chama é responsável por marcar o documento com estado de erro.
- O documento só aparece completo para o agente a partir da execução seguinte, quando os arquivos são recarregados.