
Ao adicionar uma fonte do tipo URL à base de conhecimento, a Eva acessa a página informada, extrai o texto e encontra links do mesmo domínio para ampliar o conteúdo disponível ao assistente.
Requisitos da página
Antes de adicionar a URL, confirme que:
- o endereço usa
http://ou, de preferência,https://; - a página abre sem login, VPN ou confirmação interativa;
- o servidor devolve conteúdo HTML ou outro formato textual aceito;
- os links que devem ser descobertos apontam para o mesmo domínio da URL inicial;
- o conteúdo importante aparece no HTML entregue pelo servidor.
O rastreador padrão se identifica como EvaBot/1.0, descobre até 50 links por fonte e limita o texto extraído de cada página. Sites que renderizam todo o conteúdo apenas depois de executar JavaScript podem exigir outra forma de importação.
E o robots.txt?
Na configuração atual da plataforma, o rastreador padrão não interpreta regras do robots.txt. Portanto, não é necessário adicionar uma regra para FirecrawlAgent, e essa regra isolada não libera uma página protegida.
Se você precisa impedir que a Eva acesse uma área, use uma proteção efetiva no servidor, como autenticação ou controle de rede. Se quer permitir o acesso, disponibilize a página publicamente e evite bloqueios por firewall ou proteção anti-bot para o EvaBot/1.0.
Testar antes de importar
- Abra a URL em uma janela anônima e confirme que o conteúdo aparece sem autenticação.
- Verifique se os links relevantes usam o mesmo domínio.
- Adicione a fonte na base de conhecimento da Eva.
- Aguarde o processamento e revise os documentos gerados antes de usar a fonte em produção.
Se nenhuma página for importada, verifique o status HTTP, o tipo de conteúdo, redirecionamentos e bloqueios do servidor.
Veja também: Base de conhecimento da Eva