Conhecimento

Crawl web

Ingira centrais de ajuda e documentação pública: tipos de crawl, profundidade, cortesia, reconhecimento de imagem Gemini opcional e transcrição de áudio/vídeo, e comportamento de fila em produção.

crawlcentral de ajudasite documentaçãositemapgemini

Crawl encaixa quando o conteúdo já vive em domínios que você controla. Complementa conectores quando não há API para um site estático ou microsite.

Você pode rastrear só HTML (rápido, sem Gemini) ou enriquecer opcionalmente com descrições de imagens linkadas e transcrições de áudio/vídeo. Esses passos de IA exigem Gemini operacional (hospedado ou chave de org).

Respeite robots.txt quando habilitado; o FlexyAgents aplica atrasos entre requests para aliviar sua origem. Em produção, crawls longos podem ser enfileirados em workers — revise o status no painel.

Tipos de crawl: início, sitemap, site completo

Início rastreia uma única URL — útil para landings ou testes smoke.

Modo sitemap lê sitemap.xml (e pode seguir índices aninhados até um teto) para enumerar URLs; bom para sites de docs com sitemap confiável.

Site completo parte de uma URL seed e segue links do mesmo domínio até profundidade e contagem máximas — melhor quando navegação importa e sitemaps estão incompletos.

  • Ajuste páginas máximas e profundidade à sua infraestrutura; crawls muito grandes encaixam em janelas de manutenção.
  • Seguir links aplica a crawls completos; modos início e sitemap não vagam arbitrariamente.

Seeds, escopo e cortesia

Parta de URL seed ou sitemap. Restrinja rotas a `/help/` ou `/docs/` para que marketing não dilua suporte.

Exclua rotas só para colaboradores autenticados, salvo se quiser esse conteúdo nessa base.

  • Defina atraso por request (segundos) para ser cortês com origens pequenas.
  • Ative respeito a robots.txt quando sua política exigir estritamente.

Reconhecimento de imagem vs transcrição áudio/vídeo

Dois toggles independentes controlam se o crawler obtém e processa imagens, e se processa URLs de áudio e vídeo encontradas em cada página HTML.

Se ativos, o sistema baixa mídia dentro de limites de tamanho, executa visão ou transcrição Gemini e adiciona texto extraído ao documento rastreado. Falhas geram marcadores breves para ver quais URLs falharam.

  • SVG e data: URLs são omitidos no processamento de imagem por compatibilidade.
  • Cotas de crawl hospedado contam por chamada Gemini hospedada bem-sucedida; chaves Gemini de organização evitam contadores hospedados — ver Documentação → Conhecimento → IA visão, transcrição e limites.

Portais autenticados

Algumas equipes expõem portais com SSO; coordene com TI padrões de crawl suportados ou use exportações/conectores.

Nunca guarde credenciais de clientes em configurações de crawl.

Manutenção

Agende re-crawls após lançamentos grandes de docs. Links quebrados no HTML fonte geram lacunas — corrija upstream.

Combine crawl com analytics para ver quais URLs realmente impulsionam respostas.

Construa com seu stack

Pronto para implantar assistentes fundamentados?

Inicie um teste ou fale conosco sobre implantação, governança e requisitos empresariais.