Connaissances

Crawl web

Ingérez centres d’aide et documentation publics : types de crawl, profondeur, courtoisie, reconnaissance d’image Gemini optionnelle et transcription audio/vidéo, et comportement de file en production.

crawlcentre d’aidesite documentationsitemapgemini

Le crawl convient lorsque le contenu vit déjà sur des domaines que vous contrôlez. Complétez les connecteurs lorsqu’il n’existe pas d’API pour un site statique ou un microsite.

Vous pouvez crawler uniquement le HTML (rapide, sans Gemini) ou enrichir optionnellement avec des descriptions d’images liées et des transcriptions audio/vidéo. Ces étapes IA requièrent Gemini opérationnel (hébergé ou clé d’org).

Respectez robots.txt lorsqu’il est activé ; FlexyAgents applique des délais entre requêtes pour soulager votre origine. En production, les crawls longs peuvent être mis en file dans des workers — consultez l’état dans le tableau de bord.

Types de crawl : départ, sitemap, site complet

Départ crawle une seule URL — utile pour les landings ou tests de fumée.

Le mode sitemap lit sitemap.xml (et peut suivre les index imbriqués jusqu’à un plafond) pour lister les URL ; adapté aux sites de docs avec sitemap fiable.

Site complet part d’une URL de départ et suit les liens du même domaine jusqu’à la profondeur et le nombre maximum — préférable lorsque la navigation compte et que les sitemaps sont incomplets.

  • Ajustez le nombre maximal de pages et la profondeur à votre infrastructure ; les crawls très volumineux conviennent aux fenêtres de maintenance.
  • Le suivi de liens s’applique aux crawls complets ; les modes départ et sitemap ne parcourent pas arbitrairement.

URLs de départ, périmètre et courtoisie

Partez d’une URL de départ ou d’un sitemap. Restreignez les chemins à `/help/` ou `/docs/` pour que le marketing ne dilue pas le support.

Excluez les chemins réservés aux employés authentifiés sauf si vous souhaitez ce contenu dans cette base.

  • Définissez un délai par requête (secondes) pour être courtois avec les petites origines.
  • Activez le respect de robots.txt lorsque votre politique l’exige strictement.

Reconnaissance d’image vs transcription audio/vidéo

Deux interrupteurs indépendants contrôlent si le crawler récupère et traite les images, et s’il traite les URL audio et vidéo trouvées dans chaque page HTML.

S’ils sont actifs, le système télécharge les médias dans les limites de taille, exécute la vision ou la transcription Gemini et ajoute le texte extrait au document crawlé. Les échecs génèrent de brefs marqueurs pour voir quelles URL ont échoué.

  • Les URL SVG et data: sont ignorées dans le traitement d’image pour compatibilité.
  • Les quotas de crawl hébergé comptent par appel Gemini hébergé réussi ; les clés Gemini d’organisation évitent les compteurs hébergés — voir Documentation → Connaissances → Vision IA, transcription et limites.

Portails authentifiés

Certaines équipes exposent des portails avec SSO ; coordonnez avec l’IT les modèles de crawl pris en charge ou utilisez des exports/connecteurs.

Ne stockez jamais les identifiants clients dans les configurations de crawl.

Maintenance

Planifiez des re-crawls après de grandes mises à jour de docs. Les liens cassés dans le HTML source créent des lacunes — corrigez en amont.

Combinez le crawl avec l’analytique pour voir quelles URL alimentent réellement les réponses.

Construisez sur votre stack

Prêt à déployer des assistants fondés sur vos données ?

Démarrez un essai ou parlez-nous de vos besoins de déploiement, gouvernance et exigences entreprise.