Wissen

Web-Crawl

Öffentliche Help-Center und Dokumentation ingestieren: Crawl-Typen, Tiefe, Höflichkeit, optionale Gemini-Bilderkennung und Audio-/Video-Transkription sowie Queue-Verhalten in Produktion.

crawlhelp centerdokumentationsseitesitemapgemini

Crawl eignet sich, wenn Inhalte bereits auf Domains liegen, die Sie kontrollieren. Ergänzen Sie Connectors, wenn keine API für eine statische Site oder Microsite existiert.

Sie können nur HTML crawlen (schnell, ohne Gemini) oder optional mit Bildbeschreibungen verknüpfter Bilder und Audio-/Video-Transkripten anreichern. Diese KI-Schritte erfordern funktionierendes Gemini (gehostet oder Org-Schlüssel).

Respektieren Sie robots.txt, wenn aktiviert; FlexyAgents setzt Verzögerungen zwischen Anfragen, um Ihren Origin zu entlasten. In Produktion können lange Crawls in Worker-Queues — prüfen Sie den Status im Dashboard.

Crawl-Typen: Start, Sitemap, gesamte Site

Start crawlt eine einzelne URL — nützlich für Landings oder Smoke-Tests.

Sitemap-Modus liest sitemap.xml (und kann verschachtelte Indizes bis zu einem Limit folgen), um URLs zu listen; geeignet für Docs-Sites mit zuverlässiger Sitemap.

Gesamte Site startet von einer Start-URL und folgt Links derselben Domain bis zu maximaler Tiefe und Anzahl — bevorzugt, wenn Navigation zählt und Sitemaps unvollständig sind.

  • Passen Sie maximale Seitenzahl und Tiefe an Ihre Infrastruktur an; sehr große Crawls eignen sich für Wartungsfenster.
  • Link-Following gilt für vollständige Crawls; Start- und Sitemap-Modi durchlaufen nicht beliebig.

Start-URLs, Scope und Höflichkeit

Starten Sie von einer Start-URL oder Sitemap. Beschränken Sie Pfade auf `/help/` oder `/docs/`, damit Marketing den Support nicht verwässert.

Schließen Sie Pfade für authentifizierte Mitarbeiter aus, es sei denn, Sie wollen diesen Inhalt in dieser Basis.

  • Setzen Sie eine Verzögerung pro Anfrage (Sekunden), um kleine Origins höflich zu behandeln.
  • Aktivieren Sie robots.txt-Respekt, wenn Ihre Richtlinie es strikt verlangt.

Bilderkennung vs. Audio-/Video-Transkription

Zwei unabhängige Schalter steuern, ob der Crawler Bilder abruft und verarbeitet und ob er Audio- und Video-URLs in jeder HTML-Seite verarbeitet.

Wenn aktiv, lädt das System Medien innerhalb von Größenlimits herunter, führt Vision oder Gemini-Transkription aus und fügt extrahierten Text zum gecrawlten Dokument hinzu. Fehler erzeugen kurze Markierungen, um zu sehen, welche URLs fehlschlugen.

  • SVG- und data:-URLs werden in der Bildverarbeitung aus Kompatibilitätsgründen ignoriert.
  • Gehostete Crawl-Quotas zählen pro erfolgreichem gehosteten Gemini-Aufruf; Org-Gemini-Schlüssel vermeiden gehostete Zähler — siehe Dokumentation → Wissen → KI-Vision, Transkription und Limits.

Authentifizierte Portale

Manche Teams exponieren Portale mit SSO; koordinieren Sie mit IT unterstützte Crawl-Muster oder nutzen Sie Exporte/Connectors.

Speichern Sie niemals Kunden-Anmeldedaten in Crawl-Konfigurationen.

Wartung

Planen Sie Re-Crawls nach großen Docs-Updates. Kaputte Links im HTML-Quelltext erzeugen Lücken — beheben Sie upstream.

Kombinieren Sie Crawl mit Analytik, um zu sehen, welche URLs tatsächlich Antworten speisen.

Auf Ihrem Stack bauen

Bereit für fundierte Assistenten?

Testversion starten oder mit uns über Rollout, Governance und Enterprise-Anforderungen sprechen.