ナレッジ

Web クロール

公開ヘルプセンターとドキュメントを取り込む:クロールタイプ、深度、礼儀正しさ、オプションの Gemini 画像認識と音声/動画文字起こし、本番環境でのキュー動作。

クロールヘルプセンタードキュメントサイトsitemapgemini

クロールは、すでに管理するドメイン上にあるコンテンツに適しています。静的サイトやマイクロサイトに API がない場合は、コネクターを補完します。

HTML テキストのみをクロールできます(高速、Gemini 不要)。または、リンク画像の説明とリンク音声/動画の文字起こしでページをオプションでエンリッチできます。これらの AI ステップには、動作する Gemini 設定(ホスト型または組織キー)が必要です。

有効な場合は robots.txt を尊重してください。FlexyAgents はリクエスト間に遅延を適用し、オリジンへの負荷を軽減します。本番環境では、長時間のクロールはバックグラウンド ワーカーでキューイングされる場合があります — ダッシュボードでクロール状態を確認してください。

クロールタイプ:ホームページ、sitemap、サイト全体

ホームページは単一 URL をクロールします — ランディングページやスモーク テストに有用です。

sitemap モードは sitemap.xml を読み取り(上限までネストされた sitemap インデックスをたどる場合があります)、URL を列挙します。正確な sitemap を維持するドキュメントサイトに適しています。

サイト全体はシード URL から開始し、同一ドメインのリンクを最大深度とページ数までたどります — ナビゲーションが重要で sitemap が不完全な場合に最適です。

  • 最大ページ数と深度をインフラに合わせて調整してください。非常に大規模なクロールはメンテナンス ウィンドウ向けです。
  • リンク追従はサイト全体クロールに適用されます。ホームページと sitemap モードは任意に巡回しません。

シード URL、スコープ、礼儀正しさ

シード URL または sitemap から開始してください。パスを `/help/` または `/docs/` に制限し、マーケティング コンテンツがサポート取得を薄めないようにしてください。

そのベースに社内コンテンツを意図しない限り、認証が必要な従業員専用パスを除外してください。

  • 小規模なオリジンに配慮するため、リクエストごとの遅延(秒)を設定してください。
  • ポリシーで厳格な遵守が求められる場合は、robots.txt 尊重を有効にしてください。

画像認識 vs 音声/動画文字起こし

2 つの独立したスイッチが、クローラーが画像を取得・処理するか、各 HTML ページで見つかった音声/動画 URL を処理するかを制御します。

有効な場合、システムはサイズ制限内でメディアをダウンロードし、Gemini Vision または文字起こしを実行し、抽出テキストをクロールしたドキュメントに追加します。失敗時は、どの URL が失敗したか確認できる短いプレースホルダーが生成されます。

  • SVG および data: URL は、互換性のため画像処理で無視されます。
  • ホスト型クロール クォータは、成功したホスト型 Gemini 呼び出しごとにカウントされます。組織 Gemini キーはホスト型カウンターを回避します — ドキュメント → ナレッジ → AI Vision、文字起こし、制限を参照してください。

認証付きポータル

一部のチームは SSO 付きポータルを公開しています。IT とサポートされるクロール パターンを調整するか、エクスポート/コネクターを使用してください。

クロール設定にカスタマー認証情報を保存しないでください。

メンテナンス

大規模なドキュメント更新後に再クロールを計画してください。ソース HTML の壊れたリンクはギャップを生みます — 上流で修正してください。

クロールと分析を組み合わせ、実際に回答に寄与している URL を確認してください。

自社スタックで構築

根拠のあるアシスタントを本番投入する準備はできましたか?

トライアルを開始するか、展開、ガバナンス、エンタープライズ要件についてご相談ください。