Знания

Web crawl

Ingest справочных центров и публичной документации: типы crawl, глубина, вежливость, опциональное Gemini-распознавание изображений и транскрипция аудио/видео, поведение очереди в production.

crawlсправочный центрсайт документацииsitemapgemini

Crawl подходит, когда контент уже на доменах, которыми вы управляете. Дополняет коннекторы, когда нет API для статического сайта или микросайта.

Вы можете обходить только HTML (быстро, без Gemini) или опционально обогащать описаниями связанных изображений и транскрипциями аудио/видео. Эти AI-шаги требуют рабочего Gemini (размещённого или org-ключа).

Уважайте robots.txt при включении; FlexyAgents применяет задержки между requests, чтобы не перегружать origin. В production длинные crawl могут ставиться в очередь workers — проверяйте статус в панели.

Типы crawl: start, sitemap, full site

Start обходит один URL — полезно для landing или smoke-тестов.

Режим sitemap читает sitemap.xml (и может следовать вложенным индексам до потолка) для перечисления URL; хорош для doc-сайтов с надёжным sitemap.

Full site стартует с seed URL и следует ссылкам того же домена до максимальной глубины и количества — лучше, когда важна навигация, а sitemap неполные.

  • Настройте max pages и depth под вашу инфраструктуру; очень большие crawl удобнее в окна обслуживания.
  • Follow links применяется к full crawl; режимы start и sitemap не блуждают произвольно.

Seeds, область и вежливость

Начните с seed URL или sitemap. Ограничьте маршруты `/help/` или `/docs/`, чтобы marketing не размывал support.

Исключите маршруты только для аутентифицированных сотрудников, если не хотите этот контент в этой базе.

  • Задайте delay per request (секунды), чтобы быть вежливым к небольшим origin.
  • Включите respect robots.txt, когда политика строго это требует.

Распознавание изображений vs транскрипция аудио/видео

Два независимых переключателя управляют тем, получает ли crawler и обрабатывает изображения, и обрабатывает ли URL аудио и видео, найденные на каждой HTML-странице.

Если активны, система скачивает медиа в пределах size limits, выполняет Gemini vision или транскрипцию и добавляет извлечённый текст к обходимому документу. Сбои создают краткие маркеры, чтобы видеть, какие URL упали.

  • SVG и data: URL пропускаются в image processing для совместимости.
  • Размещённые crawl-квоты считают каждый успешный размещённый Gemini-вызов; org Gemini-ключи обходят размещённые счётчики — см. Документация → Знания → AI vision, транскрипция и лимиты.

Аутентифицированные порталы

Некоторые команды открывают порталы с SSO; согласуйте с IT поддерживаемые crawl-паттерны или используйте экспорты/коннекторы.

Никогда не храните клиентские учётные данные в настройках crawl.

Обслуживание

Планируйте re-crawl после крупных релизов docs. Битые ссылки в исходном HTML создают пробелы — исправляйте upstream.

Сочетайте crawl с analytics, чтобы видеть, какие URL реально двигают ответы.

Стройте на своём стеке

Готовы развернуть обоснованных ассистентов?

Начните пробный период или обсудите с нами внедрение, governance и enterprise-требования.