Импорт сайта: как работает обход страниц

Обновлено 04.08.2026 · 3 мин чтения

Самый быстрый способ наполнить базу знаний — дать адрес сайта. Платформа обойдёт страницы, вытащит текст и проиндексирует его. Две минуты вместо часа ручной загрузки.

Как это работает

Вы указываете адрес — обычно главную страницу. Дальше:

  1. Платформа скачивает страницу и извлекает из неё текст, отбрасывая меню, подвал, скрипты и оформление.
  2. Находит ссылки на этой странице и ставит их в очередь.
  3. Повторяет для каждой страницы из очереди.

Обход ограничен: до 30 страниц и до 3 переходов от стартовой. Ходит только по вашему домену — на внешние ссылки не уходит. Файл robots.txt уважается: страницы, закрытые от индексации, пропускаются.

Очередь обхода приоритизируется: страницы, похожие на «услуги», «цены», «прайс», «контакты», обходятся раньше остальных. Иначе бюджет в 30 страниц уходил бы на новости и блог, а до прайса краулер не добирался.

Что даёт хороший результат

Начинайте с главной, а не с внутренней страницы. С главной ведут ссылки на все основные разделы, и краулер соберёт структуру.

Проверьте, что важное доступно по ссылкам. Если прайс открывается только по клику на кнопку с JavaScript и не имеет обычной ссылки, краулер до него не дойдёт.

Учтите ограничение в 30 страниц. Для сайта-визитки это с запасом. Для сайта на 300 страниц — капля. В этом случае импортируйте главную, а потом добавьте ключевые страницы по отдельным адресам либо загрузите прайс файлом.

Чего краул не умеет

Содержимое, которое рисует JavaScript. Если текст появляется на странице только после выполнения скриптов, платформа его не увидит. Проверить просто: откройте страницу и нажмите «Просмотр кода страницы» — если нужного текста в исходнике нет, краулер его тоже не найдёт.

PDF-файлы по ссылкам с сайта. Прайс, выложенный PDF-ссылкой, при обходе не скачивается — загрузите его отдельно файлом.

Закрытые разделы. Личный кабинет, страницы под паролем.

Картинки с текстом. Прайс-баннер — для платформы пустое место.

Повторный импорт

Импортировать один и тот же адрес слишком часто нельзя: краул — это десятки реальных запросов к вашему сайту, и повторный клик по кнопке не должен превращаться в нагрузку. Между обходами одного адреса действует пауза около часа.

Если сайт изменился — цены обновились, услуга добавилась — запустите импорт заново и удалите старые страницы, чтобы не осталось двух версий одного факта.

Автоматической пересинхронизации по расписанию сейчас нет. Обновление — ручное.

Импорт отдельной страницы

Кроме сайта целиком можно добавить конкретный адрес — например, страницу акции или отдельный раздел прайса. Это тот же механизм, но без обхода ссылок: берётся ровно одна страница.

Удобно для точечного дополнения, когда весь сайт уже импортирован.

После импорта — проверьте

Импорт почти никогда не даёт идеальный результат с первого раза. Откройте список документов и посмотрите, что попало.

Типичные проблемы:

  • Импортировались новости и блог, а прайс — нет. Добавьте страницу прайса отдельным адресом.
  • В документах много мусора — навигация, повторяющиеся блоки, тексты из подвала. Обычно на качество ответов это влияет слабо, но если мусора больше, чем содержания, лучше удалить такие страницы.
  • Страниц импортировалось 3 из 30. Скорее всего сайт отдаёт содержимое через JavaScript. Придётся загружать файлами.

Дальше — тест-звонок с реальными вопросами.

Сайта нет

Тогда импорт не нужен: соберите информацию в документ и загрузите файлом. Полчаса работы в текстовом редакторе дадут базу лучше, чем импорт слабого сайта. См. Чем наполнить базу знаний.