1Три типа ботов, которых путают между собой
Первый тип — обучающие. Они собирают тексты, чтобы на них училась модель. Обратной связи для сайта нет: ссылку такой бот не поставит, посетителя не приведёт, эффект появится когда-нибудь внутри весов модели. К этому типу относятся, например, GPTBot у OpenAI, ClaudeBot у Anthropic, а также Google-Extended и Applebot-Extended — специальные правила, которыми Google и Apple разделяют обычную поисковую индексацию и использование контента для обучения.
Второй тип — поисковые для ИИ-ответов. Они индексируют страницы, чтобы ассистент мог сослаться на них в ответе: OAI-SearchBot, Claude-SearchBot, PerplexityBot. Здесь обмен честный: вы отдаёте контент, ассистент показывает ссылку и может привести человека. Третий тип — по требованию пользователя: ChatGPT-User, Claude-User, Perplexity-User. Они заходят на страницу в момент, когда конкретный человек попросил ассистента открыть ссылку или проверить сайт. Блокировать их — то же самое, что отказать в визите живому посетителю, просто пришедшему через другой интерфейс.
- Обучающие: GPTBot, ClaudeBot, Google-Extended, Applebot-Extended — берут контент, ничего не возвращают.
- Поисковые для ИИ-ответов: OAI-SearchBot, Claude-SearchBot, PerplexityBot — дают ссылку в ответе.
- По запросу пользователя: ChatGPT-User, Claude-User, Perplexity-User — заходят по просьбе конкретного человека.
- У Яндекса есть отдельный YandexAdditional для дополнительных сценариев обработки контента.
- Блокировка «всех ИИ-ботов» одной строкой обычно означает и выпадение из ИИ-ответов.
2Что реально даёт robots.txt
robots.txt — это просьба, а не забор. Крупные и публичные краулеры её соблюдают: им дороже репутация, чем ваш контент. Но техническая возможность игнорировать файл есть у любого клиента, и часть менее известных сборщиков ей пользуется. Отсюда правило: robots.txt подходит, чтобы управлять поведением добросовестных ботов, и не подходит как средство защиты от тех, кто заведомо не собирается вас слушать.
Второй нюанс — гранулярность. Правила задаются на пары «user-agent + путь», поэтому осмысленная политика выглядит не как одна строка «запретить всё», а как список: этому боту можно всё кроме личного кабинета, этому — только публичные разделы, этот запрещён целиком. И третий момент, о котором забывают: закрыв раздел в robots.txt, вы закрываете его и от индексации в обычном поиске, если правило написано для поискового user-agent. Смешивать эти задачи в одном файле легко, а последствия видны не сразу.
- robots.txt — соглашение с добросовестными ботами, не техническая защита.
- Правила задаются по парам «user-agent + путь»: политика должна быть списком, а не одной строкой.
- Служебные разделы (личный кабинет, корзина, поиск по сайту) закрывают всем ботам одинаково.
- Ошибка в user-agent приводит к тому, что правило просто не применяется — проверяйте написание.
- Файл публичный: он показывает структуру сайта всем желающим, включая тех, кого вы закрываете.
3Контроль переезжает на сетевой уровень
В 2026 году управление ИИ-трафиком заметно сместилось с уровня файла на уровень инфраструктуры. Показательный пример — Cloudflare: 1 июля 2026 года компания объявила о разделении ИИ-краулеров на три категории — Search (индексация для поиска), Agent (действия от имени пользователя) и Training (сбор данных для обучения). С 15 сентября 2026 года для новых доменов категории Training и Agent блокируются по умолчанию на страницах с рекламой, а Search остаётся разрешён. Настройки доступны всем клиентам, включая бесплатный тариф.
Параллельно развивается механика Pay Per Crawl: краулер получает ответ HTTP 402 «требуется оплата», а владелец сайта назначает цену доступа; часть служебных адресов вроде /robots.txt и /sitemap.xml остаётся бесплатной всегда. Оценивать эту конструкцию как способ заработка небольшому сайту рано, но сам сдвиг важен: отказ, который раньше был просьбой в текстовом файле, теперь исполняется на уровне сети. И для владельца сайта это означает необходимость принять решение явно — иначе его примут дефолты провайдера.
- Cloudflare делит ИИ-ботов на Search, Agent и Training — выбор перестал быть бинарным.
- С 15 сентября 2026 года Training и Agent блокируются по умолчанию на страницах с рекламой у новых доменов.
- Pay Per Crawl: доступ по цене владельца, ответ HTTP 402 вместо контента.
- Сетевой уровень исполняет запрет реально, в отличие от robots.txt.
- Если сайт за CDN — проверьте настройки до того, как за вас решат дефолты.
4Как выбрать режим под свою бизнес-модель
Разумный выбор зависит от того, как контент приносит вам деньги. Если сайт — витрина услуг и источник заявок, логично открыть поисковых ИИ-ботов и ботов по запросу пользователя: цитирование в ответе работает как рекомендация, а переход из ассистента приводит человека, уже знающего, к кому он идёт. Обучающих ботов при этом можно закрыть — на приток клиентов они не влияют.
Если контент и есть продукт — платные исследования, база курсов, уникальные обзоры, — картина другая: открытой должна быть витрина и бесплатная часть, а закрытым всё, за что платят. Если сайт живёт на рекламных показах, стоит внимательно оценить обмен: ответ ассистента часто снимает необходимость переходить, и обучающий трафик тут особенно невыгоден. Отдельная категория — медицинские, юридические и финансовые проекты: там имеет смысл отдельно подумать, в каком виде ваши формулировки будут пересказаны без контекста.
- Сайт услуг и лидогенерация: поисковые ИИ-боты — открыть, обучающие — по желанию закрыть.
- Контент как продукт: открыта витрина и бесплатная часть, платное закрыто.
- Рекламная монетизация: оцените обмен трезво — ответ без перехода не приносит показов.
- Чувствительные ниши: отдельно продумайте, как ваши формулировки выглядят вне контекста.
- Пересматривайте решение раз в полгода: список ботов и правила площадок меняются быстро.
5Как это выглядит на практике
Начните с инвентаризации: посмотрите в логах веб-сервера, какие user-agent к вам ходят, как часто и по каким разделам. Обычно выясняется две вещи — во-первых, ИИ-ботов больше, чем казалось, во-вторых, значительная часть запросов приходится на страницы, которые вы вообще не собирались отдавать: результаты внутреннего поиска, версии для печати, страницы фильтров. Это ещё и вопрос нагрузки, а не только политики.
Дальше опишите правила явно: отдельный блок на каждый значимый user-agent, служебные разделы закрыты всем, публичные открыты тем, кто возвращает ссылку. Если нужен реальный запрет, а не просьба, — дублируйте его на уровне CDN или веб-сервера. И заведите привычку проверять последствия: после изменения правил смотрите, не пропали ли переходы с доменов ИИ-сервисов и не исчез ли сайт из ответов по вашим ключевым вопросам. Ошибку в одной строке robots.txt легко не заметить месяцами.
- Шаг 1: инвентаризация ботов по логам — кто, куда и как часто ходит.
- Шаг 2: закрыть служебные и «мусорные» разделы всем ботам сразу.
- Шаг 3: явные правила по каждому значимому ИИ-краулеру.
- Шаг 4: реальный запрет — на уровне CDN или сервера, а не только в robots.txt.
- Шаг 5: контроль последствий — переходы из ассистентов и присутствие в ответах.
6Частые ошибки
Первая и самая дорогая — закрыть всех ИИ-ботов одной строкой «на всякий случай». Вместе с обучающими под запрет попадают поисковые и те, что заходят по просьбе пользователя, — сайт исчезает из ИИ-ответов и перестаёт открываться, когда клиент просит ассистента проверить вашу страницу. Вторая ошибка — обратная: открыть всё, не подумав, и потом обнаружить, что база знаний, которую собирали годами, ушла в обучение целиком.
Третья ошибка техническая: правила пишут для несуществующих или неправильно написанных user-agent, и они молча не применяются. Четвёртая — считать robots.txt защитой и не ставить ничего на сетевом уровне там, где запрет действительно важен. И пятая, организационная: принять решение один раз и забыть. Список ботов, их назначение и дефолты провайдеров меняются несколько раз в год — политику доступа стоит пересматривать по календарю, вместе с другими регулярными проверками сайта.
- Не блокируйте всех ИИ-ботов одной строкой — вместе с обучающими уйдут поисковые.
- Не открывайте всё по умолчанию, если контент и есть ваш продукт.
- Проверяйте точное написание user-agent: опечатка отключает правило целиком.
- Реальный запрет ставится на сетевом уровне, robots.txt его не обеспечивает.
- Пересматривайте политику раз в полгода — правила и дефолты меняются.