Умный фильтр трафика: как устроена система обнаружения ботов

Умный фильтр трафика не просто проверяет визит по списку правил, а взвешивает десятки признаков, учится на истории и подстраивается под ваш трафик. Разбираем, что за этим стоит, где он ошибается и как контролировать его решения.

Боты и фрод9 мин чтения
Умный фильтр трафика: как устроена система обнаружения ботов
Содержание
  1. Чем умный фильтр отличается от набора правил
  2. Из чего состоит система обнаружения ботов
  3. Обучение на истории: как фильтр становится умнее
  4. Общий список доказанных ботов
  5. Автоматическая подстройка защиты
  6. Риски: когда умный фильтр срезает живых
  7. Прозрачность решений: без неё умному фильтру нельзя доверять
  8. Как устроен умный фильтр трафика в ArtisanClo
  9. Итог

Умный фильтр трафика (smart traffic filter) — это система обнаружения ботов, которая принимает решение по визиту не одним правилом, а сочетанием многих признаков: сети, браузера, поведения и истории. Она взвешивает сигналы в общую оценку доверия, учится на прошлых данных — кто оказался ботом, а кто принёс деньги — и подстраивает защиту под конкретный трафик.

Простой фильтр отвечает на вопрос «нарушено ли правило». Умный — на вопрос «насколько этот визит похож на человека, который нам нужен». Ниже разберём, из чего состоит такая система, чем она лучше набора правил, где её слабые места и почему без прозрачности решений ей нельзя доверять.

Чем умный фильтр отличается от набора правил

Классический фильтр — это список условий: страна не из списка — заглушка, IP из дата-центра — заглушка, нет JavaScript — заглушка. Это работает для очевидного, но ломается на спорных случаях.

Набор правил Умный фильтр трафика
Как решает Одно сработавшее правило — отказ Признаки складываются в оценку доверия
Спорные визиты Либо режет всех, либо пропускает всех Сомнительный признак добавляет подозрения, но не решает в одиночку
Адаптация Только ручная правка Учится на истории и общем опыте
Новые боты Пока правило не написали — проходят Похожесть на известных ботов ловит и новые варианты
Риск Предсказуемый, но грубый Тоньше, но требует контроля и объяснений

Возьмём визит через VPN. Набор правил вынужден выбрать: блокировать все VPN и потерять часть живых людей или пропускать все и пустить ботов. Умный фильтр учтёт VPN как один из признаков: если остальное в порядке — браузер настоящий, скрипт выполнился, пришла метка клика площадки, — визит пройдёт; если к VPN добавились сеть хостинга и следы автоматизации, сумма подозрений решит дело.

Важно: умный фильтр не отменяет правил. Явные случаи — программа вместо браузера, адрес из чёрного списка, неподходящая страна — по-прежнему отсекаются сразу. «Ум» нужен для середины, где правило ошибается в обе стороны. Общую схему слоёв защиты мы разбирали в статье о том, как отфильтровать ботов.

Из чего состоит система обнаружения ботов

Любая современная bot detection system собрана из четырёх частей.

1. Сигналы

Чем больше независимых признаков, тем труднее боту подделать их все сразу:

  • Сеть: тип адреса (домашний, мобильный, хостинг), VPN и прокси, провайдер, ASN — подробнее в статье про VPN, прокси и IP дата-центров;
  • Запрос: заголовки, строка user agent, метка клика площадки, сайт-источник; о том, почему строка UA сама по себе мало что доказывает, — в материале про фильтрацию по user agent;
  • Браузер: выполнение JavaScript, признаки автоматизации, согласованность свойств — см. статью про headless-браузеры и отпечаток браузера;
  • Поведение: время на странице, движение мыши и касания;
  • История: встречался ли этот адрес раньше и чем закончились прошлые визиты.

2. Оценка доверия

Сигналы сводятся в одну величину — оценку доверия (trust score). Каждый подозрительный признак снижает доверие, и если подозрений набралось слишком много, визит отсеивается. Сила каждого признака зависит от контекста: отсутствие сайта-источника подозрительно для одних площадок и совершенно нормально для других.

3. Обучение

Обучение отвечает на вопрос, который правила не задают: как выглядят именно ваши боты и именно ваши покупатели. Модель смотрит на историю — какие визиты закончились оплатой, а какие оказались ботами — и находит закономерности, которые человек не стал бы формулировать как правило.

4. Память

Бот, которого уверенно поймали один раз, скорее всего придёт снова. Общий список доказанных ботов позволяет не проверять его заново: следующий визит с того же адреса отсекается сразу. Чем больше трафика видит система, тем полезнее эта память, — поэтому её делают общей для всех клиентов сервиса.

Обучение на истории: как фильтр становится умнее

Обучение — самая сильная и самая коварная часть умного фильтра.

Сильная, потому что модель видит то, что пропустили правила. Бот, который идеально прикинулся браузером, всё равно ведёт себя не как ваши покупатели: другие часы, другие сети, другое сочетание признаков. Модель, обученная на истории аккаунта, замечает эту непохожесть.

Коварная, потому что модель учится на том, что ей показали. Если в истории мало конверсий, она плохо представляет себе покупателя. Если трафик изменился — новая площадка, новое гео, новое крео, — старые закономерности перестают работать. Поэтому у хороших систем обучения есть три защитных механизма:

  1. Общая модель для старта. Пока своих данных мало, работает модель, обученная на многих аккаунтах.
  2. Регулярное переобучение. Модель обновляется по свежим данным, а не живёт годами на старом срезе.
  3. Предохранитель по конверсиям. Если модель начала отсекать заметную долю платящих посетителей, она отключается, а не продолжает резать деньги.

Общий список доказанных ботов

Список ботов работает как коллективный иммунитет: что поймали у одного клиента, больше не пройдёт ни у кого. Но у него есть очевидный риск — занести туда живого человека. Адрес мобильного оператора, на котором сегодня сидел бот, завтра может достаться обычному абоненту.

Поэтому в такой список имеет смысл заносить только доказанных ботов, а не всех подозрительных, и хранить записи с разным сроком: адреса хостингов и дата-центров меняют владельцев редко, домашние и мобильные — часто. Подробнее про устройство списков адресов — в статье про чёрный список IP.

Автоматическая подстройка защиты

Последняя ступень — система, которая не только решает по каждому визиту, но и меняет собственные настройки: включает защиту, которая ловила бы ботов на этом трафике, или снимает правило, которое отсекает платящих посетителей. Это экономит время байера, но требует трёх ограничений:

  • Маленькие шаги. Одно изменение за раз и не чаще определённого интервала — иначе не понять, что именно повлияло на результат.
  • Неприкосновенные решения. Гео, устройства и расписание — бизнес-решения, а не защита; автоматика не должна их трогать.
  • Отмена. Каждое изменение должно быть видно с объяснением и отменяться одной кнопкой.

Риски: когда умный фильтр срезает живых

Главный риск любого фильтра — ложные срабатывания. У умного он менее заметен, потому что решение складывается из многих маленьких вкладов и не сводится к одному понятному правилу.

Признаки того, что фильтр режет людей:

  • конверсия падает вместе с ростом отсева, хотя площадка и крео не менялись;
  • до оффера доходит совсем малая доля визитов — это повод проверить настройки, особенно на закупном трафике с меткой клика;
  • отсев растёт на шаге проверки браузера — именно там фильтр ошибается чаще всего;
  • в отсеве много встроенных браузеров соцсетей и мобильных сетей.

Заметьте, что обратного правила нет: высокая доля прохода сама по себе не говорит о плохой защите. У закупного источника с проверенным click id до оффера может доходить большая часть визитов, и это нормально. Как отличить хороший трафик от плохого по отчётам, разобрано в статье про признаки бот-трафика.

Совет. Прежде чем ужесточать защиту, посмотрите, кого она отсекла бы, ничего не отсекая. Режим наблюдения стоит недорого, а срезанные конверсии назад не вернуть.

Прозрачность решений: без неё умному фильтру нельзя доверять

Чем сложнее система, тем важнее, чтобы она объясняла каждое решение. Без этого вы не отличите защиту от поломки. Минимальный набор прозрачности:

  1. Причина у каждого отказа — не «заблокирован», а конкретно: сеть хостинга, признаки автоматизации, не та страна, похоже на ботов аккаунта.
  2. Разбор отдельного визита — какие сигналы пришли и какие выводы из них сделаны.
  3. Шаг, на котором отсеян трафик — сеть, браузер или поведение; это показывает, какой слой ошибается.
  4. Журнал автоматических изменений — что, когда и почему поменялось само.

Если система не умеет хотя бы этого, слово «умный» в её описании ничего не стоит. Подробнее о критериях выбора — в статье как выбрать сервис фильтрации трафика.

Как устроен умный фильтр трафика в ArtisanClo

Фильтр ArtisanClo собран из тех же частей, и у каждой есть понятное объяснение в кабинете.

Правила для явного. Часть проверок отсекает визит сразу: чёрные списки IP, явный робот-браузер, сервисы проверки объявлений, программы вместо браузера, правила аудиторий — страна, устройство, расписание.

Оценка доверия для спорного. Остальные признаки — VPN, дата-центр, IPv6, отсутствие провайдера или сайта-источника, отсутствие JavaScript и другие — складываются в оценку доверия. Переключатели защиты решают, сколько весит каждый признак, а уровни строгости «Мягко», «Баланс» и «Строго» подбираются под площадку источника.

Умная защита — обучение на истории. С тарифа Professional в «Диагностике» есть вкладка «Умная защита». Модель учится на истории вашего аккаунта: кого вы оплачивали, а кто оказался ботом. Она проверяет только тех, кого уже пропустили остальные правила, и уводит на White Page визиты, похожие на ваших ботов. Пока своих данных мало, работает общая модель. Модель переобучается каждую ночь и отключается сама, если начинает срезать заметную долю конверсий.

Общий список ботов. Сервисы проверки объявлений, программы вместо браузера, роботы-браузеры с доказанными признаками и роботы площадок для превью попадают в общий список с первого же раза, и их следующий визит в любой поток любого клиента сразу получает White Page с причиной «Известный адрес бота». Живых посетителей с сомнительной сетью, VPN или без JavaScript туда не заносят. Адреса дата-центров и хостингов хранятся практически бессрочно, домашние и мобильные — ограниченное время. Кроме того, адрес, пойманный на автоматизации сразу у нескольких клиентов, в течение часа попадает в общий чёрный список IP.

Автопилот — автоматическая подстройка. С Professional автопилот раз в час смотрит на поток и делает не больше одного изменения за раз: включает защиту, если она поймала бы достаточно ботов и не задела бы ни одной оплаты, или снимает правило, которое отсекало посетителей с оплатами. Гео, устройства и расписание он не трогает никогда. Каждое изменение видно в журнале автопилота с объяснением, его можно отменить — и после отмены автопилот эту настройку больше не трогает.

Прозрачность. У каждого клика в журнале — решение и причина из десятков возможных. В статистике видно, на каком шаге отсеян трафик: сеть и запрос, проверка браузера или проверка не вернулась. «Разбор визита» показывает все сигналы и итоговое решение по одному визиту, а рекомендации в «Диагностике» прогоняют прошлые визиты через текущие настройки и показывают, какой фильтр режет трафик с конверсиями. Теневой режим на PHP-файле и в связке с Keitaro или Binom показывает, кого фильтр отсёк бы, никого не отсекая. Если клик ушёл не туда, начните со статьи почему клик ушёл на White Page.

Все возможности защиты собраны на странице возможностей, условия тарифов — на странице тарифов.

Итог

Умный фильтр трафика — это правила для очевидного, оценка доверия для спорного, обучение для того, что правилами не описать, и общая память о доказанных ботах. Его сила в том, что он видит сочетания признаков и подстраивается под ваш трафик. Его риск — в том, что ошибки тоньше и заметить их труднее. Поэтому выбирайте систему не по обещаниям «ловит всех ботов», а по тому, насколько ясно она объясняет каждое решение, умеет ли наблюдать без отсева и останавливается ли сама, когда начинает резать платящих посетителей.

Частые вопросы

01

Что такое умный фильтр трафика?

Это система обнаружения ботов, которая решает судьбу визита не по одному правилу, а по совокупности признаков: сети, браузера, поведения и истории. Она умеет учиться на прошлых решениях и подстраиваться под конкретный трафик. Главное отличие от простого фильтра — способность работать с неочевидными случаями, а не только с явными.

02

Может ли умный фильтр срезать живых людей?

Да, как и любой фильтр. Чем больше система полагается на вероятностные выводы, тем важнее следить за ложными срабатываниями: смотреть, на каких причинах отсеян трафик, и сверять отсев с конверсиями. Хорошая система сама замечает, что начала резать платящих посетителей, и откатывает изменение.

03

Нужно ли настраивать умный фильтр вручную?

Базовые решения всё равно за вами: какие страны и устройства нужны, насколько строго фильтровать, с какой площадки идёт трафик. Обучение и автоматическая подстройка уточняют защиту поверх этих настроек, но не заменяют понимания, кого вы хотите видеть на оффере.

04

Сколько данных нужно, чтобы фильтр начал учиться?

Зависит от системы, но всегда нужна история, где есть и боты, и подтверждённые конверсии. Пока своих данных мало, разумные системы работают на общей модели, обученной на трафике многих аккаунтов, и переходят на персональную, когда накопится достаточно примеров.

05

Почему умный фильтр должен объяснять решения?

Потому что без объяснения нельзя отличить защиту от поломки. Если видно, что визит отсеян, например, за сеть хостинга или за признаки автоматизации, вы можете проверить решение и при необходимости ослабить конкретное правило. Если видно только «заблокирован», остаётся либо верить системе, либо отключать её целиком.

Читать также

9 мин чтения

Репутация IP-адресов: откуда она берётся и почему по ней легко срезать живых

Репутация IP — оценка того, насколько адресу можно доверять, по его прошлому: что с него приходило, кому он принадлежит, в какой сети живёт. Это сильный сигнал для фильтрации трафика, но у него есть слепые зоны, и о них стоит знать до того, как блокировать.

9 мин чтения

Как отфильтровать ботов в рекламном трафике и не потерять живых людей

Фильтрация ботов — это не одна галочка «антибот», а цепочка проверок от IP-адреса до поведения в браузере. Разбираем, как её выстроить, чтобы бюджет уходил на людей.

8 мин чтения

Фильтрация по гео, языку, устройству и расписанию: точный таргетинг на своей стороне

Фильтр по гео, устройству и расписанию — самые понятные правила отбора трафика. Они отсекают нецелевые визиты, которые рекламная площадка всё равно пропустит, и почти не задевают живых покупателей.

Проверьте свой трафик на деле

Подключите ArtisanClo к своему сайту, посмотрите, кто на самом деле приходит по рекламе, и почему каждый клик получил своё решение.