Filtro de tráfico inteligente: cómo funciona un sistema de detección de bots

Un filtro de tráfico inteligente no se limita a revisar la visita con una lista de reglas: pondera decenas de señales, aprende del historial y se ajusta a tu tráfico. Vemos qué hay detrás, dónde se equivoca y cómo controlar sus decisiones.

Bots y fraude12 min de lectura
Filtro de tráfico inteligente: cómo funciona un sistema de detección de bots
Contenido
  1. En qué se diferencia un filtro inteligente de un conjunto de reglas
  2. De qué se compone un sistema de detección de bots
  3. Aprender del historial: cómo se vuelve más listo el filtro
  4. La lista común de bots demostrados
  5. Ajuste automático de la protección
  6. Riesgos: cuándo un filtro inteligente corta a personas reales
  7. Decisiones transparentes: sin ellas no se puede confiar en un filtro inteligente
  8. Cómo funciona el filtro de tráfico inteligente de ArtisanClo
  9. En resumen

Un filtro de tráfico inteligente (smart traffic filter) es un sistema de detección de bots que decide sobre una visita no con una sola regla, sino combinando muchas señales: red, navegador, comportamiento e historial. Pondera las señales en una puntuación de confianza común, aprende de los datos pasados (quién resultó ser un bot y quién trajo dinero) y ajusta la protección a un tráfico concreto.

Un filtro simple responde a la pregunta «¿se ha incumplido una regla?». Uno inteligente, a «¿cuánto se parece esta visita a la persona que nos interesa?». A continuación vemos de qué se compone un sistema así, en qué supera a un conjunto de reglas, cuáles son sus puntos débiles y por qué sin decisiones transparentes no se puede confiar en él.

En qué se diferencia un filtro inteligente de un conjunto de reglas

Un filtro clásico es una lista de condiciones: país fuera de la lista, página de relleno; IP de centro de datos, página de relleno; sin JavaScript, página de relleno. Funciona con lo evidente, pero falla en los casos dudosos.

Conjunto de reglas Filtro de tráfico inteligente
Cómo decide Una regla que salta significa rechazo Las señales se suman en una puntuación de confianza
Visitas dudosas O corta a todas o deja pasar a todas Una señal dudosa añade sospecha, pero no decide sola
Adaptación Solo editando a mano Aprende del historial y de la experiencia común
Bots nuevos Pasan hasta que alguien escribe la regla El parecido con bots conocidos atrapa también variantes nuevas
Riesgo Previsible, pero tosco Más fino, pero exige control y explicaciones

Tomemos una visita con VPN. Un conjunto de reglas tiene que elegir: bloquear todas las VPN y perder a parte de las personas reales, o dejarlas pasar todas y dejar entrar a los bots. Un filtro inteligente tendrá en cuenta la VPN como una señal más: si lo demás está en orden (navegador auténtico, script ejecutado, identificador de clic de la plataforma), la visita pasa; si a la VPN se suman una red de hosting y rastros de automatización, la suma de sospechas decide.

Importante: un filtro inteligente no anula las reglas. Los casos evidentes (un programa en lugar de navegador, una dirección de la lista negra, un país que no encaja) se siguen cortando de inmediato. La «inteligencia» hace falta para la zona intermedia, donde una regla se equivoca en ambas direcciones. El esquema general de las capas de protección lo vimos en el artículo sobre cómo filtrar bots.

De qué se compone un sistema de detección de bots

Cualquier bot detection system actual tiene cuatro partes.

1. Señales

Cuantas más señales independientes, más le cuesta a un bot falsificarlas todas a la vez:

  • Red: tipo de dirección (doméstica, móvil, hosting), VPN y proxies, proveedor, ASN; más detalles en el artículo sobre VPN, proxies e IP de centros de datos;
  • Petición: cabeceras, cadena user agent, identificador de clic de la plataforma, sitio de origen; por qué la cadena UA por sí sola demuestra poco lo explica el artículo sobre el filtrado por user agent;
  • Navegador: ejecución de JavaScript, señales de automatización, coherencia de las propiedades; ver el artículo sobre navegadores headless y huella digital;
  • Comportamiento: tiempo en la página, movimiento del ratón y toques;
  • Historial: si esta dirección ya apareció antes y cómo terminaron las visitas anteriores.

2. Puntuación de confianza

Las señales se reducen a una sola magnitud: la puntuación de confianza (trust score). Cada señal sospechosa baja la confianza, y si se acumulan demasiadas sospechas, la visita se descarta. El peso de cada señal depende del contexto: que falte el sitio de origen es sospechoso en unas plataformas y totalmente normal en otras.

3. Aprendizaje

El aprendizaje responde a una pregunta que las reglas no se plantean: cómo son tus bots y tus compradores. El modelo mira el historial (qué visitas acabaron en pago y cuáles resultaron ser bots) y encuentra patrones que una persona no formularía como regla.

4. Memoria

Un bot atrapado con seguridad una vez probablemente vuelva. Una lista común de bots demostrados permite no revisarlo de nuevo: la siguiente visita desde la misma dirección se corta al instante. Cuanto más tráfico ve el sistema, más útil es esa memoria, y por eso se hace común para todos los clientes del servicio.

Aprender del historial: cómo se vuelve más listo el filtro

El aprendizaje es la parte más potente y más traicionera de un filtro inteligente.

Potente, porque el modelo ve lo que las reglas pasaron por alto. Un bot que se hace pasar perfectamente por un navegador igualmente no se comporta como tus compradores: otras horas, otras redes, otra combinación de señales. Un modelo entrenado con el historial de la cuenta nota esa diferencia.

Traicionera, porque el modelo aprende de lo que se le muestra. Si en el historial hay pocas conversiones, se hace una idea pobre del comprador. Si el tráfico cambió (nueva plataforma, nuevo geo, nueva creatividad), los patrones antiguos dejan de funcionar. Por eso los buenos sistemas de aprendizaje tienen tres mecanismos de protección:

  1. Un modelo común para empezar. Mientras haya pocos datos propios, funciona un modelo entrenado con muchas cuentas.
  2. Reentrenamiento periódico. El modelo se actualiza con datos frescos, en lugar de vivir años con una foto antigua.
  3. Un fusible por conversiones. Si el modelo empieza a cortar una parte notable de los visitantes que pagan, se desactiva en lugar de seguir cortando dinero.

La lista común de bots demostrados

La lista de bots funciona como una inmunidad colectiva: lo que se atrapó en un cliente ya no pasará en ninguno. Pero tiene un riesgo evidente: meter en ella a una persona real. La dirección de un operador móvil que hoy usó un bot puede tocarle mañana a un abonado normal.

Por eso tiene sentido incluir en esa lista solo a bots demostrados, no a todos los sospechosos, y guardar las entradas con plazos distintos: las direcciones de hosting y de centros de datos cambian de dueño rara vez; las domésticas y móviles, a menudo. Cómo se organizan las listas de direcciones lo cuenta el artículo sobre la lista negra de IP.

Ajuste automático de la protección

El último escalón es un sistema que no solo decide en cada visita, sino que cambia su propia configuración: activa una protección que atraparía bots en ese tráfico o quita una regla que corta a visitantes que pagan. Ahorra tiempo al media buyer, pero exige tres límites:

  • Pasos pequeños. Un cambio cada vez y no con más frecuencia de un intervalo dado; si no, no se sabe qué influyó en el resultado.
  • Decisiones intocables. Los geos, los dispositivos y el horario son decisiones de negocio, no protección; la automatización no debe tocarlas.
  • Deshacer. Cada cambio debe verse con su explicación y poder deshacerse con un botón.

Riesgos: cuándo un filtro inteligente corta a personas reales

El riesgo principal de cualquier filtro son los falsos positivos. En uno inteligente se notan menos, porque la decisión se forma con muchas aportaciones pequeñas y no se reduce a una sola regla comprensible.

Señales de que el filtro está cortando personas:

  • la conversión cae a la vez que sube el descarte, aunque la plataforma y la creatividad no cambiaron;
  • llega a la oferta una proporción muy pequeña de visitas: motivo para revisar la configuración, sobre todo en tráfico de pago con identificador de clic;
  • el descarte crece en el paso de comprobación del navegador, justo donde el filtro se equivoca más a menudo;
  • entre lo descartado hay muchos navegadores integrados de redes sociales y redes móviles.

Fíjate en que la regla inversa no existe: una tasa de paso alta por sí sola no indica una mala protección. En una fuente de pago con un click id verificado, la mayoría de las visitas puede llegar a la oferta, y es normal. Cómo distinguir el tráfico bueno del malo en los informes lo explica el artículo sobre las señales del tráfico de bots.

Consejo. Antes de endurecer la protección, mira a quién cortaría sin cortar a nadie. El modo observación cuesta poco, y las conversiones cortadas no vuelven.

Decisiones transparentes: sin ellas no se puede confiar en un filtro inteligente

Cuanto más complejo es el sistema, más importante es que explique cada decisión. Sin eso no distinguirás la protección de una avería. El mínimo de transparencia:

  1. Un motivo para cada rechazo: no «bloqueado», sino algo concreto: red de hosting, señales de automatización, país equivocado, parecido a los bots de la cuenta.
  2. El detalle de cada visita: qué señales llegaron y qué conclusiones se sacaron.
  3. El paso en el que se descartó el tráfico: red, navegador o comportamiento; muestra qué capa se equivoca.
  4. Un registro de los cambios automáticos: qué cambió por sí solo, cuándo y por qué.

Si un sistema no sabe hacer al menos esto, la palabra «inteligente» en su descripción no vale nada. Más sobre los criterios de elección en el artículo cómo elegir un servicio de filtrado de tráfico.

Cómo funciona el filtro de tráfico inteligente de ArtisanClo

El filtro de ArtisanClo se compone de esas mismas partes, y cada una tiene su explicación clara en la cuenta.

Reglas para lo evidente. Parte de las comprobaciones corta la visita al instante: listas negras de IP, un navegador robot evidente, servicios de revisión de anuncios, programas en lugar de navegadores y las reglas de audiencia: país, dispositivo, horario.

Puntuación de confianza para lo dudoso. El resto de señales (VPN, centro de datos, IPv6, falta de proveedor o de sitio de origen, falta de JavaScript y otras) se suman en una puntuación de confianza. Los interruptores de protección deciden cuánto pesa cada señal, y los niveles de rigor «Suave», «Equilibrado» y «Estricto» se ajustan a la plataforma de origen.

Guardia extra: aprendizaje con el historial. Desde el plan Professional, en «Diagnóstico» está la pestaña «Guardia extra». El modelo aprende del historial de tu cuenta: a quién pagaste y quién resultó ser un bot. Solo revisa a quienes ya dejaron pasar las demás reglas, y manda a la White Page las visitas que se parecen a tus bots. Mientras haya pocos datos propios, funciona un modelo común. El modelo se reentrena cada noche y se desactiva solo si empieza a cortar una parte notable de las conversiones.

Lista común de bots. Los servicios de revisión de anuncios, los programas en lugar de navegadores, los navegadores robot con señales demostradas y los robots de vista previa de las plataformas entran en la lista común a la primera, y su siguiente visita a cualquier flujo de cualquier cliente recibe enseguida la White Page con el motivo «Dirección de bot conocida». Los visitantes reales con una red dudosa, VPN o sin JavaScript no se incluyen. Las direcciones de centros de datos y hostings se guardan prácticamente sin límite; las domésticas y móviles, durante un tiempo limitado. Además, una dirección atrapada en automatización en varios clientes a la vez entra en una hora en la lista negra común de IP.

Autoajuste: el ajuste automático. Desde Professional, el autoajuste revisa el flujo una vez por hora y hace como máximo un cambio cada vez: activa una protección si habría atrapado suficientes bots sin tocar ningún pago, o quita una regla que cortaba a visitantes con pagos. Nunca toca los geos, los dispositivos ni el horario. Cada cambio se ve en el registro del autoajuste con su explicación y se puede deshacer, y tras deshacerlo el autoajuste ya no vuelve a tocar esa configuración.

Transparencia. Cada clic del registro tiene su decisión y su motivo entre decenas posibles. En las estadísticas se ve en qué paso se descartó el tráfico: «Red y petición», «Comprobación del navegador» o «La comprobación no volvió». El «Informe de la visita» muestra todas las señales y la decisión final de una visita, y las recomendaciones de «Diagnóstico» pasan las visitas anteriores por la configuración actual y muestran qué filtro corta tráfico con conversiones. El modo sombra, con el archivo PHP y con Keitaro o Binom, muestra a quién habría cortado el filtro sin cortar a nadie. Si un clic no fue adonde esperabas, empieza por el artículo por qué el clic fue a la White Page.

Todas las posibilidades de protección están en la página de funciones, y las condiciones de los planes, en la página de planes.

En resumen

Un filtro de tráfico inteligente son reglas para lo evidente, una puntuación de confianza para lo dudoso, aprendizaje para lo que no se puede describir con reglas y una memoria común de bots demostrados. Su fuerza está en que ve combinaciones de señales y se ajusta a tu tráfico. Su riesgo, en que sus errores son más finos y cuesta más verlos. Por eso, elige un sistema no por promesas de que «atrapa a todos los bots», sino por lo claro que explica cada decisión, si sabe observar sin descartar y si se detiene solo cuando empieza a cortar a visitantes que pagan.

Preguntas frecuentes

01

¿Qué es un filtro de tráfico inteligente?

Es un sistema de detección de bots que decide el destino de una visita no con una sola regla, sino con el conjunto de señales: red, navegador, comportamiento e historial. Sabe aprender de decisiones anteriores y ajustarse a un tráfico concreto. Su principal diferencia con un filtro simple es que puede trabajar con los casos dudosos, no solo con los evidentes.

02

¿Puede un filtro inteligente cortar a personas reales?

Sí, como cualquier filtro. Cuanto más se apoya el sistema en conclusiones probabilísticas, más importante es vigilar los falsos positivos: mirar por qué motivos se descartó el tráfico y cruzar el descarte con las conversiones. Un buen sistema detecta por sí mismo que ha empezado a cortar a visitantes que pagan y revierte el cambio.

03

¿Hay que configurar a mano un filtro inteligente?

Las decisiones básicas siguen siendo tuyas: qué países y dispositivos necesitas, con qué rigor filtrar y de qué plataforma llega el tráfico. El aprendizaje y el ajuste automático afinan la protección sobre esa configuración, pero no sustituyen saber a quién quieres ver en la oferta.

04

¿Cuántos datos hacen falta para que el filtro empiece a aprender?

Depende del sistema, pero siempre hace falta un historial con bots y con conversiones confirmadas. Mientras haya pocos datos propios, los sistemas sensatos usan un modelo común entrenado con el tráfico de muchas cuentas y pasan a uno personal cuando se acumulan suficientes ejemplos.

05

¿Por qué un filtro inteligente debe explicar sus decisiones?

Porque sin explicación no se puede distinguir la protección de una avería. Si ves que una visita se descartó, por ejemplo, por una red de hosting o por señales de automatización, puedes comprobar la decisión y, si hace falta, suavizar una regla concreta. Si solo ves «bloqueado», solo te queda fiarte del sistema o desactivarlo entero.

Sigue leyendo

Comprueba tu tráfico en la práctica

Conecta ArtisanClo a tu sitio, mira quién llega realmente desde tus anuncios y por qué cada clic recibió su decisión.