Cách lọc traffic bot trong quảng cáo mà không mất người thật

Lọc bot không phải một ô “anti-bot” để tích, mà là chuỗi kiểm tra từ địa chỉ IP đến hành vi trong trình duyệt. Bài này hướng dẫn cách xây dựng chuỗi đó để ngân sách được chi cho người thật.

Bot và fraud13 phút đọc
Cách lọc traffic bot trong quảng cáo mà không mất người thật
Mục lục
  1. Vì sao phải lọc bot trong quảng cáo
  2. Những loại bot nào đến qua link quảng cáo
  3. Lớp 1. Mạng và yêu cầu
  4. Lớp 2. Kiểm tra trình duyệt
  5. Lớp 3. Hành vi
  6. Đánh giá độ tin cậy thay cho một quy tắc
  7. Cách cấu hình lọc bot: từng bước
  8. Trong ArtisanClo được thiết kế thế nào
  9. Lỗi thường gặp khi lọc bot
  10. Cách kiểm tra lọc bot đang hoạt động
  11. Tóm lại

Bot trong traffic quảng cáo không thể “tắt” bằng một cài đặt: chúng rất khác nhau — từ script thô sơ gọi link từ server tới trình duyệt hoàn chỉnh do chương trình điều khiển, chạy từ mạng gia đình. Vì vậy lọc traffic bot được xây như một phễu, mỗi lớp loại một nhóm tự động hóa riêng, còn người thật đi qua mọi lớp mà không hề nhận ra.

Dưới đây là sơ đồ mà các hệ thống chống bot trưởng thành sử dụng, cùng lời khuyên thực tế để cấu hình nó cho một nguồn cụ thể.

Vì sao phải lọc bot trong quảng cáo

Media buyer (người mua quảng cáo) có ba lý do để giữ anti-bot trên mọi chiến dịch:

  1. Tiền. Click trả phí từ bot là chi phí không có cơ hội chuyển đổi. Với mô hình CPC, bạn trả trực tiếp cho từng khách như vậy.
  2. Bảo vệ chiến dịch. Công cụ spy và parser đi theo link quảng cáo để thu thập creative, landing và offer. Nếu chúng thấy trọn chiến dịch của bạn, một tuần sau đối thủ đã chạy theo, và giá click tăng.
  3. Thống kê sạch. Tối ưu trên dữ liệu lẫn bot là tối ưu theo nhiễu: bạn tắt chiến dịch đang chạy tốt và scale vị trí rác.

Chi tiết về cách công cụ spy thu thập chiến dịch — trong bài chống công cụ spy, còn về click ảo — trong bài click fraud.

Trước khi xây bộ lọc, nên hiểu nó bảo vệ trước ai. Dấu hiệu của từng loại được phân tích kỹ trong bài traffic bot: dấu hiệu và cách nhận biết, ở đây là phân loại ngắn.

Loại Là ai Thường lộ ra thế nào
Robot xem trước crawler lấy tiêu đề và hình ảnh của link user-agent đã biết, mạng của nền tảng và ứng dụng nhắn tin, không có nhãn click
Công cụ spy và máy quét hệ thống thu thập creative và landing của người khác data center, truy cập lặp lại, trình duyệt tự động
Chương trình thay trình duyệt script curl, Python, parser không chạy JavaScript, header lạ
Headless browser Chrome không cửa sổ do chương trình điều khiển dấu vết tự động hóa trong môi trường trình duyệt
Click fraud click ảo từ đối thủ hoặc từ chính vị trí chuỗi lượt từ các địa chỉ giống nhau, không có hành vi
Người ngoài mục tiêu đối thủ, lượt từ GEO khác, link được chuyển tiếp không nhãn quảng cáo, nước khác, VPN hoặc mạng doanh nghiệp

Loại cuối khó nhất: về hình thức là người, nhưng trả tiền và đưa họ tới offer chẳng có ý nghĩa — đơn từ nước khác mạng không nhận, còn đối thủ thì chẳng mua gì. Với nhóm này, thứ có tác dụng không hẳn là dấu hiệu bot mà là bối cảnh lượt truy cập: GEO, nhãn click, mạng.

Lớp 1. Mạng và yêu cầu

Lớp đầu tiên và rẻ nhất kiểm tra những gì đã biết trước khi trang tải: địa chỉ IP, mạng, header của yêu cầu, tham số của link.

Địa chỉ IP và mạng (ASN)

Mỗi IP thuộc về một hệ thống tự trị — ASN, mạng của một nhà khai thác cụ thể. Nhà cung cấp gia đình, nhà mạng di động, cloud hosting và dịch vụ VPN là những mạng khác nhau với uy tín khác nhau. Lượt từ mạng hosting trong traffic quảng cáo gần như luôn là server chứ không phải người cầm điện thoại. Cách phân biệt các mạng này được phân tích trong bài về VPN, proxy và IP data center.

Danh sách đen địa chỉ

Nếu địa chỉ đã bị bắt chắc chắn vì tự động hóa, không cần kiểm tra lại. Danh sách chung các bot đã biết và danh sách đen IP của riêng bạn loại khách quay lại ngay lập tức, không tốn chi phí kiểm tra.

Header và nhãn click

User-agent, ngôn ngữ trình duyệt, có referrer không, tham số như fbclid hay gclid — tất cả đều rẻ để kiểm tra. Script đơn giản thường gửi bộ header thiếu hoặc mâu thuẫn. Còn việc không có nhãn quảng cáo khi chuyển từ quảng cáo là lý do để nhìn kỹ hơn.

Quy tắc chiến dịch

Ở đây còn có giới hạn của riêng bạn: quốc gia, thiết bị, ngôn ngữ, lịch chạy. Nếu bạn chạy cho Đức, lượt từ nước khác có thể loại mà không cần biết đó có phải bot. Chi tiết — trong bài về lọc traffic theo GEO, ngôn ngữ, thiết bị và lịch chạy.

Mẹo. Lớp mạng ít chạm vào người thật nhất: ở đây kích hoạt những dấu hiệu gần như không gặp ở người mua bình thường. Hãy bắt đầu cấu hình từ đây.

Lớp 2. Kiểm tra trình duyệt

Lớp thứ hai là script chạy trong trình duyệt của khách và thu thập thông tin về môi trường. Đây là thứ mà bot tinh vi đã khó giả hơn.

  • JavaScript có chạy không. Chương trình như curl không chạy script — và dừng ở đây.
  • Dấu vết tự động hóa. Cờ điều khiển trình duyệt, sự không khớp giữa trình duyệt khai báo và khả năng thực, các chi tiết đặc trưng cho chế độ headless. Chi tiết — trong bài về headless browser và dấu vân tay trình duyệt.
  • Tính nhất quán của dữ liệu. Múi giờ trình duyệt so với quốc gia của IP, ngôn ngữ hệ thống so với GEO, kích thước màn hình so với thiết bị khai báo. Riêng lẻ, sự lệch không nói lên gì; gộp lại thì thành một bức tranh.

Lưu ý quan trọng: ở lớp này bộ lọc hay nhầm nhất. Trình duyệt tích hợp của mạng xã hội và WebView trong ứng dụng đôi khi trông “lạ” nhưng lại mang tới người thật. Vì vậy một dấu hiệu đơn lẻ không nên quyết định số phận lượt truy cập — nó chỉ nên cộng thêm nghi ngờ.

Lớp 3. Hành vi

Lớp thứ ba là cách khách hành xử trên trang: chuyển động của chuột và ngón tay, tốc độ phản ứng, bao lâu trước khi hành động. Người di chuyển không đều và có ngắt quãng, chương trình thì hoặc không chuyển động, hoặc quá hoàn hảo.

Kiểm tra hành vi bắt được những bot đắt nhất, nhưng cũng tốn hơn: chúng cần chút thời gian để thu thập quan sát. Nên bật chúng với traffic đắt, nơi mỗi bot lọt qua tốn khoản tiền đáng kể, và với các nguồn có nhiều tự động hóa tinh vi.

Đánh giá độ tin cậy thay cho một quy tắc

Sai lầm chính của bộ lọc tự chế là quy tắc “thấy dấu hiệu — chặn”. Người thật bị cắt theo cách này: người dùng bình thường cũng dùng VPN, referrer bị mất trong trình duyệt tích hợp, nhà mạng di động dùng IPv6.

Đúng hơn là chia kiểm tra thành hai loại:

  • Cứng — bot rõ ràng, địa chỉ đã biết, vi phạm quy tắc đối tượng của bạn. Những lượt này bị loại ngay.
  • Mềm — dấu hiệu đáng ngờ. Mỗi dấu hiệu cộng điểm phạt vào đánh giá độ tin cậy, và chỉ khi tổng vượt ngưỡng, khách mới thấy trang an toàn.

Với sơ đồ này, một dấu hiệu yếu không đưa người tới White Page, còn bot có năm điểm “không ổn” cùng lúc thì chắc chắn đi tới đó. Mọi hệ thống chống gian lận đều xây theo cùng nguyên tắc — quy tắc, chấm điểm và danh sách.

Cách cấu hình lọc bot: từng bước

  1. Xác định nguồn. Facebook, Google, TikTok và mạng native có hồ sơ traffic khác nhau: chỗ này mất referrer, chỗ kia nhiều lượt hiển thị lặp. Cài đặt “cho tất cả” gần như luôn kém hơn cài đặt chọn theo nền tảng. Ví dụ phân tích cho Yandex — bài bot trong Yandex Direct.
  2. Chọn mức kiểm tra. Bắt đầu từ mức cân bằng: loại bot đã biết, VPN, proxy và data center, nhưng không đụng tới các dấu hiệu mà người thật hay vấp.
  3. Đặt đối tượng. Quốc gia, thiết bị, ngôn ngữ — theo offer. Đây là bộ lọc dễ hiểu và an toàn nhất.
  4. Chuẩn bị White Page. Lượt bị loại phải đi đâu đó: cần một trang bình thường đúng chủ đề website, không phải màn hình trống hay 403. Phản hồi trống được bot coi là tín hiệu để điều chỉnh, còn người bị loại nhầm sẽ nghĩ website hỏng.
  5. Chạy và xem nhật ký. Vài trăm click đầu tiên sẽ cho thấy bộ lọc loại ai và vì sao.
  6. Điều chỉnh có chọn lọc. Nếu người thật rõ ràng bị loại — hãy nới đúng phép kiểm tra đó, không phải toàn bộ bảo vệ.

Trong ArtisanClo được thiết kế thế nào

Trong ArtisanClo, lọc bot được cấu hình ở bước “Lọc” trong biểu mẫu luồng. Các đòn bẩy chính:

  • Mức độ kiểm tra — “Nhẹ”, “Cân bằng” và “Nghiêm ngặt”. Khi chọn nguồn traffic, bảo vệ được điều chỉnh theo nền tảng: ví dụ với Facebook, kiểm tra referrer bị tắt vì trong trình duyệt tích hợp nó thường bị mất.
  • Công tắc bảo vệ — chặn theo danh sách đen IP, VPN và proxy, ASN datacenter, headless browser, yêu cầu JS, kiểm tra tương tác thật và nhiều thứ khác.
  • Đối tượng — danh sách quốc gia, thiết bị, hệ điều hành, trình duyệt, ngôn ngữ, múi giờ, thành phố và vùng ở chế độ “Cho phép” hoặc “Chặn”.

Một phần kiểm tra loại lượt truy cập ngay: danh sách đen, trình duyệt robot rõ ràng, quy tắc đối tượng. Phần còn lại cộng vào đánh giá độ tin cậy. Công cụ spy, chương trình thay trình duyệt và robot xem trước link luôn đi tới White Page với bất kỳ cài đặt nào. Còn địa chỉ được nhận diện chắc chắn là bot ở bất kỳ khách hàng nào sẽ vào danh sách chung, và lượt tiếp theo của nó vào bất kỳ luồng nào sẽ nhận White Page ngay.

Mỗi quyết định được giải thích bằng lý do trong nhật ký click: “VPN hoặc proxy bị chặn”, “Phát hiện trình duyệt headless”, “Điểm tin cậy quá thấp” và hàng chục lý do khác. Phía trên danh sách lý do trong thống kê có thể thấy lượt truy cập bị loại ở bước nào: mạng và yêu cầu, kiểm tra trình duyệt hay kiểm tra không quay lại. Nếu tỷ lệ bị từ chối ở bước kiểm tra trình duyệt tăng, đó là lý do xem lại mức kiểm tra — ở đó khả năng nhầm cao nhất.

Lo rằng bộ lọc đang cắt người thật? Bật chế độ shadow vài giờ: khi kết nối bằng file PHP, bộ lọc không loại ai mà chỉ đánh dấu những ai nó lẽ ra đã chặn. Danh sách tính năng đầy đủ — ở trang tính năng ArtisanClo.

Lỗi thường gặp khi lọc bot

  • Mức nghiêm tối đa “phòng khi cần”. Cài đặt gắt cắt cả một phần người mua thật cùng với bot. Mức nghiêm ngặt hợp lý ở nguồn có tỷ lệ bot lớn và sau khi bạn đã xem traffic của mình, không phải ở khắp nơi.
  • Đánh giá bộ lọc theo tỷ lệ qua. Tỷ lệ lượt tới offer cao không phải dấu hiệu bảo vệ kém: với traffic mua có nhãn click đã xác minh, tỷ lệ này có thể rất cao, và đó là bình thường. Đáng lo là ngược lại, khi gần như không ai tới được offer.
  • Chặn theo một dấu hiệu. VPN, không có referrer, IPv6 riêng lẻ đều gặp ở người thật.
  • Script bảo vệ được tải bất đồng bộ. Nếu mã kiểm tra chạy sau khi trang hiện, bot kịp thấy offer. Mã phải tải đầu tiên — xem bài cách cài cloaker lên website.
  • Không có phản hồi. Bộ lọc không có nhật ký lý do là hộp đen. Bạn sẽ không biết cài đặt của nó đang cắt gì cho đến khi chuyển đổi giảm.

Cách kiểm tra lọc bot đang hoạt động

Cấu hình bảo vệ mới là một nửa. Nửa còn lại là bảo đảm nó loại đúng người cần loại. Vài kiểm tra đơn giản trước khi chạy và trong những ngày đầu:

  1. Mở link như bot. Truy cập landing từ mạng hosting hoặc qua VPN, không có nhãn click quảng cáo. Bạn phải thấy trang an toàn chứ không phải offer.
  2. Mở link như người mua. Từ điện thoại qua internet di động, theo link có nhãn click của nền tảng. Offer phải mở ra — không có độ trễ đáng kể.
  3. Kiểm tra trình duyệt tích hợp. Gửi link cho chính mình qua ứng dụng nhắn tin hoặc mở từ ứng dụng mạng xã hội: traffic thật thường đến đúng theo cách này.
  4. Xem vài trăm click đầu tiên. Lý do từ chối nào gặp nhiều nhất? Nếu đứng đầu là thứ gần như không xuất hiện ở bot — bộ lọc đã quá tay.
  5. So với chuyển đổi. Nếu click qua được mà không có lead, đừng chỉ tìm vấn đề ở bot: kiểm tra offer, form và việc truyền chuyển đổi.

Mẹo. Hãy thêm thiết bị test của bạn vào danh sách trắng IP của luồng — nếu không bạn sẽ phải đấu với chính lớp bảo vệ của mình và lẫn lượt của mình với của người khác.

Tóm lại

Chỉ có thể lọc traffic bot đáng tin cậy theo từng lớp: mạng và địa chỉ, kiểm tra trình duyệt, hành vi — và đánh giá độ tin cậy bên trên, để một dấu hiệu ngẫu nhiên không khiến bạn mất người mua thật. Hãy cấu hình bảo vệ theo nguồn, bắt đầu từ mức cân bằng, xem lý do quyết định và siết có chọn lọc. Bộ lọc không bảo đảm tài khoản sẽ không bị khóa — điều đó còn phụ thuộc vào creative, tên miền và chính offer — và không thay thế việc tuân thủ quy định của nền tảng. Nhiệm vụ của nó khác: để ngân sách đến với người thật, thống kê phản ánh đúng thực tế, và chiến dịch không bị công cụ spy lấy mất.

Câu hỏi thường gặp

01

Anti-bot khác cloaker thế nào?

Anti-bot chỉ quyết định trước mặt nó là người hay chương trình, và thường chỉ chặn lượt đáng ngờ. Cloaker làm điều tương tự, nhưng thay vì chặn, nó đưa lượt bị loại tới White Page đã chọn, còn người thật tới offer, và giải thích mỗi quyết định bằng lý do trong nhật ký. Với affiliate marketing, mô hình thứ hai tiện hơn: bot không nhận lỗi để từ đó điều chỉnh, còn bạn thấy ai bị loại và vì sao.

02

Có thể lọc bot bằng công cụ của chính nền tảng quảng cáo không?

Một phần. Nền tảng loại traffic không hợp lệ rõ ràng và đôi khi hoàn tiền, nhưng bộ lọc của họ phục vụ lợi ích nền tảng chứ không phải landing của bạn. Công cụ spy, máy quét và bot mở link không qua quảng cáo thì nó hoàn toàn không thấy. Vì vậy vẫn cần bộ lọc riêng ở phía bạn.

03

Sau khi cấu hình bộ lọc, bao nhiêu traffic nên bị loại là bot?

Không có chuẩn chung. Tỷ lệ loại phụ thuộc nguồn: với traffic mua có truyền nhãn click, phần lớn lượt có thể tới offer, còn traffic push hay pop giá rẻ có thể có rất nhiều bot. Tín hiệu đáng lo là khác: nếu gần như không ai tới được offer, nhiều khả năng bộ lọc đang cắt người thật.

04

Có cần captcha để chống bot trên landing không?

Với landing quảng cáo, captcha có hại: nó làm giảm chuyển đổi ở người thật, nhất là trên điện thoại, còn bot hiện đại giải nó qua dịch vụ nhận dạng. Kiểm tra trình duyệt và mạng vô hình làm cùng nhiệm vụ mà khách không phải làm gì.

05

Vì sao bot vẫn lọt qua dù bảo vệ đã bật?

Bot tốt có thể trông như trình duyệt bình thường từ mạng gia đình. Hãy xem thẻ click trong nhật ký: có những dấu hiệu nào, mạng gì, script có chạy không. Nếu những lượt như vậy lặp lại, hãy tăng mức kiểm tra, bật kiểm tra tương tác thật hoặc chặn nguồn theo vị trí và mạng.

Đọc thêm

Xem lưu lượng thật của bạn

Kết nối ArtisanClo với trang web của bạn, xem ai thực sự đến từ quảng cáo và vì sao mỗi lượt nhấp nhận quyết định đó.