Bot trong traffic quảng cáo không thể “tắt” bằng một cài đặt: chúng rất khác nhau — từ script thô sơ gọi link từ server tới trình duyệt hoàn chỉnh do chương trình điều khiển, chạy từ mạng gia đình. Vì vậy lọc traffic bot được xây như một phễu, mỗi lớp loại một nhóm tự động hóa riêng, còn người thật đi qua mọi lớp mà không hề nhận ra.
Dưới đây là sơ đồ mà các hệ thống chống bot trưởng thành sử dụng, cùng lời khuyên thực tế để cấu hình nó cho một nguồn cụ thể.
Vì sao phải lọc bot trong quảng cáo
Media buyer (người mua quảng cáo) có ba lý do để giữ anti-bot trên mọi chiến dịch:
- Tiền. Click trả phí từ bot là chi phí không có cơ hội chuyển đổi. Với mô hình CPC, bạn trả trực tiếp cho từng khách như vậy.
- Bảo vệ chiến dịch. Công cụ spy và parser đi theo link quảng cáo để thu thập creative, landing và offer. Nếu chúng thấy trọn chiến dịch của bạn, một tuần sau đối thủ đã chạy theo, và giá click tăng.
- Thống kê sạch. Tối ưu trên dữ liệu lẫn bot là tối ưu theo nhiễu: bạn tắt chiến dịch đang chạy tốt và scale vị trí rác.
Chi tiết về cách công cụ spy thu thập chiến dịch — trong bài chống công cụ spy, còn về click ảo — trong bài click fraud.
Những loại bot nào đến qua link quảng cáo
Trước khi xây bộ lọc, nên hiểu nó bảo vệ trước ai. Dấu hiệu của từng loại được phân tích kỹ trong bài traffic bot: dấu hiệu và cách nhận biết, ở đây là phân loại ngắn.
| Loại | Là ai | Thường lộ ra thế nào |
|---|---|---|
| Robot xem trước | crawler lấy tiêu đề và hình ảnh của link | user-agent đã biết, mạng của nền tảng và ứng dụng nhắn tin, không có nhãn click |
| Công cụ spy và máy quét | hệ thống thu thập creative và landing của người khác | data center, truy cập lặp lại, trình duyệt tự động |
| Chương trình thay trình duyệt | script curl, Python, parser | không chạy JavaScript, header lạ |
| Headless browser | Chrome không cửa sổ do chương trình điều khiển | dấu vết tự động hóa trong môi trường trình duyệt |
| Click fraud | click ảo từ đối thủ hoặc từ chính vị trí | chuỗi lượt từ các địa chỉ giống nhau, không có hành vi |
| Người ngoài mục tiêu | đối thủ, lượt từ GEO khác, link được chuyển tiếp | không nhãn quảng cáo, nước khác, VPN hoặc mạng doanh nghiệp |
Loại cuối khó nhất: về hình thức là người, nhưng trả tiền và đưa họ tới offer chẳng có ý nghĩa — đơn từ nước khác mạng không nhận, còn đối thủ thì chẳng mua gì. Với nhóm này, thứ có tác dụng không hẳn là dấu hiệu bot mà là bối cảnh lượt truy cập: GEO, nhãn click, mạng.
Lớp 1. Mạng và yêu cầu
Lớp đầu tiên và rẻ nhất kiểm tra những gì đã biết trước khi trang tải: địa chỉ IP, mạng, header của yêu cầu, tham số của link.
Địa chỉ IP và mạng (ASN)
Mỗi IP thuộc về một hệ thống tự trị — ASN, mạng của một nhà khai thác cụ thể. Nhà cung cấp gia đình, nhà mạng di động, cloud hosting và dịch vụ VPN là những mạng khác nhau với uy tín khác nhau. Lượt từ mạng hosting trong traffic quảng cáo gần như luôn là server chứ không phải người cầm điện thoại. Cách phân biệt các mạng này được phân tích trong bài về VPN, proxy và IP data center.
Danh sách đen địa chỉ
Nếu địa chỉ đã bị bắt chắc chắn vì tự động hóa, không cần kiểm tra lại. Danh sách chung các bot đã biết và danh sách đen IP của riêng bạn loại khách quay lại ngay lập tức, không tốn chi phí kiểm tra.
Header và nhãn click
User-agent, ngôn ngữ trình duyệt, có referrer không, tham số như fbclid hay gclid — tất cả đều rẻ để kiểm tra. Script đơn giản thường gửi bộ header thiếu hoặc mâu thuẫn. Còn việc không có nhãn quảng cáo khi chuyển từ quảng cáo là lý do để nhìn kỹ hơn.
Quy tắc chiến dịch
Ở đây còn có giới hạn của riêng bạn: quốc gia, thiết bị, ngôn ngữ, lịch chạy. Nếu bạn chạy cho Đức, lượt từ nước khác có thể loại mà không cần biết đó có phải bot. Chi tiết — trong bài về lọc traffic theo GEO, ngôn ngữ, thiết bị và lịch chạy.
Mẹo. Lớp mạng ít chạm vào người thật nhất: ở đây kích hoạt những dấu hiệu gần như không gặp ở người mua bình thường. Hãy bắt đầu cấu hình từ đây.
Lớp 2. Kiểm tra trình duyệt
Lớp thứ hai là script chạy trong trình duyệt của khách và thu thập thông tin về môi trường. Đây là thứ mà bot tinh vi đã khó giả hơn.
- JavaScript có chạy không. Chương trình như curl không chạy script — và dừng ở đây.
- Dấu vết tự động hóa. Cờ điều khiển trình duyệt, sự không khớp giữa trình duyệt khai báo và khả năng thực, các chi tiết đặc trưng cho chế độ headless. Chi tiết — trong bài về headless browser và dấu vân tay trình duyệt.
- Tính nhất quán của dữ liệu. Múi giờ trình duyệt so với quốc gia của IP, ngôn ngữ hệ thống so với GEO, kích thước màn hình so với thiết bị khai báo. Riêng lẻ, sự lệch không nói lên gì; gộp lại thì thành một bức tranh.
Lưu ý quan trọng: ở lớp này bộ lọc hay nhầm nhất. Trình duyệt tích hợp của mạng xã hội và WebView trong ứng dụng đôi khi trông “lạ” nhưng lại mang tới người thật. Vì vậy một dấu hiệu đơn lẻ không nên quyết định số phận lượt truy cập — nó chỉ nên cộng thêm nghi ngờ.
Lớp 3. Hành vi
Lớp thứ ba là cách khách hành xử trên trang: chuyển động của chuột và ngón tay, tốc độ phản ứng, bao lâu trước khi hành động. Người di chuyển không đều và có ngắt quãng, chương trình thì hoặc không chuyển động, hoặc quá hoàn hảo.
Kiểm tra hành vi bắt được những bot đắt nhất, nhưng cũng tốn hơn: chúng cần chút thời gian để thu thập quan sát. Nên bật chúng với traffic đắt, nơi mỗi bot lọt qua tốn khoản tiền đáng kể, và với các nguồn có nhiều tự động hóa tinh vi.
Đánh giá độ tin cậy thay cho một quy tắc
Sai lầm chính của bộ lọc tự chế là quy tắc “thấy dấu hiệu — chặn”. Người thật bị cắt theo cách này: người dùng bình thường cũng dùng VPN, referrer bị mất trong trình duyệt tích hợp, nhà mạng di động dùng IPv6.
Đúng hơn là chia kiểm tra thành hai loại:
- Cứng — bot rõ ràng, địa chỉ đã biết, vi phạm quy tắc đối tượng của bạn. Những lượt này bị loại ngay.
- Mềm — dấu hiệu đáng ngờ. Mỗi dấu hiệu cộng điểm phạt vào đánh giá độ tin cậy, và chỉ khi tổng vượt ngưỡng, khách mới thấy trang an toàn.
Với sơ đồ này, một dấu hiệu yếu không đưa người tới White Page, còn bot có năm điểm “không ổn” cùng lúc thì chắc chắn đi tới đó. Mọi hệ thống chống gian lận đều xây theo cùng nguyên tắc — quy tắc, chấm điểm và danh sách.
Cách cấu hình lọc bot: từng bước
- Xác định nguồn. Facebook, Google, TikTok và mạng native có hồ sơ traffic khác nhau: chỗ này mất referrer, chỗ kia nhiều lượt hiển thị lặp. Cài đặt “cho tất cả” gần như luôn kém hơn cài đặt chọn theo nền tảng. Ví dụ phân tích cho Yandex — bài bot trong Yandex Direct.
- Chọn mức kiểm tra. Bắt đầu từ mức cân bằng: loại bot đã biết, VPN, proxy và data center, nhưng không đụng tới các dấu hiệu mà người thật hay vấp.
- Đặt đối tượng. Quốc gia, thiết bị, ngôn ngữ — theo offer. Đây là bộ lọc dễ hiểu và an toàn nhất.
- Chuẩn bị White Page. Lượt bị loại phải đi đâu đó: cần một trang bình thường đúng chủ đề website, không phải màn hình trống hay 403. Phản hồi trống được bot coi là tín hiệu để điều chỉnh, còn người bị loại nhầm sẽ nghĩ website hỏng.
- Chạy và xem nhật ký. Vài trăm click đầu tiên sẽ cho thấy bộ lọc loại ai và vì sao.
- Điều chỉnh có chọn lọc. Nếu người thật rõ ràng bị loại — hãy nới đúng phép kiểm tra đó, không phải toàn bộ bảo vệ.
Trong ArtisanClo được thiết kế thế nào
Trong ArtisanClo, lọc bot được cấu hình ở bước “Lọc” trong biểu mẫu luồng. Các đòn bẩy chính:
- Mức độ kiểm tra — “Nhẹ”, “Cân bằng” và “Nghiêm ngặt”. Khi chọn nguồn traffic, bảo vệ được điều chỉnh theo nền tảng: ví dụ với Facebook, kiểm tra referrer bị tắt vì trong trình duyệt tích hợp nó thường bị mất.
- Công tắc bảo vệ — chặn theo danh sách đen IP, VPN và proxy, ASN datacenter, headless browser, yêu cầu JS, kiểm tra tương tác thật và nhiều thứ khác.
- Đối tượng — danh sách quốc gia, thiết bị, hệ điều hành, trình duyệt, ngôn ngữ, múi giờ, thành phố và vùng ở chế độ “Cho phép” hoặc “Chặn”.
Một phần kiểm tra loại lượt truy cập ngay: danh sách đen, trình duyệt robot rõ ràng, quy tắc đối tượng. Phần còn lại cộng vào đánh giá độ tin cậy. Công cụ spy, chương trình thay trình duyệt và robot xem trước link luôn đi tới White Page với bất kỳ cài đặt nào. Còn địa chỉ được nhận diện chắc chắn là bot ở bất kỳ khách hàng nào sẽ vào danh sách chung, và lượt tiếp theo của nó vào bất kỳ luồng nào sẽ nhận White Page ngay.
Mỗi quyết định được giải thích bằng lý do trong nhật ký click: “VPN hoặc proxy bị chặn”, “Phát hiện trình duyệt headless”, “Điểm tin cậy quá thấp” và hàng chục lý do khác. Phía trên danh sách lý do trong thống kê có thể thấy lượt truy cập bị loại ở bước nào: mạng và yêu cầu, kiểm tra trình duyệt hay kiểm tra không quay lại. Nếu tỷ lệ bị từ chối ở bước kiểm tra trình duyệt tăng, đó là lý do xem lại mức kiểm tra — ở đó khả năng nhầm cao nhất.
Lo rằng bộ lọc đang cắt người thật? Bật chế độ shadow vài giờ: khi kết nối bằng file PHP, bộ lọc không loại ai mà chỉ đánh dấu những ai nó lẽ ra đã chặn. Danh sách tính năng đầy đủ — ở trang tính năng ArtisanClo.
Lỗi thường gặp khi lọc bot
- Mức nghiêm tối đa “phòng khi cần”. Cài đặt gắt cắt cả một phần người mua thật cùng với bot. Mức nghiêm ngặt hợp lý ở nguồn có tỷ lệ bot lớn và sau khi bạn đã xem traffic của mình, không phải ở khắp nơi.
- Đánh giá bộ lọc theo tỷ lệ qua. Tỷ lệ lượt tới offer cao không phải dấu hiệu bảo vệ kém: với traffic mua có nhãn click đã xác minh, tỷ lệ này có thể rất cao, và đó là bình thường. Đáng lo là ngược lại, khi gần như không ai tới được offer.
- Chặn theo một dấu hiệu. VPN, không có referrer, IPv6 riêng lẻ đều gặp ở người thật.
- Script bảo vệ được tải bất đồng bộ. Nếu mã kiểm tra chạy sau khi trang hiện, bot kịp thấy offer. Mã phải tải đầu tiên — xem bài cách cài cloaker lên website.
- Không có phản hồi. Bộ lọc không có nhật ký lý do là hộp đen. Bạn sẽ không biết cài đặt của nó đang cắt gì cho đến khi chuyển đổi giảm.
Cách kiểm tra lọc bot đang hoạt động
Cấu hình bảo vệ mới là một nửa. Nửa còn lại là bảo đảm nó loại đúng người cần loại. Vài kiểm tra đơn giản trước khi chạy và trong những ngày đầu:
- Mở link như bot. Truy cập landing từ mạng hosting hoặc qua VPN, không có nhãn click quảng cáo. Bạn phải thấy trang an toàn chứ không phải offer.
- Mở link như người mua. Từ điện thoại qua internet di động, theo link có nhãn click của nền tảng. Offer phải mở ra — không có độ trễ đáng kể.
- Kiểm tra trình duyệt tích hợp. Gửi link cho chính mình qua ứng dụng nhắn tin hoặc mở từ ứng dụng mạng xã hội: traffic thật thường đến đúng theo cách này.
- Xem vài trăm click đầu tiên. Lý do từ chối nào gặp nhiều nhất? Nếu đứng đầu là thứ gần như không xuất hiện ở bot — bộ lọc đã quá tay.
- So với chuyển đổi. Nếu click qua được mà không có lead, đừng chỉ tìm vấn đề ở bot: kiểm tra offer, form và việc truyền chuyển đổi.
Mẹo. Hãy thêm thiết bị test của bạn vào danh sách trắng IP của luồng — nếu không bạn sẽ phải đấu với chính lớp bảo vệ của mình và lẫn lượt của mình với của người khác.
Tóm lại
Chỉ có thể lọc traffic bot đáng tin cậy theo từng lớp: mạng và địa chỉ, kiểm tra trình duyệt, hành vi — và đánh giá độ tin cậy bên trên, để một dấu hiệu ngẫu nhiên không khiến bạn mất người mua thật. Hãy cấu hình bảo vệ theo nguồn, bắt đầu từ mức cân bằng, xem lý do quyết định và siết có chọn lọc. Bộ lọc không bảo đảm tài khoản sẽ không bị khóa — điều đó còn phụ thuộc vào creative, tên miền và chính offer — và không thay thế việc tuân thủ quy định của nền tảng. Nhiệm vụ của nó khác: để ngân sách đến với người thật, thống kê phản ánh đúng thực tế, và chiến dịch không bị công cụ spy lấy mất.



