昨天晚上十点多我还在公司加班,顺手看了一眼服务器日志,发现有几个陌生的IP段一直在疯狂请求我们的公开接口,抓取的内容基本是产品描述和用户评论。
一开始以为是正常爬虫,后来仔细看User-Agent里带了些大模型相关的关键词,估计是拿去训练AI了。我们之前加过robots.txt,但明显没用。
现在最担心的是公司一些还没公开的策略描述也被抓走了,万一被竞争对手拿去分析就麻烦了。想问问有没有简单有效的办法,能直接把这些爬虫挡掉,又不影响正常用户访问?
昨天晚上十点多我还在公司加班,顺手看了一眼服务器日志,发现有几个陌生的IP段一直在疯狂请求我们的公开接口,抓取的内容基本是产品描述和用户评论。 一开始以为是正常爬虫,后来仔细看User-Agent里带了些大模型相关的关键词,估计是拿去训练AI了。我们之前加过robots.txt,但明显没用。 现在最担心的是公司一些还没公开的策略描述也被抓走了,万一被竞争对手拿去分析就麻烦了。想问问有没有简单有效的办法,能直接把这些爬虫挡掉,又不影响正常用户访问?
昨天晚上十点多我还在公司加班,顺手看了一眼服务器日志,发现有几个陌生的IP段一直在疯狂请求我们的公开接口,抓取的内容基本是产品描述和用户评论。
一开始以为是正常爬虫,后来仔细看User-Agent里带了些大模型相关的关键词,估计是拿去训练AI了。我们之前加过robots.txt,但明显没用。
现在最担心的是公司一些还没公开的策略描述也被抓走了,万一被竞争对手拿去分析就麻烦了。想问问有没有简单有效的办法,能直接把这些爬虫挡掉,又不影响正常用户访问?
我们公司之前也碰到过这种情况,后来直接在Nginx那边把那些UA带大模型关键词的IP段封了,再加了个简单的验证码前置,对正常用户几乎没影响。反正robots.txt就是个君子协议,流氓爬虫根本不看的。建议你也查下那几个IP段的归属,直接拉黑完事。
哎呀这个太常见了,最近我们公司也碰到过。robots.txt就是废纸,直接上频率限制+User-Agent黑名单吧。几个大模型的UA关键词网上搜一下都有列表,加个nginx规则能挡掉一大半。再不行套个Cloudflare,能抗不少恶意爬虫。别纠结,搞起来。
这种事真的烦,我也遇到过。建议你们在Nginx层按User-Agent或请求频率封掉那些明显是爬虫的IP,再配合一个简单的验证码机制,对正常用户影响不大。还有就是敏感接口加个临时token,爬虫很难自动获取。
楼上说得挺详细,我倒是想补充一点,既然robots.txt都没用,说明这些爬虫根本不遵守规则。可以试试结合行为分析,比如同一个IP短时间内多次请求某些接口就限制频率,或者用验证码验证可疑流量。还有,基于User-Agent简单封禁很容易绕过,得多维度判断。感觉这事没法完全堵死,只能把门槛调高点,至少让采集成本变高,竞争对手也不敢随便来。你们有没有考虑过用更严格的身份验证或者接口加密?我听说有些大厂把敏感接口挪到内部网络,公开接口只留必要部分,也可以参考参考。