玩蛇网提供最新Python编程技术信息以及Python资源下载!

做python爬虫的时候如何判断是否抓取过了?

以前没有做过爬虫,现在项目有个需求 就是要爬取指定论坛的某个板块的帖子 下面如果出现 “机械XXX” 等关键字就要抓取通知管理员,

但是现在有个问题,怎么判断是否爬过呢, 目前这个爬虫第一版只爬帖子内容 不爬回复 , 目前想到的思路是 定时爬前20页的id 然后去数据库里对比是否有id 如果不存在此id再继续爬,不知道这个思路怎么样

但是第二版的话就要爬回复内容了 这个应该怎么实现呢? 各位大神有什么思路吗

每个html页面都是一棵dom树,你爬取的时候记录下每一个敏感词在节点中的位置,然后再数据库中对比,完活儿.

记录下爬去过的id的思路很对呀,即使是回复内容,也可以这样子做,记录下回复的id、时间等标识性信息就可以了

请使用布隆过滤器

玩蛇网文章,转载请注明出处和文章网址:https://www.iplaypy.com/wenda/wd14128.html

相关文章 Recommend

玩蛇网Python互助QQ群,欢迎加入-->: 106381465 玩蛇网Python新手群
修订日期:2017年05月24日 - 20时34分36秒 发布自玩蛇网

您现在的位置: 玩蛇网首页 > Python问题解答 > 正文内容
我要分享到:

必知PYTHON教程 Must Know PYTHON Tutorials

必知PYTHON模块 Must Know PYTHON Modules