基于scrapy-redis的分布式爬虫,爬取JD图书,当当图书和Amazon图书

采用scrapy-redis爬去京东图书,当当图书和Amazon图书,采用分布式爬虫爬取数据,实现爬虫的暂停和开始,断点再续,URL去重,数据存储等,属于轻量级爬虫

相关的项目 - 更多比较

257 5.8k 1.6k

B 「一个」、「Time 时光」、「有道词典」、「微软必应词典」、「豆瓣电影」、「中央天气」、「小米天气」、「魅族天气」、「每日一文」、「12306」、「途牛」、「快递100」、「快递」应用 Api。仅供学习,禁止商业使用,侵权请联系删除。
 
10.0 3.5
  4天前
Popular
235 5.7k 1.7k

12306智能刷票,订票
 
10.0 10.0
  昨天
363 4.5k 1.6k

Y 越来越多的网站具有反爬虫特性,有的用图片隐藏关键数据,有的使用反人类的验证码,建立反反爬虫的代码仓库,通过与不同特性的网站做斗争(无恶意)提高技术
 
10.0 0.2
  7天前