同样源码把requests库替换成scrapy抓取内容就报500错误,是什么原因
# -*- coding: utf-8 -*-
import requests
def xici_request():
url = 'http://www.xicidaili.com'
headers = {
'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8',
'Accept-Encoding': 'gzip, deflate, sdch',
'Accept-Language': 'zh-CN,zh;q=0.8',
'Cache-Control': 'max-age=0',
'Connection': 'keep-alive',
'Host': 'www.xicidaili.com',
'Referer': 'https://www.google.com/',
'User-Agent': 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/56.0.2924.87 Safari/537.36'
res = requests.get(url, headers=headers)
print(res.text)
if __name__ == '__main__':
xici_request()
# -*- coding: utf-8 -*-
import scrapy
from collectips.items import CollectipsItem
class XiciSpider(scrapy.Spider):
name = "xici"
allowed_domains = ["http://www.xicidaili.com"]
headers = {'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8',
'Accept-Encoding': 'gzip, deflate, sdch',
'Accept-Language': 'zh-CN,zh;q=0.8',
'Cache-Control': 'max-age=0',
'Connection': 'keep-alive',
'Host': 'www.xicidaili.com',
'Referer': 'https://www.google.com/',
'User-Agent': 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/56.0.2924.87 Safari/537.36'}
def start_requests(self):
reqs = []
for i in range(1, 21):
req = scrapy.Request(
'http://www.xicidaili.com/nn/{}'.format(i), headers=self.headers)
reqs.append(req)
return reqs
def parse(self, response):
item = CollectipsItem()
sel = response.selector
for i in range(2, 102):
item['IP'] = sel.xpath(
'//*[@id="ip_list"]/tbody/tr[{}]/td[2]/text()'.format(i)).extract()
item['PORT'] = sel.xpath(
'//*[@id="ip_list"]/tbody/tr[{}]/td[3]/text()'.format(i)).extract()
item['DNS_POSITION'] = sel.xpath(
'//*[@id="ip_list"]/tbody/tr[{}]/td[4]/a/text()'.format(i)).extract()
item['TYPE'] = sel.xpath(
'//*[@id="ip_list"]/tbody/tr[{}]/td[6]/text()'.format(i)).extract()
item['SPEED'] = sel.xpath(
'//*[@id="ip_list"]/tbody/tr[{}]/td[7]/div[@title]'.format(i)).extract()
item['LAST_CHECK_TIME'] = sel.xpath(
'//*[@id="ip_list"]/tbody/tr[{}]/td[10]/text()'.format(i)).extract()
yield item
代码如上,为什么requests能返回网页内容,而scrapy却是报错内部服务器错误500? 请大神解救??
并发你没考虑进去吧,当同一时间发起过多的请求会直接封你IP
玩蛇网文章,转载请注明出处和文章网址:https://www.iplaypy.com/wenda/wd13873.html
相关文章 Recommend
- • 请教python返回值变量对象的问题,有源码
- • 想把print输出后的空格删除怎么做
- • 我把virtualenv目录改了新名字,发现pip安装包无法识
- • 求大牛看下python源码中的__init__()作用是什么
- • python什么方法能把../这样的网址转换成真实地址
- • 分析python源码找到新闻阅读器无法运行的原因,
- • Python源码里类似@xxx这样符号是什么意思
- • python travis测试超时源码分析
- • 需要把含有元组元素的列表转换为dict用什么方法
- • Flask程序如何做能达到提交表单同样效果
- • 解Python练习题源码,求大神看看有什么问题没
- • python dict能完成ruby中Hash的同样效果吗?
您现在的位置: 玩蛇网首页 > Python问题解答 > 正文内容
我要分享到:
必知PYTHON教程 Must Know PYTHON Tutorials
- • python 解释器
- • python idle
- • python dir函数
- • python 数据类型
- • python type函数
- • python 字符串
- • python 整型数字
- • python 列表
- • python 元组
- • python 字典
- • python 集合
- • python 变量
- • python print
- • python 函数
- • python 类定义
- • python import
- • python help
- • python open
- • python 异常处理
- • python 注释
- • python continue
- • python pass
- • python return
- • python global
- • python assert
- • python if语句
- • python break
- • python for循环
- • python while循环
- • python else/elif
- • lambda匿名函数
必知PYTHON模块 Must Know PYTHON Modules
- • os 模块
- • sys 模块
- • re 正则表达式
- • time 日期时间
- • pickle 持久化
- • random 随机
- • csv 模块
- • logging 日志
- • socket网络通信
- • json模块
- • urlparse 解析URL
- • urllib 模块
- • urllib2 模块
- • robotparser 解析
- • Cookie 模块
- • smtplib 邮件
- • Base64 编码
- • xmlrpclib客户端
- • string 文本
- • Queue 线程安全
- • math数学计算
- • linecache缓存
- • threading多线程
- • sqlite3数据库
- • gzip压缩解压
最新内容 NEWS
- • django app提供pv信息的方法是什么
- • Django项目版本升级如何操作?
- • django较多数据传递如何优雅的呈现
- • django1.7获取参数问题求助
- • Django1.7使用内置comment遇到问题
- • python mysql数据库做insert操作时报_mysql_ex
- • 关于python mysql的duplicate insert机制的疑问
- • pymongo使用insert函数批量插入被中断要怎么
- • Python程序员解决棘手问题的常用库
- • 求助关于restfull api接口几个问题
图文精华 RECOMMEND
-
django1.7获取参数问题求助
-
Python程序员解决棘手问题的常用库
-
求问str()同__str__原理上有什么不同
-
scrapy框架里面用link extractor怎么能
-
python {}.fromkeys创建字典append添加操
-
python3 类型Type str doesn't support th
热点文章 HOT
- 学习Python有什么好的书籍推荐?
- Python匿名函数 Lambda表达式作用
- Python与Java、C、Ruby、PHP等编程语言有什么
- Python 正则中文网页字符串提取问题
- 如何为实时性应用存取经纬度?django my
- 想用python做个客户端,在二维码登录这个地
- 有让IDE可识别Python函数参数类型的方法吗
- Python字符串转换成列表正则疑问