我的代码不起作用,我也不知道! 我想刮掉宜家的网站,我首先设计了一个爬行蜘蛛,它不够具体,无法检索网页的每个链接。所以我设计了一个基本的蜘蛛产量要求的方法。
这是我的代码:
class IkeaSpider(scrapy.Spider) :
name = "Ikea"
allower_domains = ["http://www.ikea.com/"]
start_urls = ["http://www.ikea.com/fr/fr/catalog/productsaz/8/"]
def parse_url(self, response):
for sel in response.xpath('//div[@id="productsAzLeft"]'):
base_url = 'http://www.ikea.com/'
follow_url = sel.xpath('//span[@class="productsAzLink"]/@href').extract()
complete_url = urlparse.urljoin(base_url, follow_url)
request = Request(complete_url, callback = self.parse_page)
yield request
def parse_page(self, response):
下面是错误日志:
2016-01-04 22:06:31 [scrapy] ERROR: Spider error processing <GET http://www.ikea.com/fr/fr/catalog/productsaz/8/> (referer: None)
Traceback (most recent call last):
File "/usr/local/lib/python2.7/dist-packages/twisted/internet/defer.py", line 588, in _runCallbacks
current.result = callback(current.result, *args, **kw)
File "/usr/local/lib/python2.7/dist-packages/scrapy/spiders/__init__.py", line 76, in parse
raise NotImplementedError
NotImplementedError
您的spider需要一个
parse
方法,它是所有初始请求的默认回调。您只需将parse_url
方法重命名为parse
,它就可以正常工作了。替代品
您还可以定义一个
start_requests
方法,并像在这里一样使用一个定义的callback
参数手动生成scrapy.Requests
。如果只想使用蜘蛛中的
start_urls
,则必须实现parse
方法,因为您可以检查hereparse
方法是从start_urls
中的url发出的请求的默认回调。如果要从一开始就控制请求,还可以使用
start_requests
方法。相关问题 更多 >
编程相关推荐