2
こんにちは、特定のドメイン上のすべてのリンクを取得するために実行される基本スパイダーを持っています。私はそれが状態を維持して、それがどこから残っているかを再開できるようにしたい。私は与えられたURL http://doc.scrapy.org/en/latest/topics/jobs.htmlに従ってきました。しかし、最初はうまくいき、Ctrl + Cで終了します。そして、再開しようとすると、クロールは最初のURL自体で停止します。それが終了すると、以下治療スパイダーは状態を保存しません(永続状態)
はログです:ここでは
2016-08-29 16:51:08 [scrapy] INFO: Dumping Scrapy stats:
{'downloader/request_bytes': 896,
'downloader/request_count': 4,
'downloader/request_method_count/GET': 4,
'downloader/response_bytes': 35320,
'downloader/response_count': 4,
'downloader/response_status_count/200': 4,
'dupefilter/filtered': 149,
'finish_reason': 'finished',
'finish_time': datetime.datetime(2016, 8, 29, 16, 51, 8, 837853),
'log_count/DEBUG': 28,
'log_count/INFO': 7,
'offsite/domains': 22,
'offsite/filtered': 23,
'request_depth_max': 1,
'response_received_count': 4,
'scheduler/dequeued': 2,
'scheduler/dequeued/disk': 2,
'scheduler/enqueued': 2,
'scheduler/enqueued/disk': 2,
'start_time': datetime.datetime(2016, 8, 29, 16, 51, 7, 821974)}
2016-08-29 16:51:08 [scrapy] INFO: Spider closed (finished)
は私のクモです:
from scrapy.spiders import CrawlSpider, Rule
from scrapy.linkextractors import LinkExtractor
from Something.items import SomethingItem
class maxSpider(CrawlSpider):
name = 'something'
allowed_domains = ['thecheckeredflag.com', 'inautonews.com']
start_urls = ['http://www.thecheckeredflag.com/', 'http://www.inautonews.com/']
rules = (Rule(LinkExtractor(allow=()), callback='parse_obj', follow=True),)
def parse_obj(self,response):
for link in LinkExtractor(allow=self.allowed_domains,deny =()).extract_links(response):
item = SomethingItem()
item['url'] = link.url
yield item
#print item
Scrapyバージョン:Scrapy 1.1.2
Pythonのバージョン:2.7
私はより多くの情報を投稿する必要がある場合は、私に教えてください私は、治療に新しいです。
Terminal/CMDコールはどのように見えますか?彼らが提案するような構文を使っていますか? 'scrap crawl somespider -s JOBDIR = crawls/somespider-1'? – dblclik
はい、まったく同じです。それは正常にはじめて実行されますが、上記を再開すると履歴書の統計が表示されます –
スクレーパーの実行開始時にログを貼り付けることはできますか?どこで設定が行われますか。 –