文章詳情頁

python - Scrapy存在內存泄漏的問題。

瀏覽：237日期：2022-06-27 09:37:33

問題描述

再編寫爬蟲的時候，總是跑了一段時間（不會超過12個小時）就會被OOM掉。很是無奈?。?！根據官方的文檔，使用這個prefs()但是實在找不出問題的所在。

Live ReferencesHtmlResponse 42 oldest: 753s agoMySuteSpider1 oldest: 2964s agoRequest 32412 oldest: 2920s agoSelector 42 oldest: 751s agoTripItem 37 oldest: 751s ago

爬蟲的處理是獲取所有頁面的a標簽的鏈接：

#獲取域名的后綴def get_domain_suffix(domain): if ’com’ in tldextract.extract(domain).suffix:return True return False#拼接域名。只存主域名def save_domain(domain): domain_name = tldextract.extract(domain).domain suffix_name = tldextract.extract(domain).suffix return domain_name + ’.’ + suffix_name#獲取域名ipdef get_domain_ip(domain): try:ip = socket.gethostbyname(domain)return ip except:return ’114.114.114.114’# 獲取域名所在的國家def get_domain_ct_iso(ip): GEO = geoip2.database.Reader(’/var/test/geodb/GeoLite2-City.mmdb’) r = GEO.city(ip) return r.country.iso_codeclass MyDomainSpider(scrapy.Spider): name = ’my_domain’ start_urls = [’http://xxx.com ] def parse_items(self, response):item = TripItem()for url in response.xpath(’//a/@href’).extract(): if url.startswith(’http’): domain = urlparse.urlparse(url).netloc if get_domain_tw(domain) or get_domain_ct_iso(get_domain_ip(domain)) == ’US’:item[’domain’] = save_domain(domain)item[’ip’] = get_domain_ip(domain)item[’datetime’] = datetime.datetime.now().strftime('%Y-%m-%d %H:%M:%S')yield item def parse(self, response):for url in response.xpath(’//a/@href’).extract(): if url.startswith(’http’):domain = urlparse.urlparse(url).netlocif get_domain_tw(domain) or get_domain_ct_iso(get_domain_ip(domain)) == ’US’: yield scrapy.Request(url, callback=self.parse_items)

請指教一下謝謝

問題解答

回答1：

yield item 是不是得落地，存文件或者db，不然一直存內存了

Python 編程

上一條：python - 在使用Pycharm時經?？吹饺缦碌臉邮剑±ㄌ柪锛t色的部分是什么意思呢？下一條：javascript - 請教如何獲取百度貼吧新增的兩個加密參數

相關文章：

1. node.js - mongodb查找子對象的名稱為某個值的對象的方法2. docker 17.03 怎么配置 registry mirror ?3. docker 下面創建的IMAGE 他們的 ID 一樣？這個是怎么回事？？？？4. 前端 - @media query 使用出現的問題？5. html5 - datatables 加載不出來數據。6. 運行python程序時出現“應用程序發生異?！钡膬却驽e誤？7. 測試自動化html元素選擇器元素ID或DataAttribute [關閉]8. javascript - QQ第三方登錄的問題9. 利用IPMI遠程安裝centos報錯！10. spring-mvc - spring-session-redis HttpSessionListener失效

排行榜

					
					html5 - datatables 加載不出來數據。
運行python程序時出現“應用程序發生異常”的內存錯誤？
javascript - QQ第三方登錄的問題
node.js - mongodb查找子對象的名稱為某個值的對象的方法
前端 - @media query 使用出現的問題？
測試自動化html元素選擇器元素ID或DataAttribute [關閉]
docker 17.03 怎么配置 registry mirror ?
docker  下面創建的IMAGE 他們的 ID 一樣？這個是怎么回事？？？？
java - Spring boot 讀取 放在 jar 包外的，log4j 配置文件，系統有創建日志文件，不寫入日志信息。
spring-mvc - spring-session-redis HttpSessionListener失效
javascript - 在 model里定義的 引用表模型時，model為undefined。
				

熱門標簽

午夜剧场伦理_日本一道高清_国产又黄又硬_91黄色网战_女同久久另类69精品国产_妹妹的朋友在线

python - Scrapy存在內存泄漏的問題。