文章詳情頁

Python爬蟲的亂碼問題？

瀏覽：196日期：2022-07-30 16:40:27

問題描述

使用python實現模擬登陸并爬取返回頁面的時候出現了亂碼，目標網頁的編碼使用utf-8 Python爬蟲的亂碼問題？

相關代碼：

#coding=utf-8import urllibimport urllib2headers={ ’Accept’:’text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8’, ’Accept-Encoding’:’gzip, deflate’, ’Accept-Language’:’zh-CN,zh;q=0.8,en-US;q=0.5,en;q=0.3’, ’Connection’:’keep-alive’, ’User-Agent’:’Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/47.0.2526.73 Safari/537.36’}payload={ ’_eventId’:’submit’, ’lt’:’_cF2A0EB3F-D044-046C-6F4A-C828DE0ACE8E_k8B4BE5F5-4CAD-375D-0DDC-FB84A18445DF’, ’password’:’’, ’submit’:’登錄’, ’username’:’’}payload=urllib.urlencode(payload)request = urllib2.Request(posturl, payload, headers)print requestresponse = urllib2.urlopen(request)text = response.read()print text

控制臺輸出信息： Python爬蟲的亂碼問題？

第一次遇見這種亂碼比較懵逼

問題解答

回答1：

urllib2沒有處理壓縮的問題，你要使用gzip解壓，比如這樣

from StringIO import StringIOimport gzipif response.info().get(’Content-Encoding’) == ’gzip’: buf = StringIO(text) f = gzip.GzipFile(fileobj=buf) data = f.read()

總結urllib2比較底層，建議使用requests

Python 編程

上一條：http - python requests上傳文件問題下一條：elasticsearch - 在python函數執行過程中，如何判斷并處理其中一條語句的返回值？

相關文章：

1. node.js - mongodb查找子對象的名稱為某個值的對象的方法2. html5 - datatables 加載不出來數據。3. 測試自動化html元素選擇器元素ID或DataAttribute [關閉]4. html5和Flash對抗是什么情況？5. 利用IPMI遠程安裝centos報錯！6. javascript - QQ第三方登錄的問題7. 在mac下出現了兩個docker環境8. 運行python程序時出現“應用程序發生異常”的內存錯誤？9. spring-mvc - spring-session-redis HttpSessionListener失效10. 正在使用electron和node.js做桌面應用，需要實時監聽是否有網絡連接，node或者electron是否可以做到

排行榜

					
					html5 - datatables 加載不出來數據。
運行python程序時出現“應用程序發生異常”的內存錯誤？
javascript - QQ第三方登錄的問題
node.js - mongodb查找子對象的名稱為某個值的對象的方法
測試自動化html元素選擇器元素ID或DataAttribute [關閉]
利用IPMI遠程安裝centos報錯！
在mac下出現了兩個docker環境
html5和Flash對抗是什么情況？
java - Spring boot 讀取 放在 jar 包外的，log4j 配置文件，系統有創建日志文件，不寫入日志信息。
spring-mvc - spring-session-redis HttpSessionListener失效
正在使用electron和node.js做桌面應用，需要實時監聽是否有網絡連接，node或者electron是否可以做到
				

熱門標簽

午夜剧场伦理_日本一道高清_国产又黄又硬_91黄色网战_女同久久另类69精品国产_妹妹的朋友在线

Python爬蟲的亂碼問題？