溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

python爬蟲基本知識有哪些

發布時間:2021-08-04 09:09:16 來源:億速云 閱讀:145 作者:小新 欄目:開發技術

小編給大家分享一下python爬蟲基本知識有哪些,相信大部分人都還不怎么了解,因此分享這篇文章給大家參考一下,希望大家閱讀完這篇文章后大有收獲,下面讓我們一起去了解一下吧!

爬蟲簡介

      根據百度百科定義:網絡爬蟲(又被稱為網頁蜘蛛,網絡機器人,在FOAF社區中間,更經常的稱為網頁追逐者),是一種按照一定的規則,自動地抓取萬維網信息的程序或者腳本。另外一些不常使用的名字還有螞蟻、自動索引、模擬程序或者蠕蟲。     

隨著大數據的不斷發展,爬蟲這個技術慢慢走入人們的視野,可以說爬蟲是大數據應運而生的產物,至少我解除了大數據才了解到爬蟲這一技術

隨著數據的海量增長,我們需要在互聯網上選取所需要的數據進行自己研究的分析和實驗。這就用到了爬蟲這一技術,下面就跟著小編一起初遇python爬蟲!

一、請求-響應

在利用python語言實現爬蟲時,主要用到了urllib和urllib2兩個庫。首先用一段代碼說明如下:

 import urllib
 import urllib2
 url="http://www.baidu.com"
 request=urllib2.Request(url)
 response=urllib2.urlopen(request)
 print response.read()

我們知道一個網頁就是以html為骨架,js為肌肉,css為衣服所構成的。上述代碼所實現的功能就是把百度網頁的源碼爬取到本地。

其中,url為要爬取的網頁的網址;request發出請求,response是接受請求后給出的響應。最后用read()函數輸出的就是百度網頁的源碼。

二、GET-POST

兩者都是向網頁傳遞數據,最重要的區別是GET方式是直接以鏈接形式訪問,鏈接中包含了所有的參數,當然如果包含了密碼的話是一種不安全的選擇,不過你可以直觀地看到自己提交了什么內容。

POST則不會在網址上顯示所有的參數,不過如果你想直接查看提交了什么就不太方便了,大家可以酌情選擇。

POST方式:

 import urllib
 import urllib2
 values={'username':'2680559065@qq.com','Password':'XXXX'}
 data=urllib.urlencode(values)
 url='https://passport.csdn.net/account/login?from=http://my.csdn.net/my/mycsdn'
 request=urllib2.Request(url,data)
 response=urllib2.urlopen(request)
 print response.read()

GET方式:

import urllib
import urllib2
values={'username':'2680559065@qq.com','Password':'XXXX'}
data=urllib.urlencode(values)
url = "http://passport.csdn.net/account/login"
geturl = url + "?"+data
request=urllib2.Request(geturl)
response=urllib2.urlopen(request)
print response.read()

三、異常處理

處理異常時,用到了try-except語句。

import urllib2
 try:
   response=urllib2.urlopen("http://www.xxx.com")
 except urllib2.URLError,e:
   print e.reason

以上是“python爬蟲基本知識有哪些”這篇文章的所有內容,感謝各位的閱讀!相信大家都有了一定的了解,希望分享的內容對大家有所幫助,如果還想學習更多知識,歡迎關注億速云行業資訊頻道!

向AI問一下細節

免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

AI

亚洲午夜精品一区二区_中文无码日韩欧免_久久香蕉精品视频_欧美主播一区二区三区美女