好程序員 Python 學習路線之 python 爬蟲入門 , 隨著網絡的迅速發展,萬維網成為大量信息的載體,如何有效地提取并利用這些信息成為一個巨大的挑戰。搜索引擎 (Search Engine) ,例如傳統的通用搜索引擎 AltaVista , Yahoo! 和 Google 等,作為一個輔助人們檢索信息的工具成為用戶訪問萬維網的入口和指南。但是,這些通用性搜索引擎也存在著一定的局限性 .
1. 什么是爬蟲,即網絡爬蟲,大家可以理解為在網絡上爬行的一直蜘蛛,互聯網就比作一張大網,而爬蟲便是在這張網上爬來爬去的蜘蛛咯,如果它遇到資源,那么它就會抓取下來。想抓取什么?這個由你來控制它咯。
比如它在抓取一個網頁,在這個網中他發現了一條道路,其實就是指向網頁的超鏈接,那么它就可以爬到另一張網上來獲取數據。這樣,整個連在一起的大網對這之蜘蛛來說觸手可及,分分鐘爬下來不是事兒。
2. 瀏覽網頁的過程
在用戶瀏覽網頁的過程中,我們可能會看到許多好看的圖片,我們會看到幾張的圖片以及百度搜索框,這個過程其實就是用戶輸入網址之后,經過 DNS 服務器,找到服務器主機,向服務器發出一個請求,服務器經過解析之后,發送給用戶的瀏覽器 HTML 、 JS 、 CSS 等文件,瀏覽器解析出來,用戶便可以看到形形色色的圖片了。
因此,用戶看到的網頁實質是由 HTML 代碼構成的,爬蟲爬來的便是這些內容,通過分析和過濾這些 HTML 代碼,實現對圖片、文字等資源的獲取。
3.URL 的含義
URL ,即統一資源定位符,也就是我們說的網址,統一資源定位符是對可以從互聯網上得到的資源的位置和訪問方法的一種簡潔的表示,是互聯網上標準資源的地址?;ヂ摼W上的每個文件都有一個唯一的 URL ,它包含的信息指出文件的位置以及瀏覽器應該怎么處理它。
URL 的格式由三部分組成:
①第一部分是協議 ( 或稱為服務方式 ) 。
②第二部分是存有該資源的主機 IP 地址 ( 有時也包括端口號 ) 。
③第三部分是主機資源的具體地址,如目錄和文件名等。
爬蟲爬取數據時必須要有一個目標的 URL 才可以獲取數據,因此,它是爬蟲獲取數據的基本依據,準確理解它的含義對爬蟲學習有很大幫助。
4. 環境的配置
學習 Python ,當然少不了環境的配置,最初我用的是 Notepad++ ,不過發現它的提示功能實在是太弱了,于是,在 Windows 下我用了 PyCharm ,在 Linux 下我用了 Eclipse for Python ,另外還有幾款比較優秀的 IDE.
免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。