小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在 繁華落盡and曲終人散 2018-07-14 14:01:47

来源:https://www.cnblogs.com/PY1780/archive/2018/07/14/9310564.html
-Advertisement-
Play Games

準備工作 工具:Python3.6、pycharm 庫:requests、re、time、random、os 目標網站:妹子圖(具體url大家自己去代碼里看。。。) 在寫代碼之前 在我們開始寫代碼之前,要先對網站進行分析,重點有這個幾個地方: 1、先判斷網頁是否靜態網頁,這個關係我們採用的爬蟲手段! ...


小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

準備工作

工具:Python3.6、pycharm

庫:requests、re、time、random、os

目標網站:妹子圖(具體url大家自己去代碼里看。。。)

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

在寫代碼之前

在我們開始寫代碼之前,要先對網站進行分析,重點有這個幾個地方:

1、先判斷網頁是否靜態網頁,這個關係我們採用的爬蟲手段!

簡單的說,網頁中的內容,在網頁源代碼中都可以找到,那麼就可以斷定,這個網站是靜態的了;如果沒有找到,就需要去開發者工具中查找,看看是抓包呢還是分析js結構或者其他的方式。

2、看看網頁的結構,大致清楚抓取目標數據,需要幾層迴圈,每次迴圈的方式,以及是否保證沒有遺漏!

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

開始寫代碼

首先是導入上述的各種庫,沒有的需要安裝一下!然後寫入以下幾行代碼獲取網頁源代碼看看是否有反爬:

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

全部在a標簽的屬性中,那麼我們可以用一行代碼獲取了

infos = re.findall(r'a href="(http://www.meizitu.com/.*?html)" target="_blank" title="(.*?)" ',html.text)

這裡用正則匹配,2個括弧中的內容就是我們需要的url和名字了,然後開始構建迴圈遍歷所有的分類

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

上一步取出的infos是列表,而且每一個元素都是一個元組,格式為(url,名字),所有我們用2個元素去遍歷infos,來獲取我們需要的內容,先列印下看看結果是否正確!

這裡先不創建文件夾,先進行下一步,訪問分類的url,然後開始構建分類中的頁碼吧!分析網頁發現,所有的頁碼都在下方,但是還是稍有不同:沒有當前頁、多了下一頁和末頁

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

由於存在圖集不足一頁的情況(上述源代碼就不會出現),所以我們這麼處理迴圈

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

迴圈所有的url,獲取所有圖集的url列表,27行沒有用encoding指定編碼是因為這裡我不需要取到中文的內容,所以簡寫了一下!終於該取圖片了!

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

圖集的title和圖集內所有圖片的url都取到了!其實到這裡就已經完成了爬蟲的80%了!剩下的20%就是保存圖片到本地,這裡就不多說了,給大家提供2個代碼片段,一個是新建文件夾並判斷是否存在,一個是剔除字元串內不符合命名要求的字元

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

最終完整代碼和運行效果

在請求中加入了時間模塊的暫停功能,不加入的話可能會被網頁拒絕訪問!

在最後請求圖片地址的時候,需要加入UA來告訴伺服器你是瀏覽器而不是腳本,這個是最常用的反爬手段了

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

下載一段時間後的效果

小白福利!跟著我的腳步!老司機帶你爬取整站妹子圖!反爬不存在

 

相信大家應該也做出你自己的腳本了吧!有什麼問題也可以在評論區或者私信發消息哦!

進群:125240963   即可獲取數十套PDF哦!


您的分享是我們最大的動力!

-Advertisement-
Play Games
更多相關文章
  • 最近一次迭代,參與了公司數據應用平臺的開發,其中負責的一塊功能早早的就完成了代碼的編寫工作,即將進入測試階段,因為有時間思考和總結代碼編寫中遇到的難題,便想著將代碼做一次重構:其中優化的一個功能就是關於數據平臺敏感欄位的收集 功能描述:數據平臺敏感欄位的收集: 開始的版本: 可以看出邏輯都散落在fo ...
  • 在Sring核心與設計模式的文章中,分別介紹了Ioc容器和Bean的依賴關係。如果閱讀過前2文就會知道,Spring的整個運轉機制就是圍繞著IoC容器以及Bean展開的。IoC就是一個籃子,所有的Bean都向裡面扔。除了提供籃子功能創建並存放Bean之外,IoC還要負責管理Bean與Bean之間的關 ...
  • 1. 學習計劃 第一天:Lucene的基礎知識 1、案例分析:什麼是全文檢索,如何實現全文檢索 2、Lucene實現全文檢索的流程 a) 創建索引 b) 查詢索引 3、配置開發環境 4、創建索引庫 5、查詢索引庫 6、分析器的分析過程 a) 測試分析器的分詞效果 b) 第三方中文分析器 7、索引庫的 ...
  • Spring 通過任務執行器(TaskExecutor)來實現多線程和併發編程。使用ThreadPoolTaskExecutor可實現一個基於線程池的TaskExecutor。而實際開發中任務一般是非阻礙的,即非同步的,所有我們在配置類中通過@EnableAsync開啟對非同步任務的支持,並通過在實際執... ...
  • 來源:https://www.bilibili.com/video/av20436259來源:黑馬程式員存儲器: 記憶體(rom只讀記憶體,ram隨機存儲器) 外存(硬碟,軟盤ab,光碟) 系統軟體:1.桌面操作系統:windows,macos--程式員使用較多,Linux2.伺服器操作系統:Linux ...
  • 一、Mysql事務 事務: 事務指邏輯上的一組操作,組成這組操作的各個單元,要麼全部成功,要麼全部不成功。 1、Mysql中的事務 a、mysql引擎是支持事務的 b、mysql預設自動提交事務。每條語句都處在單獨的事務中。 c、手動控制事務 開啟事務:start transaction | beg ...
  • Alei最近和迭代器較上了勁,之前自以為深究過迭代器,不成想原來是坐井觀天,以蠡測海。上文中寫的東西哪裡算什麼深入探究?!但亡羊補牢,猶未遲也,經我多次試驗,終於弄懂其中某些精巧機制,閑話少說,我們進入正題。 註意,之後所有的知識點都以 ArrayList 這個容器類為例來進行詳細說明 在討論這個問 ...
  • 爬蟲對目標網頁爬取的過程可以參考下麵黑色文字部分: 首先訪問初始url,獲取其相應內容對相應內容進行解析,提取感興趣的信息和新的鏈接將上一步提取到的數據存儲,將獲取到的鏈接去重並存儲至倉庫從url倉庫獲得一條未爬取過的url,開始新的迴圈 圖片中由黑色文字組成的迴圈應該很好理解,那麼具體到編程上來說 ...
一周排行
    -Advertisement-
    Play Games
  • GoF之工廠模式 @目錄GoF之工廠模式每博一文案1. 簡單說明“23種設計模式”1.2 介紹工廠模式的三種形態1.3 簡單工廠模式(靜態工廠模式)1.3.1 簡單工廠模式的優缺點:1.4 工廠方法模式1.4.1 工廠方法模式的優缺點:1.5 抽象工廠模式1.6 抽象工廠模式的優缺點:2. 總結:3 ...
  • 新改進提供的Taurus Rpc 功能,可以簡化微服務間的調用,同時可以不用再手動輸出模塊名稱,或調用路徑,包括負載均衡,這一切,由框架實現並提供了。新的Taurus Rpc 功能,將使得服務間的調用,更加輕鬆、簡約、高效。 ...
  • 本章將和大家分享ES的數據同步方案和ES集群相關知識。廢話不多說,下麵我們直接進入主題。 一、ES數據同步 1、數據同步問題 Elasticsearch中的酒店數據來自於mysql資料庫,因此mysql數據發生改變時,Elasticsearch也必須跟著改變,這個就是Elasticsearch與my ...
  • 引言 在我們之前的文章中介紹過使用Bogus生成模擬測試數據,今天來講解一下功能更加強大自動生成測試數據的工具的庫"AutoFixture"。 什麼是AutoFixture? AutoFixture 是一個針對 .NET 的開源庫,旨在最大程度地減少單元測試中的“安排(Arrange)”階段,以提高 ...
  • 經過前面幾個部分學習,相信學過的同學已經能夠掌握 .NET Emit 這種中間語言,並能使得它來編寫一些應用,以提高程式的性能。隨著 IL 指令篇的結束,本系列也已經接近尾聲,在這接近結束的最後,會提供幾個可供直接使用的示例,以供大伙分析或使用在項目中。 ...
  • 當從不同來源導入Excel數據時,可能存在重覆的記錄。為了確保數據的準確性,通常需要刪除這些重覆的行。手動查找並刪除可能會非常耗費時間,而通過編程腳本則可以實現在短時間內處理大量數據。本文將提供一個使用C# 快速查找並刪除Excel重覆項的免費解決方案。 以下是實現步驟: 1. 首先安裝免費.NET ...
  • C++ 異常處理 C++ 異常處理機制允許程式在運行時處理錯誤或意外情況。它提供了捕獲和處理錯誤的一種結構化方式,使程式更加健壯和可靠。 異常處理的基本概念: 異常: 程式在運行時發生的錯誤或意外情況。 拋出異常: 使用 throw 關鍵字將異常傳遞給調用堆棧。 捕獲異常: 使用 try-catch ...
  • 優秀且經驗豐富的Java開發人員的特征之一是對API的廣泛瞭解,包括JDK和第三方庫。 我花了很多時間來學習API,尤其是在閱讀了Effective Java 3rd Edition之後 ,Joshua Bloch建議在Java 3rd Edition中使用現有的API進行開發,而不是為常見的東西編 ...
  • 框架 · 使用laravel框架,原因:tp的框架路由和orm沒有laravel好用 · 使用強制路由,方便介面多時,分多版本,分文件夾等操作 介面 · 介面開發註意欄位類型,欄位是int,查詢成功失敗都要返回int(對接java等強類型語言方便) · 查詢介面用GET、其他用POST 代碼 · 所 ...
  • 正文 下午找企業的人去鎮上做貸後。 車上聽同事跟那個司機對罵,火星子都快出來了。司機跟那同事更熟一些,連我在內一共就三個人,同事那一手指桑罵槐給我都聽愣了。司機也是老社會人了,馬上聽出來了,為那個無辜的企業經辦人辯護,實際上是為自己辯護。 “這個事情你不能怪企業。”“但他們總不能讓銀行的人全權負責, ...