国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁 > 編程 > Python > 正文

python爬蟲之模擬登陸csdn的實例代碼

2020-01-04 15:03:10
字體:
來源:轉載
供稿:網友

python模擬登陸網頁主要使用到urllib、urllib2、cookielib及BeautifulSoup等基本模塊,當然進階階段我們還可以使用像requests等更高級一點的模塊。其中BeautifulSoup模塊在匹配html方面,可以很好的代替re,使用起來更方便,對于不會使用正則的人來說是福音。

本文使用python2.7

原理

模擬登陸前,我們需要先知道csdn是如何登陸的。我們通過google chrome瀏覽器先來分析下:

1.chrome瀏覽器用F12或ctrl+shift+I啟動開發者工具,并訪問csdn登陸頁面,在開發者工具中對”Preserver log”選項打勾,表示跳轉時不清楚之前的訪問記錄。

2.輸入用戶名密碼后,網頁進行跳轉,此時我們查看訪問記錄中Method為POST的鏈接的headers,可以看到

Request header:

Cache-Control:no-cacheCache-Control:no-storeConnection:keep-aliveContent-Encoding:gzipContent-Type:text/html;charset=UTF-8Date:Fri, 05 Aug 2016 03:51:56 GMTExpires:Thu, 01 Jan 1970 00:00:00 GMTKeep-Alive:timeout=20Pragma:no-cacheServer:openrestySet-Cookie:UD=%E4%BB%8A%E5%A4%A9%E4%B8%8D%E8%B5%B0%EF%BC%8C%E6%98%8E%E5%A4%A9%E5%8D%B3%E4%BD%BF%E8%B7%91%E4%B9%9F%E4%B8%8D%E4%B8%80%E5%AE%9A%E8%B7%9F%E5%BE%97%E4%B8%8A%EF%BC%81; Domain=.csdn.net; Path=/Set-Cookie:UserName=yanggd1987; Domain=.csdn.net; Path=/Set-Cookie:UserInfo=RjXwn4OfICh68ZVTzEjJxlcez5O%2B8RMsVvAiTV6uo4n4q1orcuBFZz29qx%2BUZ7JPFQQivvFGwFaC97NpT%2FKhtcZ2U%2B%2BzivoNtu5nTyg717xzimpeHcoutwnMg%2F5S8ZlARzA8H48TOftvUJUB0mxylQ%3D%3D; Domain=.csdn.net; Path=/Set-Cookie:UserNick=man8er; Domain=.csdn.net; Path=/Set-Cookie:AU=A3E; Domain=.csdn.net; Path=/Set-Cookie:CASTGC=TGT-63516-e4e600adR5WiJAFintPeHqNCpGRvO9w7nHBYtY5XUCc2BPCCcG-passport.csdn.net; Path=/; SecureSet-Cookie:UN=yanggd1987; Domain=.csdn.net; Expires=Sat, 05-Aug-2017 03:51:55 GMT; Path=/Set-Cookie:UE="yanggd1987@163.com"; Version=1; Domain=.csdn.net; Max-Age=31536000; Expires=Sat, 05-Aug-2017 03:51:55 GMT; Path=/Set-Cookie:BT=1470369115868; Domain=.csdn.net; Expires=Sat, 05-Aug-2017 03:51:55 GMT; Path=/Set-Cookie:access-token=0bd99cf6-c5bf-4683-89b8-9d8678bebff9; Domain=.csdn.net; Path=/Transfer-Encoding:chunkedVary:Accept-Encoding

有以上可以看出登陸過程中有cookie

POST提交的數據:

username:XXXXXXXXXpassword:XXXXXXXXXlt:LT-52961-eMo02Bz4tlj3wQz4QMuO173GCIdsqEexecution:e15s1_eventId:submit

其中username和password表示我們登陸的賬戶和密碼,那lt、execution表示什么呢?不要急,我們看看登陸頁面網站的源代碼:

<form id="fm1" action="/account/login?from=http%3A%2F%2Fmy.csdn.net%2Fmy%2Fmycsdn" method="post">   <input id="password" name="password" tabindex="2" placeholder="輸入密碼" class="pass-word" type="password" value="" autocomplete="off">   <div class="row forget-password">   <span class="col-xs-6 col-sm-6 col-md-6 col-lg-6">    <input type="checkbox" name="rememberMe" id="rememberMe" value="true" class="auto-login" tabindex="4">    <label for="rememberMe">下次自動登錄</label>   </span>   <span class="col-xs-6 col-sm-6 col-md-6 col-lg-6 forget tracking-ad" data-mod="popu_26">    <a href="/account/fpwd?action=forgotpassword&service=http%3A%2F%2Fmy.csdn.net%2Fmy%2Fmycsdn" rel="external nofollow" tabindex="5" target="_blank">忘記密碼</a>   </span>   </div>   <!-- 該參數可以理解成每個需要登錄的用戶都有一個流水號。只有有了webflow發放的有效的流水號,用戶才可以說明是已經進入了webflow流程。否則,沒有流水號的情況下,webflow會認為用戶還沒有進入webflow流程,從而會重新進入一次webflow流程,從而會重新出現登錄界面。 -->   <input type="hidden" name="lt" value="LT-53452-VLvC2gjfxdj4jheoUJQRkIXgoDZfc3">   <input type="hidden" name="execution" value="e16s1">    <input id="username" name="username" tabindex="1" placeholder="輸入用戶名/郵箱/手機號" value="用戶名" class="user-name" type="text"><input type="hidden" name="_eventId" value="submit">    <input class="logging" accesskey="l" value="登 錄" tabindex="6" type="button">   </form>

上面注釋的內容就是說明參數lt和execution的,就是在登陸過程中webflow會動態分配一個流水號LT-53452-VLvC2gjfxdj4jheoUJQRkIXgoDZfc3,我們只用獲取到這個流水號才能夠進行登陸。

從上面通過chrome分析得到,登陸csdn必須有cookie并且獲取到webflow分配的流水號;;并且訪問時必須有user-agent,否則客戶端會被屏蔽。

實現

1.由于我們的系統是centos6.5,默認使用python2.6,因此我們需要先安裝python2.7并安裝相關第三方模塊

(1)yum安裝

rpm -Uvh https://centos6.iuscommunity.org/ius-release.rpmyum -y install python27 python27-devel python27-pip python27-setuptools

#安裝相關第三方模塊

pip2.7 install beautifulsoup4pip2.7 install lxml

(2)編譯安裝

安裝python.2.7

wget https://www.python.org/ftp/python/2.7.12/Python-2.7.12.tgztar -zxvf Python-2.7.12.tgzcd Python-2.7.12./configure --prefix=/usr/local/python2.7make && make install#環境變量vim /etc/profileexport PATH=/usr/local/python2.7/bin:$PATHsource /etc/profile#安裝setuptoolswget https://pypi.python.org/packages/46/db/baa571da945ff731f3739a119574e89b12add9b05c03842103bd641d0990/setuptools-25.1.3.tar.gz#md5=0dcb9990901cb6e9631db195d4e775a7tar -zxvf setuptools-25.1.3.tar.gzcd setuptools-25.1.3python2.7 setup.py install#安裝pipwget https://pypi.python.org/packages/e7/a8/7556133689add8d1a54c0b14aeff0acb03c64707ce100ecd53934da1aa13/pip-8.1.2.tar.gz#md5=87083c0b9867963b29f7aba3613e8f4atar -zxvf pip-8.1.2.tar.gzcd pip-8.1.2python2.7 setup.py install#安裝相關第三方模塊pip2.7 install beautifulsoup4pip2.7 install lxml

注意: 通過編譯安裝的pip2.7 安裝lxml會報錯,因此還是建議使用yum安裝的pip2.7

2.代碼實現

vim csdn_login.py#!/usr/bin/env python2.7#-*- coding: utf-8 -*-import urllibimport urllib2import cookielibfrom bs4 import BeautifulSoupfilename = 'cookie_csdn.txt'#聲明一個MozillaCookieJar對象實例來保存cookie,之后寫入文件cookie = cookielib.MozillaCookieJar(filename)#利用urllib2庫的HTTPCookieProcessor對象來創建cookie處理器handler = urllib2.HTTPCookieProcessor(cookie)#通過handler來構建openeropener = urllib2.build_opener(handler)loginurl = "https://passport.csdn.net/account/login?from=http://my.csdn.net/my/mycsdn"#登陸前準備:獲取lt和exectionresponse = opener.open(loginurl)soup = BeautifulSoup(response.read(), "lxml")for input in soup.form.find_all("input"): if input.get("name") == "lt": lt = input.get("value") if input.get("name") == "execution": execution = input.get("value")#post信息values = { "username":"用戶名", "password":"密碼", "lt":lt, "execution":execution, "_eventId":"submit" }postdata = urllib.urlencode(values)opener.addheaders = [("User-Agent","Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/51.0.2704.63 Safari/537.36")]#模擬登錄,保存cookie到cookie.txt中result = opener.open(loginurl, postdata)cookie.save(ignore_discard=True, ignore_expires=True)#登陸后我們隨意跳轉到博客url = "http://blog.csdn.net/XXXXXXXXX"result = opener.open(url)

3.運行

python2.7 csdn_login.py

至此,當我們登陸后,可以隨意指定一個頁面進行登陸了。

總結

1.urllib和urllib2配合使用,因為urllib可以將post數據進行encode,而urllib2不可以

2.由于使用cookie、header等,用到了urllib2的基礎庫opener實現訪問等操作,當然也可以使用urllib2.Request(url,data,header)等其他訪問方式。

3.每個網站登錄方式可能不一樣,我們需要根據實際情況分析。

4.模擬登陸是我們通過實戰學習python的一種方法,而不是用它來惡意攻擊。

以上這篇python爬蟲之模擬登陸csdn的實例代碼就是小編分享給大家的全部內容了,希望能給大家一個參考,也希望大家多多支持VEVB武林網。


注:相關教程知識閱讀請移步到python教程頻道。
發表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發表
主站蜘蛛池模板: 邵阳市| 成武县| 大余县| 琼海市| 巩义市| 凤冈县| 无为县| 开化县| 醴陵市| 靖远县| 淄博市| 肇州县| 交城县| 奇台县| 甘洛县| 逊克县| 怀柔区| 方城县| 久治县| 新蔡县| 奎屯市| 和龙市| 林州市| 理塘县| 右玉县| 莆田市| 吴川市| 察隅县| 措勤县| 胶州市| 满洲里市| 浮山县| 博野县| 宝清县| 阳城县| 昌邑市| 大丰市| 鸡泽县| 黄陵县| 交口县| 神木县|