国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁 > 編程 > Python > 正文

Selenium 模擬瀏覽器動態(tài)加載頁面的實現(xiàn)方法

2020-01-04 15:04:11
字體:
供稿:網(wǎng)友

相信爬取大公司的數(shù)據(jù)時,常常會遇到頁面信息動態(tài)加載的問題,

如果僅僅使用content = urllib2.urlopen(URL).read(),估計信息是獲取不全的,這時候就需要模擬瀏覽器加載頁面的過程,

selenium提供了方便的方法,我也是菜鳥,試了很多種方式,下面提供覺得最靠譜的(已經(jīng)證明對于爬取新浪微博的topic、twitter under topic完全沒問題)。

至于下面的browser變量是什么,看前面的幾篇文章。

首先是請求對應(yīng)的URL:

right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App) print right_URL try: browser.get(right_URL) print "loading more, sleep 3 seconds ... 0" time.sleep(3) # NO need for this sleep, but we add ... browser = selenuim_loading_more(browser, method_index=0) except: print "one exception happen ==> get_tweeter_under_topic 2 ..." pass 

然后模擬瀏覽器,加載更多(推薦使用method_index=0,已經(jīng)證明比其他好用很多):

def selenuim_loading_more(browser, method_index=0):   if method_index==0:     browser.implicitly_wait(3) # 為了快速滑動,先設(shè)置超時時間為1秒     # while True:     for i in range(1, 4): # at most 3 times       print "loading more, window.scrollTo bettom for the", i,"time ..."       browser.execute_script("window.scrollTo(0,document.body.scrollHeight);")       try:         # 定位頁面底部的換頁tab         browser.find_element_by_css_selector("div[class='W_pages']")         break # 如果沒拋出異常就說明找到了底部標(biāo)志,跳出循環(huán)       except NoSuchElementException:         pass # 拋出異常說明沒找到底部標(biāo)志,繼續(xù)向下滑動     browser.implicitly_wait(4) # 將超時時間改回10秒   elif method_index==1:     browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more     print "loading more, sleep 4 seconds ... 1"     time.sleep(4)     browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more     print "loading more, sleep 3 seconds ... 2"     time.sleep(2)   elif method_index==2:     load_more_1 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more             ActionChains(browser).click(load_more_1).perform()     print "loading more, sleep 4 seconds ... 1"     time.sleep(4)     load_more_2 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more             ActionChains(browser).click(load_more_2).perform()     print "loading more, sleep 3 seconds ... 2"     time.sleep(2)   elif method_index==3:     print "loading more, sleep 4 seconds ... 1"     element = WebDriverWait(browser, 4).until(       EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))     )     element.click()     print "loading more, sleep 2 seconds ... 2"     WebDriverWait(browser, 2).until(       EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))     ).click()   return browser 

以上就是本文的全部內(nèi)容,希望對大家的學(xué)習(xí)有所幫助,也希望大家多多支持VEVB武林網(wǎng)。


注:相關(guān)教程知識閱讀請移步到python教程頻道。
發(fā)表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發(fā)表
主站蜘蛛池模板: 太湖县| 湘潭市| 荆门市| 固阳县| 靖江市| 七台河市| 仁寿县| 瑞安市| 静乐县| 林甸县| 岢岚县| 芦山县| 汕尾市| 枞阳县| 施甸县| 广汉市| 上林县| 都昌县| 隆德县| 邵武市| 台中县| 克东县| 德江县| 裕民县| 霸州市| 太仓市| 于都县| 垣曲县| 武安市| 福建省| 区。| 镇康县| 南江县| 高阳县| 青岛市| 晴隆县| 丹棱县| 上饶市| 苍山县| 淮北市| 微山县|