国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁 > 編程 > Python > 正文

python抓取最新博客內(nèi)容并生成Rss

2019-11-25 17:27:45
字體:
供稿:網(wǎng)友

osc的rss不是全文輸出的,不開心,所以就有了python抓取osc最新博客生成Rss

# -*- coding: utf-8 -*-from bs4 import BeautifulSoupimport urllib2import datetimeimport timeimport PyRSS2Genfrom email.Utils import formatdateimport reimport sysimport osreload(sys)sys.setdefaultencoding('utf-8')class RssSpider(): def __init__(self): self.myrss = PyRSS2Gen.RSS2(title='OSChina',link='http://my.oschina.net',description=str(datetime.date.today()),pubDate=datetime.datetime.now(), lastBuildDate = datetime.datetime.now(),items=[])self.xmlpath=r'/var/www/myrss/oschina.xml'self.baseurl="http://www.oschina.net/blog" #if os.path.isfile(self.xmlpath):#os.remove(self.xmlpath) def useragent(self,url): i_headers = {"User-Agent":"Mozilla/5.0 (Windows NT 6.1; WOW64)  AppleWebKit/537.36 (KHTML, like Gecko) Chrome/36.0.1985.125 Safari/537.36", "Referer": 'http://baidu.com/'} req = urllib2.Request(url, headers=i_headers) html = urllib2.urlopen(req).read() return html def enterpage(self,url): pattern = re.compile(r'd{4}Sd{2}Sd{2}sd{2}Sd{2}')rsp=self.useragent(url)soup=BeautifulSoup(rsp)timespan=soup.find('div',{'class':'BlogStat'})timespan=str(timespan).strip().replace('n','').decode('utf-8')match=re.search(r'd{4}Sd{2}Sd{2}sd{2}Sd{2}',timespan)timestr=str(datetime.date.today()) if match:timestr=match.group() #print timestrititle=soup.title.stringdiv=soup.find('div',{'class':'BlogContent'})rss=PyRSS2Gen.RSSItem(title=ititle,link=url, description = str(div), pubDate = timestr) return rss def getcontent(self):rsp=self.useragent(self.baseurl)soup=BeautifulSoup(rsp)ul=soup.find('div',{'id':'RecentBlogs'}) for li in ul.findAll('li'):div=li.find('div') if div is not None:alink=div.find('a') if alink is not None:link=alink.get('href') print linkhtml=self.enterpage(link)self.myrss.items.append(html) def SaveRssFile(self,filename):finallxml=self.myrss.to_xml(encoding='utf-8')file=open(self.xmlpath,'w')file.writelines(finallxml)file.close()if __name__=='__main__':rssSpider=RssSpider()rssSpider.getcontent()rssSpider.SaveRssFile('oschina.xml')

以上所述就是本文的全部內(nèi)容了,希望大家能夠喜歡。

發(fā)表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發(fā)表
主站蜘蛛池模板: 常德市| 资源县| 临武县| 岢岚县| 卢龙县| 岱山县| 安西县| 永顺县| 麦盖提县| 江山市| 桦川县| 翁牛特旗| 肥乡县| 娱乐| 商河县| 海原县| 宁都县| 攀枝花市| 清流县| 镇赉县| 洞口县| 措勤县| 兴海县| 哈尔滨市| 榕江县| 青铜峡市| 清水县| 永仁县| 梁河县| 巴彦县| 肃北| 疏勒县| 六枝特区| 广丰县| 布拖县| 海安县| 依兰县| 西乌| 保亭| 镇坪县| 长武县|