国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁 > 學院 > 開發設計 > 正文

python自帶re模塊正則表達式去除html標簽

2019-11-14 10:47:40
字體:
來源:轉載
供稿:網友

本文轉載自:python自帶re模塊正則表達式去除html標簽

利用正則式處理,不知道會不會有性能問題,沒有經過太多測試。 目前我有很多還是使用BeautifulSoup進行這種處理。 HTML實體處理的只是用于處理一些常用的實體。

# -*- coding: utf-8-*-import re##過濾HTML中的標簽#將HTML中標簽等信息去掉#@param htmlstr HTML字符串.def filter_tags(htmlstr): #先過濾CDATA re_cdata=re.compile('//<!/[CDATA/[[^>]*///]/]>',re.I) #匹配CDATA re_scrPRint news

——————————————————華麗的分割線——————————————————————————

import urllib2,rex=urllib2.urlopen('http://www.csdn.net').read()re_h=re.compile('</?/w+[^>]*>')s=re_h.sub('',x)print s
上一篇:leecode 268. Missing Number

下一篇:完全背包

發表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發表
主站蜘蛛池模板: 柘荣县| 南岸区| 樟树市| 江达县| 新丰县| 乳源| 仁布县| 祁阳县| 新巴尔虎左旗| 和田市| 淳安县| 桂平市| 辽源市| 乐陵市| 东乡族自治县| 扶绥县| 靖远县| 响水县| 松原市| 循化| 临汾市| 富裕县| 格尔木市| 德钦县| 双柏县| 法库县| 那坡县| 洪江市| 扶风县| 通州区| 苍溪县| 长治县| 临夏县| 孟连| 上林县| 咸丰县| 临邑县| 互助| 无棣县| 石景山区| 永福县|