python抓取网页数据的三种方法

2024-10-08 20:13:02 215人阅读

一、正则表达式提取网页内容

解析效率：正则表达式>lxml>beautifulsoup

代码：

import re

import urllib2

urllist = ‘http://example.webscraping.com/places/default/view/United-Kingdom-239‘

html = urllib2.urlopen(urllist).read()

num = re.findall(‘<td class="w2p_fw">(.*?)</td>‘,html)

print num

print "num[1]: ",num[1]

二、BeautifulSoup方法提取网页内容

代码如下：

from bs4 import BeautifulSoup

import urllib2

urllist = ‘http://example.webscraping.com/places/default/view/United-Kingdom-239‘

html = urllib2.urlopen(urllist).read()

#把html格式进行确定和纠正

soup = BeautifulSoup(html,‘html.parser‘)

#找出tr标签中id属性为places_area__row的内容，如果把find改成findall函数则会把匹配所#有的内容显示出来，find函数只匹配第一次匹配的内容。

tr = soup.find(‘tr‘,attrs={‘id‘:‘places_area__row‘})

td = tr.find(‘td‘,attrs={‘class‘:‘w2p_fw‘})

#取出标签内容

area = td.text

print "area: ",area

三、lxml

lxml库功能和使用类似BeautifulSoup库，不过lxml解析速度比beautifulsoup快。

代码：

import lxml.html

import urllib2

urllist = ‘http://example.webscraping.com/places/default/vie

w/United-Kingdom-239‘

html = urllib2.urlopen(urllist).read()

tree = lxml.html.fromstring(html)

td = tree.cssselect(‘tr#places_area__row > td.w2p_fw‘)[0]

area = td.text_content()

print area

python抓取网页数据的三种方法

声明：以上内容来自用户投稿及互联网公开渠道收集整理发布，本网站不拥有所有权，未作人工编辑处理，也不承担相关法律责任，若内容有误或涉及侵权可进行投诉：投诉/举报工作人员会在5个工作日内联系你，一经查实，本站将立刻删除涉嫌侵权内容。

联系
我们