首页 > 代码库 > python实现简单爬虫--爬图片
python实现简单爬虫--爬图片
首先有两个功能需求:
第一:获取到要爬的页面html内容;
第二:使用正则表达式进行匹配并进行保存到本地。
#!/usr/bin/env python #encoding:utf-8 import urllib import re def getHtml(url): ‘‘‘获取到url的html内容‘‘‘ page = urllib.urlopen(url) html = page.read() return html html1 = getHtml(‘http://image.baidu.com/search/index?tn=baiduimage&ct=201326592&lm=-1&cl=2&ie=gbk&word=%C3%C0%C5%AE&ala=1&fr=ala&alatpl=cover&pos=0‘) # print html1 # print re.findall(r‘"objURL":"(.+?\.jpg)"‘,html1) def downloadImg(html1): ‘‘‘下载页面里的jpg图片‘‘‘ reg = r‘"objURL":"(.+?\.jpg)"‘ #预编译正则表达式提高运行速度 imgreg = re.compile(reg) urllist = re.findall(imgreg,html1) num = 0 #for循环遍历下载每个图片 for i in urllist: urllib.urlretrieve(i,‘%s.jpg‘ % num) num+=1 downloadImg(html1)
本文出自 “song” 博客,请务必保留此出处http://song1230.blog.51cto.com/5595296/1882753
python实现简单爬虫--爬图片
声明:以上内容来自用户投稿及互联网公开渠道收集整理发布,本网站不拥有所有权,未作人工编辑处理,也不承担相关法律责任,若内容有误或涉及侵权可进行投诉: 投诉/举报 工作人员会在5个工作日内联系你,一经查实,本站将立刻删除涉嫌侵权内容。