首页 > 代码库 > 用正则获取贴吧首页贴子的相关数据
用正则获取贴吧首页贴子的相关数据
[root@iZ62jhlmsZ ~]$ wget http://tieba.baidu.com/f?kw=%C9%BD%CE%F7 -O - | grep -Po ‘href="http://www.mamicode.com/(/p/[0-9]{10}).*?j_user_card.*?\>(.*?)\<.*?threadlist_reply_date j_reply_data.*?>[ ]*([0-9]{1,2}:[0-9]{2})‘ >tb.txt
wget -- linux 下获取 http页面的工具 -O - 表示输出到管道(而不是文件)
grep --linux 正则表达式工具
-P 使用 prel语法
-o 只输出匹配到的内容(而不是一行)
(/p/[0-9]{10}) 首页贴子的链接,格式为 a href="http://www.mamicode.com/p/3444444444"
.*? 非贪婪匹配任意字符
j_user_card.*?\>(.*?) 查找发贴人昵称,值为(.*?)
threadlist_reply_date j_reply_data.*?>[ ]*([0-9]{1,2}:[0-9]{2}) 最后回复日期,值为([0-9]{1,2}:[0-9]{2})
用正则获取贴吧首页贴子的相关数据
声明:以上内容来自用户投稿及互联网公开渠道收集整理发布,本网站不拥有所有权,未作人工编辑处理,也不承担相关法律责任,若内容有误或涉及侵权可进行投诉: 投诉/举报 工作人员会在5个工作日内联系你,一经查实,本站将立刻删除涉嫌侵权内容。