首页 > 代码库 > 用正则获取贴吧首页贴子的相关数据

用正则获取贴吧首页贴子的相关数据

[root@iZ62jhlmsZ ~]$  wget http://tieba.baidu.com/f?kw=%C9%BD%CE%F7 -O - | grep -Po ‘href="http://www.mamicode.com/(/p/[0-9]{10}).*?j_user_card.*?\>(.*?)\<.*?threadlist_reply_date j_reply_data.*?>[ ]*([0-9]{1,2}:[0-9]{2})‘ >tb.txt

wget -- linux 下获取 http页面的工具 -O - 表示输出到管道(而不是文件)

grep --linux 正则表达式工具

-P  使用 prel语法

-o  只输出匹配到的内容(而不是一行)

(/p/[0-9]{10}) 首页贴子的链接,格式为 a href="http://www.mamicode.com/p/3444444444"
.*? 非贪婪匹配任意字符
j_user_card.*?\>(.*?) 查找发贴人昵称,值为(.*?)
threadlist_reply_date j_reply_data.*?>[ ]*([0-9]{1,2}:[0-9]{2})  最后回复日期,值为([0-9]{1,2}:[0-9]{2})



用正则获取贴吧首页贴子的相关数据