Python爬虫初学（一）—— 爬取段子

最近开始学Python的爬虫，是在这个博客跟着学习的，该博主用的是Python 2.7版本，而我使用的是3.5版本，很多不兼容的地方，不过没关系，自己改改就好了。

我们想针对网站的内容进行筛选，只获取自己感兴趣的部分。比如你想在XX网站把小黄图筛选出来，打包带走。这里只做简单的实现，以百思不得姐上的段子（纯文本）为例。我们想要实现如下功能：

批量下载若干页段子到本地文件中

按下任意一键，开始阅读下一条段子

1. 获取网页代码

导入urllib的相关库，Python 3中应该这样写：

import urllib.request
import urllib.parse
import re

re库是正则表达式（Regular Expression），后面作匹配时会用到。

百思不得姐的段子页面url ='http://www.budejie.com/text/1'，这里末尾数字1代表此为第一页。通过以下代码就能返回网页内容。

    req = urllib.request.Request(url)
    # 添加headers 使之看起来像浏览器在访问
    req.add_header('User-Agent', 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 '
                                 '(KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36')
    response = urllib.request.urlopen(req)
    # 得到网页内容，注意必须使用decode()解码
    html = response.read().decode('utf-8')

print(html)的话，就是如下所示的内容：

这能看？段子呢？我们想要的段子呢？！

哦对了headers这样查看。

按F12，然后...看图吧

2. 正则匹配提取段子

要想筛选符合普通人阅读的内容（如果还带着html标签那还咋读是不），成功提取出段子，为此我们需要一些既定的模式去和网页全部内容进行匹配，将模式下匹配成功的对象返回。我们使用强大的正则表达式进行匹配（Regular Expression），相关语法可以看这里。

仅仅针对本例中的网页内容，先看看我们需要的段子对应了网页中的什么内容。

可以看到段子被<div class="j-r-list-c-desc">(我们要的内容)</div>这样的标签所包围，只需要指定相应规则提取出来即可！上图可以看出段子正文前后是有很多空格的，需要匹配进去。

pattern = re.compile(r'<div class="j-r-list-c-desc">\s+(.*)\s+</div>')
result = re.findall(pattern, html)

通过re库的compile函数制定规则。

\s+可以匹配一个或更多的空格

.匹配除开换行符\n外的所有字符。

现在我们得到了匹配后的结果，来看下。

Bingo！提取出来了不是？！

可是我们发现里面还有些讨厌的<br />。没关系，写几行代码的事。这里就不再展示去掉后的内容，自行脑补哈哈。

    for each in content:
        # 如果某个段子里有<br />
        if '<br />' in each:
            # 替换成换行符并输出
            new_each = re.sub(r'<br />', '\n', each)
            print(new_each)
        # 没有就照常输出
        else:
            print(each)

这里content由get_content方法返回，表示所有获取到的段子列表。get_content方法下面会给出实现。

至此，我们成功得到我们想看的段子了！如果想要下载到本地呢？

3. 下载段子到本地

通过定义一个save()函数即可，num参数用户自定，想下载最近100页的内容都没问题！里面还有些变量没有提到，最后会给出源代码。

# num是指定网页页数
def save(num):
    # 写方式打开一个文本，把获取的段子列表存放进去
    with open('a.txt', 'w', encoding='utf-8') as f:
        text = get_content(num)
        # 和上面去掉<br />类似
        for each in text:
            if '<br />' in each:
                new_each = re.sub(r'<br />', '\n', each)
                f.write(new_each)
            else:
                f.write(str(each) + '\n')

下载到本地文档后如下图所示

4. 逐条读取段子

段子太多，琳琅满目。可我们只希望一条条阅读。通过按下键盘任意键可以切换到下一条，直到读取到最后一条程序才结束，或者通过设置一个退出键随时退出程序，比如设定q键退出。这里把全部代码给出。

import urllib.request
import urllib.parse
import re

pattern = re.compile(r'<div class="j-r-list-c-desc">\s+(.*)\s+</div>')

# 返回指定网页的内容
def open_url(url):
    req = urllib.request.Request(url)
    req.add_header('User-Agent', 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 '
                                 '(KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36')
    response = urllib.request.urlopen(req)
    html = response.read().decode('utf-8')
    return html

# num为用户自定，返回的是所有页的段子列表
def get_content(num):
    # 存放段子的列表
    text_list = []
    for page in range(1, int(num)):
        address = 'http://www.budejie.com/text/' + str(page)
        html = open_url(address)
        result = re.findall(pattern, html)
        # 每一页的result都是一个列表，将里面的内容加入到text_list
        for each in result:
            text_list.append(each)
    return text_list


# num是指定网页页数
def save(num):
    # 写方式打开一个文本，把获取的段子列表存放进去
    with open('a.txt', 'w', encoding='utf-8') as f:
        text = get_content(num)
        # 和上面去掉<br />类似
        for each in text:
            if '<br />' in each:
                new_each = re.sub(r'<br />', '\n', each)
                f.write(new_each)
            else:
                f.write(str(each) + '\n')
                
                
if __name__ == '__main__':
    print('阅读过程中按q随时退出')
    number = int(input('想读几页的内容: '))
    content = get_content(number + 1)
    for each in content:
        if '<br />' in each:
            new_each = re.sub(r'<br />', '\n', each)
            print(new_each)
        else:
            print(each)
        # 用户输入
        user_input = input()
        # 不区分大小写的q，输入则退出
        if user_input == 'q' or user_input == 'Q':
            break

演示一下，效果是这样的。

虽然功能很鸡肋，不过作为初学我还是很满意了，有兴趣才能深入下去嘛！爬虫可不仅仅如此而已，以后会学习更加高级的功能。

by @sunhaiyu

2016.8.15

最后编辑于：2017.12.04 01:39:59

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 157,298评论 4赞 360
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 66,701评论 1赞 290
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 107,078评论 0赞 237
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 43,687评论 0赞 202
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 52,018评论 3赞 286
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 40,410评论 1赞 211
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 31,729评论 2赞 310
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 30,412评论 0赞 194
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 34,124评论 1赞 239
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 30,379评论 2赞 242
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 31,903评论 1赞 257
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 28,268评论 2赞 251
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 32,894评论 3赞 233
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 26,014评论 0赞 8
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 26,770评论 0赞 192
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 35,435评论 2赞 269
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 35,312评论 2赞 260

Python爬虫初学（一）—— 爬取段子

1. 获取网页代码

2. 正则匹配提取段子

3. 下载段子到本地

4. 逐条读取段子

推荐阅读更多精彩内容