Day32

1、爬虫

import re
from urllib.request import urlopen

def getPage(url):
    response = urlopen(url)
    return response.read().decode('utf-8')

def parsePage(s):
    com = re.compile(
        '<div class="item">.*?<div class="pic">.*?<em .*?>(?P<id>d+).*?<span class="title">(?P<title>.*?)</span>'
        '.*?<span class="rating_num" .*?>(?P<rating_num>.*?)</span>.*?<span>(?P<comment_num>.*?)评价</span>', re.S)

    ret = com.finditer(s)
    for i in ret:
        yield {
            "id": i.group("id"),
            "title": i.group("title"),
            "rating_num": i.group("rating_num"),
            "comment_num": i.group("comment_num"),
        }

def main(num):
    url = 'https://movie.douban.com/top250?start=%s&filter=' % num
    response_html = getPage(url)
    ret = parsePage(response_html)
    print(ret)
    f = open("move_info7", "a", encoding="utf8")
    for obj in ret:
        print(obj)
        data = str(obj)
        f.write(data + "
")
    f.close()

if __name__ == '__main__':
    count = 0
    for i in range(10):
        main(count)
        count += 25

View Code

查看全文

相关阅读:
《SpringBoot揭秘快速构建微服务体系》读后感（二）
《SpringBoot揭秘快速构建微服务体系》读后感（一）
《Java多线程编程核心技术》读后感（十八）
4.Go-结构体、结构体指针和方法
 3.GO-项目结构、包访问权限、闭包和值传递引用传递
 3.Flask-SQLAlchemy
3.django Model
2.深入类和对象
 2.shell编程-函数的高级用法
 mysql命令

原文地址：https://www.cnblogs.com/a352735549/p/8981721.html