Python爬虫练手，一个简单的Python资讯采集案例 - 查问我看

原 python安装以及python采集（2022年4月更新）

|-转 Python爬虫练手，一个简单的Python资讯采集案例

PHPer 2022-05-27 597 0 1

在网上找的，感觉还行，收藏一下

一个简单的Python资讯采集案例，列表页到详情页，到数据保存，保存为txt文档，网站网页结构算是比较规整，简单清晰明了，资讯新闻内容的采集和保存！

应用到的库

requests，time，re，UserAgent，etree

import requests,time,re
from fake_useragent import UserAgent
from lxml import etree

列表页面

列表页，链接xpath解析

href_list=req.xpath('//ul[@class="news-list"]/li/a/@href')

详情页

内容xpath解析

h2=req.xpath('//div[@class="title-box"]/h2/text()')[0]
author=req.xpath('//div[@class="title-box"]/span[@class="news-from"]/text()')[0]
details=req.xpath('//div[@class="content-l detail"]/p/text()')

内容格式化处理

detail='\n'.join(details)

标题格式化处理，替换非法字符

pattern = r"[\/\\\:\*\?\"\<\>\|]"
new_title = re.sub(pattern, "_", title)  # 替换为下划线

保存数据，保存为txt文本

def save(self,h2, author, detail):
    with open(f'{h2}.txt','w',encoding='utf-8') as f:
        f.write('%s%s%s%s%s'%(h2,'\n',detail,'\n',author))


    print(f"保存{h2}.txt文本成功！")

遍历数据采集，yield处理

def get_tasks(self):
    data_list = self.parse_home_list(self.url)
    for item in data_list:
        yield item

程序运行效果

程序采集效果

附源码参考：

#研招网考研资讯采集
#20200710 by微信：huguo00289
# -*- coding: UTF-8 -*-


import requests,time,re
from fake_useragent import UserAgent
from lxml import etree


class RandomHeaders(object):
    ua=UserAgent()
    @property
    def random_headers(self):
        return {
            'User-Agent': self.ua.random,
        }


class Spider(RandomHeaders):
    def __init__(self,url):
        self.url=url




    def parse_home_list(self,url):
        response=requests.get(url,headers=self.random_headers).content.decode('utf-8')
        req=etree.HTML(response)
        href_list=req.xpath('//ul[@class="news-list"]/li/a/@href')
        print(href_list)
        for href in href_list:
            item = self.parse_detail(f'https://yz.chsi.com.cn{href}')
            yield item




    def parse_detail(self,url):
        print(f">>正在爬取{url}")
        try:
            response = requests.get(url, headers=self.random_headers).content.decode('utf-8')
            time.sleep(2)
        except Exception as e:
            print(e.args)
            self.parse_detail(url)
        else:
            req = etree.HTML(response)
            try:
                h2=req.xpath('//div[@class="title-box"]/h2/text()')[0]
                h2=self.validate_title(h2)
                author=req.xpath('//div[@class="title-box"]/span[@class="news-from"]/text()')[0]
                details=req.xpath('//div[@class="content-l detail"]/p/text()')
                detail='\n'.join(details)
                print(h2, author, detail)
                self.save(h2, author, detail)
                return h2, author, detail
            except IndexError:
                print(">>>采集出错需延时，5s后重试..")
                time.sleep(5)
                self.parse_detail(url)




    @staticmethod
    def validate_title(title):
        pattern = r"[\/\\\:\*\?\"\<\>\|]"
        new_title = re.sub(pattern, "_", title)  # 替换为下划线
        return new_title






    def save(self,h2, author, detail):
        with open(f'{h2}.txt','w',encoding='utf-8') as f:
            f.write('%s%s%s%s%s'%(h2,'\n',detail,'\n',author))


        print(f"保存{h2}.txt文本成功！")




    def get_tasks(self):
        data_list = self.parse_home_list(self.url)
        for item in data_list:
            yield item




if __name__=="__main__":
    url="https://yz.chsi.com.cn/kyzx/jyxd/"
    spider=Spider(url)
    for data in spider.get_tasks():
        prin

免责声明：代码仅学习使用，勿用于非法用途...

浏览更多内容请先登录。 立即注册

WEB, WEB后端, Python, 采集

更新于：2022-05-27 11:35:12

您需要登录后才可以评论。立即注册

原 python安装以及python采集（2022年4月更新）

|-转 Python爬虫练手，一个简单的Python资讯采集案例

7

1222

137w+

229

服务器搭建

WEB

个人爱好

游戏

linux

互联网

操作系统

mysql

Python

Yii2

php

WEB后端

网站建设

采集

WEB前端

Centos

经济

工具

生活

内容整理

数据库

资源

OS

电影

JS

常用命令

保险

php项目

问题整理

IT

网站

魔兽世界

composer

NodeJs

观点

AI

欧美电影

Yii扩展

美女

学习

LAMP

全文索引

Apache

前端

发现

Windows

Android

影评

服务器维护

国产电影

uwow

PHP框架

邮件服务器

评测

随笔

服务器

音乐

历史

推荐内容