Python网络爬虫（爬取嗅事百科的热图）

作者：血流的风霜_565 | 来源：互联网 | 2023-09-23 19:19

爬取糗事百科的热图设计要求(1)从糗事百科https:www.qiushibaike.comimgrank抓取所有的图片信息。(2)获取前四页所有的图片信息，并用

爬取糗事百科的热图

设计要求

(1) 从糗事百科 https://www.qiushibaike.com/imgrank/ 抓取所有的图片信息。
(2) 获取前四页所有的图片信息&＃xff0c;并用相应的名称命名该图片。
(3) 将图片存储至文件中。

分析

因为打开网站查看内容&＃xff0c;网站里面是这样的
在这里插入图片描述
我们先向服务器发送一个请求&＃xff0c;返回所有的相关资源&＃xff08;这里的new_url&＃61;https://www.qiushibaike.com/imgrank/&＃xff09;

page_text&＃61;requests.get(url&＃61;new_url,headers&＃61;headers).text

在返回的资源中找到图片相应的位置&＃xff0c;编写正则表达式&＃xff08;目的&＃xff1a;在大量的资源中匹配图片的信息&＃xff0c;以便我们筛选出来&＃xff09;&＃xff1a;

ex&＃61;&＃39;

.*?&＃39;

选择所有符合正则表达式的图片&＃xff0c;用img_src_list来保存

img_src_list&＃61;re.findall(ex,page_text,re.S)

img_src_list里面保存的是图片的下载地址&＃xff0c;遍历img_src_list&＃xff0c;下载图片并保存到相应的位置

for src in img_src_list:src&＃61;&＃39;https:&＃39;&＃43;srcimg_data&＃61;requests.get(url&＃61;src,headers&＃61;headers).contentimg_name&＃61;src.split(&＃39;/&＃39;)[-1]imgpath&＃61;&＃39;./img/&＃39;&＃43;img_namewith open(imgpath,&＃39;wb&＃39;) as fp:fp.write(img_data)

完整的代码如下&＃xff08;还实现翻页的功能&＃xff09;&＃xff1a;

import requests import re import os headers&＃61;{&＃39;User-Agent&＃39;:&＃39;Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/87.0.4280.88 Safari/537.36&＃39; } if not os.path.exists(&＃39;./img&＃39;):os.mkdir(&＃39;./img&＃39;) url&＃61;&＃39;https://www.qiushibaike.com/imgrank/page/%d/&＃39; for pageNum in range(1,5):print(&＃39;第{}页开始下载&＃39;.format(pageNum))new_url&＃61;format(url%pageNum)page_text&＃61;requests.get(url&＃61;new_url,headers&＃61;headers).textex&＃61;&＃39;

.*?&＃39;img_src_list&＃61;re.findall(ex,page_text,re.S)for src in img_src_list:src&＃61;&＃39;https:&＃39;&＃43;srcimg_data&＃61;requests.get(url&＃61;src,headers&＃61;headers).contentimg_name&＃61;src.split(&＃39;/&＃39;)[-1]imgpath&＃61;&＃39;./img/&＃39;&＃43;img_namewith open(imgpath,&＃39;wb&＃39;) as fp:fp.write(img_data)print(img_name,&＃39;下载成功&＃xff01;&＃xff01;&＃xff01;&＃39;)
print(&＃39;内容全部下载完成&＃xff01;&＃xff01;&＃xff01;&＃39;)

PS&＃xff1a;正则表达式是比较重要的&＃xff0c;有兴趣的同学可以点击去学习一下正则表达式
本代码只能用于学习

推荐阅读

text
Python爬虫实战：豆瓣电影Top250数据抓取

本文详细介绍了如何使用Python编写爬虫程序，从豆瓣电影Top250页面抓取电影信息。文章涵盖了从基础的网页请求到处理反爬虫机制，再到多页数据抓取的全过程，并提供了完整的代码示例。 ... [详细]

蜡笔小新 2024-12-27 16:55:07
sum
PHP数组平均值计算方法详解

本文详细介绍了如何在PHP中计算数组的平均值，涵盖基本概念、具体实现步骤及示例代码。通过本篇文章，您将掌握使用PHP函数array_sum()和count()来求解数组元素的平均值。 ... [详细]

蜡笔小新 2024-12-25 14:20:56
text
自己用过的一些比较有用的css3新属性【HTML】

web前端|html教程自己用过的一些比较用的css3新属性web前端-html教程css3刚推出不久，虽然大多数的css3属性在很多流行的浏览器中不支持，但我个人觉得还是要尽量开 ... [详细]

蜡笔小新 2024-12-24 19:26:54
php
PHP 5.2.5 安装与配置指南

本文详细介绍了 PHP 5.2.5 的安装和配置步骤，帮助开发者解决常见的环境配置问题，特别是上传图片时遇到的错误。通过本教程，您可以顺利搭建并优化 PHP 运行环境。 ... [详细]

蜡笔小新 2024-12-27 19:05:41
function
Yii2 GridView 实现列表页数据直接编辑的完整指南

本文详细介绍了如何使用 Yii2 的 GridView 组件在列表页面实现数据的直接编辑功能。通过具体的代码示例和步骤，帮助开发者快速掌握这一实用技巧。 ... [详细]

蜡笔小新 2024-12-27 16:27:52
go
Python自动化处理：从Word文档提取内容并生成带水印的PDF

本文介绍如何利用Python实现从特定网站下载Word文档，去除水印并添加自定义水印，最终将文档转换为PDF格式。该方法适用于批量处理和自动化需求。 ... [详细]

蜡笔小新 2024-12-27 13:10:20
text
优化Windows右键菜单管理

本文介绍如何通过注册表编辑器自定义和优化Windows文件右键菜单，包括删除不需要的菜单项、添加绿色版或非安装版软件以及将特定应用程序（如Sublime Text）添加到右键菜单中。 ... [详细]

蜡笔小新 2024-12-27 12:00:01
text
使用 NSTimer 实现倒计时功能

本文介绍如何使用 NSTimer 实现倒计时功能，详细讲解了初始化方法、参数配置以及具体实现步骤。通过示例代码展示如何创建和管理定时器，确保在指定时间间隔内执行特定任务。 ... [详细]

蜡笔小新 2024-12-26 19:08:19
sum
PHP 5.5.0rc1 发布：深入解析 Zend OPcache

2013年5月9日，PHP官方发布了PHP 5.5.0rc1和PHP 5.4.15正式版，这两个版本均支持64位环境。本文将详细介绍Zend OPcache的功能及其在Windows环境下的配置与测试。 ... [详细]

蜡笔小新 2024-12-26 12:56:20
go
Python 爬虫基础教程及代码实例

根据最新发布的《互联网人才趋势报告》，尽管大量IT从业者已转向Python开发，但随着人工智能和大数据领域的迅猛发展，仍存在巨大的人才缺口。本文将详细介绍如何使用Python编写一个简单的爬虫程序，并提供完整的代码示例。 ... [详细]

蜡笔小新 2024-12-26 10:42:40
go
Python文本处理与可视化：分词及词云生成

本文介绍如何使用Python进行文本处理，包括分词和生成词云图。通过整合多个文本文件、去除停用词并生成词云图，展示文本数据的可视化分析方法。 ... [详细]

蜡笔小新 2024-12-26 08:37:18
go
Ionic框架在HTML5中的应用与实践

本文详细介绍了Ionic框架的使用方法及其与Angular的集成。Ionic框架是一个强大的前端开发工具，适用于构建跨平台的移动应用程序。文章将探讨如何引入必要的CSS和JavaScript文件，并解释bundle.js中包含的核心功能，如路由等。 ... [详细]

蜡笔小新 2024-12-23 19:38:45
stream
Servlet 表单处理：GET 和 POST 请求的深入解析

本文详细探讨了HTML表单中GET和POST请求的区别，包括它们的工作原理、数据传输方式、安全性及适用场景。同时，通过实例展示了如何在Servlet中处理这两种请求。 ... [详细]

蜡笔小新 2024-12-23 18:09:59
php
递推算法与大数处理

本问题探讨了在特定条件下排列儿童队伍的方法数量。题目要求计算满足条件的队伍排列总数，并使用递推算法和大数处理技术来解决这一问题。 ... [详细]

蜡笔小新 2024-12-23 12:18:55
perl
Python处理Word文档的高效技巧

本文详细介绍了如何使用Python处理Word文档，涵盖从基础操作到高级功能的各种技巧。我们将探讨如何生成文档、定义样式、提取表格数据以及处理超链接和图片等内容。 ... [详细]

蜡笔小新 2024-12-23 10:40:32

血流的风霜_565

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章