xlwt在爬虫中的实战（爬取豆瓣图书）

作者：无石笑_987 | 来源：互联网 | 2023-09-17 04:22

爬虫相关知识请阅读我的其他文章importreimportxlwtimportrequestsfrombs4importBeautifulSoupdefgetHtml(ur

爬虫相关知识请阅读我的其他文章

import re import xlwt import requests from bs4 import BeautifulSoupdef getHtml(url):# 构造请求头headers &＃61; {&＃39;User-Agent&＃39;: &＃39;Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:56.0) Gecko/20100101 Firefox/56.0&＃39;}page &＃61; requests.get(url, headers&＃61;headers)html &＃61;page.textreturn htmlif __name__&＃61;&＃61;&＃39;__main__&＃39;:# 创建workbookWorkbook &＃61; xlwt.Workbook()# 创建worksheetsheet &＃61; Workbook.add_sheet(&＃39;豆瓣图书Top250&＃39;, cell_overwrite_ok&＃61;True)sheet.write(0,0,&＃39;书名&＃39;)sheet.write(0,1,&＃39;作者&＃39;)sheet.write(0,2,&＃39;译者&＃39;)sheet.write(0,3,&＃39;出版单位&＃39;)sheet.write(0,4,&＃39;出版时间&＃39;)sheet.write(0,5,&＃39;定价&＃39;)sheet.write(0,6,&＃39;豆瓣评分&＃39;)sheet.write(0,7,&＃39;评价人数&＃39;)sheet.write(0,8,&＃39;一句话&＃39;)i &＃61; 1j &＃61; 1k &＃61; 1m &＃61; 1# 循环翻页for page in range(0,250,25):url &＃61; &＃39;https://book.douban.com/top250?start&＃61;{0}&＃39;.format(page)html &＃61; getHtml(url)# beautiful对象Soup &＃61; BeautifulSoup(html,&＃39;html.parser&＃39;)names &＃61; Soup.find_all(&＃39;div&＃39;,class_ &＃61; &＃39;pl2&＃39;)for name in names:book &＃61; name.find(&＃39;a&＃39;)book &＃61; book.text.strip()book &＃61; book.replace(&＃39; &＃39;,&＃39;&＃39;)sheet.write(i,0,book)i &＃43;&＃61; 1Infos &＃61; Soup.find_all(&＃39;p&＃39;,class_ &＃61; &＃39;pl&＃39;)for Info in Infos:r &＃61; 1authorinfo &＃61; Info.textauthors &＃61; authorinfo.split(&＃39;/&＃39;)if len(authors) < 4:sheet.write(j,1,authors[0])sheet.write(j,2,authors[1])sheet.write(j,3,authors[2])j &＃43;&＃61; 1continuesheet.write(j,1,authors[0])if authorinfo.count(&＃39;/&＃39;) &＃61;&＃61; 4:sheet.write(j,2,authors[r])r &＃43;&＃61; 1sheet.write(j,3,authors[r])sheet.write(j,4,authors[r&＃43;1])sheet.write(j,5,authors[r&＃43;2])j &＃43;&＃61; 1rating_nums &＃61; Soup.find_all(&＃39;div&＃39;,class_ &＃61; &＃39;star clearfix&＃39;)for rating in rating_nums:star &＃61; rating.find_all(&＃39;span&＃39;)sheet.write(k,6,star[1].text)reg &＃61; r&＃39;\d&＃43;&＃39;vote &＃61; re.findall(reg,star[2].text)sheet.write(k,7,vote)k &＃43;&＃61; 1quotes &＃61; Soup.find_all(&＃39;p&＃39;,class_ &＃61; &＃39;quote&＃39;)for quote in quotes:sheet.write(m,8,quote.text)m &＃43;&＃61; 1Workbook.save(&＃39;豆瓣图书Top250.xls&＃39;)

在这里插入图片描述

推荐阅读

int
Python 爬虫基础教程及代码实例

根据最新发布的《互联网人才趋势报告》，尽管大量IT从业者已转向Python开发，但随着人工智能和大数据领域的迅猛发展，仍存在巨大的人才缺口。本文将详细介绍如何使用Python编写一个简单的爬虫程序，并提供完整的代码示例。 ... [详细]

蜡笔小新 2024-12-26 10:42:40
int
技术分享：从动态网站提取站点密钥的解决方案

本文探讨了如何从动态网站中提取站点密钥，特别是针对验证码（reCAPTCHA）的处理方法。通过结合Selenium和requests库，提供了详细的代码示例和优化建议。 ... [详细]

蜡笔小新 2024-12-28 04:11:47
input
深入理解Tornado模板系统

本文详细介绍了Tornado框架中模板系统的使用方法。Tornado自带的轻量级、高效且灵活的模板语言位于tornado.template模块，支持嵌入Python代码片段，帮助开发者快速构建动态网页。 ... [详细]

蜡笔小新 2024-12-27 19:22:16
int
Java并发编程：LinkedBlockingQueue的实际应用

本文介绍了Java并发库中的阻塞队列（BlockingQueue）及其典型应用场景。通过具体实例，展示了如何利用LinkedBlockingQueue实现线程间高效、安全的数据传递，并结合线程池和原子类优化性能。 ... [详细]

蜡笔小新 2024-12-27 18:51:49
version
Python爬虫实战：豆瓣电影Top250数据抓取

本文详细介绍了如何使用Python编写爬虫程序，从豆瓣电影Top250页面抓取电影信息。文章涵盖了从基础的网页请求到处理反爬虫机制，再到多页数据抓取的全过程，并提供了完整的代码示例。 ... [详细]

蜡笔小新 2024-12-27 16:55:07
const
使用 Azure Service Principal 和 Microsoft Graph API 获取 AAD 用户列表

本文介绍了一段通用代码示例，该代码不仅能够操作 Azure Active Directory (AAD)，还可以通过 Azure Service Principal 的授权访问和管理 Azure 订阅资源。Azure 的架构可以分为两个层级：AAD 和 Subscription。 ... [详细]

蜡笔小新 2024-12-27 16:07:12
int
深入理解Python的os和sys模块

本文详细解析了Python中的os和sys模块，介绍了它们的功能、常用方法及其在实际编程中的应用。 ... [详细]

蜡笔小新 2024-12-26 22:04:19
int
使用Objective-C和dispatch库实现并发素数计算

本文介绍如何使用Objective-C结合dispatch库进行并发编程，以提高素数计数任务的效率。通过对比纯C代码与引入并发机制后的代码，展示dispatch库的强大功能。 ... [详细]

蜡笔小新 2024-12-28 08:44:35
int
Python配置文件读写指南

本文详细介绍如何使用Python进行配置文件的读写操作，涵盖常见的配置文件格式（如INI、JSON、TOML和YAML），并提供具体的代码示例。 ... [详细]

蜡笔小新 2024-12-28 08:39:55
int
Java 中的 BigDecimal pow()方法，示例

Java 中的 BigDecimal pow()方法，示例 ... [详细]

蜡笔小新 2024-12-27 20:54:03
int
Java 类成员初始化顺序与数组创建

本文探讨了Java中类成员的初始化顺序、静态引入、可变参数以及finalize方法的应用。通过具体的代码示例，详细解释了这些概念及其在实际编程中的使用。 ... [详细]

蜡笔小新 2024-12-27 19:39:42
int
新浪笔试题

1:有如下一段程序：packagea.b.c;publicclassTest{privatestaticinti0;publicintgetNext(){return ... [详细]

蜡笔小新 2024-12-27 19:32:17
int
分页插件3指定到某一页

前言--页数多了以后需要指定到某一页（只做了功能，样式没有细调）html ... [详细]

蜡笔小新 2024-12-27 15:19:01
int
Python自动化处理：从Word文档提取内容并生成带水印的PDF

本文介绍如何利用Python实现从特定网站下载Word文档，去除水印并添加自定义水印，最终将文档转换为PDF格式。该方法适用于批量处理和自动化需求。 ... [详细]

蜡笔小新 2024-12-27 13:10:20
int
C#中获取进程主窗口句柄的实现方法

本文介绍了如何在C#中启动一个应用程序，并通过枚举窗口来获取其主窗口句柄。当使用Process类启动程序时，我们通常只能获得进程的句柄，而主窗口句柄可能为0。因此，我们需要使用API函数和回调机制来准确获取主窗口句柄。 ... [详细]

蜡笔小新 2024-12-27 03:39:09

无石笑_987

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章