热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

xlwt在爬虫中的实战(爬取豆瓣图书)

爬虫相关知识请阅读我的其他文章importreimportxlwtimportrequestsfrombs4importBeautifulSoupdefgetHtml(ur

爬虫相关知识请阅读我的其他文章

import re
import xlwt
import requests
from bs4 import BeautifulSoupdef getHtml(url):# 构造请求头headers &#61; {&#39;User-Agent&#39;: &#39;Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:56.0) Gecko/20100101 Firefox/56.0&#39;}page &#61; requests.get(url, headers&#61;headers)html &#61;page.textreturn htmlif __name__&#61;&#61;&#39;__main__&#39;:# 创建workbookWorkbook &#61; xlwt.Workbook()# 创建worksheetsheet &#61; Workbook.add_sheet(&#39;豆瓣图书Top250&#39;, cell_overwrite_ok&#61;True)sheet.write(0,0,&#39;书名&#39;)sheet.write(0,1,&#39;作者&#39;)sheet.write(0,2,&#39;译者&#39;)sheet.write(0,3,&#39;出版单位&#39;)sheet.write(0,4,&#39;出版时间&#39;)sheet.write(0,5,&#39;定价&#39;)sheet.write(0,6,&#39;豆瓣评分&#39;)sheet.write(0,7,&#39;评价人数&#39;)sheet.write(0,8,&#39;一句话&#39;)i &#61; 1j &#61; 1k &#61; 1m &#61; 1# 循环翻页for page in range(0,250,25):url &#61; &#39;https://book.douban.com/top250?start&#61;{0}&#39;.format(page)html &#61; getHtml(url)# beautiful对象Soup &#61; BeautifulSoup(html,&#39;html.parser&#39;)names &#61; Soup.find_all(&#39;div&#39;,class_ &#61; &#39;pl2&#39;)for name in names:book &#61; name.find(&#39;a&#39;)book &#61; book.text.strip()book &#61; book.replace(&#39; &#39;,&#39;&#39;)sheet.write(i,0,book)i &#43;&#61; 1Infos &#61; Soup.find_all(&#39;p&#39;,class_ &#61; &#39;pl&#39;)for Info in Infos:r &#61; 1authorinfo &#61; Info.textauthors &#61; authorinfo.split(&#39;/&#39;)if len(authors) < 4:sheet.write(j,1,authors[0])sheet.write(j,2,authors[1])sheet.write(j,3,authors[2])j &#43;&#61; 1continuesheet.write(j,1,authors[0])if authorinfo.count(&#39;/&#39;) &#61;&#61; 4:sheet.write(j,2,authors[r])r &#43;&#61; 1sheet.write(j,3,authors[r])sheet.write(j,4,authors[r&#43;1])sheet.write(j,5,authors[r&#43;2])j &#43;&#61; 1rating_nums &#61; Soup.find_all(&#39;div&#39;,class_ &#61; &#39;star clearfix&#39;)for rating in rating_nums:star &#61; rating.find_all(&#39;span&#39;)sheet.write(k,6,star[1].text)reg &#61; r&#39;\d&#43;&#39;vote &#61; re.findall(reg,star[2].text)sheet.write(k,7,vote)k &#43;&#61; 1quotes &#61; Soup.find_all(&#39;p&#39;,class_ &#61; &#39;quote&#39;)for quote in quotes:sheet.write(m,8,quote.text)m &#43;&#61; 1Workbook.save(&#39;豆瓣图书Top250.xls&#39;)

在这里插入图片描述


推荐阅读
  • 根据最新发布的《互联网人才趋势报告》,尽管大量IT从业者已转向Python开发,但随着人工智能和大数据领域的迅猛发展,仍存在巨大的人才缺口。本文将详细介绍如何使用Python编写一个简单的爬虫程序,并提供完整的代码示例。 ... [详细]
  • 技术分享:从动态网站提取站点密钥的解决方案
    本文探讨了如何从动态网站中提取站点密钥,特别是针对验证码(reCAPTCHA)的处理方法。通过结合Selenium和requests库,提供了详细的代码示例和优化建议。 ... [详细]
  • 深入理解Tornado模板系统
    本文详细介绍了Tornado框架中模板系统的使用方法。Tornado自带的轻量级、高效且灵活的模板语言位于tornado.template模块,支持嵌入Python代码片段,帮助开发者快速构建动态网页。 ... [详细]
  • 本文介绍了Java并发库中的阻塞队列(BlockingQueue)及其典型应用场景。通过具体实例,展示了如何利用LinkedBlockingQueue实现线程间高效、安全的数据传递,并结合线程池和原子类优化性能。 ... [详细]
  • 本文详细介绍了如何使用Python编写爬虫程序,从豆瓣电影Top250页面抓取电影信息。文章涵盖了从基础的网页请求到处理反爬虫机制,再到多页数据抓取的全过程,并提供了完整的代码示例。 ... [详细]
  • 使用 Azure Service Principal 和 Microsoft Graph API 获取 AAD 用户列表
    本文介绍了一段通用代码示例,该代码不仅能够操作 Azure Active Directory (AAD),还可以通过 Azure Service Principal 的授权访问和管理 Azure 订阅资源。Azure 的架构可以分为两个层级:AAD 和 Subscription。 ... [详细]
  • 本文详细解析了Python中的os和sys模块,介绍了它们的功能、常用方法及其在实际编程中的应用。 ... [详细]
  • 本文介绍如何使用Objective-C结合dispatch库进行并发编程,以提高素数计数任务的效率。通过对比纯C代码与引入并发机制后的代码,展示dispatch库的强大功能。 ... [详细]
  • 本文详细介绍如何使用Python进行配置文件的读写操作,涵盖常见的配置文件格式(如INI、JSON、TOML和YAML),并提供具体的代码示例。 ... [详细]
  • Java 中的 BigDecimal pow()方法,示例 ... [详细]
  • Java 类成员初始化顺序与数组创建
    本文探讨了Java中类成员的初始化顺序、静态引入、可变参数以及finalize方法的应用。通过具体的代码示例,详细解释了这些概念及其在实际编程中的使用。 ... [详细]
  • 1:有如下一段程序:packagea.b.c;publicclassTest{privatestaticinti0;publicintgetNext(){return ... [详细]
  • 前言--页数多了以后需要指定到某一页(只做了功能,样式没有细调)html ... [详细]
  • Python自动化处理:从Word文档提取内容并生成带水印的PDF
    本文介绍如何利用Python实现从特定网站下载Word文档,去除水印并添加自定义水印,最终将文档转换为PDF格式。该方法适用于批量处理和自动化需求。 ... [详细]
  • 本文介绍了如何在C#中启动一个应用程序,并通过枚举窗口来获取其主窗口句柄。当使用Process类启动程序时,我们通常只能获得进程的句柄,而主窗口句柄可能为0。因此,我们需要使用API函数和回调机制来准确获取主窗口句柄。 ... [详细]
author-avatar
无石笑_987
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有