热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

网络爬虫:Python+requests+re+xlwt爬取淘宝商品并把价格和名字写入Excel表格

网络爬虫:Python+requests+re+xlwt爬取淘宝商品并把价格和名字写入Excel表格,Go语言社区,Golang程序员人脉社


由于学东西比较死,不够灵活,学校的acm实验室做算法题,打比赛,我是真的跟不上那些大佬...就看到人以前实验室退出的,加到 其他实验室学习项目,做项目,做项目相对学习算法来说,没有那么烧脑,还能做出有趣的东西....我就想学习做项目,因为打比赛我是拿不到能看的成绩.....我们实验室的指导老师,也挺为大家考虑的,让喜欢打比赛的暑假集训,继续刷题,学习算法,还为了,一部分人开设了项目组,进行机器学习,网络爬虫.....哈哈,学了两个月的python,正好有一些基础,正好也想学习网络爬虫,首先得感谢mooc上面的北京理工大学嵩天等老师开设的 python程序设计,和网络爬虫课程,收益良多,起码能用python做点cf的题了,还学习了爬虫。。

在爬虫课程里面,模仿到嵩天老师的爬取淘宝的商品信息,价格和名字,然后自己改了一部分,增加了存入excel表的功能,然后增加提示,增加用户体验感,虽然说还是有很多不足,但是对于小白来说,有这个程度很开心了....

爬虫难点:需要对网页里面大量的网页代码里面找需要的信息,用正则表达式提取出来,正则表达式,表示很头疼...然后就是python基础能够是否灵活的运用,还有第三方库的用法。

首先:分析网页的搜索接口,以便我们通过自己的输入爬取对应的商品


可以发现搜索接口是:

https://s.taobao.com/search?q= (后面就是自己输入的商品名称在调用这个接口)

我们一般会爬取不止一页:所以需要翻页,可以有上面图片发现,每翻一页,最后的&s=()是44的倍数,所以到时候翻页的时候,就for 循环用变量自动翻页。

这里分享一下这里自己的代码:仅供互相学习。

首先看下效果吧:

由于我是打包成可运行.exe文件的就直接运行:如果是用的idle或者其他编译器请在运行这份代码的路径下寻找excel表。




爬完后保存的是这个代码文件的位置打开后:


爬取成功也保存了进来了,还可以对照这淘宝上搜索一下花卉,发现都有的。说明爬取非常成功!

贴一份源代码供大家学习,切记爬取超大量数据!

import requests,re,xlwt
#获取页面
def getHtml(url):
    try:
        r=requests.get(url,timeout=30)
        r.raise_for_status()
        r.encoding=r.apparent_encoding
        print("请求服务器成功!n")
        return r.text
    except:
        print("请求失败")
    
#解析页面 正则表达式提取信息
def parsePage(ilt,html):
    try:
        plt=re.findall(r'"view_price":"[d.]*"',html)
        tlt=re.findall(r'"raw_title":".*?"',html)
        print("解析成功!n")
        for i in range(len(plt)):
            price=eval(plt[i].split(':')[1])
            title=eval(tlt[i].split(':')[1])
            ilt.append([price,title])
    except:
        print("解析失败!n")
    
#写入Excel
def Write_Excel(ilt):
  print("正在写入Exel表格....")
  #创建工作簿指定编码
  file=xlwt.Workbook(encoding='utf-8')
  #创建表
  table=file.add_sheet("淘宝商品信息")
  count=0
  #print(tplt.format("序号","价格","商品名称"))
  value=["序号","价格","商品名称"]
  for i in range(len(value)):
    table.write(count,i+1,value[i])
  for g in ilt:
      count+=1
      value=[count,float(g[0]),g[1][0:10]]
      for j in range(3):
          table.write(count,j+1,value[j])
      #Write_Excel(count,value=[g[0],g[1]],f=file)
  file.save("淘宝商品信息.xls")
  print("写入成功!")
      #print(tplt.format(count,g[0],g[1]))
#把数据写入Excel表
   
def main():
    goods=input("请输入需要爬取的淘宝商品名称:")
    #爬取的页面深度
    depth=int(input("请输入爬取的页面数量(建议不超过5页):"))
    start_url="https://s.taobao.com/search?q="+goods
    inforList=[]
    for i in range(depth):
        try:
            #翻页,起始页面s,在a起始页面上进行翻页
            url=start_url+'&s='+str(44*i)
            print("正在请求服务器商品链接第%d页,请稍等......"%(i+1))
            html=getHtml(url)
            print("正在解析第%d页,请稍等......"%(i+1))
            parsePage(inforList,html)
        except:
            continue
    Write_Excel(inforList)
    #printGoodsList(inforList)
main()

    


推荐阅读
  • 根据最新发布的《互联网人才趋势报告》,尽管大量IT从业者已转向Python开发,但随着人工智能和大数据领域的迅猛发展,仍存在巨大的人才缺口。本文将详细介绍如何使用Python编写一个简单的爬虫程序,并提供完整的代码示例。 ... [详细]
  • 使用Python在SAE上开发新浪微博应用的初步探索
    最近重新审视了新浪云平台(SAE)提供的服务,发现其已支持Python开发。本文将详细介绍如何利用Django框架构建一个简单的新浪微博应用,并分享开发过程中的关键步骤。 ... [详细]
  • 技术分享:从动态网站提取站点密钥的解决方案
    本文探讨了如何从动态网站中提取站点密钥,特别是针对验证码(reCAPTCHA)的处理方法。通过结合Selenium和requests库,提供了详细的代码示例和优化建议。 ... [详细]
  • 离线环境下的Python及其第三方库安装指南
    在项目开发中,有时会遇到电脑只能连接内网或完全无法联网的情况。本文将详细介绍如何在这种环境下安装Python及其所需的第三方库,确保开发工作的顺利进行。 ... [详细]
  • 本文详细介绍 Go+ 编程语言中的上下文处理机制,涵盖其基本概念、关键方法及应用场景。Go+ 是一门结合了 Go 的高效工程开发特性和 Python 数据科学功能的编程语言。 ... [详细]
  • Explore how Matterverse is redefining the metaverse experience, creating immersive and meaningful virtual environments that foster genuine connections and economic opportunities. ... [详细]
  • PyCharm下载与安装指南
    本文详细介绍如何从官方渠道下载并安装PyCharm集成开发环境(IDE),涵盖Windows、macOS和Linux系统,同时提供详细的安装步骤及配置建议。 ... [详细]
  • 本文将介绍如何使用 Go 语言编写和运行一个简单的“Hello, World!”程序。内容涵盖开发环境配置、代码结构解析及执行步骤。 ... [详细]
  • 本文详细介绍了如何在Linux系统上安装和配置Smokeping,以实现对网络链路质量的实时监控。通过详细的步骤和必要的依赖包安装,确保用户能够顺利完成部署并优化其网络性能监控。 ... [详细]
  • 1.如何在运行状态查看源代码?查看函数的源代码,我们通常会使用IDE来完成。比如在PyCharm中,你可以Ctrl+鼠标点击进入函数的源代码。那如果没有IDE呢?当我们想使用一个函 ... [详细]
  • 本文介绍了在安装或运行 Python 项目时遇到的 'ModuleNotFoundError: No module named setuptools_rust' 错误,并提供了解决方案。 ... [详细]
  • Python自动化处理:从Word文档提取内容并生成带水印的PDF
    本文介绍如何利用Python实现从特定网站下载Word文档,去除水印并添加自定义水印,最终将文档转换为PDF格式。该方法适用于批量处理和自动化需求。 ... [详细]
  • 掌握远程执行Linux脚本和命令的技巧
    本文将详细介绍如何利用Python的Paramiko库实现远程执行Linux脚本和命令,帮助读者快速掌握这一实用技能。通过具体的示例和详尽的解释,让初学者也能轻松上手。 ... [详细]
  • 本文探讨了如何在给定整数N的情况下,找到两个不同的整数a和b,使得它们的和最大,并且满足特定的数学条件。 ... [详细]
  • 本文详细介绍了在Android 8.x中,GMS认证新增的CTS和VTS测试,特别是如何在VTS环境下测试GSI版本。文章涵盖了详细的测试环境配置和具体操作步骤。 ... [详细]
author-avatar
金裕麟雯茂俊佑
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有