热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

Beautifulsoup4

Beautifulsoup将复杂HTML文档转换成一个复杂的属性结构,每个节点都是python对象,所有对象可归纳为4种Tag,NavigableString,BeautifulS

Beautiful soup将复杂HTML文档转换成一个复杂的属性结构,每个节点都是python对象,所有对象可归纳为4种Tag,NavigableString,BeautifulSoup,Comment

1.Tag 就是html中的一个个标签

  tag有两个重要的属性,name和attrs

2.NavigableString  字符对象

  #打印出标签p中的内容

  print (soup.p.string)

3.BeautifulSoup 表示的是一个文档的内容

  ?部分时候,可以把它当作Tag 对象, 是?个特殊的 Tag

4.Comment 特殊的NavigableString对象

  输出的内容不包括注释符号

 

一、遍历文档树:

 1.直接子节点:.contents和.children属性

  .conten

  tag 的 .content 属性可以将tag的?节点以列表的?式输出

  Print(soup.head.contents)

  # [the domouse’s story]

 

  .children 返回的是list对象

  print (soup.head.children)

  #

  for child in soup.body.children:

  print (child)

 

2.所有子孙节点:.descendants

  contents 和 .children 属性仅包含tag的直接?节点, .descendants 属性可以对所有tag的?孙节点进?递归循环, 和 children类似, 我们也需要遍历获取其中的内容。

    for child in soup.descendants:

    print (child)

  •  通过一个例子来更直观的看出三者之间的区别

获取的节点如下

    技术分享图片

  以下代码分别获取了class=‘catListTag’下直接子节点和子孙子节点的信息

     技术分享图片

运行结果:

D:\PycharmProjects\ImoocInterface\venv\Scripts\python.exe D:/PycharmProjects/ImoocInterface/soup_test.py

-------------------contents-----------------------

[‘\n‘,

我的标签

, ‘\n‘,

  • Autoit(1)
  • beautifulsoup4(1)
  • debug(1)
  • fiddler(1)
  • grid(1)
  • jdk(1)
  • python logging(1)
  • 进程(1)
  • 模块(1)
  • 线程(1)
  • 更多
, ‘\n‘]

-------------------children------------------------

我的标签

  • Autoit(1)
  • beautifulsoup4(1)
  • debug(1)
  • fiddler(1)
  • grid(1)
  • jdk(1)
  • python logging(1)
  • 进程(1)
  • 模块(1)
  • 线程(1)
  • 更多

-------------------descendants-----------------------

我的标签

我的标签 

  • Autoit(1)
  • beautifulsoup4(1)
  • debug(1)
  • fiddler(1)
  • grid(1)
  • jdk(1)
  • python logging(1)
  • 进程(1)
  • 模块(1)
  • 线程(1)
  • 更多

  • Autoit(1)
  • Autoit

    Autoit

    (1)

  • beautifulsoup4(1)
  • beautifulsoup4

    beautifulsoup4

    (1)

  • debug(1)
  • debug

    debug

    .....................

    对比三者可发现,contens和children输出为直接子节点的内容即

    推荐阅读
    • 深入理解Cookie与Session会话管理
      本文详细介绍了如何通过HTTP响应和请求处理浏览器的Cookie信息,以及如何创建、设置和管理Cookie。同时探讨了会话跟踪技术中的Session机制,解释其原理及应用场景。 ... [详细]
    • 技术分享:从动态网站提取站点密钥的解决方案
      本文探讨了如何从动态网站中提取站点密钥,特别是针对验证码(reCAPTCHA)的处理方法。通过结合Selenium和requests库,提供了详细的代码示例和优化建议。 ... [详细]
    • QUIC协议:快速UDP互联网连接
      QUIC(Quick UDP Internet Connections)是谷歌开发的一种旨在提高网络性能和安全性的传输层协议。它基于UDP,并结合了TLS级别的安全性,提供了更高效、更可靠的互联网通信方式。 ... [详细]
    • Java 中的 BigDecimal pow()方法,示例 ... [详细]
    • 探讨如何高效使用FastJSON进行JSON数据解析,特别是从复杂嵌套结构中提取特定字段值的方法。 ... [详细]
    • 1:有如下一段程序:packagea.b.c;publicclassTest{privatestaticinti0;publicintgetNext(){return ... [详细]
    • 本文介绍了Java并发库中的阻塞队列(BlockingQueue)及其典型应用场景。通过具体实例,展示了如何利用LinkedBlockingQueue实现线程间高效、安全的数据传递,并结合线程池和原子类优化性能。 ... [详细]
    • 本文介绍如何使用 Python 将一个字符串按照指定的行和元素分隔符进行两次拆分,最终将字符串转换为矩阵形式。通过两种不同的方法实现这一功能:一种是使用循环与 split() 方法,另一种是利用列表推导式。 ... [详细]
    • 本文介绍如何在 Android 中通过代码模拟用户的点击和滑动操作,包括参数说明、事件生成及处理逻辑。详细解析了视图(View)对象、坐标偏移量以及不同类型的滑动方式。 ... [详细]
    • 本文详细介绍了Java中org.neo4j.helpers.collection.Iterators.single()方法的功能、使用场景及代码示例,帮助开发者更好地理解和应用该方法。 ... [详细]
    • PyCharm下载与安装指南
      本文详细介绍如何从官方渠道下载并安装PyCharm集成开发环境(IDE),涵盖Windows、macOS和Linux系统,同时提供详细的安装步骤及配置建议。 ... [详细]
    • Explore a common issue encountered when implementing an OAuth 1.0a API, specifically the inability to encode null objects and how to resolve it. ... [详细]
    • 本文详细介绍了如何解决Uploadify插件在Internet Explorer(IE)9和10版本中遇到的点击失效及JQuery运行时错误问题。通过修改相关JavaScript代码,确保上传功能在不同浏览器环境中的一致性和稳定性。 ... [详细]
    • 导航栏样式练习:项目实例解析
      本文详细介绍了如何创建一个具有动态效果的导航栏,包括HTML、CSS和JavaScript代码的实现,并附有详细的说明和效果图。 ... [详细]
    • PHP 5.2.5 安装与配置指南
      本文详细介绍了 PHP 5.2.5 的安装和配置步骤,帮助开发者解决常见的环境配置问题,特别是上传图片时遇到的错误。通过本教程,您可以顺利搭建并优化 PHP 运行环境。 ... [详细]
    author-avatar
    他们叫我红豆
    这个家伙很懒,什么也没留下!
    PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
    Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有