当前位置: 开发笔记 > 编程语言 > 正文

详解Python利用BeautifulSoup模块搜索内容方法

作者：坤哥小妹 | 来源：互联网 | 2017-05-14 02:44

这篇文章主要给大家介绍了python中BeautifulSoup模块的搜索方法函数。方法不同类型的过滤参数能够进行不同的过滤，得到想要的结果。文中介绍的非常详细，对大家具有一定的参考价值，需要的朋友们下面来一起看看吧。

这篇文章主要给大家介绍了python中 Beautiful Soup 模块的搜索方法函数。方法不同类型的过滤参数能够进行不同的过滤，得到想要的结果。文中介绍的非常详细，对大家具有一定的参考价值，需要的朋友们下面来一起看看吧。

前言

我们将利用 Beautiful Soup 模块的搜索功能，根据标签名称、标签属性、文档文本和正则表达式来搜索。

搜索方法

Beautiful Soup 内建的搜索方法如下：

find()
find_all()
find_parent()
find_parents()
find_next_sibling()
find_next_siblings()
find_previous_sibling()
find_previous_siblings()
find_previous()
find_all_previous()
find_next()
find_all_next()

使用 find() 方法搜索

首先还是需要建立一个 HTML 文件用来做测试。

plants

100000
algae

100000

deer

1000
rabbit

2000

fox

100
bear

100

lion

80
tiger

50

我们可以通过 find() 方法来获得

标签，默认情况下还是会得到第一个出现的，接着获得
标签，通过输出内容来验证是否获取了第一个出现的标签。
```
from bs4 import BeautifulSoup
with open(&＃39;search.html&＃39;,&＃39;r&＃39;) as filename:
 soup = BeautifulSoup(filename,&＃39;lxml&＃39;)
first_ul_entries = soup.find(&＃39;ul&＃39;)
print first_ul_entries.li.p.string
```
find() 方法具体如下：
```
find(name,attrs,recursive,text,**kwargs)
```
正如上代码所示，find() 方法接受五个参数：name、attrs、recursive、text 和 **kwargs 。name 、attrs 和 text 参数都可以在 find() 方法充当过滤器，提高匹配结果的精确度。
搜索标签
除了上面代码的搜索
- 标签，返回结果也是返回出现的第一个匹配内容。
```
tag_li = soup.find(&＃39;li&＃39;)
# tag_li = soup.find(name = "li")
print type(tag_li)
print tag_li.p.string
```
  搜索文本
  如果我们只想根据文本内容来搜索的话，我们可以只传入文本参数：
```
search_for_text = soup.find(text=&＃39;plants&＃39;)
print type(search_for_text)
```
  返回的结果也是 NavigableString 对象。
  根据正则表达式搜索
  如下的一段 HTML 文本内容
```
The below HTML has the information that has email ids.
 abc@example.com 
xyz@example.com 
 foo@example.com
```
  可以看到 abc@example 邮件地址并没有包括在任何标签内，这样就不能根据标签来找到邮件地址了。这个时候，我们可以使用正则表达式来进行匹配。
```
email_id_example = """
 The below HTML has the information that has email ids.
 abc@example.com
 xyz@example.com
 foo@example.com
 """
email_soup = BeautifulSoup(email_id_example,&＃39;lxml&＃39;)
print email_soup
# pattern = "\w+@\w+\.\w+"
emailid_regexp = re.compile("\w+@\w+\.\w+")
first_email_id = email_soup.find(text=emailid_regexp)
print first_email_id
```
  在使用正则表达式进行匹配时，如果有多个匹配项，也是先返回第一个。
  根据标签属性值搜索
  可以通过标签的属性值来搜索：
```
search_for_attribute = soup.find(id=&＃39;primaryconsumers&＃39;)
print search_for_attribute.li.p.string
```
  根据标签属性值来搜索对大多数属性都是可用的，例如：id、style 和 title 。
  但是对以下两种情况会有不同：
  - 自定义属性
  - 类 ( class ) 属性
  我们不能再直接使用属性值来搜索了，而是得使用 attrs 参数来传递给 find() 函数。
  根据自定义属性来搜索
  在 HTML5 中是可以给标签添加自定义属性的，例如给标签添加属性。
  如下代码所示，如果我们再像搜索 id 那样进行操作的话，会报错的，Python 的变量不能包括 - 符号。
```
customattr = """
 custom attribute example
   """
customsoup = BeautifulSoup(customattr,&＃39;lxml&＃39;)
customsoup.find(data-custom="custom")
# SyntaxError: keyword can&＃39;t be an expression
```
  这个时候使用 attrs 属性值来传递一个字典类型作为参数进行搜索：
```
using_attrs = customsoup.find(attrs={&＃39;data-custom&＃39;:&＃39;custom&＃39;})
print using_attrs
```
  基于 CSS 中的类进行搜索
  对于 CSS 的类属性，由于在 Python 中 class 是个关键字，所以是不能当做标签属性参数传递的，这种情况下，就和自定义属性一样进行搜索。也是使用 attrs 属性，传递一个字典进行匹配。
  除了使用 attrs 属性之外，还可以使用 class_ 属性进行传递，这样与 class 区别开了，也不会导致错误。
```
css_class = soup.find(attrs={&＃39;class&＃39;:&＃39;producerlist&＃39;})
css_class2 = soup.find(class_ = "producerlist")
print css_class
print css_class2
```
  使用自定义的函数搜索
  可以给 find() 方法传递一个函数，这样就会根据函数定义的条件进行搜索。
  函数应该返回 true 或者是 false 值。
```
def is_producers(tag):
 return tag.has_attr(&＃39;id&＃39;) and tag.get(&＃39;id&＃39;) == &＃39;producers&＃39;
tag_producers = soup.find(is_producers)
print tag_producers.li.p.string
```
  代码中定义了一个 is_producers 函数，它将检查标签是否具体 id 属性以及属性值是否等于 producers，如果符合条件则返回 true ，否则返回 false 。
  联合使用各种搜索方法
  Beautiful Soup 提供了各种搜索方法，同样，我们也可以联合使用这些方法来进行匹配，提高搜索的准确度。
```
combine_html = """
 
  Example of p tag with class identical
 
 
  Example of p tag with class identical
 

 """
combine_soup = BeautifulSoup(combine_html,&＃39;lxml&＃39;)
identical_p = combine_soup.find("p",class_="identical")
print identical_p
```
  使用 find_all() 方法搜索
  使用 find() 方法会从搜索结果中返回第一个匹配的内容，而 find_all() 方法则会返回所有匹配的项。
  在 find() 方法中用到的过滤项，同样可以用在 find_all() 方法中。事实上，它们可以用到任何搜索方法中，例如：find_parents() 和 find_siblings() 中。
```
# 搜索所有 class 属性等于 tertiaryconsumerlist 的标签。
all_tertiarycOnsumers= soup.find_all(class_=&＃39;tertiaryconsumerlist&＃39;)
print type(all_tertiaryconsumers)
for tertiaryconsumers in all_tertiaryconsumers:
 print tertiaryconsumers.p.string
```
  find_all() 方法为：
```
find_all(name,attrs,recursive,text,limit,**kwargs)
```
  它的参数和 find() 方法有些类似，多个了 limit 参数。limit 参数是用来限制结果数量的。而 find() 方法的 limit 就是 1 了。
  同时，我们也能传递一个字符串列表的参数来搜索标签、标签属性值、自定义属性值和 CSS 类。
```
# 搜索所有的 p 和 li 标签
p_li_tags = soup.find_all(["p","li"])
print p_li_tags
print
# 搜索所有类属性是 producerlist 和 primaryconsumerlist 的标签
all_css_class = soup.find_all(class_=["producerlist","primaryconsumerlist"])
print all_css_class
print
```
  搜索相关标签
  一般情况下，我们可以使用 find() 和 find_all() 方法来搜索指定的标签，同时也能搜索其他与这些标签相关的感兴趣的标签。
  搜索父标签
  可以使用 find_parent() 或者 find_parents() 方法来搜索标签的父标签。
  find_parent() 方法将返回第一个匹配的内容，而 find_parents() 将返回所有匹配的内容，这一点与 find() 和 find_all() 方法类似。
```
# 搜索 父标签
primarycOnsumers= soup.find_all(class_=&＃39;primaryconsumerlist&＃39;)
print len(primaryconsumers)
# 取父标签的第一个
primarycOnsumer= primaryconsumers[0]
# 搜索所有 ul 的父标签
parent_ul = primaryconsumer.find_parents(&＃39;ul&＃39;)
print len(parent_ul)
# 结果将包含父标签的所有内容
print parent_ul
print
# 搜索,取第一个出现的父标签.有两种操作
immediateprimary_consumer_parent = primaryconsumer.find_parent()
# immediateprimary_consumer_parent = primaryconsumer.find_parent(&＃39;ul&＃39;)
print immediateprimary_consumer_parent
```
  搜索同级标签
  Beautiful Soup 还提供了搜索同级标签的功能。
  使用函数 find_next_siblings() 函数能够搜索同一级的下一个所有标签，而 find_next_sibling() 函数能够搜索同一级的下一个标签。
```
producers = soup.find(id=&＃39;producers&＃39;)
next_siblings = producers.find_next_siblings()
print next_siblings
```
  同样，也可以使用 find_previous_siblings() 和 find_previous_sibling() 方法来搜索上一个同级的标签。
  搜索下一个标签
  使用 find_next() 方法将搜索下一个标签中第一个出现的，而 find_next_all() 将会返回所有下级的标签项。
```
# 搜索下一级标签
first_p = soup.p
all_li_tags = first_p.find_all_next("li")
print all_li_tags
```
  搜索上一个标签
  与搜索下一个标签类似，使用 find_previous() 和 find_all_previous() 方法来搜索上一个标签。
  以上就是详解Python利用Beautiful Soup模块搜索内容方法的详细内容，更多请关注第一PHP社区其它相关文章！

推荐阅读

jsp
次小生成树问题的高效求解

本文探讨了如何通过最小生成树（MST）来计算严格次小生成树。在处理过程中，需特别注意所有边权重相等的情况，以避免错误。我们首先构建最小生成树，然后枚举每条非树边，检查其是否能形成更优的次小生成树。 ... [详细]

蜡笔小新 2024-12-28 13:42:43
jsp
深入理解OAuth认证机制

本文介绍了OAuth认证协议的核心概念及其工作原理。OAuth是一种开放标准，旨在为第三方应用提供安全的用户资源访问授权，同时确保用户的账户信息（如用户名和密码）不会暴露给第三方。 ... [详细]

蜡笔小新 2024-12-28 12:07:46
jsp
2023 ARM嵌入式系统全国技术巡讲

2023 ARM嵌入式系统全国技术巡讲旨在分享ARM公司在半导体知识产权(IP)领域的最新进展。作为全球领先的IP提供商，ARM在嵌入式处理器市场占据主导地位，其产品广泛应用于90%以上的嵌入式设备中。此次巡讲将邀请来自ARM、飞思卡尔以及华清远见教育集团的行业专家，共同探讨当前嵌入式系统的前沿技术和应用。 ... [详细]

蜡笔小新 2024-12-28 11:58:48
jsp
国内BI工具迎战国际巨头Tableau，稳步崛起

尽管商业智能（BI）工具在中国的普及程度尚不及国际市场，但近年来，随着本土企业的持续创新和市场推广，国内主流BI工具正逐渐崭露头角。面对国际品牌如Tableau的强大竞争，国内BI工具通过不断优化产品和技术，赢得了越来越多用户的认可。 ... [详细]

蜡笔小新 2024-12-28 11:12:44
jsp
深入理解 Oracle 存储函数：计算员工年收入

本文介绍如何使用 Oracle 存储函数查询特定员工的年收入。我们将详细解释存储函数的创建过程，并提供完整的代码示例。 ... [详细]

蜡笔小新 2024-12-28 09:49:42
jsp
2018回顾与2019展望

本文总结了2018年的关键成就，包括职业变动、购车、考取驾照等重要事件，并分享了读书、工作、家庭和朋友方面的感悟。同时，展望2019年，制定了健康、软实力提升和技术学习的具体目标。 ... [详细]

蜡笔小新 2024-12-28 09:10:26
jsp
四载相伴，与51CTO学院共成长

在计算机技术的学习道路上，51CTO学院以其专业性和专注度给我留下了深刻印象。从2012年接触计算机到2014年开始系统学习网络技术和安全领域，51CTO学院始终是我信赖的学习平台。 ... [详细]

蜡笔小新 2024-12-28 08:20:07
jsp
CSS 布局：液态三栏混合宽度布局

本文介绍了如何使用 CSS 实现液态的三栏布局，其中各栏具有不同的宽度设置。通过调整容器和内容区域的属性，可以实现灵活且响应式的网页设计。 ... [详细]

蜡笔小新 2024-12-28 02:40:28
jsp
通过类型和标签选择元素

本文介绍了如何使用jQuery根据元素的类型（如复选框）和标签名（如段落）来获取DOM对象。这有助于更高效地操作网页中的特定元素。 ... [详细]

蜡笔小新 2024-12-27 19:44:14
shell
新浪笔试题

1:有如下一段程序：packagea.b.c;publicclassTest{privatestaticinti0;publicintgetNext(){return ... [详细]

蜡笔小新 2024-12-27 19:32:17
jsp
深入理解Cookie与Session会话管理

本文详细介绍了如何通过HTTP响应和请求处理浏览器的Cookie信息，以及如何创建、设置和管理Cookie。同时探讨了会话跟踪技术中的Session机制，解释其原理及应用场景。 ... [详细]

蜡笔小新 2024-12-27 18:20:43
jsp
Xcode 中多行代码缩进技巧

本文介绍如何在 Xcode 中使用快捷键和菜单命令对多行代码进行缩进，包括右缩进和左缩进的具体操作方法。 ... [详细]

蜡笔小新 2024-12-27 17:52:34
shell
Linux 自动化安装脚本详解

本文介绍了一款用于自动化部署 Linux 服务的 Bash 脚本。该脚本不仅涵盖了基本的文件复制和目录创建，还处理了系统服务的配置和启动，确保在多种 Linux 发行版上都能顺利运行。 ... [详细]

蜡笔小新 2024-12-27 16:33:32
jsp
在Linux系统中配置并启动ActiveMQ

本文详细介绍了如何在Linux环境中安装和配置ActiveMQ，包括端口开放及防火墙设置。通过本文，您可以掌握完整的ActiveMQ部署流程，确保其在网络环境中正常运行。 ... [详细]

蜡笔小新 2024-12-27 14:38:54
jsp
如何在WPS Office for Mac中调整Word文档的文字排列方向

本文将详细介绍如何使用最新版WPS Office for Mac调整Word文档中的文字排列方向。通过这些步骤，用户可以轻松更改文本的水平或垂直排列方式，以满足不同的排版需求。 ... [详细]

蜡笔小新 2024-12-27 12:34:14

坤哥小妹

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章