当前位置: 开发笔记 > 编程语言 > 正文

（爬取菜单信息）想要一次性获取标签的所有的东西时不需要find_all再一个个循环，直接text即可！！！！

作者：手机用户2502927973 | 来源：互联网 | 2023-10-12 16:17

爬取菜单信息的时候，想要获取所有食材时：网页源代码：新鲜豌豆米、

爬取菜单信息的时候&＃xff0c;想要获取所有食材时&＃xff1a;

网页源代码&＃xff1a;

新鲜豌豆米、瘦肉、生抽&＃xff0c;盐&＃xff0c;生粉

发现这里是两个span,一开始我是先find_all(&＃39;span&＃39;) 再把他们一个个存取到列表里面&＃xff0c;左后再一个个取出&＃xff0c;但这样搞复杂了&＃xff0c;其实可以直接.text

text获取到的是该标签内的纯文本信息&＃xff0c;即便是在它的子标签内&＃xff0c;也能拿得到。但提取属性的值&＃xff0c;只能提取该标签本身的。

from bs4 import BeautifulSoupbs &＃61; BeautifulSoup(&＃39;

惟有痴情难学佛独无媚骨不如人

&＃39;,&＃39;html.parser&＃39;)
tag &＃61; bs.find(&＃39;p&＃39;)
print(tag.text)

完美&＃xff01;&＃xff01;&＃xff01;

完整代码1.0&＃xff1a;

import requests from bs4 import BeautifulSoup res&＃61; requests.get(&＃39;http://www.xiachufang.com/explore/&＃39;) #获取网站源代码 html&＃61;res.text #解析网页时必须要是字符串类型 soup&＃61;BeautifulSoup(html,&＃39;html.parser&＃39;)#解析网页源代码 menus&＃61;soup.find_all(&＃39;div&＃39;,class_&＃61;&＃39;info pure-u&＃39;) for menu in menus:menu_name&＃61;menu.find(&＃39;p&＃39;,class_&＃61;&＃39;name&＃39;).find(&＃39;a&＃39;).text.strip()#strip&＃xff08;&＃xff09;会把空格&＃xff0c;跳行等符号取消掉menu_href&＃61;menu.find(&＃39;p&＃39;,class_&＃61;&＃39;name&＃39;).find(&＃39;a&＃39;)menu_foods&＃61;menu.find(&＃39;p&＃39;,class_&＃61;&＃39;ing ellipsis&＃39;).find_all(&＃39;span&＃39;)print(&＃39;菜名&＃xff1a;&＃39;,menu_name,&＃39;\n&＃39;)print(&＃39;链接&＃xff1a;&＃39;,menu_href[&＃39;href&＃39;],&＃39;\n&＃39;)print(&＃39;食材&＃xff1a;&＃39;,&＃39;\n&＃39;)a&＃61;[]for menu_food in menu_foods:a.append(menu_food.text)for i in a:print(i,end&＃61;&＃39; &＃39;)print(&＃39;\n&＃39;)print(&＃39;**************************************&＃39;,&＃39;\n&＃39;)

完整代码2.0&＃xff1a;

#当数据比较乱&＃xff0c;没有规律时可以使用这种办法&＃xff0c;建两个空列表&＃xff0c;把想要的先都find_all&＃xff08;&＃xff09; #存储到这两个列表里&＃xff0c;最后输出的时候用一个for循环去遍历这两个空列表&＃xff0c; #把结果一个一个对应起来。import requests # 引用requests库 from bs4 import BeautifulSoup # 引用BeautifulSoup库res_foods &＃61; requests.get(&＃39;http://www.xiachufang.com/explore/&＃39;) # 获取数据 bs_foods &＃61; BeautifulSoup(res_foods.text,&＃39;html.parser&＃39;) # 解析数据tag_name &＃61; bs_foods.find_all(&＃39;p&＃39;,class_&＃61;&＃39;name&＃39;) # 查找包含菜名和URL的

标签 tag_ingredients &＃61; bs_foods.find_all(&＃39;p&＃39;,class_&＃61;&＃39;ing ellipsis&＃39;) # 查找包含食材的

标签 list_all &＃61; [] # 创建一个空列表&＃xff0c;用于存储信息 for x in range(len(tag_name)): # 启动一个循环&＃xff0c;次数等于菜名的数量list_food &＃61; [tag_name[x].text[18:-14],tag_name[x].find(&＃39;a&＃39;)[&＃39;href&＃39;],tag_ingredients[x].text[1:-1]]# 提取信息&＃xff0c;封装为列表。注意此处[18:-14]切片和之前不同&＃xff0c;是因为此处使用的是

标签&＃xff0c;而之前是list_all.append(list_food)# 将信息添加进list_all print(list_all) # 打印# 以下是另外一种解法 #当数据比较有规律的时候用一个父级标签再去查找对应的信息list_foods &＃61; bs_foods.find_all(&＃39;div&＃39;,class_&＃61;&＃39;info pure-u&＃39;) # 查找最小父级标签list_all &＃61; [] # 创建一个空列表&＃xff0c;用于存储信息for food in list_foods:tag_a &＃61; food.find(&＃39;a&＃39;)# 提取第0个父级标签中的标签name &＃61; tag_a.text[17:-13]# 菜名&＃xff0c;使用[17:-13]切掉了多余的信息URL &＃61; &＃39;http://www.xiachufang.com&＃39;&＃43;tag_a[&＃39;href&＃39;]# 获取URLtag_p &＃61; food.find(&＃39;p&＃39;,class_&＃61;&＃39;ing ellipsis&＃39;)# 提取第0个父级标签中的

标签ingredients &＃61; tag_p.text[1:-1]# 食材&＃xff0c;使用[1:-1]切掉了多余的信息list_all.append([name,URL,ingredients])# 将菜名、URL、食材&＃xff0c;封装为列表&＃xff0c;添加进list_allprint(list_all) # 打印

推荐阅读

int
Python 的 10 个开发技巧！太实用了

1.如何在运行状态查看源代码？查看函数的源代码，我们通常会使用IDE来完成。比如在PyCharm中，你可以Ctrl+鼠标点击进入函数的源代码。那如果没有IDE呢？当我们想使用一个函 ... [详细]

蜡笔小新 2024-12-27 18:36:54
int
技术分享：从动态网站提取站点密钥的解决方案

本文探讨了如何从动态网站中提取站点密钥，特别是针对验证码（reCAPTCHA）的处理方法。通过结合Selenium和requests库，提供了详细的代码示例和优化建议。 ... [详细]

蜡笔小新 2024-12-28 04:11:47
object
深入理解org.neo4j.helpers.collection.Iterators.single()方法及其应用

本文详细介绍了Java中org.neo4j.helpers.collection.Iterators.single()方法的功能、使用场景及代码示例，帮助开发者更好地理解和应用该方法。 ... [详细]

蜡笔小新 2024-12-28 10:51:55
int
优化ListView性能

本文深入探讨了如何通过多种技术手段优化ListView的性能，包括视图复用、ViewHolder模式、分批加载数据、图片优化及内存管理等。这些方法能够显著提升应用的响应速度和用户体验。 ... [详细]

蜡笔小新 2024-12-28 10:36:30
object
编写有趣的VBScript恶作剧脚本

本文将介绍如何编写一些有趣的VBScript脚本，这些脚本可以在朋友之间进行无害的恶作剧。通过简单的代码示例，帮助您了解VBScript的基本语法和功能。 ... [详细]

蜡笔小新 2024-12-28 09:46:23
int
使用Objective-C和dispatch库实现并发素数计算

本文介绍如何使用Objective-C结合dispatch库进行并发编程，以提高素数计数任务的效率。通过对比纯C代码与引入并发机制后的代码，展示dispatch库的强大功能。 ... [详细]

蜡笔小新 2024-12-28 08:44:35
int
导航栏样式练习：项目实例解析

本文详细介绍了如何创建一个具有动态效果的导航栏，包括HTML、CSS和JavaScript代码的实现，并附有详细的说明和效果图。 ... [详细]

蜡笔小新 2024-12-27 19:42:28
int
词根词缀解析：greg、hap、helio及其他词源故事

本文基于刘洪波老师的《英文词根词缀精讲》，深入探讨了多个重要词根词缀的起源及其相关词汇，帮助读者更好地理解和记忆英语单词。 ... [详细]

蜡笔小新 2024-12-27 18:59:50
int
深入解析Android自定义View面试题

本文探讨了Android Launcher开发中自定义View的重要性，并通过一道经典的面试题，帮助开发者更好地理解自定义View的实现细节。文章不仅涵盖了基础知识，还提供了实际操作建议。 ... [详细]

蜡笔小新 2024-12-28 11:15:04
int
Go+ 中的上下文处理指南

本文详细介绍 Go+ 编程语言中的上下文处理机制，涵盖其基本概念、关键方法及应用场景。Go+ 是一门结合了 Go 的高效工程开发特性和 Python 数据科学功能的编程语言。 ... [详细]

蜡笔小新 2024-12-28 11:05:31
int
Transforming the Future of Virtual Worlds

Explore how Matterverse is redefining the metaverse experience, creating immersive and meaningful virtual environments that foster genuine connections and economic opportunities. ... [详细]

蜡笔小新 2024-12-28 09:44:49
input
如何使用JavaScript或jQuery检测文本框焦点状态和鼠标悬停事件

本文介绍了如何利用JavaScript或jQuery来判断网页中的文本框是否处于焦点状态，以及如何检测鼠标是否悬停在指定的HTML元素上。 ... [详细]

蜡笔小新 2024-12-27 21:33:33
int
网络链路质量监控：Smokeping部署与配置

本文详细介绍了如何在Linux系统上安装和配置Smokeping，以实现对网络链路质量的实时监控。通过详细的步骤和必要的依赖包安装，确保用户能够顺利完成部署并优化其网络性能监控。 ... [详细]

蜡笔小新 2024-12-27 19:31:05
post
使用 Azure Service Principal 和 Microsoft Graph API 获取 AAD 用户列表

本文介绍了一段通用代码示例，该代码不仅能够操作 Azure Active Directory (AAD)，还可以通过 Azure Service Principal 的授权访问和管理 Azure 订阅资源。Azure 的架构可以分为两个层级：AAD 和 Subscription。 ... [详细]

蜡笔小新 2024-12-27 16:07:12
object
深入解析 MVC 源码：ParameterDescriptor 与 Action 方法参数绑定

在前两篇文章中，我们探讨了 ControllerDescriptor 和 ActionDescriptor 这两个描述对象，分别对应控制器和操作方法。本文将基于 MVC3 源码进一步分析 ParameterDescriptor，即用于描述 Action 方法参数的对象，并详细介绍其工作原理。 ... [详细]

蜡笔小新 2024-12-27 15:26:10

手机用户2502927973

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章