python数据抓取_使用PythonRequest/lxml进行网页抓取：从ul/li获取数据

作者：手机用户2502910113_707 | 来源：互联网 | 2023-07-22 11:08

我使用要求和LXML与的Python，我已经看到有很多关于网页抓取不同的模块，但没有任何理由在选择一个另一个？你可以使用requestlx

我使用要求和LXML与的Python&＃xff0c;我已经看到有很多关于网页抓取不同的模块&＃xff0c;但没有任何理由在选择一个另一个&＃xff1f;你可以使用request/lxml来做同样的事情吗&＃xff1f;例如BeautifulSoup&＃xff1f;

无论如何&＃xff0c;这里是我的实际的问题;

这是我的代码&＃xff1a;

import requests

from lxml import html

# Login data

inputUrl &＃61; &＃39;http://forum.mytestsite.com/login&＃39;

usr &＃61; &＃39;myusername&＃39;

pwd &＃61; &＃39;mypassword&＃39;

payload &＃61; dict(login&＃61;usr, password&＃61;pwd)

# Open session

with requests.Session() as s:

# Login

s.post(inputUrl, data&＃61;payload)

# Get page data

pageResult &＃61; s.get(&＃39;http://forum.mytestsite.com/icons/&＃39;, allow_redirects&＃61;False)

pageResult &＃61; html.fromstring(pageResult.content)

pageIcons &＃61; pageResult.xpath(&＃39;//script[&＃64;id&＃61;"table-icons"]/text()&＃39;)

print pageIcons[0]

结果打印时pageIcons [0]&＃xff1a;

${{desc_or_name this}}$

这是生成的网站/ js代码图标&＃xff1a;

${{desc_or_name this}}$

而这里的页面上的结果&＃xff1a;

Icon 1

Icon 2

Icon 3

我的目标&＃xff1a;

我想要做的是检索所有的li data手柄&＃xff0c;但我一直无法弄清楚如何检索这些数据。所以我的目标是检索所有的图标路径和他们的头衔&＃xff0c;有谁能帮我解决这个问题吗&＃xff1f;我真的很感激任何帮助:)

2017-06-18

Lorena

&＃43;0

&＃39;// script&＃39;不是呈现的HTML的一部分。你为什么试图解析模板代码&＃xff1f; –

&＃43;0

嗯&＃xff0c;因为我是一个noob&＃xff1a;P我是因为脚本的结果给了我实际上想要的ul/li句柄&＃xff0c;所以这样做是合乎逻辑的。我的意思是&＃xff0c;渲染的HTML是从脚本生成的&＃xff0c;对吧&＃xff1f;我还能如何获得链接&＃xff1f; –

&＃43;0

您无法从python请求获取模板代码。另外&＃xff0c;如果它在页面加载后呈现&＃xff0c;那么您会得到一个空列表&＃xff0c;并且无论如何您都不能使用请求。 https://stackoverflow.com/questions/13960567/reading-dynamically-generated-web-pages-using-python –

推荐阅读

int
技术分享：从动态网站提取站点密钥的解决方案

本文探讨了如何从动态网站中提取站点密钥，特别是针对验证码（reCAPTCHA）的处理方法。通过结合Selenium和requests库，提供了详细的代码示例和优化建议。 ... [详细]

蜡笔小新 2024-12-28 04:11:47
string
使用 Azure Service Principal 和 Microsoft Graph API 获取 AAD 用户列表

本文介绍了一段通用代码示例，该代码不仅能够操作 Azure Active Directory (AAD)，还可以通过 Azure Service Principal 的授权访问和管理 Azure 订阅资源。Azure 的架构可以分为两个层级：AAD 和 Subscription。 ... [详细]

蜡笔小新 2024-12-27 16:07:12
int
扫描线三巨头 hdu1928hdu 1255 hdu 1542 [POJ 1151]

学习链接：http:blog.csdn.netlwt36articledetails48908031学习扫描线主要学习的是一种扫描的思想，后期可以求解很 ... [详细]

蜡笔小新 2024-12-26 20:04:36
int
Go+ 中的上下文处理指南

本文详细介绍 Go+ 编程语言中的上下文处理机制，涵盖其基本概念、关键方法及应用场景。Go+ 是一门结合了 Go 的高效工程开发特性和 Python 数据科学功能的编程语言。 ... [详细]

蜡笔小新 2024-12-28 11:05:31
web
深入理解Tornado模板系统

本文详细介绍了Tornado框架中模板系统的使用方法。Tornado自带的轻量级、高效且灵活的模板语言位于tornado.template模块，支持嵌入Python代码片段，帮助开发者快速构建动态网页。 ... [详细]

蜡笔小新 2024-12-27 19:22:16
int
深入理解Cookie与Session会话管理

本文详细介绍了如何通过HTTP响应和请求处理浏览器的Cookie信息，以及如何创建、设置和管理Cookie。同时探讨了会话跟踪技术中的Session机制，解释其原理及应用场景。 ... [详细]

蜡笔小新 2024-12-27 18:20:43
function
分页插件3指定到某一页

前言--页数多了以后需要指定到某一页（只做了功能，样式没有细调）html ... [详细]

蜡笔小新 2024-12-27 15:19:01
tree
Python自动化处理：从Word文档提取内容并生成带水印的PDF

本文介绍如何利用Python实现从特定网站下载Word文档，去除水印并添加自定义水印，最终将文档转换为PDF格式。该方法适用于批量处理和自动化需求。 ... [详细]

蜡笔小新 2024-12-27 13:10:20
string
Android LED 数字字体的应用与实现

本文介绍了一种适用于 Android 应用的 LED 数字字体（digital font），并详细描述了其在 UI 设计中的应用场景及其实现方法。这种字体常用于视频、广告倒计时等场景，能够增强视觉效果。 ... [详细]

蜡笔小新 2024-12-27 10:34:22
php
使用Vultr云服务器和Namesilo域名搭建个人网站

本文详细介绍了如何通过Vultr云服务器和Namesilo域名搭建一个功能齐全的个人网站，包括购买、配置服务器以及绑定域名的具体步骤。文章还提供了详细的命令行操作指南，帮助读者顺利完成建站过程。 ... [详细]

蜡笔小新 2024-12-26 16:36:34
string
深入理解Android中的ADB Shell Input命令：模拟滑动、按键和点击事件

在维护公司项目时，发现按下手机的某个物理按键后会激活相应的服务，并在屏幕上模拟点击特定坐标点。本文详细介绍了如何使用ADB Shell Input命令来模拟各种输入事件，包括滑动、按键和点击等。 ... [详细]

蜡笔小新 2024-12-26 13:43:24
function
基于KVM的SRIOV直通配置及性能测试

SRIOV介绍、VF直通配置，以及包转发率性能测试小慢哥的原创文章，欢迎转载目录?1.SRIOV介绍?2.环境说明?3.开启SRIOV?4.生成VF?5.VF ... [详细]

蜡笔小新 2024-12-25 19:26:39
int
毕业设计：基于机器学习与深度学习的垃圾邮件（短信）分类算法实现

本文详细介绍了如何使用机器学习和深度学习技术对垃圾邮件和短信进行分类。内容涵盖从数据集介绍、预处理、特征提取到模型训练与评估的完整流程，并提供了具体的代码示例和实验结果。 ... [详细]

蜡笔小新 2024-12-25 17:38:50
jar
掌握Java EE的全面指南

探讨如何真正掌握Java EE，包括所需技能、工具和实践经验。资深软件教学总监李刚分享了对毕业生简历中常见问题的看法，并提供了详尽的标准。 ... [详细]

蜡笔小新 2024-12-25 13:38:29
web
Linux 透明防火墙（网桥模式）的部署与配置

本文介绍如何在现有网络中部署基于Linux系统的透明防火墙（网桥模式），以实现灵活的时间段控制、流量限制等功能。通过详细的步骤和配置说明，确保内部网络的安全性和稳定性。 ... [详细]

蜡笔小新 2024-12-25 13:17:38

手机用户2502910113_707

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章