热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

开发笔记:pythonxml.dom模块解析xml

篇首语:本文由编程笔记#小编为大家整理,主要介绍了pythonxml.dom模块解析xml相关的知识,希望对你有一定的参考价值。

篇首语:本文由编程笔记#小编为大家整理,主要介绍了python xml.dom模块解析xml相关的知识,希望对你有一定的参考价值。




 

回到顶部

1. 什么是xml?有何特征?

xml即可扩展标记语言,它可以用来标记数据、定义数据类型,是一种允许用户对自己的标记语言进行定义的源语言。

例子:del.xml



xml version="1.0" encoding="utf-8"?>
<catalog>
<maxid>4maxid>
<login username="pytest" passwd=\'123456\'>
<caption>Pythoncaption>
<item id="4">
<caption>testcaption>
item>
login>
<item id="2">
<caption>Zopecaption>
item>
catalog>


从结构上,很像HTML超文本标记语言。但他们被设计的目的是不同的,超文本标记语言被设计用来显示数据,其焦点是数据的外观。它被设计用来传输存储数据,其焦点是数据的内容

那么它有如下特征:



  • 它是有标签对组成,

  • 标签可以有属性:

  • 标签对可以嵌入数据:abc

  • 标签可以嵌入子标签(具有层级关系)


回到顶部

2. 获得标签属性



#coding: utf-8
import xml.dom.minidom
dom = xml.dom.minidom.parse("del.xml") #打开xml文档

root = dom.documentElement #得到xml文档对象
print "nodeName:", root.nodeName #每一个结点都有它的nodeName,nodeValue,nodeType属性
print "nodeValue:", root.nodeValue #nodeValue是结点的值,只对文本结点有效
print "nodeType:", root.nodeType
print "ELEMENT_NODE:", root.ELEMENT_NODE


nodeType是结点的类型。catalog是ELEMENT_NODE类型

现在有以下几种:













1

2

3

4

5

6

7

8

9

10

11

12



\'ATTRIBUTE_NODE\'

\'CDATA_SECTION_NODE\'

\'COMMENT_NODE\'

\'DOCUMENT_FRAGMENT_NODE\'

\'DOCUMENT_NODE\'

\'DOCUMENT_TYPE_NODE\'

\'ELEMENT_NODE\'

\'ENTITY_NODE\'

\'ENTITY_REFERENCE_NODE\'

\'NOTATION_NODE\'

\'PROCESSING_INSTRUCTION_NODE\'

\'TEXT_NODE\'





运行结果













1

2

3

4



nodeName: catalog

nodeValue: None

nodeType: 1

ELEMENT_NODE: 1






回到顶部

3. 获得子标签



#coding: utf-8
import xml.dom.minidom
dom = xml.dom.minidom.parse("del.xml")
root = dom.documentElement
bb = root.getElementsByTagName(\'maxid\')
print type(bb)
print bb
b = bb[0]
print b.nodeName
print b.nodeValue


运行结果













1

2

3

4



\'xml.dom.minicompat.NodeList\'>

[0x2707a48>]

maxid

None






回到顶部

4. 获得标签属性值



#coding: utf-8
import xml.dom.minidom
dom = xml.dom.minidom.parse("del.xml")
root = dom.documentElement
itemlist = root.getElementsByTagName(\'login\')
item = itemlist[0]
print item.getAttribute("username")
print item.getAttribute("passwd")
itemlist = root.getElementsByTagName("item")
item = itemlist[0] #通过在itemlist中的位置区分
print item.getAttribute("id")
item2 = itemlist[1] #通过在itemlist中的位置区分

print item2.getAttribute("id")


运行结果













1

2

3

4



pytest

123456

4

2






回到顶部

5. 获得标签对之间的数据



#coding: utf-8
import xml.dom.minidom
dom = xml.dom.minidom.parse("del.xml")
root = dom.documentElement
itemlist = root.getElementsByTagName(\'caption\')
item = itemlist[0]
print item.firstChild.data
item2 = itemlist[1]
print item2.firstChild.data


运行结果













1

2



Python

test






回到顶部

6. 例子



xml version="1.0" encoding="UTF-8" ?>
<users>
<user id="1000001">
<username>Adminusername>
<email>admin@live.cnemail>
<age>23age>
<sex>boysex>
user>
<user id="1000002">
<username>Admin2username>
<email>admin2@live.cnemail>
<age>22age>
<sex>boysex>
user>
<user id="1000003">
<username>Admin3username>
<email>admin3@live.cnemail>
<age>27age>
<sex>boysex>
user>
<user id="1000004">
<username>Admin4username>
<email>admin4@live.cnemail>
<age>25age>
<sex>girlsex>
user>
<user id="1000005">
<username>Admin5username>
<email>admin5@live.cnemail>
<age>20age>
<sex>boysex>
user>
<user id="1000006">
<username>Admin6username>
<email>admin6@live.cnemail>
<age>23age>
<sex>girlsex>
user>


把name、email、age、sex输出 

参考代码



# -*- coding:utf-8 -*-
from xml.dom import minidom
def get_attrvalue(node, attrname):
return node.getAttribute(attrname) if node else \'\'
def get_nodevalue(node, index = 0):
return node.childNodes[index].nodeValue if node else \'\'
def get_xmlnode(node, name):
return node.getElementsByTagName(name) if node else []
def get_xml_data(filename = \'user.xml\'):
doc = minidom.parse(filename)
root = doc.documentElement
user_nodes = get_xmlnode(root, \'user\')
print "user_nodes:", user_nodes
user_list=[]
for node in user_nodes:
user_id = get_attrvalue(node, \'id\')
node_name = get_xmlnode(node, \'username\')
node_email = get_xmlnode(node, \'email\')
node_age = get_xmlnode(node, \'age\')
node_sex = get_xmlnode(node, \'sex\')
user_name =get_nodevalue(node_name[0])
user_email = get_nodevalue(node_email[0])
user_age = int(get_nodevalue(node_age[0]))
user_sex = get_nodevalue(node_sex[0])
user = {}
user[\'id\'] , user[\'username\'] , user[\'email\'] , user[\'age\'] , user[\'sex\'] = (
int(user_id), user_name , user_email , user_age , user_sex
)
user_list.append(user)
return user_list
def test_load_xml():
user_list = get_xml_data()
for user in user_list :
print \'-----------------------------------------------------\'
if user:
user_str=\'No.:\\t%d\\nname:\\t%s\\nsex:\\t%s\\nage:\\t%s\\nEmail:\\t%s\' % (int(user[\'id\']) , user[\'username\'], user[\'sex\'] , user[\'age\'] , user[\'email\'])
print user_str
if __name__ == "__main__":
test_load_xml()


结果













1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

20

21

22

23

24

25

26

27

28

29

30

31

32

33

34

35

36

37

38

39

40



C:\\Users\\jihite\\Desktop\\xml>python user.py

user_nodes: [0x2758c48>, 0x2756288>,

 0x2756888>, 0x2756e88>,

t: user at 0x275e4c8>, 0x275eac8>]

-----------------------------------------------------

No.:    1000001

name:   Admin

sex:    boy

age:    23

Email:  admin@live.cn

-----------------------------------------------------

No.:    1000002

name:   Admin2

sex:    boy

age:    22

Email:  admin2@live.cn

-----------------------------------------------------

No.:    1000003

name:   Admin3

sex:    boy

age:    27

Email:  admin3@live.cn

-----------------------------------------------------

No.:    1000004

name:   Admin4

sex:    gril

age:    25

Email:  admin4@live.cn

-----------------------------------------------------

No.:    1000005

name:   Admin5

sex:    boy

age:    20

Email:  admin5@live.cn

-----------------------------------------------------

No.:    1000006

name:   Admin6

sex:    gril

age:    23

Email:  admin6@live.cn 






回到顶部

7. 总结










1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

20

21

22

23

24

25

26

27

28



minidom.parse(filename)

加载读取XML文件

 

doc.documentElement

获取XML文档对象

 

node.getAttribute(AttributeName)

获取XML节点属性值

 

node.getElementsByTagName(TagName)

获取XML节点对象集合

 

node.childNodes #返回子节点列表。

 

node.childNodes[index].nodeValue

获取XML节点值

 

node.firstChild

#访问第一个节点。等价于pagexml.childNodes[0]

 

doc = minidom.parse(filename)

doc.toxml(\'UTF-8\')

返回Node节点的xml表示的文本

 

Node.attributes["id"]

a.name #就是上面的 "id"

a.value #属性的值

访问元素属性




推荐阅读
  • 本文介绍如何使用 Python 的 DOM 和 SAX 方法解析 XML 文件,并通过示例展示了如何动态创建数据库表和处理大量数据的实时插入。 ... [详细]
  • 为了确保iOS应用能够安全地访问网站数据,本文介绍了如何在Nginx服务器上轻松配置CertBot以实现SSL证书的自动化管理。通过这一过程,可以确保应用始终使用HTTPS协议,从而提升数据传输的安全性和可靠性。文章详细阐述了配置步骤和常见问题的解决方法,帮助读者快速上手并成功部署SSL证书。 ... [详细]
  • 本文介绍如何使用OpenCV和线性支持向量机(SVM)模型来开发一个简单的人脸识别系统,特别关注在只有一个用户数据集时的处理方法。 ... [详细]
  • 利用python爬取豆瓣电影Top250的相关信息,包括电影详情链接,图片链接,影片中文名,影片外国名,评分,评价数,概况,导演,主演,年份,地区,类别这12项内容,然后将爬取的信息写入Exce ... [详细]
  • 探讨了 Python 中 UTF-8 编码的中文字符在某些情况下被误识别为 GB2312 的问题,并提供了详细的代码示例和环境信息。 ... [详细]
  • 本文详细介绍了如何使用Python中的smtplib库来发送带有附件的邮件,并提供了完整的代码示例。作者:多测师_王sir,时间:2020年5月20日 17:24,微信:15367499889,公司:上海多测师信息有限公司。 ... [详细]
  • 第二十五天接口、多态
    1.java是面向对象的语言。设计模式:接口接口类是从java里衍生出来的,不是python原生支持的主要用于继承里多继承抽象类是python原生支持的主要用于继承里的单继承但是接 ... [详细]
  • 本文介绍了如何利用 `matplotlib` 库中的 `FuncAnimation` 类将 Python 中的动态图像保存为视频文件。通过详细解释 `FuncAnimation` 类的参数和方法,文章提供了多种实用技巧,帮助用户高效地生成高质量的动态图像视频。此外,还探讨了不同视频编码器的选择及其对输出文件质量的影响,为读者提供了全面的技术指导。 ... [详细]
  • 本文介绍了如何使用Python的Paramiko库批量更新多台服务器的登录密码。通过示例代码展示了具体实现方法,确保了操作的高效性和安全性。Paramiko库提供了强大的SSH2协议支持,使得远程服务器管理变得更加便捷。此外,文章还详细说明了代码的各个部分,帮助读者更好地理解和应用这一技术。 ... [详细]
  • 大类|电阻器_使用Requests、Etree、BeautifulSoup、Pandas和Path库进行数据抓取与处理 | 将指定区域内容保存为HTML和Excel格式
    大类|电阻器_使用Requests、Etree、BeautifulSoup、Pandas和Path库进行数据抓取与处理 | 将指定区域内容保存为HTML和Excel格式 ... [详细]
  • Python 序列图分割与可视化编程入门教程
    本文介绍了如何使用 Python 进行序列图的快速分割与可视化。通过一个实际案例,详细展示了从需求分析到代码实现的全过程。具体包括如何读取序列图数据、应用分割算法以及利用可视化库生成直观的图表,帮助非编程背景的用户也能轻松上手。 ... [详细]
  • Python多线程编程技巧与实战应用详解 ... [详细]
  • Python 伦理黑客技术:深入探讨后门攻击(第三部分)
    在《Python 伦理黑客技术:深入探讨后门攻击(第三部分)》中,作者详细分析了后门攻击中的Socket问题。由于TCP协议基于流,难以确定消息批次的结束点,这给后门攻击的实现带来了挑战。为了解决这一问题,文章提出了一系列有效的技术方案,包括使用特定的分隔符和长度前缀,以确保数据包的准确传输和解析。这些方法不仅提高了攻击的隐蔽性和可靠性,还为安全研究人员提供了宝贵的参考。 ... [详细]
  • MATLAB字典学习工具箱SPAMS:稀疏与字典学习的详细介绍、配置及应用实例
    SPAMS(Sparse Modeling Software)是一个强大的开源优化工具箱,专为解决多种稀疏估计问题而设计。该工具箱基于MATLAB,提供了丰富的算法和函数,适用于字典学习、信号处理和机器学习等领域。本文将详细介绍SPAMS的配置方法、核心功能及其在实际应用中的典型案例,帮助用户更好地理解和使用这一工具箱。 ... [详细]
  • 在 CentOS 7 系统中安装 Scrapy 时遇到了一些挑战。尽管 Scrapy 在 Ubuntu 上安装简便,但在 CentOS 7 上需要额外的配置和步骤。本文总结了常见问题及其解决方案,帮助用户顺利安装并使用 Scrapy 进行网络爬虫开发。 ... [详细]
author-avatar
flower_hj
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有