如何在Python中创建XML文档？

程序猿 • 2026年5月10日 11:21:30 • 用户投稿 • 阅读 0

使用xml.etree.ElementTree创建XML的核心步骤包括：导入模块、创建根元素、添加子元素与属性、设置文本内容、生成ElementTree对象并写入文件；注意事项有：使用ET.indent()提升可读性、指定encoding="utf-8"和xml_declaration=True保证编码规范、通过try-except处理文件写入异常；此外，lxml库功能更强，支持XPath和XSD验证，适合复杂场景。

在Python中创建XML文档，最常用且内置的方法是利用

xml.etree.ElementTree

模块。它提供了一个直观的API来构建XML树结构，让你能像搭积木一样，将元素、属性和文本内容组织起来，最终形成一个符合XML规范的文档。对于更复杂的场景或性能要求，

lxml

库也是一个非常强大的选择。

解决方案

使用

xml.etree.ElementTree

模块来创建XML文档，这通常涉及以下几个核心步骤：首先是导入模块，接着创建根元素，然后逐步添加子元素、属性和文本内容，最后将整个XML树写入文件。

让我们以创建一个简单的“书籍列表”XML文档为例：

import xml.etree.ElementTree as ETdef create_book_list_xml():    # 1. 创建根元素    # 比如，我们想要一个名为 &lt;bookstore&gt; 的根元素    root = ET.Element(&quot;bookstore&quot;)    # 2. 添加第一个 &lt;book&gt; 元素    book1 = ET.SubElement(root, &quot;book&quot;, category=&quot;fiction&quot;) # category 是属性    title1 = ET.SubElement(book1, &quot;title&quot;)    title1.text = &quot;The Great Python Adventure&quot;    author1 = ET.SubElement(book1, &quot;author&quot;)    author1.text = &quot;Jane Doe&quot;    year1 = ET.SubElement(book1, &quot;year&quot;)    year1.text = &quot;2023&quot;    price1 = ET.SubElement(book1, &quot;price&quot;)    price1.text = &quot;29.99&quot;    # 3. 添加第二个 &lt;book&gt; 元素    book2 = ET.SubElement(root, &quot;book&quot;, category=&quot;programming&quot;)    title2 = ET.SubElement(book2, &quot;title&quot;)    title2.text = &quot;Mastering XML with Python&quot;    author2 = ET.SubElement(book2, &quot;author&quot;)    author2.text = &quot;John Smith&quot;    year2 = ET.SubElement(book2, &quot;year&quot;)    year2.text = &quot;2022&quot;    price2 = ET.SubElement(book2, &quot;price&quot;)    price2.text = &quot;39.50&quot;    # 4. 创建一个ElementTree对象    tree = ET.ElementTree(root)    # 5. 将XML树写入文件    # 我们可以通过 ET.indent() 来格式化输出，使其更具可读性    ET.indent(tree, space=&quot;t&quot;, level=0) # 使用制表符进行缩进    try:        tree.write(&quot;bookstore.xml&quot;, encoding=&quot;utf-8&quot;, xml_declaration=True)        print(&quot;XML文档 'bookstore.xml' 已成功创建。&quot;)    except IOError as e:        print(f&quot;写入文件时发生错误: {e}&quot;)# 调用函数来创建XML文件if __name__ == &quot;__main__&quot;:    create_book_list_xml()

运行这段代码后，你会在当前目录下得到一个名为

bookstore.xml

的文件，其内容大致如下：

立即学习“Python免费学习笔记（深入）”；

&lt;?xml version='1.0' encoding='utf-8'?&gt;&lt;bookstore&gt;    &lt;book category=&quot;fiction&quot;&gt;        &lt;title&gt;The Great Python Adventure&lt;/title&gt;        &lt;author&gt;Jane Doe&lt;/author&gt;        &lt;year&gt;2023&lt;/year&gt;        &lt;price&gt;29.99&lt;/price&gt;    &lt;/book&gt;    &lt;book category=&quot;programming&quot;&gt;        &lt;title&gt;Mastering XML with Python&lt;/title&gt;        &lt;author&gt;John Smith&lt;/author&gt;        &lt;year&gt;2022&lt;/year&gt;        &lt;price&gt;39.50&lt;/price&gt;    &lt;/book&gt;&lt;/bookstore&gt;

使用

xml.etree.ElementTree

创建XML文档有哪些核心步骤和注意事项？

当我们谈论用

ElementTree

来构建XML，最核心的无非就是对“元素”这个概念的理解和操作。你可以把它想象成一个层层嵌套的盒子。

首先，你需要一个最外层的“大盒子”，也就是根元素。这通过

ET.Element(&quot;根元素名&quot;)

来创建。一旦有了根，接下来的所有内容都将是它的子孙。

然后，就是往这些盒子里装更小的盒子，或者直接放东西。添加子元素，我们用

ET.SubElement(父元素, &quot;子元素名&quot;, 属性字典)

。这里的属性字典是可选的，如果你想给元素加些元数据，比如

&lt;book category=&quot;fiction&quot;&gt;

，

category

就是属性。我个人觉得这种方式非常直观，因为它直接映射了XML的层级结构。

元素的文本内容，也就是标签之间的文字，比如

&lt;title&gt;Python&lt;/title&gt;

中的

Python

，是通过设置元素的

.text

属性来完成的。如果子元素本身还有文本，那它就不能再有

.text

了，这是XML的规定，但

ElementTree

会帮你处理好这些细节，你只需关心你想要什么。

一个经常被忽略但又非常重要的点是编码。XML文件最终是要被机器或人阅读的，所以正确的编码至关重要。通常，我们都会选择

utf-8

，因为它支持几乎所有字符。在

tree.write()

方法中，通过

encoding=&quot;utf-8&quot;

参数来指定。同时，

xml_declaration=True

会确保在文件顶部生成

&lt;?xml version='1.0' encoding='utf-8'?&gt;

这样的声明，这对于XML解析器来说是个好习惯，避免一些不必要的麻烦。

至于可读性，原始的

ElementTree

写入的XML可能都是挤在一行里的，这对于调试和人工阅读来说简直是灾难。幸好，Python 3.9及以上版本提供了

ET.indent(tree)

函数，能很方便地为你的XML添加缩进，让它看起来整洁有序。如果你的Python版本较低，可能需要自己写一个简单的递归函数来遍历并添加换行和空格，但这无疑增加了些许复杂性。我个人是强烈推荐使用

ET.indent()

的，它能让你的XML文件瞬间变得“友好”起来。

最后，别忘了错误处理。文件操作总是有可能失败的，比如磁盘空间不足、权限问题等等。用

try...except IOError

来包裹

tree.write()

是一个好习惯，至少能让你的程序在遇到问题时，不是直接崩溃，而是给出一个有意义的提示。

除了

ElementTree

，Python还有哪些库可以用于XML文档的生成，它们各有什么特点？

当然，

ElementTree

是Python标准库的成员，它的优势在于无需额外安装，开箱即用，对于大多数日常的XML操作已经足够了。但Python的XML生态远不止于此，还有一些其他的库，各有侧重。

一个值得一提的是

xml.dom.minidom

。这个模块是Python对W3C DOM（Document Object Model）规范的一个轻量级实现。如果你之前有其他语言（比如JavaScript）操作DOM的经验，那么

minidom

的API会让你感到非常熟悉。它的特点是面向对象，提供了更细粒度的控制，你可以像操作一个JavaScript的DOM树一样，创建节点、文本节点、属性节点，然后将它们逐个“appendChild”到父节点上。相比

ElementTree

的简洁，

minidom

会显得有些冗长，代码量通常会更多。但它在处理一些XML特性，比如命名空间（namespaces）或需要精确控制节点类型时，可能会提供更直接的途径。我通常在需要严格遵循DOM规范或者对XML结构有非常精细控制需求时才会考虑它。

另一个重量级选手是

lxml

。这并不是Python标准库的一部分，你需要通过

pip install lxml

来安装。但一旦你用了它，你可能就不想回到

ElementTree

了。

lxml

是一个非常强大、快速且功能丰富的库，它是基于C语言的libxml2和libxslt库构建的，因此在性能上通常优于纯Python实现的

ElementTree

和

minidom

。它的API设计吸收了

ElementTree

的优点，同时又扩展了许多高级功能，比如XPath、XSLT支持，以及更健壮的错误处理。当你需要处理大型XML文件、进行复杂的查询、或者对性能有较高要求时，

lxml

无疑是首选。它的学习曲线可能比

ElementTree

略陡峭，但投入是值得的，尤其是在企业级应用或数据密集型项目中。对我来说，如果项目允许安装第三方库，

lxml

几乎是我的默认选择，它在功能和性能之间找到了一个很好的平衡点。

简单来说：

xml.etree.ElementTree

: 标准库，简单易用，适合大多数基本XML创建任务。

xml.dom.minidom

: 标准库，遵循DOM规范，提供细粒度控制，但代码较冗长。

lxml

: 第三方库，性能卓越，功能强大（XPath, XSLT等），适合处理大型或复杂XML，以及对性能有要求的场景。

在生成复杂XML结构时，如何确保文档的有效性和可读性？

生成复杂XML结构，特别是那些需要与外部系统交互的XML，确保其有效性和可读性是至关重要的。这不仅仅是编码规范的问题，更是保证数据交换顺畅的关键。

关于有效性，最权威的验证方式是使用XML Schema (XSD) 或 DTD (Document Type Definition)。这些是定义XML文档结构、数据类型和约束的语言。一个XML文档只有在符合其声明的Schema或DTD时，才被称为“有效”的。Python标准库本身并没有内置的XSD验证器，但

lxml

库在这方面表现出色。你可以用

lxml

加载一个XSD文件，然后用它来验证你生成的XML文档。这就像给你的XML文件提供了一份“设计图”，确保它严格按照预期格式构建。我个人觉得，对于任何需要跨系统传输的XML，特别是涉及金融、医疗等敏感数据的，Schema验证是不可或缺的一步。在开发阶段，即使不严格执行运行时验证，也应该在设计阶段就明确Schema，并以此指导XML的生成逻辑。

除了Schema验证，确保良好格式 (Well-formedness) 也是基本要求。这意味着XML必须有且只有一个根元素，所有标签都必须正确关闭，属性值必须用引号包裹等等。幸运的是，

ElementTree

和

lxml

这类库在生成XML时，会自动处理大部分良好格式的问题，比如字符转义（如

转换为

），这省去了我们很多手动检查的麻烦。

至于可读性，这主要关乎代码和生成出的XML文件本身。

缩进和换行：前面提到的

ET.indent()

（或

lxml

的

pretty_print=True

）是让XML文件看起来整洁的关键。没有缩进的XML就像一堵密不透风的文字墙，让人望而却步。命名规范：在Python代码中，为XML元素和属性选择清晰、一致的命名，这不仅提升了代码的可读性，也使得生成的XML文档更容易被理解。例如，不要一会儿用

book_title

，一会儿又用

BookTitle

。模块化代码：当XML结构变得复杂时，将XML生成逻辑分解成更小的、职责单一的函数或类。例如，一个函数负责生成

元素，另一个负责生成

元素。这样可以减少代码重复，提高可维护性，并且更容易定位和修复生成错误。注释（在代码中）：在生成XML的代码中添加注释，解释为什么某些元素或属性以特定方式构建，或者它们代表什么业务含义。虽然XML文档本身也可以包含注释（

ET.Comment()

），但在大多数情况下，代码中的注释对维护者来说更有价值。

在我的实践中，我发现一个常见的挑战是，当需求变化时，XML结构也需要随之调整。如果一开始的代码结构混乱，那么修改起来会非常痛苦。所以，投入一些时间去设计清晰的XML结构和模块化的生成代码，这绝对是一项值得的投资。有时，为了满足特定的外部系统要求，我们甚至需要生成一些“不那么完美”的XML，比如某些元素顺序必须固定，或者某些空元素不能省略。这时候，对XML生成库的深入理解和灵活运用就显得尤为重要了。

以上就是如何在Python中创建XML文档？的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/1430819.html

ai app c语言 go java javascript python 为什么敏感数据标准库格式化输出

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

Go语言大文件读取性能优化：理解I/O瓶颈与Goroutine的合理应用

上一篇 2026年5月10日 11:21:30

.NET中的WPF是什么？如何使用MVVM模式来构建桌面应用？

下一篇 2026年5月10日 11:21:30

用户投稿

修复Django电商项目中AJAX过滤产品列表图片不显示问题

在Django电商项目中，当使用AJAX动态加载过滤后的产品列表时，常遇到图片无法正常显示的问题。这通常是由于前端模板中图片加载方式（如data-setbg属性结合JavaScript库）与AJAX动态内容更新机制不兼容所致。解决方案是直接在AJAX返回的HTML中使用标准的标签来渲染图片，确保浏览…

程序猿
2026年5月10日
0000
Matplotlib 地图中多类型图例的创建与优化

本教程旨在解决matplotlib地图可视化中，如何在一个图例中同时展示颜色块（如区域分类）和自定义标记（如特定兴趣点）的问题。文章详细介绍了当传统`patch`对象无法正确显示标记时，如何利用`matplotlib.lines.line2d`创建标记图例句柄，并将其与颜色块图例句柄合并，从而生成一…

程序猿
2026年5月10日 • 用户投稿
1000
用户投稿

Golang JSON序列化：控制敏感字段暴露的最佳实践

本教程探讨golang中如何高效控制结构体字段在json序列化时的可见性。当需要将包含敏感信息的结构体数组转换为json响应时，通过利用`encoding/json`包提供的结构体标签，特别是`json:”-“`，可以轻松实现对特定字段的忽略，从而避免敏感数据泄露，确保api…

程序猿
2026年5月10日
0000
用户投稿

利用海象运算符简化条件赋值：Python教程与最佳实践

本文旨在探讨Python中海象运算符（:=）在条件赋值场景下的应用。通过对比传统if/else语句与海象运算符，以及条件表达式，分析海象运算符在简化代码、提高可读性方面的优势与局限性。并通过具体示例，展示如何在列表推导式等场景下合理使用海象运算符，同时强调其潜在的复杂性及替代方案，帮助开发者更好地掌…

程序猿
2026年5月10日
1000
用户投稿

比特币新手教程比特币交易平台有哪些

比特币是一种去中心化的数字货币，基于区块链技术实现点对点交易，具有匿名性、有限发行和不可篡改等特点；新手可通过交易所购买，P2P交易获得比特币，常用平台包括Binance、OKX和Huobi；交易流程包括注册账户、实名认证、绑定支付方式、充值法币并下单购买，可选择市价单或限价单；比特币存储方式有交易…

程序猿
2026年5月10日
0000
用户投稿

c++中的SFINAE技术是什么_c++模板编程中的SFINAE原理与应用

SFINAE 是“替换失败不是错误”的原则，指模板实例化时若参数替换导致错误，只要存在其他合法候选，编译器不报错而是继续重载决议。它用于条件启用模板、类型检测等场景，如通过 decltype 或 enable_if 控制函数重载，实现类型特征判断。尽管 C++20 引入 Concepts 简化了部分…

程序猿
2026年5月10日
0000
用户投稿

Golang gRPC流式请求异常处理

在Golang的gRPC流式通信中，必须通过context.Context处理异常。应监听上下文取消或超时，及时释放资源，设置合理超时，避免连接长时间挂起，并在goroutine中通过context控制生命周期。在使用 Golang 和 gRPC 实现流式通信时，异常处理是确保服务健壮性的关键部分…

程序猿
2026年5月10日
0000
用户投稿

Go语言mgo查询构建：深入理解bson.M与日期范围查询的正确实践

本文旨在解决go语言mgo库中构建复杂查询时，特别是涉及嵌套`bson.m`和日期范围筛选的常见错误。我们将深入剖析`bson.m`的类型特性，解释为何直接索引`interface{}`会导致“invalid operation”错误，并提供一种推荐的、结构清晰的代码重构方案，以确保查询条件能够正确…

程序猿
2026年5月10日
1000
用户投稿

vscode上怎么运行html_vscode上运行html步骤【指南】

首先保存文件为.html格式，再通过浏览器或Live Server插件打开预览；推荐安装Live Server实现本地服务器运行与实时刷新，提升开发体验。在 VS Code 上运行 HTML 文件并不需要复杂的配置，只需几个简单步骤即可预览页面效果。VS Code 本身是一个代码编辑器，不直接运行…

程序猿
2026年5月10日
1000
用户投稿

RichHandler与Rich Progress集成：解决显示冲突的教程

在使用rich库的`richhandler`进行日志输出并同时使用`progress`组件时，可能会遇到显示错乱或溢出问题。这通常是由于为`richhandler`和`progress`分别创建了独立的`console`实例导致的。解决方案是确保日志处理器和进度条组件共享同一个`console`实例…

程序猿
2026年5月10日
0000
用户投稿

修复点击时按钮抖动：CSS垂直对齐实践

本文探讨了在Web开发中，交互式按钮（如播放/暂停按钮）在点击时发生意外垂直位移的问题。通过分析CSS样式变化对元素布局的影响，我们发现这是由于按钮不同状态下的边框样式和内边距改变，以及默认的垂直对齐行为共同作用所致。核心解决方案是利用CSS的vertical-align属性，将其设置为middle…

程序猿
2026年5月10日
0000
用户投稿

理解编程指令：当结果正确，但实现方式不符要求时

本文探讨了在编程实践中，即使程序输出了正确的结果，但若其实现方式未能严格遵循既定指令，仍可能被视为“不正确”的问题。我们将通过具体示例，对比直接求和与累加求和两种实现策略，强调理解和遵守编程规范的重要性，以确保代码的健壮性、可维护性及符合项目要求。在软件开发过程中，我们经常会遇到这样的情况：编写的…

程序猿
2026年5月10日
0000
用户投稿

Golang goroutine与channel调试技巧

使用go run -race检测数据竞争，结合runtime.NumGoroutine监控协程数量，通过pprof分析阻塞调用栈，利用select超时避免永久阻塞，有效排查goroutine泄漏、死锁和数据竞争问题。 Go语言的goroutine和channel是并发编程的核心，但它们也带来了调试上…

程序猿
2026年5月10日
0000
用户投稿

使用 Jupyter Notebook 进行探索性数据分析

Jupyter Notebook通过单元格实现代码与Markdown结合，支持数据导入（pandas）、清洗（fillna）、探索（matplotlib/seaborn可视化）、统计分析（describe/corr）和特征工程，便于记录与分享分析过程。 Jupyter Notebook 是进行探索性…

程序猿
2026年5月10日
0000
《魔兽世界》将于6月11日开启国服回归技术测试

《%ign%ignore_a_1%re_a_1%》官方宣布，将于6月11日开启国服回归技术测试，时间为7天，并称可以在6月内正式开服，玩家们可以访问官网下载战网客户端并预下载“巫妖王之怒”客户端，技术测试详情见下图。 WordAi WordAI是一个AI驱动的内容重写平台 53 查看详情以上就是《…

程序猿
2026年5月10日 • 用户投稿
2000
用户投稿

如何在HTML中插入表单元素_HTML表单控件与输入类型使用指南

HTML表单通过标签构建，包含action和method属性定义数据提交目标与方式，常用input类型如text、password、email等适配不同输入需求，配合label、required、placeholder提升可用性，结合textarea、select、button等控件实现完整交互，是…

程序猿
2026年5月10日
0000
用户投稿

前端缓存策略与JavaScript存储管理

根据数据特性选择合适的存储方式并制定清晰的读写与清理逻辑，能显著提升前端性能；合理运用Cookie、localStorage、sessionStorage、IndexedDB及Cache API，结合缓存策略与定期清理机制，可在保证用户体验的同时避免安全与性能隐患。前端缓存和JavaScript存…

程序猿
2026年5月10日
1000
用户投稿

HTML5网页如何实现手势操作 HTML5网页移动端交互的处理技巧

首先利用原生touch事件实现滑动判断，再通过preventDefault解决滚动冲突，接着引入Hammer.js处理复杂手势，最后通过优化点击区域、避免事件冲突和增加视觉反馈提升体验。在移动端浏览器中，HTML5网页可以通过触摸事件实现手势操作，提升用户体验。虽然原生JavaScript提供了基…

程序猿
2026年5月10日
0000
用户投稿

创建指定大小并填充特定数据的Golang文件教程

本文将介绍如何使用Golang创建一个指定大小的文件，并用特定数据填充它。我们将使用 `os` 包提供的函数来创建和截断文件，从而实现快速生成大文件的目的。示例代码展示了如何创建一个10MB的文件，并将其填充为全零数据。掌握这些方法，可以方便地在例如日志系统或磁盘队列等场景中，预先创建测试文件或初始…

程序猿
2026年5月10日
0000
用户投稿

深入理解 Express.js 中 next() 参数的作用与中间件机制

本文深入探讨 express.js 中间件函数中的 `next()` 参数。它负责将控制权传递给请求-响应周期中的下一个中间件或路由处理程序。文章将详细解释 `next()` 的工作原理、中间件的注册与执行顺序，以及不正确使用 `next()` 可能导致请求挂起的风险，并通过代码示例和实际应用场景，…

程序猿
2026年5月10日
0000