Linux 命令 xmlstarlet
XMLStarlet 是一种开放源码的 XML 工具箱,可以在 UNIX®、Mac OS® X 或 Microsoft® Windows® 命令行中使用。XMLStarlet 可以验证 XML、格式化 XML、选择其中的一部分、用 XSLT 进行转换甚至编辑。这意味着,不需要使用 Perl 或 Java® 之类的编程语言编写任何自定义的代码,就可以在 shell 脚本中加入 XML 工具。
使用 XMLStarlet 需要安装它,而安装需要 libxml2 和 libxslt2 库。在 Windows 上不需要安装 libxml2 和 libxslt2,因为 Win32 包已经包含了。可以下载 Win32 可执行文件并将其安装到方便从命令行执行的任何位置。如果运行 UNIX,而机器上还没有 libxml2 和 libxslt2,则必须下载并安装(请参阅 参考资料)。
然后转到 XMLStarlet 主页下载最新的构建包(请参阅 参考资料)。运行 ./configure 脚本以便设置构建脚本,然后运行 make install 构建包并安装。如果您不是超级用户,应该使用 sudo make install 以便将命令安装到 system 目录中。
可能还需要访问 XML、XSLT 和 XML Path Language (XPath) 页面以便及时更新这三个标准,这对于充分利用 XMLStarlet 非常重要(请参阅 参考资料)。
基础
安装完成后,现在可以对 XMLStarlet 做一番漫游了。首先不带参数运行 xml 命令(参见清单 1)。
1. XMLStarlet 帮助页
% xml 所有命令的基本格式为 xml % xml ed --help 这份帮助文件看起来很复杂,但最重要的部分在下面,可以看到如何删除、插入 XML 节点或者改变节点的值,等等。 本文中的一些代码行很长,如果不断开就无法在窗口中显示出来。这些行在代码清单中被折叠起来,虽然在实际的命令行中只有一行。这些行用 » 符号表示(比如清单 3)。 使用 XMLStarlet 需要有 XML,因此我们介绍第一个命令 xml ls,它用 XML 给出当前目录的列表。# 3 给出了一个例子。 % xml ls 如果认为目录列表显示的信息太多了,可以(比方说)去掉目录节点,如清单 4 所示。 % xml ls | xml ed -d "//d" 使用编辑命令(ed)从 XML 中去掉了 d 节点。ls 命令把目录输出到标准输出。管道符(|)将标准输出重定向到编辑命令的标准输入,编辑命令从列表中删除 d 节点。使用 XPath 表达式 //d 指定 d 节点,它和树中所有层次上的 d 节点匹配。如果要更加准确,可以使用 /xml/d。 现在,假设要删除 a 和 m 属性(如清单 5 所示)。 % xml ls | xml ed -d "//d" -d "//@a" -d "//@m" -d "//@p" 现在更简洁了,清单中只剩下了文件,文件节点中只能看到文件的大小和名称。为了更便于跟踪,可以将结果保存在一个名为 ls.xml 的文件中。也可使用 rename 编辑函数将 f 标签修改为 file(如清单 6 所示)。 % cat ls.xml | xml ed -r "//f" -v "file" 此外,如果标签和属性不愿意使用短名字如 s 和 n,可以分别将其修改为 size 和 name(如图 7 所示)。 % cat ls.xml | xml ed -r "//f" -v "file" -r "//@s" -v "size" -r "//@n" -v "name" 这样读起来更容易了。到现在还没有写一行 XSLT、Perl 或 Java 代码。将该文件保存为 ls2.xml。 新的目录列表看起来不错,那么是不是仍然有效呢?# 8 说明了如何来进行判断。 1 % xml val ls2.xml 啊,是有效的。就是说它是结构良好的,即标签是平衡的、字符编码是正确的等等。但是仍然可能缺少必要的标签或者正确的标签。为此必须知道文件的正确结构,因此需要一个模式。只有用模式检查 XML 文档并且通过之后才能说它是有效的。 <?xml version="1.0" encoding="UTF-8"?> RELAX NG 读起来很容易。最上面的 element 标签定义了 xml 作为基本标签。然后,xml 标签中的 oneOrMore 标签被命名为 file 和 size。 ls2.xml 文件对于这个新的模式有效吗?请参阅清单 10。 % xml val -e -r ls.rng ls2.xml 如果您像我一样 —— 只有看到错误才会满足,那么可以在 ls3.xml 文件中的一个文件节点中添加属性 someAttribute,然后再检查该文件(参见清单 11)。 % xml val -e -r ls.rng ls3.xml 结果证明失败了。不但要知道文件是结构良好的,还要知道所有的标签和属性都是正确的。 还可以使用选择函数从 XML 提取数据元素。清单 12 中的例子从 XML 目录中提取文件名作为普通文本。 % xml sel -t -m "/xml/file" -v "concat(@name,' 这里要注意两点。首先,提取文件名的 XPath 是 /xml/file 条款。其次使用 -v 选项的输出说名用回车换行连接 file 标签中的 name 属性。 现在增加 -s 选项,按照 size 属性对文件排序(参见清单 13)。 A:N:- 语法告诉 XMLStarlet 按照数值大小递增排序。(这里将 size 参数添加到 concat 语句中以便能正常工作。) % xml sel -t -m "/xml/file" -s A:N:- "@size" -v "concat
XMLStarlet Toolkit: command-line utilities for XML
Usage: xml [
where
ed (or edit) - Edit/Update XML document(s)
sel (or select) - Select data or query XML document(s) (XPATH, etc)
tr (or transform) - Transform XML document(s) using XSLT
val (or validate) - Validate XML document(s) (well-formed/DTD/XSD/RelaxNG)
fo (or format) - Format XML document(s)
el (or elements) - Display element structure of XML document
c14n (or canonic) - XML canonicalization
ls (or list) - List directory as XML
esc (or escape) - Escape special XML characters
unesc (or unescape) - Unescape special XML characters
pyx (or xmln) - Convert XML into PYX format (based on ESIS - ISO 8879)
p2x (or depyx) - Convert PYX into XML
--version - show version
--help - show help
Wherever file name mentioned in command help it is assumed
that URL can be used instead as well.
Type: xml
XMLStarlet is a command line toolkit to query/edit/check/transform
XML documents (for more information see http://xmlstar.sourceforge.net/)2. 编辑命令的帮助
XMLStarlet Toolkit: Edit XML document(s)
Usage: xml ed
where
-P (or --pf) - preserve original formatting
-S (or --ps) - preserve non-significant spaces
-O (or --omit-decl) - omit XML declaration (<?xml ...?>)
-N
ex: xsql=urn:oracle-xsql
Multiple -N options are allowed.
-N options must be last global options.
--help or -h - display help
where
-d or --delete
-i or --insert
-a or --append
-s or --subnode
-m or --move
-r or --rename
-u or --update
-x (--expr)
XMLStarlet is a command line toolkit to query/edit/check/transform
XML documents (for more information see http://xmlstar.sourceforge.net/)
长代码行
XML 目录列表3. XML 目录列表
<d p="rwxr-xr-x" a="2005.05.04 23:03:46"
» m="2004.03.24 16:21:02" s="374" n="."/>
<d p="rwxr-xr-x" a="2005.05.04 23:03:46"
» m="2005.05.04 22:13:41" s="1938"n=".."/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.24 01:13:43" s="6148"n=".DS_Store"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.24 00:41:46" s="173" n="build.xml"/>
<d p="rwxr-xr-x" a="2005.04.30 11:34:27"
» m="2004.03.24 01:13:43" s="544" n="docs"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.21 18:41:58" s="641" n="input.xml"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.23 23:41:15" s="3587"n="main.xsl"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.24 00:37:10" s="184" n="Makefile"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.24 00:36:41" s="3869"n="MyGenerator.class"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.24 00:36:33" s="5265"n="MyGenerator.java"/>
<d p="rwxr-xr-x" a="2005.04.30 11:34:25"
» m="2004.03.24 00:20:07" s="272" n="output"/>
4. 不含目录节点的列表
<?xml version="1.0"?><f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.24 01:13:43" s="6148" n=".DS_Store"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.24 00:41:46" s="173" n="build.xml"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.21 18:41:58" s="641" n="input.xml"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.23 23:41:15" s="3587" n="main.xsl"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.24 00:37:10" s="184" n="Makefile"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.24 00:36:41" s="3869" n="MyGenerator.class"/>
<f p="rw-r--r--" a="2005.03.24 17:53:52"
» m="2004.03.24 00:36:33" s="5265" n="MyGenerator.java"/>
5. 删除 a 和 m 属性的目录列表
<?xml version="1.0"?><f s="6148" n=".DS_Store"/>
<f s="173" n="build.xml"/>
<f s="641" n="input.xml"/>
<f s="3587" n="main.xsl"/>
<f s="184" n="Makefile"/>
<f s="3869" n="MyGenerator.class"/>
<f s="5265" n="MyGenerator.java"/>
6. 显示大小和文件名属性的目录列表
<?xml version="1.0"?><file s="6148" n=".DS_Store"/>
<file s="173" n="build.xml"/>
<file s="641" n="input.xml"/>
<file s="3587" n="main.xsl"/>
<file s="184" n="Makefile"/>
<file s="3869" n="MyGenerator.class"/>
<file s="5265" n="MyGenerator.java"/>
7. 使用 file 标签的目录列表
<?xml version="1.0"?><file size="6148" name=".DS_Store"/>
<file size="173" name="build.xml"/>
<file size="641" name="input.xml"/>
<file size="3587" name="main.xsl"/>
<file size="184" name="Makefile"/>
<file size="3869" name="MyGenerator.class"/>
<file size="5265" name="MyGenerator.java"/>
验证8. 检查 XML 的良构性
2
ls2.xml - valid9 显示了 XML 目录列表文件的基本 RELAX NG 模式。
9. RELAX NG 模式
<element name="xml">
<oneOrMore>
<element name="file">
<attribute name="name">
<data type="NMTOKEN"/>
</attribute>
<attribute name="size">
<data type="integer"/>
</attribute>
</element>
</oneOrMore>
</element>
10. 用模式检查
ls2.xml - valid11. 用模式检查错误的文件
ls3.xml:4: element file: Relax-NG validity error :
» Invalid attribute someAttribute for element file
ls3.xml - invalid
文本12. 提取文件名
')" ls2.xml
.DS_Store
build.xml
input.xml
main.xsl
Makefile
MyGenerator.class
MyGenerator.java13. 列表排序
» ( @name,':',@size,'
' ) " ls2.xml
build.xml:173
Makefile:184
input.xml:641
main.xsl:3587
MyGenerator.class:3869
MyGenerator.java:5265
.DS_Store:6148