xml - 编写更高效的 xquery 代码(避免冗余迭代)

coder 2024-06-29 原文

这是我正在处理的问题的简化版本:我有一堆 xml 数据，这些数据对有关人的信息进行编码。每个人都由“id”属性唯一标识，但他们可能有多个名字。例如，在一份文件中，我可能会发现

<person id=1>Paul Mcartney</person>
<person id=2>Ringo Starr</person>

在另一个我可能会发现:

<person id=1>Sir Paul McCartney</person>
<person id=2>Richard Starkey</person>

我想使用 xquery 生成一个新文档，其中列出与给定 ID 关联的每个名称。即:

<person id=1>
    <name>Paul McCartney</name>
    <name>Sir Paul McCartney</name>
    <name>James Paul McCartney</name>
</person>
<person id=2>
    ...
</person>

我现在在 xquery 中这样做的方式是这样的(伪代码式):

let $ids := distinct-terms( [all the id attributes on people] )
for $id in $ids
    return <person id={$id}>
    {
    for $unique-name in distinct-values
            (
            for $name in ( [all names] )
            where $name/@id=$id
            return $name
            )
        return <name>{$unique-name}</name>
    }
    </person>

问题是这真的很慢。我想瓶颈是最内层的循环，它为每个 id 执行一次(其中大约有 1200 个)。我正在处理相当多的数据(300 MB，分布在大约 800 个 xml 文件中)，所以即使在内部循环中执行一次查询也需要大约 12 秒，这意味着重复它 1200 次将需要大约 4小时(这可能是乐观的 - 该过程到目前为止已经运行了 3 小时)。它不仅速度慢，而且会占用大量虚拟内存。我正在使用 Saxon，我必须将 Java 的最大堆大小设置为 10 GB(!)以避免出现内存不足错误，并且它当前使用 6 GB 的物理内存。

所以这就是我真正喜欢的方式(在 Pythonic 伪代码中):

persons = {}
for id in ids:
    person[id] = set()
for person in all_the_people_in_my_xml_document:
    persons[person.id].add(person.name)

在那里，我只是在线性时间内完成，只扫描了一次 xml 文档。现在，有没有办法在 xquery 中做类似的事情？当然如果我能想象的话，一个合理的编程语言应该能够做到(他不切实际地说道)。我想问题在于，与 Python 不同，xquery(据我所知)没有任何类似关联数组的东西。

有什么聪明的方法可以解决这个问题吗？如果做不到这一点，是否有比 xquery 更好的东西可以用来实现我的目标？因为实际上，我在这个相对简单的问题上投入的计算资源有点荒谬。

最佳答案

不幸的是，这是 XQuery 1.0 中的一个缺点

XQuery 1.1 将 group by 子句添加到语法中以解决此问题，您的问题将通过以下方式解决:

for $person in /person
let $id = $person/@id
group by $id
return  <people id="{$id}">{
          for $name in distinct-values($person)
          return <name>{$name}</name>
        }</people>

不幸的是，XQuery 1.1 并未得到广泛实现，因此目前您无法使用 group by 子句。

作为 XQSharp 的开发人员，我不能代表任何其他实现，但我们花了很多时间调整我们的优化器，以发现 XQuery 1.1 中常见的分组依据模式，并使用您指定的算法执行它们。

特别是以下版本的查询:

declare variable $people as element(person, xs:untyped)* external;

for $id in distinct-values($people/@id)
return <people id="{$id}">{
          for $person in $people
          where $person/@id = $id
          return <name>{$person}</name>
       }</people>

被发现为一个分组依据，如下面的查询计划所证明的那样:

library http://www.w3.org/2005/xpath-functions external;
library http://www.w3.org/2001/XMLSchema external;
declare variable $people external;

for $distinct-person in $people
let $id := http://www.w3.org/2005/xpath-functions:data($distinct-person/attribute::id)
group by
  $id
aggregate
  element {name} { fs:item-sequence-to-node-sequence($distinct-person) }
as
  $:temp:19
return
  element {person} { (attribute {id} { $id } , fs:item-sequence-to-node-sequence($:temp:19)) }

请注意，类型注释 as element(person, xs:untyped)* 是必需的，因为不知道节点是未类型化的(未根据模式验证)，查询处理器没有办法知道 $person/@id 的数据值中没有多项。 XQSharp 尚不支持每个节点可以有多个键的表达式分组。但是，在这种情况下，仍然会发现左外部联接，因此复杂度应该大致为 n log n，而不是您遇到的二次方。

不幸的是，虽然在组中的一组人周围添加不同的值(以过滤掉重复的名称)似乎阻止了 XQSharp 找到连接；这已被记录为错误。目前，这可以通过分两次执行查询来解决——按 ID 对名称进行分组，并删除重复的名称。

总而言之，XQuery 1.0 中没有更好的方法，但一些实现(例如 XQSharp)将能够有效地评估它。如有疑问，请检查查询计划。

要更详细地了解 XQSharp 执行的连接优化，请查看此 blog post .

关于xml - 编写更高效的 xquery 代码(避免冗余迭代)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/2824001/

编写 xquery person name code xml xslt

有关xml - 编写更高效的 xquery 代码(避免冗余迭代)的更多相关文章

ruby - 如何在 buildr 项目中使用 Ruby 代码？ - 2
如何在buildr项目中使用Ruby？我在很多不同的项目中使用过Ruby、JRuby、Java和Clojure。我目前正在使用我的标准Ruby开发一个模拟应用程序，我想尝试使用Clojure后端(我确实喜欢功能代码)以及JRubygui和测试套件。我还可以看到在未来的不同项目中使用Scala作为后端。我想我要为我的项目尝试一下buildr(http://buildr.apache.org/)，但我注意到buildr似乎没有设置为在项目中使用JRuby代码本身!这看起来有点傻，因为该工具旨在统一通用的JVM语言并且是在ruby中构建的。除了将输出的jar包含在一个独特的、仅限ruby
ruby-on-rails - Rails 源代码 : initialize hash in a weird way? - 2
在rails源中:https://github.com/rails/rails/blob/master/activesupport/lib/active_support/lazy_load_hooks.rb可以看到以下内容@load_hooks=Hash.new{|h,k|h[k]=[]}在IRB中，它只是初始化一个空哈希。和做有什么区别@load_hooks=Hash.new 最佳答案查看rubydocumentationforHashnew→new_hashclicktotogglesourcenew(obj)→new_has
ruby - 在 Ruby 中编写命令行实用程序 - 2
我想用ruby编写一个小的命令行实用程序并将其作为gem分发。我知道安装后，Guard、Sass和Thor等某些gem可以从命令行自行运行。为了让gem像二进制文件一样可用，我需要在我的gemspec中指定什么。最佳答案 Gem::Specification.newdo|s|...s.executable='name_of_executable'...endhttp://docs.rubygems.org/read/chapter/20 关于ruby-在Ruby中编写命令行实用程序
ruby-on-rails - 如何从 format.xml 中删除 <hash></hash> - 2
我有一个对象has_many应呈现为xml的子对象。这不是问题。我的问题是我创建了一个Hash包含此数据，就像解析器需要它一样。但是rails自动将整个文件包含在.........我需要摆脱type="array"和我该如何处理？我没有在文档中找到任何内容。最佳答案我遇到了同样的问题；这是我的XML:我在用这个:entries.to_xml将散列数据转换为XML，但这会将条目的数据包装到中所以我修改了:entries.to_xml(root:"Contacts")但这仍然将转换后的XML包装在“联系人”中，将我的XML代码修改为
ruby-on-rails - 浏览 Ruby 源代码 - 2
我的主要目标是能够完全理解我正在使用的库/gem。我尝试在Github上从头到尾阅读源代码，但这真的很难。我认为更有趣、更温和的踏脚石就是在使用时阅读每个库/gem方法的源代码。例如，我想知道RubyonRails中的redirect_to方法是如何工作的:如何查找redirect_to方法的源代码？我知道在pry中我可以执行类似show-methodmethod的操作，但我如何才能对Rails框架中的方法执行此操作？您对我如何更好地理解Gem及其API有什么建议吗？仅仅阅读源代码似乎真的很难，尤其是对于框架。谢谢! 最佳答案 Ru
ruby-on-rails - RSpec:避免使用允许接收的任何实例 - 2
我正在处理旧代码的一部分。beforedoallow_any_instance_of(SportRateManager).toreceive(:create).and_return(true)endRubocop错误如下:Avoidstubbingusing'allow_any_instance_of'我读到了RuboCop::RSpec:AnyInstance我试着像下面那样改变它。由此beforedoallow_any_instance_of(SportRateManager).toreceive(:create).and_return(true)end对此:let(:sport_
ruby - 模块嵌套代码风格偏好 - 2
我的假设是moduleAmoduleBendend和moduleA::Bend是一样的。我能够从thisblog找到解决方案,thisSOthread和andthisSOthread.为什么以及什么时候应该更喜欢紧凑语法A::B而不是另一个，因为它显然有一个缺点？我有一种直觉，它可能与性能有关，因为在更多命名空间中查找常量需要更多计算。但是我无法通过对普通类进行基准测试来验证这一点。最佳答案这两种写作方法经常被混淆。首先要说的是，据我所知，没有可衡量的性能差异。(在下面的书面示例中不断查找)最明显的区别，可能也是最著名的，是你的
ruby - 寻找通过阅读代码确定编程语言的ruby gem？ - 2
几个月前，我读了一篇关于rubygem的博客文章，它可以通过阅读代码本身来确定编程语言。对于我的生活，我不记得博客或gem的名称。谷歌搜索“ruby编程语言猜测”及其变体也无济于事。有人碰巧知道相关gem的名称吗？最佳答案是这个吗:http://github.com/chrislo/sourceclassifier/tree/master 关于ruby-寻找通过阅读代码确定编程语言的rubygem？，我们在StackOverflow上找到一个类似的问题：
ruby - 用 Ruby 编写一个简单的网络服务器 - 2
我想在Ruby中创建一个用于开发目的的极其简单的Web服务器(不，不想使用现成的解决方案)。代码如下:#!/usr/bin/rubyrequire'socket'server=TCPServer.new('127.0.0.1',8080)whileconnection=server.acceptheaders=[]length=0whileline=connection.getsheaders想法是从命令行运行这个脚本，提供另一个脚本，它将在其标准输入上获取请求，并在其标准输出上返回完整的响应。到目前为止一切顺利，但事实证明这真的很脆弱，因为它在第二个请求上中断并出现错误:/usr/b
ruby - Net::HTTP 获取源代码和状态 - 2
我目前正在使用以下方法获取页面的源代码:Net::HTTP.get(URI.parse(page.url))我还想获取HTTP状态，而无需发出第二个请求。有没有办法用另一种方法做到这一点？我一直在查看文档，但似乎找不到我要找的东西。最佳答案在我看来，除非您需要一些真正的低级访问或控制，否则最好使用Ruby的内置Open::URI模块:require'open-uri'io=open('http://www.example.org/')#=>#body=io.read[0,50]#=>"["200","OK"]io.base_ur

xml - 编写更高效的 xquery 代码(避免冗余迭代)

有关xml - 编写更高效的 xquery 代码(避免冗余迭代)的更多相关文章

随机推荐