python - 构建 HTML Diff/Patch 算法

coder 2023-05-26 原文

描述我将要完成的工作:

输入 2(N 不是必需的)HTML 文档。
标准化 HTML 格式
区分这两个文档——外部样式并不重要，但文档内联的任何内容都将包括在内。
在 HTML block 元素级别确定增量。

扩展最后一点:

想象一下同一个网站的两个页面，它们共享一个侧边栏，而这可能是一个共同的祖先，已经被复制/粘贴了。每个页面的侧边栏都有一些小的变化。 diff 会显示这些变化，然后我可以“遍历” DOM 以找到它们共享的第一个公共(public) block 元素，或者只是默认为 <body> .在这种情况下，我想走过去发现，哦，他们有一个共同的<div id="sidebar"> .

我对 DaisyDiff 很熟悉，并且该应用程序与 CMS 世界中的应用程序类似。

我也开始使用 google diff-patch 库。

我想提出这种非具体的问题，希望能征求任何人认为可能有帮助的建议或指导。目前，如果您用枪指着我说“编写代码”，我会用 Python 重写 DaisyDiff 并添加这个 block 级逻辑。但我想也许有更好的方法和 Anyone have a diff algorithm for rendered HTML? 的答案让我感到温暖和模糊。

最佳答案

如果您要从头开始，一个有用的搜索词是“tree diff”。

有一篇非常棒的博文 here ，虽然我只是通过谷歌搜索“daisydiff python”找到了它，所以我敢打赌你已经看过了。除了所有有趣的理论内容外，他还提到了 Logilab's xmldiff 的存在。，一个开源的 XML 不同，用 Python 编写。这可能是一个不错的起点——可能不如尝试包装或重新实现 DaisyDiff 正确，但可能更容易快速启动和运行。

还有html-tree-diff在 pypi 上，我通过这个 Quora 链接找到:http://www.quora.com/Is-there-any-good-Python-implementation-of-a-tree-diff-algorithm

efficient diff algorithm for trees and Levenshtein distance 上有一些关于树差异的理论知识。在 cstheory.stackexchange 上。

顺便说一句，为了澄清，您是在谈论区分两个 DOM 树，但不一定将 diff/merge 渲染回任何特定的 HTML，对吗？ (编辑:对。) 这里很多措辞相似的问题实际上是在问“我如何将删除的行涂成红色并将添加的行涂成绿色”或“如何使匹配的段落在视觉上对齐”，跳过了“我如何首先区分两个 DOM 树”的理论困难部分和“我如何在此之前将可能格式错误的 HTML 解析为 DOM 树”的实际困难部分。 :)

关于python - 构建 HTML Diff/Patch 算法，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/12649740/

有关python - 构建 HTML Diff/Patch 算法的更多相关文章

python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声？ - 2
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题？更新问题，以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点？我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等)，但我确实想创建一个输出文件。
ruby - 安装 Ruby 时遇到问题(无法下载资源 "readline--patch") - 2
当我尝试安装Ruby时遇到此错误。我试过查看this和this但无济于事➜~brewinstallrubyWarning:YouareusingOSX10.12.Wedonotprovidesupportforthispre-releaseversion.Youmayencounterbuildfailuresorotherbreakages.Pleasecreatepull-requestsinsteadoffilingissues.==>Installingdependenciesforruby:readline,libyaml,makedepend==>Installingrub
Python 相当于 Perl/Ruby ||= - 2
这个问题在这里已经有了答案:关闭10年前。PossibleDuplicate:Pythonconditionalassignmentoperator对于这样一个简单的问题表示歉意，但是谷歌搜索||=并不是很有帮助；)Python中是否有与Ruby和Perl中的||=语句等效的语句？例如:foo="hey"foo||="what"#assignfooifit'sundefined#fooisstill"hey"bar||="yeah"#baris"yeah"另外，类似这样的东西的通用术语是什么？条件分配是我的第一个猜测，但Wikipediapage跟我想的不太一样。
java - 什么相当于 ruby 的 rack 或 python 的 Java wsgi？ - 2
什么是ruby的rack或python的Java的wsgi？还有一个路由库。最佳答案来自Python标准PEP333:Bycontrast,althoughJavahasjustasmanywebapplicationframeworksavailable,Java's"servlet"APImakesitpossibleforapplicationswrittenwithanyJavawebapplicationframeworktoruninanywebserverthatsupportstheservletAPI.ht
ruby - 在 Ruby 中构建长字符串的简洁方法 - 2
在编写Ruby(客户端脚本)时，我看到了三种构建更长字符串的方法，包括行尾，所有这些对我来说“闻起来”有点难看。有没有更干净、更好的方法？变量递增。ifrender_quote?quote="NowthatthereistheTec-9,acrappyspraygunfromSouthMiami."quote+="ThisgunisadvertisedasthemostpopularguninAmericancrime.Doyoubelievethatshit?"quote+="Itactuallysaysthatinthelittlebookthatcomeswithit:themo
区块链之加解密算法&数字证书 - 2
目录一.加解密算法数字签名对称加密DES(DataEncryptionStandard)3DES(TripleDES)AES(AdvancedEncryptionStandard)RSA加密法DSA(DigitalSignatureAlgorithm)ECC(EllipticCurvesCryptography)非对称加密签名与加密过程非对称加密的应用对称加密与非对称加密的结合二.数字证书图解一.加解密算法加密简单而言就是通过一种算法将明文信息转换成密文信息，信息的的接收方能够通过密钥对密文信息进行解密获得明文信息的过程。根据加解密的密钥是否相同，算法可以分为对称加密、非对称加密、对称加密和非
华为OD机试用Python实现 -【明明的随机数】 2023Q1A - 2
华为OD机试题本篇题目：明明的随机数题目输入描述输出描述：示例1输入输出说明代码编写思路最近更新的博客华为od2023|什么是华为od，od薪资待遇，od机试题清单华为OD机试真题大全，用Python解华为机试题|机试宝典【华为OD机试】全流程解析+经验分享,题型分享,防作弊指南华为o
python - 如何读取 MIDI 文件、更改其乐器并将其写回？ - 2
我想解析一个已经存在的.mid文件，改变它的乐器，例如从“acousticgrandpiano”到“violin”，然后将它保存回去或作为另一个.mid文件。根据我在文档中看到的内容，该乐器通过program_change或patch_change指令进行了更改，但我找不到任何在已经存在的MIDI文件中执行此操作的库.他们似乎都只支持从头开始创建的MIDI文件。最佳答案 MIDIpackage会为您完成此操作，但具体方法取决于midi文件的原始内容。一个MIDI文件由一个或多个音轨组成，每个音轨是十六个channel中任何一个上的
「Python｜Selenium｜场景案例」如何定位iframe中的元素？ - 2
本文主要介绍在使用Selenium进行自动化测试或者任务时，对于使用了iframe的页面，如何定位iframe中的元素文章目录场景描述解决方案具体代码场景描述当我们在使用Selenium进行自动化测试的时候，可能会遇到一些界面或者窗体是使用HTML的iframe标签进行承载的。对于iframe中的标签，如果直接查找是无法找到的，会抛出没有找到元素的异常。比如近在咫尺的例子就是，CSDN的登录窗体就是使用的iframe，大家可以尝试通过F12开发者模式查看到的tag_name,class_name,id或者xpath来定位中的页面元素，会抛出NoSuchElementException异常。解决
python ffmpeg 使用 pyav 转换一组图像到视频 - 2
2022/8/4更新支持加入水印水印必须包含透明图像，并且水印图像大小要等于原图像的大小pythonconvert_image_to_video.py-f30-mwatermark.pngim_dirout.mkv2022/6/21更新让命令行参数更加易用新的命令行使用方法pythonconvert_image_to_video.py-f30im_dirout.mkvFFMPEG命令行转换一组JPG图像到视频时，是将这组图像视为MJPG流。我需要转换一组PNG图像到视频，FFMPEG就不认了。pyav内置了ffmpeg库，不需要系统带有ffmpeg工具因此我使用ffmpeg的python包装p

python - 构建 HTML Diff/Patch 算法

有关python - 构建 HTML Diff/Patch 算法的更多相关文章

随机推荐