jjzjj

python - 将嵌入的 Excel 对象从 do​​cx 文件转换为图像

coder 2023-08-24 原文

我在非 Windows 机器上使用 pandoc(通过 pypandoc)将 docx 文件转换为 markdown。这些文件可以包含图像,也可以包含其他嵌入对象。

pandoc 实际上能够翻译嵌入式 Powerpoint 演示文稿(转换为 EMF 文件),但它无法处理 Excel 对象(它会忽略它们)。目的是使用 python 将那些嵌入的 Excel 对象转换为图像,以便它们可以显示为例如的一部分。一个 HTML 输出。

使用用另一种语言编写的组件(例如 bash 脚本)是可以的,只要它们可以用 python API 包装。

我意识到这在非 Windows 平台(即没有 Microsoft 库,例如 win32com)上可能是一项艰巨的任务。有没有人在这方面取得过任何成功,或者对如何进行有任何有根据的猜测?

要显示的单元格区域是什么?

所有嵌入式对象的核心问题是确定应显示它们的哪一部分,因为这是核心功能。

必须有一种方法来确定要显示哪些单元格,因为 Word 在读取 docx 文件的内容时可以使用该信息。

这是问题的关键。如果实际算法不能考虑到这一点,答案仍然会被接受,只要它提供了一种提取该信息的方法。

Some clues might be found on this page .

注意事项

按照探索文件本身结构的建议,这是我观察到的:如果您创建一个带有嵌入式 Excel 文件的简单 docx 文档 (Mydoc.docx),您可以检查通过复制 docx 文件(将其重命名为 .zip 扩展名)并解压缩来查看其内容。

  • 文本本身包含在 Mydoc/word/document.xml
  • Excel 文件包含在 Mydoc/word/embeddings/Excel_Sheet_1.xlsx(或类似的东西)中。

如果那是要走的路线,那么问题就分成两部分:

  1. Excel_Sheet_1.xlsx 转换为图像(以及您如何知道哪些工作表和单元格区域是图像的一部分?)。
  2. 调整 document.xml 使其显示“指向图像”而不是指向嵌入文件。

OOXML相当复杂,尤其是当你尝试做一些像我正在尝试做的那样“基本”的事情时......有没有人从 Unix 平台去那里并带着一些明智的东西回来?

最佳答案

正如您在 OP 中提到的,我会采用 mydoc.docx 的“反汇编-汇编”方式,即:

  1. mydoc.docx 中提取 Excel 工作表。 我假设它是一个嵌入式工作表,它肯定可以很容易地适应工作表是链接的外部 xlsx 的情况。 在我的例子中,工作表位于 docx 结构内的 word\embeddings\Microsoft_Excel_Worksheet1.xlsx。 如您所说,一种方法是将 mydoc.docx 复制到 mydoc.zip,然后从 mydoc 中提取 Microsoft_Excel_Worksheet1.xlsx .zip结构。

  2. Microsoft_Excel_Worksheet1.xlsx 转换为图像。 由于缺少 win API,这在 Linux 下似乎不是一项简单的任务。 例如,excel2img需要 pywin32 . 解决方法是使用 unoconvxlsx 转换成合适的格式。 这里的选项很多。请注意:

    1. 您可能需要在 python 中将其作为外部命令运行。这不是问题,但是您的 python 脚本应该确定主机操作系统,然后决定是使用 unoconv(对于 Linux)还是更“标准”的解决方案(对于 Windows,超出了OP)。 请注意,unoconv 是用 python 编写的,因此也许您可以将它以某种方式集成到您的脚本中。

    2. Bugs were reported对于 unoconv 当导出为 png 时,例如,您可能需要分两步执行导出到目标格式,到 pdf 然后转换为 png/jpg,例如使用转换。 这可能因版本而异。在我的版本中,电子表格可以导出的唯一图形格式是 pdf,因此必须进行两步转换。 请注意,您可能必须使用 convert-crop 选项,因为 pdf 导出会生成整个页面。

    3. 您必须在系统中安装 unoconv

    4. 您可以选择要导出的页面范围,如
      unoconv -f pdf -d spreadsheet -e PageRange=1-1 Microsoft_Excel_Worksheet1.xlsx
      据我所试,整个非空单元格范围都被导出,并且不可能使用 unoconv 导出其中的一部分。 一个可能的解决方法是 using openpyxl to fold cell ranges您不想显示的内容,然后导出。

这就是问题的本质(“目的是使用 python 将那些嵌入的 Excel 对象转换为图像。”)

  1. 用创建的图像替换 Microsoft_Excel_Worksheet1.xlsx

注意:这是一个可以对Excel工作表执行各种操作的pyhton模块列表。

pyExcelerator (显然不再维护了)

xlwt (pyExcelerator 的分支)

openpyxl

关于python - 将嵌入的 Excel 对象从 do​​cx 文件转换为图像,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/47829726/

有关python - 将嵌入的 Excel 对象从 do​​cx 文件转换为图像的更多相关文章

  1. ruby - 如何从 ruby​​ 中的字符串运行任意对象方法? - 2

    总的来说,我对ruby​​还比较陌生,我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础,我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用

  2. ruby - 使用 RubyZip 生成 ZIP 文件时设置压缩级别 - 2

    我有一个Ruby程序,它使用rubyzip压缩XML文件的目录树。gem。我的问题是文件开始变得很重,我想提高压缩级别,因为压缩时间不是问题。我在rubyzipdocumentation中找不到一种为创建的ZIP文件指定压缩级别的方法。有人知道如何更改此设置吗?是否有另一个允许指定压缩级别的Ruby库? 最佳答案 这是我通过查看ruby​​zip内部创建的代码。level=Zlib::BEST_COMPRESSIONZip::ZipOutputStream.open(zip_file)do|zip|Dir.glob("**/*")d

  3. ruby - 其他文件中的 Rake 任务 - 2

    我试图在一个项目中使用rake,如果我把所有东西都放到Rakefile中,它会很大并且很难读取/找到东西,所以我试着将每个命名空间放在lib/rake中它自己的文件中,我添加了这个到我的rake文件的顶部:Dir['#{File.dirname(__FILE__)}/lib/rake/*.rake'].map{|f|requiref}它加载文件没问题,但没有任务。我现在只有一个.rake文件作为测试,名为“servers.rake”,它看起来像这样:namespace:serverdotask:testdoputs"test"endend所以当我运行rakeserver:testid时

  4. ruby-on-rails - 在 Rails 中将文件大小字符串转换为等效千字节 - 2

    我的目标是转换表单输入,例如“100兆字节”或“1GB”,并将其转换为我可以存储在数据库中的文件大小(以千字节为单位)。目前,我有这个:defquota_convert@regex=/([0-9]+)(.*)s/@sizes=%w{kilobytemegabytegigabyte}m=self.quota.match(@regex)if@sizes.include?m[2]eval("self.quota=#{m[1]}.#{m[2]}")endend这有效,但前提是输入是倍数(“gigabytes”,而不是“gigabyte”)并且由于使用了eval看起来疯狂不安全。所以,功能正常,

  5. python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声? - 2

    关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题?更新问题,以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点?我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等),但我确实想创建一个输出文件。

  6. ruby-on-rails - Rails 3 中的多个路由文件 - 2

    Rails2.3可以选择随时使用RouteSet#add_configuration_file添加更多路由。是否可以在Rails3项目中做同样的事情? 最佳答案 在config/application.rb中:config.paths.config.routes在Rails3.2(也可能是Rails3.1)中,使用:config.paths["config/routes"] 关于ruby-on-rails-Rails3中的多个路由文件,我们在StackOverflow上找到一个类似的问题

  7. ruby-on-rails - 按天对 Mongoid 对象进行分组 - 2

    在控制台中反复尝试之后,我想到了这种方法,可以按发生日期对类似activerecord的(Mongoid)对象进行分组。我不确定这是完成此任务的最佳方法,但它确实有效。有没有人有更好的建议,或者这是一个很好的方法?#eventsisanarrayofactiverecord-likeobjectsthatincludeatimeattributeevents.map{|event|#converteventsarrayintoanarrayofhasheswiththedayofthemonthandtheevent{:number=>event.time.day,:event=>ev

  8. ruby - 将差异补丁应用于字符串/文件 - 2

    对于具有离线功能的智能手机应用程序,我正在为Xml文件创建单向文本同步。我希望我的服务器将增量/差异(例如GNU差异补丁)发送到目标设备。这是计划:Time=0Server:hasversion_1ofXmlfile(~800kiB)Client:hasversion_1ofXmlfile(~800kiB)Time=1Server:hasversion_1andversion_2ofXmlfile(each~800kiB)computesdeltaoftheseversions(=patch)(~10kiB)sendspatchtoClient(~10kiBtransferred)Cl

  9. ruby - 使用 ruby​​ 将 HTML 转换为纯文本并维护结构/格式 - 2

    我想将html转换为纯文本。不过,我不想只删除标签,我想智能地保留尽可能多的格式。为插入换行符标签,检测段落并格式化它们等。输入非常简单,通常是格式良好的html(不是整个文档,只是一堆内容,通常没有anchor或图像)。我可以将几个正则表达式放在一起,让我达到80%,但我认为可能有一些现有的解决方案更智能。 最佳答案 首先,不要尝试为此使用正则表达式。很有可能你会想出一个脆弱/脆弱的解决方案,它会随着HTML的变化而崩溃,或者很难管理和维护。您可以使用Nokogiri快速解析HTML并提取文本:require'nokogiri'h

  10. ruby - 如何将脚本文件的末尾读取为数据文件(Perl 或任何其他语言) - 2

    我正在寻找执行以下操作的正确语法(在Perl、Shell或Ruby中):#variabletoaccessthedatalinesappendedasafileEND_OF_SCRIPT_MARKERrawdatastartshereanditcontinues. 最佳答案 Perl用__DATA__做这个:#!/usr/bin/perlusestrict;usewarnings;while(){print;}__DATA__Texttoprintgoeshere 关于ruby-如何将脚

随机推荐