python中利用python-docx批量提取docx中的图片

由于工作中需要从大量docx文档中提出图片，于是到网上搜索，找了一大堆都是分析xml文件并提取的，太过于复杂，实际上有更简单的方法，只是python-docx并未开发这个功能，但通过debug方式还是能找到资源信息，直接进行提取另存就好了。

本文为原创，如需转载请注明出处。

for file in os.listdir(filePath):

try:

#跳过非docx文件

if ".docx" not in file:

continue

# 创建imgPath

subImgPath = imgPath + re.sub(".docx","",file)

if not os.path.exists(subImgPath):

os.makedirs(subImgPath)

doc = docx.Document(filePath + file) #打开文件

for rel in doc.part._rels:

rel = doc.part._rels[rel] #获得资源

if "image" not in rel.target_ref:

continue

imgName = re.findall("/(.*)",rel.target_ref)[0]

with open(subImgPath + "/" + imgName,"wb") as f:

f.write(rel.target_part.blob)

UI.currentFile.setText("当前文件：" + imgName)

except:

continue

代码中subImagPath是为了按文件名创建目录而生成的一个变量。直接利用python-docx已解析xml结构，从中提出相关数据进行图片保存，此方法速度十分快

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成，浏览时请结合常识与多方信息审慎甄别。
平台声明：文章内容（如有图片或视频亦包括在内）由作者上传并发布，文章内容仅代表作者本人观点，简书系信息发布平台，仅提供信息存储服务。