如何使用Python迭代读取word中的段落、表格和图片？

QQ-77Ly / 2023-09-03 / 原文

from docx.document import Document as _Document
from docx.oxml.text.paragraph import CT_P
from docx.oxml.table import CT_Tbl
from docx.table import _Cell, Table, _Row
from docx.text.paragraph import Paragraph
import docx
path = './test.docx'
doc = docx.Document(path)

def iter_block_items(parent):
    if isinstance(parent, _Document):
        parent_elm = parent.element.body
    elif isinstance(parent, _Cell):
        parent_elm = parent._tc
    elif isinstance(parent, _Row):
        parent_elm = parent._tr
    else:
        raise ValueError("something's not right")
    for child in parent_elm.iterchildren():
        if isinstance(child, CT_P):
            yield Paragraph(child, parent)
        elif isinstance(child, CT_Tbl):
            yield Table(child, parent)

for block in iter_block_items(doc):
    # read Paragraph
    if isinstance(block, Paragraph):
        print(block.text)
    # read table
    elif isinstance(block, Table):
        print(block.style.name)

3. 访问图片

接下来，我们可以通过遍历文档中的每个段落，找到其中包含的图片。具体代码如下：

for paragraph in document.paragraphs:

for run in paragraph.runs:

if run._element.xml.startswith('

print('Found a picture!')

其中，“runs”是指段落中的一小部分文本。如果该“run”对象的XML标记以“

4. 保存图片

最后，我们可以使用Python中的“open”函数将图片保存到本地。具体代码如下：

for paragraph in document.paragraphs:

for run in paragraph.runs:

if run._element.xml.startswith('

image_name = run.part.rels[0]._target

with open(image_name, 'wb') as f:

f.write(run.part.blob)



关于python - 如何使用Python迭代读取word中的段落、表格和图片？，我们在Stack Overflow上找到一个类似的问题：  https://stackoverflow.com/questions/55451762/

如何使用Python迭代读取word中的段落、表格和图片？更多相关文章

今日报告-66

设置Windows10暂停更新3000天

AQS公平锁的流程

AMD锐龙7 7800X3D网游专项测试：竟比i9-13900KS强了15%

常用总线技术基本参数对比

探索图像数据中的隐藏信息：语义实体识别和关系抽取的奇妙之旅

设置Chrome浏览器自动升级

JavaScript – 小技巧 Tips

postgresql在插入数据后怎么获取自增id

EF Core 的基本使用

error: failed to push some refs to 'https://github.com/*******/********.github.io.git'

欧拉降幂

编程语言能力对比

基于机器视觉的小车轨迹控制软件界面展示

随机推荐

一些学科笑话

NOIP2024模拟赛20 & 11.1 小记

20241101 数据结构与算法期中机试收获

Java，启动！

什么是IT技术

即将到来！

2024/11/1日日志关于JavaScript简介&引入方式以及基础语法的学习

舍得-时间-工作是人的一生最重要的事情-自己要有私房钱-人的一生最重要的事情是书写自己的人生

2.TiUP 部署 DM 集群

原型模式的C++实现

python bytecode解析

09-XSS键盘监听、cookie窃取&文件上传绕过

ubuntu 24.04 部署 mysql 8.4.3 LTS

国标GB28181公网平台LiteGBS国标GB28181视频平台建筑工地无线视频联网监控系统方案

imes完工下线

android 13 更改手机信号调整

BFS(Breath First Search 广度优先搜索)

Visual Studio Code（VSCode）中设置中文界面

影响黄金价格大幅波动的因素主要有哪些？

winform用Dev的TreeList滚动到指定节点的位置

如何使用Python迭代读取word中的段落、表格和图片？

如何使用Python迭代读取word中的段落、表格和图片？ 更多相关文章

随机推荐

热门话题

如何使用Python迭代读取word中的段落、表格和图片？更多相关文章