Python - 批量转换Word文件为PDF文件

1,目的

通过万能的Python把一个目录下的所有Word文件转换为PDF文件。

Word to PDF .jpg

2,遍历目录

作者总结了三种遍历目录的方法,分别如下。

2.1,调用glob

遍历指定目录下的所有文件和文件夹,不递归遍历,需要手动完成递归遍历功能。

import glob as gb
path = gb.glob('d:\\2\\*')
for path in path:
    print path

2.2,调用os.walk

遍历指定目录下的所有文件和文件夹,递归遍历,功能强大,推荐使用。

import os
for dirpath, dirnames, filenames in os.walk('d:\\2\\'):
    for file in filenames:
        fullpath = os.path.join(dirpath, file)
        print fullpath, file

2.3,自己DIY

遍历指定目录下的所有文件和文件夹,递归遍历,自主编写,扩展性强,可以学习练手。

import os;  
files = list();  
def DirAll(pathName):  
    if os.path.exists(pathName):  
        fileList = os.listdir(pathName);  
        for f in fileList:  
            if f=="$RECYCLE.BIN" or f=="System Volume Information":  
                continue;  
            f=os.path.join(pathName,f);  
            if os.path.isdir(f):     
                DirAll(f);                  
            else:  
                dirName=os.path.dirname(f);  
                baseName=os.path.basename(f);  
                if dirName.endswith(os.sep):  
                    files.append(dirName+baseName);  
                else:  
                    files.append(dirName+os.sep+baseName);  
  
DirAll("D:\\2\\");  
for f in files:  
    print f
    # print f.decode('gbk').encode('utf-8');  

2.4,备注

注意,如果遍历过程中,出现文件名称或文件路径乱码问题,可以查看本文的参考资料来解决。

3,转换Word文件为PDF

通过Windows Com组件(win32com),调用Word服务(Word.Application),实现Word到PDF文件的转换。因此,要求该Python程序需要在有Word服务(可能至少要求2007版本)的Windows机器上运行。

#coding:utf8

import os, sys
reload(sys)
sys.setdefaultencoding('utf8')

from win32com.client import Dispatch, constants, gencache

input = 'D:\\2\\test\\11.docx'
output = 'D:\\2\\test\\22.pdf'

print 'input file', input
print 'output file', output
# enable python COM support for Word 2007
# this is generated by: makepy.py -i "Microsoft Word 12.0 Object Library"
gencache.EnsureModule('{00020905-0000-0000-C000-000000000046}', 0, 8, 4)
# 开始转换
w = Dispatch("Word.Application")
try:
    doc = w.Documents.Open(input, ReadOnly=1)
    doc.ExportAsFixedFormat(output, constants.wdExportFormatPDF, \
                            Item=constants.wdExportDocumentWithMarkup,
                            CreateBookmarks=constants.wdExportCreateHeadingBookmarks)
except:
    print ' exception'
finally:
    w.Quit(constants.wdDoNotSaveChanges)

if os.path.isfile(output):
    print 'translate success'
else:
    print 'translate fail'

4,批量转换

要实现批量准换,将第2步和第3步的功能组合在一起即可,直接上代码。

# -*- coding:utf-8 -*-
# doc2pdf.py: python script to convert doc to pdf with bookmarks!
# Requires Office 2007 SP2
# Requires python for win32 extension

import glob as gb
import sys
reload(sys)
sys.setdefaultencoding('utf8')

'''
参考:http://blog.csdn.net/rumswell/article/details/7434302
'''
import sys, os
from win32com.client import Dispatch, constants, gencache

# from config import REPORT_DOC_PATH,REPORT_PDF_PATH
REPORT_DOC_PATH = 'D:/2/doc/'
REPORT_PDF_PATH = 'D:/2/doc/'

# Word转换为PDF
def word2pdf(filename):
    input = filename + '.docx'
    output = filename + '.pdf'
    pdf_name = output

    # 判断文件是否存在
    os.chdir(REPORT_DOC_PATH)
    if not os.path.isfile(input):
        print u'%s not exist' % input
        return False
    # 文档路径需要为绝对路径,因为Word启动后当前路径不是调用脚本时的当前路径。
    if (not os.path.isabs(input)):  # 判断是否为绝对路径
        # os.chdir(REPORT_DOC_PATH)
        input = os.path.abspath(input)  # 返回绝对路径
    else:
        print u'%s not absolute path' % input
        return False

    if (not os.path.isabs(output)):
        os.chdir(REPORT_PDF_PATH)
        output = os.path.abspath(output)
    else:
        print u'%s not absolute path' % output
        return False

    try:
        print input, output
        # enable python COM support for Word 2007
        # this is generated by: makepy.py -i "Microsoft Word 12.0 Object Library"
        gencache.EnsureModule('{00020905-0000-0000-C000-000000000046}', 0, 8, 4)
        # 开始转换
        w = Dispatch("Word.Application")
        try:
            doc = w.Documents.Open(input, ReadOnly=1)
            doc.ExportAsFixedFormat(output, constants.wdExportFormatPDF, \
                                    Item=constants.wdExportDocumentWithMarkup,
                                    CreateBookmarks=constants.wdExportCreateHeadingBookmarks)
        except:
            print ' exception'
        finally:
            w.Quit(constants.wdDoNotSaveChanges)

        if os.path.isfile(pdf_name):
            print 'translate success'
            return True
        else:
            print 'translate fail'
            return False
    except:
        print ' exception'
        return -1

if __name__ == '__main__':
    # img_path = gb.glob(REPORT_DOC_PATH + "*")
    # for path in img_path:
    #     print path
    #     rc = word2pdf(path)

    # rc = word2pdf('1')
    # print rc,
    # if rc:
    #     sys.exit(rc)
    # sys.exit(0)

    import os
    for dirpath, dirnames, filenames in os.walk(REPORT_DOC_PATH):
        for file in filenames:
            fullpath = os.path.join(dirpath, file)
            print fullpath, file
            rc = word2pdf(file.rstrip('.docx'))

5,参考资料

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容

  • Android 自定义View的各种姿势1 Activity的显示之ViewRootImpl详解 Activity...
    passiontim阅读 173,283评论 25 708
  • 我常常在闲的蛋疼的时候想,我的思维结构是什么样的?这思维会把我带向何处?“他”就像一个独特的生命体,会自我选择,自...
    匡正阅读 171评论 0 0
  • 六月下旬开始,内心就变得异常焦虑。时间在小时候过得很慢,等到毕业后,工作了,时间便飞一般奔跑着。转眼间2017年又...
    索莱耶阅读 276评论 0 8
  • 九十二 枫叶红了吗 谁在上山的路上 谁在下山的路上 九十三 坚持 山近在眼前 放弃 山远在天边 九十四 相恋一片...
    萧路遥阅读 194评论 3 2
  • 首先申明:我谈的并不是心里学上的焦虑症,不专业,只是一点生活感悟而已。 其实你那些莫名的焦躁感都来自于无所事事。或...
    笨学徒阅读 328评论 5 4