• 技术文章 >常见问题 >Python常见问题

    pdf如何用python读取?

    yangyang2020-05-28 16:00:37原创2955

    python中可以使用pdfminer库来读取PDF文件中的内容。

    安装命令:

    1

    pip install pdfminer

    1

    pip install pdfminer3k

    python中读取PDF文件代码:

    1

    2

    3

    4

    5

    6

    7

    8

    9

    10

    11

    12

    13

    14

    15

    16

    17

    18

    19

    20

    21

    22

    23

    24

    from urllib.request import urlopen

    from pdfminer.pdfinterp import PDFResourceManager, process_pdf

    from pdfminer.converter import TextConverter

    from pdfminer.layout import LAParams

    from io import StringIO

    from io import open

     

    def readPDF(pdfFile):

        rsrcmgr = PDFResourceManager()

        retstr = StringIO()

        laparams = LAParams()

        device = TextConverter(rsrcmgr, retstr, laparams=laparams)

     

        process_pdf(rsrcmgr, device, pdfFile)

        device.close()

     

        content = retstr.getvalue()

        retstr.close()

        return content

     

    pdfFile = urlopen("http://pythonscraping.com/pages/warandpeace/chapter1.pdf")

    outputString = readPDF(pdfFile)

    print(outputString)

    pdfFile.close()

    解析pdf文件用到的类:

    PDFParser:从一个文件中获取数据

    PDFDocument:保存获取的数据,和PDFParser是相互关联的

    PDFPageInterpreter处理页面内容

    PDFDevice将其翻译成你需要的格式

    PDFResourceManager用于存储共享资源,如字体或图像。

    更多Python知识请关注Python自学网

    专题推荐:python
    上一篇:python map()函数怎么用? 下一篇:python 3.3使用print输出保语法错误是什么原因?

    相关文章推荐

    • python里面的函数是什么意思?• python怎么导入图片?• python括号代表什么意思?• python输出格式化什么意思?

    全部评论我要评论

    © 2021 Python学习网 苏ICP备2021003149号-1

  • 取消发布评论
  • 

    Python学习网