• 技术文章 >常见问题 >Python常见问题

    pdf如何用python读取?

    yangyang2020-05-28 16:00:37原创2738

    python中可以使用pdfminer库来读取PDF文件中的内容。

    安装命令:

    pip install pdfminer
    pip install pdfminer3k

    python中读取PDF文件代码:

    from urllib.request import urlopen
    from pdfminer.pdfinterp import PDFResourceManager, process_pdf
    from pdfminer.converter import TextConverter
    from pdfminer.layout import LAParams
    from io import StringIO
    from io import open
    
    def readPDF(pdfFile):
        rsrcmgr = PDFResourceManager()
        retstr = StringIO()
        laparams = LAParams()
        device = TextConverter(rsrcmgr, retstr, laparams=laparams)
    
        process_pdf(rsrcmgr, device, pdfFile)
        device.close()
    
        content = retstr.getvalue()
        retstr.close()
        return content
    
    pdfFile = urlopen("http://pythonscraping.com/pages/warandpeace/chapter1.pdf")
    outputString = readPDF(pdfFile)
    print(outputString)
    pdfFile.close()

    解析pdf文件用到的类:

    PDFParser:从一个文件中获取数据

    PDFDocument:保存获取的数据,和PDFParser是相互关联的

    PDFPageInterpreter处理页面内容

    PDFDevice将其翻译成你需要的格式

    PDFResourceManager用于存储共享资源,如字体或图像。

    更多Python知识请关注Python自学网

    专题推荐:python
    上一篇:python map()函数怎么用? 下一篇:python 3.3使用print输出保语法错误是什么原因?

    相关文章推荐

    • python里面的函数是什么意思?• python怎么导入图片?• python括号代表什么意思?• python输出格式化什么意思?

    全部评论我要评论

    © 2021 Python学习网 苏ICP备2021003149号-1

  • 取消发布评论
  • 

    Python学习网