python读取pdf格式文档的实现代码

时间:2021-10-15 15:14:42

python读取pdf文档

一、 准备工作

?
1
2
3
安装对应的库
    pip install pdfminer3k
    pip install pdfminer.six

二、部分变量的含义

pdfdocument(pdf文档对象)
pdfpageinterpreter(解释器)
pdfparser(pdf文档分析器)
pdfresourcemanager(资源管理器)
pdfpageaggregator(聚合器)
laparams(参数分析器)

三、pdfminer类之间的关系

python读取pdf格式文档的实现代码

pdfminer的相关文档(点击跳转)

四、代码实现

?
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
#!/usr/bin/env python
# -*- coding:utf-8 -*-
# datetime:2021/3/17 12:12
# software: pycharm
# version: python 3.9.2
 
def changepdftotext(filepath):
 """
 解析pdf 文本,保存到同名txt文件中
 
 param:
 filepath: 需要读取的pdf文档的目录
 introduced module:
 from pdfminer.pdfpage import pdfpage
 from pdfminer.pdfparser import pdfparser
 from pdfminer.pdfinterp import pdfresourcemanager, pdfpageinterpreter
 from pdfminer.converter import pdfpageaggregator
 from pdfminer.layout import laparams
 from pdfminer.pdfdocument import pdfdocument, pdftextextractionnotallowed
 import os.path
 """
 file = open(filepath, 'rb') # 以二进制读模式打开
 # 用文件对象来创建一个pdf文档分析器
 praser = pdfparser(file)
 # 创建一个pdf文档
 doc = pdfdocument(praser, '') # praser :上面创建的pdf文档分析器 ,第二个参数是密码,设置为空就好了
 # 连接分析器 与文档对象
 praser.set_document(doc)
 # 检测文档是否提供txt转换,不提供就忽略
 if not doc.is_extractable:
 raise pdftextextractionnotallowed
 # 创建pdf 资源管理器 来管理共享资源
 rsrcmgr = pdfresourcemanager()
 # 创建一个pdf设备对象
 laparams = laparams()
 device = pdfpageaggregator(rsrcmgr, laparams=laparams)
 # 创建一个pdf解释器对象
 interpreter = pdfpageinterpreter(rsrcmgr, device)
 result = [] # 内容列表
 # 循环遍历列表,每次处理一个page的内容
 for page in pdfpage.create_pages(doc):
 interpreter.process_page(page)
 # 接受该页面的ltpage对象
 layout = device.get_result()
 for x in layout:
  if hasattr(x, "get_text"):
  result.append(x.get_text())
  filenames = os.path.splitext(filepath) # 分割
  # 以追加的方式打开文件
  with open(filenames[0] + '.txt', 'a', encoding="utf-8") as f:
   results = x.get_text()
   # print(results) 这个句可以取消注释就可以在控制台将所有内容输出了
   f.write(results) # 写入文件
 
# 调用示例 :
 
# path = u'e:\\1.pdf'
# changepdftotext(path)

利用pypdf2实现了对pdf文字内容的提取

?
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
from pypdf2 import pdffilereader
 
# 定义获取pdf内容的方法
def getpdfcontent(filename):
  # 获取pdffilereader对象
  pdf = pdffilereader(open(filename, "rb"))
  content = "" #content是输出文本
  for i in range(0,pdf.getnumpages()): #遍历每一页
    pageobj = pdf.getpage(i)
    try:
      extractedtext = pageobj.extracttext()#导出每一页的内容,如果当前页有图片的话就跳过
      content += extractedtext + "\n"
    except baseexception:
      pass
  return content.encode("ascii", "ignore")
 
 
# 将获取的内容写入txt文件
with open("test.txt","w") as f:
  count=0 #count的作用是限制每一行的文字个数,本人设置的是十行
  #将获取的文本变成字符串并用空白隔开
  for item in str(getpdfcontent("test.pdf")).split(" "):
    # 如果当前文字以句号结尾就换行
    if item[-1]==".":
      f.write(item+"\n")
      count=0
    else:
      f.write(item+" ")
      count +=1
    # 如果写了十个字就换行
    if count==10:
      f.write("\n")
      # 重置count
      count = 0

总结

到此这篇关于python读取pdf格式文档的文章就介绍到这了,更多相关python读取pdf文档内容请搜索服务器之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持服务器之家!

原文链接:https://blog.csdn.net/snqfyyzs/article/details/115356431