ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

python 读取pdf中的文本

2026/8/25 19:31:43 拓冰建站 浏览量
python 读取pdf中的文本

摘要

常常需要针对pdf进行文本分析,以下给出了两种方法用来读取pdf中的文字

方法一 pypdf2

pip install PyPDF2

import PyPDF2
filename = 'xxx.pdf'with open(filename, 'rb') as file:# 创建一个PDF阅读器对象reader = PyPDF2.PdfReader(file)# 遍历PDF中的每一页for page_num in range(len(reader.pages)):# 获取当前页面的文本内容text = reader.pages[page_num].extract_text()print(text)

方法二 langchain

pip install pypdf

def pdf_load(filename):# pip install pypdffrom langchain.document_loaders import PyPDFLoaderloader = PyPDFLoader(filename)return loader.load_and_split()res = pdf_load(filename)
print(res)

两种方法得到的结果,都在原文中出现了很多换行符。

输出如下:

双随机

一公开

食品药品市场监管机制

建立完善旗县






苏木乡镇食