有时候我们想提取PDF中的文本不得不借助一些转化软件,本次教程给大家介绍一下如何简单从pdf文件中提取文本的R包。- 安装R包: install.packages("pdftools")。
- 当然如果在Windows以外的环境安装需要部署 poppler 环境。命令:
Debian/ubuntu下: sudo apt-get installlibpoppler-cpp-dev
CentOS: sudo yum installpoppler-cpp-devel
Mac OS-X: brew install poppler
- 开始使用: library(pdftools)。
- 读取文本的命令: txt=pdf_txt(“文件路径”)。
- 获取每页的内容,命令:txt[n] 获取第n页的内容。
- 获取pdf文件目录: doc=pdf_toc(“文件路径”)。
- 当然doc变量中的目录还不是标准化的格式,那么我们需要一个通用json格式,需要安装R包jsoblite。文本转换命令:json=toJSON(toc, auto_unbox = TRUE, pretty = TRUE)。再利用函数fromJSON(json),我们就会把目录转化成为向量。也就拿到了文档的整个目录。
综上步骤,我们便可以随便获取任意章节的任意内容。那么接下来就是对这些文字的应用,各位集思广益吧。