[S] SCROLL+Read. Earn. Evolve.
Google Play
返回博客

Android 上的扫描 PDF 与文本 PDF:快速、实用的测试

两个文件都可以以 .pdf 结尾,并且在手机上的行为完全不同。其中,每个单词都存储为文本。在另一种情况下,每一页可能只是一张照片。这种差异决定了文本是否可以调整大小以适合您的屏幕,或者您是否需要查看原始页面。本指南向您展示如何在花时间进行故障排除之前识别每种类型。

简短回答

尝试选择一个句子或搜索您可以看到的单词。如果两者都有效,则 PDF 可能有一个可用的文本层。如果两者都不起作用,则它可能是扫描的或仅包含图像的 PDF。在 Scroll+ 中,对于基于文本的文档使用 智能提取 对于基于文本的文档,使用 原始(学术) 对于扫描件、图表、表格或页面,其确切内容布局很重要。提取质量仍然因文件而异。

1. 什么是基于文本的 PDF?

基于文本的 PDF 将字母和单词存储为可选择的内容。它可能是从文字处理器、出版工具或数字文档系统导出的。在 Android 上,您通常可以按住并拖动句子、复制它或通过搜索找到它。这些是有用的线索,但不是完美的证据:权限、不寻常的字体或损坏的文件仍然可以阻止选择。

当文本层可用时,Scroll+ 可以在您的设备上准备该文本并将其包裹到手机的宽度。对于小说、报告和其他大多数线性文档来说,这是更好的起点。在为格式复杂的文档选择模式之前,请先阅读 PDF 重排与原始页面视图

2. 什么是扫描版或纯图像 PDF?

扫描的 PDF 包含页面图片。您可以看到打印的文字,但文件可能不包含这些文字作为机器可读的文本。复印的书、拍照的收据或旧档案扫描通常都是这样。使图像更清晰不会创建文本层,并且普通的文本提取无法可靠地将图像转换为段落。

Scroll+ 不承诺将纯图像页面转换为文本。如果提取几乎没有产生任何单词,应用程序可以识别低文本产量并将书籍切换到 原始(学术) 模式,而不是留下空的阅读视图。原始页面仍然可见,但您可能需要在小屏幕上缩放和平移。

3.在Android上运行这三项检查

首先,长按一个明确的句子,看看是否可以选择单个单词。其次,搜索页面上打印的独特单词。第三,近距离放大:纯图像文本通常会变得明显像素化,而数字渲染的文本通常保持清晰。使用多个测试,因为混合 PDF 可以包含真实文本和扫描页面。

您还可以导入文件并让 Scroll+ 测试实际结果。请遵循 Android PDF 和 EPUB 导入指南。处理过程在您的手机上进行,因此较长或密集的文档在较旧或内存较低的设备上可能会花费更多时间。

4. 为什么有些 PDF 同时具有两种特征

并非所有文档都适合清洁标签。 PDF 可能有一个数字目录,后跟扫描的章节,或者带有作为图像嵌入的图表的可选正文文本。多栏论文、脚注、数学符号、异常编码和旋转页面也可能会产生错误顺序的文本。因此,成功的选择测试并不能保证完美的回流焊。

根据您必须保留的内容选择模式。如果不间断的正文文本最重要,请尝试智能提取。如果页码、图形、方程或空间关系有意义,请选择 原始(学术)。您可以保留源 PDF 并改变您的方法,而不是强迫每个文档采用相同的阅读风格。

5. Scroll+ 对每种类型的作用

Scroll+ 存储 PDF 并在您的设备上执行 PDF 处理。基于文本的文件可以准备为可重排的阅读内容。扫描或低文本文件可以回退到原始页面视图。在此过程中不会上传书籍文件,并且核心阅读不需要帐户。

Scroll+ 0.9.0 中改进了扫描文件后备功能; 0.9.0 发行说明 解释了检测和后台队列。此后备可以保护可读性,但不能保证每个格式错误、加密或异常大的 PDF 都能成功打开。

选择与文档匹配的模式

文本 PDF 通常更适合手机阅读布局。扫描的 PDF 在其原始页面视图中通常更安全。首先测试选择和搜索,然后考虑布局或可调整文本是否更重要。这个简单的决定避免了人们将大部分挫败感归咎于 PDF 阅读器本身。

尝试 Scroll+ 中的两种 PDF 阅读路径

从 Android 设备导入 PDF,选择 智能提取 或 原始(学术),然后在手机上保留图书文件和处理。

📱 在 Google Play 上获取 Scroll+