AI学习中心 / 第14课
零基础课程 · 约25分钟

第14课:PDF、Word、Excel、CSV、JSON 为什么不一样?

学习目标 → 正文 → 示例 → 常见误区 → 小测验 → 实践任务

学习目标

  • 理解PDF、DOCX、XLSX、CSV、JSON的差异
  • 知道固定版式、结构化数据和程序数据的不同
  • 理解为什么AI处理扫描件常需要OCR

正文

PDF

适合固定版式展示,不一定方便提取结构。

DOCX

Word 常用格式,里面包含段落、样式、表格、图片等结构。

XLSX

Excel 工作簿格式,可以有多个工作表、公式、单元格格式。

CSV

本质是文本表格。简单、通用,但不保存复杂格式和多个工作表。

JSON

程序最喜欢的一类结构化文本格式之一。

例如: { "name": "CampusAI", "version": "0.5" }

为什么AI处理文件有时会出错?

因为“看到页面”和“真正理解文档结构”是两件事。 扫描件可能还需要 OCR。 表格、公式、图片、页眉页脚也可能需要专门解析。

1. 本课要建立的整体认识

文件格式决定信息怎样组织。页面看起来相似,不代表程序能够用同一种方式读取、编辑和验证。

2. 把核心概念逐层拆开

2.1 PDF重视固定版式

PDF重视固定版式,可能包含真实文本、扫描图片、字体与坐标信息,提取时容易丢失阅读顺序。

2.2 DOCX包含段落、样式、表格、批注等结构

DOCX包含段落、样式、表格、批注等结构,适合编辑,但复杂排版仍需渲染检查。

2.3 XLSX是工作簿容器

XLSX是工作簿容器,包含工作表、单元格、公式、格式和图表;CSV只是简单文本表格。

2.4 JSON以键和值表达层级结构

JSON以键和值表达层级结构,适合程序交换数据,但不适合直接呈现复杂排版。

2.5 OCR只是把图像中的字识别出来

OCR只是把图像中的字识别出来,仍可能出现错字、漏行、表格错位,需要校对。

3. 把概念串成一条完整流程

处理文件前先识别格式和任务:是阅读、编辑、提取表格、保留版式还是数据交换;随后选择解析方法,检查文字、表格、图片和公式,最后验证输出文件是否可打开且内容完整。

4. 用真实场景理解

把Excel另存为CSV后,多个工作表、公式和颜色不会被完整保留;把扫描PDF直接当文本检索,也可能什么都搜不到。正确的格式意识能避免大量“AI读错文件”的问题。

5. 学习时应该怎样判断自己是否真正理解

不要只看自己是否“听过”这些词。请尝试不用原文,向一位没有技术背景的人解释本课概念;再画出关系或流程;最后换一个与你专业相关的例子。如果无法说明输入、处理、输出、依据和风险,就说明还停留在名词记忆阶段。

遇到模型、工具或规则变化时,优先保留这里学到的判断框架:先定义任务,再确认资料与边界,随后执行、测试和核验。具体品牌和界面会变化,但这种工作方法可以持续使用。

6. 本课小结

本课不是要求一次记住全部细节,而是建立一个能够继续扩展的知识框架。完成正文后,请结合后面的示例、测验和实践任务,把理解转化成自己的语言和可检查的成果。

7. 进一步拆解:从“知道名词”到“会做判断”

学习技术概念时,最容易出现的问题是记住了定义,却不知道什么时候使用,也不知道怎样发现错误。下面逐项使用同一组问题检查理解:

  • PDF重视固定版式:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • DOCX包含段落、样式、表格、批注等结构:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • XLSX是工作簿容器:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • JSON以键和值表达层级结构:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • OCR只是把图像中的字识别出来:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。

8. 建立自己的操作检查表

第一张是“任务表”:写清服务对象、目标、已有材料、最终交付物和完成标准。第二张是“数据与来源表”:记录每项材料从哪里来、何时获得、是否允许使用、是否需要更新。第三张是“执行表”:把任务拆成可以观察状态的步骤,标明每一步的输入、处理、输出和失败提示。第四张是“核验表”:列出必须人工检查的事实、数字、引用、权限、安全和专业边界。

这四张表适用于本课所讲的大多数任务。它们能防止把“模型给出了结果”误认为“工作已经完成”,也能帮助团队在出现问题时迅速定位到底是需求不清、资料错误、流程中断,还是输出没有经过验证。

9. 与前后课程的关系

这套20课不是彼此孤立的知识点。本课涉及的概念,需要与Prompt中的任务说明、API与软件系统中的执行链、RAG中的资料依据、数据分析中的质量检查以及AI安全中的责任边界结合起来。学习时可以不断回到一个问题:如果把这个概念放进完整AI产品,它位于哪一层,会影响谁,又需要谁来检查?

10. 课后自查

  1. 我能否不用术语堆砌,用自己的话解释本课核心关系?
  2. 我能否画出一个包含输入、处理、输出和核验的流程?
  3. 我能否举出一个与自己专业、学习或工作有关的实例?
  4. 我能否说出至少两个容易犯的错误,以及怎样提前发现?
  5. 我能否把本课方法用于一个真实任务,并留下可检查的成果?

示例

示例1:CSV与Excel

CSV适合简单数据交换,但不保存多个工作表、复杂样式和公式格式。

结论:文件扩展名反映不同的数据组织能力。

示例2:扫描PDF

有的PDF页面本质是图片,需要OCR才能把文字变成可检索文本。

结论:“能看到文字”不等于“程序已有文字结构”。

常见误区

  • “所有PDF都有可复制文字。”——扫描PDF可能只有图像。
  • “CSV和XLSX完全一样。”——CSV更简单,不保留复杂工作簿特性。
  • “JSON只能给JavaScript用。”——它是广泛使用的数据交换格式。

小测验

点击题目查看答案。

1. 哪种格式最常用于简单表格数据交换且本质接近文本?
  1. A. CSV
  2. B. PSD
  3. C. MP4
  4. D. EXE
答案:A

CSV是简单的文本表格格式。

2. JSON 最常见的用途之一是什么?
  1. A. 程序之间交换结构化数据
  2. B. 打印照片
  3. C. 录制声音
  4. D. 压缩硬盘
答案:A

JSON是广泛使用的结构化数据格式。

3. 为什么扫描PDF常需要OCR?
  1. A. 因为页面可能是图像而不是可直接读取的文本结构
  2. B. 因为PDF没有页面
  3. C. 因为OCR能提高网速
  4. D. 因为JSON太大
答案:A

OCR把图片中的文字识别成可处理文本。

实践任务

文件格式选择

为“课程论文、调查数据、API返回结果、扫描合同”分别选择合适的主要格式/处理方式,并解释原因。

提交物:4项选择与理由。

完成标准

  • 区分文档与数据
  • 扫描件提到OCR
  • API数据提到JSON或结构化格式