AI学习中心 / 第8课
零基础课程 · 约20分钟

第8课:AI 图像、视频和语音

学习目标 → 正文 → 示例 → 常见误区 → 小测验 → 实践任务

学习目标

  • 了解图像生成、图像理解、ASR、TTS和多模态
  • 能把视觉任务描述成主体、场景、构图、光线等要素
  • 知道不同模态有不同的数据和质量问题

正文

图像生成

输入文字描述 → 模型生成图像。 需要学会描述: 主体、场景、构图、镜头、光线、风格、比例、不要出现什么。

图像理解

给模型一张图,让它:

  • 描述内容;
  • 识别表格/界面;
  • 分析设计;
  • 提取信息。

视频生成

一般需要:

  • 角色设定;
  • 分镜;
  • 动作;
  • 镜头运动;
  • 时间长度;
  • 前后镜头一致性。

ASR

Automatic Speech Recognition:语音 → 文字。

TTS

Text To Speech:文字 → 语音。

多模态

Multimodal:一个模型同时处理文字、图片、声音甚至视频。

1. 本课要建立的整体认识

图像、视频、语音不是“换一种输入框”,每种模态都有自己的表达单位、质量标准和核验方式。

2. 把核心概念逐层拆开

2.1 图像生成要同时描述主体、场景、构图、镜头、光线、风格、比例以及明确排除项。

图像生成要同时描述主体、场景、构图、镜头、光线、风格、比例以及明确排除项。

2.2 图像理解要区分“画面中可见事实”和“根据画面作出的推断”

图像理解要区分“画面中可见事实”和“根据画面作出的推断”,模糊文字、遮挡和小目标都可能导致错误。

2.3 视频任务应先写脚本和分镜

视频任务应先写脚本和分镜,再控制镜头、动作、时长、转场和角色一致性。

2.4 ASR把语音转文字

ASR把语音转文字,TTS把文字合成语音;专业术语、人名、数字和噪声环境都需要校对。

2.5 多模态工作流常把识别、生成、编辑和人工审查组合起来

多模态工作流常把识别、生成、编辑和人工审查组合起来,而不是期待一个模型一次完成全部。

3. 把概念串成一条完整流程

制作一分钟科普视频时,先确定受众和核心信息,再写口播稿、拆分镜、生成或拍摄素材、制作配音、添加字幕,最后检查事实、文字、人物一致性、版权和平台规格。

4. 用真实场景理解

为大学生竞赛项目制作展示视频时,AI可以辅助脚本、示意图、配音和字幕,但实验画面、数据、获奖信息与团队贡献必须真实,不能用生成素材冒充实际完成的成果。

5. 学习时应该怎样判断自己是否真正理解

不要只看自己是否“听过”这些词。请尝试不用原文,向一位没有技术背景的人解释本课概念;再画出关系或流程;最后换一个与你专业相关的例子。如果无法说明输入、处理、输出、依据和风险,就说明还停留在名词记忆阶段。

遇到模型、工具或规则变化时,优先保留这里学到的判断框架:先定义任务,再确认资料与边界,随后执行、测试和核验。具体品牌和界面会变化,但这种工作方法可以持续使用。

6. 本课小结

本课不是要求一次记住全部细节,而是建立一个能够继续扩展的知识框架。完成正文后,请结合后面的示例、测验和实践任务,把理解转化成自己的语言和可检查的成果。

7. 进一步拆解:从“知道名词”到“会做判断”

学习技术概念时,最容易出现的问题是记住了定义,却不知道什么时候使用,也不知道怎样发现错误。下面逐项使用同一组问题检查理解:

  • 图像生成要同时描述主体、场景、构图、镜头、光线、风格、比例以及明确排除项。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 图像理解要区分“画面中可见事实”和“根据画面作出的推断”:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 视频任务应先写脚本和分镜:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • ASR把语音转文字:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 多模态工作流常把识别、生成、编辑和人工审查组合起来:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。

8. 建立自己的操作检查表

第一张是“任务表”:写清服务对象、目标、已有材料、最终交付物和完成标准。第二张是“数据与来源表”:记录每项材料从哪里来、何时获得、是否允许使用、是否需要更新。第三张是“执行表”:把任务拆成可以观察状态的步骤,标明每一步的输入、处理、输出和失败提示。第四张是“核验表”:列出必须人工检查的事实、数字、引用、权限、安全和专业边界。

这四张表适用于本课所讲的大多数任务。它们能防止把“模型给出了结果”误认为“工作已经完成”,也能帮助团队在出现问题时迅速定位到底是需求不清、资料错误、流程中断,还是输出没有经过验证。

9. 与前后课程的关系

这套20课不是彼此孤立的知识点。本课涉及的概念,需要与Prompt中的任务说明、API与软件系统中的执行链、RAG中的资料依据、数据分析中的质量检查以及AI安全中的责任边界结合起来。学习时可以不断回到一个问题:如果把这个概念放进完整AI产品,它位于哪一层,会影响谁,又需要谁来检查?

10. 课后自查

  1. 我能否不用术语堆砌,用自己的话解释本课核心关系?
  2. 我能否画出一个包含输入、处理、输出和核验的流程?
  3. 我能否举出一个与自己专业、学习或工作有关的实例?
  4. 我能否说出至少两个容易犯的错误,以及怎样提前发现?
  5. 我能否把本课方法用于一个真实任务,并留下可检查的成果?

示例

示例1:AI海报

为大学比赛生成海报时,明确主题、主视觉、色彩、版式、文字区域和尺寸。

结论:视觉生成也需要结构化需求。

示例2:语音转文字

将课堂录音通过ASR变成文字,再用AI整理笔记。

结论:语音识别与语言模型可以组合成工作流。

常见误区

  • “多模态就是多开几个聊天窗口。”——多模态指模型处理不同信息形式。
  • “AI图片里的文字一定准确。”——图像模型可能生成错误文字。
  • “ASR转写结果不用校对。”——专业术语、人名和噪声环境容易识别错。

小测验

点击题目查看答案。

1. ASR 指什么?
  1. A. 自动语音识别
  2. B. 自动图片生成
  3. C. 应用服务器路由
  4. D. 高级搜索规则
答案:A

ASR = Automatic Speech Recognition,语音转文字。

2. TTS 指什么?
  1. A. 文本转语音
  2. B. 表格转数据库
  3. C. 图像转代码
  4. D. 域名转IP
答案:A

TTS = Text To Speech。

3. Multimodal 最接近什么含义?
  1. A. 只处理文字
  2. B. 能处理多种信息模态,如文字、图片、音频等
  3. C. 多台服务器
  4. D. 多用户账号
答案:B

多模态表示系统可同时处理不同信息形式。

实践任务

设计一个多模态学习流程

设计“课堂录音→文字→笔记→知识点测验”的流程,标明每一步可能使用的AI能力。

提交物:4步以上流程。

完成标准

  • 包含ASR
  • 包含文本整理
  • 包含核验或校对环节