1. 导论:迎接“生成”时代——为何AIGC是当代通识教育的核心

1.1. AIGC的定义与范畴:超越“人工智能”,理解“内容生成”

人工智能生成内容(Artificial Intelligence Generated Content, AIGC)标志着人机交互与内容创作领域的一次范式革命。要准确把握其教育价值,首先必须将其与广义的人工智能(AI)概念进行区分。传统AI,尤其是分析型AI,主要聚焦于识别、分类、预测和优化现有数据。而AIGC的核心特质在于其“生成性”——它并非简单地分析数据,而是学习数据底层的分布与模式,进而创造出与训练数据相似但全新的、原创性的数据点 (1)。这一范畴涵盖了文本、图像、音频、视频乃至代码等多种模态,其代表性模型包括百度的文心一格、阿里巴巴的通义万相,以及国外的Midjourney和OpenAI的DALL-E系列等 (35)。

将AIGC置于通识教育的中心,是因为它正在重塑信息、知识与创造力的生产与传播方式。它不再仅仅是一个技术工具,更演变为一种全新的表达与沟通媒介。当学生能够通过简单的文本指令生成一幅堪比艺术品的画作,或撰写一篇结构严谨的论文初稿时,他们所接触的已非单纯的软件应用,而是一种深刻影响认知、表达和创造过程的新兴力量。因此,本课程的设计目标并非培养AI技术专家,而是要让学生理解这一变革的本质,掌握与之有效协作的能力,并对其带来的深远影响形成批判性认知。

1.2. 课程设计理念:培养批判性使用者与负责任的创造者

面对AIGC这一强大的技术,通识教育的核心任务是培养学生的“生成素养”(Generative Literacy)。这是一种超越传统读写能力和数字素养的新型能力。历史上,印刷术的普及要求人们掌握读写文本的能力;互联网时代则催生了数字素养,即有效导航和审慎评估海量信息的能力。如今,AIGC时代要求我们具备一种全新的素养:不仅能消费信息,更能与非人类智能系统协同创造。这种协同关系要求两种核心技能:一是“生成式写作”,即通过精准的提示词工程(Prompt Engineering)引导和控制AI的输出;二是“生成式阅读”,即对AI生成的内容进行审慎的评估,辨别其中可能存在的偏见、谬误和虚假信息。

基于此,本课程的设计理念确立为培养“批判性使用者”与“负责任的创造者”。这一理念通过一个三位一体的教学方法得以实现:

  1. 技术祛魅(Demystification):打破AIGC技术的“黑箱”,通过直观的类比和核心原理讲解,使学生理解其工作机制并非魔法,而是一系列可理解的数学与工程过程。这有助于消除学生对技术的盲目崇拜或无端恐惧。

  2. 实践流畅(Fluency):通过大量的动手实践,培养学生与AIGC工具进行高效对话的能力。这包括掌握提示词的构建技巧、理解关键参数的调节作用,以及探索不同工具的应用边界。目标是让学生能够自如地将AIGC作为提升学习与创造效率的辅助工具。

  3. 伦理思辨(Critique):引导学生深入探讨AIGC带来的复杂社会议题。课程将系统性地剖析其在著作权、算法偏见、信息茧房、深度伪造等方面的挑战,旨在培养学生的伦理敏感度和法律意识,使他们在使用和创造的过程中,能够预见并规避潜在的负面影响 (3)。

这套课程理念将AIGC教育从一个纯粹的技术培训,提升为关乎现代公民素养和数字伦理的基础教育,其重要性不亚于大学新生的写作课或逻辑学课程。

1.3. 学习路径图:本指南的结构与教学模块概览

为实现上述教学理念,本指南构建了一个循序渐进的五模块学习路径。这一结构旨在引导学生从理解底层原理,到掌握实践技能,再到探索前沿应用,最终形成深刻的伦理反思。其逻辑 progression 如下:从理解引擎的工作原理,到学习如何驾驶,再到探索未知的地形,展望未来的交通工具,最后共同探讨并制定道路规则。

  • 模块一:解构魔法——AIGC的核心技术原理。本模块聚焦于当前图像生成领域最核心的扩散模型(Diffusion Models),解释其从随机噪声生成高清图像的科学原理。

  • 模块二:对话的艺术——精通AIGC的交互与控制。本模块深入讲解提示词工程,将其视为一种与AI进行结构化沟通的艺术,并介绍关键参数的调节方法,帮助学生实现对生成结果的精准控制。

  • 模块三:拓展画布——从图像编辑到视频生成的应用前沿。本模块将视野从静态图像拓展到动态视频,介绍国内外主流文生视频模型,并探讨AIGC在图像修复、扩展及各行各业中的颠覆性应用。

  • 模块四:超越生成——迈向自主与可信的未来AI。本模块展望AIGC的未来演进方向,重点介绍检索增强生成(RAG)技术如何提升AI的真实性,以及AI智能体(AI Agents)如何从内容生成器进化为任务执行者。

  • 模块五:驾驭新大陆——AIGC的法律、伦理与社会挑战。本模块是课程的思辨核心,将重点梳理中国在AIGC领域的法律实践与监管框架,并结合全球视野,引导学生构建负责任的技术伦理观。

通过这一完整的学习路径,学生将构建起一个关于AIGC的全面知识框架,不仅知其然,更知其所以然,并为其所以用、所以防。

  1. 模块一:解构魔法——AIGC的核心技术原理

2.1. 扩散模型(Diffusion Models):从噪声到杰作的艺术

扩散模型是当前最先进的生成模型之一,构成了如文心一格、通义万相以及国外的Stable Diffusion、Midjourney等主流图像生成工具的技术基石 (35)。其核心思想源于非平衡热力学,通过模拟一个可逆的物理过程来实现图像的生成 (2)。这个过程的精妙之处在于,它将一个极其困难的直接生成问题(从无到有创造一幅复杂的图像)分解为一系列微小、可控的步骤,从而极大地提升了生成图像的质量和稳定性,超越了早期的生成对抗网络(GANs)等架构 (2)。

2.1.1. 前向过程与反向过程:有序地“破坏”与创造性地“恢复”

扩散模型的工作流程包含两个互逆的核心过程:前向扩散过程(Forward Diffusion Process)和反向扩散过程(Reverse Diffusion Process)。

前向扩散过程是一个系统性的“破坏”过程。它从一张清晰的训练图像开始,在连续的多个时间步(Timesteps, 通常记为)中,逐步向图像中添加微量的高斯噪声(Gaussian noise)(6)。每一步添加的噪声都非常微小,但经过数百乃至上千步的累积,原始图像的结构和信息会逐渐被侵蚀,最终完全变成一张纯粹的、无规律的随机噪声图像,如同电视雪花 (2)。这个过程是固定的、无需学习的,其数学模型可以精确描述。例如,线性调度(linear schedule)会均匀地增加噪声,而余弦调度(cosine schedule)则提供更平滑的退化过程,有助于模型取得更好的性能 (6)。

反向扩散过程则是创造性的“恢复”过程,也是模型需要通过深度学习掌握的核心能力。训练完成后,模型从一张与训练数据维度相同的随机高斯噪声图像出发,尝试一步步地逆转前向过程 (1)。在每一个时间步,模型(通常是一个U-Net结构的神经网络)会预测并移除图像中对应部分的噪声,从而将图像从状态恢复到稍微清晰一点的$x_{t-1}$状态 (6)。这个去噪步骤被迭代执行$T$次,每一次都让图像变得更加清晰、更有结构,直到最终从完全的随机噪声中“雕琢”出一幅全新的、连贯的、高质量的图像 (7)。

2.1.2. 技术直觉:从物理学扩散到“在云中识别人脸”的类比

为了让非技术背景的学生直观地理解这一抽象过程,可以运用两个生动的类比。

第一个是物理学类比。想象一滴墨水滴入一杯清水中,墨水分子会随着时间的推移随机运动,最终均匀地扩散到整杯水中,这是一个熵增的、从有序到无序的过程 (2)。这正对应了前向扩散过程。而扩散模型的反向过程,就如同拥有一台能够记录并逆转每一个墨水分子运动轨迹的“时间机器”,从一杯均匀的墨水中,将所有分子重新汇聚成最初的那一滴墨水。模型学习的正是这种“逆转时间”的规律。

第二个是更富想象力的认知心理学类比:“在云朵中识别人脸” (3)。当我们仰望天空,看到一团随机形状的云时,我们的大脑会不自觉地寻找熟悉的模式,并可能“看”出一张人脸、一只动物的轮廓。这个过程与扩散模型的生成过程惊人地相似。模型从一团随机噪声(云朵)开始,其庞大的训练数据使其对世界上各种事物的“样貌”(如人脸、猫、桌子)形成了深刻的“认知”。在反向去噪的每一步,模型都在这片混沌中寻找并强化那些最符合其“认知”的模式,逐步将噪声细化、重塑,直到一个清晰的图像(人脸)浮现出来 (3)。从这个角度看,AIGC的过程可以被理解为一种机器的“想象力”或“联想”,它在被训练去识别万事万物之后,学会了在随机性中“梦见”这些事物。

这一认知类比也解释了扩散模型的优势与缺陷。对于训练数据中常见且结构清晰的物体(如人脸),模型有非常强的先验知识,因此生成效果极佳。但对于结构复杂或训练数据中不一致的物体(如人手),模型的“认知”较为模糊,在去噪过程中容易“犯错”,从而产生多余的手指等常见问题。同样,当提示词中包含两个不常见的概念时,模型可能会将它们融合为一个混合体,例如“a giraffe and an elephant”可能会生成一个长颈鹿-大象的混合生物,而不是两种独立的动物 (7)。这些所谓的“错误”并非随机故障,而是模型基于其统计学习经验的逻辑推断结果,深刻揭示了其工作原理的本质。

2.2. 模型的“眼睛”与“大脑”:CLIP、U-Net与训练过程

扩散模型的强大能力不仅来自于其核心的去噪思想,还依赖于几个关键的架构组件协同工作,其中最重要的是负责理解文本的CLIP模型和负责图像处理的U-Net网络。

2.2.1. 理解文本与图像的连接:CLIP的角色

用户如何通过一段简单的文本(即提示词)来控制生成图像的内容?这背后的桥梁是像CLIP(Contrastive Language-Image Pre-training)这样的多模态模型 (1)。CLIP通过在海量“图像-文本对”数据上进行训练,学会了将文本描述和对应的图像内容映射到一个共享的数学空间,即“潜在空间”(latent space)中 (1)。

在这个空间里,文本“一只宇航员在月球上骑马”的向量表示,会与一张真实描绘该场景的图像的向量表示在数学上非常接近。当用户输入一个提示词时,CLIP首先将其转换为一个向量。在反向扩散的每一步,这个文本向量就像一个“指南针”或“引力源”,引导着U-Net网络的去噪方向 (7)。U-Net在移除噪声时,会倾向于使中间生成的图像在潜在空间中不断靠近这个目标文本向量。正是通过这种“条件化”(conditioning)机制,扩散模型实现了从纯粹的随机图像生成到受文本精确控制的定向内容生成 (6)。除了文本,这种条件化机制还可以应用于其他输入,如边界框(用于布局生成)、掩码图像(用于图像修复)或低分辨率图像(用于超分辨率)(7)。

2.2.2. 训练目标:模型如何学会“去噪”

扩散模型的训练过程在概念上异常简洁。其核心目标是训练一个神经网络(通常是U-Net架构),使其能够精确地预测在前向过程中添加到图像里的噪声 (3)。

具体的训练步骤如下:

  1. 从训练数据集中随机抽取一张清晰图像 。

  2. 随机选择一个时间步 (代表噪声水平)。

  3. 根据前向扩散过程的公式,计算出在 时刻对 添加噪声后得到的噪声图像 。

  4. 将噪声图像 和时间步 作为输入,送入U-Net模型。

  5. 要求模型预测在第3步中被添加到 上的原始噪声 。

  6. 计算模型预测的噪声与实际添加的噪声之间的差异,这个差异被称为“损失”(loss),通常使用均方误差(Mean Squared Error)来衡量。

  7. 通过反向传播算法调整U-Net网络的内部参数,以最小化这个损失。

这个过程会在数亿张图像上重复数百万次 (1)。通过不断地“看”噪声图像并尝试还原噪声,模型逐渐成为了一个高效的去噪专家 (3)。训练完成后,在生成新图像时,模型就利用这个学到的能力,从一个随机噪声样本开始,迭代地预测并减去它认为存在的噪声,最终恢复出一幅清晰的图像 (2)。整个训练过程的目标函数是最大化训练数据的对数似然,这等价于最小化变分下界(Variational Lower Bound, VLB)(2)。

2.3. 实践活动建议:可视化扩散过程的教学工具

为了将上述理论知识转化为直观体验,强烈建议在课程中设置实践环节。可以利用国内主流的AIGC创作平台,如百度的文心一格或阿里巴巴的通义万相,这些平台通常提供网页版,便于学生直接上手 (35)。同时,也可以介绍基于开源模型的工具,如Stable Diffusion Web UI (1)。

一个有效的教学活动是,让学生设置一个较长的推理步数(例如50步),然后生成一张图像。许多工具可以输出每一步的中间结果。学生将能亲眼看到,一张完全随机的噪声图如何在50个步骤内,逐渐浮现出轮廓、色彩和细节,最终形成一幅清晰的图像。这种可视化的体验,能够极大地加深学生对扩散模型“从混沌到有序”这一核心思想的理解,将抽象的数学过程转化为一个引人入胜的创作奇迹。

  1. 模块二:对话的艺术——精通AIGC的交互与控制

3.1. 提示词工程(Prompt Engineering)入门

如果说扩散模型是AIGC的引擎,那么提示词工程就是驾驶这台强大引擎的方向盘和油门。它是一门关于如何构建有效输入(提示词)以引导AI模型产生期望输出的学问。与其说它是一门精确的科学,不如说它更像一门需要经验、直觉和不断实践的艺术 (8)。精通提示词工程,意味着学习AI模型的“语言”,理解其“思维”方式,从而实现从被动接受生成结果到主动控制创作过程的转变。

3.1.1. 提示词的基本构成:主体、风格与框架

一个结构良好的图像生成提示词通常包含三个核心组件,这为初学者提供了一个清晰的构建框架 (7)。

  1. 主体(Subject):这是提示词的核心,描述了你希望生成图像的主要内容。它可以是任何你能想象到的事物,从“一只戴着宇航员头盔的猫”到“一座悬浮在云端的未来主义城市”。主体的描述越具体、越生动,生成的结果就越可能符合预期。

  2. 风格(Style):这是为图像注入艺术感和氛围的关键。风格可以从多个维度进行定义,包括光照(如“电影级光照”、“黄金时刻”)、艺术流派或艺术家影响(如“印象派风格”、“模仿梵高的笔触”)、主题或情绪(如“赛博朋克”、“神秘的”、“宁静的”)以及时期(如“维多利亚时代”)(1)。

  3. 框架(Frame):这定义了图像的媒介类型或呈现形式。常见的框架包括“照片”、“数码插画”、“油画”、“铅笔素描”、“单线画”等 (7)。指定框架能直接影响最终图像的质感和整体外观。例如,将框架从默认的“照片”修改为“宝丽来照片”,模型不仅会模仿宝丽来相机的色彩和颗粒感,甚至可能生成带有标志性白色边框的图像 (7)。

一个典型的结构化提示词可能如下所示:“一张宝丽来照片(框架),一只穿着西装的狐狸正在阅读报纸(主体),采用柔和的晨光和复古色调(风格)。”

3.1.2. 零样本、单样本与少样本提示:引导模型的不同策略

这些概念源自大型语言模型领域,但其思想同样适用于广义的AIGC交互,帮助我们理解引导模型的不同层次。

  • 零样本提示(Zero-Shot Prompting):这是最常见、最直接的交互方式。用户直接给出指令,不提供任何具体范例,依赖模型自身庞大的预训练知识来理解和执行任务 (8)。例如,直接输入“生成一幅描绘惊涛骇浪的油画”。这种方式适用于快速获取通用结果。

  • 单样本与少样本提示(One-Shot & Few-Shot Prompting):当需要模型遵循特定的格式或风格时,这种策略非常有效。用户在提示词中提供一个或多个“输入-输出”的范例,让模型从中学习并模仿 (8)。例如,在与语言模型交互时,可以这样提示:“将句子翻译成法语。'hello' -> 'bonjour'。'goodbye' -> 'au revoir'。'thank you' ->?”。模型会根据范例推断出任务是翻译,并给出“merci”。在图像生成中,虽然形式不同,但可以通过提供参考图或在文本中详细描述一种结构化的视觉模式来达到类似的效果,这本质上是为模型提供了一个清晰的模仿目标 (9)。

3.2. 高级提示词技巧与迭代优化

要从入门到精通,需要掌握更高级的策略,并将提示词创作视为一个持续迭代优化的过程。

3.2.1. 思维链(Chain-of-Thought)与角色扮演:提升输出的逻辑性与创造性

  • 思维链提示(Chain-of-Thought Prompting):当面对复杂的、需要多步推理的任务时,可以要求模型“一步一步地思考”或“解释其推理过程”。例如,在请求一个复杂的场景设计时,可以先让模型分步描述场景的构成元素、光照布局和角色位置,然后再要求它生成最终图像。这种方式迫使模型构建一个更具逻辑性的内部表征,从而提升最终输出的连贯性和准确性 (11)。

  • 角色扮演提示(Role-Playing Prompting):这是一种极具创造力的技巧。通过为AI指定一个角色或身份,可以极大地影响其输出的风格、语气和知识领域。例如,提示“作为一个经验丰富的电影导演,为以下场景设计一个分镜头脚本...”会比直接要求“写一个分镜头脚本”得到更专业、更具视觉想象力的结果 (9)。这个角色可以是“一位植物学家”、“一位醉醺醺的天才诗人”或“一位90年代的复古游戏设计师”,每种角色都会解锁AI不同的创造潜力。

3.2.2. 迭代框架:从定义任务到评估优化的五步法

优秀的提示词很少一蹴而就,通常需要经过多次的调整和优化。一个系统化的迭代框架可以帮助提高效率和效果,这个五步法涵盖了从构思到完善的全过程 (11):

  1. 任务(Task):清晰地定义你想要AI完成的具体目标。例如,“为一款新的有机护肤品创作一张电子商务网站的主图”。

  2. 背景(Context):提供尽可能多的相关背景信息。例如,“目标客户是关心可持续性的年轻人,产品强调天然成分,品牌色调是柔和的绿色和米色”。

  3. 参考(References):给出具体的风格范例或参考材料。例如,“风格类似于[某知名品牌]的广告,光线明亮自然,构图简洁”。

  4. 评估(Evaluate):仔细检查AI的输出是否满足任务要求。如果不符合,分析是哪个环节出了问题?是主体理解错误,还是风格不到位?

  5. 迭代(Iterate):根据评估结果,精确地修改和完善你的提示词。可能是增加更多细节,调整关键词的权重,或者尝试不同的表述方式,然后重复评估过程,直到获得满意的结果。

这个框架将提示词创作从一种随机的尝试,转变为一个结构化的、以目标为导向的问题解决流程。

3.3. 超越文本:关键参数(种子、温度等)的调节与应用

除了提示词本身,AIGC工具通常还提供一系列参数,让用户能够对生成过程进行更深层次的控制。

  • 种子(Seed):种子是一个整数,它决定了初始随机噪声图的具体模式 (7)。在扩散模型中,如果提示词、模型版本和种子值这三个要素完全相同,那么生成的图像将永远是完全一样的 (7)。这为创作提供了确定性和可复现性。如果你对一张图的构图基本满意,但想微调内容,可以固定种子值,然后修改提示词。例如,保持种子值不变,将提示词从“一双亮橙色的网球鞋”改为“一双亮蓝色的绒面正装鞋”,你可能会得到一双构图相似但主体已改变的鞋子 (7)。反之,固定提示词,不断改变种子值,则可以探索同一主题下的不同变体。

  • 温度(Temperature):这个参数主要用于大型语言模型,它控制着生成结果的随机性或“创造性”(10)。温度值较低(如0.1-0.3)时,模型会倾向于选择最有可能的、最常见的词语,生成的结果更具确定性、事实性和连贯性,适合需要精确答案的场景。温度值较高(如0.8-1.0)时,模型会考虑更多可能性较低的词语,生成的结果更多样化、更具创意,甚至出人意料,适合头脑风暴、诗歌创作等开放性任务 (10)。理解并调节温度,是在AI的“可靠性”与“创造性”之间找到最佳平衡的关键。

3.4. 教学工坊设计:提示词创作与对比分析挑战赛

为了巩固学生对提示词工程的理解,可以设计一个互动性强的教学工坊。活动可以分为两个阶段:

  1. 逆向工程挑战:向学生展示几张高质量的AI生成图像,但不提供原始提示词。要求学生分组合作,尝试“逆向工程”出能够生成相似图像的提示词。这个过程能锻炼他们对主体、风格和框架等元素的拆解和描述能力。

  2. 创意生成竞赛:给出一个开放性的主题,如“未来的交通工具”或“一个被遗忘的神话生物”。让学生利用本模块学到的所有技巧,创作出最具创意和技术含量的提示词,并生成图像。最后,进行作品展示和同行评议,让学生互相解释自己的提示词构建思路,并分析不同提示词策略导致的结果差异。这种实践和反思的结合,是提升提示词工程技能最有效的方式。

为了给学生提供一个结构化的参考,以下表格总结了核心的提示词策略。

策略类型

描述

示例

零样本 (Zero-Shot)

直接下达指令,不提供范例,适用于快速获取通用响应。

"用五个要点总结这篇文章。" (9)

少样本 (Few-Shot)

提供少量输入输出范例,引导模型模仿特定结构或风格。

"这是两个摘要范例。请用同样的风格写第三个。" (8)

角色扮演 (Role-Based)

要求AI扮演特定角色或视角,以获得特定领域或风格的响应。

"你是一位准备讲座提纲的MBA教授..." (9)

指令式 (Instructional)

使用明确的动词(如“撰写”、“解释”、“对比”)来直接命令AI执行任务。

"撰写一篇500字的文章,讨论气候变化对沿海社区的影响。" (13)

思维链 (Chain-of-Thought)

要求AI分步解释其推理过程,以提高复杂任务的逻辑性和透明度。

"请分步解释为什么电动汽车是未来,并列出三个关键点。" (11)

  1. 模块三:拓展画布——从图像编辑到视频生成的应用前沿

4.1. 图像的重塑与延展:内补(Inpainting)与外扩(Outpainting)

AIGC的能力远不止于从零开始创造图像,它同样是强大的图像编辑与增强工具。其中,内补(Inpainting)和外扩(Outpainting)是基于扩散模型的两项革命性功能,它们极大地拓展了创意工作的边界。

  • 内补(Inpainting):这项技术允许用户在图像中选择一个区域(使用遮罩),然后通过文本提示词来填充或替换该区域的内容 (7)。其应用场景极为广泛:可以用于修复老照片中的破损部分,无痕地从风景照中移除不需要的物体(如电线杆),或者在现有图像中添加全新的元素。例如,可以选中一张肖像画的背景,然后用提示词“一个繁华的赛博朋克城市夜景”来生成一个全新的、与主体无缝融合的背景 (6)。

  • 外扩(Outpainting):与内补相反,外扩技术是在图像的原始边界之外生成新的内容,从而扩展画面的视野 (7)。用户可以上传一张图片,选择一个外部区域,然后通过提示词来引导AI“想象”并绘制出画面之外的景象 (6)。这项功能对于调整构图、将一张竖构图的照片扩展为横构图的宽屏壁纸,或者为一幅经典画作(如《蒙娜ሊሳ》)创造出更广阔的背景世界等任务,都展现了惊人的潜力。

这两项技术共同表明,AIGC正在从一个纯粹的“生成器”演变为一个智能的“创意伙伴”,能够理解并参与到复杂的图像编辑与重构流程中。

4.2. 视频生成元年:国内主流模型引领潮流

如果说过去几年是图像生成的爆发期,那么现在无疑已经进入了视频生成的元年。文生视频(Text-to-Video)技术正以惊人的速度发展,国内科技公司在这一赛道上表现尤为突出,推出了一系列强大的模型,正在将静态的想象力转化为动态的视觉叙事。对于学生而言,了解这些本土化的前沿工具及其特点,是把握未来内容创作趋势的关键。

4.2.1. 模型能力与应用场景分析:可灵、Vidu、通义万相、Dreamina等

当前国内市场上的文生视频模型各具特色,在技术实力和应用场景上与国际顶尖模型同台竞技。

  • 可灵 (Kling):由快手公司推出,是国内文生视频领域的现象级产品。它支持文生视频、图生视频和视频续写,能够生成长达10秒的1080p、30fps高品质视频 (38)。可灵以其对物理世界的精准模拟、强大的概念组合能力和对中文语境的深刻理解而著称,其训练数据得益于快手庞大的短视频内容库,使其在生成符合国内用户审美的视频方面具有天然优势 (39)。

  • Vidu:由生数科技与清华大学联合发布,采用了“U-ViT”这一扩散与Transformer融合的创新架构。Vidu能够一键生成长达16秒的1080P高清视频,不仅能模拟真实物理世界,还能理解多镜头语言(如远景、特写切换),并展现出丰富的想象力,生成超现实内容 (40)。

  • 通义万相:作为阿里巴巴通义大模型家族的一员,通义万相在视频生成方面同样表现出色。最新版本支持生成10秒、1080p、24fps的电影级视频,并具备独特的声画同步生成能力,可以根据输入的音频驱动视频画面的生成,极大地丰富了创作的可能性 (35)。

  • Dreamina:集成于流行的视频剪辑软件剪映(CapCut)中,由字节跳动推出。Dreamina以其高可靠性和流畅的创作体验著称,为广大视频创作者提供了一个低门槛、高效率的AI视频生成工具。它提供稳定的免费额度和无间断的生成队列,是内容创作者进行快速创意实现和商业化内容制作的理想选择 (42)。

下表对这些国内主流模型进行了简明扼要的对比,同时列出部分国外知名模型作为参考。

工具

开发方

最大分辨率/长度

突出特点

最适用场景

可灵 (Kling)

快手

1080p / 10s

物理模拟精准,概念组合能力强,符合中文语境。

创意短视频,社交媒体内容 (39)

Vidu

生数科技/清华

1080p / 16s

U-ViT架构,理解多镜头语言,想象力丰富。

叙事短片,概念艺术视频 (40)

通义万相

阿里巴巴

1080p / 10s

声画同步生成,电影级质感,集成于通义生态。

营销广告,音乐视频,多模态创作 (41)

Dreamina (剪映)

字节跳动

1080p

可靠性高,与剪辑流无缝集成,免费额度友好。

内容创作者,视频博主,快速原型制作 (42)

Runway (国外参考)

RunwayML

1080p / 10s+

电影级视觉质量,高级运动控制,时间一致性强。

创意电影制作,艺术短片 (14)

Sora (国外参考)

OpenAI

1080p / 20s

极高的真实感,更长的生成时长,强大的视频编辑功能。

高保真视频生成,电影特效 (16)

4.2.2. 教学案例:如何利用AI视频工具进行创意叙事

为了让学生亲身体验视频生成的魅力与挑战,可以设计一个创意叙事项目。项目要求学生利用可灵Dreamina等国内工具,创作一个30秒的微型广告或一个60秒的短故事。

这个项目将引导学生经历完整的创作流程:

  1. 构思与故事板:首先,学生需要构思一个简单的故事情节,并绘制出关键帧的故事板。

  2. 提示词设计:为故事板中的每一个镜头设计精确的文本提示词,不仅要描述内容,还要考虑镜头语言(如“广角镜头”、“特写”、“从下往上摇摄”)。

  3. 分段生成:使用AI工具逐个生成视频片段。在这一步,学生将直面当前技术的核心挑战:保持角色、场景和风格在不同片段间的一致性。他们可能需要反复调整提示词,或利用图生视频功能来固定角色形象。

  4. 剪辑与后期:将所有生成的片段导入视频剪辑软件(如剪映),进行拼接、配乐、添加音效和字幕,最终完成一部完整的短片。

通过这个项目,学生不仅能学会操作AI视频工具,更能深刻体会到AI在创意流程中的角色——它是一个强大的灵感和素材生成器,但最终的叙事逻辑、节奏控制和情感表达,仍然需要人类创作者的精心编排。

4.3. 专题讨论:AIGC在不同行业(设计、营销、教育)的颠覆性潜力

在模块的最后,组织一场专题讨论,引导学生思考AIGC技术对未来职业的深远影响。可以提供一些结合国内应用场景的具体案例作为讨论的起点:

  • 设计行业:设计师如何利用文心一格通义万相在几分钟内生成数十种设计方案,从而将工作重心从重复性的绘图转移到更高层次的创意构思和方案筛选上?这些工具如何被应用于电商、游戏和文创等领域? (43)

  • 营销行业:像Pictory这样的工具如何实现“博客文章一键转视频”,自动为文字内容匹配画面和配音,从而极大地降低了视频营销的门槛和成本 (15)?国内的剪映等工具是否也集成了类似功能,赋能了大量自媒体和中小企业?

  • 教育与培训:Synthesia等平台提供的超写实AI数字人化身,如何被用于制作多语言、可定制的企业培训课程或教学视频,实现个性化和规模化的知识传播 (15)?

这场讨论旨在促使学生超越技术本身,思考其背后的经济和社会变革。AIGC不仅仅是新工具的出现,它更可能引发一场关于工作流程、技能需求乃至职业定义的深刻重塑。

  1. 模块四:超越生成——迈向自主与可信的未来AI

在掌握了AIGC的基本原理和应用之后,课程需要引导学生向前看,理解这项技术正在经历的两个关键演进方向:从追求“创造性”到追求“可信性”,以及从执行“指令”到完成“目标”。这两个方向分别由检索增强生成(RAG)和AI智能体(AI Agents)所代表,它们共同描绘了未来AI的发展蓝图。

5.1. 检索增强生成(RAG):让AI“开卷考试”,告别“一本正经地胡说八道”

大型语言模型(LLMs)一个广为人知的缺陷是“幻觉”(hallucination)——即模型会编造看似合理但实际上是错误的或不存在的信息。这是因为它们本质上是基于其固定的、可能已过时的训练数据进行概率性文本生成,相当于一个知识渊博但只能“闭卷考试”的学生 (17)。检索增强生成(Retrieval-Augmented Generation, RAG)是一种旨在解决此问题的强大AI框架。

5.1.1. RAG的工作原理与核心优势

RAG的核心思想非常直观:与其让LLM仅凭“记忆”(训练数据)回答问题,不如让它先查阅相关的、权威的资料,然后再进行回答。这就像从“闭卷考试”升级为“开卷考试” (18)。RAG框架通过将传统的信息检索系统(如搜索引擎)与先进的生成模型相结合,实现这一目标 (17)。

其工作流程通常包括以下步骤 (20):

  1. 接收用户查询:用户提出一个问题,例如,“公司最新的年假政策是什么?”

  2. 信息检索:系统并不直接将问题抛给LLM,而是首先利用该查询在一个外部的、可信的知识库(如公司的内部文档、最新的研究论文数据库、产品手册等)中进行搜索。这个搜索过程通常利用向量数据库实现,通过语义相似度快速找到最相关的文档片段 (17)。

  3. 增强提示词:系统将检索到的相关信息片段(例如,年假政策的具体条款)与用户的原始问题一起,整合成一个增强的、包含上下文的提示词。

  4. 生成答案:将这个增强后的提示词输入给LLM。此时,LLM的任务不再是凭空回忆,而是基于刚刚提供的、准确的上下文信息来综合、总结并生成一个回答。

  5. 提供来源:理想的RAG系统还会在答案旁附上信息的来源链接,允许用户核实,从而极大地增强了透明度和可信度 (18)。

RAG的核心优势在于:

  • 提高事实准确性:通过将LLM的回答“锚定”在权威数据源上,显著减少了幻觉现象 (17)。

  • 获取最新信息:克服了LLM知识截止日期的问题,使其能够回答关于最新事件或数据的提问 (17)。

  • 降低成本与门槛:相比于为特定领域的知识而对整个庞大的基础模型进行昂贵的重新训练或微调,RAG提供了一种更经济、更高效的方式来为模型注入专业知识 (20)。

5.1.2. 应用场景:构建基于特定知识库的问答系统

RAG技术的应用前景极为广阔,尤其是在需要高精度和专业性的领域。例如,可以构建一个内部HR智能助手,它能根据公司最新的政策文件,准确回答员工关于报销、休假、福利等问题 (18)。在客户服务领域,可以开发一个基于所有产品文档和故障排除指南的聊天机器人,为用户提供精准的技术支持 (21)。在科研或法律领域,RAG系统可以帮助研究人员快速地从海量文献中检索相关信息并生成综述。

5.2. AI智能体(AI Agents):从执行指令到完成目标的自主系统

如果说RAG让AI变得更“可信”,那么AI智能体则让AI变得更“能干”。传统的AIGC模型大多是被动地响应用户的单次指令。而AI智能体则代表了一种更高级的范式:它们是能够被赋予一个高层次目标,然后自主地进行规划、执行多步操作并与外部工具交互,以达成该目标的系统 (22)。

5.2.1. 智能体的构成与工作流

一个典型的AI智能体,其核心是一个用于“思考”和“决策”的大型语言模型,并辅以几个关键组件 (23):

  • 规划(Planning):当接收到一个复杂的目标,如“为我规划一次为期五天的夏威夷家庭旅行”时,智能体会首先将这个大目标分解为一系列可执行的子任务,例如:“1. 确定最佳旅行时间;2. 搜索并比较往返机票;3. 查找符合家庭需求的酒店;4. 规划每日行程;5. 估算总预算。” (22)。

  • 工具使用(Tool Use):为了执行这些子任务,智能体被赋予了使用各种“工具”的能力。这些工具可以是访问实时网络的搜索引擎、调用特定功能的API(如航班预订API、天气查询API)、读写本地文件,甚至是与其他AI模型进行交互 (23)。

  • 执行与反思(Execution & Reflection):智能体会按计划逐一执行任务,并评估每一步的结果。如果某一步失败或结果不理想,它能够进行反思、调整计划,并尝试其他方法,直到最终完成目标。

5.2.2. 前瞻:AI智能体对未来工作模式的重塑

AI智能体的兴起预示着人机协作模式的深刻变革。未来的知识工作者可能不再是繁琐任务的执行者,而是高层目标的设定者和AI智能体团队的管理者。例如,一个市场分析师可以指示一个智能体:“分析我们主要竞争对手上一季度的市场活动,并生成一份包含关键洞察和策略建议的演示文稿。”智能体将自主完成数据搜集、分析、图表制作和文稿撰写等一系列工作 (25)。

从基础的生成模型,到可信的RAG系统,再到自主的AI智能体,我们看到了一条清晰的演进路径。这条路径不仅是技术能力的提升,更反映了AI在社会经济活动中角色的变迁。

  • 阶段一(基础模型):AI是“创意工具”,擅长内容合成,但可靠性存疑。人类的核心技能是提示词工程。

  • 阶段二(RAG系统):AI是“知识助理”,擅长信息整合与准确问答。人类的技能扩展到设计和维护AI所依赖的知识库。

  • 阶段三(AI智能体):AI是“项目代理”或“虚拟员工”,能够自主完成复杂任务。人类的技能进一步提升为定义战略目标、设计智能体的工作流程和工具集,以及监督其最终成果。

因此,一个具有前瞻性的AIGC通识课程,必须超越单纯的提示词教学,引导学生理解并为这个即将到来的“智能体时代”做好准备。他们需要学习的不仅是如何与AI“对话”,更是如何与AI“共事”。

  1. 模块五:驾驭新大陆——AIGC的法律、伦理与社会挑战

6.1. 著作权迷思:中国司法实践下的AIGC版权归属

随着AIGC作品日益精进,其著作权(版权)归属成为核心法律问题。与国外,特别是美国的司法实践相比,中国在这一问题上展现了更为灵活和务实的态度,形成了一系列具有指导意义的判例。

6.1.1. “人类智力投入”:中国法院的核心裁判逻辑

根据《中华人民共和国著作权法》,受保护的作品需要具备“独创性”并属于“智力成果” (44)。在AIGC领域,中国法院并未简单地因其由AI生成而否定其可版权性,而是将审查重点放在了生成过程中是否体现了人类的独创性智力投入 (45)。

  • “春风送来了温柔”案(北京互联网法院,2023年):这是国内首例认定“AI文生图”具有可版权性的标志性案件 (46)。法院认为,原告通过构思画面、设计并反复调整大量提示词、设定参数等一系列操作,最终选定图像的过程,体现了其审美选择和个性化表达,这种智力投入使得生成的图像具备了“独创性”要件,因此构成作品,受著作权法保护 (45)。

  • 权属归属——“使用者优先”原则:在该案中,法院明确AI模型本身不能成为作者,而是在创作过程中发挥了实质性智力作用的用户(原告)被认定为作品的作者,享有完整的著作权 (45)。这确立了在没有合同约定的情况下,“使用者优先”的权属分配规则,保障了创作者的权益 (45)。

6.1.2. 中美司法实践对比与思考

中国的司法实践与美国形成了鲜明对比。美国版权局坚持严格的“人类作者”原则,认为仅通过文本提示词生成图像,用户的控制力不足以构成作者身份,因此生成的图像本身不受版权保护 (26)。

这种差异反映了两种不同的监管理念:

  • 中国模式:更侧重于从功能和贡献上认定作品属性,将AI视为一种高级的“画笔”或工具。只要人类的智力投入达到了独创性的门槛,就承认其作品地位和创作者的作者身份,这符合《著作权法》激励创作的立法宗旨 (50)。

  • 美国模式:更侧重于创作过程的物理性和直接控制力,强调作者必须是人类,且对作品的表达有最终的、可预见的控制。

此外,中国的司法实践也关注到了平台方的责任。在“奥特曼”相关侵权案中,法院判决AIGC服务提供者因未尽到合理的注意义务,对生成侵权内容承担了相应的赔偿责任,这为平台划定了法律红线 (51)。

6.2. 算法的偏见:AIGC如何放大社会刻板印象?

AIGC模型虽然看似中立,但其生成的内容却常常暴露出深刻的社会偏见,甚至会放大和固化现实世界中的刻板印象。理解这种算法偏见的来源、表现及其危害,是培养负责任的AIGC使用者的关键一环。

6.2.1. 偏见的来源:从有偏的数据集到反馈循环

算法偏见的根源主要在于其训练数据 (5)。当前的AIGC模型大多是在从互联网上抓取的海量数据上进行训练的。这些数据是人类社会的一面镜子,不可避免地反映了其中存在的各种历史和文化偏见,包括性别歧视、种族主义和职业刻板印象。AI模型在学习这些数据时,并不能辨别是非对错,只会忠实地学习并复制其中蕴含的模式和关联 (12)。

更危险的是,AIGC可能会形成并加剧偏见反馈循环(bias feedback loop)(5)。其过程如下:

  1. 一个在有偏见的数据集上训练出的模型,会生成带有偏见的内容(例如,将医生更多地描绘为男性)。

  2. 这些带有偏见的图像和文本被发布到互联网上。

  3. 未来的AI模型在进行数据抓取时,会将这些AI生成的内容作为新的训练数据。

  4. 这导致新一代模型的训练数据中,偏见被进一步强化,从而生成更具偏见的内容。 如此循环往复,偏见不仅被复制,更被系统性地放大和固化,使得AI所呈现的“虚拟世界”比现实世界更加刻板和不公 31。

6.2.2. 案例分析:性别、种族与职业的刻板印象再现

算法偏见在AIGC的输出中表现得淋漓尽致:

  • 职业与性别偏见:研究发现,当提示词中包含“医生”、“工程师”或“CEO”等职业时,生成的图像绝大多数是男性;而当提示词是“护士”、“接待员”或“家庭主妇”时,则主要是女性 (30)。这种偏见甚至比现实中的劳动力统计数据更为极端。例如,在美国,女性医生占比接近40%,但在AI生成的图像中可能只有不到10% (31)。

  • 种族与经济地位偏见:当生成高薪职业(如“律师”、“政客”)的图像时,AI倾向于生成肤色较浅的人物;而对于低薪职业(如“洗碗工”、“清洁工”),则更多地生成肤色较深的人物 (31)。这直接复制并强化了社会中存在的种族与阶级偏见。

  • 审美与文化偏见:模型往往会偏爱和生成符合西方主流审美的形象,例如,更倾向于生成苗条的身材,而忽视身体的多样性 (32)。在生成不同国家的人物形象时,也可能出现基于刻板印象的描绘,例如,将拉丁美洲的女性统一描绘成浅肤色,这是一种被称为“色彩主义”(colorism)的偏见 (31)。

这些偏见不仅是不公平的,更是有害的。它们通过无处不在的AI生成内容,潜移默化地影响人们的认知,加剧社会隔阂,并可能对被边缘化群体的自我认同造成伤害。

6.3. 深度伪造(Deepfakes)与中国的治理框架

除了偏见问题,AIGC技术,特别是其在视频和音频生成方面的应用,还催生了以“深度伪造”(Deepfakes)为代表的一系列严峻伦理挑战。中国对此高度重视,并构建了具有前瞻性的法律法规体系。

6.3.1. 虚假信息、非自愿色情与身份滥用

深度伪造是指利用AI技术创建的、极其逼真的虚假音视频内容,可以实现将一个人的脸无缝地替换到另一个人身上,或者合成某人说出从未说过的话 (4)。其恶意滥用的风险极高,包括制造政治谣言、进行金融诈骗,以及制作非自愿色情内容等 (4)。

6.3.2. 中国的应对策略:从专项规定到综合治理

面对深度伪造等伦理风险,中国采取了“发展和安全并重、促进创新和依法治理相结合”的原则,建立了一套多层次的治理框架 (52)。

  • 《互联网信息服务深度合成管理规定》:这是我国专门针对深度合成技术的管理规定,明确了深度合成技术是指利用深度学习、虚拟现实等算法制作文本、图像、音频、视频、虚拟场景等网络信息的技术 (53)。该规定要求服务提供者对使用者进行真实身份信息认证,并对生成内容进行显著标识,避免公众混淆或误认 (54)。这为深度伪造的治理提供了直接的法律依据。

  • 《生成式人工智能服务管理暂行办法》:作为全球首部针对生成式AI的综合性法规,该《办法》于2023年8月15日正式实施,确立了“包容审慎和分类分级”的监管原则 (55)。它不仅鼓励技术创新与应用,也划定了安全红线,要求服务提供者尊重知识产权、保护个人信息,并明确了对生成内容进行标识的义务,与《深度合成管理规定》相衔接 (54)。

  • 培养媒介素养与批判性思维:除了法律监管,课程还应强调提升学生的数字媒介素养。引导学生建立一套批判性的信息消费习惯:保持怀疑态度、交叉验证来源、理解技术局限,并倡导负责任的技术使用伦理。

最终,应对AIGC伦理挑战的终极防线,是培养出一代既能拥抱技术创新,又能对其潜在危害保持高度警惕和批判性反思的数字公民。

  1. 结论:设计结课项目——综合应用与批判性反思

7.1. 项目建议:AIGC艺术创作、伦理分析报告或AI辅助教学工具原型

为了检验和巩固学生在本课程中所学的全部知识与技能,设计一个综合性的结课项目(Capstone Project)至关重要。该项目应鼓励学生将技术原理、实践操作与伦理思辨融会贯通,根据自己的兴趣和专业方向选择不同的路径。

  1. 创意实践路径:此路径适合对艺术、设计、媒体创作感兴趣的学生。他们可以利用课程中学到的多种AIGC工具(如文心一格、通义万相、可灵等),完成一个具有完整概念的创意项目。例如:

  • 创作一部AI辅助的短片:学生需要完成从剧本构思、分镜设计、提示词工程、视频片段生成到后期剪辑、配音配乐的全过程。

  • 设计一本图画小说或漫画的开篇章节:学生负责故事创作和版面设计,并利用图像生成工具创作所有画面。

  • 制作一张概念音乐专辑(EP):利用AI音乐生成工具创作配乐,利用AI图像工具设计专辑封面和视觉概念。 在提交最终作品的同时,学生必须附上一篇创作反思报告,详细阐述他们的创作流程,如何通过提示词和参数调整来实现自己的艺术构想,以及在与AI协作的过程中,如何保持和表达自己独特的创作“声音”。

  1. 批判分析路径:此路径适合对社会科学、法律、哲学和新闻学感兴趣的学生。他们需要选择一个与AIGC相关的具体社会或伦理议题,进行深入的文献研究和案例分析,并撰写一份高质量的研究报告。可选的题目包括:

  • 特定AI模型的算法偏见分析:选择一款主流的图像或文本生成模型,设计实验来系统性地测试其在特定维度(如性别、种族、文化)上的偏见,并分析其潜在的社会影响。

  • AIGC对特定行业的劳动力市场冲击研究:选择一个行业(如平面设计、文案写作、客户服务),研究AIGC工具的普及对其工作岗位、技能需求和薪酬结构可能带来的短期和长期影响。

  • 比较中美在AIGC著作权认定上的司法实践:深入分析“春风送来了温柔”案与美国版权局的相关裁决,探讨两种不同法律路径背后的法理逻辑及其对创作者和产业的深远影响。

  1. 应用开发路径:此路径适合有一定编程基础或对产品设计感兴趣的学生。他们可以利用RAG框架或AI智能体开发工具,设计并实现一个简单的应用原型,解决一个具体问题。例如:

  • 构建一个课程学习助手:利用RAG技术,将本课程的所有教材、讲义和参考资料作为知识库,构建一个能够智能回答学生提问的聊天机器人。

  • 设计一个AI辅助研究工作流:创建一个简单的AI智能体,能够根据用户输入的研究课题,自动执行文献搜索、摘要生成、相关概念图谱绘制等一系列任务。

  • 开发一个“偏见探测器”插件:设计一个浏览器插件,当用户浏览网页时,可以利用AI分析页面上的图像和文本,并提示其中可能存在的刻板印象或偏见。

这些多样化的项目选择,确保了不同背景和兴趣的学生都能找到与自己专业相结合的切入点,将课程所学转化为有形的、具有个人印记的成果。

7.2. 最终展望:作为AIGC时代的领航者而非追随者

本AIGC通识课程的最终目标,是赋予学生在即将全面来临的生成时代中航行的罗盘与船桨。课程的设计理念超越了单纯的技能培训,旨在培养一种深刻的、面向未来的批判性思维和适应能力。

通过这门课程,学生将不再是AIGC技术的被动消费者或茫然的追随者。他们将成为能够理解其底层机制、驾驭其强大功能、审视其社会影响,并最终有能力参与塑造其发展方向的知情者和领航者。他们将学会如何与这个强大的非人类智能进行有效协作,放大自身的创造力和生产力,同时也能清醒地认识到技术的边界和风险,坚守人类的核心价值。

在这个技术变革日新月异的时代,我们无法预测未来会出现哪些新的AIGC工具,但我们可以确信,本课程所培养的批判性思维、系统性分析和负责任的创新精神,将是学生们应对一切未知挑战最宝贵的财富。他们的任务,将不仅仅是使用未来,更是以智慧和远见,去设计一个更公平、更具创造力、更富人性的人机共生未来。

GMAKE视觉研究所专注于AIGC在设计领域的应用研究,致力于通过技术创新提升设计质量与效率。同时积极推动AIGC与高校教育融合,通过讲座、工作坊和师资培训促进产学研合作,与多所高校及企业共同探索AIGC技术在教育与产业中的创新应用。


十亩之间兮,桑者闲闲兮。行与子还兮。十亩之外兮,桑者泄泄兮。行与子逝兮。——《国风·魏风·十亩之间


Add: 上海市闵行区环镇南路88弄51号 Email: 49723905@qq.com

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐