「AI」被用来描述从垃圾邮件过滤器到聊天机器人、再到做出你信息流里那段爆款视频的工具的一切。这里讲的是「生成式 AI」所指的那一件具体的事、这些模型到底是怎么学习的,以及本站的工具落在哪里。
大多数人日常打交道的 AI 大多是判别式的,不是生成式的 —— 它看一个已经存在的东西,并对它做出一个判断:这封邮件是垃圾邮件吗,这张照片里有没有人脸,接下来该不该给你推荐这个视频。生成式 AI 是另一回事:它不是评判已有内容,而是从一个提示或一个起始输入产出新内容 —— 一段文字、一张图像、一段视频、一段语音。ChatGPT 写邮件、Midjourney 画图、Runway 或 Veo 生成视频片段,都是生成式 AI。垃圾邮件过滤器不是,尽管它在更宽泛的意义上仍然是「AI」。
训练一个生成模型意味着给它看海量的、它要产出的那类东西的真实例子 —— 文本模型是数十亿句话,图像或视频模型是巨大的图像或视频数据集 —— 并调整模型的内部参数(可以有数十亿个),让它在预测那些数据里的模式上越来越好:哪个词合理地跟在后面,哪些像素值合理地挨着哪些其他像素值。关键在于,模型不是像搜索引擎返回一个存好的网页那样,在存储并重放特定的训练例子。它在学习足够通用的统计模式,能把它们应用到训练时从未遇到过的全新提示上 —— 这既是它有用的来源(它能处理真正新颖的请求),也是它最古怪的失败的来源(它总是在产出它最佳的统计猜测,哪怕那个猜测是错的)。
生成模型不是在查资料或核实事实 —— 它是在产出所给提示的、统计上最合理的续写,完全基于训练中学到的模式。对文本模型,这表现为言之凿凿的错误信息,常被称为「幻觉」。对图像和视频模型,这表现为在完全不相关的内容上同样几类反复出现的视觉故障:多出的或畸形的手指、扭曲或变成乱码的首饰和小字、经不起细看的精细细节。这些不是某个工具特有的随机 bug —— 它们是这类模型在结构上很难做到完全正确的东西的产物:精细的、精确的、受规则约束的细节(确切的手指数量、确切的字形)比宽泛、宽容的目标(一个整体姿势、一个大致的配色)要更难始终命中。
AI 视频生成器(Runway、Pika、Kling、Seedance、Veo 等)是专门应用于视频的生成式 AI:输入一段文字描述或一张参考图像,输出一段简短的新视频片段 —— 是模型构建的帧,不是拍摄的画面。这和文本或图像生成器背后是同一个基本思路,只是多了一个复杂之处:每一帧都要和周围的帧在视觉上保持一致。关于机制,见我们专门的解释文章AI 视频生成到底是怎么工作的;如果你只想知道刷屏的那些视频背后是什么,看我们对新手友好的实际工具导览。
这一点值得说精确,因为两者常被混为一谈:AI 背景移除(RemoveGifBG 做的事)建立在一个密切相关的神经网络技术家族之上,但它不是同一意义上的生成式。它的工作是分类,不是创造 —— 对图像或视频帧里的每个像素,判断它是主体的一部分还是背景的一部分,然后保留一个、丢弃另一个。它不像图像生成器从文字提示发明一整个场景那样发明新像素;它是在对已经存在的像素做一个保留还是丢弃的判断。具体见AI 背景移除到底是怎么工作的,以及为什么它在视频和 GIF 上比在单张照片上难得多。
简短版
相关:AI 背景移除是怎么工作的 · AI 视频是怎么做出来的(新手指南) · 全部指南
它是一类 AI 模型,被训练来产出新的内容 —— 文本、图像、视频、音频、代码 —— 而不只是分类或分析已有的内容。垃圾邮件过滤器(「这封邮件是不是垃圾邮件」)是 AI,但不是生成式的。一个能写邮件、画图,或根据描述生成视频的工具是生成式的:输出是模型构建出来的新素材,而不是给某个已经存在的东西贴的一个标签。
训练让模型接触海量的已有示例内容(文本、图像或视频,取决于它要生成什么),并调整数百万或数十亿个内部参数,让模型在预测那些数据里的模式上越来越好 —— 哪个词合理地跟在其他词后面,哪些像素值合理地跟在其他像素值后面。它不是在记住并重放特定的例子;它是在学习足够通用的统计模式,能应用到训练时从未见过的全新提示上。
因为模型是在生成统计上最合理的下一个输出,而不是在查资料或核实事实。对文本来说,这表现为言之凿凿的错误信息(「幻觉」)。对图像和视频来说,这表现为同样几类反复出现的视觉错误 —— 多出的手指、扭曲的文字、维持不住形状的首饰 —— 因为这些恰恰是那种精细的、结构上精确的细节,在整张生成的图像或整段片段中要保持统计上的一致是最难的。
不完全是,不过它是个近亲。AI 背景移除用的是同一个家族的神经网络技术(在海量示例数据上训练,做像素级的预测),但它的工作是分类,不是生成:对每个像素,它是前景还是背景?它不像图像生成器那样创造新像素 —— 它是在决定从一张已经存在的图像里保留什么。