不是 CGI。不是滤镜。也不是任何曾被拍摄过的东西的画面。这里讲的是当你输入一个提示、拿回一段视频时,底层实际发生的事。
目前大多数 AI 视频生成器建立在扩散模型之上。与直觉相反,生成不是从无到有地搭建 —— 它从纯粹的随机视觉噪声开始,也就是视频版的电视雪花,铺满片段的每一帧。然后模型运行一系列精修步骤,在每一步,它预测如何把那团噪声轻轻推向一个与给定的文字提示或参考图像相符的连贯视频。把这个精修重复几十次 —— 在专用 AI 硬件上极快地完成 —— 噪声就逐渐解析成一段完成的片段。这和 Midjourney 或 Gemini 的图像模型这类 AI 图像生成器背后是同一个核心技术,只是从单帧的宽和高,扩展到了时间。
做这个噪声精修的模型并不是在瞎猜 —— 它在训练时,从海量的真实视频里学到了,一个照片级真实的动作、一个特定的物体,或一个被描述的场景通常长什么样。那个训练过程会调整数十亿个内部参数,让模型的噪声精修预测在匹配真实视频(以及与之配对的文字描述)的实际样子上越来越好。结果是一个模型,它能为一个训练时从未见过的提示产出一段看起来合理的视频,方法是把它从所见的一切里学到的统计模式加以组合和重组。
每个主要工具都支持两种起点,它们在底层的工作方式不同:
让片段的每一帧和其他每一帧在视觉上保持一致 —— 同一个角色、同样的光照、没有随机闪烁或漂移的细节 —— 会随着片段变长而在计算上变得更难,而小的误差会在更长的序列上累积,就像一个小的测量误差会在更长的计算中累积一样。这就是大多数工具把单次生成限制在 4 到 10 秒之间的现实原因:这接近当前模型在一次处理中、以合理的速度和成本能保持连贯的极限。2026 年有新一代模型突破了这一点(那年 8 月发布的一款能在单次处理中生成最多 30 秒),但 4-10 秒在大多数主要工具里仍是常态,而你在网上看到的更长的「视频」,通常是几次单独生成剪在一起的,而不是一段连续的片段。
那些反复出现的视觉错误 —— 多出来一根手指、运动中扭曲的首饰、渲染成乱码的招牌 —— 不是某一家公司工具特有的随机 bug。它们是这些模型工作方式的一个结构性后果:宽泛、宽容的视觉细节(一个整体姿势、一个大致的配色、一个大而明显的动作比如咬一口食物)在统计上很容易做到始终正确,因为有一个很宽的「够接近」的输出范围,它们看起来都对。精细的、受规则约束的细节(某个特定姿势下确切的手指数量、确切的字形、一个在摆动时必须维持物理结构的链环)几乎没有统计近似的余地 —— 接近不等于正确,而且模型没有一个内置的「数手指并核实有五根」的概念。这就是为什么同样几类故障会出现在完全不相关的提示和工具上。
这个过程从不产出的一样东西
每一个扩散步骤都在精修整个画面 —— 主体和背景一起,作为一张图。在那个过程里没有任何一点,模型会把「角色」和「角色背后的一切」分开,所以完成的片段没有内置的透明图层或透明通道,无论是哪个工具生成的。事后把主体抠出来是一个单独的步骤 —— 见AI 背景移除到底是怎么工作的,那是一种确实不同的模型,做的是一件确实不同的工作。
相关:什么是生成式 AI? · AI 背景移除是怎么工作的 · AI 视频背景移除
目前大多数 AI 视频生成器使用扩散模型:这个过程从纯粹的视觉噪声开始(像电视雪花,但铺满整个短片的每一帧),然后以小步反复精修,每一步把噪声轻轻推向一个与文字提示或参考图像相符的连贯图像序列。经过足够多的精修步骤 —— 通常几十步,在专用硬件上非常快地完成 —— 噪声就解析成一段完成的视频片段。这和 AI 图像生成器用的是同一个核心技术,只是从空间扩展到了时间。
文生视频在启动扩散过程时,只由一段文字描述来引导 —— 模型必须仅凭提示发明每一个视觉细节。图生视频从一张真实的参考图像开始,围绕它生成运动和变化,这就是为什么它是大多数「recurring character(反复出现的角色)」内容背后的工作流:当每次生成都从同一张固定的参考图像开始时,让角色在多次单独生成之间保持一致要容易得多,而不是每次都从头重新描述角色。
模型要与其他每一帧保持一致的每增加一帧,都会成倍增加计算成本,以及可见的漂移或误差在整段片段中累积的可能性。大多数工具把单次生成限制在 4 到 10 秒之间,正是这个原因。少数较新的模型能生成更长的单个片段(至少 2026 年的一次发布是最长 30 秒),但 4-10 秒在大多数主要工具里仍是常态。
这些恰恰是那种精细、受规则约束的细节,对一个基于统计、基于模式的模型来说,要精确做对、并逐帧保持一致是最难的。宽泛、宽容的细节(一个整体轮廓、一个大致的配色、一个夸张的大动作)比小的、精确的、结构上严苛的细节可靠得多,这就是为什么同样几类视觉故障会出现在完全不相关的工具和提示上。