不是 CGI。不是濾鏡。也不是任何曾被拍攝過的東西的畫面。這裡講的是當你輸入一個提示、拿回一段影片時,底層實際發生的事。
目前大多數 AI 影片生成器建立在擴散模型之上。與直覺相反,生成不是從無到有地搭建 —— 它從純粹的隨機視覺噪聲開始,也就是影片版的電視雪花,鋪滿片段的每一格。然後模型執行一系列精修步驟,在每一步,它預測如何把那團噪聲輕輕推向一個與給定的文字提示或參考圖像相符的連貫影片。把這個精修重複幾十次 —— 在專用 AI 硬體上極快地完成 —— 噪聲就逐漸解析成一段完成的片段。這和 Midjourney 或 Gemini 的圖像模型這類 AI 圖像生成器背後是同一個核心技術,只是從單格的寬和高,擴展到了時間。
做這個噪聲精修的模型並不是在瞎猜 —— 它在訓練時,從海量的真實影片裡學到了,一個照片級真實的動作、一個特定的物體,或一個被描述的場景通常長什麼樣。那個訓練過程會調整數十億個內部參數,讓模型的噪聲精修預測在匹配真實影片(以及與之配對的文字描述)的實際樣子上越來越好。結果是一個模型,它能為一個訓練時從未見過的提示產出一段看起來合理的影片,方法是把它從所見的一切裡學到的統計模式加以組合和重組。
每個主要工具都支援兩種起點,它們在底層的工作方式不同:
讓片段的每一格和其他每一格在視覺上保持一致 —— 同一個角色、同樣的光照、沒有隨機閃爍或漂移的細節 —— 會隨著片段變長而在計算上變得更難,而小的誤差會在更長的序列上累積,就像一個小的測量誤差會在更長的計算中累積一樣。這就是大多數工具把單次生成限制在 4 到 10 秒之間的現實原因:這接近當前模型在一次處理中、以合理的速度和成本能保持連貫的極限。2026 年有新一代模型突破了這一點(那年 8 月發布的一款能在單次處理中生成最多 30 秒),但 4-10 秒在大多數主要工具裡仍是常態,而你在網上看到的更長的「影片」,通常是幾次單獨生成剪在一起的,而不是一段連續的片段。
那些反覆出現的視覺錯誤 —— 多出來一根手指、運動中扭曲的首飾、算圖成亂碼的招牌 —— 不是某一家公司工具特有的隨機 bug。它們是這些模型工作方式的一個結構性後果:寬泛、寬容的視覺細節(一個整體姿勢、一個大致的配色、一個大而明顯的動作比如咬一口食物)在統計上很容易做到始終正確,因為有一個很寬的「夠接近」的輸出範圍,它們看起來都對。精細的、受規則約束的細節(某個特定姿勢下確切的手指數量、確切的字形、一個在擺動時必須維持物理結構的鏈環)幾乎沒有統計近似的餘地 —— 接近不等於正確,而且模型沒有一個內建的「數手指並核實有五根」的概念。這就是為什麼同樣幾類故障會出現在完全不相關的提示和工具上。
這個過程從不產出的一樣東西
每一個擴散步驟都在精修整個畫面 —— 主體和背景一起,作為一張圖。在那個過程裡沒有任何一點,模型會把「角色」和「角色背後的一切」分開,所以完成的片段沒有內建的透明圖層或透明通道,無論是哪個工具生成的。事後把主體摳出來是一個單獨的步驟 —— 見AI 背景去除到底是怎麼運作的,那是一種確實不同的模型,做的是一件確實不同的工作。
相關:什麼是生成式 AI? · AI 背景去除是怎麼運作的 · AI 影片背景去除
目前大多數 AI 影片生成器使用擴散模型:這個過程從純粹的視覺噪聲開始(像電視雪花,但鋪滿整個短片的每一格),然後以小步反覆精修,每一步把噪聲輕輕推向一個與文字提示或參考圖像相符的連貫圖像序列。經過足夠多的精修步驟 —— 通常幾十步,在專用硬體上非常快地完成 —— 噪聲就解析成一段完成的影片片段。這和 AI 圖像生成器用的是同一個核心技術,只是從空間擴展到了時間。
文生影片在啟動擴散過程時,只由一段文字描述來引導 —— 模型必須僅憑提示發明每一個視覺細節。圖生影片從一張真實的參考圖像開始,圍繞它生成運動和變化,這就是為什麼它是大多數「recurring character(反覆出現的角色)」內容背後的工作流:當每次生成都從同一張固定的參考圖像開始時,讓角色在多次單獨生成之間保持一致要容易得多,而不是每次都從頭重新描述角色。
模型要與其他每一格保持一致的每增加一格,都會成倍增加計算成本,以及可見的漂移或誤差在整段片段中累積的可能性。大多數工具把單次生成限制在 4 到 10 秒之間,正是這個原因。少數較新的模型能生成更長的單個片段(至少 2026 年的一次發布是最長 30 秒),但 4-10 秒在大多數主要工具裡仍是常態。
這些恰恰是那種精細、受規則約束的細節,對一個基於統計、基於模式的模型來說,要精確做對、並逐格保持一致是最難的。寬泛、寬容的細節(一個整體輪廓、一個大致的配色、一個誇張的大動作)比小的、精確的、結構上嚴苛的細節可靠得多,這就是為什麼同樣幾類視覺故障會出現在完全不相關的工具和提示上。