「AI」被用來描述從垃圾郵件過濾器到聊天機器人、再到做出你資訊流裡那段爆紅影片的工具的一切。這裡講的是「生成式 AI」所指的那一件具體的事、這些模型到底是怎麼學習的,以及本站的工具落在哪裡。
大多數人日常打交道的 AI 大多是判別式的,不是生成式的 —— 它看一個已經存在的東西,並對它做出一個判斷:這封郵件是垃圾郵件嗎,這張照片裡有沒有人臉,接下來該不該給你推薦這個影片。生成式 AI 是另一回事:它不是評判已有內容,而是從一個提示或一個起始輸入產出新內容 —— 一段文字、一張圖像、一段影片、一段語音。ChatGPT 寫郵件、Midjourney 畫圖、Runway 或 Veo 生成影片片段,都是生成式 AI。垃圾郵件過濾器不是,儘管它在更寬泛的意義上仍然是「AI」。
訓練一個生成模型意味著給它看海量的、它要產出的那類東西的真實例子 —— 文本模型是數十億句話,圖像或影片模型是巨大的圖像或影片資料集 —— 並調整模型的內部參數(可以有數十億個),讓它在預測那些資料裡的模式上越來越好:哪個詞合理地跟在後面,哪些像素值合理地挨著哪些其他像素值。關鍵在於,模型不是像搜尋引擎返回一個存好的網頁那樣,在儲存並重放特定的訓練例子。它在學習足夠通用的統計模式,能把它們應用到訓練時從未遇到過的全新提示上 —— 這既是它有用的來源(它能處理真正新穎的請求),也是它最古怪的失敗的來源(它總是在產出它最佳的統計猜測,哪怕那個猜測是錯的)。
生成模型不是在查資料或核實事實 —— 它是在產出所給提示的、統計上最合理的續寫,完全基於訓練中學到的模式。對文本模型,這表現為言之鑿鑿的錯誤資訊,常被稱為「幻覺」。對圖像和影片模型,這表現為在完全不相關的內容上同樣幾類反覆出現的視覺故障:多出的或畸形的手指、扭曲或變成亂碼的首飾和小字、經不起細看的精細細節。這些不是某個工具特有的隨機 bug —— 它們是這類模型在結構上很難做到完全正確的東西的產物:精細的、精確的、受規則約束的細節(確切的手指數量、確切的字形)比寬泛、寬容的目標(一個整體姿勢、一個大致的配色)要更難始終命中。
AI 影片生成器(Runway、Pika、Kling、Seedance、Veo 等)是專門應用於影片的生成式 AI:輸入一段文字描述或一張參考圖像,輸出一段簡短的新影片片段 —— 是模型構建的畫面,不是拍攝的畫面。這和文本或圖像生成器背後是同一個基本思路,只是多了一個複雜之處:每一格都要和周圍的格在視覺上保持一致。關於機制,見我們專門的解釋文章AI 影片生成到底是怎麼運作的;如果你只想知道洗版的那些影片背後是什麼,看我們對新手友好的實際工具導覽。
這一點值得說精確,因為兩者常被混為一談:AI 背景去除(RemoveGifBG 做的事)建立在一個密切相關的神經網路技術家族之上,但它不是同一意義上的生成式。它的工作是分類,不是創造 —— 對圖像或影格裡的每個像素,判斷它是主體的一部分還是背景的一部分,然後保留一個、丟棄另一個。它不像圖像生成器從文字提示發明一整個場景那樣發明新像素;它是在對已經存在的像素做一個保留還是丟棄的判斷。具體見AI 背景去除到底是怎麼運作的,以及為什麼它在影片和 GIF 上比在單張照片上難得多。
簡短版
相關:AI 背景去除是怎麼運作的 · AI 影片是怎麼做出來的(新手指南) · 所有指南
它是一類 AI 模型,被訓練來產出新的內容 —— 文本、圖像、影片、音訊、程式碼 —— 而不只是分類或分析已有的內容。垃圾郵件過濾器(「這封郵件是不是垃圾郵件」)是 AI,但不是生成式的。一個能寫郵件、畫圖,或根據描述生成影片的工具是生成式的:輸出是模型構建出來的新素材,而不是給某個已經存在的東西貼的一個標籤。
訓練讓模型接觸海量的已有示例內容(文本、圖像或影片,取決於它要生成什麼),並調整數百萬或數十億個內部參數,讓模型在預測那些資料裡的模式上越來越好 —— 哪個詞合理地跟在其他詞後面,哪些像素值合理地跟在其他像素值後面。它不是在記住並重放特定的例子;它是在學習足夠通用的統計模式,能應用到訓練時從未見過的全新提示上。
因為模型是在生成統計上最合理的下一個輸出,而不是在查資料或核實事實。對文本來說,這表現為言之鑿鑿的錯誤資訊(「幻覺」)。對圖像和影片來說,這表現為同樣幾類反覆出現的視覺錯誤 —— 多出的手指、扭曲的文字、維持不住形狀的首飾 —— 因為這些恰恰是那種精細的、結構上精確的細節,在整張生成的圖像或整段片段中要保持統計上的一致是最難的。
不完全是,不過它是個近親。AI 背景去除用的是同一個家族的神經網路技術(在海量示例資料上訓練,做像素級的預測),但它的工作是分類,不是生成:對每個像素,它是前景還是背景?它不像圖像生成器那樣創造新像素 —— 它是在決定從一張已經存在的圖像裡保留什麼。