核心工作:對每一個像素做出的一個判斷

AI 背景去除工具建立在一個分割模型之上 —— 一個專門訓練來看一張圖、並為每個像素預測「這個像素屬於主體而非背景」的把握有多大的神經網路。這個預測以每個像素 0 到 255 的一個數字給出:0 表示「肯定是背景」,255 表示「肯定是主體」,中間的任何值都是真實的不確定性。這張灰階置信圖叫做透明遮罩(alpha matte)。最終的透明圖像就是直接由它構建的 —— 高置信度的主體像素保持完全不透明,高置信度的背景像素變得完全透明,中間的值變成部分透明,這正是讓一縷頭髮或一道模糊的毛邊看起來自然柔和、而不是鋸齒狀去背線的原因。

模型是怎麼學會做這個判斷的

訓練一個分割模型意味著給它看海量的示例圖像,每一張都配有一個正確答案 —— 一張經過核實的遮罩,精確標明那張特定圖像裡哪些像素是主體、哪些是背景。經過足夠多的例子,模型的內部參數會調整到能識別那些真正與「主體」和「背景」相關的視覺模式:邊緣、紋理變化、形狀連續性,以及更宏觀的場景上下文,而不只是原始像素顏色。這就是一個訓練良好的模型能對一張它從未見過的圖像做出好判斷的原因 —— 它依據的是從訓練中所見的一切裡學到的模式。

為什麼這比色鍵或「移除這種顏色」工具更好

傳統的色鍵或手動移除顏色的工具,做判斷時恰好只用一條資訊:這個像素的顏色和它被告知要針對的那個特定背景色有多接近。這在平坦、均勻的綠幕上沒問題 —— 但一旦主體和背景有相同的顏色(白牆前的白襯衫、米色背景前的米色毛髮),或者背景根本不是單一的純色(一個真實拍攝的場景、漸層、紋理),它在結構上就會失敗。AI 分割模型不侷限於顏色 —— 它使用學到的形狀和上下文,所以它能正確地把白襯衫和它背後的白牆區分開來,這是純色鍵方法按定義就做不到的,無論怎麼調參。

第一次 AI 處理之後會發生什麼

實際上,分割模型的一次原始處理很少能靠自己產出一張完美的遮罩 —— 真實圖像有模糊的邊緣、低置信度的區域,以及真正難以分類的內容(具體見為什麼在 GIF 和影片上會難得多)。一個生產級去背管線在那第一次 AI 處理之外實際做的大部分工作,是清理:用形狀和連通性邏輯解決低置信度區域、平滑邊緣,以及 —— 特別是對動畫 —— 檢查模型的判斷在一格到下一格之間彼此一致,好讓結果不閃爍。AI 分割模型做核心的分類;讓它的原始輸出變得可用,需要大量的工程。

和 AI 圖像或影片生成不同的一項工作

這裡值得說精確一點,因為在日常對話裡兩者都叫「AI」:圖像或影片生成器根據提示發明新的像素內容(見AI 影片生成到底是怎麼運作的)。而背景去除所依賴的分割模型什麼也不發明 —— 它對已經存在的像素做分類。同屬神經網路技術的大家族,但做的確實是不同的工作。

在你自己的圖像、GIF 或影片上試試

相關:動畫去背為什麼這麼難 · 什麼是生成式 AI? · 透明背景為什麼重要

常見問題

AI 背景去除到底是怎麼運作的?

一個在海量示例圖像上訓練過的神經網路(每張圖都配有一個經過核實的正確答案,標明這張圖裡究竟哪些像素是主體、哪些是背景),會看一張新圖,並為每個像素預測一個從 0(肯定是背景)到 255(肯定是主體)的置信分數 —— 這就是透明遮罩(alpha matte)。高於置信閾值的像素保持不透明,低於的變透明,中間的得到部分透明,這正是讓頭髮或毛髮這樣的柔和邊緣看起來自然、而不是鋸齒狀的原因。

這和綠幕或色鍵工具有什麼不同?

色鍵工具(色鍵,或手動的「移除這種顏色」濾鏡)做判斷時只用一條資訊:這個像素的顏色和我讓它移除的背景色有多接近。這在均勻的綠幕上沒問題,但一旦主體和背景有相同的顏色,或者背景根本就不均勻,它就完全失效。AI 分割是用學到的視覺模式來判斷的 —— 邊緣、形狀、紋理、上下文 —— 所以它能正確地把白襯衫和白牆分開,而純色鍵工具在結構上做不到這一點。

什麼是透明遮罩(alpha matte)?

它是分割模型在做任何裁切之前產生的灰階置信圖 —— 每個像素一個值,白色表示完全不透明/主體,黑色表示完全透明/背景,中間的灰值代表部分透明。最終圖像真正的透明度(它的透明通道)就是直接由這張遮罩構建的。一張更乾淨、更有把握的遮罩,會產出一個更乾淨的最終去背。

這和生成 AI 影片和圖像的那種 AI 是同一種嗎?

相關,但做的是不同的工作。生成模型(AI 影片和圖像工具背後的)根據提示創造新的像素內容。分割模型(背景去除背後的)把已有的像素分類為主體還是背景 —— 它們不發明任何新東西。兩者都是在大型資料集上訓練的神經網路,但一個的輸出是新內容,另一個的輸出是關於已經存在的內容的一個判斷。