幾乎所有主流背景移除工具都是一次只看一張照片來訓練的。Cel 必須把結果做對,而且在連續幾十甚至幾百幀裡以同樣的方式做對 —— 這是一個不同的、更難的問題,幾乎沒人為它建過訓練資料。Cel 是 RemoveGifBG 的答案,而且它是公開構建的。
時序 alpha 去背 —— 正是 RemoveGifBG 內部已在運行的那個模型
構建在開放的、採用 MIT 授權的分割研究之上 —— 見下方「Cel 是如何構建的」
動畫資料集,以及讓結果在畫面與畫面之間保持一致的處理流程
cel —— celluloid(賽璐珞)的簡稱 —— 是動畫師傳統上把角色畫在上面的透明膠片,然後疊在單獨繪製的背景上,讓兩者可以一起拍攝,而不必為每一幀重畫整個場景。這個模型產出的正是這個:角色畫面,在透明層上,背景沒了。
單張圖片的工具只需要對一次。GIF 或影片的工具必須以同樣的方式連續對幾十次甚至幾百次 —— 而這造成的失效模式,在照片基準測試裡幾乎看不出來。一塊在整段片子裡被 98% 正確移除的背景,看起來並不像 98% 那麼好;如果它在 60 幀裡有 2 幀閃回,看起來就是壞的,因為運動會讓不一致變得明顯,而靜態照片裡一個出錯的像素永遠做不到這一點。
還有第二個問題,是手繪和向量動畫特有的:角色有時被填充成和自身背景一樣的白色、黑色或純色。在照片上訓練的模型從來不需要解決這種歧義 —— 真實照片不會故意把白襯衫放在純白無縫背景前。動畫卻一直這麼幹。在我們對這個領域的公開模型和工具的評估裡,我們沒找到一個能可靠處理它的。
說實話:還很早。目前的訓練集是跨 20 段動畫片段、經人工審閱的 2,052 幀 —— 足以證明這個方法可行,但遠不足以說問題已解決。作為對比,一個類似的公開微調(ToonOut,一個專注動漫的分割模型)用大約 1,200 張單一、更窄風格的標註圖片,把像素準確率從 95.3% 提升到 99.5%。一個涵蓋動畫全領域的資料集 —— GIF、精靈圖、直播疊加層、貼紙循環、各種美術風格 —— 需要比那再高一個數量級,而且它的每一幀都由人審閱,不只是自動標註。
「可行」和「已解決」之間的這道鴻溝,正是資料集群眾募資存在的意義。
目標不是一個通用的分割模型 —— 而是專門面向動畫的最好的背景移除工具,而且這裡的「最好」不是口號:它在公開基準測試上逐類別衡量,並隨著每個類別從待解決變為已解決而更新。
Cel 是如何構建的
Cel 構建在開放的分割研究之上 —— 就是這個領域普遍使用的、開放的、採用 MIT 授權的基礎 —— 並在我們自己的動畫資料集上重新訓練。圍繞模型的時序去背流程 —— 讓結果在片段的每一幀上都保持一致、並填補標準工具漏掉的純色內容的那部分 —— 是我們自己的工作。
已解決:純色填充(白底上的白襯衫會被填充,而不是留下一個洞)、幀間一致性(被移除的背景元素不會在個別幀上閃回)、以及真實的 3D 或照片背景。仍待解決:兩個顏色都接近背景、彼此靠得很近的獨立物體,以及非常淡的低對比度線稿。完整的逐類別狀態,以及每一類是如何評分的,都在基準測試頁面。
訓練這樣一個模型,算力是便宜的部分 —— 一次完整的微調只花幾美元的 GPU 時間。真正的成本、真正的瓶頸,是人在審閱幀:修正自動生成的遮罩、確認邊緣、標記出還看著不對的地方。資金用於:
資料集群眾募資會在一個群眾募資平台上進行 —— 目前還沒開啟。留下你的聯絡方式,一上線我們就寄郵件通知你。每個層級每一美元換到的點數都比站上任何方案更多 —— 多 25–50% —— 而且點數永不過期。
層級預覽 —— 最終的回饋和價格以上線時群眾募資頁面為準。
或者今天就用 RemoveGifBG —— 每一個難住 Cel 的檔案,都會成為明天的訓練資料。免費試用。
Cel 是 RemoveGifBG 核心的 alpha 去背模型 —— 它逐幀決定哪些像素屬於動畫主體、哪些是背景。它構建在開放的分割研究之上,並在 RemoveGifBG 自己的動畫幀資料集上重新訓練 —— 這類訓練資料大多數公開模型從未見過。
cel —— celluloid(賽璐珞)的簡稱 —— 是動畫師傳統上把角色畫在上面的透明膠片,然後疊在單獨繪製的背景上,讓兩者可以一起拍攝。這個模型產出的正是這個:角色畫面,在透明層上,背景沒了。
都不是 —— 它是引擎,不是一個單獨的商品。你在 RemoveGifBG 上運行的每一個任務(無論在應用裡還是透過 API)都已經在用 Cel;沒有單獨的模型可選,也沒有「Cel 方案」。這個頁面的存在,是讓你能看到引擎蓋下到底是什麼,以及它是如何改進的。
架構是開源的 —— Cel 構建在這個領域廣泛使用的、開放的、採用 MIT 授權的分割研究之上。屬於我們、且不開放的,是針對動畫的資料集,以及圍繞模型構建的時序流程 —— 它讓結果在每一幀上都保持一致,而不只是在孤立的某一幀上準確。
幾乎所有公開的分割模型都是在單張照片上訓練的。一個 GIF 或影片需要同一個主體被連續幾十次甚至幾百次正確識別,而且結果要在畫面與畫面之間自洽 —— 一塊忽隱忽現的背景,比靜態照片裡一個略微出錯的像素顯眼得多。在照片上訓練的模型從來沒被要求解決這個問題。
兩種方式。使用 RemoveGifBG,並告訴我們任何它沒能乾淨處理的檔案 —— 這些會變成訓練資料。或者在資料集群眾募資開啟時支持它(見上文):你的錢會直接用於帶標註的幀,而這正是真正的瓶頸。