几乎所有主流背景移除工具都是一次只看一张照片来训练的。Cel 必须把结果做对,而且在连续几十甚至几百帧里以同样的方式做对 —— 这是一个不同的、更难的问题,几乎没人为它建过训练数据。Cel 是 RemoveGifBG 的答案,而且它是公开构建的。
时序 alpha 抠像 —— 正是 RemoveGifBG 内部已在运行的那个模型
构建在开放的、采用 MIT 许可的分割研究之上 —— 见下方「Cel 是如何构建的」
动画数据集,以及让结果在帧与帧之间保持一致的处理流程
cel —— celluloid(赛璐珞)的简称 —— 是动画师传统上把角色画在上面的透明胶片,然后叠在单独绘制的背景上,让两者可以一起拍摄,而不必为每一帧重画整个场景。这个模型产出的正是这个:角色画面,在透明层上,背景没了。
单张图片的工具只需要对一次。GIF 或视频的工具必须以同样的方式连续对几十次甚至几百次 —— 而这造成的失效模式,在照片基准测试里几乎看不出来。一块在整段片子里被 98% 正确移除的背景,看起来并不像 98% 那么好;如果它在 60 帧里有 2 帧闪回,看起来就是坏的,因为运动会让不一致变得明显,而静态照片里一个出错的像素永远做不到这一点。
还有第二个问题,是手绘和矢量动画特有的:角色有时被填充成和自身背景一样的白色、黑色或纯色。在照片上训练的模型从来不需要解决这种歧义 —— 真实照片不会故意把白衬衫放在纯白无缝背景前。动画却一直这么干。在我们对这个领域的公开模型和工具的评估里,我们没找到一个能可靠处理它的。
说实话:还很早。目前的训练集是跨 20 段动画片段、经人工审阅的 2,052 帧 —— 足以证明这个方法可行,但远不足以说问题已解决。作为对比,一个类似的公开微调(ToonOut,一个专注动漫的分割模型)用大约 1,200 张单一、更窄风格的标注图片,把像素准确率从 95.3% 提升到 99.5%。一个覆盖动画全领域的数据集 —— GIF、精灵图、直播叠加层、贴纸循环、各种美术风格 —— 需要比那再高一个数量级,而且它的每一帧都由人审阅,不只是自动标注。
「可行」和「已解决」之间的这道鸿沟,正是数据集众筹存在的意义。
目标不是一个通用的分割模型 —— 而是专门面向动画的最好的背景移除工具,而且这里的「最好」不是口号:它在公开基准测试上逐类别衡量,并随着每个类别从待解决变为已解决而更新。
Cel 是如何构建的
Cel 构建在开放的分割研究之上 —— 就是这个领域普遍使用的、开放的、采用 MIT 许可的基础 —— 并在我们自己的动画数据集上重新训练。围绕模型的时序抠像流程 —— 让结果在片段的每一帧上都保持一致、并填补标准工具漏掉的纯色内容的那部分 —— 是我们自己的工作。
已解决:纯色填充(白底上的白衬衫会被填充,而不是留下一个洞)、帧间一致性(被移除的背景元素不会在个别帧上闪回)、以及真实的 3D 或照片背景。仍待解决:两个颜色都接近背景、彼此靠得很近的独立物体,以及非常淡的低对比度线稿。完整的逐类别状态,以及每一类是如何评分的,都在基准测试页面。
训练这样一个模型,算力是便宜的部分 —— 一次完整的微调只花几美元的 GPU 时间。真正的成本、真正的瓶颈,是人在审阅帧:修正自动生成的蒙版、确认边缘、标记出还看着不对的地方。资金用于:
数据集众筹会在一个众筹平台上进行 —— 目前还没开启。留下你的联系方式,一上线我们就发邮件通知你。每个档位每一美元换到的积分都比站上任何套餐更多 —— 多 25–50% —— 而且积分永不过期。
档位预览 —— 最终的回报和价格以上线时众筹页面为准。
或者今天就用 RemoveGifBG —— 每一个难住 Cel 的文件,都会成为明天的训练数据。免费试用。
Cel 是 RemoveGifBG 核心的 alpha 抠像模型 —— 它逐帧决定哪些像素属于动画主体、哪些是背景。它构建在开放的分割研究之上,并在 RemoveGifBG 自己的动画帧数据集上重新训练 —— 这类训练数据大多数公开模型从未见过。
cel —— celluloid(赛璐珞)的简称 —— 是动画师传统上把角色画在上面的透明胶片,然后叠在单独绘制的背景上,让两者可以一起拍摄。这个模型产出的正是这个:角色画面,在透明层上,背景没了。
都不是 —— 它是引擎,不是一个单独的商品。你在 RemoveGifBG 上运行的每一个任务(无论在应用里还是通过 API)都已经在用 Cel;没有单独的模型可选,也没有「Cel 套餐」。这个页面的存在,是让你能看到引擎盖下到底是什么,以及它是如何改进的。
架构是开源的 —— Cel 构建在这个领域广泛使用的、开放的、采用 MIT 许可的分割研究之上。属于我们、且不开放的,是针对动画的数据集,以及围绕模型构建的时序流程 —— 它让结果在每一帧上都保持一致,而不只是在孤立的某一帧上准确。
几乎所有公开的分割模型都是在单张照片上训练的。一个 GIF 或视频需要同一个主体被连续几十次甚至几百次正确识别,而且结果要在帧与帧之间自洽 —— 一块忽隐忽现的背景,比静态照片里一个略微出错的像素显眼得多。在照片上训练的模型从来没被要求解决这个问题。
两种方式。使用 RemoveGifBG,并告诉我们任何它没能干净处理的文件 —— 这些会变成训练数据。或者在数据集众筹开启时支持它(见上文):你的钱会直接用于带标注的帧,而这正是真正的瓶颈。