为什么叫「Cel」

cel —— celluloid(赛璐珞)的简称 —— 是动画师传统上把角色画在上面的透明胶片,然后叠在单独绘制的背景上,让两者可以一起拍摄,而不必为每一帧重画整个场景。这个模型产出的正是这个:角色画面,在透明层上,背景没了。

为什么背景移除在动画上会失灵

单张图片的工具只需要对一次。GIF 或视频的工具必须以同样的方式连续对几十次甚至几百次 —— 而这造成的失效模式,在照片基准测试里几乎看不出来。一块在整段片子里被 98% 正确移除的背景,看起来并不像 98% 那么好;如果它在 60 帧里有 2 帧闪回,看起来就是坏的,因为运动会让不一致变得明显,而静态照片里一个出错的像素永远做不到这一点。

还有第二个问题,是手绘和矢量动画特有的:角色有时被填充成和自身背景一样的白色、黑色或纯色。在照片上训练的模型从来不需要解决这种歧义 —— 真实照片不会故意把白衬衫放在纯白无缝背景前。动画却一直这么干。在我们对这个领域的公开模型和工具的评估里,我们没找到一个能可靠处理它的。

Cel 目前的进展

说实话:还很早。目前的训练集是跨 20 段动画片段、经人工审阅的 2,052 帧 —— 足以证明这个方法可行,但远不足以说问题已解决。作为对比,一个类似的公开微调(ToonOut,一个专注动漫的分割模型)用大约 1,200 张单一、更窄风格的标注图片,把像素准确率从 95.3% 提升到 99.5%。一个覆盖动画全领域的数据集 —— GIF、精灵图、直播叠加层、贴纸循环、各种美术风格 —— 需要比那再高一个数量级,而且它的每一帧都由人审阅,不只是自动标注。

「可行」和「已解决」之间的这道鸿沟,正是数据集众筹存在的意义。

目标不是一个通用的分割模型 —— 而是专门面向动画的最好的背景移除工具,而且这里的「最好」不是口号:它在公开基准测试上逐类别衡量,并随着每个类别从待解决变为已解决而更新。

Cel 是如何构建的

Cel 构建在开放的分割研究之上 —— 就是这个领域普遍使用的、开放的、采用 MIT 许可的基础 —— 并在我们自己的动画数据集上重新训练。围绕模型的时序抠像流程 —— 让结果在片段的每一帧上都保持一致、并填补标准工具漏掉的纯色内容的那部分 —— 是我们自己的工作。

Cel 今天能处理什么 —— 以及不能处理什么

已解决:纯色填充(白底上的白衬衫会被填充,而不是留下一个洞)、帧间一致性(被移除的背景元素不会在个别帧上闪回)、以及真实的 3D 或照片背景。仍待解决:两个颜色都接近背景、彼此靠得很近的独立物体,以及非常淡的低对比度线稿。完整的逐类别状态,以及每一类是如何评分的,都在基准测试页面

更大的数据集能带来什么

训练这样一个模型,算力是便宜的部分 —— 一次完整的微调只花几美元的 GPU 时间。真正的成本、真正的瓶颈,是人在审阅帧:修正自动生成的蒙版、确认边缘、标记出还看着不对的地方。资金用于:

支持这个数据集

数据集众筹会在一个众筹平台上进行 —— 目前还没开启。留下你的联系方式,一上线我们就发邮件通知你。每个档位每一美元换到的积分都比站上任何套餐更多 —— 多 25–50% —— 而且积分永不过期。

Backer $25
  • 800 积分,约 270 个常规 GIF
  • 在数据集致谢名单中署名
Founding member $79
  • 2,800 积分,约 930 个常规 GIF
  • 创始成员徽章
  • 抢先体验 Cel 的新版本
  • 投票决定我们下一个攻克的类别
Studio $249
  • 10,000 积分,约 3,300 个常规 GIF
  • 将你自己的 5 个片段加入训练集,以你的名义修复
Patron $1,000
  • 45,000 积分,约 15,000 个常规 GIF
  • 包含 Studio 档位的全部内容
  • 列为数据集赞助者
  • 一条直达渠道,处理你需要解决的特定失败案例

档位预览 —— 最终的回报和价格以上线时众筹页面为准。

开启时通知我

或者今天就用 RemoveGifBG —— 每一个难住 Cel 的文件,都会成为明天的训练数据。免费试用

常见问题

Cel 是什么?

Cel 是 RemoveGifBG 核心的 alpha 抠像模型 —— 它逐帧决定哪些像素属于动画主体、哪些是背景。它构建在开放的分割研究之上,并在 RemoveGifBG 自己的动画帧数据集上重新训练 —— 这类训练数据大多数公开模型从未见过。

为什么叫「Cel」?

cel —— celluloid(赛璐珞)的简称 —— 是动画师传统上把角色画在上面的透明胶片,然后叠在单独绘制的背景上,让两者可以一起拍摄。这个模型产出的正是这个:角色画面,在透明层上,背景没了。

Cel 是一个独立产品吗,还是我可以直接使用的东西?

都不是 —— 它是引擎,不是一个单独的商品。你在 RemoveGifBG 上运行的每一个任务(无论在应用里还是通过 API)都已经在用 Cel;没有单独的模型可选,也没有「Cel 套餐」。这个页面的存在,是让你能看到引擎盖下到底是什么,以及它是如何改进的。

Cel 是开源的吗?

架构是开源的 —— Cel 构建在这个领域广泛使用的、开放的、采用 MIT 许可的分割研究之上。属于我们、且不开放的,是针对动画的数据集,以及围绕模型构建的时序流程 —— 它让结果在每一帧上都保持一致,而不只是在孤立的某一帧上准确。

为什么动画需要专门的模型?

几乎所有公开的分割模型都是在单张照片上训练的。一个 GIF 或视频需要同一个主体被连续几十次甚至几百次正确识别,而且结果要在帧与帧之间自洽 —— 一块忽隐忽现的背景,比静态照片里一个略微出错的像素显眼得多。在照片上训练的模型从来没被要求解决这个问题。

我能怎么帮忙?

两种方式。使用 RemoveGifBG,并告诉我们任何它没能干净处理的文件 —— 这些会变成训练数据。或者在数据集众筹开启时支持它(见上文):你的钱会直接用于带标注的帧,而这正是真正的瓶颈。