Por qué "Cel"

Un cel — abreviatura de celuloide — es la lámina transparente sobre la que un animador pintaba tradicionalmente un personaje, para luego colocarla sobre un fondo pintado aparte y filmar ambos juntos, sin redibujar toda la escena en cada fotograma. Es literalmente lo que produce este modelo: el arte del personaje, en transparencia, sin fondo.

Por qué la eliminación de fondo falla en animación

Una herramienta de imagen única solo tiene que acertar una vez. Una herramienta de GIF o vídeo tiene que acertar de la misma forma decenas o cientos de veces seguidas — y el modo de fallo que eso crea es casi invisible en un benchmark de fotos. Una mancha de fondo eliminada correctamente al 98% a lo largo de un clip entero no se ve 98% bien; si reaparece parpadeando en 2 de 60 fotogramas, se ve rota, porque el movimiento hace evidente la inconsistencia de un modo que un solo píxel mal en una foto nunca logra.

Hay un segundo problema, específico de la animación dibujada a mano y vectorial: a veces un personaje está relleno del mismo blanco, negro o color plano que su propio fondo. Un modelo entrenado con fotos nunca ha tenido que resolver esa ambigüedad — las fotos reales no ponen una camisa blanca sobre un fondo blanco sin costuras a propósito. La animación lo hace constantemente. En nuestra propia revisión de los modelos y herramientas públicos de este espacio, no encontramos ninguno que lo maneje de forma fiable.

Dónde está Cel hoy

Honestamente: pronto. El conjunto de entrenamiento actual son 2052 fotogramas revisados a mano en 20 clips animados — suficiente para demostrar que el enfoque funciona, ni de lejos suficiente para decir que el problema está resuelto. Como referencia, un fine-tune público comparable (ToonOut, un modelo de segmentación centrado en anime) subió su precisión de píxel del 95,3% al 99,5% usando unas 1.200 imágenes etiquetadas de un solo estilo, más estrecho. Un conjunto de datos general de animación — GIFs, hojas de sprites, overlays de stream, bucles de stickers, cada estilo de arte — necesita estar un orden de magnitud por encima de eso, y cada fotograma suyo lo revisa una persona, no solo se etiqueta automáticamente.

Esa brecha entre "funciona" y "resuelto" es exactamente lo que la campaña del conjunto de datos existe para cerrar.

El objetivo no es un modelo de segmentación de propósito general — es el mejor removedor de fondo para animación específicamente, y "mejor" aquí no es un eslogan: se mide categoría por categoría en el benchmark público, actualizado a medida que cada una pasa de abierta a resuelta.

Cómo está construido Cel

Cel está construido sobre investigación de segmentación abierta — la misma base abierta, con licencia MIT, usada en todo este campo — y re-entrenado con nuestro propio conjunto de datos de animación. El pipeline de matting temporal alrededor del modelo — la parte que mantiene un resultado consistente en todos los fotogramas de un clip y que rellena el contenido de color plano que las herramientas estándar se pierden — es trabajo nuestro.

Qué maneja Cel hoy — y qué no

Resuelto: rellenos de color plano (una camisa blanca sobre fondo blanco se rellena, no se deja como un agujero), consistencia entre fotogramas (un elemento de fondo eliminado no reaparece parpadeando en fotogramas aislados) y fondos reales en 3D o fotográficos. Aún abierto: dos objetos separados de color cercano al fondo situados juntos, y line art muy tenue de bajo contraste. El estado completo, categoría por categoría, y cómo se puntúa cada una, está en la página del benchmark.

Qué aporta un conjunto de datos más grande

El cómputo es la parte barata de entrenar un modelo así — un fine-tuning completo cuesta unos pocos dólares de tiempo de GPU. El coste real, y el cuello de botella real, son personas revisando fotogramas: corrigiendo una máscara autogenerada, confirmando un borde, marcando lo que aún se ve mal. La financiación se destina a:

Apoya el conjunto de datos

La campaña del conjunto de datos se hará en una plataforma de crowdfunding — todavía no está abierta. Registra tu interés y te avisaremos por correo en cuanto se lance. Cada nivel da más créditos por dólar que cualquier paquete del sitio — un 25–50% más — y los créditos nunca caducan.

Backer $25
  • 800 créditos, ~270 GIFs típicos
  • Nombre en los créditos del conjunto de datos
Founding member $79
  • 2800 créditos, ~930 GIFs típicos
  • Insignia de fundador
  • Acceso anticipado a las versiones de Cel
  • Vota la próxima categoría que arreglamos
Studio $249
  • 10.000 créditos, ~3300 GIFs típicos
  • 5 clips tuyos añadidos al conjunto de entrenamiento, corregidos a tu nombre
Patron $1,000
  • 45.000 créditos, ~15.000 GIFs típicos
  • Todo lo del nivel Studio
  • Aparece como patrocinador del conjunto de datos
  • Una vía directa para un caso de fallo concreto que necesites resolver

Vista previa de niveles — las recompensas y los precios finales se fijan en la página de la campaña en el lanzamiento.

Avísame cuando abra

O simplemente usa RemoveGifBG hoy — cada archivo que hace tropezar a Cel se convierte en datos de entrenamiento de mañana. Pruébalo gratis.

Preguntas frecuentes

¿Qué es Cel?

Cel es el modelo de matting alfa en el núcleo de RemoveGifBG — el modelo que decide, fotograma a fotograma, qué píxeles pertenecen al sujeto animado y cuáles son fondo. Está construido sobre investigación de segmentación abierta y re-entrenado con el propio conjunto de datos de fotogramas animados de RemoveGifBG, un tipo de datos de entrenamiento que la mayoría de los modelos públicos nunca ve.

¿Por qué se llama "Cel"?

Un cel — abreviatura de celuloide — es la lámina transparente sobre la que un animador pintaba tradicionalmente un personaje, para luego colocarla sobre un fondo pintado aparte y filmar ambos juntos. Es literalmente lo que produce este modelo: el arte del personaje, en transparencia, sin fondo.

¿Cel es un producto aparte, o algo que puedo usar directamente?

Ninguna de las dos — es el motor, no un artículo de catálogo. Todo trabajo que ejecutas en RemoveGifBG (en la app o vía API) ya usa Cel; no hay un modelo aparte que seleccionar, ni un "plan Cel". Esta página existe para que veas qué hay de verdad bajo el capó y cómo está mejorando.

¿Cel es de código abierto?

La arquitectura sí — Cel está construido sobre investigación de segmentación abierta, con licencia MIT, muy usada en este campo. Lo que es nuestro, y no es abierto, es el conjunto de datos específico de animación y el pipeline temporal construido alrededor del modelo para mantener un resultado consistente en todos los fotogramas, no solo preciso en un fotograma aislado.

¿Por qué la animación necesita su propio modelo?

Casi todos los modelos de segmentación públicos se entrenan con fotos individuales. Un GIF o vídeo necesita que el mismo sujeto se identifique correctamente decenas o cientos de veces seguidas, con el resultado coherente consigo mismo de fotograma a fotograma — una mancha de fondo que parpadea es mucho más visible que un píxel ligeramente mal en una foto fija. A los modelos entrenados con fotos nunca se les pidió resolver eso.

¿Cómo puedo ayudar?

De dos maneras. Usa RemoveGifBG y cuéntanos sobre cualquier archivo que no maneje de forma limpia — esos se convierten en datos de entrenamiento. O apoya la campaña del conjunto de datos (mira arriba) cuando se abra: tu dinero va directo a fotogramas etiquetados, que es el cuello de botella real.