Casi todos los removedores de fondo populares se entrenaron para mirar una foto a la vez. Cel tiene que acertar un resultado, y acertarlo de la misma forma, a lo largo de decenas o cientos de fotogramas consecutivos — un problema distinto y más difícil para el que casi nadie ha construido datos de entrenamiento. Cel es la respuesta de RemoveGifBG, y se está construyendo en abierto.
Matting alfa temporal — exactamente el modelo que ya funciona dentro de RemoveGifBG
Construido sobre investigación de segmentación abierta, con licencia MIT — mira "Cómo está construido Cel" más abajo
El conjunto de datos de animación y el pipeline que mantiene un resultado consistente fotograma a fotograma
Un cel — abreviatura de celuloide — es la lámina transparente sobre la que un animador pintaba tradicionalmente un personaje, para luego colocarla sobre un fondo pintado aparte y filmar ambos juntos, sin redibujar toda la escena en cada fotograma. Es literalmente lo que produce este modelo: el arte del personaje, en transparencia, sin fondo.
Una herramienta de imagen única solo tiene que acertar una vez. Una herramienta de GIF o vídeo tiene que acertar de la misma forma decenas o cientos de veces seguidas — y el modo de fallo que eso crea es casi invisible en un benchmark de fotos. Una mancha de fondo eliminada correctamente al 98% a lo largo de un clip entero no se ve 98% bien; si reaparece parpadeando en 2 de 60 fotogramas, se ve rota, porque el movimiento hace evidente la inconsistencia de un modo que un solo píxel mal en una foto nunca logra.
Hay un segundo problema, específico de la animación dibujada a mano y vectorial: a veces un personaje está relleno del mismo blanco, negro o color plano que su propio fondo. Un modelo entrenado con fotos nunca ha tenido que resolver esa ambigüedad — las fotos reales no ponen una camisa blanca sobre un fondo blanco sin costuras a propósito. La animación lo hace constantemente. En nuestra propia revisión de los modelos y herramientas públicos de este espacio, no encontramos ninguno que lo maneje de forma fiable.
Honestamente: pronto. El conjunto de entrenamiento actual son 2052 fotogramas revisados a mano en 20 clips animados — suficiente para demostrar que el enfoque funciona, ni de lejos suficiente para decir que el problema está resuelto. Como referencia, un fine-tune público comparable (ToonOut, un modelo de segmentación centrado en anime) subió su precisión de píxel del 95,3% al 99,5% usando unas 1.200 imágenes etiquetadas de un solo estilo, más estrecho. Un conjunto de datos general de animación — GIFs, hojas de sprites, overlays de stream, bucles de stickers, cada estilo de arte — necesita estar un orden de magnitud por encima de eso, y cada fotograma suyo lo revisa una persona, no solo se etiqueta automáticamente.
Esa brecha entre "funciona" y "resuelto" es exactamente lo que la campaña del conjunto de datos existe para cerrar.
El objetivo no es un modelo de segmentación de propósito general — es el mejor removedor de fondo para animación específicamente, y "mejor" aquí no es un eslogan: se mide categoría por categoría en el benchmark público, actualizado a medida que cada una pasa de abierta a resuelta.
Cómo está construido Cel
Cel está construido sobre investigación de segmentación abierta — la misma base abierta, con licencia MIT, usada en todo este campo — y re-entrenado con nuestro propio conjunto de datos de animación. El pipeline de matting temporal alrededor del modelo — la parte que mantiene un resultado consistente en todos los fotogramas de un clip y que rellena el contenido de color plano que las herramientas estándar se pierden — es trabajo nuestro.
Resuelto: rellenos de color plano (una camisa blanca sobre fondo blanco se rellena, no se deja como un agujero), consistencia entre fotogramas (un elemento de fondo eliminado no reaparece parpadeando en fotogramas aislados) y fondos reales en 3D o fotográficos. Aún abierto: dos objetos separados de color cercano al fondo situados juntos, y line art muy tenue de bajo contraste. El estado completo, categoría por categoría, y cómo se puntúa cada una, está en la página del benchmark.
El cómputo es la parte barata de entrenar un modelo así — un fine-tuning completo cuesta unos pocos dólares de tiempo de GPU. El coste real, y el cuello de botella real, son personas revisando fotogramas: corrigiendo una máscara autogenerada, confirmando un borde, marcando lo que aún se ve mal. La financiación se destina a:
La campaña del conjunto de datos se hará en una plataforma de crowdfunding — todavía no está abierta. Registra tu interés y te avisaremos por correo en cuanto se lance. Cada nivel da más créditos por dólar que cualquier paquete del sitio — un 25–50% más — y los créditos nunca caducan.
Vista previa de niveles — las recompensas y los precios finales se fijan en la página de la campaña en el lanzamiento.
O simplemente usa RemoveGifBG hoy — cada archivo que hace tropezar a Cel se convierte en datos de entrenamiento de mañana. Pruébalo gratis.
Cel es el modelo de matting alfa en el núcleo de RemoveGifBG — el modelo que decide, fotograma a fotograma, qué píxeles pertenecen al sujeto animado y cuáles son fondo. Está construido sobre investigación de segmentación abierta y re-entrenado con el propio conjunto de datos de fotogramas animados de RemoveGifBG, un tipo de datos de entrenamiento que la mayoría de los modelos públicos nunca ve.
Un cel — abreviatura de celuloide — es la lámina transparente sobre la que un animador pintaba tradicionalmente un personaje, para luego colocarla sobre un fondo pintado aparte y filmar ambos juntos. Es literalmente lo que produce este modelo: el arte del personaje, en transparencia, sin fondo.
Ninguna de las dos — es el motor, no un artículo de catálogo. Todo trabajo que ejecutas en RemoveGifBG (en la app o vía API) ya usa Cel; no hay un modelo aparte que seleccionar, ni un "plan Cel". Esta página existe para que veas qué hay de verdad bajo el capó y cómo está mejorando.
La arquitectura sí — Cel está construido sobre investigación de segmentación abierta, con licencia MIT, muy usada en este campo. Lo que es nuestro, y no es abierto, es el conjunto de datos específico de animación y el pipeline temporal construido alrededor del modelo para mantener un resultado consistente en todos los fotogramas, no solo preciso en un fotograma aislado.
Casi todos los modelos de segmentación públicos se entrenan con fotos individuales. Un GIF o vídeo necesita que el mismo sujeto se identifique correctamente decenas o cientos de veces seguidas, con el resultado coherente consigo mismo de fotograma a fotograma — una mancha de fondo que parpadea es mucho más visible que un píxel ligeramente mal en una foto fija. A los modelos entrenados con fotos nunca se les pidió resolver eso.
De dos maneras. Usa RemoveGifBG y cuéntanos sobre cualquier archivo que no maneje de forma limpia — esos se convierten en datos de entrenamiento. O apoya la campaña del conjunto de datos (mira arriba) cuando se abra: tu dinero va directo a fotogramas etiquetados, que es el cuello de botella real.