Pourquoi « Cel »

Un cel — abréviation de celluloïd — est la feuille transparente sur laquelle un animateur peignait traditionnellement un personnage, avant de la poser sur un décor peint séparément pour filmer les deux ensemble, sans redessiner toute la scène à chaque image. C'est littéralement ce que ce modèle produit : l'art du personnage, en transparence, sans l'arrière-plan.

Pourquoi la suppression d'arrière-plan échoue sur l'animation

Un outil pour image unique n'a besoin d'avoir raison qu'une fois. Un outil pour GIF ou vidéo doit avoir raison de la même façon des dizaines ou des centaines de fois de suite — et le mode d'échec que cela crée est presque invisible dans un benchmark de photos. Une zone d'arrière-plan supprimée correctement à 98 % sur tout un clip n'a pas l'air bonne à 98 % ; si elle réapparaît sur 2 images sur 60, ça a l'air cassé, parce que le mouvement rend l'incohérence évidente comme un seul pixel faux sur une photo ne le fait jamais.

Il y a un second problème, propre à l'animation dessinée à la main et vectorielle : un personnage est parfois rempli du même blanc, noir ou aplat de couleur que son propre arrière-plan. Un modèle entraîné sur photos n'a jamais eu à résoudre cette ambiguïté — les vraies photos ne mettent pas exprès une chemise blanche sur un fond blanc sans raccord. L'animation le fait sans arrêt. Lors de notre propre revue des modèles et outils publics de ce domaine, nous n'en avons trouvé aucun qui gère ça de façon fiable.

Où en est Cel aujourd'hui

Honnêtement : c'est tôt. Le jeu d'entraînement actuel compte 2 052 images relues à la main sur 20 clips animés — assez pour prouver que l'approche fonctionne, loin d'être assez pour dire le problème résolu. Pour situer, un fine-tune public comparable (ToonOut, un modèle de segmentation axé anime) a fait passer sa précision au pixel de 95,3 % à 99,5 % avec environ 1 200 images annotées d'un seul style, plus restreint. Un jeu de données généraliste pour l'animation — GIF, feuilles de sprites, overlays de stream, boucles de stickers, tous les styles — doit être un ordre de grandeur au-dessus, et chacune de ses images est relue par une personne, pas seulement étiquetée automatiquement.

C'est précisément cet écart entre « ça marche » et « c'est résolu » que la campagne du jeu de données vise à combler.

L'objectif n'est pas un modèle de segmentation généraliste — c'est le meilleur suppresseur d'arrière-plan pour l'animation en particulier, et « meilleur » n'est pas un slogan ici : c'est mesuré catégorie par catégorie sur le benchmark public, mis à jour à mesure que chacune passe de non résolue à résolue.

Comment Cel est construit

Cel est construit sur de la recherche en segmentation ouverte — la même base ouverte, sous licence MIT, utilisée dans tout le domaine — et ré-entraîné sur notre propre jeu de données d'animation. Le pipeline de matting temporel autour du modèle — la partie qui garde un résultat cohérent sur chaque image d'un clip, et qui remplit le contenu en aplat que les outils standard ratent — est notre propre travail.

Ce que Cel gère aujourd'hui — et ce qu'il ne gère pas

Résolu : les aplats de couleur (une chemise blanche sur fond blanc est remplie, pas laissée en trou), la cohérence entre images (un élément d'arrière-plan supprimé ne réapparaît pas sur des images isolées) et les décors réels en 3D ou photographiques. Encore ouvert : deux objets distincts proches de la couleur du fond situés l'un près de l'autre, et le dessin au trait très pâle à faible contraste. Le statut complet, catégorie par catégorie, et la façon dont chacune est notée, sont sur la page du benchmark.

Ce qu'un jeu de données plus grand apporte

Le calcul est la partie bon marché de l'entraînement d'un tel modèle — un fine-tuning complet coûte quelques dollars de temps GPU. Le vrai coût, et le vrai goulot d'étranglement, ce sont des personnes qui relisent des images : corriger un masque généré automatiquement, confirmer un bord, signaler ce qui semble encore faux. Le financement sert à :

Soutenez le jeu de données

La campagne du jeu de données se déroulera sur une plateforme de financement participatif — elle n'est pas encore ouverte. Laissez vos coordonnées et nous vous préviendrons par e-mail dès son lancement. Chaque niveau donne plus de crédits par dollar que n'importe quel pack du site — 25 à 50 % de plus — et les crédits n'expirent jamais.

Backer $25
  • 800 crédits, ~270 GIFs typiques
  • Votre nom dans les crédits du jeu de données
Founding member $79
  • 2 800 crédits, ~930 GIFs typiques
  • Badge de fondateur
  • Accès anticipé aux versions de Cel
  • Votez pour la prochaine catégorie à corriger
Studio $249
  • 10 000 crédits, ~3 300 GIFs typiques
  • 5 de vos propres clips ajoutés au jeu d'entraînement, corrigés à votre nom
Patron $1,000
  • 45 000 crédits, ~15 000 GIFs typiques
  • Tout ce qui est inclus dans le niveau Studio
  • Mentionné comme sponsor du jeu de données
  • Une ligne directe pour un cas d'échec précis que vous avez besoin de résoudre

Aperçu des niveaux — les récompenses et tarifs définitifs sont fixés sur la page de campagne au lancement.

Prévenez-moi à l'ouverture

Ou utilisez simplement RemoveGifBG aujourd'hui — chaque fichier qui fait trébucher Cel devient les données d'entraînement de demain. Essayez gratuitement.

Questions fréquentes

Qu'est-ce que Cel ?

Cel est le modèle de matting alpha au cœur de RemoveGifBG — le modèle qui décide, image par image, quels pixels appartiennent au sujet animé et lesquels sont l'arrière-plan. Il est construit sur de la recherche en segmentation ouverte et ré-entraîné sur le propre jeu de données d'images animées de RemoveGifBG, un type de données d'entraînement que la plupart des modèles publics ne voient jamais.

Pourquoi « Cel » ?

Un cel — abréviation de celluloïd — est la feuille transparente sur laquelle un animateur peignait traditionnellement un personnage, avant de la poser sur un décor peint séparément pour filmer les deux ensemble. C'est littéralement ce que ce modèle produit : l'art du personnage, en transparence, sans l'arrière-plan.

Cel est-il un produit à part, ou quelque chose que je peux utiliser directement ?

Ni l'un ni l'autre — c'est le moteur, pas une référence catalogue. Chaque traitement que vous lancez sur RemoveGifBG (dans l'app ou via l'API) utilise déjà Cel ; il n'y a pas de modèle séparé à sélectionner, pas de « forfait Cel ». Cette page existe pour que vous voyiez ce qu'il y a vraiment sous le capot et comment ça s'améliore.

Cel est-il open source ?

L'architecture, oui — Cel est construit sur de la recherche en segmentation ouverte, sous licence MIT, largement utilisée dans ce domaine. Ce qui est à nous, et n'est pas ouvert, c'est le jeu de données spécifique à l'animation et le pipeline temporel construit autour du modèle pour garder un résultat cohérent sur chaque image, pas seulement exact sur une image isolée.

Pourquoi l'animation a-t-elle besoin de son propre modèle ?

Presque tous les modèles de segmentation publics sont entraînés sur des photos isolées. Un GIF ou une vidéo exige que le même sujet soit correctement identifié des dizaines ou des centaines de fois de suite, avec un résultat cohérent d'image en image — une zone d'arrière-plan qui clignote est bien plus visible qu'un pixel légèrement faux sur une photo fixe. On n'a jamais demandé aux modèles entraînés sur photos de résoudre ça.

Comment puis-je aider ?

De deux façons. Utilisez RemoveGifBG et signalez-nous tout fichier qu'il ne traite pas proprement — ils deviennent des données d'entraînement. Ou soutenez la campagne du jeu de données (voir ci-dessus) à son ouverture : votre argent va directement à des images annotées, le vrai goulot d'étranglement.