Presque tous les suppresseurs d'arrière-plan grand public ont été entraînés à regarder une photo à la fois. Cel doit réussir un résultat, et le réussir de la même façon, sur des dizaines ou des centaines d'images consécutives — un problème différent et plus difficile, pour lequel presque personne n'a constitué de données d'entraînement. Cel est la réponse de RemoveGifBG, et il est développé au grand jour.
Matting alpha temporel — exactement le modèle qui tourne déjà dans RemoveGifBG
Construit sur de la recherche en segmentation ouverte, sous licence MIT — voir « Comment Cel est construit » plus bas
Le jeu de données d'animation, et le pipeline qui garde un résultat cohérent d'image en image
Un cel — abréviation de celluloïd — est la feuille transparente sur laquelle un animateur peignait traditionnellement un personnage, avant de la poser sur un décor peint séparément pour filmer les deux ensemble, sans redessiner toute la scène à chaque image. C'est littéralement ce que ce modèle produit : l'art du personnage, en transparence, sans l'arrière-plan.
Un outil pour image unique n'a besoin d'avoir raison qu'une fois. Un outil pour GIF ou vidéo doit avoir raison de la même façon des dizaines ou des centaines de fois de suite — et le mode d'échec que cela crée est presque invisible dans un benchmark de photos. Une zone d'arrière-plan supprimée correctement à 98 % sur tout un clip n'a pas l'air bonne à 98 % ; si elle réapparaît sur 2 images sur 60, ça a l'air cassé, parce que le mouvement rend l'incohérence évidente comme un seul pixel faux sur une photo ne le fait jamais.
Il y a un second problème, propre à l'animation dessinée à la main et vectorielle : un personnage est parfois rempli du même blanc, noir ou aplat de couleur que son propre arrière-plan. Un modèle entraîné sur photos n'a jamais eu à résoudre cette ambiguïté — les vraies photos ne mettent pas exprès une chemise blanche sur un fond blanc sans raccord. L'animation le fait sans arrêt. Lors de notre propre revue des modèles et outils publics de ce domaine, nous n'en avons trouvé aucun qui gère ça de façon fiable.
Honnêtement : c'est tôt. Le jeu d'entraînement actuel compte 2 052 images relues à la main sur 20 clips animés — assez pour prouver que l'approche fonctionne, loin d'être assez pour dire le problème résolu. Pour situer, un fine-tune public comparable (ToonOut, un modèle de segmentation axé anime) a fait passer sa précision au pixel de 95,3 % à 99,5 % avec environ 1 200 images annotées d'un seul style, plus restreint. Un jeu de données généraliste pour l'animation — GIF, feuilles de sprites, overlays de stream, boucles de stickers, tous les styles — doit être un ordre de grandeur au-dessus, et chacune de ses images est relue par une personne, pas seulement étiquetée automatiquement.
C'est précisément cet écart entre « ça marche » et « c'est résolu » que la campagne du jeu de données vise à combler.
L'objectif n'est pas un modèle de segmentation généraliste — c'est le meilleur suppresseur d'arrière-plan pour l'animation en particulier, et « meilleur » n'est pas un slogan ici : c'est mesuré catégorie par catégorie sur le benchmark public, mis à jour à mesure que chacune passe de non résolue à résolue.
Comment Cel est construit
Cel est construit sur de la recherche en segmentation ouverte — la même base ouverte, sous licence MIT, utilisée dans tout le domaine — et ré-entraîné sur notre propre jeu de données d'animation. Le pipeline de matting temporel autour du modèle — la partie qui garde un résultat cohérent sur chaque image d'un clip, et qui remplit le contenu en aplat que les outils standard ratent — est notre propre travail.
Résolu : les aplats de couleur (une chemise blanche sur fond blanc est remplie, pas laissée en trou), la cohérence entre images (un élément d'arrière-plan supprimé ne réapparaît pas sur des images isolées) et les décors réels en 3D ou photographiques. Encore ouvert : deux objets distincts proches de la couleur du fond situés l'un près de l'autre, et le dessin au trait très pâle à faible contraste. Le statut complet, catégorie par catégorie, et la façon dont chacune est notée, sont sur la page du benchmark.
Le calcul est la partie bon marché de l'entraînement d'un tel modèle — un fine-tuning complet coûte quelques dollars de temps GPU. Le vrai coût, et le vrai goulot d'étranglement, ce sont des personnes qui relisent des images : corriger un masque généré automatiquement, confirmer un bord, signaler ce qui semble encore faux. Le financement sert à :
La campagne du jeu de données se déroulera sur une plateforme de financement participatif — elle n'est pas encore ouverte. Laissez vos coordonnées et nous vous préviendrons par e-mail dès son lancement. Chaque niveau donne plus de crédits par dollar que n'importe quel pack du site — 25 à 50 % de plus — et les crédits n'expirent jamais.
Aperçu des niveaux — les récompenses et tarifs définitifs sont fixés sur la page de campagne au lancement.
Ou utilisez simplement RemoveGifBG aujourd'hui — chaque fichier qui fait trébucher Cel devient les données d'entraînement de demain. Essayez gratuitement.
Cel est le modèle de matting alpha au cœur de RemoveGifBG — le modèle qui décide, image par image, quels pixels appartiennent au sujet animé et lesquels sont l'arrière-plan. Il est construit sur de la recherche en segmentation ouverte et ré-entraîné sur le propre jeu de données d'images animées de RemoveGifBG, un type de données d'entraînement que la plupart des modèles publics ne voient jamais.
Un cel — abréviation de celluloïd — est la feuille transparente sur laquelle un animateur peignait traditionnellement un personnage, avant de la poser sur un décor peint séparément pour filmer les deux ensemble. C'est littéralement ce que ce modèle produit : l'art du personnage, en transparence, sans l'arrière-plan.
Ni l'un ni l'autre — c'est le moteur, pas une référence catalogue. Chaque traitement que vous lancez sur RemoveGifBG (dans l'app ou via l'API) utilise déjà Cel ; il n'y a pas de modèle séparé à sélectionner, pas de « forfait Cel ». Cette page existe pour que vous voyiez ce qu'il y a vraiment sous le capot et comment ça s'améliore.
L'architecture, oui — Cel est construit sur de la recherche en segmentation ouverte, sous licence MIT, largement utilisée dans ce domaine. Ce qui est à nous, et n'est pas ouvert, c'est le jeu de données spécifique à l'animation et le pipeline temporel construit autour du modèle pour garder un résultat cohérent sur chaque image, pas seulement exact sur une image isolée.
Presque tous les modèles de segmentation publics sont entraînés sur des photos isolées. Un GIF ou une vidéo exige que le même sujet soit correctement identifié des dizaines ou des centaines de fois de suite, avec un résultat cohérent d'image en image — une zone d'arrière-plan qui clignote est bien plus visible qu'un pixel légèrement faux sur une photo fixe. On n'a jamais demandé aux modèles entraînés sur photos de résoudre ça.
De deux façons. Utilisez RemoveGifBG et signalez-nous tout fichier qu'il ne traite pas proprement — ils deviennent des données d'entraînement. Ou soutenez la campagne du jeu de données (voir ci-dessus) à son ouverture : votre argent va directement à des images annotées, le vrai goulot d'étranglement.