Quase todo removedor de fundo popular foi treinado para olhar uma foto por vez. O Cel precisa acertar um resultado, e acertá-lo da mesma forma, ao longo de dezenas ou centenas de quadros consecutivos — um problema diferente e mais difícil para o qual quase ninguém construiu dados de treino. O Cel é a resposta do RemoveGifBG, e está sendo construído abertamente.
Matting alfa temporal — exatamente o modelo que já roda dentro do RemoveGifBG
Construído sobre pesquisa de segmentação aberta, com licença MIT — veja "Como o Cel é construído" abaixo
O conjunto de dados de animação e o pipeline que mantém um resultado consistente quadro a quadro
Um cel — abreviação de celuloide — é a folha transparente sobre a qual um animador tradicionalmente pintava um personagem, para depois colocá-la sobre um fundo pintado à parte e filmar os dois juntos, sem redesenhar a cena inteira a cada quadro. É literalmente o que este modelo produz: a arte do personagem, em transparência, sem o fundo.
Uma ferramenta de imagem única só precisa acertar uma vez. Uma ferramenta de GIF ou vídeo precisa acertar da mesma forma dezenas ou centenas de vezes seguidas — e o modo de falha que isso cria é quase invisível num benchmark de fotos. Uma mancha de fundo 98% corretamente removida ao longo de um clipe inteiro não parece 98% boa; se ela pisca de volta em 2 de 60 quadros, parece quebrada, porque o movimento torna a inconsistência óbvia de um jeito que um único pixel errado numa foto nunca faz.
Há um segundo problema, específico da animação desenhada à mão e vetorial: às vezes um personagem é preenchido com o mesmo branco, preto ou cor chapada do próprio fundo. Um modelo treinado em fotos nunca precisou resolver essa ambiguidade — fotos reais não colocam uma camisa branca sobre um fundo branco sem emenda de propósito. A animação faz isso o tempo todo. Na nossa própria avaliação dos modelos e ferramentas públicos nessa área, não encontramos um que lide com isso de forma confiável.
Honestamente: cedo. O conjunto de treino atual tem 2.052 quadros revisados à mão em 20 clipes animados — o suficiente para provar que a abordagem funciona, longe do necessário para dizer que o problema está resolvido. Para escala, um fine-tune público comparável (ToonOut, um modelo de segmentação focado em anime) elevou sua precisão de pixel de 95,3% para 99,5% usando cerca de 1.200 imagens rotuladas de um único estilo, mais restrito. Um conjunto de dados geral de animação — GIFs, folhas de sprites, overlays de stream, loops de figurinhas, todo estilo de arte — precisa estar uma ordem de magnitude além disso, e cada quadro dele é revisado por uma pessoa, não apenas rotulado automaticamente.
Essa lacuna entre "funciona" e "resolvido" é exatamente o que a campanha do conjunto de dados existe para fechar.
O objetivo não é um modelo de segmentação de uso geral — é o melhor removedor de fundo para animação especificamente, e "melhor" aqui não é um slogan: é medido categoria por categoria no benchmark público, atualizado à medida que cada uma passa de aberta a resolvida.
Como o Cel é construído
O Cel é construído sobre pesquisa de segmentação aberta — a mesma base aberta, com licença MIT, usada em toda a área — e re-treinado no nosso próprio conjunto de dados de animação. O pipeline de matting temporal em torno do modelo — a parte que mantém um resultado consistente em todos os quadros de um clipe e que preenche conteúdo de cor chapada que as ferramentas padrão perdem — é trabalho nosso.
Resolvido: preenchimentos de cor chapada (uma camisa branca sobre fundo branco é preenchida, não deixada como um buraco), consistência entre quadros (um elemento de fundo removido não pisca de volta em quadros isolados) e cenários reais em 3D ou fotográficos. Ainda em aberto: dois objetos separados de cor próxima ao fundo posicionados perto um do outro, e traço muito tênue de baixo contraste. O status completo, categoria por categoria, e como cada uma é pontuada, está na página do benchmark.
Computação é a parte barata de treinar um modelo assim — um fine-tuning completo custa alguns dólares de tempo de GPU. O custo real, e o gargalo real, são pessoas revisando quadros: corrigindo uma máscara gerada automaticamente, confirmando uma borda, sinalizando o que ainda parece errado. O financiamento vai para:
A campanha do conjunto de dados vai rodar numa plataforma de crowdfunding — ainda não está aberta. Registre seu interesse e a gente te avisa por e-mail no momento em que ela lançar. Todo nível dá mais créditos por dólar do que qualquer pacote no site — 25 a 50% mais — e os créditos nunca expiram.
Prévia dos níveis — as recompensas e os preços finais são definidos na página da campanha no lançamento.
Ou simplesmente use o RemoveGifBG hoje — todo arquivo que dá trabalho ao Cel vira dado de treino amanhã. Teste grátis.
O Cel é o modelo de matting alfa no núcleo do RemoveGifBG — o modelo que decide, quadro a quadro, quais pixels pertencem ao sujeito animado e quais são fundo. Ele é construído sobre pesquisa de segmentação aberta e re-treinado no conjunto de dados de quadros animados do próprio RemoveGifBG, um tipo de dado de treino que a maioria dos modelos públicos nunca vê.
Um cel — abreviação de celuloide — é a folha transparente sobre a qual um animador tradicionalmente pintava um personagem, para depois colocá-la sobre um fundo pintado à parte e filmar os dois juntos. É literalmente o que este modelo produz: a arte do personagem, em transparência, sem o fundo.
Nenhum dos dois — é o motor, não um item de catálogo. Todo trabalho que você roda no RemoveGifBG (no app ou via API) já usa o Cel; não há um modelo separado para selecionar, nem um "plano Cel". Esta página existe para você ver o que realmente está sob o capô e como isso está melhorando.
A arquitetura é — o Cel é construído sobre pesquisa de segmentação aberta, com licença MIT, amplamente usada nesta área. O que é nosso, e não é aberto, é o conjunto de dados específico de animação e o pipeline temporal construído em torno do modelo para manter um resultado consistente em todos os quadros, não apenas preciso em um quadro isolado.
Quase todo modelo de segmentação público é treinado em fotos individuais. Um GIF ou vídeo precisa que o mesmo sujeito seja identificado corretamente dezenas ou centenas de vezes seguidas, com o resultado concordando consigo mesmo de quadro a quadro — uma mancha de fundo que pisca entrando e saindo é muito mais visível do que um pixel levemente errado numa foto parada. Modelos treinados em fotos nunca precisaram resolver isso.
De duas formas. Use o RemoveGifBG e nos conte sobre qualquer arquivo que ele não trate de forma limpa — esses viram dados de treino. Ou apoie a campanha do conjunto de dados (veja acima) quando ela abrir: seu dinheiro vai direto para quadros rotulados, que é o gargalo real.