Por que "Cel"

Um cel — abreviação de celuloide — é a folha transparente sobre a qual um animador tradicionalmente pintava um personagem, para depois colocá-la sobre um fundo pintado à parte e filmar os dois juntos, sem redesenhar a cena inteira a cada quadro. É literalmente o que este modelo produz: a arte do personagem, em transparência, sem o fundo.

Por que a remoção de fundo quebra em animação

Uma ferramenta de imagem única só precisa acertar uma vez. Uma ferramenta de GIF ou vídeo precisa acertar da mesma forma dezenas ou centenas de vezes seguidas — e o modo de falha que isso cria é quase invisível num benchmark de fotos. Uma mancha de fundo 98% corretamente removida ao longo de um clipe inteiro não parece 98% boa; se ela pisca de volta em 2 de 60 quadros, parece quebrada, porque o movimento torna a inconsistência óbvia de um jeito que um único pixel errado numa foto nunca faz.

Há um segundo problema, específico da animação desenhada à mão e vetorial: às vezes um personagem é preenchido com o mesmo branco, preto ou cor chapada do próprio fundo. Um modelo treinado em fotos nunca precisou resolver essa ambiguidade — fotos reais não colocam uma camisa branca sobre um fundo branco sem emenda de propósito. A animação faz isso o tempo todo. Na nossa própria avaliação dos modelos e ferramentas públicos nessa área, não encontramos um que lide com isso de forma confiável.

Onde o Cel está hoje

Honestamente: cedo. O conjunto de treino atual tem 2.052 quadros revisados à mão em 20 clipes animados — o suficiente para provar que a abordagem funciona, longe do necessário para dizer que o problema está resolvido. Para escala, um fine-tune público comparável (ToonOut, um modelo de segmentação focado em anime) elevou sua precisão de pixel de 95,3% para 99,5% usando cerca de 1.200 imagens rotuladas de um único estilo, mais restrito. Um conjunto de dados geral de animação — GIFs, folhas de sprites, overlays de stream, loops de figurinhas, todo estilo de arte — precisa estar uma ordem de magnitude além disso, e cada quadro dele é revisado por uma pessoa, não apenas rotulado automaticamente.

Essa lacuna entre "funciona" e "resolvido" é exatamente o que a campanha do conjunto de dados existe para fechar.

O objetivo não é um modelo de segmentação de uso geral — é o melhor removedor de fundo para animação especificamente, e "melhor" aqui não é um slogan: é medido categoria por categoria no benchmark público, atualizado à medida que cada uma passa de aberta a resolvida.

Como o Cel é construído

O Cel é construído sobre pesquisa de segmentação aberta — a mesma base aberta, com licença MIT, usada em toda a área — e re-treinado no nosso próprio conjunto de dados de animação. O pipeline de matting temporal em torno do modelo — a parte que mantém um resultado consistente em todos os quadros de um clipe e que preenche conteúdo de cor chapada que as ferramentas padrão perdem — é trabalho nosso.

O que o Cel resolve hoje — e o que não resolve

Resolvido: preenchimentos de cor chapada (uma camisa branca sobre fundo branco é preenchida, não deixada como um buraco), consistência entre quadros (um elemento de fundo removido não pisca de volta em quadros isolados) e cenários reais em 3D ou fotográficos. Ainda em aberto: dois objetos separados de cor próxima ao fundo posicionados perto um do outro, e traço muito tênue de baixo contraste. O status completo, categoria por categoria, e como cada uma é pontuada, está na página do benchmark.

O que um conjunto de dados maior traz

Computação é a parte barata de treinar um modelo assim — um fine-tuning completo custa alguns dólares de tempo de GPU. O custo real, e o gargalo real, são pessoas revisando quadros: corrigindo uma máscara gerada automaticamente, confirmando uma borda, sinalizando o que ainda parece errado. O financiamento vai para:

Apoie o conjunto de dados

A campanha do conjunto de dados vai rodar numa plataforma de crowdfunding — ainda não está aberta. Registre seu interesse e a gente te avisa por e-mail no momento em que ela lançar. Todo nível dá mais créditos por dólar do que qualquer pacote no site — 25 a 50% mais — e os créditos nunca expiram.

Backer $25
  • 800 créditos, ~270 GIFs típicos
  • Nome nos créditos do conjunto de dados
Founding member $79
  • 2.800 créditos, ~930 GIFs típicos
  • Selo de fundador
  • Acesso antecipado às versões do Cel
  • Vote na próxima categoria que vamos resolver
Studio $249
  • 10.000 créditos, ~3.300 GIFs típicos
  • 5 clipes seus adicionados ao conjunto de treino, corrigidos em seu nome
Patron $1,000
  • 45.000 créditos, ~15.000 GIFs típicos
  • Tudo do nível Studio
  • Listado como patrocinador do conjunto de dados
  • Um canal direto para um caso de falha específico que você precisa resolver

Prévia dos níveis — as recompensas e os preços finais são definidos na página da campanha no lançamento.

Avise-me quando abrir

Ou simplesmente use o RemoveGifBG hoje — todo arquivo que dá trabalho ao Cel vira dado de treino amanhã. Teste grátis.

Perguntas frequentes

O que é o Cel?

O Cel é o modelo de matting alfa no núcleo do RemoveGifBG — o modelo que decide, quadro a quadro, quais pixels pertencem ao sujeito animado e quais são fundo. Ele é construído sobre pesquisa de segmentação aberta e re-treinado no conjunto de dados de quadros animados do próprio RemoveGifBG, um tipo de dado de treino que a maioria dos modelos públicos nunca vê.

Por que se chama "Cel"?

Um cel — abreviação de celuloide — é a folha transparente sobre a qual um animador tradicionalmente pintava um personagem, para depois colocá-la sobre um fundo pintado à parte e filmar os dois juntos. É literalmente o que este modelo produz: a arte do personagem, em transparência, sem o fundo.

O Cel é um produto separado, ou algo que posso usar diretamente?

Nenhum dos dois — é o motor, não um item de catálogo. Todo trabalho que você roda no RemoveGifBG (no app ou via API) já usa o Cel; não há um modelo separado para selecionar, nem um "plano Cel". Esta página existe para você ver o que realmente está sob o capô e como isso está melhorando.

O Cel é de código aberto?

A arquitetura é — o Cel é construído sobre pesquisa de segmentação aberta, com licença MIT, amplamente usada nesta área. O que é nosso, e não é aberto, é o conjunto de dados específico de animação e o pipeline temporal construído em torno do modelo para manter um resultado consistente em todos os quadros, não apenas preciso em um quadro isolado.

Por que a animação precisa de um modelo próprio?

Quase todo modelo de segmentação público é treinado em fotos individuais. Um GIF ou vídeo precisa que o mesmo sujeito seja identificado corretamente dezenas ou centenas de vezes seguidas, com o resultado concordando consigo mesmo de quadro a quadro — uma mancha de fundo que pisca entrando e saindo é muito mais visível do que um pixel levemente errado numa foto parada. Modelos treinados em fotos nunca precisaram resolver isso.

Como posso ajudar?

De duas formas. Use o RemoveGifBG e nos conte sobre qualquer arquivo que ele não trate de forma limpa — esses viram dados de treino. Ou apoie a campanha do conjunto de dados (veja acima) quando ela abrir: seu dinheiro vai direto para quadros rotulados, que é o gargalo real.