要するに、1枚の写真の背景除去は成熟した、ほぼ解決済みの問題ですが、同じアプローチはアニメーションGIFや動画では崩壊します — モデルは1枚の写真を正しく処理するだけでなく、すべてのフレームで自分自身と一致する必要があります。RemoveGifBG は、まさにこのために作られた、専用のフレームごとの処理とフレーム間の一貫性チェックを実行します。
AI背景除去ツールは1つのフレームを見て、各ピクセルが「被写体」か「背景」かの可能性をピクセルごとに予測します。同じモデルを60フレームのGIFの各フレームで独立して実行すると、60個の少しずつ異なる意見が得られます — キャラクターがほとんど動いていなくても、耳の端がフレーム12では含まれ、フレーム13では除外されることがあります。静止画では、誰もこの種の小さな不確かさに気づきません。アニメーションでは、それが目に見えるちらつきとして現れます。輪郭がフレームごとにちらついたり這ったりし、1枚の写真のわずかに不完全なエッジよりもはるかに気が散ります。それを修正するには、フレームどうしを比較して不一致を滑らかにする必要があります — フレームごとのツールは一度に1フレームしか見ないため、それができません。
多くの実際のキャラクターアートには、白いハイライト、クリーム色の毛並み、または無地の白や明るい背景のすぐ隣にある淡い輪郭線があります。単一のピクセルの塊を見ているモデル(正直なところ人間も)にとって、「この白い塊はキャラクターの一部だ」対「この白い塊は背景が透けて見えているのだ」と示す局所的な情報がないことがよくあります。それを正しく判断するには、形全体について推論する必要があります — この白い塊はキャラクターに完全に囲まれているのか、それともフレームの端までつながっているのか — これは、単に「このピクセルは背景色に近いか」と尋ねるのとは根本的に異なる(そしてはるかにコストのかかる)種類の分析です。
写真には1つの良いエッジがあればよいのです。アニメーションには、すべてのフレームに良いエッジが必要で、そのエッジは動く標的です。髪が揺れ、手が顔の前を通り、キャラクターが回転します。あるポーズで簡単な細部(平坦な背景に対するきれいなシルエット)は、動きの途中で、髪の毛1本1本や指のような細い構造が奇妙な角度で一瞬背景に重なるときに、はるかに難しくなります。「簡単な」静止ポーズだけをうまく処理する除去処理は、キャラクターが何か面白いことをしているまさにそのフレームで目に見えて劣化します — アニメーションでは、それが大部分です。
平坦なスタジオ背景では、「背景」は単純で明確に定義された概念です。どこでも1色です。実際のクリップがそれほどきれいであることはめったにありません — 地面に落ちる影、発光するキャラクターの周りの光るハロー、または独自のテクスチャと奥行きを持つ完全なシーン背景。落ちる影は本当に背景色の陰影ですが、それを完全に除去すると間違って見えることがあります(視聴者は何らかの接地の影を期待します)。グローは本当にキャラクターの見え方の一部ですが、鋭いエッジがまったくなく、徐々に背景に溶け込みます。これらをうまく扱うには、「背景」を単一のはい/いいえの線ではなく、確信度のスペクトルとして扱い、普遍的なしきい値ではなく、コンテンツの種類ごとに異なる判断を下す必要があります。
RemoveGifBG は、専用のフレームごとのAIセグメンテーション処理を実行し、その上に、アニメーションを意識した別のクリーンアップ処理のセットを実行します。ちらつきをなくすフレーム間の一貫性、実際の背景も保持せずに同色のキャラクターコンテンツを復元する形状認識推論、そして平坦・色付き・シーンの背景それぞれに個別に調整されたエッジクリーンアップです。これらはどれも、1枚のビフォーアフターのスクリーンショットでは見えません — 動きの中できれいに見えるアニメーションと、技術的には「背景除去済み」だがちらついたり、穴があったり、キャラクターの周りにうっすらとした背景のハローを引きずったりするアニメーションとの違いとしてのみ現れます。
なぜ「写真の背景除去ツール」がこれに適したツールではないのか
関連: AI背景除去の実際の仕組み · 透明な背景が重要な理由