主流の背景除去ツールのほとんどは、写真を1枚ずつ見るように訓練されています。Cel は、結果を正しく、しかも数十から数百の連続したフレームにわたって同じように正しく出さなければなりません — 別の、より難しい問題で、そのための学習データをほとんど誰も作ってきませんでした。Cel は RemoveGifBG の答えであり、公開で開発されています。
時間的アルファマッティング — RemoveGifBG の内部ですでに動いているモデルそのもの
オープンで MIT ライセンスのセグメンテーション研究の上に構築 — 下記「Cel の作り方」を参照
アニメーションのデータセットと、結果をフレームごとに一貫させるパイプライン
セル(cel、celluloid = セルロイドの略)とは、アニメーターが伝統的にキャラクターを描いた透明なシートのことで、別に描かれた背景の上に重ねることで、フレームごとにシーン全体を描き直さずに一緒に撮影できるようにしたものです。このモデルが生み出すのはまさにそれです。キャラクターの絵、透明な状態で、背景なし。
1枚画像のツールは一度正しければよい。GIF や動画のツールは、同じように数十回から数百回連続で正しくなければなりません — そして、それが生む失敗の形は、写真のベンチマークではほとんど見えません。クリップ全体で98%正しく除去された背景の断片は、98%良く見えるわけではありません。60フレーム中2フレームでちらついて戻れば、壊れて見えます。動きは、静止画の1つの間違ったピクセルには決してできない形で、不整合を目立たせるからです。
もう1つ、手描きやベクターアニメーション特有の問題があります。キャラクターが、自分の背景と同じ白、黒、またはベタ塗りの色で塗られていることがあるのです。写真で訓練されたモデルは、この曖昧さを解く必要が一度もありませんでした — 実際の写真は、白いシャツを真っ白なシームレス背景の前にわざと置いたりしません。アニメーションは常にそれをやります。この分野の公開モデルやツールを自分たちで調べた限り、それを確実に処理できるものは見つかりませんでした。
正直に言うと、まだ初期段階です。現在の学習セットは20本のアニメーションクリップにわたる、人が確認した2,052フレームです — この手法が機能することを示すには十分ですが、問題が解決したと言うには程遠い量です。規模感として、比較可能な公開ファインチューン(ToonOut、アニメに特化したセグメンテーションモデル)は、より狭い単一スタイルのラベル付き画像を約1,200枚使って、ピクセル精度を95.3%から99.5%に引き上げました。アニメーション全般のデータセット — GIF、スプライトシート、配信オーバーレイ、ステッカーのループ、あらゆる画風 — は、それより一桁多くある必要があり、そのすべてのフレームが自動ラベル付けではなく人によって確認されます。
この「機能する」と「解決済み」の間のギャップを埋めるために、データセットのキャンペーンがあります。
目標は汎用のセグメンテーションモデルではありません — アニメーションに特化した最高の背景除去ツールです。ここでの「最高」はスローガンではありません。公開ベンチマークでカテゴリーごとに計測され、それぞれが未解決から解決済みに変わるたびに更新されます。
Cel の作り方
Cel は、オープンなセグメンテーション研究 — この分野全体で使われている、オープンで MIT ライセンスの基盤 — の上に構築され、当社独自のアニメーションデータセットで再学習されています。モデルを取り巻く時間的マッティングパイプライン — クリップのすべてのフレームで結果を一貫させ、標準ツールが見落とすベタ塗りの内容を埋める部分 — は当社独自の成果です。
解決済み:ベタ塗り(白背景の白いシャツは穴にならず塗りつぶされる)、フレーム間の一貫性(除去された背景要素が個々のフレームでちらついて戻らない)、実際の3Dや写真の背景。まだ未解決:背景色に近い2つの別々の物体が近接している場合、そして非常にかすかで低コントラストの線画。カテゴリーごとの完全なステータスと、それぞれの採点方法は、ベンチマークのページにあります。
このようなモデルの訓練で、計算は安い部分です — フルのファインチューニング1回で GPU 時間は数ドルです。本当のコスト、本当のボトルネックは人がフレームを確認することです。自動生成されたマスクを修正し、エッジを確認し、まだおかしく見える箇所に印をつける。資金は次に使われます:
データセットのキャンペーンはクラウドファンディングのプラットフォームで実施します — まだ開始していません。ご関心を登録いただければ、開始した瞬間にメールでお知らせします。どのティアも、サイト上のどのパックより1ドルあたりのクレジットが多く — 25〜50% 多く — クレジットは無期限です。
ティアのプレビュー — 最終的な特典と価格は、開始時にキャンペーンページで確定します。
または、今日 RemoveGifBG を使ってください — Cel をつまずかせるファイルはすべて、明日の学習データになります。無料で試す。
Cel は RemoveGifBG の中核となるアルファマッティングモデルです — フレームごとに、どのピクセルがアニメーションの被写体に属し、どれが背景かを判断します。オープンなセグメンテーション研究の上に構築され、RemoveGifBG 独自のアニメーションフレームのデータセットで再学習されています。ほとんどの公開モデルが目にすることのない種類の学習データです。
セル(cel、celluloid = セルロイドの略)とは、アニメーターが伝統的にキャラクターを描いた透明なシートのことで、別に描かれた背景の上に重ねて一緒に撮影できるようにしたものです。このモデルが生み出すのはまさにそれです。キャラクターの絵、透明な状態で、背景なし。
どちらでもありません — これは製品(SKU)ではなくエンジンです。RemoveGifBG で実行するすべてのジョブ(アプリでも API 経由でも)はすでに Cel を使っています。選ぶべき別のモデルも、「Cel プラン」もありません。このページは、実際に中身がどうなっていて、どう改善されているかを見てもらうためにあります。
アーキテクチャはそうです — Cel は、この分野で広く使われているオープンで MIT ライセンスのセグメンテーション研究の上に構築されています。当社のもので公開していないのは、アニメーション専用のデータセットと、単一フレームで正確なだけでなく、すべてのフレームで結果を一貫させるためにモデルの周りに構築した時間的パイプラインです。
ほとんどの公開セグメンテーションモデルは1枚の写真で訓練されています。GIF や動画では、同じ被写体が連続して何十回、何百回も正しく識別され、しかも結果がフレームごとに整合している必要があります — ちらついて出たり消えたりする背景の断片は、静止画の少し間違ったピクセル1つよりはるかに目立ちます。写真で訓練されたモデルは、それを解けと求められたことがありません。
2つの方法があります。RemoveGifBG を使い、きれいに処理できなかったファイルがあれば教えてください — それが学習データになります。または、データセットのキャンペーン(上記参照)が始まったら支援してください。あなたの支援は、実際のボトルネックであるラベル付きフレームに直接使われます。