色キーのフィルタではなく、画像や動画を生成するのと同じ種類のAIでもありません。背景除去ツールがピクセルごとに、何を残し何を透明にするかを決めるとき、実際に何が起きているのかを説明します。
AI背景除去ツールはセグメンテーションモデルの上に構築されています — 画像を見て、すべてのピクセルについて、そのピクセルが背景ではなく被写体に属している確信度を予測するように特別に訓練されたニューラルネットワークです。その予測はピクセルごとに0から255までの数値として出てきます。0は「確実に背景」、255は「確実に被写体」を意味し、その間の値はすべて本物の不確かさです。このグレースケールの信頼度マップはアルファマットと呼ばれます。最終的な透明画像はそこから直接作られます — 高信頼度の被写体ピクセルは完全に不透明のまま、高信頼度の背景ピクセルは完全に透明になり、中間の値は部分的に透明になります。これが、髪の一房やぼやけた毛の端を、ギザギザの切り抜き線ではなく自然に柔らかく見せる仕組みです。
セグメンテーションモデルを訓練するとは、膨大な数のサンプル画像を見せることを意味します。それぞれに正解 — その特定の画像でどのピクセルが被写体でどれが背景だったかを正確に示す検証済みのマット — が対になっています。十分な数の例を経ると、モデルの内部パラメータは、「被写体」対「背景」と実際に相関する視覚パターン、つまりエッジ、テクスチャの変化、形状の連続性、より広いシーンのコンテキストを認識するように調整されます。生のピクセル色だけではありません。これが、よく訓練されたモデルが、訓練中に見たすべてから学んだパターンに基づいて、見たことのない画像について良い判断を下せる理由です。
従来のクロマキーや手動の色除去ツールは、まさに1つの情報だけで判断します。このピクセルの色は、狙うよう指示された特定の背景色にどれだけ近いか、です。平坦で均一なグリーンスクリーンに対してはうまくいきます — しかし、被写体が背景と色を共有した瞬間(白い壁に対する白いシャツ、クリーム色の背景に対するクリーム色の毛並み)、または背景がまったく単一の平坦な色でない場合(実際に撮影されたシーン、グラデーション、テクスチャ)、構造的に失敗します。AIセグメンテーションモデルは色に限定されません — 学習した形状とコンテキストを使うため、白いシャツをその背後の白い壁と正しく区別できます。これは、どう調整しても純粋な色キー方式には定義上できないことです。
実際には、セグメンテーションモデルの生の処理1回で完璧なマットが単独で生成されることはめったにありません — 実際の画像には曖昧なエッジ、低信頼度の領域、そして本当に分類が難しいコンテンツがあります(特にGIFや動画でなぜはるかに難しくなるかを参照)。本番の背景除去パイプラインが、その最初のAI処理を超えて実際に行うことのほとんどはクリーンアップです。形状と連結性のロジックを使って低信頼度の領域を解決し、エッジを滑らかにし、そして — 特にアニメーションについては — モデルの判断があるフレームから次のフレームへと互いに一致していることを確認して、結果がちらつかないようにします。AIセグメンテーションモデルは中核的な分類を行います。その生の出力を使えるものにするために、多くのエンジニアリングが投入されます。
AI画像・動画生成とは異なる仕事
ここは正確に言う価値があります。日常会話ではどちらも「AI」だからです。画像や動画の生成器は、プロンプトから新しいピクセルコンテンツを発明します(AI動画生成の実際の仕組みを参照)。背景除去が動作しているセグメンテーションモデルは、何も発明しません — すでに存在するピクセルを分類します。ニューラルネットワーク技術という広い意味では同じ系統ですが、仕事は本当に異なります。
膨大な数のサンプル画像(それぞれに、その画像でどのピクセルが被写体でどれが背景かを正確に示す、検証済みの正解が対になっている)で訓練されたニューラルネットワークが、新しい画像を見て、すべてのピクセルについて0(確実に背景)から255(確実に被写体)までの信頼度スコアを予測します — これがアルファマットです。信頼度のしきい値を超えるピクセルは不透明のまま、下回るピクセルは透明になり、中間のピクセルは部分的に透明になります。これが、髪や毛のような柔らかいエッジをギザギザではなく自然に見せる仕組みです。
色キーのツール(クロマキー、または手動の「この色を除去する」フィルタ)は、たった1つの情報だけで判断します。このピクセルの色は、除去するよう指定した背景色にどれだけ近いか、です。均一なグリーンスクリーンに対してはうまくいきますが、被写体が背景と色を共有した瞬間、または背景がまったく均一でない瞬間に完全に失敗します。AIセグメンテーションは、学習した視覚パターン — エッジ、形状、テクスチャ、コンテキスト — を使って判断するため、白いシャツを白い壁から正しく分離できます。純粋な色キーのツールには構造上これができません。
これは、切り抜きが行われる前にセグメンテーションモデルが生成するグレースケールの信頼度マップです — ピクセルごとに1つの値で、白は完全に不透明/被写体、黒は完全に透明/背景を意味し、その間のグレーの値は部分的な透明度を表します。最終画像の実際の透明度(そのアルファチャンネル)は、このマットから直接作られます。よりクリーンで確信度の高いマットは、よりクリーンな最終的な切り抜きを生み出します。
関連していますが、違う仕事をしています。生成モデル(AI動画・画像ツールの背後にある)は、プロンプトから新しいピクセルコンテンツを作成します。セグメンテーションモデル(背景除去の背後にある)は、既存のピクセルを被写体か背景かに分類します — 新しいものは何も発明しません。どちらも大規模データセットで訓練されたニューラルネットワークですが、一方の出力は新しいコンテンツで、もう一方の出力はすでに存在するコンテンツについての判断です。