「AI」は、スパムフィルタからチャットボット、フィードにあるあのバズった動画を作ったツールまで、あらゆるものを説明するのに使われます。「生成AI」が意味するその1つの具体的なこと、これらのモデルが実際にどう学ぶか、そしてこのサイトのツールがどこに位置づけられるかを説明します。
ほとんどの人が日常的に触れるAIのほとんどは識別的であり、生成的ではありません — すでに存在する何かを見て、それについて判断を下します。このメールはスパムか、この写真に顔が含まれているか、この動画を次にあなたに推薦すべきか。生成AIは違う仕事です。既存のコンテンツを判断する代わりに、プロンプトや開始入力から新しいコンテンツ — テキストの段落、画像、動画クリップ、音声録音 — を生み出します。ChatGPTがメールを書くこと、Midjourneyが絵を描くこと、RunwayやVeoが動画クリップを生成することは、すべて生成AIです。スパムフィルタは、より広い意味ではまだ「AI」ですが、生成AIではありません。
生成モデルを訓練するとは、それが生み出すべきものの実際の例を膨大な数見せること — テキストモデルには数十億の文、画像や動画モデルには巨大な画像や動画のデータセット — を意味し、モデルの内部パラメータ(数十億個あることも)を調整して、そのデータ内のパターン、つまりどの単語がもっともらしく次に来るか、どのピクセル値がもっともらしく他のどのピクセル値の隣に属するか、を予測することにおいて徐々に上手くなるようにします。重要なのは、モデルが検索エンジンが保存されたウェブページを返すように、特定の訓練例を保存して再生しているのではないということです。訓練中に一度も遭遇しなかったまったく新しいプロンプトに適用できるほど一般的な統計パターンを学んでいます — これがその有用性の源(本当に新規の要求に対応できる)であり、その最も奇妙な失敗の源(その推測が間違っていても、常に最善の統計的推測を生み出している)でもあります。
生成モデルは何かを調べたり事実を確認したりしていません — 与えられたプロンプトの統計的に最ももっともらしい続きを、訓練中に学んだパターンに完全に基づいて生み出しています。テキストモデルの場合、これは自信を持って述べられた誤った情報として現れ、しばしば「ハルシネーション」と呼ばれます。画像・動画モデルの場合、まったく無関係なコンテンツにわたって同じいくつかの繰り返される視覚的な不具合として現れます。余分または奇形の指、歪んだり意味不明になったりする宝飾品や小さな文字、精査に耐えない細かい細部です。これらは1つのツールに固有のランダムなバグではありません — この種のモデルが正確に仕上げるのが構造的に難しいものの産物です。細かく、精密で、ルールに支配された細部(正確な指の本数、正確な文字の形)は、大まかで許容度の高いもの(全体的なポーズ、おおよその配色)よりも、一貫して命中させるのがはるかに難しい統計的な標的です。
AI動画生成器(Runway、Pika、Kling、Seedance、Veoなど)は、動画に特化して適用された生成AIです。テキストの説明や参照画像が入力され、短い新しい動画クリップ — モデルが構築したフレームであり、撮影された映像ではない — が出力されます。テキストや画像の生成器と同じ基礎的な考え方ですが、すべてのフレームが周囲のフレームと視覚的に一貫していなければならないという複雑さが加わっています。仕組みについては専用の解説記事AI動画生成の実際の仕組みを、フィードにあふれる動画の背後にあるものを知りたいだけなら初心者向けの実際のツールのツアーをご覧ください。
この点は正確にする価値があります。両者が混同されるからです。AI背景除去(RemoveGifBG が行うこと)は、密接に関連したニューラルネットワーク技術の系統の上に構築されていますが、同じ意味での生成的ではありません。その仕事は分類であり、創造ではありません — 画像や動画のフレームのすべてのピクセルについて、それが被写体の一部か背景の一部かを判断し、一方を残して他方を捨てます。画像生成器がテキストプロンプトからシーン全体を発明するように新しいピクセルを発明しているのではなく、すでに存在するピクセルについて残すか捨てるかの判断をしています。詳細はAI背景除去の実際の仕組みを、そしてなぜそれが1枚の写真よりも動画やGIFではるかに難しい問題なのかをご覧ください。
短縮版
関連: AI背景除去の仕組み · AI動画の作り方(初心者ガイド) · すべてのガイド
それは、既存のコンテンツを分類・分析するだけでなく、新しいコンテンツ — テキスト、画像、動画、音声、コード — を生み出すように訓練されたAIモデルのカテゴリーです。スパムフィルタ(「このメールはスパムかそうでないか」)はAIですが、生成的ではありません。メールを書いたり、画像を描いたり、説明から動画を生成したりするツールは生成的です。出力は、すでに存在するものに適用されたラベルではなく、モデルが構築する新しい素材です。
訓練は、モデルを膨大な量の既存のサンプルコンテンツ(生成する対象に応じて、テキスト、画像、または動画)にさらし、数百万または数十億の内部パラメータを調整して、モデルがそのデータ内のパターン — どの単語が他の単語にもっともらしく続くか、どのピクセル値が他のピクセル値にもっともらしく続くか — を予測することにおいて徐々に上手くなるようにします。特定の例を記憶して再生しているのではなく、訓練中に一度も見たことのないまったく新しいプロンプトに適用できるほど一般的な統計パターンを学んでいます。
モデルが、何かを調べたり事実を検証したりするのではなく、統計的に最ももっともらしい次の出力を生成しているからです。テキストの場合、それは自信を持って述べられた誤った情報(「ハルシネーション」)として現れます。画像や動画の場合、それは同じいくつかの繰り返される視覚的エラー — 余分な指、歪んだ文字、形を保てない宝飾品 — として現れます。これらはまさに、生成された画像やクリップ全体で統計的に一貫させるのが最も難しい、細かく構造的に精密な細部だからです。
厳密には違いますが、近い親戚です。AI背景除去は同じ系統のニューラルネットワーク技術(膨大な量のサンプルデータで訓練され、ピクセルレベルの予測を行う)を使いますが、その仕事は生成ではなく分類です。各ピクセルについて、それは前景か背景か?画像生成器のように新しいピクセルを作るのではなく、すでに存在する画像から何を残すかを決めています。