AI活用

画像生成AIの仕組みとは?拡散モデルとインペインティングを解説

公開日 2026年8月28日

執筆: カグオクAI編集部 / 監修: 増山大知

画像生成AIの仕組みは、基盤となる「拡散モデル(ノイズ除去を繰り返し学習し、ノイズの塊から画像を生み出す技術)」と、その拡散モデルを応用した「インペインティング(画像の一部だけをマスクで指定し、そこだけを描き直す技術)」の2つで説明できます。この2つの技術が組み合わさることで、空室の写真に家具だけを自然に合成するAIホームステージングが成り立っています。

本記事では、不動産会社の実務担当者向けに、拡散モデルとインペインティングの仕組みを比喩と具体例で解説します。あわせて、生成画像でスケール狂いや光源不整合といった失敗がなぜ起こるのかを技術的な原因から整理し、生成画像の著作権・利用権についても現時点で確実にいえる範囲を紹介します。

この記事を読むことで、AIホームステージングや家具消しの仕上がりを「なぜこうなるのか」という視点で理解し、生成画像を広告に使う際に押さえておくべき権利面の基礎知識を持てるようになります。

この記事を読むとわかること

  • 画像生成AIの中核技術である拡散モデルが、ノイズ除去の学習によってどのように画像を生み出すのか
  • インペインティング(部分生成)の仕組みと、それが空室写真への家具合成を可能にしている理由
  • スケール狂いや光源不整合といった生成の失敗が、仕組みのどこに起因するのか
  • 拡散モデルによる生成・従来型3DCG・家具消しAIの技術的な違い
  • 生成画像の著作権について、AI開発・学習段階、生成・利用段階、生成物自体の3つに分けた基礎知識

画像生成AIとは何か?拡散モデルが主流になった理由

画像生成AIの2つの系譜──GANと拡散モデル

画像生成AIには、大きく分けて2つの系譜があります。ひとつは2010年代半ばから使われてきたGAN(敵対的生成ネットワーク、生成役のAIと見分け役のAIを競わせて鍛える方式)です。もうひとつが、現在主流になっている拡散モデル(ノイズを少しずつ除去する練習を通じて画像の作り方を学ぶ方式)です。

技術生成の基本的な考え方学習の安定性現在の位置づけ
GAN(敵対的生成ネットワーク)「生成役」と「見分け役」の2つのAIを競わせて鍛える学習が不安定になりやすく、大規模化が難しい2010年代後半までは主流だったが、後述の理由で後退傾向
拡散モデルノイズを少しずつ除去して元の画像を復元する学習を1つのAIで行う学習が安定しやすく、大規模なデータでも扱いやすいStable Diffusion等、現在の主要な画像生成AIの中核技術

拡散モデルが主流になった理由

GANは2つのAIを競わせる仕組み上、片方が強くなりすぎると学習全体が崩れやすいという弱点を抱えていました。拡散モデルは1つのAIが「ノイズを当てて除去する」という単純な目標を繰り返し学習するだけで済むため、学習が安定しやすく、大量の画像データを使った大規模な学習に向いています。

AIホームステージングをはじめ、不動産業務で使われている画像生成AIの多くは、この拡散モデルを基盤にしています。次の章では、この拡散モデルが具体的にどのようなプロセスで画像を生み出しているのかを見ていきます。

拡散モデルの仕組み──ノイズ除去から画像が生まれるプロセス

学習フェーズ:ノイズを加える過程を「当てる練習」で学ぶ

拡散モデルの学習は、まず大量の実写真に、少しずつランダムなノイズ(画像を砂嵐のように乱す信号)を加えていくところから始まります。ごく薄いノイズを加えた状態から、完全に砂嵐と区別がつかない状態までを仮想的に多数の段階として定義しておき、学習時にはその中から段階を選んで、対応する量のノイズを写真に加えます。

AIに学習させるのは、この逆方向です。ある段階のノイズまみれの画像を見せて、「1段階前はどんな見た目だったか」「このノイズはどんなパターンだったか」を当てる練習を、何百万枚もの写真と多数の段階の組み合わせについて繰り返します。この練習を通じて、AIは「ノイズの中から、もっともらしい元の画像を推測する」という能力を身につけます。

生成フェーズ:ノイズの山から一歩ずつ絵を掘り出す

新しい画像を作るときは、この学習と逆の順序で処理が進みます。まず完全なランダムノイズ(何も写っていない砂嵐の状態)を1枚用意し、学習で身につけた「1段階分だけノイズを除去する」処理を、何十回、何百回と繰り返し適用します。

比喩でいえば、曇ったガラス越しに景色を見ながら、少しずつ表面を拭って像を浮かび上がらせる作業を、何百回も練習したような仕組みです。1回ごとの拭き取りでは景色ははっきり見えませんが、正しい手順を繰り返すことで、最終的に自然な1枚の画像が浮かび上がります。

プロンプトによる条件付け──指示文が画像の特徴と結びつく仕組み

ノイズ除去を何もない状態で繰り返すと、AIは「もっともらしい画像」を作りますが、狙った内容にはなりません。ここで使われるのが、プロンプト(生成したい内容を指定する指示文)による条件付け(生成の各段階で、指示内容に沿うようノイズ除去の方向を調整する仕組み)です。

プロンプトの文章は、あらかじめ画像の特徴と対応づけられた数値の並びに変換され、ノイズ除去の1段階ごとに「この指示に近づく方向」へ調整をかける手がかりとして使われます。「ナチュラルテイストのソファ」といった指示を与えると、除去の各段階でその特徴に近づくよう軌道修正が繰り返され、最終的に指示に沿った画像として出力されます。

拡散モデルのノイズ除去プロセス図

インペインティングとは?部分生成が空室写真への家具合成を可能にする理由

インペインティングとは何か──マスクした範囲だけ描き直す技術

インペインティングとは、既存の写真の一部にマスク(生成し直したい範囲を指定する型紙のような領域)をかけ、マスク部分だけをノイズ除去のプロセスで描き直す技術です。マスクの外側は元の写真の情報がそのまま保持され、マスクの内側だけが新たに生成されます。

これは、ゼロから1枚の画像全体を生成する通常の拡散モデルの使い方とは異なり、「すでにある画像の続きを、周囲と矛盾しないように描き足す」という条件つきの生成です。周囲の壁・床・窓といった手がかりを参照しながら、マスク内のノイズ除去を進める点が最大の特徴です。

なぜ空室写真に家具だけを自然に合成できるのか

AIホームステージングで空室写真に家具を合成できるのは、このインペインティングの仕組みによるものです。家具を置きたい床・壁の領域をマスクとして指定し、その周囲に写っている床のライン・壁の角度・窓からの光の入り方を手がかりに、マスク内へ家具を描き足す処理が行われます。

AIは、部屋の奥行きや窓の位置を「計測」しているわけではなく、マスク周囲のピクセルパターンから「この部屋なら、これくらいの大きさ・向きの家具が自然に見える」という組み合わせを、学習済みの統計的な傾向にもとづいて推測しています。標準的な角度で部屋全体が写った写真ほど、この推測の手がかりが豊富になり、仕上がりが安定しやすくなります。AIホームステージングの費用や従来型との違いはAIホームステージングとは?費用・仕組み・従来型との違いを実務目線で解説で詳しく解説しています。

家具消しとの違い──「足す生成」と「消す生成」

インペインティングは、家具を新しく描き足す用途だけでなく、逆に既存の家具や生活用品を消す用途にも使われます。仕組みはどちらも同じ「マスク範囲を周囲と矛盾しないように描き直す」条件付き生成であり、違いは生成させる内容にあります。マスク内に家具(物体)を生成させるのが家具合成、マスク内に周囲と連続する背景を生成させるのが家具消しで、同じ処理で描かせる対象が「家具」か「背景」かという点が異なります。

不動産写真の実務では、空室の内覧用写真には家具合成、居住中の売却物件には家具消しというように、物件の状態に応じて使い分けます。家具消しの仕組みと使いどころのより詳しい比較は家具消しツールの比較を参考にしてください。

インペインティングの仕組み図(マスク領域のみ生成)

なぜ生成画像は失敗するのか?スケール狂い・光源不整合の仕組み的な原因

スケール狂いが起きる仕組み──奥行きは「推測」でしかない

拡散モデルは、部屋の実際の寸法をセンサーで測っているわけではなく、写真に写る壁・床・窓の位置関係から「この写真ならこれくらいの奥行きだろう」という推測を、学習データの統計的な傾向にもとづいて行っているだけです。部屋の隅や床面が写り込んでいない写真、極端に広角で歪んだ写真では、この推測の手がかりが乏しくなり、家具の大きさが部屋の広さと合わない結果につながりやすくなります。

光源不整合が起きる仕組み──物理計算ではなく統計的パターン

家具の影の向きが窓の光と矛盾する失敗も、同様の原因で説明できます。拡散モデルは、光線の向きや反射を物理的に計算しているのではなく、「学習データにあった、こういう窓の写真には、こういう向きの影が多かった」という統計的なパターンを再現しています。逆光や複数照明が混在する写真のように、学習データの典型例から外れた光の条件では、この統計的な推測が実際の物理法則とずれやすくなります。

継ぎ目の破綻とインペインティングの境界処理

床や壁の継ぎ目が家具の輪郭部分で不自然に途切れる失敗は、インペインティングのマスク境界処理に起因します。マスクの内側を生成する際、AIはマスクのすぐ外側にあるピクセルの模様を手がかりに継ぎ目をつなげようとしますが、柄や継ぎ目が複雑な床材ほど、この手がかりからの推測が外れやすくなります。

3つの失敗パターンと、その仕組み的な原因、元写真の側で有効な対策の方向性を整理すると、次のとおりです。

失敗パターン仕組み的な原因元写真側で有効な対策の方向性
スケール狂い奥行きを実測でなく、壁・床の位置関係からの統計的推測で決めている部屋の隅・床面までしっかり写った標準的な角度で撮影する
光源不整合光の向きを物理計算でなく、学習データにある陰影パターンの再現で決めている単一光源に近い自然光下で、逆光を避けて撮影する
継ぎ目の破綻マスク境界のテクスチャを周囲のピクセルからの推測で埋めている無地に近い床・壁が写った構図ほど推測が安定しやすい

これらの失敗パターンをどう見分け、掲載前にどうチェックすべきかという実務的なチェックリストは、AIステージングでよくある失敗と回避策で具体的に整理しています。

拡散モデル・インペインティングの技術比較

拡散モデル生成・従来型3DCG・家具消しの違い

同じ「AIで画像を作る・変える」技術でも、方式によって処理の考え方と得意分野が異なります。

方式処理の基本的な考え方得意なこと不動産写真での主な用途
拡散モデルによる生成(家具合成)ノイズ除去を繰り返し、マスク範囲に家具を新規描画する短時間・低コストで多様なテイストを合成できるAIホームステージング
従来型3DCG合成3Dモデルを座標上に配置し、光源計算にもとづきレンダリングする寸法・光源を数値条件として扱えるため整合性を管理しやすい完成予想パース、間取りの3D化
インペインティングによる除去(家具消し)マスク範囲に背景を生成して埋める(合成と同じ仕組みで、生成させる内容が家具でなく背景)既存の家具・生活用品を自然に消せる居住中物件の生活感消し

用途に応じた使い分けの考え方

従来型3DCGは、部屋の寸法データと光源を数値として持つため、正確さを優先したい完成予想パースに向いています。拡散モデルによる生成は、寸法や光源を数値として持たず統計的な推測で描くぶん、撮影済みの実写真をそのまま使えて処理が速いという特徴があり、賃貸の空室写真のように数を優先したい場面に向いています。

物件写真全体の撮影・活用の考え方は不動産×AI画像活用の全体地図で、5分野に整理して解説しています。

生成画像の著作権・利用権の基礎

AI開発・学習段階──著作権法30条の4という考え方

画像生成AIの多くは、開発の過程でインターネット上の大量の画像を学習データとして使っています。この学習段階での著作物の利用については、著作権法30条の4が関係します。

著作権法30条の4は、「著作物に表現された思想又は感情の享受(作品を鑑賞するなどして、知的・精神的な満足を得ること)を目的としない利用」であれば、著作権者の許諾を得ずに行えると定めた規定です。AI開発のための情報解析はこの「非享受目的の利用」に当たると整理されており、原則として許諾は不要とされています。

もっとも、この非享受目的の要件には注意が必要です。情報解析と同時に、生成物を鑑賞するといった享受目的が併存する場合には、そもそも本条の適用対象から外れ、この規定による許諾不要の扱いは受けられないと整理されています。

さらに、本条にはただし書きがあり、非享受目的であっても「著作権者の利益を不当に害することとなる場合」は対象外とされています。情報解析用として販売されているデータベースを許諾なく学習に使う場合などが、この例として挙げられています。

出典:著作権法(e-Gov法令検索)

生成・利用段階──類似性と依拠性による判断

生成した画像を公開・販売する段階では、既存の著作物の著作権を侵害していないかが問題になります。文化庁の整理によれば、AIを使って生成した場合でも、著作権侵害となるかどうかは、人がAIを使わず絵を描いた場合と同じ枠組みで判断されます。

判断の枠組みは、既存の著作物と「類似性(表現上の本質的な特徴を直接感じ取れるかどうか)」があり、かつ「依拠性(既存の著作物に接し、それを自分の作品に用いたといえるかどうか)」がある場合に、著作権侵害と判断されるというものです。生成画像が既存の著作物と偶然似てしまっただけで、依拠性が認められない「独自創作」の場合は、この枠組みでは著作権侵害に当たらないと考えられています。

なお、AI生成物における依拠性の具体的な判断基準については、文化庁の資料でも複数の見解が併存する形で紹介されており、今後の整理が進められている段階です。この点は専門家の間でも見解が分かれるため、既存の著作物と似た生成画像を使う際は、慎重な確認が必要です。

出典:AIと著作権に関する考え方について|文化庁

生成物自体は著作物になるのか──創作意図と創作的寄与

AIが生成した画像そのものに著作権が発生するかどうかは、また別の論点です。文化庁の資料では、人が何も指示を与えず、あるいは簡単な指示だけを与えて「生成」ボタンを押しただけのものは、著作物に該当しない可能性が高いとされています。最終的に著作物に当たるかどうかは、後述する創作的寄与の程度によって判断されます。

これに対して、人が「思想又は感情を創作的に表現するための道具」としてAIを使ったと認められる場合は、著作物に該当し、AI利用者が著作者になると考えられています。この判断は、人に「創作意図(結果物として何かを表現しようとする意図)」があり、かつ「創作的寄与(生成物に修正・加筆を加えるなど、創作といえる関与)」と認められる行為を行ったかどうかで行われます。なお文化庁の最終整理では、生成物を選ぶ行為それ自体は創作的寄与の判断に直接影響しないとされており、単に気に入った1枚を選んだだけでは創作的寄与とは認められにくいと考えられています。

出典:AIと著作権に関する考え方について(2024年3月)|文化庁

3つの段階を整理すると、次のとおりです。

段階主な行為関係する考え方実務上のポイント
AI開発・学習段階学習データとして画像を収集・複製する著作権法30条の4(非享受目的の利用)原則として許諾不要だが、著作権者の利益を不当に害する場合は対象外
生成・利用段階生成画像を公開・販売する類似性・依拠性による著作権侵害の判断類似性と依拠性の両方が認められる場合は利用を見合わせ、権利制限規定の適用や許諾の要否を確認する
生成物自体の著作物性生成画像そのものの権利の有無創作意図と創作的寄与の有無単純な生成ボタン操作だけでは著作物と認められにくい

不動産実務で押さえるべきポイント

プロンプトの工夫は「創作的寄与」といえるか──見解が分かれる論点

AIホームステージングでテイストを指定するプロンプトの工夫が「創作的寄与」に当たるかどうかは、現時点で明確な基準が定まっていません。文化庁の最終整理では、単純なパラメータの設定や、生成物を選択する行為それ自体は創作的寄与の判断に直接影響しないと整理されており、創作的寄与といえるかは、生成物への修正・加筆など創作といえる関与を伴うかどうかによって判断されると考えられます。もっとも、どの程度の関与があれば創作的寄与と認められるかは事例の蓄積を踏まえて引き続き整理が進められている段階であり、専門家の間でも見解が分かれるため、断定的な扱いは避けるべきです。

カグオクAIの運用では、生成前にマスク範囲を家具の設置予定エリアだけに絞り、床・壁のラインをできる限り保持したまま生成する設定を標準にしています。テイストを指定する際も、家具の点数を絞ったシンプルな指示のほうが、部屋の実寸に対して破綻の少ない結果になりやすいというのが、日々の運用で得ている実感です。

生成画像を広告に使う際の表示ルールとの接続

生成画像の著作権とは別に、不動産広告に掲載する際は、宅地建物取引業法や不動産の表示に関する公正競争規約にもとづく表示ルールへの配慮も必要です。合成画像であることが分かるよう注記を入れることが実務の基本になります。

カグオクAIの品質チェックでは、生成後に「床のラインが家具の脚元で不自然に途切れていないか」を必ず確認しており、これはインペインティングの境界処理に負荷がかかりやすい箇所だからです。表示ルールと注記文言の実例については、不動産広告のAI加工画像、表示ルールと注記文言の実例を解説で詳しく整理しています。

なお、国土交通省も宅地建物取引業者がデジタル・AI技術による補助ツールの活用に躊躇しないよう、活用例の整理と周知を進めています。

出典:不動産分野におけるDXの推進|国土交通省

不動産売買仲介におけるデジタル・AI活用は、内閣府の規制改革推進会議のワーキンググループでも議題として取り上げられており、画像分野に限らずAI活用が政策的にも後押しされている状況です。

出典:不動産売買仲介におけるデジタル・AI活用|内閣府 規制改革推進会議

よくある質問(FAQ)

Q. 画像生成AIの「拡散モデル」とは何ですか?

拡散モデルとは、写真にノイズを少しずつ加えていく過程を学習し、その逆順(ノイズから元の画像に近い状態を推測して除去していく処理)を繰り返すことで画像を生み出す技術です。1つのAIがノイズ除去という単純な目標を学習するだけで済むため、学習が安定しやすく、現在の主要な画像生成AIの中核技術になっています。

Q. インペインティングと通常の画像生成の違いは何ですか?

通常の画像生成は、何もないノイズの状態から1枚の画像全体を新規に作り出します。インペインティングは、既存の写真の一部だけにマスクをかけ、マスクの外側の情報を保持したまま、マスク内だけを周囲と矛盾しないように描き直す技術です。空室写真への家具合成や、居住中物件の家具消しは、このインペインティングの応用にあたります。

Q. なぜAIホームステージングで家具のスケールが不自然になることがあるのですか?

拡散モデルは部屋の実寸法を計測しているのではなく、写真に写る壁・床・窓の位置関係から奥行きを統計的に推測しているだけだからです。部屋の隅が写り込んでいない写真や、極端な広角レンズで歪んだ写真では、この推測の手がかりが乏しくなり、家具の大きさが部屋の広さと合わない結果が起きやすくなります。

Q. AIが生成した画像に著作権は発生しますか?

人が何も指示を与えず、あるいは簡単な指示だけで生成ボタンを押しただけの画像は、著作物に該当しない可能性が高いと考えられています。最終的な判断は、創作的寄与と認められる関与がどの程度あったかによります。人が「創作意図」を持ち、生成物への修正・加筆といった「創作的寄与」と認められる関与を行った場合は、著作物として扱われ、AI利用者が著作者になると考えられていますが、どこまでの関与が創作的寄与に当たるか(とくに生成物を選ぶ行為だけで足りるか)は、現時点でも見解が分かれる論点です。

Q. 生成画像が他人の著作物に似てしまった場合、使っても大丈夫ですか?

既存の著作物との「類似性」と「依拠性」の両方が認められる場合は、著作権侵害に当たるおそれがあります。利用者もAIも当該著作物に接していないといえる場合は依拠性が否定される余地がありますが、文化庁の整理では、利用者自身が既存の著作物を知らなくても、その著作物がAIの学習データに含まれていれば依拠性が推認され得るとされています。似ていることに気づいた生成画像は、そのまま使わない、著作権者の許諾を得る、大幅に手を加えるといった対応を検討する必要があります。

まとめ

  • 画像生成AIの中核技術は拡散モデルで、ノイズ除去を繰り返し学習することで画像を生み出す
  • インペインティングは、既存写真の一部をマスクで指定し、周囲と矛盾しないように描き直す技術で、空室写真への家具合成を可能にしている
  • スケール狂いや光源不整合は、AIが寸法・光源を物理的に計算せず、統計的な推測で描いていることに起因する
  • 生成画像の著作権は、AI開発・学習段階(著作権法30条の4)、生成・利用段階(類似性・依拠性)、生成物自体の著作物性(創作意図・創作的寄与)の3つに分けて考える必要があり、一部の論点は専門家の間でも見解が分かれている

カグオクAIは、拡散モデルとインペインティングの技術を使い、不動産会社様の空室写真から家具合成画像を数分で作成するツールです。仕組みを踏まえた品質チェックを経た仕上がりを、無料トライアルで確認いただけます。