Skip to content

DNET_GenerativeAI

nishi_74322014 edited this page Aug 3, 2026 · 1 revision

生成系AI(Generative AI)

概要

  • 生成モデルのAIは一般的に「生成AI」と呼ばれる
  • 主に、テキスト、画像、音声などの新しいコンテンツを生成するために使用される

特徴

  • 既存データからパターンを学習し、新しいデータを生成
  • 人間が作成したかのような自然なコンテンツを生成可能
  • テキスト、画像、音声、動画、コードなど多様なモーダルに対応

従来のAIとの違い

  • 従来のAI(識別モデル):データを分類、予測
  • 生成AI(生成モデル):新しいデータを創造

詳細

生成AIに分類されるアルゴリズムは機械学習モデルでも開発できるが、実用的なものは、深層学習モデルのものが多い。

主要な技術

自己符号化器(AE:オートエンコーダ)

  • データを低次元の潜在表現に圧縮し、復元する
  • ノイズ除去、データ圧縮、異常検知に応用

変種:

  • VAE(変分オートエンコーダ)
    • 確率的な潜在表現を学習
    • 滑らかな潜在空間により、より良い生成が可能

テキスト生成系(Transformer系)

  • Transformer アーキテクチャ

    • 注意機構(Attention)により長距離依存関係を捉える
    • 並列処理が可能で学習が高速
  • 大規模言語モデル(LLM)

    • GPT(Generative Pre-trained Transformer)
    • BERT(Bidirectional Encoder Representations from Transformers)
    • T5、LLaMA、Mistralなど
  • 応用:

    • ChatGPT:対話型AIアシスタント
    • OSSのLLM:オープンソースの大規模言語モデル
    • コード生成:GitHub Copilot、CodeLlama
    • 文章要約、翻訳、質問応答

敵対的生成ネットワーク(GAN)

  • 生成器(Generator)と識別器(Discriminator)が競い合って学習
    • 生成器:偽データを生成
    • 識別器:本物と偽物を見分ける
    • 両者が競争することで、より精巧なデータ生成が可能に

変種:

  • StyleGAN:高解像度で写実的な顔画像生成
  • Pix2Pix:画像から画像への変換
  • CycleGAN:ペアなしで画像スタイル変換

応用:

  • 高品質な画像生成
  • スタイル変換(写真→絵画風など)
  • データ拡張

拡散モデル(Diffusion Model)

  • ノイズを段階的に除去してデータを生成

    • Forward Process:データに徐々にノイズを追加
    • Reverse Process:ノイズから元のデータを復元
  • 近年、画像生成で最も成功している手法

    • GANより安定した学習
    • 高品質で多様な画像を生成

代表的なモデル:

  • DDPM(Denoising Diffusion Probabilistic Models)
  • Stable Diffusion:テキストから高品質な画像を生成
  • DALL-E 2/3:テキストから画像を生成(OpenAI)
  • Midjourney:芸術的な画像生成に特化

応用:

  • テキストから画像生成(Text-to-Image)
  • 画像編集(Inpainting、Outpainting)
  • 超解像(Super Resolution)

応用分野

テキスト生成

  • 対話システム:ChatGPT、Claude、Bard
  • 文章作成支援:メール、レポート、記事
  • プログラミング支援:コード生成、デバッグ
  • 翻訳、要約、質問応答

画像生成

  • アート作成:Midjourney、Stable Diffusion、DALL-E
  • デザイン支援:ロゴ、イラスト、写真編集
  • ゲーム開発:テクスチャ、キャラクター生成
  • 医療:合成データ生成

音声・音楽生成

  • テキスト音声合成(TTS)
  • 音声クローン
  • 音楽生成:作曲、編曲
  • 音声変換

動画生成

  • テキストから動画生成
  • 動画編集、エフェクト
  • アニメーション生成

その他

  • 3Dモデル生成
  • 分子設計(創薬)
  • ファッションデザイン

課題と倫理

  • 著作権問題:学習データの権利
  • ディープフェイク:悪用のリスク
  • バイアス:学習データに含まれる偏見
  • 環境負荷:大規模モデルの学習コスト
  • 真偽判定:AI生成コンテンツの識別

参考

代表的なプロダクト

テキスト生成系:

画像生成系:

  • Stable Diffusion
  • DALL-E 3
  • Midjourney
  • Adobe Firefly

マルチモーダル:

  • GPT-4V(Vision)
  • Gemini
  • Claude 3

Tags: 移行, 生成AI, Generative AI, LLM, Stable Diffusion

NetDevInfraWiki

マイクロソフト系技術情報 Wiki
Open 棟梁 Wiki

(未着手)

開発基盤部会 Wiki

移行管理: DONETODO

Clone this wiki locally