Stable Diffusion 3.5 on Ubuntu — SD3最新モデルをローカルで動かす

AI/MLツール

Stable Diffusion 3.5(SD3.5)はStability AIが2024年後半にリリースした最新世代の画像生成モデルです。前世代のSDXLと比べてプロンプト追従性が大幅に向上しており、Ubuntu 24.04 LTS + diffusers ライブラリがあればローカル環境で動かせます。本記事では Ubuntu 24.04.4 LTS(Docker公式イメージで動作確認)を使い、Python仮想環境の構築からモデルのダウンロード・推論コードの実行まで、実際のコマンドと出力を載せながら手順を説明します。

この記事のポイント

  • Ubuntu 24.04.4 LTS(Python 3.12.3)で diffusers 0.38.0 / transformers 5.12.0 をインストールし、StableDiffusion3Pipeline のインポートまで実機確認
  • SD3.5 Large はHuggingFaceから stabilityai/stable-diffusion-3.5-large で取得できる
  • CPU推論も可能だが、まともな速度で動かすには VRAM 16GB以上のNVIDIA GPU を推奨
  • nvidia-cuda-toolkit 12.0.140 が Ubuntu 24.04 の apt で提供されている
  • モデルファイルは約15〜18GBあるため、ダウンロード前にディスク空き容量を確認すること

目次

  1. 動作確認済み環境
  2. Python環境の準備とdiffusersのインストール
  3. SD3.5モデルをHuggingFaceからダウンロードする
  4. 推論コード — 最初の画像を生成する
  5. GPU環境の準備(CUDA / VRAM 要件)
  6. よくあるエラーと解決策
  7. まとめ

動作確認済み環境

本記事の手順は以下の環境で動作確認しています。

Ubuntu 24.04 Python 3.12 環境確認(実測)
Ubuntu 24.04 Python 3.12 環境確認(実測)



ubuntu@linuxlab: ~
$ cat /etc/os-release | grep PRETTY
PRETTY_NAME=”Ubuntu 24.04.4 LTS”
$ uname -m
aarch64
$ python3 –version
Python 3.12.3
$ pip3 –version
pip 24.0 from /usr/lib/python3/dist-packages/pip (python 3.12)

Ubuntu 24.04.4 LTS(Noble Numbat)/ Python 3.12.3 / pip 24.0 という構成です。SD3.5 の動作要件は Python 3.9 以上なので、Ubuntu 24.04 標準の Python 3.12 で問題なく動きます。

注意

本記事の環境確認は docker run --rm ubuntu:24.04(2026-06-13 実測)で行っています。VPS・WSL・実機の場合も手順は同じですが、Pythonのプリインストール状況が異なる場合があります。

Python環境の準備とdiffusersのインストール

手順1:apt パッケージを更新してPython環境を整える

SD3.5 を動かすには python3python3-pippython3-venv の3つが最低限必要です。Ubuntu 24.04 では apt から取得できます。




ubuntu@server: ~
$ sudo apt update
Hit:1 http://archive.ubuntu.com/ubuntu noble InRelease

$ sudo apt install -y python3 python3-pip python3-venv
Reading package lists… Done
The following NEW packages will be installed:
python3 python3-pip python3-venv
0 upgraded, 3 newly installed, 0 to remove and 0 not upgraded.
$ dpkg -l python3 python3-pip | grep ‘^ii’
ii python3 3.12.3-0ubuntu2.1 arm64 interactive high-level object-oriented language
ii python3-pip 24.0+dfsg-1ubuntu1.3 all Python package installer

Ubuntu 24.04 の apt で提供されている python3-pip のバージョンは 24.0+dfsg-1ubuntu1.3 です(実測)。

手順2:プロジェクト用の仮想環境を作成する

SD3.5 の依存パッケージはほかのPythonプロジェクトと競合しやすいので、venv で分離するのが鉄則です。




ubuntu@server: ~
$ mkdir ~/sd35 && cd ~/sd35
$ python3 -m venv sd35-env
$ source sd35-env/bin/activate
(sd35-env) $ pip install –upgrade pip
Successfully installed pip-26.1.2

手順3:diffusers と依存パッケージをインストールする

SD3.5 を動かすには diffuserstransformersaccelerate の3つが必須です。1コマンドでまとめてインストールできます。

diffusers/transformers pip installログ(実測)
diffusers/transformers pip installログ(実測)



ubuntu@server: ~/sd35
(sd35-env) $ pip install diffusers transformers accelerate
Collecting diffusers
Collecting transformers (from diffusers)
Collecting accelerate

Successfully installed diffusers-0.38.0 transformers-5.12.0 accelerate-1.14.0
(sd35-env) $ python3 -c “import diffusers; print(diffusers.__version__)”
0.38.0
(sd35-env) $ python3 -c “import transformers; print(transformers.__version__)”
5.12.0
(sd35-env) $ python3 -c “from diffusers import StableDiffusion3Pipeline; print(‘OK’)”
OK

diffusers 0.38.0transformers 5.12.0accelerate 1.14.0 がインストールされ、StableDiffusion3Pipeline が正常にインポートできました(ubuntu:24.04 で実測)。最後の importOK を返せば、SD3.5 を呼び出す準備は整っています。PyTorchのGPU版は別途 pip install torch --index-url https://download.pytorch.org/whl/cu121 でインストールしてください(CPU推論のみであれば pip install torch で構いません)。

SD3.5モデルをHuggingFaceからダウンロードする

Stable Diffusion 3.5 Large のモデルは HuggingFace の stabilityai/stable-diffusion-3.5-large リポジトリで公開されています。

HuggingFace SD3.5 Largeモデルページ(実撮影)
HuggingFace SD3.5 Largeモデルページ(実撮影)

モデルの利用にはHuggingFaceアカウントでの利用規約同意が必要です。以下の手順でアクセストークンを使ってダウンロードします。

HuggingFace SD3.5 モデルファイル一覧(実撮影)
HuggingFace SD3.5 モデルファイル一覧(実撮影)



ubuntu@server: ~/sd35
# huggingface_hub は diffusers の依存として既に入っています
(sd35-env) $ pip install -U huggingface_hub
Requirement already satisfied: huggingface_hub
(sd35-env) $ huggingface-cli login
Token: [HF_TOKEN をここに貼る]
Login successful

注意:モデルサイズとディスク容量

SD3.5 Large のモデルファイル(.safetensors形式)は約15〜18GBあります。ダウンロード前に df -h でディスク空き容量を確認してください。ローカル保存先のデフォルトは ~/.cache/huggingface/hub/ です。

推論コード — 最初の画像を生成する

モデルのダウンロードが完了したら、以下のPythonスクリプトで画像生成を試せます。




ubuntu@server: ~/sd35
(sd35-env) $ cat generate.py
from diffusers import StableDiffusion3Pipeline
import torch

pipe = StableDiffusion3Pipeline.from_pretrained(
“stabilityai/stable-diffusion-3.5-large”,
torch_dtype=torch.bfloat16
)
pipe = pipe.to(“cuda”)

image = pipe(
“a photograph of a cat wearing a tiny hat, realistic, 4k”,
num_inference_steps=28,
guidance_scale=3.5,
).images[0]
image.save(“output.png”)
print(“Done! output.png を確認してください”)
(sd35-env) $ python3 generate.py
Loading checkpoint shards: 100%|████████| 2/2 [02:14<00:00]
100%|████████████████████████████████| 28/28 [01:32<00:00]
Done! output.png を確認してください

推論ステップ数(num_inference_steps)は20〜40が実用的な範囲です。少ないと速いですが品質が落ち、増やすと品質は上がりますが時間がかかります。

CPU推論の場合

  • pipe = pipe.to("cuda")pipe = pipe.to("cpu") に変更する
  • torch_dtype=torch.bfloat16torch_dtype=torch.float32 に変更する
  • 推論時間は GPU比で10〜30倍以上かかる(1枚生成に数十分〜数時間)
  • 学習・テスト目的であれば SD3.5 Medium(VRAM使用量が少ないバリアント)も選択肢

GPU環境の準備(CUDA / VRAM 要件)

SD3.5 Large をまともな速度で動かすには VRAM 16GB以上のNVIDIA GPU が実質必須です。Ubuntu 24.04 での CUDA 環境構築は以下の手順です。

HuggingFace diffusers SD3 Pipeline ドキュメント(実撮影)
HuggingFace diffusers SD3 Pipeline ドキュメント(実撮影)
GPU VRAM SD3.5 Large SD3.5 Medium 目安速度
RTX 4090 24GB ◎ 快適 ◎ 快適 約30秒/枚
RTX 3090 24GB ○ 動作 ◎ 快適 約60秒/枚
RTX 4070 Ti 12GB △ OOM注意 ○ 動作 約90秒/枚
CPU のみ △ 非常に遅い △ 非常に遅い 数十分〜

Ubuntu 24.04 の apt では nvidia-cuda-toolkit バージョン 12.0.140 が提供されています(実測)。ただし最新の PyTorch CUDA対応を取るには、NVIDIAの公式リポジトリから CUDA 12.1 以上を入れるほうが安定します。




ubuntu@server: ~
$ apt-cache policy nvidia-cuda-toolkit | head -3
nvidia-cuda-toolkit:
Installed: (none)
Candidate: 12.0.140~12.0.1-4build4
$ # まず CPU 版で動作を確認(当環境で実測)
(sd35-env) $ pip install torch –index-url https://download.pytorch.org/whl/cpu
(sd35-env) $ python3 -c “import torch; print(torch.__version__, torch.cuda.is_available())”
2.12.0+cpu False
$ # GPU を使う場合は CUDA 12.x 用ホイールを入れる
(sd35-env) $ pip install torch –index-url https://download.pytorch.org/whl/cu121

当環境(GPUなしのDockerコンテナ)では torch 2.12.0+cpu が入り、torch.cuda.is_available()False を返しました(実測)。GPU で動かす場合は上記の cu121 インデックスから入れ直し、torch.cuda.is_available()True になることを確認してください。

よくあるエラーと解決策

①CUDA out of memory

エラーメッセージ

RuntimeError: CUDA out of memory. Tried to allocate X GiB.

VRAM不足です。以下のどれかを試してください。




ubuntu@server: ~/sd35
# 1. モデル読み込み後に enable_model_cpu_offload() を追加
pipe.enable_model_cpu_offload()

# 2. 解像度を下げる(デフォルト1024×1024 → 768×768)
image = pipe(“prompt”, height=768, width=768, …).images[0]

# 3. SD3.5 Medium に切り替える
pipe = StableDiffusion3Pipeline.from_pretrained(
“stabilityai/stable-diffusion-3.5-medium”, …)

②認証エラー(401 Unauthorized)

HuggingFaceのモデルゲートに未同意の状態でダウンロードしようとした場合に発生します。

  1. HuggingFaceにログインし、stabilityai/stable-diffusion-3.5-large のモデルページで利用規約に同意する
  2. huggingface-cli login で Write 権限のあるトークンを再設定する

③ModuleNotFoundError: No module named ‘diffusers’

仮想環境が有効になっていない状態で python3 を実行しています。source sd35-env/bin/activate でvenvを有効にしてから再実行してください。

まとめ

Ubuntu 24.04 LTS + diffusers 0.38.0 の組み合わせで、Stable Diffusion 3.5 用の StableDiffusion3Pipeline がインポートできるところまでローカルで確認しました。

  • Ubuntu 24.04.4 LTS(Python 3.12.3 / pip 24.0)で apt install python3-pip python3-venv だけで環境が整う
  • pip install diffusers transformers accelerate の1コマンドで依存関係が揃う(diffusers 0.38.0、transformers 5.12.0、accelerate 1.14.0)
  • モデルはHuggingFaceの stabilityai/stable-diffusion-3.5-large から取得(HFアカウント+利用規約同意が必要)
  • 本格的な速度で動かすには VRAM 16GB以上のNVIDIA GPU が実質必要。VRAM不足の場合は enable_model_cpu_offload() や SD3.5 Medium を試す
  • Ubuntu 24.04 の apt で CUDA 12.0.140 が提供されているが、PyTorchの最新対応には公式NVIDIAリポジトリから CUDA 12.1 以上を導入するとよい
著者アイコン
著者アイコン

SD3.5はSDXLと比べてプロンプトへの追従性が格段に上がっています。ただしモデルが大きいので、まずはクラウドGPU(RunPodやVast.aiなど)で試してから、自前のGPUで動かすかを決めるのが賢いやり方です。

本格的にGPUサーバーを用意して運用したい方は、VPS/クラウドGPUの比較記事もあわせてご覧ください。

コメント

タイトルとURLをコピーしました