AI/MLツール

AI/MLツール

SadTalker on Ubuntu — 音声から口パク動画を自動生成するAIツール

SadTalker は、1枚の顔写真と音声ファイルを渡すだけで、口パクしながら話しているような動画を自動生成する AI ツールです。CVPR 2023 で発表された研究で、Gradio ベースの WebUI も付属しているのでコマンド操作が…
AI/MLツール

LivePortrait on Ubuntu — 静止画を動かすAIアバター生成ツールの導入

この記事では Ubuntu 24.04 LTS への LivePortrait のインストール手順を、実際にコンテナで動かした結果とあわせて解説します。
AI/MLツール

Real-ESRGAN on Ubuntu — AIで画像・動画を4K超解像アップスケール

「古い写真を高解像度で蘇らせたい」「アニメ画像を4Kで保存したい」——Real-ESRGANはそのための実用的な超解像AIツールです。Ubuntu 24.04 LTS に pip install realesrgan でインストールでき、G…
AI/MLツール

InstantID on Ubuntu — 1枚の顔写真から一貫したキャラクター画像を生成

1枚の顔写真を渡すだけで、同じ人物の顔を保ちながら様々なスタイルや構図の画像を生成できる——それが InstantID です。LoRA のような追加学習は不要で、推論時に顔の特徴をそのまま適用するのが特徴です。
AI/MLツール

IP-Adapter on Ubuntu — 参照画像のスタイルを別の画像に転写する方法

IP-Adapter(アイピーアダプター)とは、Tencent AI Lab が 2023 年に発表した画像スタイル転写の手法です。参照画像を1枚渡すだけで、そのスタイルや特徴を Stable Diffusion の生成画像に反映できます。…
AI/MLツール

AnimateDiff on Ubuntu — ローカルAI動画生成のセットアップと実行

AnimateDiff は、Stable Diffusion で生成した静止画に「動き」を与えてショート動画(GIF/MP4)を生成するフレームワークです。 2023年に Yuwei Guo らが発表した論文「AnimateDiff: An…
AI/MLツール

AUTOMATIC1111 API on Ubuntu — Stable Diffusionを外部APIとして利用

AUTOMATIC1111(stable-diffusion-webui)には、WebUI本体とは別にREST APIを公開する機能が標準で搭載されています。起動オプションに --api を追加するだけで http://localhost:…
AI/MLツール

DeepSpeed on Ubuntu — 大規模LLM分散学習の環境構築

「GPUが複数あるのに、モデルが1枚に収まらない」「学習が遅すぎて実験が回らない」――そんな悩みを解決するのが、Microsoft が開発した分散学習ライブラリ DeepSpeed です。結論から言うと、Ubuntu 24.04 LTS 上…
AI/MLツール

NVIDIA Triton Inference Server on Ubuntu — 本番MLモデルサービング

本番環境でMLモデルをAPIとして公開したい、でも手軽なスクリプトではスループットが足りない——そんな課題に答えるのが NVIDIA Triton Inference Server です。結論から言うと、Ubuntu 24.04 上に Do…
AI/MLツール

ONNX Runtime on Ubuntu — モデル変換と高速推論パイプライン構築

「機械学習モデルを本番環境で動かしたいけど、どのフレームワークでも動く推論エンジンってあるの?」という疑問に直接お答えします。結論として、ONNX Runtime を使えば PyTorch・TensorFlow・scikit-learn な…