ローカルLLM

ローカルLLM

ローカルLLMの量子化(GGUF/GPTQ/AWQ)を理解する完全ガイド

ローカル環境でLLMを動かすとき、一番気になるのがGPUメモリ(VRAM)の消費量です。最新の7Bモデルでも量子化なし(FP16)では16GB以上のVRAMが必要で、RTX 3060やRTX 4060では到底動きません。しかし量子化(Qua…
ローカルLLM

Perplexity API on Ubuntu — Sonar検索モデルをPythonから呼び出す

Web 検索機能を内蔵した大規模言語モデルを自分のコードから呼び出したいとき、Perplexity の Sonar API は選択肢として有力です。openai パッケージの base_url を変えるだけで既存の OpenAI SDK が…
ローカルLLM

LLM Gateway on Ubuntu — 複数AIプロバイダーを統一プロキシで管理

Ubuntu 24.04.4 LTS / Python 3.12.13(python:3.12-slim Docker イメージで実測)/ LiteLLM 1.89.3 / 2026-06-21 確認
ローカルLLM

OpenRouter on Ubuntu — 複数LLMを1つのAPIで使い分ける設定方法

OpenRouter は、OpenAI・Google・Anthropic・Mistral など 340 以上のLLMを 1つのAPIエンドポイントで呼び分けられる プロキシサービスです。「今日は Gemma で試して、本番は Claude…
ローカルLLM

2026年Ollamaおすすめモデルランキング【実測比較】

「Ollamaでおすすめのモデルってどれ?」という質問は、2026年に入って急増しています。モデルの数が増えすぎて、どれを選べばいいか分からない——そんな声に応えるために、実際に Ollama 0.30.8 で5つのモデルを動かし、トークン…
ローカルLLM

Ollamaモデルのパラメータ数(7B/13B/70B)とスペック対応表

「ollama pull llama3.1:8b を実行したいけど、自分のPCで動くか不安…」という声をよく聞きます。7Bや13B、70Bという数字が何を意味するのか、どれくらいのRAMが必要なのかが分かると、モデル選びがぐっと楽になります…
ローカルLLM

用途別Ollamaモデルの選び方【コーディング/日本語/軽量】

「Ollamaを入れたけど、どのモデルを使えばいいの?」と迷っている方は多いと思います。Ollama公式ライブラリには数百のモデルが登録されており、選択肢が多すぎて逆に困ってしまうのが正直なところです。
ローカルLLM

ローカルLLMはVPSと自宅PCどちらで動かすべき?コスト比較

ローカルLLMを動かしたいけど、VPSと自宅PCのどっちがいいんだろう?正直、これは多くの人が最初に詰まるポイントです。
ローカルLLM

2026年のローカルLLM最新動向とおすすめモデルまとめ

「ローカルLLMって最近どうなっているの?」という疑問に、2026年6月15日時点で実際にツールを叩いて取った一次データで答えます。結論から言うと、Ollamaは v0.30.8(2026年6月12日リリース)が最新で、llama3.2・q…
ローカルLLM

ノートPCでローカルLLMを動かす方法【低スペック対応モデル】

「ローカルLLMって GPU がないと無理でしょ?」——そう思っていませんか。