【AI開発】社内でローカルLLMを構築したい。最高スペックのサーバーを買えば良いのか?|用途別ハードウェア選定ガイド
はじめに
「社内でローカルLLMを構築したい。とりあえず最高スペックのGPUサーバーを買えば良いのか?」
この問いに対する答えは 「NO‼️」 です。
クラウドAPIのコスト増大やデータプライバシーの懸念から、ローカルLLMを検討する企業が増えています。しかし、用途を定めずにハイエンドサーバーを購入してしまうのは、投資対効果の観点から見てリスクが高い判断です。
さらに見落とされがちな点として、LLMの推論にGPUは必須ではない ということがあります。量子化モデルであれば、一般的なCPUだけでも実用的に動作します。
本記事では、2026年3月現在の最新モデル(Qwen3.5シリーズ)を例に取りながら、AIモデルの用途別(汎用、音声、画像、コード生成など)に必要なハードウェアスペック と、CPU vs GPU の選択基準 を整理します。
ローカルLLM構築の基本概念
ローカルLLMとは、クラウドサービス(OpenAI、Anthropic等)のAPIに依存せず、自社サーバーや開発者マシン上で動作するAIモデルのことです。
推論(テキスト生成)はCPUのみでも実行できます。GPUは推論速度を大幅に向上させますが、必須ではありません。
まとめ(CPU vs GPU、用途別ハードウェア要件)
ローカルLLMの構築で最初に決めるべきなのは「CPUで十分か、GPUが必要か」と「どのAIタスクを実行するか」の2点です。
CPU vs GPU の比較
| 項目 | CPU のみ | GPU あり |
|---|---|---|
| LLM推論(テキスト生成) | 可能(量子化モデル使用) | 高速(10〜50倍) |
| 初期投資 | 安価(5〜15万円) | 高額(20〜100万円以上) |
| 消費電力 | 低い(50〜150W) | 高い(200〜700W) |
| 推論速度(Qwen3.5 9B) | 5〜20 tokens/秒 | 50〜150 tokens/秒 |
| 適用場面 | 低頻度利用、バッチ処理 | 高頻度利用、リアルタイム応答 |
| 画像・音声処理 | 実用的でない | 必須 |
用途別ハードウェア要件の全体像
| 用途 | 推奨モデル | CPU のみ | GPU 推奨 | 想定コスト |
|---|---|---|---|---|
| 汎用LLM(低頻度) | Qwen3.5 9B 量子化 | ✅ 可能 | RTX 4060 (8GB) | 5〜20万円 |
| 汎用LLM(高頻度) | Qwen3.5 9B | ⚠️ 遅い | RTX 4070 (12GB) | 20〜30万円 |
| 音声認識・生成 | Whisper Large v3 Turbo | ⚠️ 遅い | RTX 4060 (8GB) | 15〜25万円 |
| 画像生成(SD) | SDXL / Flux | ❌ 不可能 | RTX 4080 (16GB) | 30〜50万円 |
| 画像認識(Vision) | Qwen3.5-VL | ❌ 不可能 | RTX 4090 (24GB) | 40〜80万円 |
| コード生成(高頻度) | Qwen3.5 27B | ⚠️ 遅い | RTX 4080 (16GB) | 30〜50万円 |
なぜ「最高スペック」を買うべきではないのか?

1. 用途によってはCPUで十分
テキスト生成(LLM推論)だけであれば、量子化モデルでCPUのみでも実用的に動作します。社内FAQシステムやバッチ処理での文書要約など、リアルタイム性が不要な用途では、GPUは不要です。
# CPUのみでQwen3.5 9Bを実行(量子化モデル)
ollama run qwen3.5:9b-q4_K_M
# メモリ使用量の目安: 約6.6GB(CPU RAM)
# 推論速度: 5〜15 tokens/秒(Intel Core i7相当)
2. 過剰投資のリスク
NVIDIA H100(1台200万円以上)のようなハイエンドGPUが活きるのは、数百億パラメータのモデルを学習・推論する場合や、画像・動画処理に限られます。テキスト生成だけなら、はるかに安価なCPUや低価格GPUで十分なケースが多いです。
3. 運用コストの増大
高性能GPUは電力消費が大きく、冷却コストも跳ね上がります。
- H100: 消費電力700W、年間電気代 約12万円(24時間稼働)
- RTX 4070: 消費電力200W、年間電気代 約3.5万円
- CPU(Core i7): 消費電力65W、年間電気代 約1.1万円
4. スケーラビリティの柔軟性
最初から大規模なサーバーを構築してしまうと、需要変化への対応が難しくなります。小規模から始めて必要に応じてスケールアップするほうが、リスクとコストを抑えられます。
用途別ハードウェア選定の詳細ガイド
1. 汎用LLM(テキスト生成・チャットボットなど)
推奨モデル
- Qwen3.5 9B: 日本語を含む201言語対応、256Kコンテキスト対応の汎用モデル(Apache 2.0ライセンス)
- Qwen3.5 4B: 軽量・高速。日常的な質問応答やルーティング用途に最適
- Qwen3.5 2B: エッジデバイスや極めて省リソースな環境向け
ハードウェア要件
パターン1: CPU のみ(低頻度利用)
- 構成: Intel Core i7 / AMD Ryzen 7、32GB RAM
- コスト: 10〜15万円
- 推論速度: 5〜15 tokens/秒(量子化モデル使用)
- 適用場面: 社内FAQ、バッチ処理、低頻度の問い合わせ対応
# 量子化モデルの使用(CPUで高速化)
ollama run qwen3.5:9b-q4_K_M # 4bit量子化、メモリ約6.6GB
ollama run qwen3.5:9b-q8_0 # 8bit量子化、メモリ約10GB
パターン2: GPU あり(高頻度利用)
- 最小構成: RTX 4060 (8GB)、16GB RAM、15万円〜
- 推奨構成: RTX 4070 (12GB)、32GB RAM、25万円〜
- 推論速度: 50〜100 tokens/秒
- 適用場面: リアルタイムチャットボット、高頻度の質問応答
量子化による最適化
| 量子化レベル | メモリ使用量(9B) | 精度 | 推論速度(CPU) |
|---|---|---|---|
| FP16(非量子化) | 約18GB | 最高 | 遅い(実用的でない) |
| Q8(8bit) | 約10GB | 高い | 普通(実用的) |
| Q4(4bit) | 約6.6GB | 中程度 | 速い(推奨) |
2. 音声認識・音声生成
推奨モデル
- Whisper Large v3 Turbo: OpenAI製の音声認識モデル。v3から大幅に高速化(同精度でCPUでも動作可能なケースあり)
- Kokoro: 軽量な日本語音声合成(オープンソース)
ハードウェア要件
音声処理はCPUでも動作しますが、リアルタイム用途にはGPUを推奨します。
- 最小構成: RTX 4060 (8GB)、16GB RAM、15万円〜
- 推奨構成: RTX 4070 (12GB)、32GB RAM、25万円〜
実装例(Whisper)
import whisper
# モデルのロード(GPU使用)
model = whisper.load_model("large-v3-turbo")
# 音声ファイルを文字起こし
result = model.transcribe("meeting.mp3", language="ja")
print(result["text"])
処理速度の目安
- RTX 4060: 1分の音声を約5秒で処理
- RTX 4070: 1分の音声を約3秒で処理
- CPU(Core i7) + faster-whisper: 1分の音声を約30〜60秒で処理(最適化あり)
3. 画像生成(Stable Diffusion / Flux)
推奨モデル
- SDXL: 高品質な画像生成
- Flux: 最新の高速生成モデル
- ControlNet: 構図制御が可能
ハードウェア要件
CPUでの実行は現実的でなく、GPUが必須です。
- 最小構成: RTX 4070 (12GB)、24GB RAM、25万円〜
- 推奨構成: RTX 4080 (16GB)、32GB RAM、45万円〜
- ハイエンド: RTX 4090 (24GB)、64GB RAM、80万円〜
VRAM使用量の目安
- SDXL (1024x1024): 8〜12GB
- SDXL + ControlNet: 12〜16GB
- バッチ生成(4枚同時): 16〜24GB
実装例(Diffusers)
from diffusers import StableDiffusionXLPipeline
import torch
# モデルのロード(GPU必須)
pipe = StableDiffusionXLPipeline.from_pretrained(
"stabilityai/stable-diffusion-xl-base-1.0",
torch_dtype=torch.float16
).to("cuda")
# 画像生成
image = pipe(
"a futuristic cityscape at sunset",
num_inference_steps=50
).images[0]
image.save("output.png")
4. 画像認識
推奨モデル
- Qwen3.5-VL: テキスト・画像・動画を統合的に理解するマルチモーダルモデル。Qwen3.5シリーズのVision対応版
- LLaVA-Next: 軽量かつ高精度な画像・テキスト統合モデル
ハードウェア要件
CPUでの実行は実用的でなく、GPUが必須です。
- 最小構成: RTX 4070 (12GB)、24GB RAM、25万円〜
- 推奨構成: RTX 4080 (16GB)、32GB RAM、45万円〜
- ハイエンド: RTX 4090 (24GB)、64GB RAM、80万円〜
5. コード生成(プログラミング支援)
推奨モデル
- Qwen3.5 27B: 汎用性が高く、コード生成から設計レビューまで対応。HumanEval/MBPPのスコアがオープンソースモデルでトップクラス
- Qwen3.5 9B: 軽量で高速。日常的なコード補完に十分な精度
- Qwen3.5-35B-A3B (MoE): MoEアーキテクチャで計算効率が高く、32B相当の能力を低VRAMで実現
ハードウェア要件
パターン1: CPU のみ(低頻度、小規模モデル)
- 構成: Intel Core i9、64GB RAM
- モデル: Qwen3.5 9B(量子化)
- 推論速度: 8〜15 tokens/秒
- 適用場面: バッチでのコード解析、低頻度の補完
パターン2: GPU あり(高頻度、大規模モデル)
- 推奨構成: RTX 4080 (16GB)、32GB RAM、45万円〜(Qwen3.5 27B向け)
- ハイエンド: RTX 4090 (24GB)、64GB RAM、80万円〜(Qwen3.5 35B-MoE向け)
- 推論速度: 60〜120 tokens/秒
- 適用場面: IDE統合、リアルタイム補完、コードレビュー
実務で使えるハードウェア構成案

用途別の推奨ハードウェア構成
パターン1: CPU のみ構成(予算: 10〜20万円)
対象: テキスト生成のみ、低頻度利用
構成例:
- CPU: Intel Core i7-14700 / AMD Ryzen 7 7700X
- RAM: 32GB DDR5
- Storage: 1TB NVMe SSD
- GPU: なし
実行可能なタスク:
- 汎用LLM(Qwen3.5 9B 量子化)
- 社内FAQ、ドキュメント要約
- バッチ処理での文書生成
推論速度: 5〜15 tokens/秒
電気代: 年間約1.5万円
パターン2: エントリーGPU構成(予算: 20〜30万円)
対象: テキスト生成(高頻度)+ 音声認識
構成例:
- GPU: RTX 4060 Ti (16GB) または RTX 4070 (12GB)
- CPU: AMD Ryzen 7 / Intel Core i7
- RAM: 32GB DDR5
- Storage: 1TB NVMe SSD
実行可能なタスク:
- 汎用LLM(Qwen3.5 9B、高速)
- 音声認識(Whisper Large v3 Turbo)
- コード支援(Qwen3.5 9B)
推論速度: 50〜100 tokens/秒
電気代: 年間約3.5万円
パターン3: ミドルレンジGPU構成(予算: 40〜60万円)
対象: 画像生成 + マルチモーダル + コード生成
構成例:
- GPU: RTX 4080 (16GB) または RTX 4090 (24GB)
- CPU: AMD Ryzen 9 / Intel Core i9
- RAM: 64GB DDR5
- Storage: 2TB NVMe SSD
実行可能なタスク:
- 汎用LLM(Qwen3.5 27B)
- マルチモーダルモデル(Qwen3.5-VL)
- 高品質画像生成(SDXL + ControlNet)
- 複数モデルの同時実行
推論速度: 100〜200 tokens/秒
電気代: 年間約6万円
パターン4: エンタープライズ構成(予算: 200万円以上)
対象: 大規模LLM + ファインチューニング
構成例:
- GPU: NVIDIA A100 (40GB) × 2 または H100 (80GB) × 1
- CPU: AMD EPYC / Intel Xeon
- RAM: 128GB以上
- Storage: 4TB NVMe SSD RAID
実行可能なタスク:
- 大規模LLM(Qwen3.5 122B-MoE)
- GPT-4oクラスのマルチモーダル推論
- モデルのファインチューニング
- 複数ユーザーの同時アクセス
ローカルLLM構築の実践手順
ステップ1: 用途の明確化と要件定義
まず「何のためにローカルLLMを構築するか」と「CPUで十分か、GPUが必要か」を明確にします。
| 用途 | 頻度 | CPUで可能? | 推奨構成 | 予算 |
|---|---|---|---|---|
| 社内FAQ | 低 | ✅ はい | CPU のみ | 10〜15万円 |
| リアルタイムチャット | 高 | ⚠️ 遅い | RTX 4060+ | 20〜30万円 |
| 音声議事録 | 中 | ⚠️ 最適化次第 | RTX 4070+ | 25〜35万円 |
| 画像生成 | 中 | ❌ いいえ | RTX 4080+ | 40〜60万円 |
ステップ2: 小規模検証から開始(CPUで試す)
いきなりGPUサーバーを購入するのではなく、まずCPUで検証します。
# Ollamaをインストール(macOS / Linux)
curl -fsSL https://ollama.com/install.sh | sh
# Qwen3.5 9B(量子化版)を起動してテスト
ollama run qwen3.5:9b-q4_K_M
# 性能を確認
ollama run qwen3.5:9b-q4_K_M "Pythonでフィボナッチ数列を書いて"
判断の目安:
- 推論速度が
5 tokens/秒以上 → CPUで運用可能 - 推論速度が遅すぎる、または画像・音声処理が必要 → GPU購入を検討
ステップ3: モニタリングとスケーリング
実際の利用状況を計測しながら、必要に応じてハードウェアをスケールアップします。
import psutil
import GPUtil
import time
# CPU・メモリ使用率のモニタリング
cpu_percent = psutil.cpu_percent(interval=1)
memory = psutil.virtual_memory()
print(f"CPU使用率: {cpu_percent}%")
print(f"メモリ使用: {memory.used / (1024**3):.1f}GB / {memory.total / (1024**3):.1f}GB")
# GPU使用率(GPU搭載時のみ)
gpus = GPUtil.getGPUs()
if gpus:
for gpu in gpus:
print(f"GPU {gpu.id}: {gpu.memoryUsed}MB / {gpu.memoryTotal}MB ({gpu.load * 100:.1f}%)")
おわりに
本記事では、ローカルLLMの用途別ハードウェア選定と CPU vs GPU の選択基準を整理しました。
要点は3つです:
- LLMの推論(テキスト生成)は、CPUのみでも実行可能 — Qwen3.5 9B(量子化)であれば、6.6GBのRAMで動作する
- 「最高スペックのサーバーを買う」より「用途に合ったハードウェアを選ぶ」 — 用途を先に定義することが最も重要
- まずCPUで検証し、必要に応じてGPUへスケールアップ — 段階的なアプローチがリスクを最小化する
今回例として使用した Qwen3.5シリーズは、Alibaba Qwenチームが2026年2月にリリースした最新のオープンソースLLMファミリーです。201言語対応、最大256Kトークンのコンテキスト、Apache 2.0ライセンスで商用利用可能という特性から、ローカル環境での実運用ユースケースが広いモデルです。まずは ollama run qwen3.5:9b で試してみてください。
次のステップとして、以下のトピックも検討してください:
- モデルの量子化とチューニング: VRAMを削減しつつ精度を維持する
- 複数GPUでの分散推論: 大規模モデルを複数GPUで並列実行
- RAGシステムの構築: 社内ドキュメントと連携した質問応答システム
より踏み込んだ内容(本番環境の設計など)は Shineos Tech Blog で公開予定です。
参考リンク
Qwen3.5モデル:
その他ツール・参考情報:
Discussion