🖥️

【AI開発】社内でローカルLLMを構築したい。最高スペックのサーバーを買えば良いのか?|用途別ハードウェア選定ガイド

に公開

はじめに

「社内でローカルLLMを構築したい。とりあえず最高スペックのGPUサーバーを買えば良いのか?」

この問いに対する答えは 「NO‼️」 です。

クラウドAPIのコスト増大やデータプライバシーの懸念から、ローカルLLMを検討する企業が増えています。しかし、用途を定めずにハイエンドサーバーを購入してしまうのは、投資対効果の観点から見てリスクが高い判断です。

さらに見落とされがちな点として、LLMの推論にGPUは必須ではない ということがあります。量子化モデルであれば、一般的なCPUだけでも実用的に動作します。

本記事では、2026年3月現在の最新モデル(Qwen3.5シリーズ)を例に取りながら、AIモデルの用途別(汎用、音声、画像、コード生成など)に必要なハードウェアスペック と、CPU vs GPU の選択基準 を整理します。

ローカルLLM構築の基本概念

ローカルLLMとは、クラウドサービス(OpenAI、Anthropic等)のAPIに依存せず、自社サーバーや開発者マシン上で動作するAIモデルのことです。

推論(テキスト生成)はCPUのみでも実行できます。GPUは推論速度を大幅に向上させますが、必須ではありません。

まとめ(CPU vs GPU、用途別ハードウェア要件)

ローカルLLMの構築で最初に決めるべきなのは「CPUで十分か、GPUが必要か」と「どのAIタスクを実行するか」の2点です。

CPU vs GPU の比較

項目 CPU のみ GPU あり
LLM推論(テキスト生成) 可能(量子化モデル使用) 高速(10〜50倍)
初期投資 安価(5〜15万円) 高額(20〜100万円以上)
消費電力 低い(50〜150W) 高い(200〜700W)
推論速度(Qwen3.5 9B) 5〜20 tokens/秒 50〜150 tokens/秒
適用場面 低頻度利用、バッチ処理 高頻度利用、リアルタイム応答
画像・音声処理 実用的でない 必須

用途別ハードウェア要件の全体像

用途 推奨モデル CPU のみ GPU 推奨 想定コスト
汎用LLM(低頻度) Qwen3.5 9B 量子化 ✅ 可能 RTX 4060 (8GB) 5〜20万円
汎用LLM(高頻度) Qwen3.5 9B ⚠️ 遅い RTX 4070 (12GB) 20〜30万円
音声認識・生成 Whisper Large v3 Turbo ⚠️ 遅い RTX 4060 (8GB) 15〜25万円
画像生成(SD) SDXL / Flux ❌ 不可能 RTX 4080 (16GB) 30〜50万円
画像認識(Vision) Qwen3.5-VL ❌ 不可能 RTX 4090 (24GB) 40〜80万円
コード生成(高頻度) Qwen3.5 27B ⚠️ 遅い RTX 4080 (16GB) 30〜50万円

なぜ「最高スペック」を買うべきではないのか?

クラウドAPIとローカルLLMの比較

1. 用途によってはCPUで十分

テキスト生成(LLM推論)だけであれば、量子化モデルでCPUのみでも実用的に動作します。社内FAQシステムやバッチ処理での文書要約など、リアルタイム性が不要な用途では、GPUは不要です。

# CPUのみでQwen3.5 9Bを実行(量子化モデル)
ollama run qwen3.5:9b-q4_K_M

# メモリ使用量の目安: 約6.6GB(CPU RAM)
# 推論速度: 5〜15 tokens/秒(Intel Core i7相当)

2. 過剰投資のリスク

NVIDIA H100(1台200万円以上)のようなハイエンドGPUが活きるのは、数百億パラメータのモデルを学習・推論する場合や、画像・動画処理に限られます。テキスト生成だけなら、はるかに安価なCPUや低価格GPUで十分なケースが多いです。

3. 運用コストの増大

高性能GPUは電力消費が大きく、冷却コストも跳ね上がります。

  • H100: 消費電力700W、年間電気代 約12万円(24時間稼働)
  • RTX 4070: 消費電力200W、年間電気代 約3.5万円
  • CPU(Core i7): 消費電力65W、年間電気代 約1.1万円

4. スケーラビリティの柔軟性

最初から大規模なサーバーを構築してしまうと、需要変化への対応が難しくなります。小規模から始めて必要に応じてスケールアップするほうが、リスクとコストを抑えられます。

用途別ハードウェア選定の詳細ガイド

1. 汎用LLM(テキスト生成・チャットボットなど)

推奨モデル

  • Qwen3.5 9B: 日本語を含む201言語対応、256Kコンテキスト対応の汎用モデル(Apache 2.0ライセンス)
  • Qwen3.5 4B: 軽量・高速。日常的な質問応答やルーティング用途に最適
  • Qwen3.5 2B: エッジデバイスや極めて省リソースな環境向け

ハードウェア要件

パターン1: CPU のみ(低頻度利用)

  • 構成: Intel Core i7 / AMD Ryzen 7、32GB RAM
  • コスト: 10〜15万円
  • 推論速度: 5〜15 tokens/秒(量子化モデル使用)
  • 適用場面: 社内FAQ、バッチ処理、低頻度の問い合わせ対応
# 量子化モデルの使用(CPUで高速化)
ollama run qwen3.5:9b-q4_K_M  # 4bit量子化、メモリ約6.6GB
ollama run qwen3.5:9b-q8_0    # 8bit量子化、メモリ約10GB

パターン2: GPU あり(高頻度利用)

  • 最小構成: RTX 4060 (8GB)、16GB RAM、15万円〜
  • 推奨構成: RTX 4070 (12GB)、32GB RAM、25万円〜
  • 推論速度: 50〜100 tokens/秒
  • 適用場面: リアルタイムチャットボット、高頻度の質問応答

量子化による最適化

量子化レベル メモリ使用量(9B) 精度 推論速度(CPU)
FP16(非量子化) 約18GB 最高 遅い(実用的でない)
Q8(8bit) 約10GB 高い 普通(実用的)
Q4(4bit) 約6.6GB 中程度 速い(推奨)

2. 音声認識・音声生成

推奨モデル

  • Whisper Large v3 Turbo: OpenAI製の音声認識モデル。v3から大幅に高速化(同精度でCPUでも動作可能なケースあり)
  • Kokoro: 軽量な日本語音声合成(オープンソース)

ハードウェア要件

音声処理はCPUでも動作しますが、リアルタイム用途にはGPUを推奨します。

  • 最小構成: RTX 4060 (8GB)、16GB RAM、15万円〜
  • 推奨構成: RTX 4070 (12GB)、32GB RAM、25万円〜

実装例(Whisper)

import whisper

# モデルのロード(GPU使用)
model = whisper.load_model("large-v3-turbo")

# 音声ファイルを文字起こし
result = model.transcribe("meeting.mp3", language="ja")
print(result["text"])

処理速度の目安

  • RTX 4060: 1分の音声を約5秒で処理
  • RTX 4070: 1分の音声を約3秒で処理
  • CPU(Core i7) + faster-whisper: 1分の音声を約30〜60秒で処理(最適化あり)

3. 画像生成(Stable Diffusion / Flux)

推奨モデル

  • SDXL: 高品質な画像生成
  • Flux: 最新の高速生成モデル
  • ControlNet: 構図制御が可能

ハードウェア要件

CPUでの実行は現実的でなく、GPUが必須です。

  • 最小構成: RTX 4070 (12GB)、24GB RAM、25万円〜
  • 推奨構成: RTX 4080 (16GB)、32GB RAM、45万円〜
  • ハイエンド: RTX 4090 (24GB)、64GB RAM、80万円〜

VRAM使用量の目安

  • SDXL (1024x1024): 8〜12GB
  • SDXL + ControlNet: 12〜16GB
  • バッチ生成(4枚同時): 16〜24GB

実装例(Diffusers)

from diffusers import StableDiffusionXLPipeline
import torch

# モデルのロード(GPU必須)
pipe = StableDiffusionXLPipeline.from_pretrained(
    "stabilityai/stable-diffusion-xl-base-1.0",
    torch_dtype=torch.float16
).to("cuda")

# 画像生成
image = pipe(
    "a futuristic cityscape at sunset",
    num_inference_steps=50
).images[0]

image.save("output.png")

4. 画像認識

推奨モデル

  • Qwen3.5-VL: テキスト・画像・動画を統合的に理解するマルチモーダルモデル。Qwen3.5シリーズのVision対応版
  • LLaVA-Next: 軽量かつ高精度な画像・テキスト統合モデル

ハードウェア要件

CPUでの実行は実用的でなく、GPUが必須です。

  • 最小構成: RTX 4070 (12GB)、24GB RAM、25万円〜
  • 推奨構成: RTX 4080 (16GB)、32GB RAM、45万円〜
  • ハイエンド: RTX 4090 (24GB)、64GB RAM、80万円〜

5. コード生成(プログラミング支援)

推奨モデル

  • Qwen3.5 27B: 汎用性が高く、コード生成から設計レビューまで対応。HumanEval/MBPPのスコアがオープンソースモデルでトップクラス
  • Qwen3.5 9B: 軽量で高速。日常的なコード補完に十分な精度
  • Qwen3.5-35B-A3B (MoE): MoEアーキテクチャで計算効率が高く、32B相当の能力を低VRAMで実現

ハードウェア要件

パターン1: CPU のみ(低頻度、小規模モデル)

  • 構成: Intel Core i9、64GB RAM
  • モデル: Qwen3.5 9B(量子化)
  • 推論速度: 8〜15 tokens/秒
  • 適用場面: バッチでのコード解析、低頻度の補完

パターン2: GPU あり(高頻度、大規模モデル)

  • 推奨構成: RTX 4080 (16GB)、32GB RAM、45万円〜(Qwen3.5 27B向け)
  • ハイエンド: RTX 4090 (24GB)、64GB RAM、80万円〜(Qwen3.5 35B-MoE向け)
  • 推論速度: 60〜120 tokens/秒
  • 適用場面: IDE統合、リアルタイム補完、コードレビュー

実務で使えるハードウェア構成案

ローカルLLMアーキテクチャの全体像
用途別の推奨ハードウェア構成

パターン1: CPU のみ構成(予算: 10〜20万円)

対象: テキスト生成のみ、低頻度利用

構成例:

  • CPU: Intel Core i7-14700 / AMD Ryzen 7 7700X
  • RAM: 32GB DDR5
  • Storage: 1TB NVMe SSD
  • GPU: なし

実行可能なタスク:

  • 汎用LLM(Qwen3.5 9B 量子化)
  • 社内FAQ、ドキュメント要約
  • バッチ処理での文書生成

推論速度: 5〜15 tokens/秒
電気代: 年間約1.5万円

パターン2: エントリーGPU構成(予算: 20〜30万円)

対象: テキスト生成(高頻度)+ 音声認識

構成例:

  • GPU: RTX 4060 Ti (16GB) または RTX 4070 (12GB)
  • CPU: AMD Ryzen 7 / Intel Core i7
  • RAM: 32GB DDR5
  • Storage: 1TB NVMe SSD

実行可能なタスク:

  • 汎用LLM(Qwen3.5 9B、高速)
  • 音声認識(Whisper Large v3 Turbo)
  • コード支援(Qwen3.5 9B)

推論速度: 50〜100 tokens/秒
電気代: 年間約3.5万円

パターン3: ミドルレンジGPU構成(予算: 40〜60万円)

対象: 画像生成 + マルチモーダル + コード生成

構成例:

  • GPU: RTX 4080 (16GB) または RTX 4090 (24GB)
  • CPU: AMD Ryzen 9 / Intel Core i9
  • RAM: 64GB DDR5
  • Storage: 2TB NVMe SSD

実行可能なタスク:

  • 汎用LLM(Qwen3.5 27B)
  • マルチモーダルモデル(Qwen3.5-VL)
  • 高品質画像生成(SDXL + ControlNet)
  • 複数モデルの同時実行

推論速度: 100〜200 tokens/秒
電気代: 年間約6万円

パターン4: エンタープライズ構成(予算: 200万円以上)

対象: 大規模LLM + ファインチューニング

構成例:

  • GPU: NVIDIA A100 (40GB) × 2 または H100 (80GB) × 1
  • CPU: AMD EPYC / Intel Xeon
  • RAM: 128GB以上
  • Storage: 4TB NVMe SSD RAID

実行可能なタスク:

  • 大規模LLM(Qwen3.5 122B-MoE)
  • GPT-4oクラスのマルチモーダル推論
  • モデルのファインチューニング
  • 複数ユーザーの同時アクセス

ローカルLLM構築の実践手順

ステップ1: 用途の明確化と要件定義

まず「何のためにローカルLLMを構築するか」と「CPUで十分か、GPUが必要か」を明確にします。

用途 頻度 CPUで可能? 推奨構成 予算
社内FAQ ✅ はい CPU のみ 10〜15万円
リアルタイムチャット ⚠️ 遅い RTX 4060+ 20〜30万円
音声議事録 ⚠️ 最適化次第 RTX 4070+ 25〜35万円
画像生成 ❌ いいえ RTX 4080+ 40〜60万円

ステップ2: 小規模検証から開始(CPUで試す)

いきなりGPUサーバーを購入するのではなく、まずCPUで検証します。

# Ollamaをインストール(macOS / Linux)
curl -fsSL https://ollama.com/install.sh | sh

# Qwen3.5 9B(量子化版)を起動してテスト
ollama run qwen3.5:9b-q4_K_M

# 性能を確認
ollama run qwen3.5:9b-q4_K_M "Pythonでフィボナッチ数列を書いて"

判断の目安:

  • 推論速度が5 tokens/秒以上 → CPUで運用可能
  • 推論速度が遅すぎる、または画像・音声処理が必要 → GPU購入を検討

ステップ3: モニタリングとスケーリング

実際の利用状況を計測しながら、必要に応じてハードウェアをスケールアップします。

import psutil
import GPUtil
import time

# CPU・メモリ使用率のモニタリング
cpu_percent = psutil.cpu_percent(interval=1)
memory = psutil.virtual_memory()

print(f"CPU使用率: {cpu_percent}%")
print(f"メモリ使用: {memory.used / (1024**3):.1f}GB / {memory.total / (1024**3):.1f}GB")

# GPU使用率(GPU搭載時のみ)
gpus = GPUtil.getGPUs()
if gpus:
    for gpu in gpus:
        print(f"GPU {gpu.id}: {gpu.memoryUsed}MB / {gpu.memoryTotal}MB ({gpu.load * 100:.1f}%)")

おわりに

本記事では、ローカルLLMの用途別ハードウェア選定と CPU vs GPU の選択基準を整理しました。

要点は3つです:

  1. LLMの推論(テキスト生成)は、CPUのみでも実行可能 — Qwen3.5 9B(量子化)であれば、6.6GBのRAMで動作する
  2. 「最高スペックのサーバーを買う」より「用途に合ったハードウェアを選ぶ」 — 用途を先に定義することが最も重要
  3. まずCPUで検証し、必要に応じてGPUへスケールアップ — 段階的なアプローチがリスクを最小化する

今回例として使用した Qwen3.5シリーズは、Alibaba Qwenチームが2026年2月にリリースした最新のオープンソースLLMファミリーです。201言語対応、最大256Kトークンのコンテキスト、Apache 2.0ライセンスで商用利用可能という特性から、ローカル環境での実運用ユースケースが広いモデルです。まずは ollama run qwen3.5:9b で試してみてください。

次のステップとして、以下のトピックも検討してください:

  • モデルの量子化とチューニング: VRAMを削減しつつ精度を維持する
  • 複数GPUでの分散推論: 大規模モデルを複数GPUで並列実行
  • RAGシステムの構築: 社内ドキュメントと連携した質問応答システム

より踏み込んだ内容(本番環境の設計など)は Shineos Tech Blog で公開予定です。

https://blog.shineos.com/

参考リンク

Qwen3.5モデル:

その他ツール・参考情報:

Discussion