主要モデルサイズ・性能・用途別比較
| モデル |
パラメータ数 |
コンテキスト長 |
主要ベンチマーク性能 |
推奨用途 |
メモリ要件目安 |
| LLaMA 1 |
|
|
|
|
|
| LLaMA-7B |
70億 |
2K tokens |
GPT-3(175B)を多くのタスクで上回る |
軽量アプリケーション |
~14GB |
| LLaMA-13B |
130億 |
2K tokens |
GPT-3(175B)を上回る性能 |
中規模アプリケーション |
~26GB |
| LLaMA-30B |
300億 |
2K tokens |
高性能、研究用途 |
高品質タスク |
~60GB |
| LLaMA-65B |
650億 |
2K tokens |
PaLM、Chinchillaと競合 |
最高品質タスク |
~130GB |
| LLaMA 2 |
|
|
|
|
|
| LLaMA2-7B |
70億 |
4K tokens |
MMLU: ~46%, GSM8K: ~14% |
チャットボット、軽量用途 |
~14GB |
| LLaMA2-13B |
130億 |
4K tokens |
MMLU: ~55%, GSM8K: ~29% |
中規模商用アプリ |
~26GB |
| LLaMA2-70B |
700億 |
4K tokens |
MMLU: ~69%, GSM8K: ~57% |
高品質アプリケーション |
~140GB |
| LLaMA 3 |
|
|
|
|
|
| LLaMA3-8B |
80億 |
8K tokens |
MMLU: ~67%, GSM8K: ~79% |
オープンソース最高峰(8B級) |
~16GB |
| LLaMA3-70B |
700億 |
8K tokens |
MMLU: ~82%, GSM8K: ~93% |
Claude 3 Sonnet超えの性能 |
~140GB |
| LLaMA 3.1 |
|
|
|
|
|
| LLaMA3.1-8B |
80億 |
128K tokens |
長コンテキスト対応強化 |
モバイル・エッジ最適化 |
~16GB |
| LLaMA3.1-70B |
700億 |
128K tokens |
ツール使用、推論強化 |
中~大企業アプリ |
~140GB |
| LLaMA3.1-405B |
4,050億 |
128K tokens |
GPT-4級の性能、最大オープンモデル |
シンセティックデータ生成 |
~810GB |
| LLaMA 3.2 |
|
|
|
|
|
| LLaMA3.2-1B |
10億 |
128K tokens |
テキスト特化軽量版 |
モバイル・IoT |
~2GB |
| LLaMA3.2-3B |
30億 |
128K tokens |
テキスト特化中規模 |
軽量サーバー用途 |
~6GB |
| LLaMA3.2-11B |
110億 |
128K tokens |
視覚+テキスト対応 |
マルチモーダル用途 |
~22GB |
| LLaMA3.2-90B |
900億 |
128K tokens |
高性能マルチモーダル |
企業向けVision AI |
~180GB |
| LLaMA 4 (2025) |
|
|
|
|
|
| LLaMA4-11B |
110億 |
10M tokens |
MoE技術、超長コンテキスト |
次世代軽量用途 |
~22GB |
| LLaMA4-90B |
900億 |
10M tokens |
GPT-4o超えの性能 |
企業向け高性能AI |
~180GB |
主要ベンチマーク説明
| ベンチマーク |
内容 |
満点/評価方法 |
| MMLU |
57科目の多分野知識テスト |
100%(正答率) |
| GSM8K |
小学校レベル数学文章題 |
100%(正答率) |
| HumanEval |
プログラミングコード生成 |
100%(Pass@1) |
| GPQA |
大学院レベル理科問題 |
100%(PhD学生65%程度) |
実用的な選び方ガイド
🚀 軽量・高速用途
-
LLaMA3.2-1B/3B: モバイルアプリ、IoT
-
LLaMA3-8B: コスト重視の商用サービス
⚡ バランス型
-
LLaMA3.1-70B: 企業の多用途AI
-
LLaMA3.2-11B: 画像も扱うアプリ
🏆 最高品質
-
LLaMA3.1-405B: シンセティックデータ生成
-
LLaMA4-90B: 次世代企業AI(2025年)
ファインチューニング実現性
| モデルサイズ |
8xA100環境での学習 |
必要な手法 |
現実性 |
| 7B-13B |
✅ 容易 |
通常学習可能 |
⭐⭐⭐⭐⭐ |
| 70B |
✅ 可能 |
DeepSpeed ZeRO-3 + LoRA |
⭐⭐⭐⭐⭐ |
| 405B |
⚠️ 制限あり |
ZeRO-3 + QLoRA + 複数ノード |
⭐⭐⭐ |
コスト目安(月額推定)
| モデル |
クラウド推論コスト |
自前GPU推論 |
| 8B級 |
$50-100 |
RTX 4090 1台 |
| 70B級 |
$200-500 |
A100 2-4台 |
| 405B級 |
$1000-2000 |
A100 8-16台 |
2025年現在の推奨
開発・学習用: LLaMA3-8B → 性能と効率のバランス最高
商用アプリ: LLaMA3.1-70B → 実用性と品質の最適解
研究・実験: LLaMA4シリーズ → 最新技術を試したい場合
Discussion