📘

2025年8月現在の LLaMAモデル比較表

に公開

主要モデルサイズ・性能・用途別比較

モデル パラメータ数 コンテキスト長 主要ベンチマーク性能 推奨用途 メモリ要件目安
LLaMA 1
LLaMA-7B 70億 2K tokens GPT-3(175B)を多くのタスクで上回る 軽量アプリケーション ~14GB
LLaMA-13B 130億 2K tokens GPT-3(175B)を上回る性能 中規模アプリケーション ~26GB
LLaMA-30B 300億 2K tokens 高性能、研究用途 高品質タスク ~60GB
LLaMA-65B 650億 2K tokens PaLM、Chinchillaと競合 最高品質タスク ~130GB
LLaMA 2
LLaMA2-7B 70億 4K tokens MMLU: ~46%, GSM8K: ~14% チャットボット、軽量用途 ~14GB
LLaMA2-13B 130億 4K tokens MMLU: ~55%, GSM8K: ~29% 中規模商用アプリ ~26GB
LLaMA2-70B 700億 4K tokens MMLU: ~69%, GSM8K: ~57% 高品質アプリケーション ~140GB
LLaMA 3
LLaMA3-8B 80億 8K tokens MMLU: ~67%, GSM8K: ~79% オープンソース最高峰(8B級) ~16GB
LLaMA3-70B 700億 8K tokens MMLU: ~82%, GSM8K: ~93% Claude 3 Sonnet超えの性能 ~140GB
LLaMA 3.1
LLaMA3.1-8B 80億 128K tokens 長コンテキスト対応強化 モバイル・エッジ最適化 ~16GB
LLaMA3.1-70B 700億 128K tokens ツール使用、推論強化 中~大企業アプリ ~140GB
LLaMA3.1-405B 4,050億 128K tokens GPT-4級の性能、最大オープンモデル シンセティックデータ生成 ~810GB
LLaMA 3.2
LLaMA3.2-1B 10億 128K tokens テキスト特化軽量版 モバイル・IoT ~2GB
LLaMA3.2-3B 30億 128K tokens テキスト特化中規模 軽量サーバー用途 ~6GB
LLaMA3.2-11B 110億 128K tokens 視覚+テキスト対応 マルチモーダル用途 ~22GB
LLaMA3.2-90B 900億 128K tokens 高性能マルチモーダル 企業向けVision AI ~180GB
LLaMA 4 (2025)
LLaMA4-11B 110億 10M tokens MoE技術、超長コンテキスト 次世代軽量用途 ~22GB
LLaMA4-90B 900億 10M tokens GPT-4o超えの性能 企業向け高性能AI ~180GB

主要ベンチマーク説明

ベンチマーク 内容 満点/評価方法
MMLU 57科目の多分野知識テスト 100%(正答率)
GSM8K 小学校レベル数学文章題 100%(正答率)
HumanEval プログラミングコード生成 100%(Pass@1)
GPQA 大学院レベル理科問題 100%(PhD学生65%程度)

実用的な選び方ガイド

🚀 軽量・高速用途

  • LLaMA3.2-1B/3B: モバイルアプリ、IoT
  • LLaMA3-8B: コスト重視の商用サービス

⚡ バランス型

  • LLaMA3.1-70B: 企業の多用途AI
  • LLaMA3.2-11B: 画像も扱うアプリ

🏆 最高品質

  • LLaMA3.1-405B: シンセティックデータ生成
  • LLaMA4-90B: 次世代企業AI(2025年)

ファインチューニング実現性

モデルサイズ 8xA100環境での学習 必要な手法 現実性
7B-13B ✅ 容易 通常学習可能 ⭐⭐⭐⭐⭐
70B ✅ 可能 DeepSpeed ZeRO-3 + LoRA ⭐⭐⭐⭐⭐
405B ⚠️ 制限あり ZeRO-3 + QLoRA + 複数ノード ⭐⭐⭐

コスト目安(月額推定)

モデル クラウド推論コスト 自前GPU推論
8B級 $50-100 RTX 4090 1台
70B級 $200-500 A100 2-4台
405B級 $1000-2000 A100 8-16台

2025年現在の推奨

開発・学習用: LLaMA3-8B → 性能と効率のバランス最高
商用アプリ: LLaMA3.1-70B → 実用性と品質の最適解
研究・実験: LLaMA4シリーズ → 最新技術を試したい場合

Discussion