🌟

🧠 CHORD: SFTとRLを統一するオフポリシー・オンポリシー学習の新フレームワーク

に公開

🚀 はじめに

大規模言語モデル(LLM)の性能向上において、教師あり微調整(SFT)強化学習(RL) は重要な手法として知られている。しかし、従来の「SFT → RL」の順次実行パラダイムは、しばしば最適以下の結果をもたらすことが報告されている。

今回紹介するのは、Alibaba Groupの研究チームが発表した「CHORD」🎼 —— SFTとRLを統一的に扱う革新的なフレームワークである。

📝 論文紹介

  • タイトル: On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
  • 著者: Wenhao Zhang et al. (Alibaba Group)

🔬 従来手法の問題点:「Shift-Readapt-Overfit」現象

SFT-then-RLパラダイムの限界

研究チームは、Qwen2.5-7B-InstructをDeepseek-R1の専門家データで学習させる実験を通じて、興味深い現象を発見した。学習曲線は以下の3段階を示す:

1. Shift(シフト)段階 📉

  • モデル性能が初期段階で低下
  • オフポリシーな専門家データが既存パターンを破綻させる
  • 露出バイアス(exposure bias)により自己生成コンテキストでの推論が困難

2. Readapt(再適応)段階 📈

  • 専門家の推論パターンを徐々に統合
  • 性能が専門家レベルまで回復・向上
  • しかし自発的探索能力が制限される

3. Overfit(過学習)段階 📊

  • 限られた専門家データへの過学習
  • 汎化性能の低下と出力多様性の喪失
  • 後続のRL最適化に必要な探索能力を阻害

🏗️ CHORDフレームワークの提案

統一的な視点:オフポリシー vs オンポリシー

CHORDは、SFTを独立した段階ではなく、オンポリシーRL過程内の動的重み付き補助目的として再定義する。

ハイブリッド損失関数

L_{\text{Hybrid}}(\theta) = (1 - \mu) L_{\text{GRPO}}(\theta) + \mu L_{\text{SFT}}(\theta)

ここで:

  • L_{\text{GRPO}}(\theta): GRPO(Group Relative Policy Optimization)損失
  • L_{\text{SFT}}(\theta): 教師あり微調整損失
  • \mu \in [0, 1]: グローバル制御係数

デュアル制御メカニズム

1. グローバル係数 \mu による制御 🌐

\mu の減衰スケジュールにより、オフポリシー模倣からオンポリシー探索への滑らかな遷移を実現:

  • 初期段階: \mu が高く、専門家データからの学習を重視
  • 後期段階: \mu が低下し、オンポリシー探索にシフト

2. トークンワイズ重み関数 \phi(\cdot) による微細制御 🎯

重要度サンプリング(IS)の問題点を解決するため、新しい重み関数を提案:

\phi(y_t^*; \pi_\theta) = p_t(1 - p_t)

ここで p_t = \pi_\theta(y_t^*|x, y_{<t}^*) は現在の政策下でのトークン確率。

\phi(\cdot) の特徴

  • p_t = 0.5 で最大値を取る放物線的曲線
  • 両極端をダウンウェイト
    • 高確率トークン(p_t \to 1):エントロピー崩壊を防止
    • 低確率トークン(p_t \to 0):政策破綻を回避
  • 不確実性の高いトークンに学習を集中

SFT-φ目的関数

\mathcal{L}_{\text{SFT}-\phi}(\theta) = -\mathbb{E}_{(x, y^*) \sim \mathcal{D}_{\text{SFT}}} \left[ \sum_{t=1}^{|y^*|} \phi(y_t^*; \pi_\theta) \cdot \log \pi_\theta(y_t^*|x, y_{<t}^*) \right]

📊 実験結果

データセットと評価

  • データセット: OpenR1-Math-220k(数学問題とDeepseek-R1による解答)
  • モデル: Qwen2.5-Instructシリーズ
  • 評価指標: AIME24, AIME25, AMC, MMLU-pro

性能比較結果

手法 AMC AIME24 AIME25 MMLU-Pro
Qwen2.5-7B-Instruct 43.8 11.7 6.66 24.7
SFT-best + RL 58.4 17.1 16.3 51.3
CHORD-μ 60.8 18.1 17.9 43.3
Pure RL 52.1 13.2 8.54 45.8
CHORD-φ 62.5 18.2 17.2 56.2

主要な発見 🔍

  1. CHORD-μ: 全数学ベンチマークでSFT-best+RLを上回る性能
  2. CHORD-φ: 最高性能を達成し、汎用推論能力も維持
  3. 応答長の制御: 専門家データの過度な模倣を避けつつ、効果的なパターンを選択的に吸収

学習曲線の分析

エントロピー損失の変化 📈

  • Pure RL: 安定したエントロピー維持
  • オフポリシーデータ統合(ISなし): 急激なエントロピー上昇
  • IS使用: エントロピー崩壊を引き起こす
  • CHORD-φ: 探索と活用の最適バランスを維持

💡 実装時の考慮事項

実装詳細

  1. 勾配停止: \phi(p_t) を重みとしてのみ扱い、\phi 内の p に対する逆伝播を防ぐ
  2. 重み付き正規化: 有効トークンに対して \sum_t \phi(p_t) で除算
  3. 確率クランプ: 数値的極値を避けるため p_t[\varepsilon, 1-\varepsilon] にクランプ

推奨監視指標

  • \pi_\theta の系列レベルエントロピー
  • 専門家トークンの p_t ヒストグラム
  • 平均 \sum_t \phi(p_t) と平均 p_t
  • 応答長分布

🚀 実用的意義と今後の展望

CHORDの利点

  1. 安定性: オフポリシーデータの破綻的影響を軽減
  2. 柔軟性: 動的重み付けによる段階的遷移
  3. 効率性: 専門家知識の選択的吸収
  4. 汎用性: 既存のRL手法との容易な統合

🎯 まとめ

CHORDフレームワークは、SFTとRLの統一的扱いを通じて、従来の順次実行パラダイムが抱える根本的問題を解決する。デュアル制御メカニズム(グローバル係数 \mu とトークンワイズ関数 \phi(\cdot))により、専門家知識の選択的吸収と探索能力の保持を両立している。

特に \phi(p_t) = p_t(1-p_t) という不確実性に基づく重み付けは、高確率・低確率両極端のダウンウェイトにより、安定した学習を実現する革新的アプローチだ。

実験結果は、数学的推論タスクにおいてCHORDの優位性を明確に示しており、LLMの高度な推論能力開発における新たな標準となる可能性を秘めている。


この記事が参考になったら、ぜひ「いいね」👍とコメントをお願いします!CHORDの実装や応用について議論しましょう🤖

Discussion