🚀

🚀 Qwen系「7月ラッシュ」まとめ記事(2025年7月22〜2025年7月31日)

に公開

🚀 Qwen系「7月ラッシュ」まとめ記事

この1か月だけで少なくとも6つの主要リリースが雪崩れ込みました。公式ブログ・HFモデルカード・ツイートを突き合わせ、「何が出て/何が変わったか」を俯瞰します。

📊 一覧表:日付順ハイライト

日付 モデル / ツール パラメータ構成 コア特徴 典拠
7/22 Qwen3-Coder-480B-A35B-Instruct 480B 全体 / 35B アクティブ (MoE) 256K→1M トークン、長ホライズン RL、SWE-Bench SOTA HF Model
7/24 Qwen Code CLI (npm) Gemini CLI フォーク、マルチモデル AB テスト対応 npm package
7/28 Qwen3-Coder-30B-A3B-Instruct(通称 Flash) 30.5B / 3.3B 64GB Mac でも動作、>6 tok/s(Unsloth計測) HF Model
7/29 Qwen3-30B-A3B-Instruct-2507 30.5B / 3.3B 非-Thinking モード刷新、精度向上版 HF Model
7/30 Qwen3-235B-A22B-Thinking-2507 235B / 22B "Thinking" 強化、数学系ベンチ最大+54% HF Model
7/31 Anycoder HF Space & Cerebras API ブラウザ実行デモ/1700 TPS推論 HF Space

🔍 各リリース詳細

2-1. Qwen3-Coder-480B-A35B-Instruct(7/22)

目的: リポジトリ丸ごと読み込み → 連続ツールコールで修正まで完遂する Agentic Coding。

技術: 7.5T以上のコード大規模訓練 + Mixture-of-Experts。35B activeに抑えつつ480B totalの知識を活用。

成果: SWE-Bench VerifiedでGPT-4o水準、Reutersも「国内外トップモデルに匹敵」と報道。

GPU要件: A100 80GB × 8以上推奨。

2-2. Qwen Code CLI(7/24)

Gemini CLIを完全OSSで再実装。npm i -g @qwen-code/qwen-codeで導入、.envでモデルを切替。

マルチターン対話時に複数APIコールを投げるためトークン消費は多め—Claude Codeと同じ注意点。

2-3. Qwen3-Coder-Flash(30B-A3B, 7/28)

3.3B activeでmacOS 64GB/RTX 3090単機でも常用可能。

Unslothの動的量子化で>6 tok/s実測報告。

Simon Willison氏も「今月6体目のQwenモデル」と驚嘆。

2-4. Qwen3-30B-A3B-Instruct-2507(7/29)

非Thinking系のリフレッシュチェックポイント。生成精度と一貫性を微調整。

2-5. Qwen3-235B-A22B-Thinking-2507(7/30)

"思考トークン"を活かした長手順推論専用。AIME25など数学系で+13〜54%向上。

HFカードで詳細変更点公開。

2-6. エコシステム拡張(7/31)

Anycoder: HF Space経由でブラウザ試遊可。

Cerebras: 235B Thinkingを1.7秒full-answer / 1700 TPSでAPI提供開始。

🌍 コミュニティリアクション

Unsloth—Flashを動的ローダで高速化、ローカルLLM勢が歓迎。

海外勢からの感嘆・危惧—「今年だけで50本目の中国OSS」など、西側モデル不足を嘆く声も。

📋 モデル選定ガイド(超簡易版)

使い道 推奨モデル 理由
研究/クラウドGPU潤沢 480B-A35B 全面SOTA・1Mコンテキスト
ローカルIDEで爆速 30B-A3B (Flash) 3.3B active + 量子化
複雑な数学・推論 235B-A22B-Thinking "思考"最適化
ターミナル自動化 Qwen Code CLI マルチモデル適用・ABテスト

🎯 技術的ハイライト

MoE(Mixture-of-Experts)アーキテクチャ

Qwen系の特徴的なMoE実装により、総パラメータ数に対してアクティブパラメータを大幅に削減:

  • 480Bモデル: 480B total → 35B active(7.3%)
  • 235Bモデル: 235B total → 22B active(9.4%)
  • 30Bモデル: 30.5B total → 3.3B active(10.8%)

Thinking トークン技術

Qwen3-Thinking系では、推論過程を明示的にトークン化することで:

  • 数学問題解決能力が最大54%向上
  • 長手順推論の一貫性向上
  • 推論過程の可視化・デバッグが可能

長コンテキスト対応

  • 1Mトークン: 480Bモデルで実現
  • 256Kトークン: 他のモデルで標準対応
  • リポジトリ全体の読み込みが可能

💻 実装例

Qwen Code CLI の使用例

# インストール
npm i -g @qwen-code/qwen-code

# 環境変数設定
echo "QWEN_API_KEY=your_api_key" > .env

# 使用
qwen-code "このPythonスクリプトを最適化して"

Flash モデルのローカル実行

# Unsloth での高速化例
from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained(
    model_name="Qwen/Qwen3-Coder-30B-A3B-Instruct",
    max_seq_length=8192,
    dtype=None,
    load_in_4bit=True,
)

# 推論
inputs = tokenizer("def fibonacci(n):", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=100)

📈 ベンチマーク結果

SWE-Bench Verified

  • Qwen3-Coder-480B: GPT-4o相当
  • Qwen3-Coder-30B: GPT-4相当

数学系ベンチマーク

  • AIME25: +13〜54%向上(Thinking版)
  • GSM8K: 大幅改善
  • MATH: 推論精度向上

推論速度

  • Flash 30B: >6 tok/s(Unsloth量子化)
  • 235B Thinking: 1.7秒/full-answer(Cerebras API)

🔮 今後の展望

8月以降の予告

  • 7B/14BサイズのFlash版
  • Thinking-Lite版の登場
  • マルチモーダル対応の拡張

エコシステム発展

  • IDE統合の深化
  • CI/CD連携の強化
  • エンタープライズ向け機能

📚 参考文献

Qwen3-Coder-480B-A35B-Instruct - Hugging Face Model Card
Qwen Code CLI - npm package
Qwen3-Coder-30B-A3B-Instruct (Flash) - Hugging Face Model Card
Qwen3-235B-A22B-Thinking-2507 - Hugging Face Model Card
Anycoder HF Space - ブラウザデモ
Reuters: "Qwen models rival top AI models" - 2025-07-22
Simon Willison's Blog - 2025-07-28

🎯 まとめ

7月だけで6本のメジャーアップデート。特に"Flash"と"Thinking"系の住み分けが明確化。

OSSツールチェーン(CLI/Anycoder)とAPIエコシステム(Cerebras, Unsloth量子化)が急速整備。

コーディングLLM領域は中国勢が明確に主導。今後は7B/14Bサイズや"Thinking-Lite"版が8月以降に予告済み。

これで混乱を一掃し、ご自身のワークロードに最適なQwenモデルを選ぶ手がかりにしてください!


本稿は2025年7月31日時点の情報に基づいています。最新情報は各公式ソースをご確認ください。

Discussion