🚀 Qwen系「7月ラッシュ」まとめ記事(2025年7月22〜2025年7月31日)
🚀 Qwen系「7月ラッシュ」まとめ記事
この1か月だけで少なくとも6つの主要リリースが雪崩れ込みました。公式ブログ・HFモデルカード・ツイートを突き合わせ、「何が出て/何が変わったか」を俯瞰します。
⸻
📊 一覧表:日付順ハイライト
| 日付 | モデル / ツール | パラメータ構成 | コア特徴 | 典拠 |
|---|---|---|---|---|
| 7/22 | Qwen3-Coder-480B-A35B-Instruct | 480B 全体 / 35B アクティブ (MoE) | 256K→1M トークン、長ホライズン RL、SWE-Bench SOTA | HF Model |
| 7/24 | Qwen Code CLI (npm) | — | Gemini CLI フォーク、マルチモデル AB テスト対応 | npm package |
| 7/28 | Qwen3-Coder-30B-A3B-Instruct(通称 Flash) | 30.5B / 3.3B | 64GB Mac でも動作、>6 tok/s(Unsloth計測) | HF Model |
| 7/29 | Qwen3-30B-A3B-Instruct-2507 | 30.5B / 3.3B | 非-Thinking モード刷新、精度向上版 | HF Model |
| 7/30 | Qwen3-235B-A22B-Thinking-2507 | 235B / 22B | "Thinking" 強化、数学系ベンチ最大+54% | HF Model |
| 7/31 | Anycoder HF Space & Cerebras API | — | ブラウザ実行デモ/1700 TPS推論 | HF Space |
⸻
🔍 各リリース詳細
2-1. Qwen3-Coder-480B-A35B-Instruct(7/22)
目的: リポジトリ丸ごと読み込み → 連続ツールコールで修正まで完遂する Agentic Coding。
技術: 7.5T以上のコード大規模訓練 + Mixture-of-Experts。35B activeに抑えつつ480B totalの知識を活用。
成果: SWE-Bench VerifiedでGPT-4o水準、Reutersも「国内外トップモデルに匹敵」と報道。
GPU要件: A100 80GB × 8以上推奨。
2-2. Qwen Code CLI(7/24)
Gemini CLIを完全OSSで再実装。npm i -g @qwen-code/qwen-codeで導入、.envでモデルを切替。
マルチターン対話時に複数APIコールを投げるためトークン消費は多め—Claude Codeと同じ注意点。
2-3. Qwen3-Coder-Flash(30B-A3B, 7/28)
3.3B activeでmacOS 64GB/RTX 3090単機でも常用可能。
Unslothの動的量子化で>6 tok/s実測報告。
Simon Willison氏も「今月6体目のQwenモデル」と驚嘆。
2-4. Qwen3-30B-A3B-Instruct-2507(7/29)
非Thinking系のリフレッシュチェックポイント。生成精度と一貫性を微調整。
2-5. Qwen3-235B-A22B-Thinking-2507(7/30)
"思考トークン"を活かした長手順推論専用。AIME25など数学系で+13〜54%向上。
HFカードで詳細変更点公開。
2-6. エコシステム拡張(7/31)
Anycoder: HF Space経由でブラウザ試遊可。
Cerebras: 235B Thinkingを1.7秒full-answer / 1700 TPSでAPI提供開始。
⸻
🌍 コミュニティリアクション
Unsloth—Flashを動的ローダで高速化、ローカルLLM勢が歓迎。
海外勢からの感嘆・危惧—「今年だけで50本目の中国OSS」など、西側モデル不足を嘆く声も。
⸻
📋 モデル選定ガイド(超簡易版)
| 使い道 | 推奨モデル | 理由 |
|---|---|---|
| 研究/クラウドGPU潤沢 | 480B-A35B | 全面SOTA・1Mコンテキスト |
| ローカルIDEで爆速 | 30B-A3B (Flash) | 3.3B active + 量子化 |
| 複雑な数学・推論 | 235B-A22B-Thinking | "思考"最適化 |
| ターミナル自動化 | Qwen Code CLI | マルチモデル適用・ABテスト |
⸻
🎯 技術的ハイライト
MoE(Mixture-of-Experts)アーキテクチャ
Qwen系の特徴的なMoE実装により、総パラメータ数に対してアクティブパラメータを大幅に削減:
- 480Bモデル: 480B total → 35B active(7.3%)
- 235Bモデル: 235B total → 22B active(9.4%)
- 30Bモデル: 30.5B total → 3.3B active(10.8%)
Thinking トークン技術
Qwen3-Thinking系では、推論過程を明示的にトークン化することで:
- 数学問題解決能力が最大54%向上
- 長手順推論の一貫性向上
- 推論過程の可視化・デバッグが可能
長コンテキスト対応
- 1Mトークン: 480Bモデルで実現
- 256Kトークン: 他のモデルで標準対応
- リポジトリ全体の読み込みが可能
⸻
💻 実装例
Qwen Code CLI の使用例
# インストール
npm i -g @qwen-code/qwen-code
# 環境変数設定
echo "QWEN_API_KEY=your_api_key" > .env
# 使用
qwen-code "このPythonスクリプトを最適化して"
Flash モデルのローカル実行
# Unsloth での高速化例
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained(
model_name="Qwen/Qwen3-Coder-30B-A3B-Instruct",
max_seq_length=8192,
dtype=None,
load_in_4bit=True,
)
# 推論
inputs = tokenizer("def fibonacci(n):", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=100)
⸻
📈 ベンチマーク結果
SWE-Bench Verified
- Qwen3-Coder-480B: GPT-4o相当
- Qwen3-Coder-30B: GPT-4相当
数学系ベンチマーク
- AIME25: +13〜54%向上(Thinking版)
- GSM8K: 大幅改善
- MATH: 推論精度向上
推論速度
- Flash 30B: >6 tok/s(Unsloth量子化)
- 235B Thinking: 1.7秒/full-answer(Cerebras API)
⸻
🔮 今後の展望
8月以降の予告
- 7B/14BサイズのFlash版
- Thinking-Lite版の登場
- マルチモーダル対応の拡張
エコシステム発展
- IDE統合の深化
- CI/CD連携の強化
- エンタープライズ向け機能
⸻
📚 参考文献
• Qwen3-Coder-480B-A35B-Instruct - Hugging Face Model Card
• Qwen Code CLI - npm package
• Qwen3-Coder-30B-A3B-Instruct (Flash) - Hugging Face Model Card
• Qwen3-235B-A22B-Thinking-2507 - Hugging Face Model Card
• Anycoder HF Space - ブラウザデモ
• Reuters: "Qwen models rival top AI models" - 2025-07-22
• Simon Willison's Blog - 2025-07-28
⸻
🎯 まとめ
• 7月だけで6本のメジャーアップデート。特に"Flash"と"Thinking"系の住み分けが明確化。
• OSSツールチェーン(CLI/Anycoder)とAPIエコシステム(Cerebras, Unsloth量子化)が急速整備。
• コーディングLLM領域は中国勢が明確に主導。今後は7B/14Bサイズや"Thinking-Lite"版が8月以降に予告済み。
これで混乱を一掃し、ご自身のワークロードに最適なQwenモデルを選ぶ手がかりにしてください!
本稿は2025年7月31日時点の情報に基づいています。最新情報は各公式ソースをご確認ください。
Discussion