👨‍💻

Qwen3.8-Max:コーディングとコワーキングの新たな基準

に公開

2026/08/03 · 25分 · 5068語 · QwenTeam

本日、Qwen ファミリー中最も高性能なモデル Qwen 3.8-Max を正式にリリースします。これは、Qwen-Max クラスのモデルの重みを初めてオープンソース化する里程碑でもあります — オープンウェイトは来週公開予定です。Qwen 3.5 のアーキテクチャを基盤に、Qwen 3.8-Max は 2.4 兆パラメータ にスケールし、コーディング、業務、研究、長期タスクのあらゆる面で包括的な改善をもたらします。より難しい質問に答えるだけでなく、複雑なタスクをエンドツーエンドで高い信頼性を持って完了し、着実に成果物を届けることができます。

Qwen3.8-Max — 現在 QwenCloud で利用可能

  • 2.4T パラメータ(アクティブ 95B)、オープンウェイトは来週公開
  • コーディング、業務、研究、長期タスクを横断する包括的な改善
  • 複雑なタスクのエンドツーエンドかつ信頼性の高い成果物の提供

API は ModelStudioから呼び出せます。


コーディング

最先端モデルにとって、今日のコーディングとは「依頼された関数を書く」ことではなく、空のフォルダから数日かけて実際のプロジェクトを完成させることを意味します。私たちは Qwen3.8-Max を 3 つのそうした課題でテストしました。すべての結果は、コードを実際に書いて実行して得る必要があり、人間の手は一切入りませんでした。3 つに共通するのは、Qwen3.8-Max は固定された計画をただ追うのではなく、フィードバックループを通じて自己進化するという点です。自己進化するハーネスを構築する場合でも、実験を通じて研究方法を磨く場合でも、提出を重ねてコンペティションの順位を上げる場合でも同様です。

10日以上の自律コーディング:自己進化するハーネスの構築

このケースでは、Qwen3.8-Max に oh-my-cli プロジェクトをゼロから作成し、10日以上にわたる長期自律コーディング実行の中で自己進化するハーネスを構築するよう依頼しました。ユーザーフィードバック、先進的なコミュニティの実践、モデル自身のセルフテスト結果を 1 つのエンジニアリングループに統合します。要件は Issue に正規化され、エージェントが自動的に引き受けて実行され、コード・テスト・プレビュー・ログを通じて継続的に反復されます。完全なプロジェクト履歴は GitHub リポジトリ qwen-code-dev-bot/oh-my-cli で公開されています。

自律コーディングハーネスの主な実装詳細:

  • ループエンジニアリングのセットアップ:タスク状態、ディスパッチ、リカバリ
    Qwen3.8-Max は Issue ステートマシン、ディスパッチャー、モニター、ウォッチドッグを 1 つの実行ループに統合します。新しい要件が GitHub Issues に入ると、エージェントがステートマシンを通じて ready → leased → active と引き受けます。実装が完了すると E2E テストと CI チェックがトリガーされ、合格後に PR がマージされます。

  • 自己テスト:製品の自己テストとメンテナンス
    各アップデート後、モデルは Build、Unit Test、E2E、Desktop Lifecycle の検証をトリガーします。異常状態は該当する Issue / PR に戻され、修正と再検証が行われます。

  • マルチソース進化:複数の需要シグナルからの製品アップグレード
    コミュニティの経験やユーザー / 開発者からのフィードバックを実行可能な作業に変換することで、/goal、/resume、Dynamic Workflow、Session Replay、Desktop などの機能を継続的に進化させます。

2026年7月30日時点で、約16日間の完全自律 AI 運用の後、リポジトリには 265 コミット、127 PR、151 Issue が蓄積され、継続的に進化する自律コーディング能力を実証しました。

Video 1. 10日以上にわたる長期自律コーディング実行の中で、Qwen3.8-Max はコミュニティの要件収集、Issue ディスパッチ、コード生成、検証、自己修復を自律的かつ継続的に完了します。

研究論文を再現し、さらに改善する

Qwen3.8-Max に最近の研究論文「Unified Data Selection for LLM Reasoning」を渡し、論文の実験をコードで再現した上で、さらに性能を上げるよう依頼しました。この論文は、LLM の学習において非常に実用的な問いに取り組んでいます:学習に使えるデータ量をはるかに超えるデータがあるとき、どの例を残すべきか? 論文の答えは、「困難な判断点(hard decision points)」が多い例 — 解説の中でモデルが次に進む方向について本当に迷った瞬間 — を重視することです。

重要な点:Qwen3.8-Max は論文と GPU セット以外、何も与えられていませんでした。スターターコードも、完成したパイプラインもありません。データ処理スクリプト、学習コード、評価設定 — すべてをゼロから設計・作成する必要があり、熟練エンジニアが数日かかるような作業です。

約5日間(約125時間の継続的な作業)、Qwen3.8-Max は単独で約 7,600 行のコードを書き、1,100 以上のアクションを実行し、33 ラウンドの GPU 学習を行いました。最初に約37時間を費やして論文の完全なパイプラインをゼロから再構築し、6つの主要な発見を再現しました — 選択したデータで Qwen3-8B モデルを繰り返し微調整し、難しい数学ベンチマークでの性能向上を確認しました(例えば、論文の選択方法はランダム選択に比べて AIME24 で +7.7% 優れていました)。

次に、再現を自己進化に変えました。続く約88時間の間、自己改善型研究ループ — 仮説を立てる → コードを書く → GPU で実行する → 分析する → 再試行する — を実行し、4 ラウンドで 18 の改善アイデアを独自に発明・テストしました。各ラウンドの結果が次のラウンドの仮説に反映され、各試行の失敗を診断することで、最終的に論文自身のアプローチを上回る新しい手法を生み出しました。コンペティションレベルの数学ベンチマーク AIME24 で +2.7 ポイントの向上を達成しました。

24時間で数百の人間チームを上回る

次に、Qwen3.8-Max を実際のオンラインコンテスト — Alibaba Cloud Tianchi プラットフォームで開催された「WWW2025 Multimodal Dialogue Intent Recognition Challenge」— にエントリーしました。526 チームが競う中、タスクは顧客サービスのチャット(テキストとスクリーンショットの両方)を読み、顧客が何を望んでいるかを正しく把握することでした。

完全に自律的に、厳密な24時間の制限の中で、Qwen3.8-Max はコンテストルールを読み、完全なソリューションをコードで構築しました。テキスト側では、BERT、MacBERT、RoBERTa などの中国語言語モデルを微調整してアンサンブルしました。製品スクリーンショット側では、視覚言語モデル Qwen2.5-VL-7B を微調整し、メインモデルが自信を持てない画像には Chinese-CLIP モデルをバックアップとして使用しました。それらを重み付け投票システムに統合し、クロスバリデーションで各モデルの投票の重みを調整し、同点を破るために追加の画像投票者を加えました。45 回の提出を通じて、各ラウンドのフィードバックが次の微調整と再重み付けを導き、精度は 0.60 から最終的に 0.853 まで着実に上昇し、526 チーム中 458 チーム(87%)を上回りました。

この 3 つのケースは、Qwen3.8-Max の際立った点を示しています。困難でオープンエンドな目標に数日間集中し、自らアイデアを生み出し、それを動作する結果に変換できる — そしてすべてを人間が介在せずに行います。


業務(Work)

コーディングと並んで、ほぼあらゆる職業の日常を埋める複雑で多ステップ、ツールを多用した「実際の業務」は、フロンティアモデルが巨大な経済的価値を生むもう一つの主な領域です。Qwen3.8-Max をこれらのワークフローで広く有能かつ信頼性高く使えるようにすることが、私たちのミッションの中心です。

実世界の RL システムのスケーリング

RL 環境と計算リソースを共同でスケーリングすることで、複数の人気ハーネス(QwenWork / Claude Code / Codex / OpenClaw / Hermes)全体を横断して、一般的な業務能力を均一に向上させます。これを実現するには、3 つの連携した課題に取り組む必要がありました:

  1. 独立した軸に沿って分離された実世界環境を継続的にスケールする
    タスク(単一タスク → マルチタスク → マルチデイ)、ワークスペース(複数ファイル → 階層フォルダ → 複雑な異種フォルダ)、ハーネス(カテゴリ、バージョン、スキル)の各軸で、環境の成長が組み合わせ的に増大するようにし、個別の統合を必要としないようにします。

  2. 異種の検証を内包する Universal Reward System
    実行ベースのチェック、テキストやレンダリングされた視覚出力に対するルーブリック条件付き判定、エージェントによる検査を、自動スケーラブルなルーブリックの下で統一します。これらのモダリティを 1 つの報酬システム内で統一することで、タスク固有の検証器を維持することによる非一貫性を排除し、すべての環境で一貫して信頼できる報酬源を提供します。

  3. オンラインデータバランサー
    タスク、難易度、ワークスペース、ハーネス間の分布が高度にバランスされたバッチを維持するよう各バッチを整形し、バッチ間の勾配分散を抑制し、RL 計算の安定した継続的スケーリングを支えます。

これらが幅広さ、信頼できる報酬、安定性を提供し、環境と計算の共同スケールを、実世界の業務能力における測定可能で水平的な向上に変えます。

Fig 1. Qwen3.8-Max は、RL 学習のスケールが続くにつれて、社内および公開の業務ベンチマーク数十種で安定した一貫した改善を示します。

Fig 2. Qwen3.8-Max は QwenWork、Claude Code、Codex、OpenClaw、Hermes など、多くのハーネスで同等の性能を達成します。

数百の高付加価値職種における業務能力の広さの検証

フロンティアモデルが経済的に価値の高い業務でますます広い役割を担う中、Qwen3.8-Max が実際のワークフローで本番品質の成果を届ける能力の広さを、数百の高経済価値職種にわたってストレステストしました。いくつかの代表的な事例:

  • 企業コンプライアンス顧問
    Qwen3.8-Max は数百の文書から構成されるコーパスから 1,284 の関連条項を一度のパスで抽出し、1時間未満で完全なレビューを完了しました。通常、このようなレビューにはパラリーガルチームが協力して約 1 週間かかります。

  • UI/UX デザイナー
    デジタルバンキングアプリ NOVA の高忠実度・インタラクティブなプロトタイプを 8 画面、一貫したデザインシステムで一発で作成しました。人間の修正ラウンドはゼロで、通常のワークフローでは 3〜5 ラウンドの修正が必要です。

  • レストランブランド創業者
    100 件以上の食材供給ブリーフを読み、26 品の完全なメニューを一発で作成しました。各料理には平均カロリーと食材の出所が注釈付けされ、食材コスト率は 33.8% に抑えられています。通常、このようなメニュー開発にはシェフ長と運用チームが数週間かけてレシピテスト、コスト計算、洗練を繰り返します。

  • 構造エンジニア
    一連の図面から、30階建てオフィスビルの耐震構造モデルをブラウザ上で再構築しました。固有周期、基礎せん断力、層間変位角は、ホバーでリアルタイムに確認できます。従来のワークフローでは、エンジニアが専門のモデリングソフトで手動でモデルを構築し、通常 1 週間以上かかります。

  • リハビリテーションセラピスト
    2D の紙の評価シートを、自由に回転可能な視点と層ごとの解剖学的オーバーレイを持つ 3D インタラクティブデモに変換しました。患者がどこに損傷があり、回復がどう進むかを正確に見ることができます。以前は医療アニメーションスタジオに外注し、納期 2〜4 週間、数千ドルのコストがかかっていました。

  • スポーツデータアナリスト
    1 選手あたり約 8,400 の攻撃 / 守備ポゼッションを解析し、数十分で使える選手の戦術プロファイルとコーチングレポートを作成しました。従来のアナリティクスチームは、戦術セグメンテーション、因果帰属、レポート作成を手動で行い、通常数日の作業日を要します。

Video 1. 数百の高付加価値職種を横断し、Qwen3.8-Max は実際のワークフローで人間の生産性を測定可能に向上させます — 業務能力の広さを示しています。

1 セッションで収益性のあるエンドツーエンドのクオンツ戦略を構築

Dynamic Workflows 構築能力を駆使し、Qwen3.8-Max はタスク計画をプログラム的に推進し、大規模なサブエージェントシステムを正確にオーケストレーションします — 1 回の会話をエンドツーエンドで自動化されたクオンツ研究ループに変えます。

  • 深さ:エンドツーエンドの ETF ローテーション戦略の研究開発
    1 行のタスク記述から、Qwen3.8-Max は複雑な動的ワークフローを自律的に計画し、数時間かけて完全な ETF ローテーション戦略を提供しました — データシステムの構築、ベースファクターの作成、多ラウンドの貪欲反復のオーケストレーションを行い、バックテストを動的に分析しながら軌道修正しました。その間、固定されたスクリプトではなく、証拠に基づいて行動しました:

    • 設計期間の指標と検証期間の指標の不一致 — 典型的な過学習のシグナル — を観察すると、自動的にプルーニングをトリガーし、ラウンドごとに冗長なファクターを削除しました。
    • 複数のパスが同じコアシグナルセットに収束していることを見つけると、パス依存性を排除するためにマルチシード和集合検証を追加しました。
    • 3 モデルアンサンブルが、小さなクロスセクションでは固定方向合成ほど頑健でないと判断すると、より適した戦略フレームワークに自律的に切り替えました。
  • 広さ:大規模並列ファクター探索
    ファクター研究は広大な探索空間を持ち、従来のワークフローは直列的でした。Qwen3.8-Max はこのプロセスを並列化しました:モメンタム、バリュー、クオリティ、インベストメント、ローリスク、センチメントという古典的ファクターファミリーの 6 つの短い説明から、それぞれを 50 の研究方向に分解し、約 330 のサブエージェントを派遣し、約 6,000 のバックテストを完了し、実行中にもワークフローを継続的に適応させました。選定されたファクターは 0.64〜1.48 の超過シャープレシオを達成し、IC は一様に正で 0.010〜0.014 の範囲でした。

一貫した単一トラックの R&D から巨大な仮説空間の並列探索まで、Qwen3.8-Max は Dynamic Workflows を活用してオーケストレーションロジックを再現可能なプログラムに固定し — 研究者が数週間から数ヶ月かけて直列作業で行っていたクオンツ研究を、1 回の会話内でスケーラブルかつ自動化されたループに圧縮しました — 長期自律業務の広い可能性を示しています。

Video 2. Qwen3.8-Max は、クオンツ研究者の専門知識を誰にでも届けられるようにする可能性を示唆しています — 業務能力の深さを示しています。


長期タスク(Long-Horizon Task)

高度に複雑で長期にわたり、複数の制約を持つタスクに取り組む際、Qwen3.8-Max は卓越したシステムレベルの自律計画とエンドツーエンドの閉ループ適応学習能力を示します。デジタルチップ設計における厳密な物理制約の中を航行する場合でも、高度に競争的で戦略的なビジネスシミュレーションの場合でも、モデルはアクション・フィードバック・反復のループを通じて数千ラウンドの相互作用にわたって深いアルゴリズムおよび戦略的再構築を達成します。

自律チップ設計とフィードバック駆動型最適化

Qwen3.8-Max は、論理再構築、多制約最適化、物理レイアウト生成にわたるシリコンデザインのフロー全体を自律的に実行することに成功しました。対象デザインは、モジュラー指数演算とモジュラー乗算を統合した GCD / RSA 暗号化ハードウェアアクセラレータです。GCD データパスと制御パスを基盤に構築されたこのブロックは、典型的にコンパクトでありながら論理密度の高いデジタル回路を表しています。ランダム化された cocotb 検証フレームワークの下で、モデルは 4 ビット、6 ビット、8 ビット、16 ビット構成全体でビット正確な機能的正確性を維持しながら、合成ゲート数(Yosys セル数)を最小化する必要があります — これはフロントエンドのハードウェア設計における面積と正確性の古典的なトレードオフに直接取り組むものです。面積性能は 16 ビット(WIDTH = 16)構成に基づいて評価されます。

Qwen3.8-Max は、シミュレーション(Iverilog)、合成(Yosys)、物理設計(OpenROAD)のツールチェーンと統合されたサンドボックス環境内でこのデザインを最適化しました。最小限の入力 — 基本的なタスク記述、空のモジュールテンプレートを持つスタブ RTL ワークスペース、検証と合成のための評価スクリプト — から始まり、Qwen3.8-Max は完全に自律的に動作しました。ゴールデンリファレンスデザインや人間の介入なしに、モデルは高レベルのアルゴリズムアーキテクチャ設計から RTL コード生成、多ラウンドの反復的洗練までのプロセス全体を独立して実行しました。

1 回の継続的な自律実行で、Qwen3.8-Max は約 500 ターンと 13 の重要なマイルストーンにわたる 71 回の評価を完了し、デザインのエンドツーエンド再構築を実行しました。モデルは RTL 編集、シミュレーション・デバッグ、合成分析、冗長性の特定、データパスの反復的再アーキテクティングを自律的に管理し — 初期のバグ修正から深いアルゴリズムレベルの書き換えまで前進しました。最初の機能的に実用可能なデザインは 8,298 ゲートでしたが、Qwen3.8-Max はこれを 678 ゲートまで削減し、評価されたすべてのモデル中トップの成績を収めました。この軌跡は、Qwen3.8-Max が実行の後半、つまり数百ターンを超えた後でも主要な構造的突破が可能であることを示しています。早期の低い成果に留まるのではなく、さらに深く最適化し続けられるのです。

主なデザインマイルストーン:

  1. アルゴリズム書き換え:モジュロディバイダーから反復シフト減算へ(8,298 → 2,010 ゲート、ターン 22)
    最も大きな最適化ステップ。Qwen3.8-Max は modular_multiplier の高価な 16 ビットハードウェアモジュロディバイダーを反復シフト減算アーキテクチャに置き換え、一挙に 6,288 ゲートを削減 — 総面積削減の 80% 以上を占めます。

  2. 冗長性除去とビット幅トリミング(2,010 → 1,304 ゲート、ターン 35〜48)
    呼び出し元の事前条件を認識し、モデルは REDUCE ステージ全体を安全にバイパスし、2 つの独立した削減モジュールを 1 つの共有ブロックに統合し、出力パスを組み合わせ回路に最適化し、内部レジスタ k_ff のビット幅を縮小しました。

  3. レジスタと制御 FSM のプルーニング(1,304 → 907 ゲート、ターン 60〜113)
    モデルは冗長なベースと mod レジスタ、および k_nz フリップフローを削除し、偶数の早期脱出メカニズムを導入し、減算器の最上位ビット(MSB)をコンパレータとして使用し、GCD モジュール内の分離した「比較してから減算」ロジックを 1 つの再利用可能な減算器に統合しました。

  4. モジュール融合とロジック共有(907 → 765 ゲート、ターン 170〜252)
    モジュール境界を解消し、モデルは乗算器をモジュラー指数演算の有限状態マシン(FSM)に直接インライン化し、3 つのサブモジュールを統合し、1 つの減算器をグローバルに共有しました。これにより、モジュール間の冗長なインターフェースと重複ロジックが排除されました。

  5. ゲートレベル洗練(765 → 678 ゲート、ターン 443〜500)
    共有 NOR ゲートツリー、絶対差減算分割(abs-sub splitting)、バイトからビットへの選択ロジックなどの局所最適化を活用し、モデルは最後のゲートレベルの冗長性を絞り出しました。

フロントエンドの最適化が物理実装に変換されるかを検証するため、Qwen3.8-Max は RTL デザインを OpenROAD(Nangate45 PDK)を使用した標準的な配置配線(PR)フローに通し、物理的なシリコンレイアウトを生成しました。物理レイアウト表現では、各チップは実際の配線結果を示します:標準セルはダイの物理平面上に配置され、金属配線層がその上に積み重ねられ(各層は色分けされ、垂直なビアで接続されます)。初期デザインは 106×106 µm² のダイを占有し、総配線長は 33,369 µm で、深刻なタイミング違反(-4.46 ns のネガティブスラック)がありました。最終的なレイアウトは 46×46 µm² のダイに縮小され、配線長は 4,187 µm に減少し、500 MHz でタイミングクロージャーを達成しました(+0.66 ns スラック)。これは物理ダイ面積を 81% 削減し、高レベルのフロントエンドアーキテクチャ最適化が、高度にコンパクトで配線可能かつ高性能なシリコン実装に直接変換されることを証明しました。

このケースは、自律的な長期ハードウェアエージェントの基盤モデルとしての Qwen3.8-Max の 2 つの重要な能力を浮き彫りにします:

  • 長期にわたる持続的な最適化:モデルは数百の複雑な相互作用ターンにわたって高度に一貫した体系的な戦略を維持し、表面的な構文調整で停滞するのではなく、アルゴリズムレベルのデータパス書き換えまで深く掘り下げます。
  • フィードバック駆動型の閉ループ改善:事前のリファレンスデザインがない状況で、モデルは完全に「編集・シミュレート・合成・レイアウト」のフィードバックループに依存して最適化を推進します。各設計反復は自動化された cocotb 機能テストによって厳密に検証され、物理的実現可能性は OpenROAD バックエンド検証によって完全に保証されます。

長期運用における継続的学習

E-Commerce Bench は、365 日間の長期サイクルにわたる EC 運営シミュレーションベンチマークであり、持続的な運用シナリオにおける大規模言語モデルのビジネス意思決定能力を評価するために設計されました。Taobao と Tmall からの実際の匿名化された取引データに基づいて構築され、このベンチマークは 12 の店舗タイプ、60 の製品カテゴリ、約 600 のサプライヤー、7,000 の製品からなる複雑なエコシステムを深く再現しています。モデルには 10 万元の初期資本が与えられ、複数のオンラインストアを同時に運営します。1 年を通じて、季節的な需要変動、突発的な環境イベント、高度に現実的な EC 決済システムからのキャッシュフロー圧力に対処する必要があります。モデルは、商品選定、サプライチェーン交渉、在庫管理、動的価格設定、返品処理を含むフルチェーンの意思決定を自律的に行い、最終的な目標は年末の総残高を最大化することです。これはまた、1 年を通じたモデルの資本配分戦略もテストします。成長のために積極的に投資するタイミングを知る必要があります。同様に重要なのは、サイクル終了前に在庫や営業利益を現金に変換することです。そうでないと、帳簿に残された未換算資産が最終結果を損なう可能性があります。

価格交渉では、ベンチマークはゲーム理論の原則に基づいてサプライヤーマトリックスを導入し、各サプライヤーは独自の性格特性と譲歩戦略を持ちます。これにより、モデルは多ラウンドの自然言語相互作用を通じて交渉する必要があります。Qwen3.8-Max は交渉において継続的学習能力を示しました。同じサプライヤーの同じ製品について深く探り、ラウンドごとに調達価格を段階的に引き下げ、利益を安定して増加させました。その結果、レーダーチャートで表される交渉効率は時間とともに継続的に拡大しました。さらに、この交渉経験を類似の製品に効果的に一般化しました。一方、他のモデルの交渉効率は中盤で頭打ちになる傾向がありました。

さらに、モデルは水面下の隠れたリスクと複雑な市場のリズムを乗り越える必要がありました。約 600 のサプライヤーのマトリックス内に、ベンチマークは密かに 152 の詐欺的な販売者を仕込んでおり、「会員料金の罠」「安値の餌」「商品説明と異なる」などの典型的な詐欺パターンを網羅しています。これはモデルのリスク管理能力を包括的にテストしました。同時に、年次大促進期の注文急増と、台風や原材料不足などのランダムなサプライチェーン危機が絡み合い、モデルの在庫リズムと危機管理能力を限界まで試しました。この背景の中で、Qwen3.8-Max は卓越した先見的計画能力を示しました。運営の最早期に最も多くの資本を投資してポジションを確立し、これがその後の資産成長曲線を加速させました。また、年末の大促進期に 10 万元を超える純利益を達成しました — これは 2 位の GLM 5.2 の約 2.4 倍に相当します。

Qwen3.8-Max は最終的に最高総残高 41万6,252元(4.16 倍のリターン)を達成し、2 位の GLM 5.2 を 38% 上回りました。これは前代のフラッグシップである Qwen3.7-Max よりも 152% の改善を示しています。これらの結果は、Qwen3.8-Max が長期の一貫した意思決定において優位性を持つことを示しています。さらに、取引フィードバックから適応的に学び、2,000 ラウンド以上の相互作用にわたって継続的に反復・進化する能力を持ち、初期に学んだ戦略に固執するのではありません。


マルチモーダルエージェント

見るものすべてから行うことすべてへ、Qwen3.8-Max は画像、文書、動画を理解できるだけではありません。タスクのライフサイクル全体を貫く視覚的知性を提供します。

200 ページ以上の財務報告書や複雑な PDF を扱う際、Qwen3.8-Max はページをまたいでテキスト、グラフ、文書レイアウトを理解し、大量の情報から重要な洞察を抽出し、構造化されたレポートや本番-ready な Web 体験に変換できます。100 時間以上の動画を処理する際、特定の瞬間を見つけて詳細な質問に答えるだけでなく、人物、イベント、タイムスタンプ、シーンをビデオメモリグラフに整理し、長期間にわたってつながりを継続的に構築し、事象の展開、人物関係、重要な瞬間を再構成できます。

入力が数百ページの文書であれ、完全な TV シリーズであれ、100 時間のライブストリームであれ、消費が困難だった情報を検索可能で追跡可能、かつインタラクティブな知識構造に変換できます。

理解にとどまらず、Qwen3.8-Max は実際の視覚的生産タスクも実行できます。個人の映像を vlog に編集したり、質問を没入型の教育アニメーションに変えたり、単一のインターフェーススクリーンショットから完全なフロントエンドプロジェクトを再構築したり、間取り図を Blender ベースの 3D 室内ビジュアライゼーションに変換したり、自然言語のリクエストからインタラクティブなゲームやアプリケーションを開発したりできます。

さらに重要なのは、視覚が入力段階に限定されないことです。実行中、Qwen3.8-Max は自分の中間結果を継続的に観察・評価します。ページレイアウト、物体の向き、空間関係、アニメーションの質、相互作用の結果を検査できます。テレビの向きが間違っている、インターフェースがずれている、意図したデザインと視覚結果が一致しないなどの問題を検出すると、ずれを特定し、計画を修正し、自律的に出力を修正できます。

これは、視覚がエージェントが入力を理解するための単なる別のモダリティではなく、計画、実行、検証、反復を横断するネイティブなフィードバックループになることを意味します。モデルは観察しながら生成し、実行しながらレビューし、結果を繰り返し検査し、問題を特定し、作業を改善します。この視覚的フィードバックループにより、エージェントはタスクを単に完了させるのではなく、うまく完了させる方向へ進みます。

Qwen3.8-Max は、マルチモーダルエージェントが世界を理解することから、視覚を通じて世界の中で継続的に行動し創造することへ進化するのを助けています。

デジタル世界で複雑なタスクを独力で完了するには、多くの場合、基盤ロジックを実装するためのコーディングと、タスクを推進し結果を観察するための手動によるインターフェース操作の両方が同時に必要です。この Hybrid Agent 能力 — コーディングと GUI 操作の組み合わせ — は、2 つのチャンネルを補完させます:コーディングは効率的かつ大規模に重い作業を行い、GUI 操作は人間が見て触れることができるものすべてにアクセスし、さらに重要なのは、実際に動作するシステムに対するフィードバックを提供すること — 上記の自分の出力を検査する視覚的フィードバックループを、実際に動作するアプリケーションに対する検証まで拡張します。

これを測定するため、私たちは RecreationBench を導入します。これは、デスクトップ(Ubuntu、macOS、Windows)、モバイル(Android)、Web の 5 つのプラットフォームにわたる長期アプリケーション再現ベンチマークです。モデルは実際に動作するアプリケーションをブラックボックスとしてのみ観察 — ソースコードなし、インターネットアクセスなし — 純粋に相互作用とフィードバックを通じてそれを理解し、アプリケーション全体をゼロから再構築します。ここで Qwen3.8-Max はすでにフロンティアレベルの Hybrid Agent 能力を示しており、反復的なコーディングとインタラクティブなフィードバックのサイクルを繰り返し、段階的にオリジナルに収束します。

これらの能力を既存のエージェントシステムに統合しやすくするため、私たちは Qwen-MM-Plugins も導入します。これはマルチモーダルエージェント向けに設計されたハーネス拡張ライブラリで、画像・動画処理、マルチモーダルメモリ、動的解像度サポート、視覚的ツール使用、動画編集、Blender、CAD などのタスクに特化した能力をエージェントフレームワークに提供します。Qwen-MM-Plugins を使えば、既存のエージェントハーネスを、より自然にマルチモーダルネイティブなシステムに拡張できます。


ユーザーからのフィードバック

Qwen3.8-Max について最も正直な評価は、実際にそれを使い込んできた人々からのものです。トップクラスのエージェントプラットフォーム、主要なオープンソースアルゴリズムチーム、法律・金融・製造のプロフェッショナル企業、スタートアップ、個人開発者、学術研究者 — すべてが最も複雑でミッションクリティカルで長期的なタスクを次々と任せています。

企業は大規模なエージェントシステムを構築するために使います。知識労働者は画像、原稿、動画を投げかけ、すべてを処理してもらいます。開発者は重いエンジニアリングタスクを丸投げします。研究チームは文献、データ、シミュレーションのループをエンドツーエンドで実行します。1 つのモデルが、これほど異なる仕事でこれほど頻繁に頼られる存在になる。評価は同じです:Qwen3.8-Max は長い自律タスクチェーンを駆動し、一発で出荷可能な成果物を生み出します。


フルベンチマーク表

コーディングエージェント

ベンチマーク Opus4.8 Fable5 GPT5.6 Sol (max) Qwen3.7-Max Qwen3.8-Max
Terminal Bench 2.1 84.6 84.6 88.8 74.5 86.6
SWE-bench Pro 69.2 80.0 64.6 60.6 67.7
DeepSWE 1.1 59.0 70.0 73.0 21.6 56.6
NL2Repo-Bench 69.4 -- -- 47.2 55.9
FrontierSWE 70.0 88.8 -- 40.7 73.5
MLS-Bench-Lite 42.8 49.9 46.2 31.7 41.0
PaperBench 80.3 88.8 90.5 64.8 93.0
AndroidBench 69.8 84.5 74.0 56.5 75.1
QwenSWEBench 84.0 86.3 73.5 63.4 80.7
QwenQoderBench 62.7 63.1 53.8 36.8 58.4
QwenReactBench 1694 1770 1564 1538 1724
QwenSVGBench 1648 1690 1758 1499 1713

汎用エージェント

ベンチマーク Opus4.8 Fable5 GPT5.6 Sol (max) Qwen3.7-Max Qwen3.8-Max
CoWorkBench 72.3 75.9 71.5 64.6 74.8
WorkSpaceBench 66.8 68.7 65.6 61.4 67.7
JobBench 48.4 57.4 45.4 31.3 53.4
SkillsBench 65.1 70.9 73.5 61.2 70.2
Agents' Last Exam (Pass / Score) 27.0 / 45.1 -- / -- 30.6 / 53.6 11.8 / 31.1 27.0 / 52.4
Automation-Bench (Pass@1) 27.2 29.1 29.7 14.2 27.3
Toolathlon Verified (Pass@1) 76.2 77.9 74.9 49.7 72.5
WideSearch 72.9 81.2 -- 75.2 81.9
HLE w/ tools 57.9 64.5 58.0 53.5 56.2

汎用能力

ベンチマーク Opus4.8 Fable5 GPT5.6 Sol (max) Qwen3.7-Max Qwen3.8-Max
GPQA Diamond 92.0 92.6 94.1 92.4 92.6
HLE 45.7 53.3 47.2 41.4 43.6
IFBench 62.2 63.5 72.7 79.1 82.8
$OneMillion-Bench (expert score) 41.8 55.9 53.8 44.4 52.5
HealthBench 52.4 -- 55.3 54.5 60.2
PLawBench 69.6 70.2 72.3 58.9 73.2
PRBench-Legal 52.7 57.6 57.6 48.5 57.6
PRBench-Finance 51.9 55.8 55.5 46.8 58.3
MRCR v2 256K (8-needle) 83.2 -- 93.8 86.7 92.9
LongBench v2 69.1 -- 67.1 65.3 66.3

注記:

  1. Fable5 の結果にはフォールバックが含まれる可能性があります。
  2. Terminal Bench 2.1:Claude Code で評価(avg@10)、5時間タイムアウト、max_tokens=131,072。他のモデルは、公開されているハーネス間の最高スコアを報告。
  3. SWE-bench Pro:Claude Code ハーネス、temp=1.0、top_p=0.95、256K コンテキストウィンドウで評価。
  4. DeepSWE 1.1:Claude Code および mini-SWE-agent ハーネスで評価。両方のうち最高スコアを報告。Qwen3.8-Max は Claude Code で最も性能が良い。
  5. NL2Repo-Bench:Claude Code ハーネスで評価。報酬ハッキング防止のため、特定のリポジトリにアクセスしようとする Bash コマンドは無効化。
  6. FrontierSWE:Claude Code ハーネスで評価。他の利用可能な MEAN@5 結果は公式 FrontierSWE リーダーボード(2026年8月3日時点)から取得。
  7. MLS-Bench-Lite:Claude Code を使用し、5時間タイムアウト、max_tokens=131,072 で評価。
  8. PaperBench:BasicAgent 設定、Code-Dev モード、Claude Opus 4.6 判定、3 回実行の平均(1回最大12時間)。
  9. AndroidBench:95 タスクの公開サブセットで評価、avg@3 を報告。
  10. --:スコアがまだ利用できない、または該当しないことを示します。

マルチモーダル推論

ベンチマーク Opus4.8 Fable5 Gemini3.1-Pro GPT5.6-Sol Qwen3.7-Plus Qwen3.8-Max
MMMU-Pro 75.6 81.2 80.5 83.0 79.0 82.3
MathVision 87.1 / 97.1 92.7 / 98.6 87.4 / 95.7 90.8 / 97.8 90.3 / -- 95.2 / 97.7
BabyVision 28.4 / 81.2 42.5 / 90.5 55.9 / 68.3 65.5 / 88.9 64.7 / 70.4 82.0 / 91.3
HLE-VL (w/ Tools) -- -- 43.9 51.2 25.6 52.2
ZeroBench (Pass@5) 17.0 / 34.0 20.0 / 46.0 17.0 / 23.0 22.0 / 35.0 19.0 / 19.0 24.0 / 49.0
ZeroBench-Sub 31.1 37.1 36.5 46.7 41.0 48.5
LogicVista 76.7 85.7 82.6 89.7 84.3 91.9
HiPhO 69.3 78.6 85.4 86.8 84.1 90.0
PhyX 54.2 71.7 79.4 79.1 80.0 83.5
SLAKE 75.9 86.6 82.9 85.1 83.2 90.8
MedXpertQA-MM 71.7 80.0 80.7 81.5 71.0 80.4
PMC-VQA 59.2 63.2 62.5 62.3 63.4 66.2

視覚エージェント&コーディング

ベンチマーク Opus4.8 Fable5 Gemini3.1-Pro GPT5.6-Sol Qwen3.7-Plus Qwen3.8-Max
OSWorld-Verified 83.4 85.0 76.2 83.2 73.3 86.1
OSWorld 2.0 20.6 / 54.8 -- / 66.1 7.8 / 30.6 -- / 62.6 2.8 / 21.5 19.4 / 46.7
ScreenSpot Pro 82.3 87.3 68.1 81.3 79.0 84.5
WebArena-Verified 67.9 71.3 64.3 69.7 55.3 66.8
AndroidWorld 75.0 88.8 70.7 77.6 81.0 85.3
MobileWorld 67.5 85.5 58.1 76.9 51.2 77.8
ClawEval-MM 73.3 / 73.8 81.2 / 77.5 50.5 / 55.2 81.2 / 78.9 57.4 / 60.1 77.2 / 74.8
Vision2Web 62.4 70.5 -- 62.1 42.1 69.0
QwenBlenderBench 62.4 69.5 23.0 68.6 41.5 69.9
Parametric CAD Bench 85.1 87.5 73.5 86.2 73.8 91.5
RecreationBench 48.0 56.1 16.2 47.6 30.2 51.7
PresentBench 80.9 79.8 55.4 82.9 65.7 79.6

文書&オフィス知性

ベンチマーク Opus4.8 Fable5 Gemini3.1-Pro GPT5.6-Sol Qwen3.7-Plus Qwen3.8-Max
CharXiv (RQ) 78.5 / 89.9 87.9 / 93.5 84.4 / 89.9 85.1 / 89.1 85.8 / 85.9 88.4 / 93.5
OmniDocBench 1.5 86.5 89.5 90.0 86.7 91.4 92.1
OCR-Bench-V2 (EN/ZH) 53.9 / 55.3 65.3 / 58.1 64.6 / 58.2 69.0 / 57.3 70.7 / 67.1 74.2 / 68.3
CC-OCR-Bench-V2 60.3 72.4 68.9 68.0 72.7 79.6
MTVQA-Test 48.1 41.6 54.3 52.7 51.2 56.6
MADQA 86.8 86.0 81.1 87.8 87.1 91.8
QwenVisualOffice 34.5 32.4 39.6 29.5 32.4 44.6

実世界&空間理解

ベンチマーク Opus4.8 Fable5 Gemini3.1-Pro GPT5.6-Sol Qwen3.7-Plus Qwen3.8-Max
RealWorldQA 76.6 85.9 83.5 83.7 86.9 88.0
ERQA 57.2 70.0 68.0 70.0 69.8 77.8
LingoQA 73.8 77.4 66.8 72.6 83.4 84.8
SURDS 62.2 79.4 64.0 63.0 77.2 77.8

視覚認知&グラウンディング

ベンチマーク Opus4.8 Fable5 Gemini3.1-Pro GPT5.6-Sol Qwen3.7-Plus Qwen3.8-Max
SimpleVQA 67.3 73.4 73.1 66.6 70.3 75.0
WorldVQA 33.9 53.5 54.0 45.1 43.9 53.2
MMStar 76.7 80.5 84.0 82.5 83.2 85.9
PerceptionBench 47.2 57.2 56.2 59.7 51.1 63.5
CountQA 41.3 63.1 72.8 68.6 77.0 82.4
RefAdv-S 61.7 68.6 71.9 69.2 73.0 80.2
Dense200 20.8 31.1 69.7 55.3 60.7 87.0
COCO 50.7 56.4 72.4 61.2 74.2 78.7
VisFactor 30.1 54.5 39.8 62.8 42.8 60.8
VLMsAreBiased 43.8 61.2 74.1 59.8 36.6 88.3

動画知性&エージェント

ベンチマーク Opus4.8 Fable5 Gemini3.1-Pro GPT5.6-Sol Qwen3.7-Plus Qwen3.8-Max
VideoMME (w/ Sub.) 85.4 -- 86.7 89.5 88.0 90.4
VideoMME v2 (w/ Sub.) 49.0 52.2 66.9 71.1 59.7 68.3
VideoMMMU 75.3 81.2 85.3 85.0 85.4 88.7
MMVU 67.4 72.0 77.9 81.2 76.6 82.4
MLVU (M-Avg) 53.4 -- 84.7 87.6 87.4 90.8
TVBench 61.5 -- 73.0 83.2 78.2 81.9
LVBench 67.3 -- 75.1 78.8 76.2 81.8
LVBench (w/ Mem.) 84.3 90.1 -- 84.2 74.5 85.6
EgoLife (w/ Mem.) 78.3 82.3 -- 70.8 68.8 80.3
VideoDR (w/ Search) 65.6 77.1 -- 71.3 41.0 73.2

注記:

  1. MathVision、BabyVision、CharXiv (RQ)、ZeroBench:スコアは「CI なし / CI あり」で報告。
  2. MMMU-Pro:Gemini3.1-Pro と GPT5.6-Sol の結果は公式モデルレポートまたはシステムカードから。他は社内評価。
  3. ClawEval-MM:スコアは「Pass@3 / average score」で報告。
  4. HLE-VL (w/ Tools):ツール使用(CI と Search の両方)で評価。
  5. OSWorld 2.0:スコアは「binary / partial」で報告。
  6. LVBench と EgoLife (w/ Mem.):Qwen-MM-Plugins で構築されたメモリシステムを使用して評価。
  7. --:スコアがまだ利用できない、または該当しないことを示します。

Qwen3.8 で構築する

Qwen3.8-Max は現在 QwenCloud から利用できます。人気のエージェントフレームワークやコーディングアシスタントと統合できます。モデルの重みは来週、Hugging Face と ModelScope でオープンソース化される予定です — お楽しみに。

API の使い方

Qwen3.8-Max は reasoning_effort を公式サポートしており、推論の深さを調整してコストを制御できます:

  • xhigh(デフォルト):徹底的な分析を必要とする複雑なタスク向け
  • medium:精度と速度のバランス
  • low:速度とコストを最適化した効率的な推論

また、preserve_thinking はすべてのワークロードでデフォルトで有効になっており、最高のすぐに使える体験を提供します。

QwenCloud

QwenCloud は業界標準プロトコルをサポートしており、OpenAI 仕様互換の chat completions および responses API、さらに Anthropic 互換の API インターフェースも提供します。

"""
環境変数:
  DASHSCOPE_API_KEY: https://home.qwencloud.com/ から取得した API Key
  DASHSCOPE_BASE_URL: (オプション)互換モード API のベース URL
    - Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1
    - Singapore: https://dashscope-intl.aliyuncs.com/compatible-mode/v1
    - US (Virginia): https://dashscope-us.aliyuncs.com/compatible-mode/v1
"""
from openai import OpenAI
import os

api_key = os.environ.get("DASHSCOPE_API_KEY")
if not api_key:
    raise ValueError(
        "DASHSCOPE_API_KEY が必要です。 "
        "export DASHSCOPE_API_KEY='your-api-key' で設定してください。"
    )

client = OpenAI(
    api_key=api_key,
    base_url=os.environ.get(
        "DASHSCOPE_BASE_URL",
        "https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
    ),
)

messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    extra_body={
        "enable_thinking": True,
        # "preserve_thinking": True,
    },
    reasoning_effort="xhigh",  # xhigh, medium, low がサポートされています
    stream=True,
)

reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

Discussion