週刊AI駆動開発 - 2026年03月15日
今週の週刊AI駆動開発では、主要AIコーディングツールのリリース情報、注目のトレンドリポジトリ、AI関連ニュース、論文トレンド、テックブログ記事、海外コミュニティの動向、開発者向けイベント情報をお届けします。Claude Code v2.1.76のMCP Elicitationサポートと1Mコンテキストウィンドウの一般提供、Gemini CLI v0.33のA2Aリモートエージェント認証、VS Code 1.111のAutopilotプレビュー、OpenAIのResponses APIへのコンピュータ環境追加、そしてMCP vs CLI論争の深化など、AIエージェントの自律性とセキュリティが同時に問われた一週間です。
🚀 リリース情報
Gemini CLI v0.33.0 / v0.33.1
Gemini CLIがA2Aリモートエージェント認証やプランモードの研究サブエージェントなど、エージェント連携の強化を含むアップデートをリリースしました。
- A2A(Agent-to-Agent)リモートエージェントのHTTP認証サポート: リモートエージェントへのHTTP認証接続が可能に。認証済みA2Aエージェントカードの発見にも対応
-
GitHub Issue Creator スキル追加:
github-issue-creatorスキルが組み込みで利用可能に - プランモードに研究サブエージェント: プランモードで組み込みの研究サブエージェントが利用可能に
- プランのフィードバック注釈: プランにフィードバックを付けてイテレーションできる機能を追加
-
ACP向けスラッシュコマンド実装:
/memory,/init,/extensions,/restoreがACP(Agent Communication Protocol)で利用可能に - コンテキストウィンドウ表示の改善: 使用量ベースの表示に変更
Claude Code v2.1.75 / v2.1.76
Claude Codeは MCP Elicitationサポート、1Mコンテキストウィンドウの一般提供、/effortコマンドなど多数の新機能が追加されました。
- Opus 4.6 の1Mコンテキストウィンドウ: Max、Team、Enterpriseプランでデフォルト利用可能に。大規模コードベースの一括解析が実用レベルに
-
MCP Elicitation サポート: MCPサーバーがタスク実行中に構造化入力をインタラクティブダイアログで要求可能に。
ElicitationおよびElicitationResultフックで応答のインターセプトとオーバーライドが可能 -
セッション名のCLIフラグ:
-n/--name <name>フラグでセッション起動時に表示名を設定可能 -
ワークツリーのスパースチェックアウト:
worktree.sparsePaths設定で大規模monorepo内の必要なディレクトリのみをチェックアウト可能 -
/effortスラッシュコマンド: モデルのエフォートレベルをセッション内で設定可能 -
PostCompactフック: コンパクション完了後に発火する新フック - 自動コンパクションのサーキットブレーカー: 連続失敗時の無限リトライを3回で停止
-
--worktreeの起動パフォーマンス向上: git refs直接読み取りで高速化
Cursor - Marketplace に30以上の新プラグイン追加
Cursorが Atlassian、Datadog、GitLabなどのパートナーから30以上のプラグインをMarketplaceに追加しました。クラウドエージェント向けのMCPサーバー統合がさらに拡充されています。
VS Code 1.111.0(March 2026)
VS Code 1.111は初の週次安定版リリースであり、エージェント体験の強化に焦点を当てています。
- Agent Permissions(エージェント権限制御): Chatビューにパーミッションピッカーが追加。Default Approvals、Bypass Approvals、Autopilot(Preview)の3段階で自律性レベルを調整可能
-
Autopilot(Preview): エージェントが
task_completeツールを呼び出すまで自律的に作業を継続するモード - Agent-Scoped Hooks(Preview): カスタムフロントマターでエージェント固有のフックを定義可能
-
Debug Events Snapshot:
#debugEventsSnapshotでエージェントのデバッグイベントスナップショットをチャットに添付可能
Cline v3.72.0
- Anthropic Opus 4.6 ファストモード対応: Opus 4.6のファストモードバリアントが追加
- Markdown画像の読み込みにユーザー同意が必要に: セキュリティ強化
- Hooks機能トグルの再導入: フック機能のオン/オフを切り替え可能に
Kiro IDE v0.11
- MCP Registry Governance: エンタープライズ管理者がJSONレジストリファイルで組織が使用するMCPサーバーを制御可能に
- Model Governance: 組織がモデルアクセス管理のトグルと承認済みモデルリストをKiroコンソールから管理可能に
- ドキュメント添付機能: チャットメッセージに最大5つのドキュメントをネイティブドキュメントブロックとして直接添付可能
- チャットパフォーマンスの向上: 再レンダリング削減による高速化
OpenAI Codex v0.112.0 / v0.113.0 / v0.114.0
OpenAI Codexが3バージョンを矢継ぎ早にリリースし、プラグインエコシステムとパーミッション制御を強化しました。
- 実験的コードモード: より隔離されたコーディングワークフロー向けの新モード
-
request_permissionsツール: 実行中のターンがランタイムで追加権限を要求可能に - プラグインマーケットプレイス拡充: キュレーション済みマーケットプレイスの発見、リッチメタデータ、認証チェック付きインストール
-
@pluginメンション: チャットでプラグインを直接参照し、MCP/app/skillコンテキストを自動インクルード - 新パーミッションプロファイル設定言語: ファイルシステム/ネットワークのサンドボックスポリシーをより精密に制御
GitHub Copilot CLI v1.0.4 / v1.0.5
-
/prコマンド: PR の作成・閲覧、CI失敗の自動修正、レビューフィードバック対応、マージコンフリクト解決を支援 -
/extensionsコマンド: CLI拡張機能の表示、有効化、無効化が可能に -
write_agentツール: バックグラウンドエージェントにフォローアップメッセージを送信し、マルチターン対話が可能に -
@ファイルメンションの拡張: プロジェクト外のパスをサポート(絶対パス、ホームディレクトリ、相対親パス) - OpenTelemetry インストルメンテーション: エージェントセッション、LLM呼び出し、ツール実行のオブザーバビリティ
-
/diffのシンタックスハイライト: 17言語対応
📈 注目のAI開発リポジトリ
volcengine/OpenViking
AIエージェント専用のコンテキストデータベースです。ByteDance傘下のVolcEngineがApache 2.0で公開しており、メモリ(会話履歴や学習した知識)、リソース(ドキュメントやデータ)、スキル(エージェントの能力定義)という3種類のコンテキストを、ファイルシステムのメタファーで統一的に管理します。
L0(約100トークンの要約)、L1(約2,000トークンの概要)、L2(元のコンテンツ)の三層ローディングにより、エージェントは最初から全文をコンテキストに詰め込む必要がなくなり、トークン消費の削減がAPIコストの削減に直結します。ディレクトリの検索も階層構造を活かしたセマンティック検索を組み合わせた再帰的な検索が行われ、検索の軌跡は可視化可能です。セッション管理の自動化により、長い会話から6カテゴリのメモリを自動抽出してコンテキストデータベースに保存します。
lightpanda-io/browser
AIエージェントのためにゼロから設計されたヘッドレスブラウザです。Chromiumをフォークしたのではなく、Zig言語で一から書かれています。JavaScriptエンジンにはV8、HTMLパーサーにはhtml5ever、HTTPにはlibcurlを使い、画面描画に関する機能を省いています。
公開されているベンチマークでは、Puppeteerから100ページを処理するシナリオにおいて、Chromeの9分の1のメモリ使用量と11倍の実行速度を達成しています。CDPプロトコルに対応しているため、既存のPlaywright、Puppeteer、chromedpのスクリプトがそのまま動作し、Chromiumを差し替えるだけで既存のスクレイピングパイプラインを高速化できます。robots.txtの尊重をビルトインでサポートしている点も、スクレイピング用途では実用的です。
📰 AI関連ニュース
OpenAI - Responses APIにコンピュータ環境を追加
OpenAIがResponses APIに本格的なコンピュータ環境を追加し、Unixシェルツール、ホストコンテナ、コンテキスト圧縮、再利用可能なエージェントスキルといった新しいプリミティブを提供開始しました。モデルがサービスの起動、API呼び出し、スプレッドシートやレポートなどの成果物生成を含む幅広いユースケースに対応可能になり、自律型エージェントの構築がより堅牢かつスケーラブルになります。
OpenAI - Promptfooを買収
OpenAIがAIセキュリティプラットフォームのPromptfooを買収すると発表しました。Promptfooは35万人以上の開発者に利用され、Fortune 500企業の25%以上で採用されているオープンソースのAIテストツールです。買収後もオープンソースとして維持され、OpenAI Frontierプラットフォームに統合されます。プロンプトインジェクション、データリーク、ツール悪用などの脆弱性検出が開発フローに組み込まれる見込みです。
OpenAI - Codex Security リサーチプレビュー
OpenAIがCodex Securityをリサーチプレビューとして公開しました。リポジトリの脅威モデルを自動生成し、コンテキストを理解した上で脆弱性を特定・検証・修正提案を行うAIセキュリティエージェントです。ベータ期間中に120万コミットをスキャンし、792件の重大な問題と10,500件以上の高深刻度の問題を発見。OpenSSH、GnuTLS、Chromiumなどで実際のCVEを14件報告済みです。
OpenAI - AIエージェントのプロンプトインジェクション耐性設計
OpenAIがAIエージェントのプロンプトインジェクション攻撃への耐性設計に関するエンジニアリングフレームワークを公開しました。入力フィルタリングだけでなく、攻撃が成功した場合でも影響を限定的に抑えるシステム設計アプローチを提唱しています。エージェントは限定的・可逆的なアクションのみ実行し、重要な操作前にはユーザー確認を必須とする多層防御の設計を推奨しています。
Google DeepMind - Gemini 3.1 Flash-Lite
Google DeepMindがGemini 3.1 Flash-Liteを発表しました。Gemini 3シリーズで最も高速かつコスト効率の高いモデルで、2.5 Flashと比較して初回トークン応答が2.5倍速く、出力速度が45%向上しています。入力$0.25/1Mトークン、出力$1.50/1Mトークンの価格設定で、翻訳・分類など高ボリューム・低レイテンシタスクに最適化されています。
Anthropic - Claude Partner Networkに1億ドル投資
AnthropicがClaude Partner Networkを立ち上げ、2026年に1億ドルの初期投資を実施しました。パートナー企業向けにトレーニング、技術サポート、共同マーケティングリソースを提供し、エンタープライズでのClaude導入を支援します。Claude Certified Architect, Foundationsという初の技術認定資格も導入されました。
Anthropic - The Anthropic Institute設立
Anthropicが「The Anthropic Institute」を設立しました。共同創業者のJack Clarkがリーダーを務め、Frontier Red Team、Societal Impacts、Economic Researchの3チームを統合し、AIの雇用・経済活動への影響、AIシステムのガバナンス、再帰的自己改善に関する研究を推進します。
Microsoft Research - AgentRxフレームワーク
Microsoft ResearchがAIエージェントのデバッグフレームワーク「AgentRx」を発表しました。エージェント実行のトラジェクトリを正規化し、制約を自動生成してステップごとに検証することで、重大な失敗ステップを自動特定します。失敗の局所化で+23.6%、根本原因の帰属で+22.9%の精度向上を達成しています。
Hugging Face - Storage Buckets
Hugging Face HubにS3ライクなオブジェクトストレージ「Storage Buckets」が追加されました。チェックポイント、オプティマイザステート、処理済みデータシャードなど、頻繁に変更されるMLアーティファクトの管理に最適化されています。
NVIDIA - NeMo Retrieverにエージェンティック検索パイプライン追加
NVIDIAがNeMo Retrieverにエージェンティックな検索パイプラインを追加しました。ReACTアーキテクチャを活用してLLMとリトリーバーが反復的に検索・評価・クエリ改善を行う仕組みで、ViDoRe v3リーダーボードで1位を獲得しています。
📄 今週のAI論文トレンド
1. Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning
著者: Lei Huang, Xiang Cheng, Chenxiao Zhao, Guobin Shen, Junjie Yang, Xiaocheng Feng, Yuxuan Gu, Xing Yu, Bing Qin
大規模言語モデル(LLM)の強化学習において、スカラー報酬のみに依存する従来のアルゴリズムでは自然言語フィードバックに含まれる情報が活用されていなかった問題に対し、グループレベルの言語フィードバックを活用するRLフレームワーク「GOLF」を提案した研究です。外部批評とグループ内試行という2つの相補的なフィードバック源を統合し、スパース報酬領域での的を絞ったガイダンスとしてオフポリシーの足場として適応的に注入します。検証可能・検証不可能な両ベンチマークでサンプル効率が2.2倍向上することが示されました。
2. Geometry-Guided Reinforcement Learning for Multi-view Consistent 3D Scene Editing
著者: Jiyuan Wang, Chunyu Lin, Lei Sun, Zhi Cao, Yuyang Yin, Lang Nie, Zhenlong Yuan, Xiangxiang Chu, Yunchao Wei, Kang Liao, Guosheng Lin
2D拡散モデルの事前知識を3D編集に活用する際の多視点整合性の課題に対し、強化学習を用いたシングルパスフレームワーク「RL3DEdit」を提案した研究です。3D基盤モデルVGGTから導出された報酬を用いたRL最適化により、2D編集の事前知識を3D整合性のある多様体に定着させます。安定した多視点整合性を達成し、最先端手法を編集品質と効率の両面で上回ることが実証されました。
3. Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
著者: Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang
コンパクトな(2Bおよび8B)Vision Language Modelの性能限界を探索した研究です。対照学習が識別に最適化されることで細粒度の視覚的手がかりを抑制する目的関数のミスマッチを特定し、テキストのみのLLMから初期化されたビジョンエンコーダを持つ「Penguin-VL」を提案しています。Qwen3-VLなどの主要VLMと数学推論で同等の性能を達成し、文書理解・視覚知識・多視点動画理解では上回る結果を示しました。モデルスケーリングではなく視覚表現の改善が性能向上の主要因であることを実証しています。
💻 テックブログ
MCPはなぜCLIに負けたのか -- 経緯と構造を整理する
Model Context Protocol(MCP)が約18か月で従来のCLIアプローチに対して劣勢となった理由を構造的に分析した記事です。高度な推論モデルがドキュメントを自律的に読み解きCLI操作を実行できるようになったこと、トークン効率の大幅な差(CLIツールのREADME: 約225トークン vs MCP実装: 13,000~55,000トークン)を解説しています。Anthropic自身が98.7%のトークン削減をMCP廃止で達成したという事実は、ツール選択時の判断材料として参考になります。
Claude Agent SDKで本番AIエージェントを作る方法
Claude Agent SDK(旧Claude Code SDK)を使って本番環境で動作するAIエージェントを構築する完全ガイドです。query()によるワンショットタスクとClaudeSDKClientによるマルチターン対話の2つのAPIを紹介し、バグ修正、コードレビュー、テスト生成、セキュリティ監査など7つの実践ユースケースをコード付きで解説しています。@toolデコレータによるカスタムツール作成、Hooksによるエージェント監視・制御など、本番運用に必要な機能を網羅した実践的な記事です。
Cursor / Claude Code / Devin / Antigravity の違いを整理してみた
2026年春時点で注目される4つのAI開発ツールの役割と思想の違いを整理した記事です。Cursor(人間が主導でAIが補助)、Claude Code(AIがCLIタスクを自動化)、Devin(要件から実装・テスト・デバッグまで自律遂行)、Antigravity(複数AIエージェントを管理し人間はPMとレビューに集中)という進化スペクトラムを提示しています。ツール選択は「どれが最強か」ではなく「どのフェーズの作業か」で決めるべきという実践的な指針を提供しています。
AIコーディングツール最新比較 2026春
Cursor、Claude Code、Windsurf、Copilot CLIの4種を実際に使い比べた比較レビューです。Claude CodeはOpus 4.6の推論能力とAgent Teamsによる並列開発で新規プロジェクトに最適、CursorのComposerはマルチファイル編集とビジュアルdiffでリファクタリングに強み、Copilot CLIはGitHub Actions連携でCI/CDに優れるとまとめています。複雑なリファクタリングでのClaude Code(18分)vs Cursor(35分)のパフォーマンス比較も掲載されています。
Antigravityが静かに別物になっていた
2026年3月12日にGoogleが発表したAntigravityの大幅アップデートについてまとめた記事です。Google AI Proサブスクリプションとの統合により、ビルトインAIクレジットがAntigravityで利用可能になりました。単なるIDE機能を超えてGoogleのAIプラットフォーム全体の一部として位置づけられるようになった変化を分析しています。
Claude Codeはなぜそう動くのか -- 設計思想と挙動の完全ガイド
Claude Codeの内部アーキテクチャと設計思想を分析した技術記事です。「コンテキストウィンドウはすぐ埋まり、埋まるほど性能が劣化する」という根本制約からすべてのアーキテクチャ判断が導かれていることを解説しています。CLAUDE.md指示は「アドバイザリ(助言的)」でLLMが無視する可能性があるのに対し、Hooksは「決定論的」で必ず実行されるという違いの理解が、Claude Code運用の鍵になると述べています。
🌐 海外コミュニティ動向
Claude Opus 4.6 / Sonnet 4.6で100万トークンコンテキストが一般提供開始
Anthropicが1Mコンテキストウィンドウの一般提供(GA)を発表しました。大規模コードベースの一括解析やドキュメント全体の処理が実用レベルに到達し、RAGに頼らないアプローチが現実的になりつつあります。大規模プロジェクトのコードレビューやリファクタリングなど、チャンク分割が必要だったワークフローを根本的に見直す好機です。
Amazon、AI生成コード変更にシニアエンジニアの承認を義務化
AmazonがAIアシスタントによるコード変更が原因で複数の障害を経験し、シニアエンジニアによるレビュー・承認プロセスを必須化しました。481件のコメントでは、AI生成コードのレビュー体制やテスト自動化の必要性が議論されています。AIコーディングツールの導入に際して、コードレビュープロセスの見直しが不可欠であることを示す重要な事例です。
Manus元バックエンドリード: function callingを止めた理由
AIエージェント開発プラットフォームManusの元バックエンドリードが、2年間のエージェント開発経験を経てfunction callingを放棄した実践的知見を共有しました。レイテンシの増加、エラーハンドリングの複雑さ、モデル間の非互換性などが問題として指摘され、構造化プロンプトとテキストベースのコマンドパターンを組み合わせた代替アプローチが提案されています。
「Shall I implement it? No」 -- AI時代のエンジニアの判断力
AI時代のソフトウェア開発における「実装すべきでないもの」についてのエッセイが1500以上のポイントを獲得しました。AIが容易にコードを生成できるようになったことで、「実装できるか」ではなく「実装すべきか」という判断がエンジニアの核心的価値になるという議論です。AIツールの生産性向上に目を奪われず、アーキテクチャ設計やプロダクト判断というメタレベルのスキルを磨くことが差別化要因になります。
Axe: AIフレームワークを置き換える12MBのバイナリ
LangChainなどの重厚なAIフレームワークに対するアンチテーゼとして、12MBのシングルバイナリでAIエージェント機能を提供するツールが登場しました。Go言語で実装され、LLM呼び出し、ツール実行、エージェントループなどの基本機能を単一バイナリで提供し、依存関係ゼロでインストール可能です。
geohot: 69個のエージェントを同時実行する開発スタイル
tinygrad開発者のgeohot氏が「69個のAIエージェントを同時実行する」開発ワークフローを公開し、712ポイント・455コメントの議論になりました。複数のAIコーディングエージェントを並列で走らせ、成功した変更のみをマージし失敗したものは破棄するという「進化的プログラミング」のアプローチです。
McKinseyのAIプラットフォームをハッキングした方法
McKinseyのAIプラットフォームの脆弱性が公開され、LLMを組み込んだシステムにおけるセキュリティ設計の課題が浮き彫りになりました。プロンプトインジェクション、アクセス制御の不備、データ漏洩のリスクが具体的に示されています。LLMを組み込んだアプリケーション開発において、プロンプトインジェクション対策やLLM出力のサニタイゼーションなどAI固有のセキュリティ対策が求められることを改めて示す事例です。
Mcp2cli: MCPのトークン消費を96-99%削減
MCPサーバーのスキーマをCLIコマンドに変換することで、トークン消費を96-99%削減するツールが登場しました。MCPプロトコルでは各ツール呼び出しにJSONスキーマ全体を送信する必要がありトークンを大量に消費していましたが、mcp2cliはMCPサーバーの機能をCLIコマンドとして公開し、シェルコマンド経由でアクセスすることでコスト効率を改善します。
Qwen 3.5ファミリーのベンチマーク比較
Alibaba CloudのQwen 3.5モデルファミリーが公開され、各サイズのベンチマーク比較が注目を集めました。MoE(Mixture of Experts)アーキテクチャの35B-A3Bモデルは推論時3Bパラメータのみアクティブで35Bモデル相当の性能を実現しています。0.8Bモデルはスマートウォッチ上での動作も実証されました。
NVIDIAがオープンウェイトAIモデルに260億ドル投資
NvidiaがオープンウェイトAIモデルの構築に260億ドルを投資する計画が明らかになりました。Meta、Alibaba(Qwen)に加え、NVIDIAの本格参入により、オープンウェイトモデルの選択肢と品質が急速に向上しています。
📅 今週のAI開発イベント
Vibe Codingハッカソン - 1時間で未来を前倒そう
- 日時: 2026-03-17 19:00~21:30
- 形式: オフライン(東京都渋谷区道玄坂 GUILD VALLEY)
- 参加費: 無料(飲み物・軽食あり)
- 概要: AI駆動開発(Vibe Coding)を活用し、Cursor、Claude、ChatGPT、GitHub Copilotなど好きなAIツールを使って1時間でプロダクトを開発するハッカソン
AI開発を語るスシ会 PLUG SUSHI NIGHT vol.11
- 日時: 2026-03-18 19:00~21:00
- 形式: オフライン(東京都千代田区四番町 STRACTオフィス)
- 参加費: 無料(寿司付き)
- 概要: Node.js/webpackコントリビュータのhiroppy氏ほかが登壇。LLM・AIエージェント・RAGなど実践的なAI開発テーマのLTが充実
VIBE CODING LT vol.03
- 日時: 2026-03-20 19:00~22:00
- 形式: オンライン(YouTubeライブ配信)
- 参加費: 無料
- 概要: AIを使って2時間でお題に基づくプロダクトを制作し、そのままLT発表まで行うライブイベント。毎週開催の定期イベント
📝 まとめ
今週はClaude Codeの1Mコンテキスト一般提供とOpenAIのResponses APIコンピュータ環境追加により、AIエージェントの実行能力が大きく拡張される一方、AmazonのAI生成コード障害やMcKinseyプラットフォームの脆弱性公開など、品質・セキュリティ管理の重要性が改めて浮き彫りになりました。
週刊AI駆動開発について
この記事は以下リポジトリの内容で生成されています。
追加したい情報、修正、改善案などあればIssueを立てるか変更のPRをお願いします!
Discussion