スキルクリエイターにeval自動生成が追加 — Agent Skillsのベンチマークとモデル更新対応が変わる

に公開

スキル品質管理の盲点を突いたアップデート

Claude Codeの「スキル」とは、SKILL.mdファイルで定義するカスタムワークフロー指示のこと。よく使う作業手順やツール操作をClaude Codeに覚えさせて、スラッシュコマンドなどで呼び出せる仕組みです。

そのスキルエコシステムが2025年半ばの約50スキルから2026年3月時点で334件超に急成長している。find-skills が452,600インストールを記録し、vercel-react-best-practices が185,000インストールと、実際に使われているスキルの規模感は想像以上です。

ただし、スキルが増えれば増えるほど浮上してくる問題がある。Claude のモデルが更新されたとき、自分が作ったスキルがまだ正しく動くかどうか、誰も確認できていない、という状況です。

これを解決するアップデートが2026年3月3日にAnthropicから発表されました。Skill-creator に eval 生成・ベンチマーク・A/Bテスト機能が追加されています。

エンジニアでないスキル作者を前提にした設計

Anthropicが明確にしているのは、スキルの作者の多くはエンジニアではないという点です。自分の業務フローを熟知した担当者がスキルを書くケースが主流で、ソフトウェアテストの経験はない。そういった人たちに「コードを書かずに品質管理できる仕組み」を提供するのが今回の更新の狙いです。

実際にスキルを書いてみると、この課題はリアルに感じます。SKILL.md に記述した trigger 条件が正しく機能しているかを、実際に何度か試してみないとわからない。ましてやモデルが更新された後に再確認するかどうかは、作者の意識次第でした。

4つの新機能

eval生成とベンチマークモード

スキル作者がテストプロンプトと期待出力を定義すると、Skill-creator がそのスキルをロードした状態でClaude に実行させ、pass rate・elapsed time・token usage を報告します。これをベンチマークモードで定期実行することで、モデル更新後の品質劣化を数値で捉えられます。

evalの定義は evals.json に書く形式で、テストケースごとにプロンプトと期待出力の説明を記述します。

{
  "skill_name": "my-skill",
  "evals": [
    {
      "id": 1,
      "prompt": "ユーザーが送るタスクの指示文",
      "expected_output": "正しい出力がどういう状態かの説明",
      "assertions": []
    }
  ]
}

eval の役割は2つと整理されています。ひとつはモデルやインフラが変わったときの品質劣化検出。もうひとつは、ベースモデルの一般性能が向上してスキル自体が不要になったタイミングの検知です。後者はやや皮肉な話で、スキルが育ちすぎて自分が必要なくなるかどうかをevalで測るという構造になっています。

並列エージェント実行

eval を順番に実行すると遅く、前のテスト実行のコンテキストが次に漏れる問題があります。これを解消するために、各evalを独立したエージェントとして並列実行する仕組みが追加されました。コンテキストの汚染なしに、それぞれ独自のトークン・タイミング計測が取れます。

A/Bコンパレータエージェント

2つのスキルバージョン、またはスキルあり・なしを比較するコンパレータエージェントが追加されています。評価エージェントはどちらのバージョンかを知らない状態で判定するため、バイアスなしに「変更が実際に効いたかどうか」を確認できます。

スキル説明文の最適化支援

スキルのトリガー精度を改善するために、説明文をサンプルプロンプトと照合し、false positive・false negative を減らすための改善案を提案する機能も加わっています。公式ドキュメントにある6つのスキルで検証したところ、5つでトリガー精度が向上したと報告されています。

スキルの種類でevalの意味合いが変わる

Anthropicはスキルを2種類に整理しています。

Capability uplift skills はベースモデルが苦手なタスクを補完するスキルです。ドキュメント生成系が典型例で、モデルの一般性能が向上すれば徐々に不要になる可能性があります。eval が「スキルを卒業するタイミング」を教えてくれる、という使い方が想定されています。

Encoded preference skills は特定のチームワークフローをClaudeに覚えさせるスキルです。NDAのレビュープロセスや週次レポートの生成フローなど。こちらはモデルが進化しても陳腐化しにくいですが、実際の業務フローが変わったときにスキルが古いままになるリスクがあります。継続的な検証が必要で、evalはここで効いてきます。

CI統合まで考えると導入コストは見えにくい

eval の結果はローカルに保存でき、ダッシュボードに連携したり CI パイプラインに組み込んだりできると説明されています。

ただ、CI に組み込むとなるとエンジニアのサポートが必要で、「エンジニアでない作者向け」という設計思想と若干ズレてきます。eval を書いて実行するだけなら敷居は低いですが、本番的な品質管理を継続的に回すには結局それなりのセットアップが必要になりそうです。

LangChain はスキルのテスト環境として Docker を使った軽量スキャフォールドを用意したと公開していますが、これを個人や小チームが整備するのは重めです。

エコシステムが急成長しているのは確かで、スキル品質の管理ニーズは本物だと思います。eval 生成とベンチマークが組み込まれたことで、少なくとも「何も測れない」状態は脱せそうです。


参照元

GitHubで編集を提案

Discussion