本文へスキップ

The Merge:テストは通る。エージェントは仕事をやり遂げられるか?

by
Hendrik Krack

Hendrik Krack

September 25, 2026

4 min read

The Mergeのロゴの横に、円形の迷路を通るオレンジ色の経路が描かれています。

CodeRabbitの最新のThe Mergeで、Cua AIのCEO兼共同創業者であるFrancesco Bonacciと対談しました。Cua AIは、AIエージェントがコンピューターを操作するためのツールや環境を開発しています。今回は、チームがそうしたツールをどうテストし、エージェントがそれらを使って課題を完了できるかをどう確認しているのかについて話しました。

テストによって、エージェントのクリックが狙ったボタンに届くことは確認できます。しかし、それだけでは、エージェントが正しいボタンを選んだか、仕事をやり遂げたかまでは確認できません。Cuaのエンジニアリングチームは、コンピューターの操作が機能するか、エージェントが課題を完了するか、そして課題を採点するソフトウェアが正しく採点するかをテストしています。

Bonacciは、異なる動作環境でコンピューター操作のリグレッションを検出する難しさについて語りました。リリースの速さも、その負担を大きくしています。「1か月半で21回のマイナーリリースを行いました」と彼は言います。Cuaの技術解説によると、テスト用アプリケーションが、操作によって期待した変化が起きたかを独立して観測します。ツールが成功を報告していても、テストではアプリケーション内で実際に何が起きたかを確認しなければなりません。

エージェントが残した成果物を確認する

エージェントが課題を完了したかを確認するために、チームはCua-Benchを使っています。Cuaによる別のAI Engineer World’s Fairの発表では、CTOのDillon DuPontが、各タスクには既知の開始状態、参照となる解答、評価器があると説明しています。評価器とは、ファイルやアプリケーションの状態を調べて、エージェントが成功したかを判定するソフトウェアです。

Bonacciは、CuaとSnorkelの共同プロジェクトから一例を紹介しました。両社は、電気回路を設計するアプリケーションKiCadを使ったベンチマークを作りました。エージェントに与えられる課題は、回路図に部品を配置し、配線し、部品のプロパティを編集することです。

基本的な操作でさえ、依然として難しいままです。ドラッグやスクロールについて、Bonacciは「そうした操作は、今でもエージェントにとって実際に難しいのです」と語りました。KiCadを使うエージェントは、回路の課題そのものも理解しなければなりません。部品をうまく移動できれば前進ではありますが、回路はまだ未完成かもしれません。Cuaの評価器は、保存された回路の部品と接続を調べ、参照となる解答と比較して成果物を採点します。

6月の評価で、Cuaは7つのモデルを25のKiCadタスクでテストしました。各モデルには、1つのタスクを完了するために最大200ステップの操作が認められていました。最も多くの課題を完了したモデルでも、完了できたのは25件中6件でした。Cuaによると、ある程度順調に進みながらも、完了する前にステップ数の上限に達した試行もありました。

採点するソフトウェアをテストする

こうしたスコアは、採点用ソフトウェアが成功と失敗を正しく認識できることを前提としています。判定ルールに欠陥があれば、課題を達成していない成果物に満点を与えてしまう可能性があります。

Cuaは、評価環境を公開する前に、評価器のレビュープロセスを通じてその可能性を調べています。選ばれたタスクでは、一方のエージェントが課題の指示に従おうとし、もう一方は意図的に指示に違反しながら得点を得ようとします。評価器は、正しい試行を加点し、もう一方を減点する必要があります。レビュアーは記録された両方の試行を調べ、根拠と修正案を添えた指摘をまとめます。

開発者にとって、これは何を完了の根拠とするかを決め、その結果を生み出し、検証するコードをレビューすることを意味します。コーディングエージェントがソフトウェアを書く場合、CodeRabbitのCLIスキルを使えば、そのエージェントがコードレビューを依頼し、修正を適用し、再度レビューを依頼できます。そのうえでタスク評価を行い、そのソフトウェアによってエージェントがユーザーの課題を完了できるかをテストします。

レビューでは、エージェントが何にアクセスできるかも確認する必要があります。Bonacciは、エージェントがユーザーのコンピューターを乗っ取ることを防ぎ、機密データを保護するために、隔離された環境を使っていると説明しました。エージェントのツールを変更すると、そうした保護にも影響する可能性があります。

CodeRabbitのSecurity Architecture Reviewは、提案された変更が権限、機密性の高い操作、データフローにどう影響するかを調べます。この評価は、セキュリティ機能の対象で、十分な関連情報があるプルリクエストで利用でき、セキュリティテストや人によるレビューを補完します。

Bonacciは自身の仕事について、日中に計画を立て、夜の間はエージェントを動かしておくと語っています。あとで「自分が修正しなければならない問題」が残らないという安心感を持って、もっと多くのタスクを任せたいと考えています。

共有

Share on XShare on LinkedinShare on Reddit