TestMu AI、AIエージェントのリリース前に検証を行う「Agent Assurance」をリリース

TestMu【画像:https://kyodonewsprwire.jp/img/202608194384-O1-8OsPGo7P

 

この新製品は、顧客と対話するAIエージェントと、システム上で動作するエージェントの両方を検証し、コードから直接テストシナリオを生成し、実際のエビデンスに基づいてすべてのアクションを評価し、検証できなかった項目についてはアシュアランス・ギャップを報告します。

 

サンフランシスコおよびインド・ノイダ、, 2026年8月19日 /PRNewswire/ -- 世界初のエージェント型AIネイティブ品質エンジニアリング・プラットフォームである「TestMu AI」(旧LambdaTest)は、現在AIエージェントをリリースしているすべてのエンジニアリングチームが直面している課題に応えるために開発された製品「Agent Assurance」を発表しました。この薬剤は輸送しても安全ですか?「エージェント・アシュアランス」は、1つの商品で以下の2種類のエージェントをカバーしています。1つは「会話型エージェント」 カテゴリーで、チャット、音声、電話、ビデオ、画像といったユーザーと直接対話するエージェントを評価するものです。もう1つは新たに設けられた「自律型エージェント」 カテゴリーで、システム上で動作するエージェント(ツールの呼び出し、ファイルの作成、APIへのアクセス、プルリクエストの送信など)を検証するものです。

 

現在、ほとんどのチームは、自律型エージェントが自身の行動について記述した記録や、最終メッセージに対する審査員の採点などを参照して、そのエージェントを評価しています。これに代わり、Agent Assuranceがその効果を評価します。コードベースを指定すると、エージェントの動作を解析し、エージェントの機能テスト、非機能チェック、および敵対的シナリオを網羅するエンドツーエンドのエージェントテストスイートを生成します。その後、実際にエージェントを実行し、観測された証拠に基づいて各基準を評価します。 評価対象となるのは、ディスク上で変更されたファイル、生成された成果物、およびエージェント自身が宣言したツールインターフェースに基づいて検証されたツール呼び出しです。

 

「合格」と「不合格」に加え、Agent Assuranceは3つ目の判定結果として「検証不能」を報告します。これは合格率の算出対象から除外され、数値として公表されるアシュアランス・ギャップです。レポートに記載されている結果はすべて実際に観測されたものであり、このギャップはエージェントが自身の行動についてどれだけ記録しているかを反映しているため、チームはエージェントの観測可能性を高めることで、このギャップを縮小することができます。

 

「エンジニアリングチームは、まさにリスクが最も高いレイヤーにおいて、検証負債を蓄積しつつあります。「エージェント自身の行動に関する説明は、その行動について得られるエビデンスの中で最も信頼性の低いものです。なぜなら、その当事者には誤った説明をする動機があるからです」と、TestMu AIのエンジニアリング担当グループシニアバイスプレジデントであるVipul Vermaは述べています。「この分野のツールはすべて、合格率を報告しています。Agent Assuranceは、合格率と自社の盲点の規模を報告しています。なぜなら、そうすることで初めて、行動を起こすうえで信頼できる数値が得られるからです。」

 

「Agent Assurance」を利用することで、チームは以下のことが可能になります。

 

・テストコードを書かずにテストを行う — テストスイートがコードベースから導出されるエージェントによる自動テストです。必要な入力は、エージェントの呼び出し方法(コマンド、HTTPエンドポイント、MCPサーバー、あるいはn8nなどのプラットフォーム上で構築されたワークフローなど)のみです。
・デフォルトで敵対的領域を網羅 — プロンプト注入、ツールの誤用、および指示の書き換えといったシナリオは、単なる追加機能ではなく、第一級のファミリーとして生成されます。
・CIにおけるリリースゲート — すべてのパイプラインにおいてエージェントの継続的テストが実施されます。各コミット時のエージェントのスモークテストから、リリース前のフル実行までをカバーし、ヘッドレスコマンドと終了コードを用いて、「エージェントに不具合があった」場合と「テストフレームワークがテストできなかった」場合を区別します。
・変更を確実に追跡 — エージェントの回帰テストにおいて、実行ごとの差分比較を行い、新たに失敗した結果、新たに修正された結果、および不安定な結果を区別します。不安定な結果と回帰には、それぞれ異なる対応が必要だからです。

 

また、「会話型エージェント」カテゴリーも、ソフトウェアと人が接する最新の場、すなわちカメラに映し出されるエージェントへとその領域を広げつつあります。このプラットフォームの新しい「ビデオエージェントテスト(リンク) 機能により、リアルな顔と声を持つシミュレートされた人物が、ライブビデオエージェントのセッションに参加し、本物の会話を交わしたうえで、チームが定義した成功基準に基づいてエージェントを評価します。また、評価結果はすべて、その評価が下された録画の正確な時点に紐付けられます。記録から確認できない事項は、すべて意図的に「未達成」とみなされます。これは、記録そのものがエビデンスとなるカテゴリーにおいては厳格な基準であり、評価者が確認できなかった瞬間については、ビデオエージェントは決して評価対象とはなりません。

 

本日より、TestMu AIプラットフォームにおいて「会話型エージェント」カテゴリが一般提供開始となりました。「自律型エージェント」カテゴリは早期アクセス版として利用可能で、ターミナルから「rook」として実行されます。モデルはTestMu AIコントローラー上で実行されるため、ローカルでプロバイダーのAPIキーは必要ありません。まずは、 リンクにアクセスしてください。

 

TestMu AIについて

 

TestMu AI は、世界初のエージェント型Aネイティブ品質エンジニアリング・プラットフォームであり、インテリジェンスを中核に据えて、組織がテストの自動化とスケール化を実現できるよう設計されています。TestMu AIは、自律的な機能と、最新の開発ワークフロー全体にわたるシームレスな統合を組み合わせることで、AIファーストの世界において、チームがより迅速に、信頼性と安全性の高いソフトウエアを提供できるよう支援します。

 

詳細については、 TestMu AIをご覧ください。

 

お問い合わせ先: 

 

Nikhil Saxena、
TestMu AIのコーポレート・コミュニケーション・マネージャー、
nikhils@testmuai.com
+919870981968

 

 

 

(日本語リリース:クライアント提供)

PR Newswire Asia Ltd.

 

【画像:https://kyodonewsprwire.jp/img/202608194384-O2-B74QVw99

 

PR Newswire
1954年に設立された世界初の米国広報通信社です。配信ネットワークで全世界をカバーしています。Cision Ltd.の子会社として、Cisionクラウドベースコミュニケーション製品、世界最大のマルチチャネル、多文化コンテンツ普及ネットワークと包括的なワークフローツールおよびプラットフォームを組み合わせることで、様々な組織のストーリーを支えています。www.prnasia.com

配信会社から提供を受けたコンテンツやプレスリリースを原文のまま掲載しており、J-CASTトレンドが制作した記事ではありません。お問い合わせは配信会社・プレスリリースの配信元にお願いいたします。
共同通信PRワイヤー