VERIFICATION

実績・検証データ

対象システムのURLを指定するだけでデグレード(改修による不具合)を自動検出するAGEST ZERO TESTが、実際の検証で発揮した生産性と品質向上の定量的な実証データを公開しています。

手作業によるテスト設計・実行との所要時間比較、人や一般AIとのバグ検出性能のベンチマーク、大規模LLM(Claude)とのテストケース生成量の対比など、当社が24業種のテスト環境や14の実在サイトを用いて測定した、客観的な検証結果をご紹介します。

※掲載されているデータはすべて社内検証環境または公開されている実在サイトを対象に測定されたものであり、実際の導入効果はお客さまのシステム構成やテスト要件により変動します。

人がやった場合と、どこが違うのか

あらかじめ不具合を仕込んだ販売管理システムで、ツールは45件のテストケースを設計し、改修前と改修後の2つの版で実行しました。
同じ45件を人が作って実行した場合と、並べてみます。

手作業によるテスト設計・実行との所要時間比較

AGEST ZERO TESTによる全自動テストと、同じテストケース(45件)を人が手作業で設計・実行した場合の時間比較です。

本ツールの所要時間

38.9

分

(実測値)

内訳

テストの自動設計 11.5分 + 改修前の画面観測 7.6分 + 改修後の実行と差分比較 19.8分

※作業中はすべて自動で実行されるため、稼働中の人手による立ち会いは不要(無人実行)です。

人手による所要時間

約

15

時間

(推定値)

内訳

テスト設計(45件の書き起こし) 約11時間 + テスト実行(改修前後の2回実行) 約4時間

38.9分の内訳は、テスト設計11.5分、改修前の観測7.6分、改修後の実行と差分比較19.8分。すべて自動で、実行中は無人です。
人の約15時間は、設計が約11時間、実行が約4時間。45件を1件ずつ書き起こし、改修前と改修後で2回実行する前提です。
人が行ったのは、URLとテスト用アカウントを入力して実行+最後に違いを確認することだけです。並行実行も可能で、ある場合は17システム分を1晩で無人実行しました。

※ ツールの38.9分は2026年8月18日・当社の検証用ベンチでの実測です。人の約15時間は、ツールが作った45ケースの内訳(遷移のみ20件・入力あり21件・入力の多い画面4件)に設計と実行の標準工数を当てた推定で、実測ではありません。

※ 本ツールの所要時間(38.9分)は、2026年8月18日に当社検証環境(対象:販売管理システム)において測定した実測値です。
※ 人の所要時間(約15時間)は、本ツールが自動作成した45ケースの内訳(画面遷移20件、フォーム入力21件、入力項目の多い画面4件)をもとに、標準的な設計・実行工数を当てはめて算出した「推定値」であり、実測値ではありません(算出根拠:「テスト設計・実行工数の推定根拠-2026-08-20」)。
※ 推定値を含む比較であるため、単純な倍率(例:「作業時間を◯分の1に削減」「◯倍高速」等)による断言は行わず、各所要時間の実数およびグラフでの視覚的比較にとどめています。

人・AI・ツールで、同じ問題を解いてみました

速いだけではないか、も確かめました

同じ販売管理システムを、ベテラン技術者、生成AI、そしてこのツールが、答えを知らされない状態でそれぞれ独立に検証しました。不具合は8つのクラスに分かれています。

人(エンジニア)

テスト歴25年・45分

4/8

クラスを検出

AI(Claude Opus 4.8)

画面を見せない条件・約30分

5/8

クラスを検出

AGEST ZERO TEST

URLだけを入力・38.9分(無人)

4/8

クラスを検出

見つけた4クラスも、見逃した4クラスも、ベテラン技術者とまったく同じでした。

答えを知らされない状態で、それぞれが独立に検証しています(自社ベンチ・8クラス)。

2026年8月・当社内での測定値です。

見つけた4クラスも、見逃した4クラスも、ベテラン技術者とまったく同じでした。
人とは違う見方をしているのではなく、人と同じ見方を自動化できている、ということだと考えています。

AI が1クラスだけ多く見つけています。日付の書式のずれです。

※ ここでの人の45分は、テストケースを作らずに画面を探索して不具合を探した時間です。
前章の約15時間は、45件のテストケースを作って実行した場合で、別の測り方です。

3者とも見つけられなかった3クラスについて

「削除の整合」と「セッション」は、ツールが既定で実行しない操作です。
本番と同じ環境を壊さないための設計上の選択で、見つける力の限界ではありません。

「入力チェック」は本当の弱点です。ここは改善を続けています。

このときのテストの中身(ツール側・2026年8月18日)

テストケース数

45

件

比較可能率

100

%

45件すべてを改修前後の両方で実行できた

誤った検出

0

件

正常な版どうしを比べたとき

到達度

100

%

画面8種・送信3種・結果確認3種

別の測り方でも、AI と比べています

ここまでは「同じ問題を解かせて、結果を突き合わせる」比べ方でした。
もうひとつ、AI に画面をいっさい見せずにテストを設計させ、こちらが URL だけから自動生成したテストと突き合わせる、という測り方もしています。

5業種・AI 側の107項目を分母として、その 76.6% を同じ操作でカバーしていました。(2026年8月16日・社内測定)

設計の広さで肉薄したうえで、こちらは実行と比較まで自動です。AI が出すのは設計書で、動かすには人が手を動かす必要があります。

実力を3つの数字で

開発検証から得られた実力を示す3つの数値

2つの測り方をしています。
ひとつは、24業種ぶんの業務システムを自分たちで作り、そこにわざと不具合を仕込んで、見つけられるかどうか。
もうひとつは、当社が作っていない外部の実在サイトに、どこまで入り込めるかです。

①24業種の検証環境に仕込んだ不具合の検出率

98

%

(社内測定)

24業種の検証環境(45/46)

4の異なる業種を想定して構築したテスト環境に、あらかじめ仕込んだ計46件の不具合のうち、45件を正確に検出しました。(2026年8月19日測定)

② 正常なシステム間における誤検出

0

件

(社内測定)

同じ条件で同時に測定

不具合のない正常なバージョン同士を比較した際、誤った変更・不具合を報告しない「誤検出0件」の安定性を同時に確認しています。

③ 外部の実在サイトに対する平均画面到達度

84

%

(社内測定)

自社で作っていないサイト14件

当社が開発に関与していない、一般に公開されている14の外部Webアプリケーション(CRM、ERP、学習管理、課題管理、問い合わせ管理、ECなど)を対象に、自動探索で到達・操作できた要素の割合です。
(2026年8月17日〜18日測定の2夜合算値)

①…検出されなかった1件は、画面の操作からは入力できない「負の残業時間」というデータ内部の状態に起因する不具合です。UI操作を起点とする本ツールでは原理的に到達できないため、この領域はシリーズ製品である「AGEST ZERO TEST for Static」や「for Data」がカバーします。

②… 本測定は、静的な検証用サイトにおいて「ビルド番号などの変化するバナー」をあらかじめ比較対象から除外した条件下での実測値です。「あらゆる環境下で誤検出が100%発生しないこと」を保証するものではありません。

③… 14サイト中6サイトでは、検出した全操作対象への到達度100%を記録。他社意匠権および機密保護の観点から、対象サイトは個別の製品名ではなくシステムカテゴリ名で表記しています。

14サイトのうち6サイトでは、見つけた操作対象のすべてに到達できました。CRM・ERP・学習管理・課題管理・問い合わせ管理・EC など、当社が作っていない公開サイトを対象にしています。ログインが必要なサイトは、テスト用アカウントをご用意いただくと到達できる範囲が広がります。

サイトごとの内訳と、測定の方法・条件・限界はテクニカルペーパーに記載しています。

検証の測定条件・サイト別内訳を掲載した
テクニカルペーパーをダウンロード

keyboard_arrow_right

大規模LLMと比べました

大規模LLM(Claude)とのテスト設計ボリューム比較

本ツールが観測した画面データと同一の情報を大規模LLM(Claude Opus 4.8)に与え、それぞれが設計したテスト内容を比較検証しました。

総テストケース数

(重複排除後)

本ツールが 1.26倍
(450件 対 357件)を記録

(2026年8月25日・社内測定)

ツールの強み

(入力の組み合わせ)

「同値分割」「状態遷移」「境界値」など、複雑な入力パターンの機械的な総当たり設計において高い網羅性を発揮します。

LLMの強み

(コンテキストの理解)

「計算式の整合性」「画面の表示形式」「複雑な権限チェック」といった、文脈や言葉の意味の理解が必要な観点においては、大規模LLMの方が優れた設計精度を示しました。

本ツールはLLMと競合するものではなく、
それぞれの得意領域で互いの弱点をカバーし合う(相互補完する)関係として設計されています。

本ツールはLLMと競合するものではなく、それぞれの得意領域で互いの弱点をカバーし合う(相互補完する)関係として設計されています。

3つの指標。比べた相手は、それぞれ違います

テスト設計量は大規模 LLM と、画面への到達は人がブラウザを操作した場合と、検出力はシニアテストエンジニアと比べています。相手も条件も違う、別々の測定です。

画面への到達は、標準的な業務 Web アプリでサイトの全画面のうち 82~100%。人が操作したときと同等でした。差の1画面は、確定操作を安全のため既定で押さない設定によるものです。

検出力は、仕込んだ不具合のクラスを誤検知 0 件で見つけました。到達した画面は毎回すべて比較するため、見落としの偏りが出ません。

※ 本テスト設計量の比較(1.26倍)は、大規模LLMを対象とした測定結果です。画面到達度は「ブラウザを手動操作する人」、不具合検出力は「シニアテストエンジニア」をそれぞれ比較相手としており、すべての指標において同一の相手(Claude)を上回ったという表記ではありません。
※ 計算検証機能においては大規模LLMが優れており、本比較は「すべての観点において本ツールがLLMより優れている」ことを示すものではありません。

定量的な実力を確認し、
実際の効果を自社で試してみたい方へ

keyboard_arrow_down

無料PoC(概念実証)に応募する

応募はこちらから