{{item.title}}
{{item.text}}
{{item.text}}
近年、生成AIは企業活動のさまざまな場面で活用され、導入は一般的なものとなりつつあります。PwC Japanグループが実施した「生成AIに関する実態調査2026 春 6カ国比較 ―AI変革は選択肢から生存条件へ 変わりゆく世界に日本企業は追いつけるのか―」によれば、生成AIを「活用中・推進中」とする企業は87%に達しています。一方で、日本企業では「期待を大きく上回る効果が出ている」と回答した企業は10%にとどまり、さらに「まだ効果を評価できていない層」が他国と比べて高い傾向も見られ、活用の広がりに対し、効果を測定して改善につなげる姿勢に課題があることが分かります。
背景には、「何をもって成功とするのか」が定義されずに活用が進んでいることも一因として考えられ、実際の現場では「動いてはいるが使われていない」「改善の方向性が分からない」といった課題が生じるケースもあります。
本来、生成AI導入の目的は「AIを使うこと」ではなく、「価値を創出すること」にあります。そのためには、「何をもって成功とするのか」を明確にし、「どのような価値を生み、どういったリスクを許容するのか」を定義する必要があります(図表1)。
図表1:AIプロダクトの「価値」と「リスク」の例
価値とは、売上やコスト削減に加え、業務や顧客体験への貢献も含まれます。一方で、リスクとしては、個人情報漏洩や法令違反等の従来システムと共通する課題に加え、誤情報の生成などの生成AI特有の性質も考慮する必要があります。
AIプロダクトは本来、「どのような価値を提供し、どのようなリスクを伴うのか」を組織として判断し、利用者に証明できる状態にあるべきです。しかし現実には、こうした価値とリスクが組織や利用者に対して十分に証明されないまま活用されているケースも見られます。生成AIの活用現場では、「業務に役立ちそう」という期待と「何が危険か分からない」という不安が、感覚的に扱われることも少なくありません。結果として、開発者や一部関係者の納得に依存したまま、組織としての合意形成がされない状態で活用が進んでいきます。この背景には、主に3つの理由があります(図表2)。
図表2:AIプロダクトの評価が難しい3つの理由
第1に構造的な理由です。生成AIは、文脈や意図を踏まえて柔軟に出力を生成できるため、正解が一意に定まらない非構造的なタスクにも活用されています。そのため、従来のシステムのような固定的なテストによる品質保証が難しく、「良いかどうか」の判断が主観に依存しやすくなります。
第2に組織的な理由です。「評価」という概念が十分に浸透しておらず、共通の判断基準が存在しないケースが多くあります。業務部門はROI、開発部門は出力精度、管理部門はリスクと、重視する観点が異なるため、組織横断で評価を語ることが難しくなります。
第3に実務的な理由です。AI導入の目的や業務プロセスが曖昧な場合、評価の前提自体が成立しません。どの業務成果につなげたいのかが定義されていなければ、「何を評価すべきか」も定まらず、「とりあえず動かしてみる」という状態に陥りやすくなります。
これらの結果、組織内で共通の評価基準や評価方法が定まらず、導入されたAIに対する評価結果が人や部門によってばらつきます。そのため、「何をもって成功とするのか」「どこまでリスクを許容できるのか」が曖昧なままPoC(概念実証)や開発が進み、改善や継続投資の判断が難しくなります。したがって重要なのは、「開発者が主観で良いと思うか」ではなく、「組織として価値とリスクを証明できるかどうか」です。
ここまで見てきた課題の根本原因は、「何をもって成功とするのか」が定義されず、価値とリスクを評価できていないことにあります。この課題を解決する鍵となるのが、「評価」を生成AI活用の中心に据えるという考え方です。
AIプロダクトは、利用状況や環境変化に応じて期待される価値や許容できるリスクが変化するため、一度評価して終わりではなく、継続的に評価と改善を繰り返すことが重要になります。
加えて、生成AIは文脈や処理途中の判断によって出力や振る舞いが変化するため、一度のテストだけで品質を保証することは難しいでしょう。さらに、AIプロダクトでは、情報検索やツール実行など複数の処理を組み合わせながら、自ら出力を見直して試行錯誤することで目的を達成するケースが増えています。そのため、最終的な出力だけでなく、一連のプロセス全体を通じて適切に目的を達成できているかを評価する必要があります。
このように、AIプロダクトでは価値やリスクが変化し続け、評価対象も出力単体からプロセス全体へと広がっています。こうした理由から、評価は開発の最後に実施するものではなく、AIプロダクトの開発ライフサイクル全体に組み込む必要があるのです(図表3)。
図表3:生成AIの開発ライフサイクルと「評価」の関係性
評価とは「何をもって成功とするか」を定義し、それを継続的に測る行為です。価値とリスクの基準を定め、改善につなげられる状態が「評価できている状態」といえます。重要なのは、単に出力の良し悪しを判断することではなく、組織として合意できる判断基準を設計することです。
AIプロダクトの評価は、価値創出とリスク管理を両立するために、「攻め」と「守り」の両面から捉えることができます。重要なのは、これらを別々の活動として扱うのではなく、同じ評価の枠組みの中で設計することです(図表4)。
図表4:AIプロダクトに必要な評価の全体像/評価観点の例
「守り」の評価とは、法令違反や不適切な出力など、許容できないリスクを抑制するものであり、AIを安心して利用できる環境を整えるための重要な土台となります。一方、企業がAIプロダクトの導入効果を高めるためには、「守り」だけでは不十分です。AIプロダクトが業務成果や顧客体験の向上につながってビジネス目標を満たしているのかを測る「攻め」の評価も不可欠になります。
攻めの評価とは、「便利そうか」といった感覚的なものではなく、ユーザーの目的に対して実際に価値が生まれているのかを構造的に確認するものです。ここでの「価値」は、企業のビジョンやミッション、経営戦略、業務上の目的から導出される必要があります。例えば問い合わせ対応であれば、回答の正確性そのものではなく、「ユーザーが自己解決できるか」が重要になります。つまり評価観点は、「AIが何を出力したか」だけでなく、「その出力によってユーザーや業務がどう変わったか」から逆算して定義する必要があります。
また、AIプロダクトにおいては「使える」ことと「使い続けたい」ことは同じではありません。出力された文章が正確であっても、冗長で分かりにくければ業務上の利用は定着しないでしょう。生成AIの評価では、正解・不正解が明確なものだけでなく、簡潔さと網羅性のように、利用者や業務文脈によって望ましい出力が変わります。
このような領域では、「業務目的の達成度」「回答の分かりやすさ」「根拠の明確さ」「欲しい情報を網羅できているか」「次の行動につながるか」といった各AIプロダクトの導入目的に沿った評価観点を定義し、組織として何を良い回答とみなすかの合意形成をすることが重要です(図表5)。
図表5:評価観点の設計(攻めの評価観点例)
そのうえで、評価観点を具体的な評価項目へ落とし込み、評価用テストセットやルーブリック(評価基準表)を整備することで、攻めの評価は再現性のある判断プロセスになります。
守りの評価とは、法令違反や不適切な出力など、許容できないリスクを抑制するものである一方、生成AI活用を制限するためのものではありません。むしろ、「どこまでなら安心して活用できるのか」を明確にすることで、活用範囲を広げるための基盤です。法令遵守や倫理、セキュリティといった観点から重要性が広く認識されており、ガイドラインや評価手法も一定程度体系化されています。
PwC Japanグループでは、AIガバナンス支援やAI Red Teaming、ISO42001をはじめとしたAIマネジメントシステム構築支援などを通じて、こうしたリスクの特定・評価・管理を行うサービスを提供しています。
評価を中心にAIプロダクトの活用を進めることで、判断基準が明確になり、品質上の課題や価値が生まれている業務場面を把握できるようになります。その結果をもとにプロンプト・データ・業務プロセスなどを改善して再評価することで、AIプロダクトは継続的に成長していきます。さらに、運用を通じてはじめて見えてくる想定外の成功/失敗パターンを評価観点や評価基準へ反映することで、評価はより実態に即したものへと進化していくでしょう。
その結果、なぜそのプロダクトが良いと判断されたのかを説明できるようになり、組織としての意思決定の質も向上していきます(図表6)。
図表6:評価がもたらす変化の例
観点 |
評価が十分でない場合 |
評価を設計・運用した場合 |
判断基準 |
判断が個人の経験や感覚に依存する |
共通の評価基準に基づいて判断できる |
改善活動 |
課題の所在を特定しにくい |
改善対象を特定しやすい |
品質 |
品質の安定性を確保しにくい |
品質の再現性を高めやすい |
価値検証 |
提供価値の妥当性を確認しにくい |
ユーザー価値の実現状況を検証できる |
リスク管理 |
許容範囲が曖昧になりやすい |
リスクを一定の基準で管理できる |
意思決定 |
投資・継続・中止の判断が難しい |
判断に必要な材料を整理できる |
説明責任 |
対外的・対内的な説明が難しい |
判断結果を根拠とともに説明できる |
評価とは、品質を確認するための作業ではなく、「価値を継続的に創出するための仕組み」そのものです。AIプロダクトの成否はモデルの性能だけでは決まらず、どのように評価を設計し、改善サイクルを運用するかによって、その価値は大きく変わります。
生成AIの価値は、導入しただけでは証明されません。組織にとっての価値とリスクを測り、関係各所に説明し、改善し続ける評価の仕組みを持つことが、AI活用を成果につなげる鍵となります。
{{item.text}}
{{item.text}}
{{item.text}}
{{item.text}}