見出し画像

Salesforce AgentForce Faithfulness/Context評価

1. Faithfulnessとは?AIが“正しい情報源”から答えているかを測る 🧠

Salesforce AgentForceにおける**Faithfulness(忠実性)**とは、AIが生成した回答が「実際のデータソースにどれだけ忠実であるか」を測る評価指標です。
つまり、AIが“勝手に創作していないか(幻覚)”を検知するための観点です。
たとえば、AgentForceが「この顧客の契約は2026年まで有効です」と答えたとき、Data Cloud上の契約情報にその根拠があるかを検証するのがFaithfulness評価です。
幻覚(hallucination)は、RAG(Retrieval-Augmented Generation)構成における最大の課題。Retrieverが情報を拾えていない、またはPrompt設計が不適切な場合、AIは“それっぽいが誤った”回答を返すことがあります。
Faithfulness評価を行うことで、
・AIの回答がData Cloud内の事実と整合しているか
・Retrieverが正しいデータを取得できているか
を定量的に把握でき、システムの信頼性を高めることができます。
つまり、FaithfulnessはAIの「正確さの品質保証」にあたる指標なのです。


2. Context評価とは?AIが“文脈を維持して回答できているか”を測る 🔄

もう一つの重要な軸がContext(文脈)評価です。
これは、AIがユーザーとの会話や検索結果の背景文脈をどれだけ理解・維持しているかを測定する指標です。
RAGでは、質問ごとにRetrieverが検索を行い、該当情報をPrompt Builderに渡して回答を生成します。
しかし、複数ターンの会話が続くと、前回の質問意図や制約条件を保持できず、回答が“文脈からずれる”ケースが発生します。
たとえば、
ユーザー:「この顧客の契約プランを教えて」
AI:「Goldプランです」
ユーザー:「じゃあ、更新できる?」
→ 文脈を保持できないAIは「何の顧客か」を忘れ、誤回答を返すことがあります。

Context評価では、こうした「過去のやりとり」や「検索コンテキスト」が維持されているかをスコア化します。
Data Cloud+Agentforce Data Library(ADL)を連携することで、AIが顧客IDや検索条件を引き継ぎ、連続的に文脈を理解できるようにするのが理想です。
言い換えれば、Context評価はAIの“会話の一貫性”を確認するテスト。
AIが「覚えて、つなげて、正しく答える」力を評価するフェーズなのです。


3. Faithfulness × Contextで見るAgentForceの品質基準 ✨

FaithfulnessとContextは、どちらか片方だけではAI品質を評価しきれません。
前者は「正しい情報に基づく回答ができているか(事実性)」、後者は「質問の意図を保ったまま回答できているか(文脈性)」を表します。
この2軸を組み合わせることで、AgentForce全体の回答品質を定量的に監視・改善できます。

💡 実践例:AI評価チェックリスト

評価項目観点測定例Faithfulness回答がData Cloudの事実と一致しているか“引用元テーブル名” と “回答内容” の一致率Context会話や検索文脈を維持できているか“過去ターンとの整合率” や “コンテキスト再利用率”

これらをAgentForce開発の検証フェーズに組み込むことで、AIの回答精度を客観的に評価可能になります。

さらに、Einstein Trust Layerを活用すれば、AIの回答プロセスを可視化し、「どのデータを参照して答えたか」をトレーサブルに記録できます。
Faithfulnessスコアが低い場合はRetriever層(検索漏れ)を、Contextスコアが低い場合はPrompt Builder層(文脈設計)を見直すとよいでしょう。

最終的に目指すのは、「正しい情報をもとに、文脈を維持して答えるAI」。
この2軸評価を継続的に実施することが、AgentForceを“業務で信頼されるAIエージェント”へ進化させる鍵となります。


まとめ 💬

Salesforce AgentForceのAI評価では、**Faithfulness(忠実性)Context(文脈維持)**の2軸が欠かせません。
・Faithfulnessは「AIが事実に基づいて答えているか」
・Contextは「AIが文脈を保って対話しているか」
を測る指標です。
まとめると、この2つを定期的に評価することで、AIが「正確で一貫したアシスタント」として信頼性を高めていけます。
AIは“作って終わり”ではなく、“評価と改善のループ”で成熟していく。
AgentForceはその評価設計までを内包する、真に運用可能な生成AI基盤なのです。

いいなと思ったら応援しよう!