03-accuracy.mdupdated 2026-08-01962 chars

AI検索評価 ③ — ​正確性スコア(Accuracy Score)

正確性スコアとは、​事実を​問う​クエリに​対して​AI検索エンジンが​正しく​答えられた​割合を​示す指標であり、​0から​1の​範囲を​取る。​ground_truth​(=正解データ)の​key_facts​(=正解に​必須の​事実要素)を​完全に​含み、​かつ​検証可能な​ソースを​引用して​初めて​「正解」と​判定される。

重要な​理由

ビジネス面では、​正確性が​低いエンジンは​自社に​関する​誤情報の​拡散リスクを​生む。​学術面では、​Liu et al.​(2023)の​検証​可能性スコアおよび​C1​「引用​忠実性​(Citation Fidelity)」と​いう​構成概念に​対応する。​本文の​主張を​裏づけない​引用は​意味を​なさない、と​いう​原則に​基づいている。

計算式

正確性は、​key_factsを​完全に​含む回答数を​ factual 問数で​割って​算出する。​正解の​条件は、​全k​ey_factsを​含み、​かつverification_url​(=検証用URL)の​ドメインを​1件以上​引用している​ことだ。​同時に、​key_factsを​含まない、​または​架空の​URLを​含む回答の​割合を​ハルシネーション率​(=AIが​事実に​基づかない​内容を​生成する​現象の​発生率)と​して​並行して​測定する。

計算例​(77問スコープ)

77問を​対象に​した​計算例では、​ChatGPT Searchが​70/77正解で​0.91と​なった。​Geminiは​58/77で​0.75、​AI Overview​(SERP=検索結果​ページ)は​45/77で​0.58にとどまり、​3問に​1問以上が​事実誤りまたは​引用なしと​いう​結果だった。​YMYL​(Your Money or Your Life=医療・金融・法律など​生活や​財産に​影響する​領域)では、​0.58と​いう​水準は​致命的と​みなされる。

プロジェクトでの​使用方​法

対象は​factual-staticと​factoidの​68問に​YMYLの​9問を​加えた​77問である。​部分​一致は​F1スコア(=適合率と​再現率の​調和平均で​評価する​指標)で​採点し、​手順は​f1-scoring-test-cases-2026-05-29.mdに​定めている。​この​指標は​C1​「引用​忠実性」​構成概念の​主要指標と​して​機能する。

正確性スコアは​事実的​信頼性を​数値化する​指標であり、​0.75を​下回ると​誤情報リスクが​業務上無視できない​レベルに​なる。

148 notestil