生成AIの品質を“AIで測る”――「LLM as a Judge」を機能させる3つの要素

同じ機能を3回評価した結果。ハードルール達成率は全て100%だった一方、解釈性や説明文品質、総合スコアにはばらつきが見られた(提供:dotData)