生成AIの品質を“AIで測る”――「LLM as a Judge」を機能させる3つの要素 同じ機能を3回評価した結果。ハードルール達成率は全て100%だった一方、解釈性や説明文品質、総合スコアにはばらつきが見られた(提供:dotData) 記事に戻る @IT