「ベンチマーク高得点」AIでも“本番”で障害頻発 GitHubがLLMの誤検知を「95%削減」した7つの教訓 LLM-as-judgeを活用し、人間によるレビューの対象を絞り込むトリアージファネル:全ての評価例(モデルの出力と信頼できる正解のラベル)はファネル(じょうご)に入り、「明確な合意」「信頼度が低い」「モデルとラベルの不一致」「影響が大きいケース」の4グループに分類される。明確な合意がある評価例は自動処理に移行し、他の3グループは、結果決定とラベル修正のために人間によるレビューに回される。レビューされた例、修正されたラベル、新しいテストケースは、評価データセットにフィードバックされる(提供:GitHub) 記事に戻る @IT