LLM(大規模言語モデル)を用いた評価者は、人間の労力を減らすために利用されますが、その信頼性は人間の評価者との一致に依存しています。本研究では、限られた注釈からLLM評価者の信頼性を推定する「メトリックマッチ」という手法を開発しました。この手法は、人間の注釈のためにサンプルを選び、合成ラベルに基づく信頼性指標と一致させることを目的としています。実験結果では、メトリックマッチがランダム選択に対して高い成功率を示しました。
✅ AI解説
LLM(大規模言語モデル)を用いた評価者は、人間の労力を減らすために利用されますが、その信頼性は人間の評価者との一致に依存しています。本研究では、限られた注釈からLLM評価者の信頼性を推定する「メトリックマッチ」という手法を開発しました。この手法は、人間の注釈のためにサンプルを選び、合成ラベルに基づく信頼性指標と一致させることを目的としています。実験結果では、メトリックマッチがランダム選択に対して高い成功率を示しました。

ブッダ
織田信長
吉田松陰
坂本龍馬
太宰治
葛飾北斎
ソクラテス
野口英世
ダヴィンチ
エジソン
アインシュタイン
ナイチンゲール
ガリレオ
ニーチェ