主辦方有提供的訓練集並分為真的(Supports)、 假的(Refutes)、資訊不足(Not Enough Information )三種類,每個敘述會有對應的維基百科文章中的某句支持或反對,因此任務為
輸入:
(某句話)
我們將檢索與這句話有關的維基百科,
再將維基百科的文章拆成數個句子
每個句子與(某句話)合併,輸入訓練好的 BERT base model 做判斷
其他技術細節如果需要我再做進一步說明
最近有沒有閱讀過LLM幻想性相關的論文
有的,最近閱讀了 SELFCHECKGPT: Zero-Resource Black-Box Hallucination Detection
for Generative Large Language Models 這篇論文,論文提出了SELFCHECKGPT目標用於:
1.檢測事實性和非事實性的句子
2.根據事實性對文本進行排序。
並發現在句子層級的幻覺檢測比文本層級的事實性評估,會有更高的信心程度
(後續開始說明做法)