RENDER:控制LLM记忆评估中的读者可见证据
1. 摘要
记忆与RAG(检索增强生成)评估常常将回答模型的输入视为实现细节,尽管系统可能将相同的历史记录呈现为记忆条目、摘要、类型化记录或原始摘录。我们引入了RENDER,一种基准控制方法,它在固定对话的同时变化读者可见的工件。RENDER结合了五级数据包阶梯(packet ladder),定位答案承载内容进入输入的时间点,并使用确定性模板近似ChatGPT风格的条目、LangChain摘要、MemGPT风格的类型化记录和原始对话。在500个LongMemEval问题和九个模型上,匹配预算的解析数据包比仅截断最近内容的原始对话高出42.4至72.6个百分点。在部署风格的模板中,每个模型的最佳与最差表现差异为24.6至48.8个百分点;在主要评分器下,ChatGPT风格的条目在9个模型中的7个上比原始对话有更高的点估计。裁判重新评分保持了正面的总体效果,但模型特定的显著性结果不一。三个在正式账本数据包上得分为0%的模型,在自然语言条目上回答相同事实的准确率为45.4%至53.4%。该效果在检索噪声下依然存在,并迁移到HotpotQA,表明记忆/RAG评估应报告或控制读者可见的工件。
2. 引言
大型语言模型(LLM)的记忆系统通常将对话历史存储为多种形式,如记忆条目、摘要、类型化记录或原始摘录。然而,现有的记忆与RAG评估方法往往忽略这些呈现形式对模型性能的影响,将输入视为固定的实现细节。这种忽视可能导致评估结果不准确,无法反映实际部署中的性能差异。为此,我们提出RENDER基准,旨在通过控制读者可见的工件来系统评估不同呈现形式对LLM记忆性能的影响。
3. RENDER基准设计
RENDER基准的核心是一个五级数据包阶梯,用于控制答案承载内容进入模型输入的时间点。阶梯从早期包含答案到晚期包含答案,共五个级别。同时,我们设计了确定性模板,模拟四种常见的呈现形式:ChatGPT风格的条目、LangChain摘要、MemGPT风格的类型化记录和原始对话。通过固定对话内容并变化呈现形式,我们能够隔离呈现形式对模型性能的影响。
4. 实验设置
我们在500个LongMemEval问题和九个不同模型上进行了实验。每个模型在匹配预算的条件下,分别使用解析数据包和仅截断最近内容的原始对话进行测试。此外,我们还测试了部署风格的模板,并使用了主要评分器和裁判重新评分两种评估方式。实验还考虑了检索噪声的影响,并在HotpotQA数据集上进行了迁移测试。
5. 主要结果
实验结果显示,匹配预算的解析数据包比仅截断最近内容的原始对话平均高出42.4至72.6个百分点。在部署风格的模板中,每个模型的最佳与最差表现差异为24.6至48.8个百分点。在主要评分器下,ChatGPT风格的条目在9个模型中的7个上比原始对话有更高的点估计。裁判重新评分保持了正面的总体效果,但模型特定的显著性结果不一。特别值得注意的是,三个在正式账本数据包上得分为0%的模型,在自然语言条目上回答相同事实的准确率为45.4%至53.4%。
6. 鲁棒性与迁移
我们进一步测试了RENDER效果在检索噪声下的鲁棒性,发现效果依然存在。此外,在HotpotQA数据集上的迁移测试表明,该效果不仅限于LongMemEval,具有普遍性。这些结果强调了在记忆/RAG评估中报告或控制读者可见工件的重要性。
7. 结论与建议
RENDER基准揭示了读者可见工件对LLM记忆性能的显著影响,表明现有评估方法可能低估或高估模型的实际能力。我们建议未来的记忆/RAG评估应明确报告或控制读者可见的工件,以确保评估结果的准确性和可比性。RENDER提供了一个标准化的控制方法,有助于推动该领域评估方法的改进。
RENDER:控制LLM记忆评估中的读者可见证据
1. 摘要
记忆与RAG(检索增强生成)评估常常将回答模型的输入视为实现细节,尽管系统可能将相同的历史记录呈现为记忆条目、摘要、类型化记录或原始摘录。我们引入了RENDER,一种基准控制方法,它在固定对话的同时变化读者可见的工件。RENDER结合了五级数据包阶梯(packet ladder),定位答案承载内容进入输入的时间点,并使用确定性模板近似ChatGPT风格的条目、LangChain摘要、MemGPT风格的类型化记录和原始对话。在500个LongMemEval问题和九个模型上,匹配预算的解析数据包比仅截断最近内容的原始对话高出42.4至72.6个百分点。在部署风格的模板中,每个模型的最佳与最差表现差异为24.6至48.8个百分点;在主要评分器下,ChatGPT风格的条目在9个模型中的7个上比原始对话有更高的点估计。裁判重新评分保持了正面的总体效果,但模型特定的显著性结果不一。三个在正式账本数据包上得分为0%的模型,在自然语言条目上回答相同事实的准确率为45.4%至53.4%。该效果在检索噪声下依然存在,并迁移到HotpotQA,表明记忆/RAG评估应报告或控制读者可见的工件。
2. 引言
大型语言模型(LLM)的记忆系统通常将对话历史存储为多种形式,如记忆条目、摘要、类型化记录或原始摘录。然而,现有的记忆与RAG评估方法往往忽略这些呈现形式对模型性能的影响,将输入视为固定的实现细节。这种忽视可能导致评估结果不准确,无法反映实际部署中的性能差异。为此,我们提出RENDER基准,旨在通过控制读者可见的工件来系统评估不同呈现形式对LLM记忆性能的影响。
3. RENDER基准设计
RENDER基准的核心是一个五级数据包阶梯,用于控制答案承载内容进入模型输入的时间点。阶梯从早期包含答案到晚期包含答案,共五个级别。同时,我们设计了确定性模板,模拟四种常见的呈现形式:ChatGPT风格的条目、LangChain摘要、MemGPT风格的类型化记录和原始对话。通过固定对话内容并变化呈现形式,我们能够隔离呈现形式对模型性能的影响。
4. 实验设置
我们在500个LongMemEval问题和九个不同模型上进行了实验。每个模型在匹配预算的条件下,分别使用解析数据包和仅截断最近内容的原始对话进行测试。此外,我们还测试了部署风格的模板,并使用了主要评分器和裁判重新评分两种评估方式。实验还考虑了检索噪声的影响,并在HotpotQA数据集上进行了迁移测试。
5. 主要结果
实验结果显示,匹配预算的解析数据包比仅截断最近内容的原始对话平均高出42.4至72.6个百分点。在部署风格的模板中,每个模型的最佳与最差表现差异为24.6至48.8个百分点。在主要评分器下,ChatGPT风格的条目在9个模型中的7个上比原始对话有更高的点估计。裁判重新评分保持了正面的总体效果,但模型特定的显著性结果不一。特别值得注意的是,三个在正式账本数据包上得分为0%的模型,在自然语言条目上回答相同事实的准确率为45.4%至53.4%。
6. 鲁棒性与迁移
我们进一步测试了RENDER效果在检索噪声下的鲁棒性,发现效果依然存在。此外,在HotpotQA数据集上的迁移测试表明,该效果不仅限于LongMemEval,具有普遍性。这些结果强调了在记忆/RAG评估中报告或控制读者可见工件的重要性。
7. 结论与建议
RENDER基准揭示了读者可见工件对LLM记忆性能的显著影响,表明现有评估方法可能低估或高估模型的实际能力。我们建议未来的记忆/RAG评估应明确报告或控制读者可见的工件,以确保评估结果的准确性和可比性。RENDER提供了一个标准化的控制方法,有助于推动该领域评估方法的改进。