分类
AI 工具
193 条动态
比尔·盖茨:AI危险阈值已过,我们该怎么办?
华盛顿州柯克兰市,一个阳光明媚的日子。这是西雅图富裕的郊区,位于华盛顿湖东岸。气温在华氏80多度(约摄氏30度),天空蓝得不能再蓝。从Gates Ventures的会议室望出去,可以看到Carillon Point码头,那里停泊着一队昂贵的船只,湖对岸是奥林匹克山脉,勾勒出地平线。景色美不胜收,但隐约令人恐惧。因为如果景色是平静的,传递信息的人却不是。坐在我对面的会议室桌旁,比尔·盖茨在椅子上前后
阅读全文ESQ-Bench:评估NL2SQL方言泛化与静默语义分歧的多层企业Oracle基准
最先进的自然语言转SQL(NL2SQL)模型在Spider和BIRD等既有基准上报告的执行准确率超过89%。然而,这些基准依赖于简化的学术模式(schemas)和开源SQL方言,无法反映企业数据库环境的复杂性。我们引入了ESQ-Bench,这是一个以Oracle优先的NL2SQL基准,具有系统化的复杂度层级(complexity tiers),并在三个企业模式复杂度层级上评估静默分歧(silent
阅读全文LLM智能体利用仿真模型进行受控实验
大型语言模型(LLMs)在推理、规划和工具使用方面展现出强大的能力,但许多科学和工程任务不仅仅需要生成合理的文本和代码。这些任务要求理解系统对干预的响应方式,而这在实践中依赖于受控实验。在本工作中,我们提出了一种多智能体框架,使LLM智能体能够利用科学仿真模型进行受控实验,以用于制药工艺设计。给定用户查询和基线配置,该系统构建结构化的任务表示,设计实验,执行比较仿真,解释结果,并为工艺参数优化综合
阅读全文RENDER:控制LLM记忆评估中的读者可见证据
记忆与RAG(检索增强生成)评估常常将回答模型的输入视为实现细节,尽管系统可能将相同的历史记录呈现为记忆条目、摘要、类型化记录或原始摘录。我们引入了RENDER,一种基准控制方法,它在固定对话的同时变化读者可见的工件。RENDER结合了五级数据包阶梯(packet ladder),定位答案承载内容进入输入的时间点,并使用确定性模板近似ChatGPT风格的条目、LangChain摘要、MemGPT风
阅读全文隐藏规则游戏中的AI学习与概念迁移
本报告总结了在隐藏规则游戏(Game of Hidden Rules, GOHR)上进行的工作,重点关注通过试错反馈推断隐藏规则的强化学习智能体、表示设计、规则难度分析、迁移学习、泛化能力以及伪机器人辅助的人类学习分析。报告重点介绍了基于Transformer的A2C框架、特征中心(Feature-Centric)和对象中心(Object-Centric)表示、实验结果以及人类学习数据的分类。
阅读全文AIREP:AI运行时治理中逐决策证据的协议
本文提出了一种用于记录自动化AI运行时治理决策的协议。当运行时对单个输出进行发布、阻止、延迟、编辑或升级处理时,AIREP将该决策记录为单个签名对象,任何一方都可以离线检查该对象,而无需依赖生成该对象的运行时。每条记录将决策表示为在既定政策依据下的封闭动词集合中的一个动词,通过哈希而非值来引用其输入、输出和证据,并声明其证据覆盖的内容以及未覆盖的内容。记录形成SHA-256哈希链,将每条记录绑定到
阅读全文KVBoost:基于偏差引导重算的分块键值缓存复用技术,实现高效大语言模型推理
基于Transformer的大语言模型(LLM)在推理过程中面临高预填充延迟问题,因为每个请求都需要重新计算键值(KV)张量。现有的前缀缓存系统虽然能降低这一成本,但要求提示词共享一个连续的前缀,这限制了共享内容出现在任意位置时的复用效果。
阅读全文LitReview Arena:基于对战式同行评审平台的文献综述智能体评估
文献综述对科学进步至关重要,但严格评估自动生成的综述仍然困难重重,因为研究效用的许多方面依赖于专家判断,而非参考重叠指标。我们推出了LitReview Arena,一个对战式评估平台,采用针对文献综述质量量身定制的结构化协议:具有AI论文写作经验的领域专家对匿名草稿进行比较,匹配其专业领域内的主题,并针对五个文献综述特定标准提供分维度结果。通过该协议,我们收集了约3000条专家判断,每条包含五个维
阅读全文模型崩溃现象与对策综述
在大量网络规模数据的驱动下,生成式人工智能(GenAI)取得了显著进展,推动了各个领域的多种应用。GenAI的进步促使从业者使用AI合成数据来训练下一代AI模型。不可否认,使用合成数据缓解了日益增长的数据供应需求。然而,它也引入了一个新的关键问题:在模型与数据之间的自消耗循环中,模型最终会崩溃,这引发了对GenAI可信度的更多担忧。近年来,越来越多的研究调查了模型崩溃(MC)现象,并探索了缓解该问
阅读全文比尔·盖茨:AI危险阈值已过,我们该怎么办?
华盛顿州柯克兰市,一个阳光明媚的日子。这是西雅图富裕的郊区,位于华盛顿湖东岸。气温在华氏80多度(约摄氏30度),天空蓝得不能再蓝。从Gates Ventures的会议室望出去,可以看到Carillon Point码头,那里停泊着一队昂贵的船只,湖对岸是奥林匹克山脉,勾勒出地平线。景色美不胜收,但隐约令人恐惧。因为如果景色是平静的,传递信息的人却不是。坐在我对面的会议室桌旁,比尔·盖茨在椅子上前后
ESQ-Bench:评估NL2SQL方言泛化与静默语义分歧的多层企业Oracle基准
最先进的自然语言转SQL(NL2SQL)模型在Spider和BIRD等既有基准上报告的执行准确率超过89%。然而,这些基准依赖于简化的学术模式(schemas)和开源SQL方言,无法反映企业数据库环境的复杂性。我们引入了ESQ-Bench,这是一个以Oracle优先的NL2SQL基准,具有系统化的复杂度层级(complexity tiers),并在三个企业模式复杂度层级上评估静默分歧(silent
LLM智能体利用仿真模型进行受控实验
大型语言模型(LLMs)在推理、规划和工具使用方面展现出强大的能力,但许多科学和工程任务不仅仅需要生成合理的文本和代码。这些任务要求理解系统对干预的响应方式,而这在实践中依赖于受控实验。在本工作中,我们提出了一种多智能体框架,使LLM智能体能够利用科学仿真模型进行受控实验,以用于制药工艺设计。给定用户查询和基线配置,该系统构建结构化的任务表示,设计实验,执行比较仿真,解释结果,并为工艺参数优化综合
RENDER:控制LLM记忆评估中的读者可见证据
记忆与RAG(检索增强生成)评估常常将回答模型的输入视为实现细节,尽管系统可能将相同的历史记录呈现为记忆条目、摘要、类型化记录或原始摘录。我们引入了RENDER,一种基准控制方法,它在固定对话的同时变化读者可见的工件。RENDER结合了五级数据包阶梯(packet ladder),定位答案承载内容进入输入的时间点,并使用确定性模板近似ChatGPT风格的条目、LangChain摘要、MemGPT风
隐藏规则游戏中的AI学习与概念迁移
本报告总结了在隐藏规则游戏(Game of Hidden Rules, GOHR)上进行的工作,重点关注通过试错反馈推断隐藏规则的强化学习智能体、表示设计、规则难度分析、迁移学习、泛化能力以及伪机器人辅助的人类学习分析。报告重点介绍了基于Transformer的A2C框架、特征中心(Feature-Centric)和对象中心(Object-Centric)表示、实验结果以及人类学习数据的分类。
AIREP:AI运行时治理中逐决策证据的协议
本文提出了一种用于记录自动化AI运行时治理决策的协议。当运行时对单个输出进行发布、阻止、延迟、编辑或升级处理时,AIREP将该决策记录为单个签名对象,任何一方都可以离线检查该对象,而无需依赖生成该对象的运行时。每条记录将决策表示为在既定政策依据下的封闭动词集合中的一个动词,通过哈希而非值来引用其输入、输出和证据,并声明其证据覆盖的内容以及未覆盖的内容。记录形成SHA-256哈希链,将每条记录绑定到
KVBoost:基于偏差引导重算的分块键值缓存复用技术,实现高效大语言模型推理
基于Transformer的大语言模型(LLM)在推理过程中面临高预填充延迟问题,因为每个请求都需要重新计算键值(KV)张量。现有的前缀缓存系统虽然能降低这一成本,但要求提示词共享一个连续的前缀,这限制了共享内容出现在任意位置时的复用效果。
LitReview Arena:基于对战式同行评审平台的文献综述智能体评估
文献综述对科学进步至关重要,但严格评估自动生成的综述仍然困难重重,因为研究效用的许多方面依赖于专家判断,而非参考重叠指标。我们推出了LitReview Arena,一个对战式评估平台,采用针对文献综述质量量身定制的结构化协议:具有AI论文写作经验的领域专家对匿名草稿进行比较,匹配其专业领域内的主题,并针对五个文献综述特定标准提供分维度结果。通过该协议,我们收集了约3000条专家判断,每条包含五个维
模型崩溃现象与对策综述
在大量网络规模数据的驱动下,生成式人工智能(GenAI)取得了显著进展,推动了各个领域的多种应用。GenAI的进步促使从业者使用AI合成数据来训练下一代AI模型。不可否认,使用合成数据缓解了日益增长的数据供应需求。然而,它也引入了一个新的关键问题:在模型与数据之间的自消耗循环中,模型最终会崩溃,这引发了对GenAI可信度的更多担忧。近年来,越来越多的研究调查了模型崩溃(MC)现象,并探索了缓解该问