强化学习之父Sutton最新访谈:合成数据是巨大错误,大模型只完成了四分之一的智能
当前,大模型主要通过预训练和后训练获得能力,上线后参数通常不再更新,只能借助上下文、知识库或重新训练适应变化。如何让 AI 在部署后持续学习,正成为行业需要突破的基础问题。 8 月 18 日,红杉资本旗下播客《Training Data》发布了一期围绕 AI 持续学习的对谈,受访者为强化学习奠基人、2024 年图灵奖得主 Rich Sutton。此外,参与访谈的嘉宾还有 Sutton 的前学生、Oak Lab 联合创始人 Khurram Javed,对谈由红杉资本合伙人 Sonya Huang 和 Alfred Lin 主持。 访谈从 Sutton 2019 年发表的《苦涩的教训》谈起,延伸至合成数据、世界模型和持续学习,并讨论智能体如何从真实经验中形成抽象概念。Sutton 认为,部署后便停止改变的模型,还称不上完整的智能系统。大模型虽是重要突破,却主要解决了语言能力,只覆盖智能的一部分。 基于这一判断,Sutton 正将持续学习推进为一条完整的技术路线。就在上个月,他与 Khurram Javed 创立 AI 初创公司 Oak Lab,并提出以经验学习、时间抽象和规划为核心的 OaK 架构,希望智能体能从连续经历中实时学习,不断更新认知并改进决策。 “止步不前”的智能 在今天,大模型看起来无所不知,却有一个容易被忽略的特点:它们的大部分能力都在上线前形成,经过预训练和后训练后,模型参数便基本固定。此后即使每天接触大量用户和新信息,也不会像人一样把这些经历转化为新的长期能力。 图|访谈现场
托纳利:输球输在对抗;德泽尔比重建热刺精神
为球队提供定制的足球装备,包括球衣、球鞋、球袜等,满足团队需求。...
梅阿查的青春风暴:4-1大胜背后,皮奥的“支点”哲学与国米的新答案
为球队提供定制的足球装备,包括球衣、球鞋、球袜等,满足团队需求。...