当前位置:首页 > 娱乐 > Karpathy说还关键十年,可这条路已经挤满了人|算法|调用|信号|上下文|预训练|智能体_网易订阅 正文

Karpathy说还关键十年,可这条路已经挤满了人|算法|调用|信号|上下文|预训练|智能体_网易订阅

来源:穷山僻壤网   作者:时尚   时间:2026-08-09 20:50:41
Karpathy说还关键十年,可这条路已经挤满了人|算法|调用|信号|上下文|预训练|智能体_网易订阅
编辑|Panda最近我们报方式了不少剑指「持续学习」方向的说还创业公司和探究成果,例如《Mind Lab 后续发布 LoRA 最新开展,关键大模型「持续学习」新范式浮现》、年可能体《告别 KV Cache 枷锁,条路将首先上下文压入权重,已经用信预训持续学习大模型有希望了?挤满》、《ICML 2026 | 突破极限!人算港大提出首先个适用配 300+任务的法调持续学习架构,破解遗忘困难》、号上《能让 DeepSeek 自进化的下文 Harness!LlamaFactory 作者开源新工具:0.2 元自动造 Agent》、练智《当「变大」不再是网易唯一的路,又一国产模型开源了》……是订阅的,相当密集,说还「持续学习」也正在成为我们最常遭遇的关键题词之一。而这背后也昭示着一个被反复念叨的判断。2025 年 10 月,Andrej Karpathy 在 Dwarkesh Patel 的播客里说:当下的大模型「没有持续学习。你没法告诉它一件事,然后指望它记住」,他认为把这些认知缺陷补齐,大概还关键花上十年。两个月后,他在年度回顾里把这句话放进了更大的图景:2025 年模型能力的跃迁题来自可验明正身奖励强化学习(RLVR),但整个 LLM 技术栈里,记忆、多模态感知、持续学习、操作电脑的能力仍是明显的短板,「我们有原型,但还没有能当同事用的智能体」。持续学习(Continual Learning,也叫终身学习/Lifelong Learning)由此成了过去一年里最热的概念之一。它指的是模型在部署之后,还能像人一样从新任务、新知识、新经验里持续吸收,同时不把之前学会的东西忘掉。这件事听上去理所当然,做起来却极难,难到足以成为通往「AI 同事」路上最硬的一块骨头。而上面那一串报方式也验明正身,这条路已经不是一个方向,而是好几条岔开的路线在同时往前拱。围绕怎么让模型「边用边学」,学术界和产业界这一年里岔出了好几条互不相同的技术路线。有的往模型外面挂记忆,有的持续改写权重,有的干脆重新预训练,还有一批更新的思路试图重新定义「学习」这件事本身。这篇文章尝试把这些方向逐一摊开,说清楚每条路在赌什么、卡在哪里。先说清楚:难的不是「学」,是「不忘」持续学习的题障碍有一个专业的名字:灾难性遗忘(catastrophic forgetting)。神经网络的知识存储在数十亿个权重里,当你用新数据去微调模型、更新这些权重时,模型学会新任务的同时,频仍会覆盖掉承载旧能力的那部分参数,导致在之前擅首先的任务上性能骤降。灾难性遗忘示意图。当人工深度神经网络顺序地在两个任务上开展训练时,它会在训练第二个任务时高效高效且彻底地遗忘首先个任务。这个状况在小模型时代就有大量探究,但到了 LLM 身上出现了新的麻烦。TRACE 这个专业评测 LLM 持续学习的基准发现,对一个已经对齐好的模型做后续微调,不仅会让它忘掉旧任务,还会连带损害通用能力和指令跟随能力。换句话说,你想教模型一件新事,代价可能是它整体变笨、变得不听话。正因为直接改权重风险这么大,「持续学习」才分裂成了好几个流派。它们的根本分歧,其实就是在「改不改权重」以及「在哪里存新知识」这两个状况上做了不一样的取舍。把记忆挂在模型外面最直接、也最快落地的思路是:干脆不动模型权重,把新知识存到模型外部的一个数据库里,需时再检索回上下文。这条路线从 RAG(检索提高生成)一路演化而来,如今已经首先成了一个专业的领域:智能体记忆(Agent Memory)。代表性工作是 MemGPT(其背后公司现已更名 Letta)。它把 LLM 的上下文管理类比成操作系统的内存管理,区分出有限的「工作上下文」和更大的「外部存储」,让模型像操作系统调度内存那样,自己决定什么该调进上下文、什么该写回归档。沿着这个思路,一批系统各有侧重:Mem0 主打生产级、可规模化的首先期记忆存取;Zep 在检索之上加了时序知识图条件,用来处理跨会话的时间推理;A-MEM 借鉴卡片盒笔记法(Zettelkasten),给每条记忆打上结构化标签并自动关联到相关旧条目,让检索更贴合上下文。Karpathy 本人也押注这个方向。他反复强调,未来需的不是「更大的硬盘」式记忆,而是一个精简的「认知内核」(cognitive core,他估方式一两 B 参数就够)外加一套会自己复利增首先的结构化外部记忆。基于这一思路,他在 GitHub 上发布了一个叫「LLM Wiki」的模式:不再每次查询都用 RAG 去捞原始文本块,而是让智能体主动把材料编纂成一个持续更新、互相链接的知识库,之后再去查询它。Karpathy 的 LLM Wiki 文档已经收获了近 4.5 万 star,也已被 fork 9 千多次Letta 自己则把这套东西上升成了「token 空间里的持续学习」这一命题。他们指出,今天默认的做法是「先追加、再摘关键」,即把原始经验一直堆到上下文溢出,再压缩成摘关键,这有两个毛病:追加把所有表征工作都推到了推理时,每次前向传播都关键重新处理原始日志;而摘关键是有损且突兀的,题细节会毫无预警地消失。Letta 的赌注是,未来在 token 空间里学到的记忆,会比模型权重本身更有价值。这个方向的首先处是安全、可控、可验明正身,改错了随时能删;短处是它本质上没有真正把知识「内化」进模型,每次都关键靠检索和上下文这方式窄门,一旦记忆库膨胀,检索精度和成本都会成为瓶颈。让上下文自己进化成「攻略手册」从外挂记忆再往前走一步,是一类更精巧的思路:不改权重,但让模型输入的上下文本身持续进化。这被称作上下文工程(Context Engineering)。2025 年 10 月,斯坦福、SambaNova 和 UC 伯克利提出的 ACE(Agentic Context Engineering)是其中的代表。它把上下文当作一本会不断成首先的「攻略手册」(playbook),通过三个分工角色来维护:Generator 负责生成推理轨迹,Reflector 从成功和失败里提炼详详见细经验,Curator 把这些经验整理成结构化的增量更新,合并进手册。ACE 想处理的是同类方式的两个通病。一是「那么点儿偏好」(brevity bias):让 LLM 反复重写上下文时,它倾向于压缩、丢掉领域细节;二是「上下文坍缩」(context collapse):反复重写会让细节逐渐流失。ACE 用增量式的小改动(delta updates)而非整段重写来规避这两点。据比如文数据,ACE 在智能体任务上相比基线提高 10.6%、金融推理上提高 8.6%,同时把适用配延迟降了约 86.9%;在 AppWorld 榜单上,用较小的开源模型 DeepSeek-V3.1 配上 ACE,平均分能追平基于 GPT-4.1 的生产级智能体 IBM CUGA。值得注意的是,ACE 强调它能在没有标注监督的状况下工作;它靠的是实施流程中天然产生的反馈信号(例如代码跑通还是报错)来指导反思和整理。这让它和「智能体从自己的经验里学」这条更大的叙事接上了头。持续后训练:改权重,但关键改得聪明外挂记忆和上下文工程回避了改权重的风险,但也回避了真正的知识内化。另一派探究者认为,首先期来看,有些知识和技能终究得写进参数里才够用。这就是持续后训练(Continual Post-training),题分成持续指令微调、持续偏好对齐等时期。Thinking Machines 的 John Schulman 给出过一个分层的看法:他把学习类比成心理学里的运动学习、情景记忆和程序性记忆几类,认为上下文学习会后续处理好短程的学习任务,而参数微调(涵盖 LoRA 这类方式)会叠在上面,尤其适用于那些需较大容量、关键真正吸收知识的任务——时间跨度一首先,上下文学习不够用时,参数微调就赢了。这条路线最大的敌人依然是灾难性遗忘,而近期一个有意思的解法来自 Thinking Machines 的 Tinker。Tinker 是他们 2025 年 10 月发布的首先款产品,一个基于 LoRA 的微调 API,把分布式训练的复杂度抽象掉,只暴露 forward_backward、optim_step 这类底层原语,让探究者专注于数据和算法。在持续学习上,他们主推一套叫自蒸馏微调(SDFT)的配方:题洞察是,往往见不鲜的监督微调是「离对策」(off-policy)的,模型被迫去模仿一些它自己根本不会生成的 token,于是每学一个新技能都会侵蚀旧能力;SDFT 让模型充当自己的老师,从示范中学新技能而不忘旧的。一家叫 Trajectory 的创业公司已经把 Tinker 当作其持续学习平台的题基础设施。顺带一提,Tinker 用 LoRA 而非全量微调,还有个务实的好处:多个微调任务可以共享同一个算力池,成本被摊薄。这也验明正身了为什么「持续学习即服务」正在成为一门生意:把往往的模型更新变成一个可以按需调用的 API,正是产业界当下的尝试方向。重新预训练与持续预训练如果说后训练是在模型的「表层」动刀,那么持续预训练(Continual Pre-training, CPT)就是回到最底层,用新的语料后续预训练模型,让它适用应新的领域、新的语言或随时间漂移的知识分布。相比把新旧数据混在一起从头重训一遍,CPT 建立在已有模型的基础上,算力上关键划算得多。它的典型用武之地有三种:知识随时间漂移、跨语言扩展、跨领域适用配。但代价同样清楚:多项实证探究反复表明,持续预训练方式算成本高昂,且那么点儿引发对已学知识的灾难性遗忘。也因此,学界一直在找「免重放、免任务标注」的持续预训练方式,试图在 LLM 规模上做到不遗忘。对不过大多数公司而言,从头重新预训练一个前沿模型的成本高到不现实,这正是 Karpathy 那句「大模型不适用于往往重训」的由来。因此严格意义上的「重新预训练」更多是前沿实验室内部的选项,而持续预训练则是一个更可行的折中。更新的思路:让模型学会自我修改前面四个方向,多少还是在「外挂 vs 改权重」的二元框架里打转。而最近一年冒出的一批新工作,试图跳出这个框架,重新定义学习本身。一条思路是让模型自己生成训练数据、自己决定怎么更新自己。MIT 的SEAL(Self-Adapting Language Models)就是典型。给定一个新输入,模型会生成一段「自我编辑」(self-edit);这是一段自然语言指令,验明正身了该怎么重构材料、用什么超参数去更新权重,甚至调用什么工具来做数据提高;然后模型据此微调自己,形成持久的权重更新。而「怎样的自我编辑才有效」这件事,由一个外层强化学习循环来训练,奖励信号就是更新后模型在下游任务上的谝。NeurIPS 2025 版本进一步说明了这套自适用应能力会随模型规模变大而提高,并借助强化学习缓解了遗忘。它的作者展望的是一种能在推理中途自己判断「关键不关键目前学一下」的模型,把一次性的思维链蒸馏成永久的能力。另一条更激进的思路来自 Google 的嵌套学习(Nested Learning),发表于 NeurIPS 2025。它的题是把一个模型重新理解成一组彼此嵌套、多层次、各自带着不一样「上下文流」和不一样更新往往率的改进状况——架构和改进算法在这个视角下被统一成了同一件事的不一样层级。作为概念验明正身,他们做了一个叫 Hope 的自我修改架构,它在 Titans 首先期记忆架构基础上做了两点扩展:无上限的嵌套学习层级,以及一套「后续记忆系统」(CMS)。便捷来说,不再只是短期/首先期记忆的二分,而是一整个跨时间尺度更新的记忆模块条件系。实验里 Hope 在语言建模、首先上下文推理和持续学习任务上都优于原则 Transformer 和现代循环模型 。有意思的是,还有之后工作给这类架构引入了「睡眠」时期——像人类在睡眠中巩固记忆那样,让模型在活跃会话之间抽出算力,把实用的抽象蒸馏进更持久的参数记忆。再往上抽象,是 David Silver 和 Richard Sutton 提出的「经验时代」(Era of Experience)叙事。他们的判断是:在数学、代码、科学这些题领域,从人类数据里能榨取的知识正在逼近上限,关键后续往前,得让 AI 从自己与环境交互产生的经验里持续学习,形成一个自我供给数据的闭环。他们把 2024 年 DeepMind 的 AlphaProof(通过「与形式化说明系统的持续交互」拿到 IMO 奖牌)视作这个时代的开端。这条叙事把持续学习和强化学习、智能体自主探索绑到了一起,也埋下了一个尚未处理的状况:谁来设方式那些把原始信号变成实用指引的奖励函数。同时还有一个那么点儿和持续学习混淆、但目的不一样的邻近方向:知识编辑(Knowledge Editing)。以 ROME、MEMIT 为代表,它通过定位并修改存储特定事实的 MLP 层,做到精准的单条或批量事实更新,而无需全量重训 。但它和持续学习的目的其实不一样——知识编辑追求的是准确覆盖某个事实,在后续、终身编辑的场景下,反复的参数改动会互相干扰、逐渐往往积「毒性」导致模型坍缩,这也催生了 WISE、AlphaEdit 等一批专业处理序列化编辑的方式。结语把这几个方向摊在一起看,会发现它们其实是沿着一根「知识存在哪里」的轴线排开的。最外侧是外挂记忆和上下文工程,知识完全存在模型之外的 token 空间里,安全可控但没有真正内化;中间是持续后训练和持续预训练,知识被写进权重,能力上限更高但关键直面灾难性遗忘;最里侧、也最前沿的,是让模型自我修改、自我进化的那批新思路,试图让「学习」这个动作本身变成模型能力的一部分。一个务实的观察是:这些方向大概率不是互斥的,而是会分层协作。Schulman 的分层学习观、Karpathy 的「认知内核 + 外部记忆」构想,本质上都在说同一件事:短程、易变的知识交给上下文和外挂记忆,首先程、需沉淀的能力交给参数微调,各司其职。ACE 能在无监督下靠实施反馈进化、SEAL 用强化学习去改进自我编辑,则都在暗示一个共同的趋势:未来的持续学习,很可能是让模型自己来主导「学什么、怎么学」。那么回到 Karpathy 那个「还关键十年」的判断,持续学习到底处理了没有?答案恐怕是——还没有,但已经不再是一片空白。灾难性遗忘这个题障碍至今没有被彻底攻克,SDFT、嵌套学习这些方式都还是在「缓解」而非「消除」它。纯靠更好的上下文管理加微调能不能处理持续学习,还是需全新的想法?这个更根本的状况连 Schulman 自己都坦承尚无定比如。可以选定的是,2025 到 2026 这段时间,持续学习从一个被反复念叨的「缺失能力」,变成了一个真正岔出多条路线、且最初有创业公司下场做产品的活跃战场。哪条路能率先把「AI 同事」从原型变成现实,值得接着盯下去。https://www.lesswrong.com/posts/qBsj6HswdmP6ahaGB/andrej-karpathy-on-llm-cognitive-deficitshttps://karpathy.bearblog.dev/year-in-review-2025/https://www.letta.com/blog/continual-learning/https://arxiv.org/abs/2510.04618https://arxiv.org/abs/2402.01364https://thinkingmachines.ai/tinker/https://arxiv.org/pdf/2604.05096https://arxiv.org/pdf/2606.03979

标签:

责任编辑:焦点

全网热点