行业调研 · 主题深度 · 2026-08-13

智能上限的主线
不是世界模型,是学习

他把技术主线排成语言模型 → CoT → Agent → 持续学习 → 渐变的自我迭代 → 具身智能。本报告还原他为何这样排,把每一级对照可核验的前沿研究,并写出三条证伪条件。与观点提炼稿交叉链接:那份只收原话,这份只做行业证据与推断。

6
级技术阶梯
P1–P5
证据分级
3
条证伪条件
对照
实验室路线

报告日:2026-08-13。
体裁:行业主题深度(industry primer + thematic deep dive)。不是个股覆盖,不给目标价,不写买卖建议。
一级材料:2026-05-20 梁文锋投资者交流会录音文字稿(音频 deepseek 0520.m4a,约 3 小时 44 分钟;整理 2026-07-16,ASR,说话人未切分)。结构化摘录见同目录 《梁文锋投资者交流会 · 观点提炼》(下称「摘录稿」)。数字与专有名词的 ASR 风险继承摘录稿第十五节,本报告不把交流会里的卡量、利润倍数当作已审计事实
对照材料:DeepSeek 已发表技术报告、同行评审论文、实验室官方博客与产品说明。
读法:凡写「他怎么说」只指向摘录稿;凡写「本报告判断 / 推断」均加框或标明,不回写到他头上。

Part 1

一、封面纪律:材料、方法、证据分级

1.1 这份报告回答什么问题

摘录稿已经把梁文锋本人的判断抽干净了。本报告只追三个问题:

  1. 他为什么把智能主线排成「语言模型 → CoT → Agent → 持续学习 → 渐变的自我迭代(他先称奇点、随即改口)→ 具身智能」?会上给出的理由是否自洽?
  2. 2026 年 8 月能核验的最前沿研究,把这条阶梯的每一级推到了哪一档成熟度?
  3. 哪些公开证据会支持、修正或打穿这条排序?对产业而言,价值更可能沉淀在哪一级?

本报告不重写整场交流会,不讨论开源定价与融资条款。那些属于摘录稿的范围。

1.2 与摘录稿的分工

摘录稿 本报告
任务 他说了什么、拿什么当理由 行业证据怎么说、哪些是推断、什么会证伪
纪律 不补心理动机 推断必须单独标注
数字 交流会数字照录并标 ASR 不用交流会产能数字作外部事实
读者 要贴着录音读的人 要把这条阶梯放到全球技术地图上的人

1.3 投行方法(实际执行,不只写在封面上)

对标主题深度研报的六个模块,而不是卖方覆盖模板里的目标价页。

模块 本报告落地
One-pager 第二节:辩论、判断、三条证伪条件
证据分级 P1 当事人原文 / 本实验室论文;P2 同行评审或可核验技术报告;P3 官方博客与产品说明;P4 可信二手对公开声明的转述;P5 媒体与传闻(只用于时间线,不支撑技术结论)
声称三分栏 「他怎么说 / 本报告推断 / 文献怎么说」分栏,不混写
成熟度 已工业部署 / 窄域工业部署 / 实验室可复现 / 问题已提出方法未通 / 概念
对照系 OpenAI、Anthropic、Google DeepMind、Meta / LeCun、Physical Intelligence、NVIDIA 具身栈
情景与证伪 用「哪一级被解锁」定义 Base / Bull / Bear,不用日历预言充作结论

严格禁止:把「业界共识」写成无出处判断;把推断写成「梁文锋认为」;用交流会里的卡量交叉验证外部财报。

1.4 证据分级符号

后文每条关键判断尽量落到参考文献编号。编号与附录对照表一一对应,附录给出作者、年份、venue、URL/DOI、证据级、支撑哪条判断。核不到标题与 URL 的文献,正文不引用。

Axis I投资人一页纸
Part 2

二、投资人一页纸

2.1 核心辩论

当前前沿实验室并不共用一张路线图。至少四条叙事在抢「智能上限」的定义权:

叙事 代表出处 智能上限主要靠什么抬
语言—推理—行动—学习(梁文锋) 摘录稿 §6.3、§12.1 先把可检验的符号智能做完,再用它开发下一版,最后才进物理世界
世界模型先行 LeCun 2022 立场论文与 Meta 预告 [32][33] 在潜空间里预测世界,而不是把下一个 token 当作主目标
视频 / 生成即模拟 OpenAI Sora 技术说明 [34] 规模化视频生成是通向物理世界模拟器的路径
具身数据先行 Physical Intelligence π₀ [36]、Open X-Embodiment [37]、Gemini Robotics [39] 跨本体机器人数据 + 视觉—语言—动作模型,现在就把身体接上

梁文锋把后三条里的视频生成、现阶段世界模型明确移出「智能主线」:商业上可以是好生意,但「跟智能的上限也没有太大的关系」(摘录稿 §8.1)。这不是审美偏好,是他对什么叫抬智能上限的操作定义。

2.2 本报告判断(不是他的原话)

本报告判断。 这条阶梯在依赖关系上成立:后面几级的已发表系统,几乎都站在语言模型(以及越来越常见的视觉—语言模型)肩膀上。最大的未解关口是他所说的「持续学习」——全球实验室都承认灾难性遗忘与「权重冻结的 LLM」之间的裂缝,但还没有一个被广泛复现、可规模化部署的解法。他把「奇点」改口为渐变,与 I. J. Good 1965 年的「智力爆炸」硬起飞叙事 [29] 在机制上决裂,与「用模型改进模型的局部环节」这类已出现的弱形式 [30] 更接近。具身被后置,是杠杆逻辑(让更强的智能去造机器人),不是否定物理世界有需求。

三句收口:

  1. 依赖成立。 CoT 论文明确建立在足够大的语言模型上 [9];ReAct 把思维链与行动交错 [14];π₀ 等具身模型以预训练视觉—语言模型为骨干 [36]。后一步用前一步,不是修辞。
  2. 瓶颈判断与公开证据同向,替代假说也成立。 「给全上下文已经超过人、仍替代不了员工」与 METR 的时间视野结果同向:前沿 agent 在短任务上接近满分,在数小时级任务上成功率骤降 [18]。但「缺的是权重可更新的持续学习」并不是唯一解释——缺的也可能是更长的可靠工具链,而不必改权重。
  3. 排序是资源约束下的最轻松路线,不是唯一物理可能。 他给出的排序理由是「后面的技术可用前面的技术来开发」「先具身是苦活」(摘录稿 §6.3)。这在工程上自洽,不能推出「现在做机器人的实验室走错了」;只能推出:在算力紧、要以自身为第一用户的实验室里,这条路径的期望加班更少。

2.3 三条证伪条件(What would change our mind)

若下列任一事件以可复现方式出现,本报告对这条阶梯的权重必须下调:

# 证伪条件 观察路标
F1 世界模型或视频生成单独把智能上限明显抬过语言—推理栈,且不依赖后者作骨干 在无强语言模型骨干的设定下,世界模型在可检验推理 / 规划基准上稳定超过同期 CoT+Agent 系统
F2 不更新权重、只靠上下文与工具,agent 即可完成「约两个月在岗学习」级任务 METR 类时间视野在高可靠性阈值(如 80%)上达到周—月级 [18],并且在真实企业岗位上可复现,而不出现灾难性遗忘式的串任务崩溃
F3 先具身、后符号的实验室,用明显更少的语言智能做出可泛化家务 / 养老级系统 跨家庭、跨本体的成功不依赖大规模 VLM/LLM 骨干,且数据效率高于「先软件智能再机器人」的对照

这三条在 2026-08 均未被满足。F2 是最近的竞争假说;F1、F3 与公开论文方向相反。

2.4 成熟度仪表盘(截至 2026-08)

flowchart LR
  L1["1 语言模型
已工业部署"] --> L2["2 CoT / 推理时计算
已工业部署"] L2 --> L3["3 Agent
窄域工业部署"] L3 --> L4["4 持续学习
方法未通"] L4 --> L5["5 自我迭代
弱形式可复现"] L5 --> L6["6 具身智能
实验室可复现"]
他的时间锚(摘录稿) 本报告成熟度 一句话证据
语言模型 更前一步 已工业部署 Transformer [4] + 规模律 [5][6];DeepSeek-V3 为 671B/37B 激活 MoE [2]
CoT 「去年」 已工业部署 o1 用 RL 训练思维链 [11][12];DeepSeek-R1 用 RL 激励推理并发表于 Nature [3][46]
Agent 「今年」 窄域工业部署 编码 agent 已进产品;SWE-bench 曾是主尺,OpenAI 于 2026 年因污染停止用 Verified 报前沿 [20];通用桌面/岗位仍远
持续学习 「下一个瓶颈」 问题已提出、方法未通 EWC 2017 仍是经典补丁 [21];Titans / Nested Learning / SEAL 是 2025 年新架构,尚未成为训练默认 [24][26][27]
自我迭代 「奇点,但是渐变」 弱形式实验室可复现 AlphaEvolve 改进 Gemini 训练内核并进入 Google 基础设施 [30];全自动「下一版模型」未出现
具身 自我迭代之后 实验室可复现 π₀、GR00T、Gemini Robotics 均公开 [36][40][39];家务/养老级泛化未证明
Axis II他为什么这样排序
Part 3

三、认知还原:他为什么这样排,而不是另一种排

本节只做两件事:把他会上给出的理由收成一条因果链;再把本报告的推断单独加框。不把后者写进他的嘴里。

3.1 会上给出的三条排序公理

摘录稿 §6.3、§12.1 里,他反复使用的不是一张产品路线图,是三条公理:

公理 原话压缩 它排除什么
依赖 后一步用到前一步:CoT 用语言模型,Agent 用 CoT 「跳过推理、直接上 agent / 机器人」作为主线
杠杆 「后面的技术可用前面的技术来开发」;「奇点之后再做具身,就不用人来做了」;先具身「是一个很苦的活」 把机器人本体研发当成当前最高杠杆
可观察瓶颈 问题说清、上下文给全,「已经超过人类」;人有几十年上下文,招一个员工大约两个月就能上手;AI 没有这两月学习,替代不了员工。Agent 走完仍到不了 AGI。「必须要有持续学习的能力,它才能叫下一代模型。」 把多模态、搜索、视频生成、现阶段世界模型当成智能上限主线

这三条足够推出他的排序,不需要额外的性格分析。

3.2 实验室中心的 AGI 定义

摘录稿写得很清楚:没有具身时,他对 AGI 的希望是「能帮我迭代下一版模型」;有具身后,希望它迭代下一版具身、做下一版机器人。持续学习的第一用户是他们自己:「我们做的模型,第一目标不是大家用得好用,而是我们自己用得好用。」(摘录稿 §12.1)

推断(本报告,非梁文锋原话)。 这是一个以研究生产率为产品的 AGI 定义。消费侧的「做家务、养老」被明确承认是正常人的需求,但被放在自我迭代之后。因此他的阶梯看起来「不像 C 端产品经理会画的图」,而像「一个要把下一张权重训练出来的实验室主任会画的图」。编码 agent 被放在当前垂直应用第一(摘录稿 §8.3),与这个定义同构:写代码、改内核、跑实验,是「帮我迭代下一版模型」最近的任务分布。

公开对照:Google DeepMind 的 AlphaEvolve 把「用编码 agent 改进算法与训练栈」做成了可部署系统,并报告将 Gemini 架构中一个矩阵乘内核加快 23%、训练时间降约 1% [30]。这不是梁文锋引用过的材料,但它表明:「第一用户是自己」在别的顶尖实验室也已经从口号变成内部工具。

3.3 员工类比:他把「完成任务」收成「持续学习」

他用来卡住 Agent 的,不是某一道奥数题,是岗位:

  • 人:叫「小王」过来就知道小王是谁;大约两个月熟悉环境。
  • 模型:每次必须被告知小王是谁、职务、怎么找、注意什么。「你不可能给他所有的上下文,也不现实。」(摘录稿 §6.2)

因此「持续学习」在他那里不是一项点名的算法,而是「像人一样较长时段学习、不必每次给极强训练」。他同时说「可能不是一项技术,它是一个问题」,「现在全世界都还没有找到好的方法」(摘录稿 §12.1)。文稿里「持续学习」与「学习去学习」混用,摘录稿不强行合并;本报告同样分列(见附录术语表)。

推断。 他把两个在文献里分开的问题焊在了一起:(a)任务级 agent 失败(工具链、记忆、可靠性);(b)权重级持续学习失败(新任务冲掉旧任务)。焊点是员工类比。若(a)能被更长上下文、外部记忆、更好的 agent 脚手架单独解掉,他的「下一代 = 必须有持续学习」就会显得过严。这正是第二节 F2。

3.4 「最轻松的路线图」:算力约束下的研究策略,不是宇宙唯一解

他给出的排序还有一层组织理由:这条路「可以不用加班」;持续学习研究「不消耗卡,只需要很少的卡,他需要的是想法」,内部叫「摸奖」(摘录稿 §12.1)。Scaling 才烧卡,模型大小「按资源算出来」(摘录稿 §6.4)。

推断。 在算力相对美国更紧的约束下,把未解问题定义成「想法密集、卡不密集」,同时把已解问题(预训练、推理时计算)交给能买到的卡,是理性的研究组合——它解释了为什么视频生成这种「好生意」仍被移出主线:它既烧卡,又(在他看来)不抬智能上限。Sutton 2019 年的 The Bitter Lesson 说,最终赢的是能吃计算的通用方法 [31]。梁文锋同时相信 Scaling(吃计算)持续学习这个尚未被规模化的问题(吃想法)。二者不矛盾:Scaling 还没撞墙,墙以外的那一级被他命名为持续学习。

3.5 改口「奇点 → 渐变」:这是有理论含量的判断

I. J. Good 1965 年的操作定义是:超智能机器能够设计更好的机器,于是「毫无疑问会有一次智力爆炸」,人的智力被甩在后面;「第一台超智能机器是人类需要做的最后一项发明」[29]。梁文锋先借用「奇点」这个习惯叫法,立即修正:不是突变,是较长渐变;AGI「没有临界点,但是非线性」,因为「AI 可以加速 AI 的研究」(摘录稿 §6.3、§13.1)。

对齐与决裂可以写成一行:

Good 1965 [29] 梁文锋 2026-05(摘录稿)
内容 机器能设计更好的机器 模型能做人类能做的事,能开发下一版本
动力学 智力爆炸 较长渐变;无临界点,可非线性
人的位置 被甩在后面 至少在持续学习做通之前,人仍是研究主体;AI「还不是自主地工作,还是只是跟人搭配」

推断。 这次改口使他更接近 Silver 与 Sutton 2025 年「经验时代」的渐进口径——用智能体与环境交互产生的数据持续改进,而不是一次冻结权重后的相变 [28]——而不是更接近 Good 的爆炸。公开文献里已经出现弱形式的「用模型改进模型」:R1 的推理能力被蒸馏回 V3 [2][3];AlphaEvolve 优化 Gemini 自己的训练栈 [30]。这些是渐变的证据,不是爆炸的证据。

3.6 DeepSeek 已发表轨迹与阶梯是否同构

只看公开论文,不看交流会产能数字:

台阶 公开物证 证据级
语言模型 DeepSeek-V3:671B 总参、每 token 37B 激活;14.8T token 预训练;全文训练 2.788M H800 GPU 小时 [2] P1
CoT / 推理 DeepSeek-R1-Zero:无 SFT 先做大规模 RL,推理行为涌现;DeepSeek-R1 加冷启动与多阶段,推理任务与 OpenAI-o1-1217 可比;Nature 正式发表 [3][46] P1 / P2
Agent 交流会称「今年」;公开论文侧尚未有与 R1 同级的「DeepSeek Agent 技术报告」。本仓库对 deepseek-harness 的源码分析只能证明工程栈存在,不能代替实验室官方论文 会上 P1;工程栈不升格为论文 P1
持续学习 他明确说全世界还没做通、内部想法未做通(摘录稿 §12.1) P1(否定性声明)

同构的部分:V3 → R1 就是「语言模型 → CoT」的一次公开演示,而且 R1 的训练明确从 V3-Base 出发 [3]。尚未同构的部分:Agent 与持续学习还停在会上的时间锚,没有同等重量的论文。本报告不把「今年做 Agent」写成已经发表的事实。

3.7 主线外不做:视频、世界模型、多模态的位置

摘录稿 §8.1:3D / 视频生成「跟智能主线没有太大关系」,Sora 之后大小公司都做、小公司后来砍掉;世界模型「现在跟智能的上限也没有太大的关系」,且词义「没那么清楚」。多模态对 C 端重要,对智能上限「是一个组件……跟搜索一样」;V4 起仍做原生多模态(摘录稿 §6.4)。

推断。 他用的判别标准是:这件事是否提高「在完整上下文里解决问题」的上限,而不是「是否让产品更好看 / 是否更像一个世界」。OpenAI 把 Sora 写成「通向通用物理世界模拟器的有希望路径」[34];LeCun 把世界模型写成自主智能的中枢 [32][33]。梁文锋等于宣布:在他的操作定义下,这两条叙事目前是组件或旁路。后文第五节把这场路线之争摊开,不在这里判胜负。

Axis III六级阶梯 · SOTA 仪表盘
Part 4

四、六级对照:每一级的定义、前沿、吻合与张力

每级固定六块:他怎么界定 / 为何在这一级 / 2026 年最前沿做到哪 / 与他判断的吻合与张力 / 未解 / 关键出处。成熟度是本报告的评级,不是实验室自评。

4.1 第一级 · 语言模型

他怎么界定。 更前一步;CoT 用到它(摘录稿 §6.3)。相信 Scaling,尚未看到上限;卡住的是算力不是意愿(摘录稿 §6.4)。

为何在这一级。 依赖公理:没有能预测下一个 token 的基础模型,后面的思维链与工具循环无处安放。

2026 年最前沿做到哪。

  • 架构底座仍是 Transformer [4]。
  • 训练损失对模型规模、数据量、计算量呈幂律,Kaplan 等 2020 给出早期规模律 [5];Hoffmann 等 2022(Chinchilla)发现参数与 token 应近似等比例放大,此前许多模型训练不足 [6]。
  • GPT-4 技术报告用小两个到四个数量级的实验预测大模型损失与部分能力 [7]。
  • Llama 3 Herd 报告给出开放权重侧的规模化配方 [8]。
  • DeepSeek-V3 用 MLA + DeepSeekMoE,671B / 37B 激活,14.8T token,并强调训练稳定、成本可控 [2]。

成熟度:已工业部署。 争议不在「语言模型是否成立」,在「规模律是否已到墙」。梁文锋的判断是墙对硅谷和对他不是同一距离(摘录稿 §6.4)。这是视角声明,不是可证伪的已测墙。

吻合。 V3 论文本身就是「先把语言模型做成、再在其上做后训练」的实例 [2]。R1 从 V3-Base 出发 [3],依赖关系被自家论文写死。

张力。 LeCun 认为自回归 LLM 不是通向自主智能的充分路径,真正缺的是世界模型 [32][33]。若 F1 成立,第一级仍会作为组件留下,但不再是主线的第一块承重墙。

未解。 数据质量与标注成本(他称数据几乎等于模型一半,摘录稿 §12.2);推理成本随规模上升(他自己也说美国训得起极大激活参数「也用不起来……确实有点贵」——此为他的判断,不作外部核验)。

关键出处。 [2][4][5][6][7][8]。

4.2 第二级 · CoT / 思维链 / 推理时计算

他怎么界定。 「自己思考,提高智能上限」;在奥数、写程序上「已经超过最顶尖的人类」;到上限仍到不了 AGI。时间锚:「去年」(摘录稿 §6.3)。

为何在这一级。 依赖:思维链从足够大的语言模型里涌现 [9]。杠杆:同一套权重,用更多测试时计算换更高正确率,不必先把预训练再放大一个数量级 [11][13]。

2026 年最前沿做到哪。

  • Wei 等 2022:少样本思维链提示显著提高算术、常识、符号推理;PaLM 540B 在 GSM8K 上用八个思维链示例即达当时 SOTA [9]。该文把能力描述为约 100B 参数量级才显著出现的尺度现象。
  • Kojima 等 2022:仅加 “Let’s think step by step” 即可激发零样本思维链 [10]。
  • OpenAI o1(2024-09 起):用大规模强化学习训练模型使用思维链;明确写出表现随训练时计算与测试时「思考时间」共同上升,约束与预训练规模律不同 [11]。系统卡把 o1 系列定义为「先想后答」的推理模型 [12]。
  • Snell 等 2024:在固定权重上优化测试时计算,对某些任务可比扩大参数更有效 [13]。
  • DeepSeek-R1:R1-Zero 证明纯 RL 可涌现长推理;R1 用冷启动解决可读性与语言混用,推理任务与 o1-1217 可比,并开源蒸馏小模型 [3];2025 年 Nature 发表 [46]。

成熟度:已工业部署。 「去年」这个时间锚与 2024 年 o1、2025 年 R1 的公开时间线一致。

吻合。 他家的 R1 论文几乎是这条台阶的实验证明:先有 V3-Base,再有推理。他把 CoT 说成提高智能上限、但仍不是 AGI,也与 o1/R1 仍困在「一题一答、上下文有限」相符。

张力。

  • 思维链是否忠实反映内部计算,仍是开放问题;o1 系统卡把这列为监测前提 [12]。
  • 「超过最顶尖人类」被他限定在奥数与写程序。这与公开基准的强项分布一致,不能外推到含糊岗位。
  • 测试时计算把「智能」部分地买成了延迟与费用。这不否定台阶,但改变单位智能的成本曲线 [11][13]。

未解。 过程奖励与结果奖励的稳定性;语言混用与可读性(R1-Zero 的已知缺陷 [3]);把推理从竞赛题迁到含糊的真实任务。

关键出处。 [3][9][10][11][12][13][46]。

4.3 第三级 · Agent

他怎么界定。 能力范围更大、智能上限更高;要用到 CoT;走完仍替代不了员工。时间锚:「今年」。当前垂直应用「最重要的应该还是 Coding Agent」(摘录稿 §6.3、§8.3)。

为何在这一级。 依赖:ReAct 的原文命题就是把推理痕迹与行动交错,推理帮助更新计划,行动从环境取证 [14]。杠杆:可检验反馈(测试、编译器、网页状态)让模型把 CoT 用到环境上,而不是停在卷面上。

2026 年最前沿做到哪。

  • 范式。 ReAct(Yao 等,ICLR 2023)在问答与决策基准上超过只推理或只行动 [14]。Anthropic 2024-12 工程文把 agent 定义为模型动态决定工具与流程、在环境反馈上循环;并单独指出编码与「电脑使用」是两个已落地领域 [16]。
  • 软件工程尺。 SWE-bench:真实 GitHub issue → 补丁 → 隐藏测试 [15]。SWE-agent 用定制的 agent—计算机接口把全量测试集 SOTA 抬到当时的 12.5% 量级 [44]。OpenAI 2024-08 发布 SWE-bench Verified(500 题人工筛过)[19]。到 2026 年,OpenAI 公开停止用 Verified 报前沿,理由是污染使分数不再反映真实软件工程能力,并建议改报 SWE-bench Pro [20]。
  • 时间视野。 METR 2025:用人类专家耗时定义任务长度,拟合模型 50% 成功率对应的时长。原论文报告约 7 个月翻倍;当时前沿(如 o3 / Claude 3.7 Sonnet,版本因文稿而异)落在约一小时量级,数小时级任务成功率低 [18]。官方页声明静态数字会过时,以 time-horizons 页为准 [18b]。
  • 通用计算机。 OSWorld 在真实桌面应用上评测 [42];GAIA 测「对人类简单、对当时 AI 很难」的工具链问答 [41]。二者仍显示长程、含糊、多应用任务与人类差距。
  • 电脑使用。 Anthropic 将 computer use 作为 agent 的参考实现之一 [16][17]。

成熟度:窄域工业部署。 编码 agent 已是产品;通用岗位替代未被 METR 或 OSWorld 支持。

吻合。

  • 「Agent 用到 CoT」被 ReAct 与 Anthropic 的编码 agent 实践同时写明 [14][16]。
  • 「走完仍替代不了员工」与 METR「短任务近满分、长任务崩溃」同向 [18]。员工类比里的两个月,远长于已测的 50% 时间视野。
  • 他把 Coding Agent 放在垂直第一,与 Anthropic「代码可被测试检验,因此 agent 特别有效」[16] 同向,也与他自己「第一用户是实验室」同向。

张力。

  • 公开基准正在失效:SWE-bench Verified 的污染使「今年 Agent 做到哪」更难用单一分数回答 [20]。本报告因此不引用任何未注明日期与脚手架的 SWE-bench 百分比作为前沿水平
  • 替代假说 F2:时间视野继续按指数延长,可能在不解决持续学习的情况下,先覆盖一部分「小王」岗位。梁文锋把这一步的残差全部记在持续学习账上,可能过早。
  • 记忆类系统(MemGPT 把上下文当虚拟内存分页 [23];Voyager 在 Minecraft 里积累技能库 [45])说明:一部分「学习」可以被脚手架冒充。 他若坚持「下一代必须改学习问题本身」,需要把这些冒充排除在外——会上他没有做这套概念手术,只说持续学习是一个问题、会有很多技术。

未解。 高可靠性长程(80% 时间视野远短于 50% [18]);含糊需求;跨班次记忆;评测污染。

关键出处。 [14][15][16][17][18][19][20][23][41][42][44][45]。

4.4 第四级 · 持续学习(本阶梯的承重裂缝)

他怎么界定。 像人一样较长时段学习,不必每次给极强训练;与「完成任务」是同一问题;Agent 之后能看到的下一个瓶颈;全世界还没找到好方法;内部有看起来有前途的想法,都还没做通;「持续学习先做出来,通用智能可能就很容易了」;否则靠人堆数据和人力「性价比也不高」(摘录稿 §12.1)。下一代模型的定义权在这一级(摘录稿 §6.4)。

为何在这一级。 可观察瓶颈:全上下文已经够用的任务分布被 CoT+Agent 吃掉之后,剩下的是跨天、跨任务、跨岗位的适应。依赖:先有能行动的 agent,才有「从自己的轨迹里学」的数据。这与 Silver & Sutton 2025 年「高质量人类数据逼近上限,下一步必须让智能体从自身经验里学」[28] 同向。

2026 年最前沿做到哪。 必须先把几件经常被混为一谈的事切开:

机制 改不改权重 代表工作 算不算他所说的持续学习
更长上下文 / RAG / 虚拟内存 通常不改 MemGPT [23] 他的员工类比暗示「不够」:不能也不现实把一切塞进上下文
测试时记忆(序列模型内部状态) 前向过程中更新记忆模块 Titans:用神经长期记忆在测试时记忆历史,注意力当短时记忆 [26] 更接近,但仍是架构实验,不是训练默认
弹性权重巩固等正则 改,但保护旧任务 EWC,PNAS 2017 [21];灾难性干扰的经典表述见 McCloskey & Cohen 1989 [22] 问题陈述与他一致;方法未成为 LLM 主路径
自编辑后微调 SEAL:模型生成 self-edit,经 SFT 写入权重,用下游表现作 RL 奖励 [27] 方向同向;实验尺度远小于前沿预训练
嵌套优化 / 自修改架构 改(多层不同更新频率) Nested Learning + Hope,NeurIPS 2025;Google 官方博客将其标为持续学习新范式 [24][25] 问题同向;Hope 是概念验证,不是 V3/R1 级配方
经验数据闭环 改,数据来自交互 The Era of Experience [28] 问题同向;是纲领,不是已部署系统

成熟度:问题已提出、方法未通。 这与他的原话同句。本报告把 2025 年 Titans / Nested Learning / SEAL 记为「有前途的实验室方向」,不记为「已解」。

吻合。 他可能是公开场合把这个问题说得最硬的实验室负责人之一:直接用它定义下一代,而不是把它写成论文里的 future work。文献支持「未通」这一负向事实 [21][22][24][27][28]。

张力。

  • 术语混用。 「持续学习 / 学习去学习 / continuous learning」在会上未对齐。元学习(learn-to-learn)与在线适应(continual / online learning)在文献里不是同一题。本报告不替他对齐。
  • 他与提问者提到的 Recursive Improvement 未画等号(摘录稿 §12.1)。本报告把递归自改进放到第五级,避免把第四、第五级焊死。
  • Silver & Sutton 的「经验时代」更强调环境交互产生的数据 [28],不一定先要求一个已完成的数字 agent。 若他们的纲领对,持续学习与具身 / 模拟环境的耦合会比梁文锋的排序更紧,第四级就不能干净地放在具身之前。这是对公理 2 的温和压力,尚未构成 F3。

未解。 在不灾难性遗忘的前提下,把新的岗位知识写进权重或等价记忆;在模型尺度上复现 SEAL / Hope 类结果;把「两个月上手」变成可测基准(目前没有被广泛采用的「员工两个月」基准)。

关键出处。 [21][22][23][24][25][26][27][28]。

4.5 第五级 · 自我迭代(他称为奇点,随即改口为渐变)

他怎么界定。 模型能做人类能做的所有事情,能自己开发下一版本;不是突变,是较长渐变;只是习惯称为奇点。没有具身时,第一用途是迭代下一版模型(摘录稿 §6.3)。AGI 无临界点、可非线性,因为 AI 可加速 AI 研究(摘录稿 §13.1)。

为何在这一级。 杠杆公理的顶点:持续学习一旦使模型能吸收自己的实验轨迹,研究本身成为可加速对象。依赖:需要 agent(能改代码、跑实验)+ 持续学习(实验不会在下一天被忘掉)。

2026 年最前沿做到哪。

  • 理论原典。 Good 1965:超智能机器能设计更好的机器 → 智力爆炸 [29]。梁文锋保留「能设计下一版」,丢掉「爆炸」。
  • 弱形式、已部署。 AlphaEvolve:Gemini 驱动的进化编码 agent,用自动评估器筛选程序;报告包括改进 Gemini 自身训练内核(矩阵乘子问题划分加快 23%,训练时间约 −1%)、FlashAttention 内核最高约 32.5% 加速,并在后续一年进入 TPU 设计、缓存策略、Spanner 等基础设施 [30]。这是「模型改进模型的训练栈」的存在性证明,对象是算法与内核,不是完整下一世代权重。
  • 弱形式、训练配方。 R1 推理被蒸馏进 V3 后训练 [2][3]:用更强推理模型教下一个通用模型。人仍设计流水线。
  • 弱形式、自编辑。 SEAL 让模型写出自己的微调指令 [27]。尺度远小于预训练。
  • 纲领。 Silver & Sutton:人类高质量数据逼近上限,经验数据必须成为改进的主介质 [28]。

成熟度:弱形式实验室可复现;完整「自己开发下一版本」仍为概念。

吻合。 改口为渐变,与 AlphaEvolve「几天自动实验替代数周专家」[30] 这类局部加速相符,与一夜换代不符。第一用户是自己,与 AlphaEvolve 首先服务 Google 内部训练栈相符。

张力。 Good 的爆炸若在某一代突然成立,他的「无临界点」会被证伪。目前没有公开系统展示跨代的、无人值守的权重设计。Amodei《Machines of Loving Grace》把强大 AI 写成可管理的、偏渐进的社会过程 [47],与改口同侧,但那是随笔不是实验。

未解。 从「优化一个内核」到「提出并完成下一代训练配方」;从有人设定适应度函数到自己提出问题(他另有一句「再下一步它自己问问题」,摘录稿 §8.1)。

关键出处。 [2][3][27][28][29][30][47]。

4.6 第六级 · 具身智能

他怎么界定。 走进现实世界:做家务、养老;放在自我迭代之后;「对一个正常人来讲,他的需求并不是电脑」。先做「很苦」;奇点之后「不用人来做」(摘录稿 §6.3)。

为何在这一级。 杠杆:让已经能迭代软件的系统去迭代机器人。依赖:具身论文几乎都从视觉—语言模型出发,而不是从零发明智能。

2026 年最前沿做到哪。

  • 数据。 Open X-Embodiment / RT-X:跨本体机器人数据集与模型,证明混合不同机器人数据有泛化收益 [37]。
  • VLA。 RT-2 把网络视觉—语言知识迁到机器人控制 [38]。π₀:Physical Intelligence 的流匹配视觉—语言—动作模型,骨干是预训练 VLM,再加动作专家;官方博客与 arXiv 同步 [36][36b]。NVIDIA Isaac GR00T:开放的跨本体 VLA 参考栈 [40]。Gemini Robotics:把 Gemini 级模型带进物理世界,后续 1.5 强调具身推理与动作迁移 [39]。
  • 世界模型对照。 LeCun 2022:可配置的预测世界模型 + JEPA,作为自主智能蓝图 [32][33]。Sora:规模化视频生成「是通向通用物理世界模拟器的有希望路径」[34];Sora 2 仍把世界模拟能力当作训练能理解物理世界的 AI 的关键里程碑 [35]。Genie:从无标注视频学可交互环境 [43]。

成熟度:实验室可复现;家务/养老级泛化未证明。 公开系统展示的是桌面操作、厨房短技能、受控实验室,不是「任意家庭、任意老人」。

吻合。 几乎所有 2024–2026 年的通用机器人基础模型都先借用语言/视觉—语言智能,再接到动作头上 [36][38][39]。这直接支持依赖公理,即使这些实验室的投资时点比他更早进入硬件。

张力(这是整条阶梯与外部世界摩擦最大的地方)。

  • Physical Intelligence、Figure 类公司、Tesla Optimus 叙事、Gemini Robotics,都在不等「软件奇点」就收集真实机器人数据。他们的隐含判断是:物理数据的瓶颈不能靠以后的智能凭空补上,现在不采、以后也没有。这与「先具身是苦活」并不逻辑矛盾——苦活可以同时是必要的——但与「奇点之后就不用人来做」的期望冲突:若物理数据必须由人在今天采集,后人无法用纯软件智能回填。
  • 世界模型派认为,没有内部模拟器,agent 在真实世界会贵到做不成 [32][34]。梁文锋把现阶段世界模型移出主线。若 F1 成立,第六级会前移,甚至插入 Agent 与持续学习之间。
  • Moravec 悖论的经典表述是:对人类容易的感知运动,对机器很难。他的「苦活」与这一传统同向。他的新意是:把苦活推迟到自我迭代之后,让更强的智能承担数据与控制的成本。这是策略,不是对悖论的否定。

未解。 跨家庭泛化;安全与接触力控制;数据从实验室到真实住宅的分布偏移;世界模型是否必须成为具身的前置。

关键出处。 [32][33][34][35][36][36b][37][38][39][40][43]。

4.7 六级对照总表

他的原话功能 成熟度 最硬的公开证据 与他最强的吻合 与他最强的张力
1 LM 底座 已工业部署 V3 [2];规模律 [5][6] R1 从 V3-Base 出发 LLM 是否是死路 [32]
2 CoT 抬上限 已工业部署 o1 [11];R1/Nature [3][46] 「去年」与 2024–25 推理模型同期 思维链忠实度 [12]
3 Agent 扩大范围 窄域工业部署 ReAct [14];METR [18] 编码优先 [16];仍替不了员工 评测污染 [20];F2
4 持续学习 下一代定义 方法未通 EWC [21];SEAL [27];Nested Learning [24] 「全世界没做通」与文献一致 外部记忆冒充;与具身耦合 [28]
5 自我迭代 渐变而非爆炸 弱形式可复现 AlphaEvolve [30];Good 原典 [29] 改口与弱形式同向 硬起飞未被排除,只是未见
6 具身 正常人的需求 实验室可复现 π₀ [36];OXE [37] VLA 依赖 VLM 骨干 物理数据必须现在采
Axis IV路线之争、情景、产业含义
Part 5

五、路线之争:四张地图,不要站队文

5.1 对照系

路线 智能上限的操作定义 现在该烧钱的地方 与梁文锋阶梯
语言—推理—行动—学习 完整上下文下可检验任务 + 最终能改自己的权重 预训练、推理时 RL、agent 脚手架、持续学习想法 他自己
世界模型 / JEPA 在潜空间预测世界并规划 自监督视频/多模态、非生成式预测架构 他:现阶段不是上限主线
视频即模拟器 像素级(或补丁级)世界模拟 大规模视频预训练 他:视频生成是好生意、非主线
具身数据 跨本体、跨场景的真实动作成功 机器人本体、远程操作、仿真 他:后置;先做是苦活

没有一条路线被 2026-08 的公开结果「判决」。能写进研报的只有:投资时点不同,承重墙不同,证伪实验不同。

5.2 世界模型先行:LeCun 与 Sora 不是同一主张

LeCun 2022 立场论文要的是非像素级重建的联合嵌入预测架构,避免生成式视频那种对无关细节的浪费 [32][33]。OpenAI 的 Sora 说明走的是生成式、补丁级扩散 Transformer,并明确把规模化视频写成通向世界模拟器的路径 [34]。二者都叫世界模型,方法相反。

梁文锋说世界模型「含义没那么清楚」、很多东西都能叫这个名字(摘录稿 §8.1)。这句话被上述分裂直接证实。 因此「他拒绝世界模型」必须写成:「他拒绝把现阶段、定义不清的世界模型当作智能上限主线」,而不是「他拒绝一切内部模拟」。

Genie 把「从视频学可交互环境」做成另一条生成式世界模型 [43]。若这类系统开始稳定地为 agent 提供可验证的规划收益,F1 的观察窗口就会打开。目前公开材料仍把它们写成研究系统或产品预览,不是已替代 CoT+Agent 的智能上限。

5.3 Scaling 即一切

规模律文献 [5][6][7] 与 o1「训练时 + 测试时计算都升」[11] 支持「继续加计算仍有回报」。梁文锋同意 Scaling 未到墙(摘录稿 §6.4),但拒绝用 Scaling 代替持续学习来定义下一代。张力在于:若测试时计算 + 更长上下文 + 更好脚手架在 F2 意义上覆盖了员工任务,持续学习作为「下一代」定义就会被市场(不是被物理)降级为可选优化。

5.4 递归自改进硬起飞

Good 的爆炸 [29] 是第五级的理论对照,不是任何实验室的当前配方。AlphaEvolve [30] 证明局部自改进存在,也证明它今天仍嵌在人类设计的评估器与进化环里。本报告把硬起飞保留为尾部情景(Bull 的极端),不把它写成基本情景。

Part 6

六、情景与证伪:用「哪一级被解锁」而不是用年份

日历预测在这个领域的记录很差。本报告只定义状态。年份若出现,只作为 METR 原论文自己的外推,并标明其假设。

6.1 三种状态

Bear Base Bull
含义 阶梯在第四级卡住,或被 F1/F3 改道 他的依赖顺序大体被行业走出来,持续学习缓慢部分解 弱自我迭代提前,时间视野快速覆盖岗位
第四级 外部记忆与长上下文被误认为已经解完;权重级适应仍灾难性遗忘 SEAL / Nested Learning / 经验闭环之一在中等尺度可复现,开始进入后训练配方 持续学习成为「下一代」的默认训练项,他的定义被市场采用
第五级 只有蒸馏与内核优化,人仍写全部配方 AlphaEvolve 类系统成为多家实验室标配,覆盖训练栈局部 出现跨代、少人值守的训练配方搜索;仍渐变,不是 Good 爆炸
第六级 机器人停留在演示;或反过来,具身派用物理数据反超软件智能(F3) VLA 继续吃 VLM 红利,家务级产品仍窄 自我迭代开始设计下一版本体;苦活明显减轻
对「编码 agent」 评测污染 + 可靠性平台期,收入在辅助编码停住 继续作为最可检验的窄域,时间视野从小时向工作日爬 [18] 编码 agent 变成实验室操作系统,自我迭代的手

6.2 可观察路标(公开、可核验)

  1. 论文级: 是否出现与 R1 同重量的「持续学习 / 经验闭环」技术报告,含失败案例与遗忘曲线,而不是只有针在稻草堆里检索。
  2. 产品级: 同一权重(或同一持续记忆)是否能在不重训的前提下,跨周完成同一代码库 / 同一岗位的新任务,并保持旧任务。
  3. 评测级: METR 80% 时间视野;OSWorld 类桌面任务;以及——目前还没有的——「两个月入职」基准。
  4. 评测诚信: 是否改用抗污染基准(OpenAI 已公开离开 SWE-bench Verified [20])。
  5. 自我迭代: 是否有第二家实验室发表「本系统改进了本系统的训练成本 / 算法」,并给出可复核的评估器。
  6. 具身: 跨家庭、跨本体、非遥操作的成功率,而不是实验室厨房的剪辑。

6.3 METR 外推怎么用、怎么不用

METR 原论文写:若 2019–2025 趋势外推,约五年内系统可能自动完成许多当前需人类一个月的软件任务;并强调外部效度与趋势变化是主要不确定性 [18]。本报告引用这条外推作为文献中的外推,不把它改写成我们的预测。它直接服务于 F2:若月级软件任务在高可靠性下被解开,梁文锋员工类比里的「必须持续学习」压力会下降,但「必须持续学习才能叫下一代」仍可以作为一个研究定义存在——只是市场可能不再付钱给这个定义。

Part 7

七、产业含义(逻辑含义,不是价格)

本节把阶梯翻译成「价值可能沉淀在哪」,不写买卖建议,不给倍数。

7.1 编码 agent:当前唯一既可检验又贴近自我迭代的窄域

Anthropic 把编码列为 agent 最有效的领域之一,理由是测试可自动打分 [16]。梁文锋把 Coding Agent 放在垂直第一(摘录稿 §8.3)。二者独立、同向。产业含义:

  • 在持续学习未通之前,可检验闭环(代码、数学、部分科研)会继续吸收推理时计算与 agent 脚手架的预算。
  • 评测污染 [20] 意味着买方不能再用单一公开榜当验收;价值转向私有、抗污染、带成本约束的内部基准。本仓库的《Agent 评测与基准测试》把「分数最高 ≈ 最贵」写进了 L3 的读法,与此一致。

7.2 持续学习一旦做通:研究效率飞轮,而不是先做 C 端超级应用

他的第一用户是自己。若第四级做通,首先加速的是下一张权重,不是广告与电商(后两者被他明确判为现阶段浪费时间,摘录稿 §8.1)。产业含义:

  • 能把「岗位记忆」写进权重或等价记忆的实验室,会拉开与「每次会话从零解释小王是谁」的产品差距。
  • 在那之前,外部记忆(MemGPT 类 [23])与更长上下文会作为过渡性租金存在:它们冒充持续学习,也能收钱,但按他的定义不算下一代。

7.3 自我迭代的弱形式:训练栈软件,不是「AI 公司股票的奇点条款」

AlphaEvolve 类系统把价值放进编译器、内核、调度、芯片设计工具链 [30]。这是基础设施软件租金,不是一夜之间的需求侧奇点。与他的改口一致:渐变、可非线性,但不是爆炸条款。

7.4 具身后置对机器人 / 世界模型资产的含义

逻辑上有两种读法,必须并列,不能只写一种:

  • 读法 A(支持后置)。 今天的 VLA 已经在用 VLM 骨干 [36][38][39]。软件智能每抬一级,同一本体的数据效率上升。过早把资本锁进单一本体,可能在下一版智能到来时贬值。
  • 读法 B(反对后置)。 真实世界数据有时间上的不可逆:现在不采,以后没有 2026 年的家庭分布。世界模型若必须靠视频与交互环境预训练 [34][43],则视频生成与仿真不是旁路,是第六级的前置资本开支。

本报告不在 A/B 之间选边。投资上这意味着:机器人与世界模型资产的估值,取决于你相信物理数据是否可被未来更强智能回填。 梁文锋的公开判断接近 A;LeCun / Sora / 具身派接近 B。这是第二节核心辩论的资产版本。

7.5 多模态与搜索:组件定价

他把多模态比作搜索:C 端重要,不是上限主线,但仍会做(摘录稿 §6.4)。产业含义:多模态能力会被打包进产品,但不应该被当成「下一代模型」的充分条件。按他的定义,下一代的充分条件是持续学习。

Part 8

八、本报告可能错在哪里

  1. 一级材料是 ASR 文字稿,不是经讲者审定的书面声明。专有名词与数字以录音为准(摘录稿第十五节)。本报告有意避开那些数字。
  2. 「揣测」若写得过满。 第三节的加框推断可能过度解释「第一用户是自己」。否证方式:若 DeepSeek 随后把主要研究预算公开转到 C 端超级应用,该推断失效。
  3. 成熟度是横截面。 2026-08 之后的一篇论文就可能把第四级从「方法未通」改成「实验室可复现」。仪表盘必须随文献更新,不能当永久评级。
  4. 未覆盖闭源内部。 OpenAI、Google、Anthropic 的持续学习内部进展若强于论文,本报告会系统性低估第四、第五级。我们只对公开证据负责。
  5. 编码偏见。 公开基准与 METR 任务偏软件。若真实经济中的「员工」主要是身体与社交劳动,第六级的权重被我们和梁文锋一起低估。
Part 9

九、附录 A · 术语表(不强行合并)

用语 本报告处理
持续学习 / continual learning 他会上的中心词:较长时段学习、不必每次强训练。文献里常指克服灾难性遗忘的序列任务学习 [21][22]
学习去学习 文稿混用。文献里常近元学习。本报告分列,不与持续学习划等号
recursive improvement / 递归自改进 提问者并提;他未定义为同一术语。本报告放入第五级对照,不并入第四级
奇点 他先用后改口为渐变。本报告把改口当理论判断
Agent 采用 Anthropic 的工作定义:模型动态决定工具与流程 [16];与「预写死的 workflow」区分
世界模型 他指出含义不清。本报告在第五、六节拆成 JEPA 式与生成式两类
具身智能 他:家务、养老、走进现实。文献:VLA、跨本体、世界模型仿真,范围更杂
下一代模型 他的操作定义:必须有持续学习。不是参数量或多模态
Part 10

十、附录 B · 参考文献

下表是本报告全部引用。P5 不用于支撑技术结论。 URL 均为 2026-08-13 检索时可解析的公开页;OpenReview 的 PDF 直链可能被反机器人页拦截,故同时给 forum 与 Meta 官方介绍。

# 文献 类型 / 日期 证据级 支撑的判断
1 本仓库《梁文锋投资者交流会 · 观点提炼》,材料为 2026-05-20 交流会 ASR 文字稿 内部结构化摘录,2026-07-16 整理 P1(转写风险见该稿) 他的阶梯、三条公理、改口、员工类比、编码优先、持续学习未通
2 DeepSeek-AI. DeepSeek-V3 Technical Report. arXiv:2412.19437. https://arxiv.org/abs/2412.19437 技术报告,2024-12 P1 语言模型台阶;671B/37B;R1 蒸馏进 V3 的后训练叙述
3 DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948. https://arxiv.org/abs/2501.12948 技术报告,2025-01 P1 CoT 台阶;从 V3-Base 出发;与 o1-1217 可比
4 Vaswani, A. et al. Attention Is All You Need. NeurIPS 2017. https://arxiv.org/abs/1706.03762 会议论文,2017 P2 Transformer 底座
5 Kaplan, J. et al. Scaling Laws for Neural Language Models. arXiv:2001.08361. https://arxiv.org/abs/2001.08361 ;OpenAI 介绍 https://openai.com/index/scaling-laws-for-neural-language-models/ 2020-01 P2 / P3 规模律;他相信 Scaling 的文献背景
6 Hoffmann, J. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556. https://arxiv.org/abs/2203.15556 2022-03 P2 Chinchilla:参数与 token 等比例
7 OpenAI. GPT-4 Technical Report. arXiv:2303.08774. https://arxiv.org/abs/2303.08774 ;https://cdn.openai.com/papers/gpt-4.pdf 2023-03 P3 用小模型预测大模型损失
8 Grattafiori, A. et al. The Llama 3 Herd of Models. arXiv:2407.21783. https://arxiv.org/abs/2407.21783 2024-07 P3 开放权重侧规模化配方
9 Wei, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022. https://arxiv.org/abs/2201.11903 2022 P2 CoT 原论文;依赖足够大的 LM
10 Kojima, T. et al. Large Language Models are Zero-Shot Reasoners. NeurIPS 2022. https://arxiv.org/abs/2205.11916 2022 P2 零样本思维链
11 OpenAI. Learning to reason with LLMs. https://openai.com/index/learning-to-reason-with-llms/ 官方博客,2024-09 P3 o1;训练时与测试时计算共同上升
12 OpenAI. OpenAI o1 System Card. https://arxiv.org/abs/2412.16720 ;https://cdn.openai.com/o1-system-card-20241205.pdf 2024-12 P3 思维链监测;先想后答
13 Snell, C. et al. Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314. https://arxiv.org/abs/2408.03314 2024-08 P2 测试时计算 vs 扩参
14 Yao, S. et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023. https://arxiv.org/abs/2210.03629 2022/23 P2 Agent 用到 CoT 的原论文
15 Jimenez, C. E. et al. SWE-bench: Can Language Models Resolve Real-World GitHub Issues? ICLR 2024. https://arxiv.org/abs/2310.06770 2024 P2 真实软件工程基准
16 Anthropic. Building effective agents. https://www.anthropic.com/engineering/building-effective-agents 工程博客,2024-12-19 P3 agent vs workflow;编码与 computer use
17 Anthropic. 3.5 models and computer use(computer use 发布说明). https://www.anthropic.com/news/3-5-models-and-computer-use 2024-10 P3 电脑使用作为 agent 落地
18 Kwa, T. et al. / METR. Measuring AI Ability to Complete Long Tasks. arXiv:2503.14499. https://arxiv.org/abs/2503.14499 2025-03 P2 时间视野;员工类比的定量对照
18b METR. Measuring AI Ability to Complete Long Software Tasks(博客,声明静态数字可能过时). https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ ;更新页 https://metr.org/time-horizons/ 2025-03 起 P3 约 7 个月翻倍的原表述;以更新页为准
19 OpenAI. Introducing SWE-bench Verified. https://openai.com/index/introducing-swe-bench-verified/ 2024-08 P3 500 题人工筛选
20 OpenAI. Why SWE-bench Verified no longer measures frontier coding capabilities. https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/ 2026 P3 污染;停止用 Verified 报前沿
21 Kirkpatrick, J. et al. Overcoming catastrophic forgetting in neural networks. PNAS 2017. https://doi.org/10.1073/pnas.1611835114 2017 P2 EWC;持续学习经典方法
22 McCloskey, M. & Cohen, N. J. Catastrophic interference in connectionist networks: The sequential learning problem. Psychology of Learning and Motivation 24:109–165 (1989). https://doi.org/10.1016/S0079-7421(08)60536-8 1989 P2 灾难性干扰的问题陈述
23 Packer, C. et al. MemGPT: Towards LLMs as Operating Systems. arXiv:2310.08560. https://arxiv.org/abs/2310.08560 2023-10 P2 外部记忆冒充「学习」
24 Behrouz, A. et al. Nested Learning: The Illusion of Deep Learning Architectures. NeurIPS 2025. https://arxiv.org/abs/2512.24695 2025 P2 持续学习新范式;Hope
25 Behrouz, A. & Mirrokni, V. Introducing Nested Learning. Google Research Blog. https://research.google/blog/introducing-nested-learning-a-new-ml-paradigm-for-continual-learning/ 2025-11 P3 官方将 NL 标为持续学习
26 Behrouz, A., Zhong, P. & Mirrokni, V. Titans: Learning to Memorize at Test Time. arXiv:2501.00663. https://arxiv.org/abs/2501.00663 2025-01 P2 测试时长期记忆
27 Zweiger, A. et al. Self-Adapting Language Models (SEAL). NeurIPS 2025. https://arxiv.org/abs/2506.10943 2025 P2 自编辑写入权重
28 Silver, D. & Sutton, R. S. Welcome to the Era of Experience. 将收入 Designing an Intelligence(MIT Press). 作者页 https://davidstarsilver.wordpress.com/publications/ 2025 P2/P3(章节预印,以作者页著录为准) 经验数据取代人类数据上限;与第四、五级同向
29 Good, I. J. Speculations Concerning the First Ultraintelligent Machine. Advances in Computers 6:31–88 (1965). https://doi.org/10.1016/S0065-2458(08)60418-0 1965 P2 「智力爆炸」原典;与改口对照
30 DeepMind. AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms. https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/ ;论文 https://arxiv.org/abs/2506.13131 ;后续影响 https://deepmind.google/blog/alphaevolve-impact/ 2025–2026 P3 / P2 弱形式自我迭代;改进 Gemini 训练栈
31 Sutton, R. The Bitter Lesson. 2019-03-13. http://www.incompleteideas.net/IncIdeas/BitterLesson.html 随笔 P3 通用方法吃计算;与 Scaling 同向
32 LeCun, Y. A Path Towards Autonomous Machine Intelligence (v0.9.2). OpenReview. https://openreview.net/forum?id=BZ5a1r-kVsf 2022-06 P2(立场论文,非传统评审) 世界模型蓝图
33 Meta AI. Yann LeCun on a vision to make AI systems learn and reason like animals and humans. https://ai.meta.com/blog/yann-lecun-advances-in-ai-research/ 2022-02 P3 世界模型主张的官方介绍
34 OpenAI. Video generation models as world simulators. https://openai.com/index/video-generation-models-as-world-simulators/ 2024-02 P3 Sora;视频生成作为世界模拟路径——他移出主线的对照
35 OpenAI. Sora 2 is here. https://openai.com/index/sora-2/ 产品博客 P3 仍把世界模拟当物理理解的里程碑
36 Black, K. et al. (Physical Intelligence). π₀: A Vision-Language-Action Flow Model for General Robot Control. arXiv:2410.24164. https://arxiv.org/abs/2410.24164 2024-10 P2 具身;VLM 骨干——支持「后一步用前一步」
36b Physical Intelligence. π₀ 博客. https://www.physicalintelligence.company/blog/pi0 官方博客,与 [36] 同期 P3 与 [36] 对应的官方说明
37 Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv:2310.08864. https://arxiv.org/abs/2310.08864 2023-10 P2 跨本体数据
38 Brohan, A. et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818. https://arxiv.org/abs/2307.15818 2023 P2 VLA 范式
39 Google DeepMind. Gemini Robotics 相关论文 arXiv:2503.20020. https://arxiv.org/abs/2503.20020 ;介绍 https://deepmind.google/discover/blog/gemini-robotics-brings-ai-into-the-physical-world/ 2025-03 P2 / P3 把前沿模型接入物理世界
40 NVIDIA. Isaac GR00T. https://developer.nvidia.com/isaac/gr00t ;代码 https://github.com/NVIDIA/Isaac-GR00T 产品/开源栈 P3 开放跨本体 VLA
41 Mialon, G. et al. GAIA: a benchmark for General AI Assistants. arXiv:2311.12983. https://arxiv.org/abs/2311.12983 2023 P2 通用工具链任务仍难
42 Xie, T. et al. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments. arXiv:2404.07972. https://arxiv.org/abs/2404.07972 2024 P2 真实电脑环境
43 Bruce, J. et al. Genie: Generative Interactive Environments. ICML 2024. https://arxiv.org/abs/2402.15391 2024 P2 可交互世界模型
44 Yang, J. et al. SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering. arXiv:2405.15793. https://arxiv.org/abs/2405.15793 2024 P2 ACI 抬高 issue 解决率
45 Wang, G. et al. Voyager: An Open-Ended Embodied Agent with Large Language Models. arXiv:2305.16291. https://arxiv.org/abs/2305.16291 2023 P2 技能库式「学习」;脚手架冒充
46 Guo, D. et al. DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning. Nature 645, 633–638 (2025). https://doi.org/10.1038/s41586-025-09422-z 2025 P2 R1 的同行评审版本
47 Amodei, D. Machines of Loving Grace. https://darioamodei.com/machines-of-loving-grace 2024-10 P3(随笔) 渐进、可管理的强大 AI 叙事;与改口同侧,不作实验证据
48 DeepMind. Enabling Continual Learning in Neural Networks. https://deepmind.google/blog/enabling-continual-learning-in-neural-networks/ 2017 P3 EWC 官方介绍
49 Silver, D. et al. Mastering the game of Go with deep neural networks and tree search. Nature 529, 484–489 (2016). https://doi.org/10.1038/nature16961 2016 P2 他用来论证「可超越已说出的人类知识」的 AlphaGo 依据(摘录稿 §12.2)

检索说明

  • 未列入而计划里点过名、但本报告最终不用来支撑结论的材料:无法稳定解析全文的预印本镜像、二手自媒体对内部卡量的转述、交流会 ASR 中的产能数字。
  • [28] 的 PDF 直链在撰写日未能从一处公开存储稳定取回,故以作者出版物目录的著录为准,不伪造页码引文。
  • [32] 的 PDF 直链在撰写日遇到 OpenReview 反机器人页,故同时引用 forum 与 Meta 官方介绍 [33],不引用未读到的页码。

本报告不替代录音,不替代原论文。若当事人随后发表书面技术路线,以书面为准。