报告日:2026-08-13。
体裁:行业主题深度(industry primer + thematic deep dive)。不是个股覆盖,不给目标价,不写买卖建议。
一级材料:2026-05-20 梁文锋投资者交流会录音文字稿(音频deepseek 0520.m4a,约 3 小时 44 分钟;整理 2026-07-16,ASR,说话人未切分)。结构化摘录见同目录 《梁文锋投资者交流会 · 观点提炼》(下称「摘录稿」)。数字与专有名词的 ASR 风险继承摘录稿第十五节,本报告不把交流会里的卡量、利润倍数当作已审计事实。
对照材料:DeepSeek 已发表技术报告、同行评审论文、实验室官方博客与产品说明。
读法:凡写「他怎么说」只指向摘录稿;凡写「本报告判断 / 推断」均加框或标明,不回写到他头上。
一、封面纪律:材料、方法、证据分级
1.1 这份报告回答什么问题
摘录稿已经把梁文锋本人的判断抽干净了。本报告只追三个问题:
- 他为什么把智能主线排成「语言模型 → CoT → Agent → 持续学习 → 渐变的自我迭代(他先称奇点、随即改口)→ 具身智能」?会上给出的理由是否自洽?
- 2026 年 8 月能核验的最前沿研究,把这条阶梯的每一级推到了哪一档成熟度?
- 哪些公开证据会支持、修正或打穿这条排序?对产业而言,价值更可能沉淀在哪一级?
本报告不重写整场交流会,不讨论开源定价与融资条款。那些属于摘录稿的范围。
1.2 与摘录稿的分工
| 摘录稿 | 本报告 | |
|---|---|---|
| 任务 | 他说了什么、拿什么当理由 | 行业证据怎么说、哪些是推断、什么会证伪 |
| 纪律 | 不补心理动机 | 推断必须单独标注 |
| 数字 | 交流会数字照录并标 ASR | 不用交流会产能数字作外部事实 |
| 读者 | 要贴着录音读的人 | 要把这条阶梯放到全球技术地图上的人 |
1.3 投行方法(实际执行,不只写在封面上)
对标主题深度研报的六个模块,而不是卖方覆盖模板里的目标价页。
| 模块 | 本报告落地 |
|---|---|
| One-pager | 第二节:辩论、判断、三条证伪条件 |
| 证据分级 | P1 当事人原文 / 本实验室论文;P2 同行评审或可核验技术报告;P3 官方博客与产品说明;P4 可信二手对公开声明的转述;P5 媒体与传闻(只用于时间线,不支撑技术结论) |
| 声称三分栏 | 「他怎么说 / 本报告推断 / 文献怎么说」分栏,不混写 |
| 成熟度 | 已工业部署 / 窄域工业部署 / 实验室可复现 / 问题已提出方法未通 / 概念 |
| 对照系 | OpenAI、Anthropic、Google DeepMind、Meta / LeCun、Physical Intelligence、NVIDIA 具身栈 |
| 情景与证伪 | 用「哪一级被解锁」定义 Base / Bull / Bear,不用日历预言充作结论 |
严格禁止:把「业界共识」写成无出处判断;把推断写成「梁文锋认为」;用交流会里的卡量交叉验证外部财报。
1.4 证据分级符号
后文每条关键判断尽量落到参考文献编号。编号与附录对照表一一对应,附录给出作者、年份、venue、URL/DOI、证据级、支撑哪条判断。核不到标题与 URL 的文献,正文不引用。
二、投资人一页纸
2.1 核心辩论
当前前沿实验室并不共用一张路线图。至少四条叙事在抢「智能上限」的定义权:
| 叙事 | 代表出处 | 智能上限主要靠什么抬 |
|---|---|---|
| 语言—推理—行动—学习(梁文锋) | 摘录稿 §6.3、§12.1 | 先把可检验的符号智能做完,再用它开发下一版,最后才进物理世界 |
| 世界模型先行 | LeCun 2022 立场论文与 Meta 预告 [32][33] | 在潜空间里预测世界,而不是把下一个 token 当作主目标 |
| 视频 / 生成即模拟 | OpenAI Sora 技术说明 [34] | 规模化视频生成是通向物理世界模拟器的路径 |
| 具身数据先行 | Physical Intelligence π₀ [36]、Open X-Embodiment [37]、Gemini Robotics [39] | 跨本体机器人数据 + 视觉—语言—动作模型,现在就把身体接上 |
梁文锋把后三条里的视频生成、现阶段世界模型明确移出「智能主线」:商业上可以是好生意,但「跟智能的上限也没有太大的关系」(摘录稿 §8.1)。这不是审美偏好,是他对什么叫抬智能上限的操作定义。
2.2 本报告判断(不是他的原话)
本报告判断。 这条阶梯在依赖关系上成立:后面几级的已发表系统,几乎都站在语言模型(以及越来越常见的视觉—语言模型)肩膀上。最大的未解关口是他所说的「持续学习」——全球实验室都承认灾难性遗忘与「权重冻结的 LLM」之间的裂缝,但还没有一个被广泛复现、可规模化部署的解法。他把「奇点」改口为渐变,与 I. J. Good 1965 年的「智力爆炸」硬起飞叙事 [29] 在机制上决裂,与「用模型改进模型的局部环节」这类已出现的弱形式 [30] 更接近。具身被后置,是杠杆逻辑(让更强的智能去造机器人),不是否定物理世界有需求。
三句收口:
- 依赖成立。 CoT 论文明确建立在足够大的语言模型上 [9];ReAct 把思维链与行动交错 [14];π₀ 等具身模型以预训练视觉—语言模型为骨干 [36]。后一步用前一步,不是修辞。
- 瓶颈判断与公开证据同向,替代假说也成立。 「给全上下文已经超过人、仍替代不了员工」与 METR 的时间视野结果同向:前沿 agent 在短任务上接近满分,在数小时级任务上成功率骤降 [18]。但「缺的是权重可更新的持续学习」并不是唯一解释——缺的也可能是更长的可靠工具链,而不必改权重。
- 排序是资源约束下的最轻松路线,不是唯一物理可能。 他给出的排序理由是「后面的技术可用前面的技术来开发」「先具身是苦活」(摘录稿 §6.3)。这在工程上自洽,不能推出「现在做机器人的实验室走错了」;只能推出:在算力紧、要以自身为第一用户的实验室里,这条路径的期望加班更少。
2.3 三条证伪条件(What would change our mind)
若下列任一事件以可复现方式出现,本报告对这条阶梯的权重必须下调:
| # | 证伪条件 | 观察路标 |
|---|---|---|
| F1 | 世界模型或视频生成单独把智能上限明显抬过语言—推理栈,且不依赖后者作骨干 | 在无强语言模型骨干的设定下,世界模型在可检验推理 / 规划基准上稳定超过同期 CoT+Agent 系统 |
| F2 | 不更新权重、只靠上下文与工具,agent 即可完成「约两个月在岗学习」级任务 | METR 类时间视野在高可靠性阈值(如 80%)上达到周—月级 [18],并且在真实企业岗位上可复现,而不出现灾难性遗忘式的串任务崩溃 |
| F3 | 先具身、后符号的实验室,用明显更少的语言智能做出可泛化家务 / 养老级系统 | 跨家庭、跨本体的成功不依赖大规模 VLM/LLM 骨干,且数据效率高于「先软件智能再机器人」的对照 |
这三条在 2026-08 均未被满足。F2 是最近的竞争假说;F1、F3 与公开论文方向相反。
2.4 成熟度仪表盘(截至 2026-08)
flowchart LR L1["1 语言模型
已工业部署"] --> L2["2 CoT / 推理时计算
已工业部署"] L2 --> L3["3 Agent
窄域工业部署"] L3 --> L4["4 持续学习
方法未通"] L4 --> L5["5 自我迭代
弱形式可复现"] L5 --> L6["6 具身智能
实验室可复现"]
| 级 | 他的时间锚(摘录稿) | 本报告成熟度 | 一句话证据 |
|---|---|---|---|
| 语言模型 | 更前一步 | 已工业部署 | Transformer [4] + 规模律 [5][6];DeepSeek-V3 为 671B/37B 激活 MoE [2] |
| CoT | 「去年」 | 已工业部署 | o1 用 RL 训练思维链 [11][12];DeepSeek-R1 用 RL 激励推理并发表于 Nature [3][46] |
| Agent | 「今年」 | 窄域工业部署 | 编码 agent 已进产品;SWE-bench 曾是主尺,OpenAI 于 2026 年因污染停止用 Verified 报前沿 [20];通用桌面/岗位仍远 |
| 持续学习 | 「下一个瓶颈」 | 问题已提出、方法未通 | EWC 2017 仍是经典补丁 [21];Titans / Nested Learning / SEAL 是 2025 年新架构,尚未成为训练默认 [24][26][27] |
| 自我迭代 | 「奇点,但是渐变」 | 弱形式实验室可复现 | AlphaEvolve 改进 Gemini 训练内核并进入 Google 基础设施 [30];全自动「下一版模型」未出现 |
| 具身 | 自我迭代之后 | 实验室可复现 | π₀、GR00T、Gemini Robotics 均公开 [36][40][39];家务/养老级泛化未证明 |
三、认知还原:他为什么这样排,而不是另一种排
本节只做两件事:把他会上给出的理由收成一条因果链;再把本报告的推断单独加框。不把后者写进他的嘴里。
3.1 会上给出的三条排序公理
摘录稿 §6.3、§12.1 里,他反复使用的不是一张产品路线图,是三条公理:
| 公理 | 原话压缩 | 它排除什么 |
|---|---|---|
| 依赖 | 后一步用到前一步:CoT 用语言模型,Agent 用 CoT | 「跳过推理、直接上 agent / 机器人」作为主线 |
| 杠杆 | 「后面的技术可用前面的技术来开发」;「奇点之后再做具身,就不用人来做了」;先具身「是一个很苦的活」 | 把机器人本体研发当成当前最高杠杆 |
| 可观察瓶颈 | 问题说清、上下文给全,「已经超过人类」;人有几十年上下文,招一个员工大约两个月就能上手;AI 没有这两月学习,替代不了员工。Agent 走完仍到不了 AGI。「必须要有持续学习的能力,它才能叫下一代模型。」 | 把多模态、搜索、视频生成、现阶段世界模型当成智能上限主线 |
这三条足够推出他的排序,不需要额外的性格分析。
3.2 实验室中心的 AGI 定义
摘录稿写得很清楚:没有具身时,他对 AGI 的希望是「能帮我迭代下一版模型」;有具身后,希望它迭代下一版具身、做下一版机器人。持续学习的第一用户是他们自己:「我们做的模型,第一目标不是大家用得好用,而是我们自己用得好用。」(摘录稿 §12.1)
推断(本报告,非梁文锋原话)。 这是一个以研究生产率为产品的 AGI 定义。消费侧的「做家务、养老」被明确承认是正常人的需求,但被放在自我迭代之后。因此他的阶梯看起来「不像 C 端产品经理会画的图」,而像「一个要把下一张权重训练出来的实验室主任会画的图」。编码 agent 被放在当前垂直应用第一(摘录稿 §8.3),与这个定义同构:写代码、改内核、跑实验,是「帮我迭代下一版模型」最近的任务分布。
公开对照:Google DeepMind 的 AlphaEvolve 把「用编码 agent 改进算法与训练栈」做成了可部署系统,并报告将 Gemini 架构中一个矩阵乘内核加快 23%、训练时间降约 1% [30]。这不是梁文锋引用过的材料,但它表明:「第一用户是自己」在别的顶尖实验室也已经从口号变成内部工具。
3.3 员工类比:他把「完成任务」收成「持续学习」
他用来卡住 Agent 的,不是某一道奥数题,是岗位:
- 人:叫「小王」过来就知道小王是谁;大约两个月熟悉环境。
- 模型:每次必须被告知小王是谁、职务、怎么找、注意什么。「你不可能给他所有的上下文,也不现实。」(摘录稿 §6.2)
因此「持续学习」在他那里不是一项点名的算法,而是「像人一样较长时段学习、不必每次给极强训练」。他同时说「可能不是一项技术,它是一个问题」,「现在全世界都还没有找到好的方法」(摘录稿 §12.1)。文稿里「持续学习」与「学习去学习」混用,摘录稿不强行合并;本报告同样分列(见附录术语表)。
推断。 他把两个在文献里分开的问题焊在了一起:(a)任务级 agent 失败(工具链、记忆、可靠性);(b)权重级持续学习失败(新任务冲掉旧任务)。焊点是员工类比。若(a)能被更长上下文、外部记忆、更好的 agent 脚手架单独解掉,他的「下一代 = 必须有持续学习」就会显得过严。这正是第二节 F2。
3.4 「最轻松的路线图」:算力约束下的研究策略,不是宇宙唯一解
他给出的排序还有一层组织理由:这条路「可以不用加班」;持续学习研究「不消耗卡,只需要很少的卡,他需要的是想法」,内部叫「摸奖」(摘录稿 §12.1)。Scaling 才烧卡,模型大小「按资源算出来」(摘录稿 §6.4)。
推断。 在算力相对美国更紧的约束下,把未解问题定义成「想法密集、卡不密集」,同时把已解问题(预训练、推理时计算)交给能买到的卡,是理性的研究组合——它解释了为什么视频生成这种「好生意」仍被移出主线:它既烧卡,又(在他看来)不抬智能上限。Sutton 2019 年的 The Bitter Lesson 说,最终赢的是能吃计算的通用方法 [31]。梁文锋同时相信 Scaling(吃计算)和持续学习这个尚未被规模化的问题(吃想法)。二者不矛盾:Scaling 还没撞墙,墙以外的那一级被他命名为持续学习。
3.5 改口「奇点 → 渐变」:这是有理论含量的判断
I. J. Good 1965 年的操作定义是:超智能机器能够设计更好的机器,于是「毫无疑问会有一次智力爆炸」,人的智力被甩在后面;「第一台超智能机器是人类需要做的最后一项发明」[29]。梁文锋先借用「奇点」这个习惯叫法,立即修正:不是突变,是较长渐变;AGI「没有临界点,但是非线性」,因为「AI 可以加速 AI 的研究」(摘录稿 §6.3、§13.1)。
对齐与决裂可以写成一行:
| Good 1965 [29] | 梁文锋 2026-05(摘录稿) | |
|---|---|---|
| 内容 | 机器能设计更好的机器 | 模型能做人类能做的事,能开发下一版本 |
| 动力学 | 智力爆炸 | 较长渐变;无临界点,可非线性 |
| 人的位置 | 被甩在后面 | 至少在持续学习做通之前,人仍是研究主体;AI「还不是自主地工作,还是只是跟人搭配」 |
推断。 这次改口使他更接近 Silver 与 Sutton 2025 年「经验时代」的渐进口径——用智能体与环境交互产生的数据持续改进,而不是一次冻结权重后的相变 [28]——而不是更接近 Good 的爆炸。公开文献里已经出现弱形式的「用模型改进模型」:R1 的推理能力被蒸馏回 V3 [2][3];AlphaEvolve 优化 Gemini 自己的训练栈 [30]。这些是渐变的证据,不是爆炸的证据。
3.6 DeepSeek 已发表轨迹与阶梯是否同构
只看公开论文,不看交流会产能数字:
| 台阶 | 公开物证 | 证据级 |
|---|---|---|
| 语言模型 | DeepSeek-V3:671B 总参、每 token 37B 激活;14.8T token 预训练;全文训练 2.788M H800 GPU 小时 [2] | P1 |
| CoT / 推理 | DeepSeek-R1-Zero:无 SFT 先做大规模 RL,推理行为涌现;DeepSeek-R1 加冷启动与多阶段,推理任务与 OpenAI-o1-1217 可比;Nature 正式发表 [3][46] | P1 / P2 |
| Agent | 交流会称「今年」;公开论文侧尚未有与 R1 同级的「DeepSeek Agent 技术报告」。本仓库对 deepseek-harness 的源码分析只能证明工程栈存在,不能代替实验室官方论文 | 会上 P1;工程栈不升格为论文 P1 |
| 持续学习 | 他明确说全世界还没做通、内部想法未做通(摘录稿 §12.1) | P1(否定性声明) |
同构的部分:V3 → R1 就是「语言模型 → CoT」的一次公开演示,而且 R1 的训练明确从 V3-Base 出发 [3]。尚未同构的部分:Agent 与持续学习还停在会上的时间锚,没有同等重量的论文。本报告不把「今年做 Agent」写成已经发表的事实。
3.7 主线外不做:视频、世界模型、多模态的位置
摘录稿 §8.1:3D / 视频生成「跟智能主线没有太大关系」,Sora 之后大小公司都做、小公司后来砍掉;世界模型「现在跟智能的上限也没有太大的关系」,且词义「没那么清楚」。多模态对 C 端重要,对智能上限「是一个组件……跟搜索一样」;V4 起仍做原生多模态(摘录稿 §6.4)。
推断。 他用的判别标准是:这件事是否提高「在完整上下文里解决问题」的上限,而不是「是否让产品更好看 / 是否更像一个世界」。OpenAI 把 Sora 写成「通向通用物理世界模拟器的有希望路径」[34];LeCun 把世界模型写成自主智能的中枢 [32][33]。梁文锋等于宣布:在他的操作定义下,这两条叙事目前是组件或旁路。后文第五节把这场路线之争摊开,不在这里判胜负。
四、六级对照:每一级的定义、前沿、吻合与张力
每级固定六块:他怎么界定 / 为何在这一级 / 2026 年最前沿做到哪 / 与他判断的吻合与张力 / 未解 / 关键出处。成熟度是本报告的评级,不是实验室自评。
4.1 第一级 · 语言模型
他怎么界定。 更前一步;CoT 用到它(摘录稿 §6.3)。相信 Scaling,尚未看到上限;卡住的是算力不是意愿(摘录稿 §6.4)。
为何在这一级。 依赖公理:没有能预测下一个 token 的基础模型,后面的思维链与工具循环无处安放。
2026 年最前沿做到哪。
- 架构底座仍是 Transformer [4]。
- 训练损失对模型规模、数据量、计算量呈幂律,Kaplan 等 2020 给出早期规模律 [5];Hoffmann 等 2022(Chinchilla)发现参数与 token 应近似等比例放大,此前许多模型训练不足 [6]。
- GPT-4 技术报告用小两个到四个数量级的实验预测大模型损失与部分能力 [7]。
- Llama 3 Herd 报告给出开放权重侧的规模化配方 [8]。
- DeepSeek-V3 用 MLA + DeepSeekMoE,671B / 37B 激活,14.8T token,并强调训练稳定、成本可控 [2]。
成熟度:已工业部署。 争议不在「语言模型是否成立」,在「规模律是否已到墙」。梁文锋的判断是墙对硅谷和对他不是同一距离(摘录稿 §6.4)。这是视角声明,不是可证伪的已测墙。
吻合。 V3 论文本身就是「先把语言模型做成、再在其上做后训练」的实例 [2]。R1 从 V3-Base 出发 [3],依赖关系被自家论文写死。
张力。 LeCun 认为自回归 LLM 不是通向自主智能的充分路径,真正缺的是世界模型 [32][33]。若 F1 成立,第一级仍会作为组件留下,但不再是主线的第一块承重墙。
未解。 数据质量与标注成本(他称数据几乎等于模型一半,摘录稿 §12.2);推理成本随规模上升(他自己也说美国训得起极大激活参数「也用不起来……确实有点贵」——此为他的判断,不作外部核验)。
关键出处。 [2][4][5][6][7][8]。
4.2 第二级 · CoT / 思维链 / 推理时计算
他怎么界定。 「自己思考,提高智能上限」;在奥数、写程序上「已经超过最顶尖的人类」;到上限仍到不了 AGI。时间锚:「去年」(摘录稿 §6.3)。
为何在这一级。 依赖:思维链从足够大的语言模型里涌现 [9]。杠杆:同一套权重,用更多测试时计算换更高正确率,不必先把预训练再放大一个数量级 [11][13]。
2026 年最前沿做到哪。
- Wei 等 2022:少样本思维链提示显著提高算术、常识、符号推理;PaLM 540B 在 GSM8K 上用八个思维链示例即达当时 SOTA [9]。该文把能力描述为约 100B 参数量级才显著出现的尺度现象。
- Kojima 等 2022:仅加 “Let’s think step by step” 即可激发零样本思维链 [10]。
- OpenAI o1(2024-09 起):用大规模强化学习训练模型使用思维链;明确写出表现随训练时计算与测试时「思考时间」共同上升,约束与预训练规模律不同 [11]。系统卡把 o1 系列定义为「先想后答」的推理模型 [12]。
- Snell 等 2024:在固定权重上优化测试时计算,对某些任务可比扩大参数更有效 [13]。
- DeepSeek-R1:R1-Zero 证明纯 RL 可涌现长推理;R1 用冷启动解决可读性与语言混用,推理任务与 o1-1217 可比,并开源蒸馏小模型 [3];2025 年 Nature 发表 [46]。
成熟度:已工业部署。 「去年」这个时间锚与 2024 年 o1、2025 年 R1 的公开时间线一致。
吻合。 他家的 R1 论文几乎是这条台阶的实验证明:先有 V3-Base,再有推理。他把 CoT 说成提高智能上限、但仍不是 AGI,也与 o1/R1 仍困在「一题一答、上下文有限」相符。
张力。
- 思维链是否忠实反映内部计算,仍是开放问题;o1 系统卡把这列为监测前提 [12]。
- 「超过最顶尖人类」被他限定在奥数与写程序。这与公开基准的强项分布一致,不能外推到含糊岗位。
- 测试时计算把「智能」部分地买成了延迟与费用。这不否定台阶,但改变单位智能的成本曲线 [11][13]。
未解。 过程奖励与结果奖励的稳定性;语言混用与可读性(R1-Zero 的已知缺陷 [3]);把推理从竞赛题迁到含糊的真实任务。
关键出处。 [3][9][10][11][12][13][46]。
4.3 第三级 · Agent
他怎么界定。 能力范围更大、智能上限更高;要用到 CoT;走完仍替代不了员工。时间锚:「今年」。当前垂直应用「最重要的应该还是 Coding Agent」(摘录稿 §6.3、§8.3)。
为何在这一级。 依赖:ReAct 的原文命题就是把推理痕迹与行动交错,推理帮助更新计划,行动从环境取证 [14]。杠杆:可检验反馈(测试、编译器、网页状态)让模型把 CoT 用到环境上,而不是停在卷面上。
2026 年最前沿做到哪。
- 范式。 ReAct(Yao 等,ICLR 2023)在问答与决策基准上超过只推理或只行动 [14]。Anthropic 2024-12 工程文把 agent 定义为模型动态决定工具与流程、在环境反馈上循环;并单独指出编码与「电脑使用」是两个已落地领域 [16]。
- 软件工程尺。 SWE-bench:真实 GitHub issue → 补丁 → 隐藏测试 [15]。SWE-agent 用定制的 agent—计算机接口把全量测试集 SOTA 抬到当时的 12.5% 量级 [44]。OpenAI 2024-08 发布 SWE-bench Verified(500 题人工筛过)[19]。到 2026 年,OpenAI 公开停止用 Verified 报前沿,理由是污染使分数不再反映真实软件工程能力,并建议改报 SWE-bench Pro [20]。
- 时间视野。 METR 2025:用人类专家耗时定义任务长度,拟合模型 50% 成功率对应的时长。原论文报告约 7 个月翻倍;当时前沿(如 o3 / Claude 3.7 Sonnet,版本因文稿而异)落在约一小时量级,数小时级任务成功率低 [18]。官方页声明静态数字会过时,以 time-horizons 页为准 [18b]。
- 通用计算机。 OSWorld 在真实桌面应用上评测 [42];GAIA 测「对人类简单、对当时 AI 很难」的工具链问答 [41]。二者仍显示长程、含糊、多应用任务与人类差距。
- 电脑使用。 Anthropic 将 computer use 作为 agent 的参考实现之一 [16][17]。
成熟度:窄域工业部署。 编码 agent 已是产品;通用岗位替代未被 METR 或 OSWorld 支持。
吻合。
- 「Agent 用到 CoT」被 ReAct 与 Anthropic 的编码 agent 实践同时写明 [14][16]。
- 「走完仍替代不了员工」与 METR「短任务近满分、长任务崩溃」同向 [18]。员工类比里的两个月,远长于已测的 50% 时间视野。
- 他把 Coding Agent 放在垂直第一,与 Anthropic「代码可被测试检验,因此 agent 特别有效」[16] 同向,也与他自己「第一用户是实验室」同向。
张力。
- 公开基准正在失效:SWE-bench Verified 的污染使「今年 Agent 做到哪」更难用单一分数回答 [20]。本报告因此不引用任何未注明日期与脚手架的 SWE-bench 百分比作为前沿水平。
- 替代假说 F2:时间视野继续按指数延长,可能在不解决持续学习的情况下,先覆盖一部分「小王」岗位。梁文锋把这一步的残差全部记在持续学习账上,可能过早。
- 记忆类系统(MemGPT 把上下文当虚拟内存分页 [23];Voyager 在 Minecraft 里积累技能库 [45])说明:一部分「学习」可以被脚手架冒充。 他若坚持「下一代必须改学习问题本身」,需要把这些冒充排除在外——会上他没有做这套概念手术,只说持续学习是一个问题、会有很多技术。
未解。 高可靠性长程(80% 时间视野远短于 50% [18]);含糊需求;跨班次记忆;评测污染。
关键出处。 [14][15][16][17][18][19][20][23][41][42][44][45]。
4.4 第四级 · 持续学习(本阶梯的承重裂缝)
他怎么界定。 像人一样较长时段学习,不必每次给极强训练;与「完成任务」是同一问题;Agent 之后能看到的下一个瓶颈;全世界还没找到好方法;内部有看起来有前途的想法,都还没做通;「持续学习先做出来,通用智能可能就很容易了」;否则靠人堆数据和人力「性价比也不高」(摘录稿 §12.1)。下一代模型的定义权在这一级(摘录稿 §6.4)。
为何在这一级。 可观察瓶颈:全上下文已经够用的任务分布被 CoT+Agent 吃掉之后,剩下的是跨天、跨任务、跨岗位的适应。依赖:先有能行动的 agent,才有「从自己的轨迹里学」的数据。这与 Silver & Sutton 2025 年「高质量人类数据逼近上限,下一步必须让智能体从自身经验里学」[28] 同向。
2026 年最前沿做到哪。 必须先把几件经常被混为一谈的事切开:
| 机制 | 改不改权重 | 代表工作 | 算不算他所说的持续学习 |
|---|---|---|---|
| 更长上下文 / RAG / 虚拟内存 | 通常不改 | MemGPT [23] | 他的员工类比暗示「不够」:不能也不现实把一切塞进上下文 |
| 测试时记忆(序列模型内部状态) | 前向过程中更新记忆模块 | Titans:用神经长期记忆在测试时记忆历史,注意力当短时记忆 [26] | 更接近,但仍是架构实验,不是训练默认 |
| 弹性权重巩固等正则 | 改,但保护旧任务 | EWC,PNAS 2017 [21];灾难性干扰的经典表述见 McCloskey & Cohen 1989 [22] | 问题陈述与他一致;方法未成为 LLM 主路径 |
| 自编辑后微调 | 改 | SEAL:模型生成 self-edit,经 SFT 写入权重,用下游表现作 RL 奖励 [27] | 方向同向;实验尺度远小于前沿预训练 |
| 嵌套优化 / 自修改架构 | 改(多层不同更新频率) | Nested Learning + Hope,NeurIPS 2025;Google 官方博客将其标为持续学习新范式 [24][25] | 问题同向;Hope 是概念验证,不是 V3/R1 级配方 |
| 经验数据闭环 | 改,数据来自交互 | The Era of Experience [28] | 问题同向;是纲领,不是已部署系统 |
成熟度:问题已提出、方法未通。 这与他的原话同句。本报告把 2025 年 Titans / Nested Learning / SEAL 记为「有前途的实验室方向」,不记为「已解」。
吻合。 他可能是公开场合把这个问题说得最硬的实验室负责人之一:直接用它定义下一代,而不是把它写成论文里的 future work。文献支持「未通」这一负向事实 [21][22][24][27][28]。
张力。
- 术语混用。 「持续学习 / 学习去学习 / continuous learning」在会上未对齐。元学习(learn-to-learn)与在线适应(continual / online learning)在文献里不是同一题。本报告不替他对齐。
- 他与提问者提到的 Recursive Improvement 未画等号(摘录稿 §12.1)。本报告把递归自改进放到第五级,避免把第四、第五级焊死。
- Silver & Sutton 的「经验时代」更强调环境交互产生的数据 [28],不一定先要求一个已完成的数字 agent。 若他们的纲领对,持续学习与具身 / 模拟环境的耦合会比梁文锋的排序更紧,第四级就不能干净地放在具身之前。这是对公理 2 的温和压力,尚未构成 F3。
未解。 在不灾难性遗忘的前提下,把新的岗位知识写进权重或等价记忆;在模型尺度上复现 SEAL / Hope 类结果;把「两个月上手」变成可测基准(目前没有被广泛采用的「员工两个月」基准)。
关键出处。 [21][22][23][24][25][26][27][28]。
4.5 第五级 · 自我迭代(他称为奇点,随即改口为渐变)
他怎么界定。 模型能做人类能做的所有事情,能自己开发下一版本;不是突变,是较长渐变;只是习惯称为奇点。没有具身时,第一用途是迭代下一版模型(摘录稿 §6.3)。AGI 无临界点、可非线性,因为 AI 可加速 AI 研究(摘录稿 §13.1)。
为何在这一级。 杠杆公理的顶点:持续学习一旦使模型能吸收自己的实验轨迹,研究本身成为可加速对象。依赖:需要 agent(能改代码、跑实验)+ 持续学习(实验不会在下一天被忘掉)。
2026 年最前沿做到哪。
- 理论原典。 Good 1965:超智能机器能设计更好的机器 → 智力爆炸 [29]。梁文锋保留「能设计下一版」,丢掉「爆炸」。
- 弱形式、已部署。 AlphaEvolve:Gemini 驱动的进化编码 agent,用自动评估器筛选程序;报告包括改进 Gemini 自身训练内核(矩阵乘子问题划分加快 23%,训练时间约 −1%)、FlashAttention 内核最高约 32.5% 加速,并在后续一年进入 TPU 设计、缓存策略、Spanner 等基础设施 [30]。这是「模型改进模型的训练栈」的存在性证明,对象是算法与内核,不是完整下一世代权重。
- 弱形式、训练配方。 R1 推理被蒸馏进 V3 后训练 [2][3]:用更强推理模型教下一个通用模型。人仍设计流水线。
- 弱形式、自编辑。 SEAL 让模型写出自己的微调指令 [27]。尺度远小于预训练。
- 纲领。 Silver & Sutton:人类高质量数据逼近上限,经验数据必须成为改进的主介质 [28]。
成熟度:弱形式实验室可复现;完整「自己开发下一版本」仍为概念。
吻合。 改口为渐变,与 AlphaEvolve「几天自动实验替代数周专家」[30] 这类局部加速相符,与一夜换代不符。第一用户是自己,与 AlphaEvolve 首先服务 Google 内部训练栈相符。
张力。 Good 的爆炸若在某一代突然成立,他的「无临界点」会被证伪。目前没有公开系统展示跨代的、无人值守的权重设计。Amodei《Machines of Loving Grace》把强大 AI 写成可管理的、偏渐进的社会过程 [47],与改口同侧,但那是随笔不是实验。
未解。 从「优化一个内核」到「提出并完成下一代训练配方」;从有人设定适应度函数到自己提出问题(他另有一句「再下一步它自己问问题」,摘录稿 §8.1)。
关键出处。 [2][3][27][28][29][30][47]。
4.6 第六级 · 具身智能
他怎么界定。 走进现实世界:做家务、养老;放在自我迭代之后;「对一个正常人来讲,他的需求并不是电脑」。先做「很苦」;奇点之后「不用人来做」(摘录稿 §6.3)。
为何在这一级。 杠杆:让已经能迭代软件的系统去迭代机器人。依赖:具身论文几乎都从视觉—语言模型出发,而不是从零发明智能。
2026 年最前沿做到哪。
- 数据。 Open X-Embodiment / RT-X:跨本体机器人数据集与模型,证明混合不同机器人数据有泛化收益 [37]。
- VLA。 RT-2 把网络视觉—语言知识迁到机器人控制 [38]。π₀:Physical Intelligence 的流匹配视觉—语言—动作模型,骨干是预训练 VLM,再加动作专家;官方博客与 arXiv 同步 [36][36b]。NVIDIA Isaac GR00T:开放的跨本体 VLA 参考栈 [40]。Gemini Robotics:把 Gemini 级模型带进物理世界,后续 1.5 强调具身推理与动作迁移 [39]。
- 世界模型对照。 LeCun 2022:可配置的预测世界模型 + JEPA,作为自主智能蓝图 [32][33]。Sora:规模化视频生成「是通向通用物理世界模拟器的有希望路径」[34];Sora 2 仍把世界模拟能力当作训练能理解物理世界的 AI 的关键里程碑 [35]。Genie:从无标注视频学可交互环境 [43]。
成熟度:实验室可复现;家务/养老级泛化未证明。 公开系统展示的是桌面操作、厨房短技能、受控实验室,不是「任意家庭、任意老人」。
吻合。 几乎所有 2024–2026 年的通用机器人基础模型都先借用语言/视觉—语言智能,再接到动作头上 [36][38][39]。这直接支持依赖公理,即使这些实验室的投资时点比他更早进入硬件。
张力(这是整条阶梯与外部世界摩擦最大的地方)。
- Physical Intelligence、Figure 类公司、Tesla Optimus 叙事、Gemini Robotics,都在不等「软件奇点」就收集真实机器人数据。他们的隐含判断是:物理数据的瓶颈不能靠以后的智能凭空补上,现在不采、以后也没有。这与「先具身是苦活」并不逻辑矛盾——苦活可以同时是必要的——但与「奇点之后就不用人来做」的期望冲突:若物理数据必须由人在今天采集,后人无法用纯软件智能回填。
- 世界模型派认为,没有内部模拟器,agent 在真实世界会贵到做不成 [32][34]。梁文锋把现阶段世界模型移出主线。若 F1 成立,第六级会前移,甚至插入 Agent 与持续学习之间。
- Moravec 悖论的经典表述是:对人类容易的感知运动,对机器很难。他的「苦活」与这一传统同向。他的新意是:把苦活推迟到自我迭代之后,让更强的智能承担数据与控制的成本。这是策略,不是对悖论的否定。
未解。 跨家庭泛化;安全与接触力控制;数据从实验室到真实住宅的分布偏移;世界模型是否必须成为具身的前置。
关键出处。 [32][33][34][35][36][36b][37][38][39][40][43]。
4.7 六级对照总表
| 级 | 他的原话功能 | 成熟度 | 最硬的公开证据 | 与他最强的吻合 | 与他最强的张力 |
|---|---|---|---|---|---|
| 1 LM | 底座 | 已工业部署 | V3 [2];规模律 [5][6] | R1 从 V3-Base 出发 | LLM 是否是死路 [32] |
| 2 CoT | 抬上限 | 已工业部署 | o1 [11];R1/Nature [3][46] | 「去年」与 2024–25 推理模型同期 | 思维链忠实度 [12] |
| 3 Agent | 扩大范围 | 窄域工业部署 | ReAct [14];METR [18] | 编码优先 [16];仍替不了员工 | 评测污染 [20];F2 |
| 4 持续学习 | 下一代定义 | 方法未通 | EWC [21];SEAL [27];Nested Learning [24] | 「全世界没做通」与文献一致 | 外部记忆冒充;与具身耦合 [28] |
| 5 自我迭代 | 渐变而非爆炸 | 弱形式可复现 | AlphaEvolve [30];Good 原典 [29] | 改口与弱形式同向 | 硬起飞未被排除,只是未见 |
| 6 具身 | 正常人的需求 | 实验室可复现 | π₀ [36];OXE [37] | VLA 依赖 VLM 骨干 | 物理数据必须现在采 |
五、路线之争:四张地图,不要站队文
5.1 对照系
| 路线 | 智能上限的操作定义 | 现在该烧钱的地方 | 与梁文锋阶梯 |
|---|---|---|---|
| 语言—推理—行动—学习 | 完整上下文下可检验任务 + 最终能改自己的权重 | 预训练、推理时 RL、agent 脚手架、持续学习想法 | 他自己 |
| 世界模型 / JEPA | 在潜空间预测世界并规划 | 自监督视频/多模态、非生成式预测架构 | 他:现阶段不是上限主线 |
| 视频即模拟器 | 像素级(或补丁级)世界模拟 | 大规模视频预训练 | 他:视频生成是好生意、非主线 |
| 具身数据 | 跨本体、跨场景的真实动作成功 | 机器人本体、远程操作、仿真 | 他:后置;先做是苦活 |
没有一条路线被 2026-08 的公开结果「判决」。能写进研报的只有:投资时点不同,承重墙不同,证伪实验不同。
5.2 世界模型先行:LeCun 与 Sora 不是同一主张
LeCun 2022 立场论文要的是非像素级重建的联合嵌入预测架构,避免生成式视频那种对无关细节的浪费 [32][33]。OpenAI 的 Sora 说明走的是生成式、补丁级扩散 Transformer,并明确把规模化视频写成通向世界模拟器的路径 [34]。二者都叫世界模型,方法相反。
梁文锋说世界模型「含义没那么清楚」、很多东西都能叫这个名字(摘录稿 §8.1)。这句话被上述分裂直接证实。 因此「他拒绝世界模型」必须写成:「他拒绝把现阶段、定义不清的世界模型当作智能上限主线」,而不是「他拒绝一切内部模拟」。
Genie 把「从视频学可交互环境」做成另一条生成式世界模型 [43]。若这类系统开始稳定地为 agent 提供可验证的规划收益,F1 的观察窗口就会打开。目前公开材料仍把它们写成研究系统或产品预览,不是已替代 CoT+Agent 的智能上限。
5.3 Scaling 即一切
规模律文献 [5][6][7] 与 o1「训练时 + 测试时计算都升」[11] 支持「继续加计算仍有回报」。梁文锋同意 Scaling 未到墙(摘录稿 §6.4),但拒绝用 Scaling 代替持续学习来定义下一代。张力在于:若测试时计算 + 更长上下文 + 更好脚手架在 F2 意义上覆盖了员工任务,持续学习作为「下一代」定义就会被市场(不是被物理)降级为可选优化。
5.4 递归自改进硬起飞
Good 的爆炸 [29] 是第五级的理论对照,不是任何实验室的当前配方。AlphaEvolve [30] 证明局部自改进存在,也证明它今天仍嵌在人类设计的评估器与进化环里。本报告把硬起飞保留为尾部情景(Bull 的极端),不把它写成基本情景。
六、情景与证伪:用「哪一级被解锁」而不是用年份
日历预测在这个领域的记录很差。本报告只定义状态。年份若出现,只作为 METR 原论文自己的外推,并标明其假设。
6.1 三种状态
| Bear | Base | Bull | |
|---|---|---|---|
| 含义 | 阶梯在第四级卡住,或被 F1/F3 改道 | 他的依赖顺序大体被行业走出来,持续学习缓慢部分解 | 弱自我迭代提前,时间视野快速覆盖岗位 |
| 第四级 | 外部记忆与长上下文被误认为已经解完;权重级适应仍灾难性遗忘 | SEAL / Nested Learning / 经验闭环之一在中等尺度可复现,开始进入后训练配方 | 持续学习成为「下一代」的默认训练项,他的定义被市场采用 |
| 第五级 | 只有蒸馏与内核优化,人仍写全部配方 | AlphaEvolve 类系统成为多家实验室标配,覆盖训练栈局部 | 出现跨代、少人值守的训练配方搜索;仍渐变,不是 Good 爆炸 |
| 第六级 | 机器人停留在演示;或反过来,具身派用物理数据反超软件智能(F3) | VLA 继续吃 VLM 红利,家务级产品仍窄 | 自我迭代开始设计下一版本体;苦活明显减轻 |
| 对「编码 agent」 | 评测污染 + 可靠性平台期,收入在辅助编码停住 | 继续作为最可检验的窄域,时间视野从小时向工作日爬 [18] | 编码 agent 变成实验室操作系统,自我迭代的手 |
6.2 可观察路标(公开、可核验)
- 论文级: 是否出现与 R1 同重量的「持续学习 / 经验闭环」技术报告,含失败案例与遗忘曲线,而不是只有针在稻草堆里检索。
- 产品级: 同一权重(或同一持续记忆)是否能在不重训的前提下,跨周完成同一代码库 / 同一岗位的新任务,并保持旧任务。
- 评测级: METR 80% 时间视野;OSWorld 类桌面任务;以及——目前还没有的——「两个月入职」基准。
- 评测诚信: 是否改用抗污染基准(OpenAI 已公开离开 SWE-bench Verified [20])。
- 自我迭代: 是否有第二家实验室发表「本系统改进了本系统的训练成本 / 算法」,并给出可复核的评估器。
- 具身: 跨家庭、跨本体、非遥操作的成功率,而不是实验室厨房的剪辑。
6.3 METR 外推怎么用、怎么不用
METR 原论文写:若 2019–2025 趋势外推,约五年内系统可能自动完成许多当前需人类一个月的软件任务;并强调外部效度与趋势变化是主要不确定性 [18]。本报告引用这条外推作为文献中的外推,不把它改写成我们的预测。它直接服务于 F2:若月级软件任务在高可靠性下被解开,梁文锋员工类比里的「必须持续学习」压力会下降,但「必须持续学习才能叫下一代」仍可以作为一个研究定义存在——只是市场可能不再付钱给这个定义。
七、产业含义(逻辑含义,不是价格)
本节把阶梯翻译成「价值可能沉淀在哪」,不写买卖建议,不给倍数。
7.1 编码 agent:当前唯一既可检验又贴近自我迭代的窄域
Anthropic 把编码列为 agent 最有效的领域之一,理由是测试可自动打分 [16]。梁文锋把 Coding Agent 放在垂直第一(摘录稿 §8.3)。二者独立、同向。产业含义:
- 在持续学习未通之前,可检验闭环(代码、数学、部分科研)会继续吸收推理时计算与 agent 脚手架的预算。
- 评测污染 [20] 意味着买方不能再用单一公开榜当验收;价值转向私有、抗污染、带成本约束的内部基准。本仓库的《Agent 评测与基准测试》把「分数最高 ≈ 最贵」写进了 L3 的读法,与此一致。
7.2 持续学习一旦做通:研究效率飞轮,而不是先做 C 端超级应用
他的第一用户是自己。若第四级做通,首先加速的是下一张权重,不是广告与电商(后两者被他明确判为现阶段浪费时间,摘录稿 §8.1)。产业含义:
- 能把「岗位记忆」写进权重或等价记忆的实验室,会拉开与「每次会话从零解释小王是谁」的产品差距。
- 在那之前,外部记忆(MemGPT 类 [23])与更长上下文会作为过渡性租金存在:它们冒充持续学习,也能收钱,但按他的定义不算下一代。
7.3 自我迭代的弱形式:训练栈软件,不是「AI 公司股票的奇点条款」
AlphaEvolve 类系统把价值放进编译器、内核、调度、芯片设计工具链 [30]。这是基础设施软件租金,不是一夜之间的需求侧奇点。与他的改口一致:渐变、可非线性,但不是爆炸条款。
7.4 具身后置对机器人 / 世界模型资产的含义
逻辑上有两种读法,必须并列,不能只写一种:
- 读法 A(支持后置)。 今天的 VLA 已经在用 VLM 骨干 [36][38][39]。软件智能每抬一级,同一本体的数据效率上升。过早把资本锁进单一本体,可能在下一版智能到来时贬值。
- 读法 B(反对后置)。 真实世界数据有时间上的不可逆:现在不采,以后没有 2026 年的家庭分布。世界模型若必须靠视频与交互环境预训练 [34][43],则视频生成与仿真不是旁路,是第六级的前置资本开支。
本报告不在 A/B 之间选边。投资上这意味着:机器人与世界模型资产的估值,取决于你相信物理数据是否可被未来更强智能回填。 梁文锋的公开判断接近 A;LeCun / Sora / 具身派接近 B。这是第二节核心辩论的资产版本。
7.5 多模态与搜索:组件定价
他把多模态比作搜索:C 端重要,不是上限主线,但仍会做(摘录稿 §6.4)。产业含义:多模态能力会被打包进产品,但不应该被当成「下一代模型」的充分条件。按他的定义,下一代的充分条件是持续学习。
八、本报告可能错在哪里
- 一级材料是 ASR 文字稿,不是经讲者审定的书面声明。专有名词与数字以录音为准(摘录稿第十五节)。本报告有意避开那些数字。
- 「揣测」若写得过满。 第三节的加框推断可能过度解释「第一用户是自己」。否证方式:若 DeepSeek 随后把主要研究预算公开转到 C 端超级应用,该推断失效。
- 成熟度是横截面。 2026-08 之后的一篇论文就可能把第四级从「方法未通」改成「实验室可复现」。仪表盘必须随文献更新,不能当永久评级。
- 未覆盖闭源内部。 OpenAI、Google、Anthropic 的持续学习内部进展若强于论文,本报告会系统性低估第四、第五级。我们只对公开证据负责。
- 编码偏见。 公开基准与 METR 任务偏软件。若真实经济中的「员工」主要是身体与社交劳动,第六级的权重被我们和梁文锋一起低估。
九、附录 A · 术语表(不强行合并)
| 用语 | 本报告处理 |
|---|---|
| 持续学习 / continual learning | 他会上的中心词:较长时段学习、不必每次强训练。文献里常指克服灾难性遗忘的序列任务学习 [21][22] |
| 学习去学习 | 文稿混用。文献里常近元学习。本报告分列,不与持续学习划等号 |
| recursive improvement / 递归自改进 | 提问者并提;他未定义为同一术语。本报告放入第五级对照,不并入第四级 |
| 奇点 | 他先用后改口为渐变。本报告把改口当理论判断 |
| Agent | 采用 Anthropic 的工作定义:模型动态决定工具与流程 [16];与「预写死的 workflow」区分 |
| 世界模型 | 他指出含义不清。本报告在第五、六节拆成 JEPA 式与生成式两类 |
| 具身智能 | 他:家务、养老、走进现实。文献:VLA、跨本体、世界模型仿真,范围更杂 |
| 下一代模型 | 他的操作定义:必须有持续学习。不是参数量或多模态 |
十、附录 B · 参考文献
下表是本报告全部引用。P5 不用于支撑技术结论。 URL 均为 2026-08-13 检索时可解析的公开页;OpenReview 的 PDF 直链可能被反机器人页拦截,故同时给 forum 与 Meta 官方介绍。
| # | 文献 | 类型 / 日期 | 证据级 | 支撑的判断 |
|---|---|---|---|---|
| 1 | 本仓库《梁文锋投资者交流会 · 观点提炼》,材料为 2026-05-20 交流会 ASR 文字稿 | 内部结构化摘录,2026-07-16 整理 | P1(转写风险见该稿) | 他的阶梯、三条公理、改口、员工类比、编码优先、持续学习未通 |
| 2 | DeepSeek-AI. DeepSeek-V3 Technical Report. arXiv:2412.19437. https://arxiv.org/abs/2412.19437 | 技术报告,2024-12 | P1 | 语言模型台阶;671B/37B;R1 蒸馏进 V3 的后训练叙述 |
| 3 | DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948. https://arxiv.org/abs/2501.12948 | 技术报告,2025-01 | P1 | CoT 台阶;从 V3-Base 出发;与 o1-1217 可比 |
| 4 | Vaswani, A. et al. Attention Is All You Need. NeurIPS 2017. https://arxiv.org/abs/1706.03762 | 会议论文,2017 | P2 | Transformer 底座 |
| 5 | Kaplan, J. et al. Scaling Laws for Neural Language Models. arXiv:2001.08361. https://arxiv.org/abs/2001.08361 ;OpenAI 介绍 https://openai.com/index/scaling-laws-for-neural-language-models/ | 2020-01 | P2 / P3 | 规模律;他相信 Scaling 的文献背景 |
| 6 | Hoffmann, J. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556. https://arxiv.org/abs/2203.15556 | 2022-03 | P2 | Chinchilla:参数与 token 等比例 |
| 7 | OpenAI. GPT-4 Technical Report. arXiv:2303.08774. https://arxiv.org/abs/2303.08774 ;https://cdn.openai.com/papers/gpt-4.pdf | 2023-03 | P3 | 用小模型预测大模型损失 |
| 8 | Grattafiori, A. et al. The Llama 3 Herd of Models. arXiv:2407.21783. https://arxiv.org/abs/2407.21783 | 2024-07 | P3 | 开放权重侧规模化配方 |
| 9 | Wei, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022. https://arxiv.org/abs/2201.11903 | 2022 | P2 | CoT 原论文;依赖足够大的 LM |
| 10 | Kojima, T. et al. Large Language Models are Zero-Shot Reasoners. NeurIPS 2022. https://arxiv.org/abs/2205.11916 | 2022 | P2 | 零样本思维链 |
| 11 | OpenAI. Learning to reason with LLMs. https://openai.com/index/learning-to-reason-with-llms/ | 官方博客,2024-09 | P3 | o1;训练时与测试时计算共同上升 |
| 12 | OpenAI. OpenAI o1 System Card. https://arxiv.org/abs/2412.16720 ;https://cdn.openai.com/o1-system-card-20241205.pdf | 2024-12 | P3 | 思维链监测;先想后答 |
| 13 | Snell, C. et al. Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314. https://arxiv.org/abs/2408.03314 | 2024-08 | P2 | 测试时计算 vs 扩参 |
| 14 | Yao, S. et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023. https://arxiv.org/abs/2210.03629 | 2022/23 | P2 | Agent 用到 CoT 的原论文 |
| 15 | Jimenez, C. E. et al. SWE-bench: Can Language Models Resolve Real-World GitHub Issues? ICLR 2024. https://arxiv.org/abs/2310.06770 | 2024 | P2 | 真实软件工程基准 |
| 16 | Anthropic. Building effective agents. https://www.anthropic.com/engineering/building-effective-agents | 工程博客,2024-12-19 | P3 | agent vs workflow;编码与 computer use |
| 17 | Anthropic. 3.5 models and computer use(computer use 发布说明). https://www.anthropic.com/news/3-5-models-and-computer-use | 2024-10 | P3 | 电脑使用作为 agent 落地 |
| 18 | Kwa, T. et al. / METR. Measuring AI Ability to Complete Long Tasks. arXiv:2503.14499. https://arxiv.org/abs/2503.14499 | 2025-03 | P2 | 时间视野;员工类比的定量对照 |
| 18b | METR. Measuring AI Ability to Complete Long Software Tasks(博客,声明静态数字可能过时). https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ ;更新页 https://metr.org/time-horizons/ | 2025-03 起 | P3 | 约 7 个月翻倍的原表述;以更新页为准 |
| 19 | OpenAI. Introducing SWE-bench Verified. https://openai.com/index/introducing-swe-bench-verified/ | 2024-08 | P3 | 500 题人工筛选 |
| 20 | OpenAI. Why SWE-bench Verified no longer measures frontier coding capabilities. https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/ | 2026 | P3 | 污染;停止用 Verified 报前沿 |
| 21 | Kirkpatrick, J. et al. Overcoming catastrophic forgetting in neural networks. PNAS 2017. https://doi.org/10.1073/pnas.1611835114 | 2017 | P2 | EWC;持续学习经典方法 |
| 22 | McCloskey, M. & Cohen, N. J. Catastrophic interference in connectionist networks: The sequential learning problem. Psychology of Learning and Motivation 24:109–165 (1989). https://doi.org/10.1016/S0079-7421(08)60536-8 | 1989 | P2 | 灾难性干扰的问题陈述 |
| 23 | Packer, C. et al. MemGPT: Towards LLMs as Operating Systems. arXiv:2310.08560. https://arxiv.org/abs/2310.08560 | 2023-10 | P2 | 外部记忆冒充「学习」 |
| 24 | Behrouz, A. et al. Nested Learning: The Illusion of Deep Learning Architectures. NeurIPS 2025. https://arxiv.org/abs/2512.24695 | 2025 | P2 | 持续学习新范式;Hope |
| 25 | Behrouz, A. & Mirrokni, V. Introducing Nested Learning. Google Research Blog. https://research.google/blog/introducing-nested-learning-a-new-ml-paradigm-for-continual-learning/ | 2025-11 | P3 | 官方将 NL 标为持续学习 |
| 26 | Behrouz, A., Zhong, P. & Mirrokni, V. Titans: Learning to Memorize at Test Time. arXiv:2501.00663. https://arxiv.org/abs/2501.00663 | 2025-01 | P2 | 测试时长期记忆 |
| 27 | Zweiger, A. et al. Self-Adapting Language Models (SEAL). NeurIPS 2025. https://arxiv.org/abs/2506.10943 | 2025 | P2 | 自编辑写入权重 |
| 28 | Silver, D. & Sutton, R. S. Welcome to the Era of Experience. 将收入 Designing an Intelligence(MIT Press). 作者页 https://davidstarsilver.wordpress.com/publications/ | 2025 | P2/P3(章节预印,以作者页著录为准) | 经验数据取代人类数据上限;与第四、五级同向 |
| 29 | Good, I. J. Speculations Concerning the First Ultraintelligent Machine. Advances in Computers 6:31–88 (1965). https://doi.org/10.1016/S0065-2458(08)60418-0 | 1965 | P2 | 「智力爆炸」原典;与改口对照 |
| 30 | DeepMind. AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms. https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/ ;论文 https://arxiv.org/abs/2506.13131 ;后续影响 https://deepmind.google/blog/alphaevolve-impact/ | 2025–2026 | P3 / P2 | 弱形式自我迭代;改进 Gemini 训练栈 |
| 31 | Sutton, R. The Bitter Lesson. 2019-03-13. http://www.incompleteideas.net/IncIdeas/BitterLesson.html | 随笔 | P3 | 通用方法吃计算;与 Scaling 同向 |
| 32 | LeCun, Y. A Path Towards Autonomous Machine Intelligence (v0.9.2). OpenReview. https://openreview.net/forum?id=BZ5a1r-kVsf | 2022-06 | P2(立场论文,非传统评审) | 世界模型蓝图 |
| 33 | Meta AI. Yann LeCun on a vision to make AI systems learn and reason like animals and humans. https://ai.meta.com/blog/yann-lecun-advances-in-ai-research/ | 2022-02 | P3 | 世界模型主张的官方介绍 |
| 34 | OpenAI. Video generation models as world simulators. https://openai.com/index/video-generation-models-as-world-simulators/ | 2024-02 | P3 | Sora;视频生成作为世界模拟路径——他移出主线的对照 |
| 35 | OpenAI. Sora 2 is here. https://openai.com/index/sora-2/ | 产品博客 | P3 | 仍把世界模拟当物理理解的里程碑 |
| 36 | Black, K. et al. (Physical Intelligence). π₀: A Vision-Language-Action Flow Model for General Robot Control. arXiv:2410.24164. https://arxiv.org/abs/2410.24164 | 2024-10 | P2 | 具身;VLM 骨干——支持「后一步用前一步」 |
| 36b | Physical Intelligence. π₀ 博客. https://www.physicalintelligence.company/blog/pi0 | 官方博客,与 [36] 同期 | P3 | 与 [36] 对应的官方说明 |
| 37 | Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv:2310.08864. https://arxiv.org/abs/2310.08864 | 2023-10 | P2 | 跨本体数据 |
| 38 | Brohan, A. et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818. https://arxiv.org/abs/2307.15818 | 2023 | P2 | VLA 范式 |
| 39 | Google DeepMind. Gemini Robotics 相关论文 arXiv:2503.20020. https://arxiv.org/abs/2503.20020 ;介绍 https://deepmind.google/discover/blog/gemini-robotics-brings-ai-into-the-physical-world/ | 2025-03 | P2 / P3 | 把前沿模型接入物理世界 |
| 40 | NVIDIA. Isaac GR00T. https://developer.nvidia.com/isaac/gr00t ;代码 https://github.com/NVIDIA/Isaac-GR00T | 产品/开源栈 | P3 | 开放跨本体 VLA |
| 41 | Mialon, G. et al. GAIA: a benchmark for General AI Assistants. arXiv:2311.12983. https://arxiv.org/abs/2311.12983 | 2023 | P2 | 通用工具链任务仍难 |
| 42 | Xie, T. et al. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments. arXiv:2404.07972. https://arxiv.org/abs/2404.07972 | 2024 | P2 | 真实电脑环境 |
| 43 | Bruce, J. et al. Genie: Generative Interactive Environments. ICML 2024. https://arxiv.org/abs/2402.15391 | 2024 | P2 | 可交互世界模型 |
| 44 | Yang, J. et al. SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering. arXiv:2405.15793. https://arxiv.org/abs/2405.15793 | 2024 | P2 | ACI 抬高 issue 解决率 |
| 45 | Wang, G. et al. Voyager: An Open-Ended Embodied Agent with Large Language Models. arXiv:2305.16291. https://arxiv.org/abs/2305.16291 | 2023 | P2 | 技能库式「学习」;脚手架冒充 |
| 46 | Guo, D. et al. DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning. Nature 645, 633–638 (2025). https://doi.org/10.1038/s41586-025-09422-z | 2025 | P2 | R1 的同行评审版本 |
| 47 | Amodei, D. Machines of Loving Grace. https://darioamodei.com/machines-of-loving-grace | 2024-10 | P3(随笔) | 渐进、可管理的强大 AI 叙事;与改口同侧,不作实验证据 |
| 48 | DeepMind. Enabling Continual Learning in Neural Networks. https://deepmind.google/blog/enabling-continual-learning-in-neural-networks/ | 2017 | P3 | EWC 官方介绍 |
| 49 | Silver, D. et al. Mastering the game of Go with deep neural networks and tree search. Nature 529, 484–489 (2016). https://doi.org/10.1038/nature16961 | 2016 | P2 | 他用来论证「可超越已说出的人类知识」的 AlphaGo 依据(摘录稿 §12.2) |
检索说明
- 未列入而计划里点过名、但本报告最终不用来支撑结论的材料:无法稳定解析全文的预印本镜像、二手自媒体对内部卡量的转述、交流会 ASR 中的产能数字。
- [28] 的 PDF 直链在撰写日未能从一处公开存储稳定取回,故以作者出版物目录的著录为准,不伪造页码引文。
- [32] 的 PDF 直链在撰写日遇到 OpenReview 反机器人页,故同时引用 forum 与 Meta 官方介绍 [33],不引用未读到的页码。
本报告不替代录音,不替代原论文。若当事人随后发表书面技术路线,以书面为准。