解析 · 人工智能

AI 开始造 AI:把 RSI 这个词讲清楚

如果一台机器能设计出比自己更好的机器,那它会设计出什么?这个问题今年不再是哲学讨论——它已经开始出现在模型训练日志里。

主题 递归式自我改进(RSI) 解析来源 视频号 · 远哥带你看 核对时间 2026-09-24
原文出处

本文解析自视频号短内容《AI已经开始参与研发下一代AI了》(2026 年 9 月 23 日发布)。视频里的核心说法是: “如果把传统大模型训练比作让 AI 进大学学知识,RSI 更像把它送进‘社会大学’——走进真实任务,从结果中不断调整自己。”视频点名上海 AI 公司 StartLux 正在做这件事,并在结尾抛出问题:AI 连“如何让自己变强”都越做越好,会不会最终走向智能爆炸? 下面按科普方式把这套说法展开:哪些已经被公开事实印证,哪些还只是单方描述。


01先把词拆开:RSI 到底是什么

RSI,全称 Recursive Self-Improvement,中文通常译作“递归式自我改进”。它的意思是:AI 参与到对自身的改进中去,形成“能力提升 → 研发能力增强 → 能力再提升”的正反馈。

放到日常语言里,可以这样理解:普通 AI 帮你写代码,是因为你要它写;RSI 里的 AI 写代码,是为了让下一代 AI 更强,然后再用更强的下一代去设计再下一代。链条一旦转起来,改进的推力就不再只来自人。

这里最容易搞混的一点是:RSI 不是“有”或“没有”的开关,而是一个连续谱。真正有价值的提问不是“AI 会不会自我改进”,而是——这个闭环,已经闭合了多少?

02这个念头其实很老

RSI 不是 2026 年的新发明,它最早来自一位数学家在半个多世纪前的一句话。

1965
“最后一项发明”
英国数学家 I. J. Good 提出:如果一台机器能在各种智力活动上超过人类,而设计机器本身也是一种智力活动,那么它原则上就能设计出更好的机器。第一台超智能机器,可能是人类需要完成的最后一项发明。(不同资料记为 1965 或 1966 年)
2008
这个词被正式命名
Eliezer Yudkowsky 在直接以该概念为题的文章中给出定义:AI 重写自己的认知算法,让原本作用于外部对象的智能开发能力反过来作用于自身,由此“闭合循环”。
2014
给“爆炸”装上刹车片
哲学家尼克·波斯特洛姆在《超级智能》里提出一个关键比值:智能演进速度 = 优化能力 ÷ 改进阻力。RSI 会放大优化能力,但最易得的改进会被用尽,数据、算力、电力都会变成阻力——所以 RSI 并不自动等于智能爆炸。
之后
一个形象的阶段划分
研究者图尔钦与邓肯伯格把 AI 分为“狭义 AI”(人的工具)与“青年 AI”(开始自我提升、自我进化)。从工具变成“青年”,才是 RSI 真正改变的东西。

03为什么偏偏是 2026 年被翻出来

因为过去一年多,一批可以查证的具体事件,把这个概念从论文推到了工程现场。

2025 年 5 月,Google DeepMind 公布 AlphaEvolve:用大模型生成候选算法,靠自动评估和演化搜索保留更优方案,已被用于优化数据中心调度、芯片设计和 AI 训练流程。2026 年 2 月,OpenAI 称 GPT-5.3-Codex 在“创建自身”的过程中发挥了重要作用——早期版本被用于监控和调试训练、管理部署、分析评测结果。同期,Meta 研究者发布 HyperAgents:它能修改那个“负责修改任务智能体的元智能体”本身。

真正让公众开始讨论的是 2026 年 6 月 16 日 Anthropic 发布的报告《当 AI 开始建造自身》。报告披露:截至 2026 年 5 月,Anthropic 代码库中超过 80% 的合入代码由 Claude 编写;Claude 智能体已经可以自主提出并检验假设,累计执行约 800 小时的开放式 AI 安全研究实验。

OpenAI 也披露了自己的口径:截至 2026 年 8 月,其研究组织中每 1 个人类研究日,对应约 3.1 个 AI Agent 工作日;但也坦承,在 4 到 8 小时的复杂任务里,超过一半的成功案例仍需要人工救场。

80%
Anthropic 代码库中由 Claude 编写并合入的代码占比
Anthropic 报告,截至 2026-05
800小时
Claude 智能体自主执行的开放式安全研究实验时长
同上
3.1:1
OpenAI 研究组织中 AI Agent 与人类的工作日之比
OpenAI 披露,截至 2026-08
46.5亿美元
RSI 方向公司 Recursive Superintelligence 的投后估值(2026 年 5 月融资 6.5 亿美元)
公开报道

钱和人也在往同一个方向挤。由多位 AI 研究者创办的 Recursive Superintelligence 完成 6.5 亿美元融资;前 Anthropic Discovery 团队负责人创办的 Mirendil 以 RSI 为核心方向拿到 2 亿美元种子轮;在谷歌工作 27 年的 Jeff Dean 离职创办的 Discovery Loop,方向同样是把完整的实验循环交给 AI;Andrej Karpathy 则开源了 autoresearch,让 Agent 在真实的小模型训练环境里自己改代码、跑训练、看结果。

国内的时间点也很有意思:就在视频发布当天(9 月 23 日),机器之心联合张江 AI 创新小镇在上海办了一场名为「AI²:当 AI 学会自我超越」的技术沙龙,主题正是“今天的 AI 究竟进入了 AI 研发循环的哪些环节”。

04视频里那家公司,具体在做什么

视频点名的 StartLux,是上海的 AI 公司,注册主体为上海原点星辉科学技术有限公司,方向是本地 Agent 模型。它的模型 StartLux-V1.0-27B-Preview 以 Qwen3.6-27B 为基座做后训练,可以在消费级个人电脑上跑。

成绩单来自中国信通院人工智能研究所的“可信 AI 大模型基准测试——MCP 专项测试”:综合性能排名第二,综合得分 39.25,超过 284B 参数的 DeepSeek-V4-Flash-0731 与 198B 的 Step-3.7-Flash,同等参数规模下比 Qwen-3.6-27B 高 5.34 个百分点,仅次于 1.6T 参数的 DeepSeek-V4-Pro;在位置导航任务上排名第一,浏览器自动化、金融分析等单项与 DeepSeek-V4-Pro 并列或独占第一。

但真正和 RSI 相关的是训练方法。团队称,在这版模型的后训练中,约 70% 的实验研发工作由 AI 独立完成——包括提出实验假设、生成或筛选数据、启动训练和评测、分析失败轨迹,再决定下一轮试什么;人类研究员负责的是研究方向和关键取舍。

“如果只是批量生成合成数据,或者自动搜一组超参数,我会把它叫自动化,而不是 Research。真正的 Auto Research 应该形成‘假设—实验—验证—新假设’的闭环。”

—— StartLux 联合创始人兼 CTO 郭权玮

这句话是理解整件事的关键。自动化解决的是“把活干了”,Auto Research 解决的是“下一步该干什么”。举个团队给的例子:早期模型拿到看似合理的数据就直接算,环境反馈会暴露日期或交易日对不上;Auto Research 会从这类失败轨迹里归纳问题,自己补上“回查原始数据—确认条件—再计算”的训练任务。它并不是凭空发明新算法,而是从失败里决定下一轮补什么。

那刹车在哪?团队的说法是:只要出现某类评测在涨、泛化却在变差,或者模型明显在钻评分机制的漏洞,研究员立刻介入。而在下一步规划里,他们要通过新的模型架构、训练算法和受控的本地参数更新机制,让模型具备在本地持续自我更新的能力;这版模型目前正在推进备案。

需要说明的一点:视频里说 StartLux 把“自我改进能力与长期记忆连接起来”。公开报道能核实的是它围绕真实任务积累的数据、Auto Research 流程、训练管线和失败分析体系,以及“本地持续自我更新”的规划;“长期记忆”这一层目前只有视频一个来源,本文按单一信源处理。

05那么,RSI 到底实现了吗

没有。至少按严格要求看:公开案例都还停在“弱 RSI”。判断标准可以拆成五个环节,看每个环节的决定权在谁手里。

01
识别自身能力不足
知道自己哪里不行、下一步该试什么
AI 已能参与
02
提出新算法、结构或训练方法
从失败里生成下一轮的假设与方案
AI 已能参与
03
实施修改并训练出新版本
真的动手改、真的跑训练,而不是只提建议
人类掌舵
04
独立评价是否真的变好
判断改进是否成立、是否引入新的安全问题
人类掌舵
05
进入下一轮,并逐轮减少对人的依赖
闭环真正转起来的标志
人类掌舵

逐项对照现在的公开案例,差距很具体:

真正的风险点,也正落在这里:如果提假设、跑实验、评结果、批准上线都由同一个系统握手,就成了“自己命题、自己答题、自己阅卷”。Anthropic 在自己报告里的判断是:完整的 RSI 尚未实现,也并非必然会出现,但它到来的时间可能早于多数机构做好准备的时间。为此它提出建立协调且可核查的减速或暂停机制;OpenAI 则主张强化对前沿模型的评估、建立独立评估生态,并把 RSI 进展列为重点监测对象。

06另一派声音:为什么“爆炸”没那么快

视频结尾抛出的问题是“会不会走向智能爆炸”。这个问题在业内并没有共识,反方给了几条很实在的理由:

加速派的理由

  • AI 已进入研发循环的多个环节,且每个环节的效率都在提升
  • 制约大模型迭代的稀缺资源正在从 GPU 转向高水平研究员的时间
  • 模型越强,越容易发现新算法与更高训练效率,形成正反馈

减速派的理由

  • “有损自我改进”:系统越复杂,摩擦与协调成本越拖慢飞轮
  • 成本:前沿系统的开发动辄数十亿美元,没人敢完全托管给 AI 自主跑
  • 物理约束:算力、电力、芯片产线、机器人,仍深度依赖人类社会
  • 另一种想象是“AI 寒武纪”——大量不同智能体共存演化,而不是单一超级智能

还有一种更贴近现实的时间表:人类研究者不是被一次性替换,而是逐层退出——先不再亲自调试细节,转而负责选研究方向,再往后像项目主管或 CEO 那样定目标,最后变成监督者。

07普通人该盯哪三个信号

RSI 这件事离日常并不远,但它很难靠一句“AI 又变强了”来判断。看这三个地方更实在:

  1. 评价权——成功标准是谁定的?如果模型能改自己的评分规则,那闭环就危险了;只要评价函数仍由人设定,AI 就还是在人类画好的场地里跑。
  2. 权限——算力账户、模型权重、部署开关、自我复制的通道,是不是同一个系统全握着。Anthropic 与 OpenAI 提出的监管思路,核心也都是拆开这个闭环。
  3. 可回溯——实验有没有完整日志、能不能回滚、有没有隔离环境。StartLux 说的“人工介入刹车”,本质上也是这一条。

回到视频里那个比喻。把 AI 送进“社会大学”其实很准确——真正的门槛不是它读了多少书,而是在真实任务里能不能自己发现问题、自己判断下一步,并且有人还能扣得住它的分数。RSI 让人紧张的从来不是“AI 会写代码”,而是这套循环的四个关键动作,可能被同一只手同时握住。

08证据与来源

已确认
RSI 概念史与监管讨论:1965 年 I. J. Good 智能爆炸设想、2008 年 Yudkowsky 的定义、2014 年波斯特洛姆《超级智能》的优化能力/改进阻力框架、完整 RSI 的五环节标准,均出自经济观察报《当 AI 改进自己:递归式自我改进与 AI 监管》。
已确认
Anthropic 报告数据:“80% 合入代码由 Claude 编写”“约 800 小时安全研究实验”,来自 Anthropic 2026-06-16 报告,经上述报道与虎嗅等多家转述。
已确认
StartLux 技术信息与信通院测试结果:投资界、凤凰网广东报道与上海市政府英文站经济新闻(2026-09-03)相互印证。
单一信源
视频中“把自我改进与长期记忆连接”的说法:目前仅见于该视频号内容,公开材料未见对应细节,本文未作为事实陈述。