AI 开始造 AI:把 RSI 这个词讲清楚
如果一台机器能设计出比自己更好的机器,那它会设计出什么?这个问题今年不再是哲学讨论——它已经开始出现在模型训练日志里。
本文解析自视频号短内容《AI已经开始参与研发下一代AI了》(2026 年 9 月 23 日发布)。视频里的核心说法是: “如果把传统大模型训练比作让 AI 进大学学知识,RSI 更像把它送进‘社会大学’——走进真实任务,从结果中不断调整自己。”视频点名上海 AI 公司 StartLux 正在做这件事,并在结尾抛出问题:AI 连“如何让自己变强”都越做越好,会不会最终走向智能爆炸? 下面按科普方式把这套说法展开:哪些已经被公开事实印证,哪些还只是单方描述。
01先把词拆开:RSI 到底是什么
RSI,全称 Recursive Self-Improvement,中文通常译作“递归式自我改进”。它的意思是:AI 参与到对自身的改进中去,形成“能力提升 → 研发能力增强 → 能力再提升”的正反馈。
放到日常语言里,可以这样理解:普通 AI 帮你写代码,是因为你要它写;RSI 里的 AI 写代码,是为了让下一代 AI 更强,然后再用更强的下一代去设计再下一代。链条一旦转起来,改进的推力就不再只来自人。
这里最容易搞混的一点是:RSI 不是“有”或“没有”的开关,而是一个连续谱。真正有价值的提问不是“AI 会不会自我改进”,而是——这个闭环,已经闭合了多少?
02这个念头其实很老
RSI 不是 2026 年的新发明,它最早来自一位数学家在半个多世纪前的一句话。
03为什么偏偏是 2026 年被翻出来
因为过去一年多,一批可以查证的具体事件,把这个概念从论文推到了工程现场。
2025 年 5 月,Google DeepMind 公布 AlphaEvolve:用大模型生成候选算法,靠自动评估和演化搜索保留更优方案,已被用于优化数据中心调度、芯片设计和 AI 训练流程。2026 年 2 月,OpenAI 称 GPT-5.3-Codex 在“创建自身”的过程中发挥了重要作用——早期版本被用于监控和调试训练、管理部署、分析评测结果。同期,Meta 研究者发布 HyperAgents:它能修改那个“负责修改任务智能体的元智能体”本身。
真正让公众开始讨论的是 2026 年 6 月 16 日 Anthropic 发布的报告《当 AI 开始建造自身》。报告披露:截至 2026 年 5 月,Anthropic 代码库中超过 80% 的合入代码由 Claude 编写;Claude 智能体已经可以自主提出并检验假设,累计执行约 800 小时的开放式 AI 安全研究实验。
OpenAI 也披露了自己的口径:截至 2026 年 8 月,其研究组织中每 1 个人类研究日,对应约 3.1 个 AI Agent 工作日;但也坦承,在 4 到 8 小时的复杂任务里,超过一半的成功案例仍需要人工救场。
钱和人也在往同一个方向挤。由多位 AI 研究者创办的 Recursive Superintelligence 完成 6.5 亿美元融资;前 Anthropic Discovery 团队负责人创办的 Mirendil 以 RSI 为核心方向拿到 2 亿美元种子轮;在谷歌工作 27 年的 Jeff Dean 离职创办的 Discovery Loop,方向同样是把完整的实验循环交给 AI;Andrej Karpathy 则开源了 autoresearch,让 Agent 在真实的小模型训练环境里自己改代码、跑训练、看结果。
国内的时间点也很有意思:就在视频发布当天(9 月 23 日),机器之心联合张江 AI 创新小镇在上海办了一场名为「AI²:当 AI 学会自我超越」的技术沙龙,主题正是“今天的 AI 究竟进入了 AI 研发循环的哪些环节”。
04视频里那家公司,具体在做什么
视频点名的 StartLux,是上海的 AI 公司,注册主体为上海原点星辉科学技术有限公司,方向是本地 Agent 模型。它的模型 StartLux-V1.0-27B-Preview 以 Qwen3.6-27B 为基座做后训练,可以在消费级个人电脑上跑。
成绩单来自中国信通院人工智能研究所的“可信 AI 大模型基准测试——MCP 专项测试”:综合性能排名第二,综合得分 39.25,超过 284B 参数的 DeepSeek-V4-Flash-0731 与 198B 的 Step-3.7-Flash,同等参数规模下比 Qwen-3.6-27B 高 5.34 个百分点,仅次于 1.6T 参数的 DeepSeek-V4-Pro;在位置导航任务上排名第一,浏览器自动化、金融分析等单项与 DeepSeek-V4-Pro 并列或独占第一。
但真正和 RSI 相关的是训练方法。团队称,在这版模型的后训练中,约 70% 的实验研发工作由 AI 独立完成——包括提出实验假设、生成或筛选数据、启动训练和评测、分析失败轨迹,再决定下一轮试什么;人类研究员负责的是研究方向和关键取舍。
“如果只是批量生成合成数据,或者自动搜一组超参数,我会把它叫自动化,而不是 Research。真正的 Auto Research 应该形成‘假设—实验—验证—新假设’的闭环。”
—— StartLux 联合创始人兼 CTO 郭权玮这句话是理解整件事的关键。自动化解决的是“把活干了”,Auto Research 解决的是“下一步该干什么”。举个团队给的例子:早期模型拿到看似合理的数据就直接算,环境反馈会暴露日期或交易日对不上;Auto Research 会从这类失败轨迹里归纳问题,自己补上“回查原始数据—确认条件—再计算”的训练任务。它并不是凭空发明新算法,而是从失败里决定下一轮补什么。
那刹车在哪?团队的说法是:只要出现某类评测在涨、泛化却在变差,或者模型明显在钻评分机制的漏洞,研究员立刻介入。而在下一步规划里,他们要通过新的模型架构、训练算法和受控的本地参数更新机制,让模型具备在本地持续自我更新的能力;这版模型目前正在推进备案。
05那么,RSI 到底实现了吗
没有。至少按严格要求看:公开案例都还停在“弱 RSI”。判断标准可以拆成五个环节,看每个环节的决定权在谁手里。
逐项对照现在的公开案例,差距很具体:
- GPT-5.3-Codex 参与了自身的训练和部署,但训练目标、基础架构、算力配置和最终决策仍由 OpenAI 团队控制。
- Claude 能写大量代码、能跑实验,但选哪个研究问题、判断结果是否重要、哪些发现进入下一代模型,权力仍在人手里。
- AlphaEvolve 能发现更高效的算法,但它依赖人类事先设定的评价函数——只有能被快速、明确自动验证的问题才适合它。
- HyperAgents、Darwin Gödel Machines 这类系统已经能修改“改进自己的那套机制”,但它们改的主要是智能体程序、工具组合和任务流程,并没有重新训练构成核心能力的基础模型,运行范围与算力也由人提供。
真正的风险点,也正落在这里:如果提假设、跑实验、评结果、批准上线都由同一个系统握手,就成了“自己命题、自己答题、自己阅卷”。Anthropic 在自己报告里的判断是:完整的 RSI 尚未实现,也并非必然会出现,但它到来的时间可能早于多数机构做好准备的时间。为此它提出建立协调且可核查的减速或暂停机制;OpenAI 则主张强化对前沿模型的评估、建立独立评估生态,并把 RSI 进展列为重点监测对象。
06另一派声音:为什么“爆炸”没那么快
视频结尾抛出的问题是“会不会走向智能爆炸”。这个问题在业内并没有共识,反方给了几条很实在的理由:
加速派的理由
- AI 已进入研发循环的多个环节,且每个环节的效率都在提升
- 制约大模型迭代的稀缺资源正在从 GPU 转向高水平研究员的时间
- 模型越强,越容易发现新算法与更高训练效率,形成正反馈
减速派的理由
- “有损自我改进”:系统越复杂,摩擦与协调成本越拖慢飞轮
- 成本:前沿系统的开发动辄数十亿美元,没人敢完全托管给 AI 自主跑
- 物理约束:算力、电力、芯片产线、机器人,仍深度依赖人类社会
- 另一种想象是“AI 寒武纪”——大量不同智能体共存演化,而不是单一超级智能
还有一种更贴近现实的时间表:人类研究者不是被一次性替换,而是逐层退出——先不再亲自调试细节,转而负责选研究方向,再往后像项目主管或 CEO 那样定目标,最后变成监督者。
07普通人该盯哪三个信号
RSI 这件事离日常并不远,但它很难靠一句“AI 又变强了”来判断。看这三个地方更实在:
- 评价权——成功标准是谁定的?如果模型能改自己的评分规则,那闭环就危险了;只要评价函数仍由人设定,AI 就还是在人类画好的场地里跑。
- 权限——算力账户、模型权重、部署开关、自我复制的通道,是不是同一个系统全握着。Anthropic 与 OpenAI 提出的监管思路,核心也都是拆开这个闭环。
- 可回溯——实验有没有完整日志、能不能回滚、有没有隔离环境。StartLux 说的“人工介入刹车”,本质上也是这一条。
回到视频里那个比喻。把 AI 送进“社会大学”其实很准确——真正的门槛不是它读了多少书,而是在真实任务里能不能自己发现问题、自己判断下一步,并且有人还能扣得住它的分数。RSI 让人紧张的从来不是“AI 会写代码”,而是这套循环的四个关键动作,可能被同一只手同时握住。