谷歌似乎跑通了RSI。一个名为「rsi-model-liverl-le」的模型突然出现在Google生成式语言API的返回结果里。这个模型正是递归自我改进(Recursive Self-Improvement,简称RSI)。

谣言迅速传播,称谷歌DeepMind已经实现了RSI。网友Chubby还在推测之际,Anthropic CEO公开宣布全行业包括Anthropic,RSI已经开始发生。这让Chubby相信传言是真的:RSI已经被实现了。据称,Google内部不止这一个模型,在同一批标签下还有从00到09编号的10个专属训练槽位。当晚,Google紧急收回了一批相关API密钥,但之后没有进一步的官方声明。

这起风波始于一句看似普通的祝贺。9月11日晚,爆料账号lyra给Google DeepMind发了一条帖子,内容中三个大写字母拼成RSI。这条帖子迅速引发热议,几个小时后,另一个账号Lentils直接发布了实锤截图。截图显示,Google的API返回了一段JSON代码,模型代码为「rsi-model-liverl-le」,参数规格是输入上限1048576个token,输出上限65536个token。Lentils指出,如果GDM内部真有这样一个模型,并且还有10个专属的训练槽位,那确实非常惊人。

LiveRL被认为是在线强化学习,即模型一边运行业务,一边自我进化。接下来,lyra发文@了Google AI Studio负责人Logan Kilpatrick,称没有必要因为怕他而收回API密钥。他还透露这批密钥来自GDM内部员工,可以访问超过1000个内部checkpoint。Lentils紧随其后嘲讽道,“我闻到了恐惧的味道。”

尽管这张截图的真伪尚未得到第三方验证,但它与Google最近的报道吻合。三天前,Business Insider报道称,谷歌联合创始人Sergey Brin对Gemini的进展速度不满,力促员工更加专注于递归自我改进。Brin回归Google后,在总部Gradient Canopy大楼的一间改造过的微厨房办公,旁边是DeepMind现任负责人Kavukcuoglu,Sundar Pichai每周也会来几次。Brin直接插手芯片分配,开辟了算力特权通道,甚至推行了一项激进计划,监控部分员工的编码过程,用这些数据训练Gemini的代码能力。他的核心诉求是全公司必须以最快速度向RSI发起总攻。

Brin如此急迫的原因在于Google在AI竞赛中掉队了。Gemini 3去年11月短暂登顶后被Anthropic和OpenAI反超,新一代旗舰模型因编码能力不达标推迟了两个月发布。同时,核心人才不断流失。Brin的赌注是彻底切断原有赛道,让模型自己评估、修改自己,将迭代周期压缩到按周计算。这条路一旦走通,落后两个月的旗舰模型将不再是痛点,Google将获得降维打击的迭代速度。

9月2日,Google发布了Gemini 3.8 Flash和3.8 Flash Cyber。官方博客中提到,这些模型的进展被长时间运行的智能体循环加速,这些循环递归地评估和精炼底层模型。这意味着谷歌可能已经实现了RSI。姚顺宇评价道,这对模型而言是一小步,但对RSI来说是一次巨大飞跃。Sicong Jiang更是乐观预测,这是RSI飞轮开始产生复利效应的时候。

DAIR.AI创始人elvis认为,这就是递归自我改进(RSI)飞轮的早期成果。三周一个版本,六周三个大跨度跃升,这种迭代节奏表明人是跟不上的。事后lyra也指出,大家应该去读读Google的官方博客,看看最近几个Flash版本的发布间隔,RSI这件事其实已经非常明显了。

RSI概念在AI圈流传了二十多年,其核心是让AI自己修改自己的训练代码和方法,从而训出更强的下一代。今年,这一概念终于变为现实。各大厂都在向这个终点狂奔。Dario Amodei正式宣布,RSI已经在整个行业发生,包括在Anthropic内部。但Google的信号不同,其他两家说的还停留在“AI辅助我们做研究”,而Google的博客直言“循环在递归地蒸馏模型”,X上流出的是带有RSI命名的正式模型标签和训练槽位。

如果Flash三周一更的节奏真是靠这个循环驱动,那么Google手里握有的不仅是模型,而是进化速度本身。下一个Flash的发布时间将成为验证的关键。AI竞赛过去三年比的是谁的模型最强,现在比的是谁的循环转得最快。模型强不强变成了一个中间量,循环每转一圈,它就自动刷新一次。人类研究员在这个循环中的位置也在逐渐退后。如果那张截图是真的,AI研发史上第一个由模型自己训出来的模型已经在Google的机房里运行。它的名字里直接写着RSI。
股票配资证券入口
配资出入金流程
元股配资新手指导提示:本文来自互联网,不代表本网站观点。