他拥有创始人独有的影响力,直接插手芯片分配,给Gemini团队开辟特殊算力通道,砍掉优先级不符的芯片项目,甚至收集员工编码数据,用来训练模型代码能力。内部员工评价布林,已经彻底信奉AGI,把RSI当成谷歌翻盘的唯一机会。路透社在8月就报道,布林在全员会议上催促团队,把资源全面倾斜到自我改进方向。 最近AI圈炸出一桩悬案:一张API截图、一句藏头诗、一批紧急收回的密钥,所有人都在问同一个问题——谷歌DeepMind是不是已经跑通了传说中的RSI递归自我改进? 这个概念在学术界讨论了二十年,简单来说,就是AI不再单纯等着人类投喂数据、人工评估效果,而是可以自己评估、迭代、训练下一代更强模型。一旦这套闭环跑通,AI研发的节奏会从按季度更新,压缩到以周甚至天为单位。 截图的真假至今没有第三方实锤,谷歌全程沉默。但巧合的是,另一边Anthropic的CEO公开表态,RSI已经在整个行业发生,连自家内部也出现了这类现象。再加上谷歌近期反常的模型迭代速度,很难不让人猜测,AI竞赛的底层规则,正在发生改变。 一、藏头诗与API截图,一场突如其来的泄密风波 整件事的导火索,始于9月11日X平台上一条不起眼的祝贺帖子。账号lyra发文向DeepMind道贺,句子里刻意大写的三个字母拼在一起,刚好是RSI。 这条帖子很快引爆评论区,不少圈内人开始寻找线索。没过多久,另一位网友放出一张API返回截图,JSON信息里出现了`rsi-model-liverl-le`这个内部模型名称,标注为RSIModelLiveRLLE。配套参数写着1048576输入token上限,输出最高65536token,和Gemini现有模型规格高度吻合。爆料还提到,后台存在编号从00到09,一共10个专属训练槽位,专门留给这套RSI体系。 事情发酵之后,lyra直接@谷歌AIStudio负责人,直言谷歌不该因为这次泄露,直接批量吊销内部API密钥。他称这批密钥来自谷歌内部员工,可以访问上千个模型检查点。谷歌当晚紧急收回相关密钥,之后就不再发声,官方至今没有确认,也没有否认截图的真伪。 当然,这张截图本身无法被独立验证。不少人提出疑问:有可能只是内部测试代号,也可能是爱好者制作的恶作剧。可它之所以能短时间传遍整个AI圈子,并不是单凭一张截图,而是刚好和谷歌最近一系列动作完美对上。 二、微厨房作战室:布林押上全部资源豪赌RSI 如果说截图是流言,那谷歌联合创始人谢尔盖・布林在山景城总部的布局,是实打实被媒体拍到的现实。BusinessInsider报道,布林如今的办公地点,不是高管办公室,而是大楼里一间改造后的微厨房。 这里被改造成战时指挥中心,U型桌子围坐着DeepMind负责人,谷歌CEO劈柴哥每周会多次过来开会。这间微厨房最大的作用,就是绕开公司层层官僚流程,集中资源攻坚RSI。 作为谷歌的奠基人,布林对Gemini当前的追赶进度并不满意。OpenAI、Anthropic持续发力,谷歌旗舰模型多次延期,核心人才接连出走。单纯依靠传统模式堆算力、人工调参,永远只能跟在对手身后追赶。布林的解决方案,就是把赌注押在递归自我改进上。 在他的设想里,Gemini不再是传统大模型项目,而是像初创公司一样快速试错。人类研究员慢慢打磨模型的旧路径太慢,他想要一套可以自动迭代的循环:模型自己评估缺陷,自动生成改进方案,训练更强的新版本,新版本继续循环优化。 三、藏在官方博客里的伏笔:三周更新一次的Flash模型 很多人忽略,早在这次截图风波之前,谷歌已经在公开文档里,写下了关于递归自我精炼的描述。9月2日发布Gemini3.8Flash和Cyber版本时,官方博客有一句话,当时很少有人读懂分量:模型的进展,由长时间运行的智能体循环加速,循环用来递归评估、精炼底层模型。 翻译成人话:谷歌已经在用AI智能体,自动评估、优化大模型本身。 这次发布本身就足够反常,六周之内连续推出3个Flash版本,3.7Flash上线才三周,3.8Flash就接踵而至。传统AI研发,一轮训练、评估、调优,最少要一个季度,需要大量研究员、标注人员手动测评。三周一次迭代,人力根本跟不上这样的节奏。 新版模型成绩同样亮眼,3.8Flash在推理基准拿到54.9%,专门做漏洞挖掘的Cyber版本,真实漏洞挖掘成功率突破70%。DeepMind研究员姚顺宇当时点评,这对于模型只是一小步,但对RSI来说是巨大飞跃。另一位研究递归改进的研究员判断,这正是RSI飞轮产生复利效应的特征。 大家之前只是把这句话当成宣传话术,直到RSI模型截图流出,所有人回头重读这段文字,才意识到谷歌早把线索放在公开文章里。爆料账号lyra也提到,想要看懂这次事件,重点不是截图,而是Flash系列越来越快的迭代节奏。 四、全行业集体踩刹车:RSI已经不
发表评论