在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境
在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
搜索
大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
过去两周,AI圈最让人坐不住的三个字母,就是RSI。
「人类造的最后一个 AI」还有多远?OpenAI、Anthropic 等头部厂商进度如何?定义中国 RSI 的 roadmap——前沿 AI 研究机构 Theseus Labs 结合 72 家产业实践,推出「RSI 五级框架」
Claude Opus 5.2深夜在Claude Code中开启灰度测试悄然上线,开发者通过抓包确认前端未变的Opus 5已被路由至5.2版本,响应速度和自主迭代能力显著提升;同时Anthropic内部代号Model 2的模型在CoBench v2榜单取得62.8%高分并接管大部分代码编写工作,RSI进程疑似加速。
让模型自己生成训练数据、自己改写提示词、自己修复代码,这条路线被称为: 递归自我改进(Recursive Self-Improvement,RSI)。
谷歌DeepMind被传已实现递归自我改进(RSI),其生成式语言API中出现名为rsi-model-liverl-le的模型,联创Sergey Brin力促Gemini团队全力押注RSI方向,Gemini Flash以每三周迭代一次的节奏加速发布,但相关截图真伪尚未得到第三方验证。
智谱宣布完成约50亿美元融资,募资净额约60%将用于下一代GLM基础模型及完全自训练体系(含递归式自我改进RSI)的研发,并支撑算力基础设施建设,同时约15%用于业务拓展与战略投资,约25%用于优化资本结构与补充营运资金。
第一篇AI4AI综述论文将long horizon智能体、AI4AI与recursive self-improvement纳入同一研究地图,指出AI能在明确目标与评价规则下承担部分研发工作,但单项能力提升无法证明完整流程可靠,持续自我改进仍面临组合鸿沟等验证挑战。
openJiuwen首发双维度RSI框架,在WorkSwarm蜂群办公智能体上落地Harness与Artifacts双维度优化,支持科研论文和算法程序两类交付产物迭代,并依托昇腾算力亲和能力降低多轮优化的时延与资源开销。
Agent 完成任务后,学到的经验去了哪里?