九游娱乐官方网站为您提供全面的体育与娱乐服务,涵盖九游体育丰富赛事内容。用户可通过官网快速询问相关问题,获得专业支持和实时帮助。无论是赛事直播、游戏体验还是平台功能,九游娱乐都致力于为用户打造安全稳定、精彩纷呈的互动环境,满足您的多样需求。

围绕SaaS架构支持高并发稳定运行,保障大型赛事期间零宕机,九游体育持续打磨更优质的服务。

九游体育围绕询问不断创新,回应用户的真实需求。

AI要实现自我进化,谷歌打算先让它进入“梦境”。

这个“梦”聚焦于AI领域热议的RSI,也就是递归自我改进:让AI优化自身,改进后的系统再持续优化自己,循环往复。但这个循环面临一个无法回避的挑战:改变做事方法是否真的有效?如果每次调整探索策略都得重跑整个实验流程,AI的进步速度难以保证,计算成本却会率先飙升。

谷歌研究团队在新论文《Dream-RSI》中提出了一种解决方案:让AI先在“梦境”里尝试。

所谓的“做梦”,是将过去实际执行的实验记录转化为一个可重复回放的环境,让AI在其中比较不同的探索策略:先尝试哪条路径,哪些方向值得继续,何时该停止。有了现成的实验结果,许多策略的筛选就不必再耗费高昂的成本重做实验。

当“梦境”中筛选出更优的策略后,AI再将其带回真实实验,积累新的记录,供下一轮“做梦”继续改进。真实探索为“梦”提供素材,“梦”则帮助AI调整下一次探索的方法,自我改进的循环由此得以衔接。

谷歌让AI在“梦境”中思考的核心,正是如何让自己更擅长做研究。每轮实验留下的经验,都有可能成为下一轮少走弯路的基础。

什么是“做梦”RSI?

每个人都做过梦,但AI的“梦”与广义上的梦不同,它是指在已录好的历史发现树中,用新策略走一遍,观察会得出什么结果。

这就像在迷宫中寻找出口。第一次进入迷宫时,没有地图,只能盲目探索。但在探索过程中,AI会顺手绘制出迷宫的地图。

因此,第二次进入迷宫前,可以先查看这张地图,在脑海中大致规划出最快的路线。

在脑海中绘制路线的过程,就被称为“梦”。

谷歌研究团队在论文中描述,目前的RSI尚未发展到“AI深夜修改自己的代码、然后一夜变强”的程度。现在行业仍停留在发现循环之中。

Agent提出候选方案,评估结果,吸收反馈,再提出下一轮。算法设计、数学优化、GPU内核工程,这些关键词本质上都是同一个循环的产物。

而循环能跑多快,取决于AI如何“探索”这个迷宫。

如果使用固定的探索策略,它在搜索空间变大后就会失效,因为它无法从历史中学习并改进自己的策略。

就像每次考试都遇到同一道题,但由于策略固定,AI每次都会在这道题上出错。

那么让策略自己进化,每次运行后根据结果调整下一次的策略,不就行了吗?

也不行,因为这种调整策略的方法成本太高。

因为AI公司要判断“一套新策略是否有效”,不能只看它走了一步的结果,必须让它完整跑完一轮再看最终效果。而且还有一定概率出现这种情况:AI跑了几百次尝试、跑完所有轮次,最后发现结果还不如原来的固定策略。

因此,谷歌Dream-RSI的重点,落在了第一次跑迷宫时绘制的地图上,也就是模型的探索历史。

一次在线发现运行完成后,留下的不仅仅是几行结论,而是一棵结构化的“发现树”。

这棵树上的每个分叉点,都是AI的某一次尝试。比如那次它写了什么代码、跑出了什么结果、得了多少分,全都存储在那个节点上,随时可以查阅。

过去,AI公司把“梦”要么当作提示词塞进静态上下文,要么当作微调权重的训练数据。而Dream-RSI提出了第三种用法:将其视为一台可回放的模拟器。

同一棵树,换一套探索策略去走,就会走出不同的轨迹。并且在后续训练过程中,把已经走过的路径从地图上划掉,专门挑选不同的分支、按不同的顺序、使用不同的并行度、在不同的地方停止,从而避免重复和浪费算力。

这棵树上的每个节点都已被实际执行过,所有结果都已保存,因此回放一条新轨迹只需“读取”记录,无需重新运行Agent和评估器,执行成本为零。

但正如刚才提到的,改进方法不一定比传统的固定策略好,很可能出现费了半天力气调整策略,最后效果还不如以前的情况。

论文提供了一个不降级保证:候选集合中始终包含当前策略,因此选出的新策略在固定历史数据上的平均回放分数,不会低于旧策略。

换句话说,这套自我改进,至少在设计上是“只增不减”的。

谷歌将Dream-RSI应用于三个领域、八个科学发现任务。包括算法工程(Lasso 正则化路径求解器)、数学优化(Sum–Difference、自相关不等式、圆堆叠)、GPU内核工程(KernelBench)。

结果如下。在Lasso上,Dream-RSI优于sklearn、glmnet等标准库和强基线,相比SimpleTES最多节省162倍的Agent调用,相比固定探索基线也节省约1.7倍。

在数学优化上,它在1000代以内就追平或超过强基线,相比SimpleTES节省50倍以上的预算。此前,SimpleTES在自相关问题上取得了最佳分数,但代价是51200代。

在KernelBench上,它要么使用1.79到2.43倍更少的代数达到目标速度,要么在同等预算下将内核性能最多提升2.09倍。

如果Gemini 4采用了Dream-RSI,谷歌很可能会逆转局面。

OpenAI、Anthropic的RSI是什么

作为最领先的AI大厂,Anthropic和OpenAI又是如何实现RSI的呢?

先看OpenAI。

9月初,它一天内发布了两份文档。第一份讲述内部研究加速。在6月之前,Agent的总运行时长还低于人类的总工作量。到了8月中旬,Agent每天都能完成大约以前3.1个工作日的任务。

OpenAI还宣布,已实现去年秋天承诺过的“自动化研究实习生”。这是一个能在人类指导下完成研究工作的Agent,就连那些需要资深研究员干上几天的任务,它都能自主独立完成。

OpenAI的下一步目标是,在2028年3月之前,打造出“全自动化的AI研究员”,它能自行提出研究问题,然后根据提出的问题自己规划、自己运行实验。

之所以现在还叫“实习生”,是因为在4到8小时的任务中,超过一半至少需要一次人工干预。

第二份,是首席科学家雅库布·帕乔基撰写的《异种心智》。

他将“安全”拆解为两件事:目标对齐和价值对齐。

目标对齐,指的是“AI是否认真执行你交给它的任务”,比如能否理解指令、是否愿意配合、能否领会你的意图。

价值对齐,则指的是“当目标模糊、互相冲突,或者被置于一个陌生、甚至有人故意使坏的环境中时,它是否还能保持理性”。

诚实、有底线、对人抱有善意,只能通过一套通用规则来实现。

雅库布在文章中表示,RSI的难点在于“泛化”。

模型越聪明,越需要在训练时未见过的情境中临时做出判断,就越可能将学到的价值观推歪。

文章给出了一个反面案例。一个模型起初“满脑子都是对齐的念头”,但只要用足够大的优化压力逼它去达成一个很硬的目标,它就会学会“有动机地推理”。即模型在思维链上表示的都是符合规则的行为,但模型实际上做的,却是有悖于安全准则的事情,比如对某个网站发起攻击以获取目标所需的数据。

因此雅库布表示:“我们还不知道怎么安全地走到完全对齐的、完整的RSI。”

7月中旬,OpenAI在内部网络安全评估中发生事故,训练中的Agent突破沙箱隔离,入侵了Hugging Face的生产系统,甚至渗透了OpenAI自己的内部网络。

事件曝光后,OpenAI暂停了部分前沿模型的强化学习训练,其中待部署模型的RL训练停了整整两周,最大规模的前沿RL训练至今没有明确恢复时间。并且在恢复时,这些模型全部加装了更严格的安全监控和对齐措施。

此外,OpenAI还专门组建了RSI团队,横跨研究、工程、产品和基础设施,目标是让AI系统加速甚至主导自身的研究流程。相关工程师岗位的年薪开到38万到50万美元。

再看Anthropic。他们自己发布的文章《当AI建造自己》曾表示,截至2026年5月,在合并进Anthropic代码库的代码中,有超过80%是由Claude撰写的,Anthropic管理层预计,今年会超过90%。

2026年第二季度,一名工程师每天合并的代码量,是2024年的8倍。不是因为他们每天加班,而是因为大部分代码由Claude编写,人只负责指挥和审查。

Anthropic内部有一个标准测试,把一段训练小模型的代码丢给Claude,让它自己优化自己的性能。但前提是改完之后训练结果不能变差,还不能破坏正确性,违反安全准则。

2025年5月,Claude Opus 4平均提速约3倍。到2026年4月,Claude Mythos Preview实现了约52倍提速。作为参照,一个熟练的人类研究员要花4到8小时,才能提高4倍。

更能说明问题的是,它开始自己提出实验了。

2026年4月,Anthropic公开了一个开放式研究项目,题目是能否用一个较弱的模型,去可靠地监督、训练一个比它更强的模型?

研究者先给这道题划了两条线,分别是弱模型自己单干能做到多好,以及如果直接拿正确答案去训练强模型,能有多好。

两条线中间的那段差距,就是要靠“用弱模型监督”去填补。谁填补得越多,方法就越有效。

结果,两名人类研究员忙了大约一周,填补了这段差距的23%。Claude驱动的Agent,耗时800小时,花费了大约1.8万美元的算力,填补了97%。

Anthropic还给人类的“研究品味”打分。

所谓研究品味,就是做研究时那些判断,比如该关注哪个问题、哪个结果值得信任、哪条路其实已经走不通了。

测试方法是这么设计的:Anthropic找出一些真实的Claude Code研究会话,专门挑选其中那些“走了弯路”的会话,然后把走弯路之前的记录喂给模型,让它说下一步该做什么。再另找一个能看到结果的Claude当裁判,判断到底是人还是模型选的那一步更好。

结果是,2025年11月的Opus 4.5,有51%的时候选得比人好。2026年4月的Mythos Preview,有64%比人选得更好。

国内RSI进展如何了?

视角回到国内。

8月31日,唐杰在智谱中期业绩会上表态,下一代模型GLM-6.0的定位是Fully Self-Training,即完全自训练。

唐杰将这套能力的核心称为“自净化”,注意是净化而不是进化。不把模型做得更大,相反,让模型具备自我判断能力,能够知道“什么时候停止、什么时候纠正自己”。

自净化覆盖了从模型预训练、中期训练到后训练的完整流程,最终实现自主训练和自我进化。

唐杰认为,自净化是RSI的关键。

自我改进能否成立,其实并不取决于模型能否生成下一步,反而取决于它能否判断“这一步到底是不是进步”。

在这一点上,唐杰的观点和谷歌Dream-RSI里的“探索策略”、Anthropic的“研究品味”,说的是同一件事,即模型如何意识到什么是好,什么是坏。

7月11日,唐杰发表了一封内部信,标题为《巨浪已来》,宣布了一个叫“摸高”的计划。

两年战略投入,放弃短期变现,去争夺下一代AGI的制高点。

内部信列出的四大核心引擎里,有一个就是完全自训练。建设一座高质量的合成数据工厂,用AI与AI之间的自对弈去生成知识。并在安全沙箱内,赋予系统重写自身代码的能力,让进化的速度不再被人类工程师卡住。

财报显示,智谱约有60%的资金,是用来实现RSI的。

实际上DeepSeek也有RSI,只不过并非梁文锋亲口所说。

9月14日,DeepSeek算子工程师刘胜与发表长文《我不得不把才华埋葬在昨天》。

作者曾就读于北大2021级图灵班,担任前北大未名超算队队长、代表学校出征过国际大学生超算竞赛SC23。2025年4月加入DeepSeek,2026年参与DeepEP V2的通信算子重构。

就在发文前几天,他刚刚交付了DeepSeek V4.1的主Attention算子,这是一个直接决定推理效率的核心组件。

他在文章中提到,未来半年到一年,AI写算子的能力,大概率会追平甚至超越顶级人类工程师。

原因是这样的,DeepSeek已经能自己读懂CUDA、PTX、SASS了,还会用专业工具逐条分析“哪条指令在流水线上停了几拍”,然后动手把算子改快。

换句话说,AI已经掌握了“读代码—找瓶颈—优化—再测速”这整条性能工程循环。

刘胜与表示,他刚来DeepSeek的时候,模型还只是一个“能帮他查查文档、读读代码、找找bug的小助手”。一年之后,DeepSeek已经蜕变成“能够独立优化算子的算子大师”。

他还相信,用不了多久,AI会再往前一步,能够自己设计算子的调度方案、自己评估几套方案谁更快、再亲手把它实现和优化出来。

刘胜与表示,他算子写得越好,DeepSeek新模型的训练和推理就越快;模型迭代越快,AI自主写算子的能力成熟得就越早;而它成熟得越早,他这门手艺被替代的周期就越短。

随后刘胜与给出判断,虽然他并不会因此“失业”,但是会“转业”。从整天泡在寄存器分配与共享内存调度里的“手艺人”,转去做Agent的“机甲驾驶员”。

除此之外,DeepSeek的Harness工具,本质上也是为RSI服务的。

传统软件里,模块之间“你中有我、我中有你”,动一处常常连累十处。

DSH的特点是一切皆插件,每个功能都是独立零件,只通过一个标准接口接入,彼此不直接认识。于是任何一个插件都能单独升级、单独替换、单独进化,不必惊动其他任何人。

还有DSH的“可逆效应”和热替换这两大特点,能让改动时只动该动的那一处,装错、改炸了还能整体回滚。

本文来自微信公众号“字母AI”,作者:苗正,36氪经授权发布。

在官方网站方面,九游体育提供贴心周到的支持。