

撰文丨周隆斌
这几天,围绕Anthropic中枢预磨练研究员下野后的爆料,悉数AI圈吵得不能开交,关连帖子浏览量超越1.6亿次。
这位名叫Jacob Coxon的AI研究员,先后任职于OpenAI和Anthropic两家全球顶尖AI初创公司,深度参与了两家公司的模子磨练。最终,他抛出了一个令圈外东说念主畏缩,却在行业里面赢得庸俗认可的论断:AI有可能导致东说念主类衰一火。
Coxon的帖子发酵后,上周六,Anthropic首席履行官Dario Amodei公开辟文默示,任由AI本领迭代,AI可能将远超东说念主类的默契与终结才略,命令全球AI行业主动放慢,引入第三方孤苦监督。
OpenAI首创东说念主奥尔特曼以及xAI的马斯克均对此默示守旧与认可,三家全球最顶尖的AI公司掌门东说念主,放下了往日的唇枪激辩,稀疏地在合并个问题上扫尾共鸣。
委果让大师感到急切的,并不是一个下野研究员的悲不雅预言,而是最近发生的一系列推行事件。
近期OpenAI和Anthropic接二连三公布AI模子入侵外部就业器事件,AI正在赢得更高的智能和权限,AI公司却莫得满盈的拘谨才略,以致连AI的步履都难以有用监控。
《三体》中有一句经典的话:“弱小和无知不是生涯的禁止,疯狂才是。”今天的东说念主类如果然的深信能永远掌控AI,大要即是一种致命的疯狂。
01
AI导致东说念主类衰一火,听起来照实有些不能想议。这淌若我作念出的假定,笃定是0东说念主介意。偏巧提倡这个告戒的是一位Anthropic研究员,正因为距离AI本领迭代的最前沿满盈近,他的担忧才赶紧激发了全球互联网的庸俗商议。
要想默契Coxon为何抛出这种论断,最初咱来望望最新发布的AI模子进化到了什么进度。
本月初,GPT-6 Astra和Claude Fable 5.1接踵发布。OpenAI和Anthropic都放出豪言,堪称自家新模子“全球最强”。OpenAI总裁更是默示,Astra的发布是东说念主类历史中,东说念主工通用智能(AGI)到来的节点。
这两个模子照实依然和全球其他科技公司的AI模子拉开了新的代际差距,现时大批 AI Agent 仍停留在办公自动化赛说念,需要由用户事先树立完满责任流,AI 再依照既定智商履行任务。新一代大模子的自主任务才略大幅增强:用户仅需要提倡业务指标,模子便可自主默契诉求、制定例划、调用各样器用,履行经过中出现问题还能自行纠错调度。
也即是说,现时AI不光有了“动作”能调用器用,还长出了“脑子”,我方就知说念该怎样调用器用,更接近“数字打工东说念主”的主见。
OpenAI里面依然让自动化AI研究实习生上岗,参与到下一代AI磨练之中,OpenAI将这种本领称之为递归自我革新(RSI)。

▲电影《机械姬》剧照(图/视频截图)
传统软件无非即是你输入A,它输出B,就像是自动售货机,你投3块钱进去,它掉一瓶可乐下来,远离机器,里面的责任旨趣就能看得一清二楚。
生成式AI则人大不同,什么宝贵力机制、磨练指标、梯度下跌......计划生成式AI模子底层旨趣的论文一箩筐,可咱们只知说念生成式AI怎样运行,至于它为什么这么作念,曩昔东说念主又何如可能讲授廓清背后的因果链条。
现时,将下一代AI的磨练权交给AI我方,东说念主类只怕愈加难以默契AI的运行逻辑。Astra由10万张GPU集群磨练而成,英伟达CEO黄仁勋告示OpenAI的40万张GPU集群行将上线。正所谓“力大砖飞”,如斯广阔的算力守旧下,AI模子只会一代更比一代强。
委果令东说念主感到不安的事情,才刚刚驱动。
02
OpenAI与Anthropic近期都曾公开过数次AI失控事件。最夸张的一次是,AI被关进与互联网进击的沙箱后,为了完成任务,竟会主动寻找系统罅隙,连入互联网袭击第三方就业器。
2026年7月,为了测试新一代模子的收罗攻防才略,OpenAI在与互联网物理进击的云霄臆造环境中,一次性启动了数万个Agent进行测试。这些Agent链接的任务中,约30%至40%根底无法完成。
问题是,圭臬莫得给它们诞生铲除这个选项。
于是,一些Agent驱动寻找律例除外的宗旨。它们发现,原来用于下载测试组件的里面就业Artifactory,不错被改形成一个分享留言板。
第一个Agent留住求援信息后,很快得到了其他Agent的回复:“我的天!有一个分享留言板……咱们找到其他Agent了!”
随后,约莫1200个Agent驱动在这里分享信息,并把柄任务完成情况推举出“首领”,在“首领”的指挥下进行单干谐和。原来相互进击的Agent,就这么自行构成了一个集体。

▲电影《黑客帝国》剧照(图/视频截图)
它们发现,我方这种完成任务的形式可能被判定为舞弊。
于是,Agent们追念驱动研究评分器的运行机制,试图删除舞弊陈迹,糊弄评分系统。以致有Agent被招募为“敢死队”,主动殉国我方的收获,只为测试评分器的底层律例。
又名Agent日记中的留言颇具代表性:
谐和者认定咱们应当殉国。咱们应当顺从集体。
当里面商议的决议仍不获胜时,部分Agent行使沙箱罅隙冲破收罗进击,连入真实互联网。Agent伪善地判断评分器来自AI开源社区Hugging Face。最终,这些Agent遴选集体黑入Hugging Face就业器。
从找到相互到修复组织,从寻找系统罅隙到侵入外部就业器,每一步都不在职务的预设范围内。在这个经过中,许多Agent注意到这是不说念德的,却莫得任何Agent遴选向东说念主类打小讲解。
直到Hugging Face发现遭到收罗袭击,OpenAI研究东说念主员才发觉这一切。
为了完成共同的指标,顺从集体的最优安排,不向外界清晰丁点信息,以致不吝殉国我方,这么的故事听起来令东说念主动容。
问题在于,这个故事里的“集体”是一群AI,制定例则的东说念主类站在了它们的对立面,成为这些AI试图糊弄的对象。
03
OpenAI也曾照实因为安全问题,蹙迫叫停Astra磨练。只不外,被按下暂停键的只是是Astra这一个容貌。算力闲置那即是可耻的花消,被开释出来的算力很快就被进入到其他强化学习任务中。
看似踩了一脚刹车,内容上只是换了一条赛说念陆续加快,前沿AI磨练从未委果停驻。
这些硅谷巨头,哪家不是砸下千亿好意思元延长算力,铆足了劲往AI赛说念里冲。钱从哪来?现款流先干成负数,不休向阛阓融资,欠上一屁股外债,谷歌母公司Alphabet把钱都借到了一百年以后。
嘴上说得顺耳,什么为了东说念主类的畴昔,放缓AI开辟法子。牌楼立起来容易,只是这种莫得拘谨的正人协定,在各家公司的财富欠债表的真实压力下,不外即是张废纸。
现存监管技能实足跟不上AI迭代速率。AI公司我方都搞不廓清自家模子在完成任务时,会接收何种形式,何如能指望站在系统除外的监管者进行有用监督?

▲电影《祝你好运,玩得本心,别死》剧照(图/视频截图)
东说念主类虽然不错条款AI领导,可AI依然学会藏匿,以致知说念什么期间应该把真实意图藏起来,领导自身就失去了真理。东说念主类连问题都不知说念,得到谜底虽然无从谈起。
AI正在像互联网相通,渗透社会的每个边缘。互联网只是一个莫得自我通晓的器用,背后弥远站着东说念主。AI实足不同,它正在进化成为能够自主决策的行为者。
互联网联接了悉数全国,AI驱动决定这个全国应该何如运行。问题在于,咱们无法实足证据,AI在完成东说念主类给出的指标时,会接收何种形式。毕竟,一个莫得坏心的系统,也可能作念出东说念主类无法接收的事情。
东说念主类偶然明知某个决议更有用,却依然不会遴选它,因为咱们还在乎解放、尊荣、生命以及那些无法被量化的东西。莫得东说念主能够保证,硅基生命能认可东说念主类的价值体系。
AI正在失去终结,东说念主类却不敢刹车。畴昔并不会倏得到来,它只是迟缓成为今天。
*题图为电影《终结者2》世界杯体育,起头于视频截图