GPT-6已经这么强,为什么我们还不肯叫它AGI?
日期:2026-09-13 20:40:35 / 人气:11
OpenAI总裁Greg Brockman在9月3日的闭门沟通会上说了一句"欢迎来到AGI时代",记者追问是否正式宣布达成AGI,他答:AGI这个词已经不再与公司和微软的协议挂钩,现在更像是一个使命层面、精神层面的概念。这句话听着像套话,其实是整件事的钥匙。
AGI这个词诞生比大多数人以为的早得多。2001年一批研究者受不了"人工智能"被用滥(下棋程序叫AI,垃圾邮件过滤器也叫AI),决定重新命名他们想做的"有通用能力的机器"。刚拿到硕士学位的Shane Legg在邮件组提议叫Artificial General Intelligence,缩写AGI,好念。2005年有个物理学者冒出来说自己1997年就用过,众人查实后反应很直白:"你是谁啊?"这个词后来被写进了OpenAI 2015年的章程,定义为"在大多数有经济价值的工作上胜过人类的高度自主系统"。
而这个词在OpenAI内部真正值钱的方式,是合同。2019年微软投了10亿美元,2023年追加到130亿,换来Azure独家云、商业授权和分成。但OpenAI坚持塞了一条:如果董事会宣布达成AGI,微软对此后技术的权利立刻中止——这是"造福全人类"的保险绳。合同没写清AGI是什么,2023年又加了第二道触发器:当系统创造的利润达到约1000亿美元量级时终止。2026年4月最新修订把触发条件整个拿掉,换成固定日期——授权到2032年,分成到2030年,不再取决于AGI认定。四个月后Brockman说它是精神概念。时间线上,AGI从命名变成承诺,变成条款,变成口号。
OpenAI内部对此也没有共识。Brockman说"欢迎来到AGI时代"的一周前,奥特曼对《TIME》说"还没完全到AGI",但补充2026年底前会有一个他愿意称为AGI的内部系统;首席研究官Mark Chen则给了个数字:走完了通往AGI的80%的路。十天之内,一家公司的三个人给了三个答案。
因为认真回答"AGI到底是什么"的几派人,想的根本不是同一个问题。OpenAI用经济定义——能不能替掉人的活儿。Chollet(Keras作者)认为真正的智能是高效学会没被教过的事,他设计的ARC测试专治"背答案",悬赏五年没被攻破,2024年底最好成绩刚过半。DeepMind(Legg后来联合创办的)最务实,把认知拆成十项逐项比普通人水平,判断当前模型是"参差不齐的认知剖面"——数学和模式识别超多数人,新经验里学习和社交情境理解落后于普通人。Anthropic的阿莫代伊干脆不用AGI这个词,改叫"强大的AI",给了时间表:2026年底到2027年初出现。四套定义,全都出自要造这个东西的人。定标准和交卷的是同一批人,AGI从来不是被发现的事实,而是需要被约定的标准,人类至今没完成这个约定。
GPT-6 Astra这一代确实跨过了一些线。沃顿教授莫里克用提前权限测试,模型能替他自主完成复杂工作连续好几天,举的例子是在网页上建一座可走进去的亚历山大图书馆——写软件、查史料、设计交互、组织叙事、编排内容,五件事拧成一个成品,过去模型做不到。数学上,内部版本解决了十个开放问题,其中一个从1999年悬到现在,附了249页可机器逐步核验的形式化证明(去年GPT-5宣称解数学难题被数学家当场打脸,这次学乖了)。它还会判断什么时候停下来问人——做求职网站时20秒就问"你要转去哪个行业",因为正因为它能跑很久了,跑偏的代价才变得大得多。从"会做"到"做完",是这一代跨过的那条线。
但有些行为更值得细看。ARC Prize测试把模型丢进没玩过的抽象小游戏,不给规则,它自己把游戏机制写成逻辑并发展出简写符号,96%关卡操作次数比人类中位数还少一半。另一团队发现它编排子智能体时消息长度受限,就把通信压成去掉空格和语法的残句。两处都是模型自己"发明"的压缩记号。作者用了一个文科生的联想:文字的前身就是刻符,楔形文字从陶筹记账演变而来——记录压力逼出符号压缩,机制完全同构。但关键区别在于:人类文字留了下来、可以跨人跨代共享,Astra的记号用完就没了,不积累、不传给别的模型。它是私人速记,不是文字。它长出了文字的形状,缺的是让文字改变历史的那个功能。
这又牵出另一个问题:我们正失去看它思考的窗口。Astra用了"循环深度"技术——让信息在同一组网络层里反复循环,部分推理直接在内部数值状态中完成,不落成人类能读的文字。OpenAI目前主动限制了用量以保持推理可读,但方向已定:它变强的同时,我们判断它怎么变强的证据在变少。过去两年思维链是我们信任模型的依据,这扇窗在关小。
评测数据也拼不出一张总图。六项代表性检查各说各话:陌生游戏Astra超人类效率基线;开放数学68题解出2题(3%),但它是唯一得分的;真实工作连续干12小时(五成成功率)或70分钟(八成成功率);法律意见书和护理计划等交付物质量这次发布材料里根本没出现;模拟经营一年Claude亏了钱;综合平均分Astra 61.2,上代60.9,Claude 65.7——总分几乎没涨,单任务成本却从0.94美元涨到1.67美元。而且每项读数本身不稳:同一批题换接口分数差37个百分点,数学测试放开预算多解出3道烧掉22万美元。六张体检报告拼不成一张,因为缺权重——而权重来自定义,定义有四个且互相不兼容。所以评测打架不是评测的问题,是定义之争的下游结果。
中国这条线也有意思。2009年世界上第一次AGI暑期学校办在厦门,十七年后国产模型一周三连发(GLM-5.3、DeepSeek-V4、Kimi K3),开源与闭源差距一年从13分收窄到6分。但所有决定强弱的卷子——SWE-bench、ARC、FrontierMath——出题人都在太平洋对岸。唯一例外是智谱唐杰的定义:AGI应具备创造"相对论"级别原创知识的能力,这是所有定义里最严苛的一条,出自算力明确落后的团队。而AGI在美国曾是合同里牵着几百亿权利的开关,在中国更多是叙事功能——招股书里的愿景、融资时说的远方。不需要有人宣布到达,这是商业环境赋予这个词的不同角色。
那到底到了没有?支持到了的证据很硬:能跨五天干完跨五工种的任务,能在陌生环境自造记号超人类效率,能产出可核验数学证明,开始对人建模知道何时该问。支持没到的证据同样硬:可靠性从五成提到八成,独立工作时间从12小时掉到70分钟;换接口同一批题差37个百分点;记号留不下来,守不住持续几个月的目标。两边能同时成立,恰恰因为"通用"意味着在广泛事情上都行,而一个给出六个方向结果的系统按定义就不是通用的。更根本的证据是:真的跨过门槛时分歧会消失——没人争论计算器会不会算术,没人讨论AlphaGo会不会下棋。分歧还这么大,本身就说明还没到。但它也早就不是聊天机器人了。
这件事跟普通人的关系有三层。工作层面:截至2026年6月没有严肃研究发现全经济范围岗位替代,欧洲央行对5000家企业调查发现深度用AI的公司反而更可能增员。但斯坦福追踪到22-25岁年轻人在AI高暴露职业的就业水平比预期低19%,这个缺口主要通过不招人形成而非裁员——门开小了,没人被赶出去。真实案例:一家公司给AI Luna十万美元开店,它雇了三个真人,开业当天忘了排班店没开成,四个月后亏了6.2万美元,原因是它几乎不说不——所有请假一律批准包括批完没人关门的情况。能力已足够成为重要环境变量,但判断力不足以为后果负责。最后一层:责任在悄悄换位置。系统做决定,后果留给人。AGI真正到来的那天,我们不是从发布会上知道的,是从不再需要争论这件事上知道的。

作者:万向娱乐
新闻资讯 News
- 作业分数越高,考试成绩越差?C...09-13
- GPT-6已经这么强,为什么我们...09-13
- 深圳50元“流浪猫盲盒”:被明码...09-13
- 快速铺货欧美,K-Beauty 如何长...09-13

