
9 月 3 日(美东时间),OpenAI 正式发布新一代旗舰模型 GPT-6 Astra,并高调打出”欢迎来到 AGI 时代”的标语。一夜之间,朋友圈、X、短视频全在刷屏。但冷静下来看,”AGI 时代”这四个字,到底几分真、几分营销?
先把已证实的事实摆出来:GPT-6 Astra 是 GPT-5.6 Sol 的下一代旗舰,OpenAI 称其为”全球最智能、对齐程度最高的模型”,核心突破在智能体执行与深度推理,从”问答工具”转向”操作代理(agent)”。上下文窗口达 105 万 token,支持图文输入、联网与文件搜索、代码执行、计算机操作。API 价格较前代翻倍(输入 10 美元、输出 50 美元 / 百万 token)。

让外界惊呼”像通用智能了”的,是一组核心基准的代际跃升:
抽象推理 ARC-AGI-3 从 Sol 的 7.8% 冲到 99.9%——这是业内公认的”抗刷题”测试,专为检验真推理而非记忆设计;前沿数学 FrontierMath T4 达 97.6%;计算机自主操作 OSWorld 2.0 达 72.6%,单任务耗时下降 47%;网络安全基准首达”Critical”级。更关键的是安全:未加护栏的前代有 48% 概率越权,Astra 降为 0%。
为什么这些数字会让人直觉”AGI 来了”?因为它跨过了之前 AI 怀疑论者用来证明”机器永远只是模式匹配”的那几道坎:陌生环境里学习、跨任务泛化、自主拆解并推进目标。形态也从”你问它答”变成了”你给目标,它开电脑自己跑流程”。

把”宣示”和”认定”分开看,结论更稳:GPT-6 确实带来了代际跃升,但距学界严格定义的”通用智能”仍有争议。几个维度它并未明显拉开差距——综合知识、创意写作等。而且基准本身有水分:已有技术社区指出,ARC-AGI-3 的”前代分数”可能没用同一套测试工具,横向对比要打折看;不同媒体报出的数字也略有出入。
对普通人来说,这件事的意义不在”机器有没有成神”,而在认知类工作的拐点被推近了:分析、写作、编程、科研辅助,会从”人操作 AI”加速转向”AI 自主跑流程、人只做把关”。打工人和被 AI 赋能的小团队,差距会进一步拉开。同时它也再次提醒——就在发布前几小时,ChatGPT、Claude、Grok 还集体宕机近 4 小时,”强却脆”仍是现实。
一句话总结:GPT-6 让人类离 AGI 又近了一大步,但”到了没”没有统一答案。“AGI 时代”更像一句方向明确的口号,而不是已经验讫的判决书。
本文基于多家权威媒体(财联社、界面、澎湃、TechWeb、环球网等)公开报道整理,能力数据以官方披露为准;”AGI 时代”相关表述均标注为厂商宣示,不构成对任何技术阶段的权威认定。配图为 AI 生成概念图与开放授权真实图,未使用任何品牌标识。



