人类花了几十年给AI出题现在,出题的人先投降了
2025年7月9日,xAI发布Grok 4的现场,马斯克没有像往常一样炫耀跑分。他坐在黑色背景前,穿着皮夹克,语气平静得像在宣读一份讣告,
"我们实际上正在耗尽能拿来考AI的测试题。即便对人类来说荒谬地难、几乎不可能的书面问题,对AI也正迅速变得trivial。"
然后他给出了自己的答案:现实,是最终裁判。
车能不能开?火箭能不能入轨?药有没有效?你骗不了物理定律


▲ ELON CLIPS账号发布的完整引述视频,注明来源为"Grok 4 presentation by xAI, July 9, 2025"
一张考卷的死亡曲线
要理解马斯克为什么说这番话,得先看一组令人窒息的数字。
MMLU,曾经被视为衡量大模型"通识水平"的黄金标准,涵盖57个学科、从天文到法律,2023年还能拉开差距,到2024年底,前沿模型全部挤在90%以上。GSM8K,小学数学应用题集,曾经让GPT-3抓耳挠腮,如今被几乎所有主流模型碾到满分附近。
斯坦福HAI年度报告给这个现象起了个精准的名字:benchmark saturation,基准饱和。温度计的刻度用完了,你分不清37.8°C和38°C的区别。
于是学界和工业界开始了一场"出更难的卷"的军备竞赛。GPQA,号称研究生级别、连Google都搜不到答案的题。各种竞赛数学、编程马拉松直到一个项目诞生,它的名字本身就是一句宣言,
Humanity's Last Exam。人类最后一场考试
▲ 英文维基百科"Humanity's Last Exam"条目,记载了这一项目的起源与设计逻辑
"最后一场考试",灵感竟来自马斯克的一句抱怨
这件事的讽刺之处在于:HLE的诞生,恰恰与马斯克有关。
Center for AI Safety主任Dan Hendrycks公开说过,灵感来自与马斯克的一次对话,马斯克认为MMLU太容易了。于是Hendrycks团队与Scale AI合作,从全球学科专家手中众包题目,先让领先模型过滤掉"已经会做"的,再经两轮人工审核。最终产出约2500道题,数学占比最高,另有物理、生物、化学、工程、人文社科。
发布初期,模型准确率低到令人尴尬,个位数百分比。终于,温度计又能量体温了
但马斯克在Grok 4发布会上说的话,等于提前写好了HLE的墓志铭:任何写在纸上的固定卷,终将失去压测功能。Grok 4在HLE上继续抬分,而他已经望向了下一座山。
▲ xAI官网新闻页标注日期Jul 9, 2025,强调"Scaling Up Reinforcement Learning"
"物理是法则,其他都是建议"
马斯克那段话的完整版,远比短视频流传的金句更有工程含量。他说:
"有一件事是极好的裁判:现实。因为物理是法则,其他一切都只是建议,你无法打破物理。所以对AI的终极推理测试就是现实……这将形成围绕现实的强化学习闭环。"
这里有三层递进:
第一层,评估标准的转换纸面题有唯一标准答案,做对就是做对。但造一辆车、发射一枚火箭、合成一种药物,反馈是慢的、贵的、不可任意重置的。你不能Ctrl+Z一次爆炸
第二层,训练范式的暗示当前最强推理模型大量依赖强化学习:做对了给奖励,做错了扣分。数学证明可以自动判分,代码可以跑测试,但当"既难又有干净对错信号"的题目越来越少,奖励本身就会变得稀疏。瓶颈随之转向了"什么算做对了"
第三层,马斯克的商业帝国就是这句话的注脚。特斯拉的自动驾驶,靠的是数百万辆车在真实道路上积累的数据;SpaceX的猎鹰回收,靠的是一次次发射与坠毁的物理反馈。这番话也映照着他手里的现实基础设施。


▲ 特斯拉车主社区账号同期引述,聚焦"终极推理考试是现实"一句
AI造药:已经在发生的"现实考试"
马斯克举的三个例子里,"新药是否有效"可能是离普通人最近、也最容易被低估的一个。
事实上,AI制药已经走出PPT公开报道显示:Insilico Medicine用AI设计的候选分子ISM001-055,从靶点确认到进入人体I期临床,只用了大约18个月,传统流程通常需要4到6年。DeepMind的AlphaFold系列把蛋白质结构预测推进到了可支撑结构基药物设计的精度。FDA在2025年前后发布了"用AI支持药品监管决策"的草案指导文件。
▲ 产业媒体报道AI如何改变药物发现流程
但这里有一个残酷的落差:AI能在几周内生成看起来完美的分子结构,然而从"计算命中"到"临床终点",药在人体内真的有效、安全、可量产,中间隔着的,是漫长而昂贵的现实闭环。I期成功不代表III期成功,候选分子进入人体不等于上市。
马斯克要的"终极考试"比这更狠:AI独立发明一种药,并且真的治好疾病。 我们还没到那一步但方向盘已经转了
代码世界:已经有了"快速现实"
这里有一个有趣的对照组
软件工程领域,编译器就是物理定律,代码跑不跑得通,毫秒级反馈。单元测试、持续集成、自动化部署,构成了一个成本极低、可无限重置的"微型现实"。这正是AI编程进步最快的原因:每一次试错几乎免费。
而马斯克点名的车、火箭、药,恰恰是另一个极端,合成要清洗仪器,发射要等窗口期,临床要过伦理审批。反馈慢、代价高、不可逆 一位技术评论者曾如此概括:AI在"世界像测试套件"的领域进步最快;在"现实无法Ctrl+Z"的领域,进步更慢,但护城河完全不同。
这个不对称性,恰恰是马斯克判断的底层逻辑。谁拥有与物理世界交互的基础设施,工厂、发射场、车队、机器人,谁就拥有下一代AI训练中最稀缺的东西:来自现实的奖励信号。
社区的冷水:聪明不等于智慧
评论区也有人质疑:"即便连接了现实反馈,模型仍缺人类式直觉。数据枯竭后,越喂垃圾判断越差"
▲ 对"现实闭环"可行性的直接质疑
这条质疑指向一个马斯克没有展开的问题:物理世界能提供"对不对"的信号,但它能提供"为什么对"的信号吗? 火箭坠毁后,失败已经确定,原因却可能有一万种。现实是严厉的考官,往往不会耐心解释失败原因。
考试结束之后
回到那个核心图景,
人类给AI出了几十年的题从感知到推理,从选择题到开放问答,从MMLU到Humanity's Last Exam。每一张试卷被做满之后,我们就慌忙出下一张更难的。
现在,马斯克说:别出卷了让它去造东西看它造的东西能不能在这个世界上站住。
这个故事最终落在了聪明的定义本身正在被改写。当所有纸面考试都变成trivial,当所有benchmark都走向饱和,剩下的唯一问题是:
你的智能,能不能经得起重力、摩擦、副作用和时间的检验?
物理不给部分分现实不接受申诉而这场考试,刚刚开始