考试卷做完了 人类能写出来、拿去考AI的所有试卷,都快不够用了。
2025年7月9日,xAI发布Grok 4的活动现场,埃隆·马斯克说出了一句让整个AI行业都该坐直身子的话:"我们正在耗尽能拿来考AI的题目。一切都变得trivial" 他随后给出自己的答案:对AI的终极推理测试应当转向现实本身。
车能不能开?火箭能不能入轨?药有没有效?
现实,是最终裁判
这段话被剪成一分钟短视频,在X上像病毒一样扩散。一年后的2026年8月,仍有账号用几乎相同的文案反复推送,因为它击中了一个所有人都隐约感觉到、却没人说得这么狠的事实:AI的"聪明",正在和"有用"脱钩。


▲ Grok 4发布次日,科技账号Autism Capital放出马斯克原声短视频,迅速获得大量互动
试卷经济的崩盘时刻
先回答一个问题:为什么"没题可考"会是个大事?
过去三年,AI行业的军备竞赛有一个共同裁判,基准测试(benchmark)。MMLU考百科知识,GSM8K考小学数学推理,GPQA考研究生级科学……模型发布时,厂商拿着一张成绩单说"看,我们数学97分,物理95分",投资人点头,用户鼓掌。
问题是:当所有尖子生都考了满分,这张卷子就废了。
斯坦福HAI把这个现象叫做benchmark saturation,基准饱和。MMLU从2023年的"硬核挑战"变成2025年的"热身练习",中间只用了不到两年。行业的应对方式是什么?出更难的卷 GPQA号称"研究生也做不对",HLE(Humanity's Last Exam,人类最后一场考试)更是直接放话:这是人类能出的最难的闭卷笔试了。
▲ HLE的维基百科页面,这个项目的灵感直接来自马斯克对MMLU"太容易"的吐槽
讽刺的是,HLE本身就是马斯克催生的。 公开资料显示,Center for AI Safety主任Dan Hendrycks称,创建HLE的灵感来自与马斯克的一次对话,后者嫌MMLU太简单。于是Hendrycks联合Scale AI,从全球学科专家手里众包了约2500道"连专家都要挠头"的题目,先用最强模型过滤掉"已经会做"的,再经两轮人工审核。
发布初期,模型准确率只有个位数看起来很美对吧?
但马斯克在Grok 4发布会上说的恰恰是:即便是这样的卷子,也撑不了多久。
"物理是法则,其他一切都只是建议"
让我们回到发布会现场,看看马斯克到底说了什么。比短视频流传的版本更完整的口述是这样的:
"我们实际上正在耗尽可问的测试题。即便对人类来说荒谬地难、甚至几乎不可能的、写在纸上的问题,对AI也正迅速变得trivial。但有一件事是极好的裁判:现实。因为物理是法则,其他一切都只是建议,你无法打破物理。所以对AI的终极推理测试就是现实。你发明一项新技术,比如改进汽车或火箭设计,或创造一种新药,它行不行?火箭有没有入轨?车能不能开?药有没有效?无论哪种情况,现实都是最终裁判。这将形成围绕现实的强化学习闭环。"
这段话勾勒出一条工程路线图
▲ xAI官网的Grok 4公告页,专章提到"Scaling Up Reinforcement Learning",强化学习的规模化
要理解这句话的份量,需要知道当今最强推理模型是怎么炼成的。答案是强化学习(RL):给模型一道有明确对错的题,做对了奖励,做错了惩罚,反复训练直到它"想明白"怎么解题。数学证明对了、代码跑过了、化学方程配平了,这些都是干净的奖励信号。
瓶颈来了: 当模型把人类能出的"有标准答案的难题"都学会了,奖励信号就枯竭了。算力和数据仍在增长,"什么算做对了"却越来越难定义。
马斯克的解法是:别在纸上找答案了把物理世界的结果当作奖励信号 火箭发射失败就记为错,成功入轨就记为对。药物也要以人体内的疗效来评分这个反馈很难伪造,也难以通过"背题"绕过,因为你骗不了物理定律。
从"秒级反馈"到"年级反馈":三条赛道的残酷真相
马斯克举的三个例子,车、火箭、药,其实暗含一个递进结构:反馈速度从快到慢,难度从低到高。
造车: 特斯拉的自动驾驶系统每天从数百万辆车上收集真实路况数据。安全行驶和行人识别会在短时间内得到反馈,周期以秒计。这是"现实闭环"里最成熟的一环,AI的预测必须与物理世界一致,否则后果即时可见。
造火箭: SpaceX的迭代哲学是"快速发射、快速失败、快速修正"。但即便如此,一次发射的准备周期仍以周和月计。每次回收着陆的数据都是昂贵的、不可重置的真实物理反馈。
造药: 这是最残酷的赛道从分子设计到临床终点,最快也要以年计。
▲ 产业媒体对AI药物发现的报道,AI已在加速靶点筛选与分子设计,但从计算命中到临床验证仍是漫长旅程
但"慢"不代表"不在发生"AI制药已经从PPT走向临床:Insilico Medicine的候选分子ISM001-055据报道在约18个月内从设计推进到人体试验,传统路径通常需要数年;AlphaFold系列把蛋白质结构预测推到了可支撑药物设计的精度。FDA也在2025年前后发布了"用AI支持药品监管决策"的指导草案。
产业已经在用"现实"打分了,只是这张卷子交卷要等很久,而且每道题的成本是几千万到几亿美元。
一个隐秘的对比:为什么AI写代码进步最快?
这里有一个被大多数人忽略的洞察
软件领域为什么成了AI进步最快的战场?因为代码世界有秒级、可重置、几乎零成本的现实反馈。编译通过没?测试跑过了吗?CI流水线绿了吗?这本质上就是马斯克说的"现实闭环",只不过这个"现实"是虚拟的、友善的、可以无限重来的。
物质世界的反馈则完全相反:合成要清洗仪器,实验要过夜,摩擦与磨损不可完美复现,碰撞测试毁掉的车不会自己复原。
AI在"世界像测试套件"的领域进步最快,在"现实无法一键重置"的领域进步最慢,但后者的护城河也最深。 马斯克点名的车、火箭、药,恰好全部属于慢反馈、高代价的一类。这种选择透露出他的判断:率先打通物理世界强化学习闭环的团队,将拿到下一代AI竞赛的入场券。


▲ 特斯拉车主社区也摘引了这段话,"现实是裁判"对应着每天在道路上产生的反馈
质疑的声音:现实闭环真的能闭上吗?
也有人对这套说法持怀疑态度
在这段视频的评论区里,有人提出了尖锐的反驳:"即便AI接入了现实,它仍然缺乏人类直觉。" 用户@shaulXTRAUDD写道:"我们已经看到了,给AI喂越多垃圾数据,它的判断就越差。即便AI与现实交互,它仍然缺乏人类式的直觉来判断事物。"
▲ 对"现实闭环"可行性的质疑,数据枯竭与直觉缺失的双重担忧
另一位用户@Sudeepfr则把问题拉向了更深处。他写道:"关键在于问题本身也许那才是AGI的试金石" AGI也需要先找对问题
▲ 评论者认为,问题本身或许才是AGI的试金石
这两个质疑其实指向同一件事:从"做题"到"做事"的鸿沟,远比更换评分标准复杂。 做题只需要推理;做事需要判断什么值得做、在不确定性中决策、在信息不完整时仍然行动。现实给出的反馈是"行不行",但选择做什么这件事本身,目前还没有模型能可靠地完成。
抛开短视频带来的情绪,技术信号已经浮现:AI评估正在从"答对题目"走向"改变现实"。 评估尺度随之从纸面分数延伸到物理后果,从干净信号延伸到噪声丛生的真实世界,也从毫秒级的token生成延伸到跨越数月甚至数年的实验验证。
试卷的时代正在落幕接下来的考试,没有标准答案,交卷要用火箭。