人类出的题,全被做烂了 这番狠话来自埃隆·马斯克在xAI的Grok 4发布会。他仿佛亲手撕掉整个AI评估行业的考卷,然后指着窗外说:出门左转,那才是考场。
2025年7月9日,xAI正式发布Grok 4。二十万块GPU组成的Colossus集群轰鸣作响,强化学习被拉到与预训练同等规模,各项学术基准上模型展现出博士级水准。但马斯克没有举杯庆祝他当时说的这段话,一年后仍在X上反复出现:
"我们实际上正在耗尽可用来提问的测试题。即便对人类来说荒谬地难、甚至几乎不可能的书面问题,对AI也正迅速变得trivial。"
接着,他给出一个让基准制造者不安的判断:
"对AI的终极推理测试,是现实你发明一项新技术,车能否开动?火箭能否入轨?药物是否有效?现实,是最终裁判"


▲ 马斯克原话由二次发布账号整理,一年后仍在X上反复出现
试卷被做穿了:一场静悄悄的评估危机
要理解马斯克为什么说这话,得先看清AI考试界正在经历什么。
想象一个考场:出题者费尽心思设计了一套全球最难的试卷,结果考生全考了95分以上。你分不出谁是天才谁是庸才,温度计失灵了。这就是过去两年AI基准领域正在发生的事,学术界把它叫做benchmark saturation(基准饱和)。
MMLU、GSM8K,这些曾经被视为"AI智力温度计"的经典测试,被前沿模型推到了接近满分。斯坦福HAI的年度综述白纸黑字写着:分数不再能区分"很好"与"顶尖"。
▲ 维基百科Humanity's Last Exam条目,记载了这场"出更难的卷"运动的起源
于是行业开始疯狂造更难的尺子GPQA要求研究生级别抗搜索能力,竞赛数学与编程榜不断加码。而其中最具野心的,是一场被命名为"Humanity's Last Exam"(人类最后一场考试)的项目,由AI安全中心(CAIS)与Scale AI联手,从全球各学科专家众包约2500道题,先用领先模型过滤掉"已经会做的",再经人工两轮审核。
有趣的是,HLE的诞生本身就与马斯克有关。 CAIS主任Dan Hendrycks公开说过,灵感来自与马斯克的一次对话,马斯克嫌MMLU太容易了。
▲ xAI官方页面展示Grok 4的训练范式:将强化学习扩展到与预训练同等规模
所以你看到一条完整的因果链:马斯克嫌卷太易 → HLE被创造 → Grok 4在HLE上继续抬分 → 马斯克宣布连HLE也终将失效。 他亲手催生了"更难的考试",然后亲手判了所有考试的死刑。
"物理是法则,其他一切都只是建议"
马斯克那段话的完整版本,比社交媒体上流传的金句要深得多。
发布会转写显示,他先铺垫了一层工程逻辑:强化学习依赖"做对了/做错了"的清晰信号,数学证明对了、代码跑通了、答案匹配了,都是干净的奖励。但当模型变强,人类能出的、可自动判分的难题越来越少,训练就撞上了"奖励稀疏"的墙。此时瓶颈转向了稀缺的正确答案与判分信号。
然后他说出了那句在工程师群体中近乎信条的话:"物理是法则,其他一切都只是建议,你无法打破物理。"
这段话描述了一种新的训练范式:以物理现实作为不可伪造的奖励函数,构建围绕现实的强化学习闭环。 火箭入轨,奖励+1;任务失败,-1物理结果无法讨价还价,也难以靠数据污染或"为榜而训"绕过。
他进一步对比了两类工具:浏览器里能跑的搜索和代码解释器,"原始得可怜";与特斯拉、SpaceX用的有限元分析、计算流体力学、碰撞仿真,工业级现实逼近器。更长远的路径?让模型通过人形机器人与物理世界互动,提出假设,验证假设。
这份愿景背后,是一个同时拥有火箭公司、汽车公司、机器人项目和AI公司的人在用全部产业版图画路线图。
纸面聪明与现实智慧之间的鸿沟
社区也有不同看法,评论区里的一些声音尖锐得像手术刀。
▲ 有人担忧:数据枯竭后越喂垃圾判断越差,即便接入现实仍缺人类直觉
另一位用户Shaxtr更悲观:"我们已经在很多领域看到AI开始失败了……越喂垃圾数据,它的判断力越差。即便AI能接触现实,它仍然缺乏人类直觉来判断事物。"
这些评论指向一个真实的技术张力:软件世界有编译器、单元测试、持续集成,提供秒级可重置的反馈,AI编程因此进步最快。 但物质科学呢?合成要清洗仪器,实验要过夜,摩擦与磨损不可完美复现。AI在"世界像测试套件"的领域突飞猛进;在"现实无法一键重置"的领域,每一步都贵得令人心疼。
马斯克点名的车、火箭、药,恰好都属于慢反馈、高代价的那一类。
造药:已经在发生的部分,与仍属科幻的部分
马斯克说"药有没有效"的时候,AI制药赛道的创业者大概五味杂陈。
▲ 产业媒体报道:AI已成为药物研发的核心技术之一
事实是,AI参与造药已经是进行时DeepMind的AlphaFold把蛋白质结构预测推进到可支撑结构基药物设计的程度;Insilico Medicine声称其AI设计的候选分子在约18个月内推进到临床,传统流程需要数年;美国FDA在2025年前后发布了关于"用AI支持药品监管决策"的草案指导。
但马斯克定义的"终极考试"远比这苛刻。生成了分子结构不算及格,进了I期临床不算及格,甚至通过了III期也只是中间答卷,药物是否在真实患者群体中长期安全有效、可规模化生产、可重复验证,那才是"现实裁判"交出的最终判决书。
从计算命中到临床终点,还要跨越时间、金钱、伦理审查、生物体的不可预测性。这恰恰印证了马斯克的潜台词:纸面分数可以刷,但物理世界不接受速通。
终局猜想:当考场从纸面挪到物理世界
让我们把视野拉远一步
如果马斯克的判断成立,AI的终极考场是物理现实,那么接下来的竞争格局会发生根本性位移。纯靠堆语料、刷榜单的路线将面临收益递减;而拥有物理世界交互能力的玩家,有工厂的、有车队的、有发射台的、有临床管线的,会获得一种独特的数据护城河:来自现实的、不可伪造的、稀缺的反馈信号。
这恰好是马斯克自己的帝国版图:特斯拉的自动驾驶每天吃进数百万公里真实路况,SpaceX的星舰在每次试飞与着陆中收集物理数据,Optimus机器人在产线上积累操作轨迹。他描述未来的同时,也在为自己的产业组合画一条护城河。
当然,这个框架也有盲区法律推理、艺术创造、情感陪伴、战略规划未必适合物理验证,这些领域的"现实检验"远没有火箭入轨那样二元清晰。马斯克的物理主义框架,是一个极具力量但边界有限的透镜。
不过,有一点他大概率是对的:纸面考试的时代,确实正在结束。 不管下一个裁判是物理现实、是市场回报、还是某种我们尚未命名的评估方式,至少,刷分刷到天花板然后发新闻稿庆祝的游戏,快玩不下去了。