斯坦福研究:AI编程基准测试存在重大缺陷
AI模型解决几乎所有编程基准,斯坦福最新报告揭示真相
过去一年,AI编程基准测试出现了奇怪现象。作为自主软件工程的标准测试,SWE-bench Verified的性能从约60%提升到接近100%。仅用一年时间。这种跃升在成熟领域很少见,在任何领域都极为罕见。
这一数据点来自斯坦福大学以人为本人工智能中心本周早些时候发布的2026年AI指数报告。这份第九版年度报告长达400多页,内容涵盖从计算能力到碳排放再到公众意见的方方面面。但编程基准数据尤为突出,因为它们表明"AI可以帮助编写代码"与"AI可以编写生产代码"之间的差距已基本消失。
AI指数指导委员会联合主任Ray Perrault敦促人们在解释基准结果时保持谨慎。Perrault告诉IEEE Spectrum:"我们通常缺乏衡量系统(或代理)在特定环境中需要达到何种功能水平的标准。"知道法律推理基准有75%的准确率,并不能告诉我们它在律师事务所的实际活动中表现如何。
他说得对。基准测试是受控环境,而生产代码库则不是。但SWE-bench Verified的改进速度仍然值得关注,因为它追踪的内容比多项选择题式的琐事更接近实际工作。该测试要求模型解决来自流行开源仓库的实际GitHub问题。从60分到接近完美的十二个月进步,意味着模型在理解混乱的人工编写代码和找出问题所在方面有了显著提升。
人类的最后一门考试持续时间不长
编程基准测试并非唯一被碾压的测试。人类的最后一门考试是一个由专家提交的问题构建的基准,旨在代表各学科领域中最难的问题,情况类似。在2025年AI指数报告中,得分最高的模型(OpenAI的o1)仅正确回答了8.8%的问题。2026年报告将该数据提升至38.3%。截至2026年4月,如Anthropic的Claude Opus 4.6和Google的Gemini 3.1 Pro等模型已突破50%的门槛。
照这样下去,考试名称已经显得过时了。趋势很明显:每当研究人员构建一个旨在"最终"挑战AI模型的基准测试时,模型的追赶速度总是超出预期。
谁在构建这些模型
美国在原始模型输出方面仍然领先。Epoch AI追踪了2025年美国机构发布的50个"知名"模型。但与中国的差距已经缩小到两国在特定基准测试上多次交换领先地位的程度。2026年报告明确指出,美中模型差距实际上已经消失。
一个没有改变的趋势是:现在几乎所有模型都来自产业界。Epoch AI记录了2025年公司发布的87个知名模型,而学术界和政府加起来只有7个。这超过了90%。2015年,比例大致相当。2003年,产业界模型为零。从大学实验室到企业产品团队的管道现在只朝一个方向运行。
数字背后的计算能力建设
这些进步都不是免费的。报告包含了EpochAI对全球AI计算能力的估计,以H100e等效单位衡量。自2022年以来,总量每年增长超过三倍。自2021年以来,增长了30倍。
英伟达处于这个领域的顶端,其GPU占全球AI计算能力的60%以上。亚马逊和谷歌都在设计自己的AI芯片,分别占据第二和第三位。台积电周四即将公布的业绩预计将确认这家1.7万亿美元公司在制造推动这一扩张的芯片方面继续占据主导地位,尽管日本对Rapidus的160亿美元投资以及英特尔与埃隆·马斯克的合作表明,并非所有人都对台湾在先进芯片制造领域的控制感到舒适。
没人愿意精确量化的碳排放问题
这是令人不安的部分。根据斯坦福大学的报告,训练像xAI的Grok 4这样的前沿模型会产生估计72,000吨二氧化碳当量的排放。作为比较,GPT-4估计为5,184吨,Meta的Llama 3.1 405B为8,930吨。这一趋势并不微妙。
佩罗指出这些数据存在显著不确定性。"这些估计应谨慎解读。以Grok为例,它们严重依赖于从公开报道、xAI声明和其他无法验证的来源推断的输入,"他说。但他也指出,Epoch AI独立估计Grok 4的排放量约为140,000吨二氧化碳,几乎是该报告保守数字的两倍。
不同模型的推理能耗差异巨大。DeepSeek的V3处理中等长度提示约消耗23瓦,而Claude 4 Opus使用约5瓦。效率最低的模型每次查询产生的碳足迹是最高效模型的十倍以上。随着部署规模扩大(报告显示88%的组织已采用),碳排放方程中的推理部分最终可能超过训练成本。
88%采用率实际意味着什么
报告发现,88%的受访组织以某种形式采用了AI工具,五分之四的大学生现在定期使用生成式AI。这些采用率是大多数技术需要数十年才能达到的数字。
与此同时,中国在机器人部署方面遥遥领先世界。2024年,该国安装了295,000台工业机器人,而日本约为44,500台,美国约为34,200台。AI指数一直同时追踪软件和硬件,机器人数据是一个有用的提醒,"AI采用"根据您所看的国家和行业而有很大不同。
美国还有另一个新兴问题:人才保留。2025年,已确定的AI作者和发明家中最大比例来自美国(220,520人),其次是印度(50,460人)和德国(48,520人)。但报告指出,尽管美国在AI研发上的支出超过其他国家,却"发现越来越难以吸引顶尖人才"。尽管拥有5万人的AI人才库,印度在净人才外流方面却位居世界首位。
所以呢
2026年AI指数证实了该领域从业者早已察觉的情况:模型能力正在加速发展,在企业环境中已近乎普及,而环境成本的增长速度与基准测试指标不相上下。美国和中国模型性能之间的差距已经消失。编程基准测试已基本达到极限。人类的终极考试已通过一半。
真正的问题不在于AI能否通过测试,而在于基础设施、电网和监管框架能否跟上模型在生产环境中现在能够做到的事情。根据这份报告,模型已经领先了。