斯坦福2026 AI指数报告:中国已追上,数字惊人
斯坦福2026年AI指数报告:中国已追平,无人察觉,数字令人震惊
斯坦福大学以人为本人工智能研究院于2026年4月13日发布第九份年度AI指数报告,头条结论引发关注:中国已抹平美国在AI模型性能上的领先优势。过去连续八年,美国模型稳居榜首。如今局面已变。美国和中国模型在Arena社区驱动的基准排行榜上每周交替登顶,差距之小,以至于成本和可靠性比原始能力更重要。
报告篇幅超过400页。斯坦福HAI研究团队牵头,南加州大学计算机科学家Yolanda Gil参与,汇编了数十个数据集,涵盖模型性能、投资流向、劳动力变化以及数十个国家的公众意见。呈现出的图景是:一项技术正加速超越所有旨在追踪、监管甚至理解它的制度机制。
两个超级大国,一场势均力敌的竞赛
截至2026年3月的Arena排行榜上,Anthropic占据首位。xAI、Google和OpenAI紧随其后。DeepSeek和阿里巴巴的中国模型差距不大。ChatGPT于2022年发布后曾看似无法逾越的鸿沟已经消失。DeepSeek的R1模型在2025年2月短暂追平美国顶尖模型,此后中国实验室一直保持同步。
但竞争并不对称。美国在资本、基础设施和芯片方面仍占主导。美国拥有约5427个数据中心,是其他任何国家的十倍以上。英伟达GPU占全球AI算力能力的60%以上。但中国在论文发表、专利以及报告所称的“物理AI”领域领先。中国2024年安装了29.5万台工业机器人。日本安装了4.45万台。美国安装了3.42万台。
韩国人均AI专利申请量超过其他任何国家。44个国家现已运营政府支持的超级计算集群,而两年前只有少数几个。与此同时,南美和中东国家落后更多。报告警告出现新的数字鸿沟:无法建设自主AI基础设施的国家将完全错失经济红利。
透明度正在崩塌
2025年发布的知名AI模型中,超过90%来自私营公司。十年前这一比例还不到50%。这种集中趋势值得关注,因为这些公司分享的信息比以往更少。谷歌、Anthropic和OpenAI都已停止披露数据集规模、训练时长和参数数量。去年发布的95个最知名模型中,有80个未附带训练代码发布。
吉尔对《麻省理工科技评论》表示:“我们在预测模型行为方面有很多未知。”这不是学术界的无谓担忧。独立研究人员依赖公开的训练细节来研究模型安全性、偏见和故障模式。没有这些信息,外界等于在黑暗中摸索。吉尔直言:“模型在基准测试上的表现缺失,本身可能就说明了问题。”
AI行业代表出席国会听证会的频率是2017年的三倍,而中立学术界的参与度大幅下降。制造模型的人越来越多地主导着围绕模型的规则制定。公众信任度反映了这一点。只有31%的美国公民信任政府能妥善监管AI。在中国,这一数字降至27%。欧盟公民相对更有信心,为53%。
采用率打破所有纪录。就业也开始受影响。
全球53%的人口现在经常使用生成式AI。这一采用速度超过了个人电脑、互联网和智能手机在各自生命周期同阶段的普及率。88%的组织报告使用AI。五分之四的大学生使用它。
但美国在实际采用率上全球排名第24位,只有28.3%的美国人经常使用生成式AI。中国、马来西亚、泰国、印度尼西亚和新加坡都有超过80%的人口预期AI将在三到五年内重塑日常生活。美国人在制造工具。东南亚人在使用它们。
就业数据开始让人感到刺痛。2025年斯坦福经济学研究发现,自2022年以来,22至25岁软件开发者的就业率下降了近20%。宏观经济状况有一定影响,但与AI编程工具的关联难以忽视。麦肯锡2025年调查发现,三分之一的组织预计AI将在未来一年缩减员工规模,其中服务运营、供应链和软件工程受影响最大。客户服务生产率提升了14%。软件开发生产率提升了26%。需要判断力的任务,其生产率提升则持平。
专家与其他人群之间的感受差距持续拉大。73%的AI研究人员对AI对就业的影响持乐观态度。普通公众中这一比例为23%。这50个百分点的差距是该指数有记录以来的最大值。
物理账单即将到期
全球AI数据中心目前消耗29.6吉瓦电力。这足以在高峰需求时供应整个纽约州。训练xAI的Grok 4估计产生了7.2万吨二氧化碳。Epoch AI独立估算这一数字接近14万吨。无论哪个数字都远超此前估计:OpenAI的GPT-4为5184吨,Meta的Llama 3.1 405B为8930吨。
AI指数指导委员会联合主任Ray Perrault提醒对这些估算保持谨慎。他说:“这些估算应谨慎解读。以Grok为例,它们严重依赖从公开报道、xAI声明及其他无法核实来源推断出的输入数据。”不过,趋势本身不容忽视。仅GPT-4o的推理用水量就能满足1200万人每年的饮用水需求。
这一切背后的供应链系于一个单点故障。台湾的一家公司台积电,几乎制造了所有领先的AI芯片。美国数据中心依赖它。中国数据中心也依赖它,制裁也不例外。整个全球AI建设都经由这座地缘政治争议岛屿上的一家晶圆厂运转。
基准测试已失效。模型仍在持续改进。
顶尖AI模型如今在衡量科学、数学和语言领域博士级理解力的测试中已超过人类水平。测试自主编程能力的SWE-Bench Verified,顶尖得分从2024年的约60%跃升至2025年的接近100%。在由专家提交的专业领域问题构建的基准测试Humanity’s Last Exam上,准确率从2025年初的8.8%攀升至年底的38.3%。截至2026年4月可用的模型,包括Anthropic的Claude Opus 4.6和Google的Gemini 3.1 Pro,现已突破50%。
问题在于:基准测试本身难以保持相关性。一个流行的数学基准测试,其答案键自身就有42%的错误率。基于基准数据训练的模型可以刷分,却无实质进步。而且AI在实际应用中的使用方式,很少与测试方式相符。Perrault说:“知道一个法律推理基准测试有75%的准确率,并不能说明它在律所实际工作中能有多好用。”
企业对AI的投资自2013年以来增长了40倍。今年美国生成式AI的消费者盈余达到1720亿美元。这台金融引擎比以往任何时候都更热。OpenAI和Anthropic据报道都在2026年冲刺IPO。资金是真实的。同样真实的是7.2万吨碳排放、相当于1200万人用水量的水资源消耗,以及初级开发者就业率20%的下降。
当两个AI能力并驾齐驱的国家在采用上完全分道扬镳时,会发生什么?美国在建设。东南亚在运行。而那位22岁、寻找第一份工作的程序员,正被夹在一场无人预料的转变之中。