DeepSeek AI研究:能耗降低100倍且效果更佳

· AIX Cove 出品 · AIX Cove 评测 · AI 智能体与自动化
DeepSeek AI研究:能耗降低100倍且效果更佳

人工智能正在以惊人的速度消耗电力,任何需要交电费的人都该感到紧张。2024年,仅美国的人工智能系统和数据中心就消耗了约415太瓦时电力。根据国际能源署的数据,这占全美总发电量的10%以上,而到2030年,需求预计将翻一番。

所以,当一组研究人员表示他们构建了一个能耗降低100倍、同时准确度更高的AI系统时,这值得关注。

研究人员到底造了什么

塔夫茨大学Matthias Scheutz领导的团队开发了一种他们称之为神经符号视觉-语言-动作模型。论文题为“价格不对:神经符号方法在结构化长时程操作任务中以显著更低的能耗超越VLA”,于2026年2月发布在arXiv上,并将于今年5月在维也纳举行的国际机器人与自动化会议上展示。

这个想法很直接,尽管实现起来并不简单。当前用于机器人的AI,称为视觉-语言-动作模型或VLA,工作原理很像大型语言模型。它们靠蛮力学习,处理海量数据集,运行数百万次试错循环,直到偶然发现可行的模式。这有时能产生令人印象深刻的结果,但效率极低。可以把它想象成记住每个可能的棋局位置,而不是学习规则。

神经符号AI走的是另一条路。它将神经网络的模式识别能力与实际规则和逻辑推理结合起来。神经网络负责感知和运动控制,符号层负责规划和逻辑。两者协同工作,更像人实际解决问题的方式:观察、思考规则、规划步骤,然后行动。

数字说明一切

研究人员在汉诺塔谜题上测试了两种方法。如果你不熟悉,这是一个经典逻辑谜题,要求按照严格规则在柱子之间移动圆盘。选择这个谜题是因为它需要顺序推理和多步规划,而这正是当前AI所欠缺的。

以下是实际情况:

  • 成功率:神经符号系统在95%的情况下正确完成了拼图。标准VLA模型只有34%。
  • 新场景:当面对一个从未见过的更复杂版本拼图时,混合系统仍有78%的成功率。传统模型?零。每一次尝试都失败了。
  • 训练时间:神经符号系统用了34分钟,而标准方法需要超过一天半。
  • 训练能耗:新系统只消耗了标准训练所需能量的1%。
  • 运行能耗:仅为传统模型的5%。

这些不是渐进式改进。这是完全不同的性能量级。

为什么这不止关乎机器人技术

Scheutz提出的一个观点让我印象深刻。他把这种低效与日常AI工具做了对比,指出即使是一次简单的谷歌搜索,现在也要经过层层AI处理,消耗不成比例的能量,而本质上只是完成一个信息检索任务。

“这些系统只是在试图预测序列中的下一个词或动作,但这可能不完美,它们会产生不准确的结果或幻觉。它们的能量消耗往往与任务本身不成比例。”

他说得对。当前AI的做法从根本上就是浪费的。我们往问题上堆更多GPU,建更大的数据中心,消耗更多电力,换来的模型仍然会幻觉,仍然在基础推理上出错,仍然无法可靠地提前规划三步。

一些数据中心的用电量已经相当于小城市。国际能源署预计,AI的电力消耗在本十年内将持续大幅攀升。到某个节点,经济账就算不过来了。你不能每几年就让电费翻倍,还把这叫做可持续增长。

为什么这不是一个快速解决方案

我想先说明这项研究的局限性。本次研究聚焦于规则明确的机器人任务。汉诺塔有清晰的约束条件:圆盘按顺序移动,一次只能移动一个,遵循特定规则。这种结构正是符号推理所擅长的。

像写文章、生成代码或回答常识问题这类开放式任务,并没有如此清晰的规则集。如何将符号推理应用于“写一封有说服力的邮件”这种模糊场景,目前并不明确。现有研究并未涉及这一点。

还有规模问题。实验是在相对受控的实验室环境中进行的,针对的是特定的机器人操作任务。当这些效率提升扩展到更复杂、更混乱的真实世界环境时,是否依然成立,还有待观察。

AI效率的大局

话虽如此,这项研究指向了一个重要方向。AI行业目前靠增加算力和数据来强行解决所有问题的策略,正在触及物理和经济的极限。能源昂贵,芯片昂贵,建设数据中心需要数年时间和数十亿美元。

微软刚宣布在日本投资100亿美元建设AI基础设施。软银向OpenAI投入了100亿美元。联合健康集团正花费30亿美元将AI嵌入其运营。这些赌注只有在底层技术变得更高效而非更低效时才能回本。

神经符号方法表明,确实存在提升空间。与其构建越来越大的模型,让它们通过试错从头学习一切,不如将已知规则编码进去,让神经网络专注于它真正擅长的事情:感知、模式匹配和运动控制。符号系统负责逻辑。两部分都不必独自承担全部负担。

接下来值得关注的点

该论文将于2026年5月在维也纳举行的ICRA会议上正式发表。关注其他实验室能否在不同任务和更大规模上复现这些结果。如果效率提升在多个领域都能成立,神经符号AI可能会改变行业对构建智能系统的思考方式。

这项研究还提出了一个更多人应该思考的问题:如果通过给模型加入结构化推理,我们能用少100倍的能耗获得更好的结果,那当初为什么满足于蛮力方案?部分原因在于,用算力堆问题比认真思考架构要容易得多。但容易不等于聪明。

论文可在arXiv上查阅(arXiv:2602.19260)。

来源:官方文档与定价页、标注的实测,以及社区反馈。价格核对于 2026 年 8 月,可能变动。