/ ai资讯

什么是Physical AI?智能机器时代已来临

发布时间:2026-07-31 17:46:14

本文转自:边缘人工智能


在大多数历史时期,人工智能一直生活软件里。它读文档、生成文本、分类图像、回答问题——但从未真正对世界施加行动。它无法从生产线上拿起一个零件,无法在凌晨两点穿行仓库,也无法在不被告知具体要寻找什么的情况下,对从未见过的危险做出响应。

这一局面正在改变。Physical AI(物理人工智能)指的是那些不只是处理信息,而是能够感知、推理并对其所处的物理环境做出行动的人工智能系统。AI从软件能力转变为现实世界中的运营存在,这是该技术发展史上最具深远意义的转折之一。而对于那些运营物理环境的组织来说,这一转变正在当下发生。

Physical AI是专为在物理世界中运行和交互而设计的一类AI系统。传统人工智能处理数字输入并产生数字输出,而Physical AI系统则通过摄像头、激光雷达(lidar)、麦克风及其他传感器采集感知数据,对数据的上下文含义进行推理,并据此采取物理行动。

用一句话概括:Physical AI是能够看见、理解并在真实世界环境中行动的人工智能——而不仅仅存在于软件之中。

Physical AI与自2022年以来占据公众注意力的生成式AI有着本质区别。生成式AI产生内容——文本、图像、代码和音频。Physical AI产生的是行动

生成式AI模型可以描述如何在仓库中导航。而Physical AI系统实际导航。生成式AI的输出是信息性的;Physical AI的输出是物理性的。

这一术语的广泛流行,部分归功于Jensen Huang(黄仁勋)在CES 2025上宣称"机器人领域的ChatGPT时刻已经到来",他将Physical AI定位为大语言模型时代之后的下一波变革浪潮。全球Physical AI市场规模在2025年估值约为50亿美元,预计到2033年将达到830亿至1190亿美元,年复合增长率约32%~36%。

Physical AI指的是多种能力的组合,这些能力共同使机器能够在物理世界中智能地运行。理解Physical AI的工作原理,需要先了解每个系统赖以存在的三个层次。


感知:计算机视觉与传感器融合

任何Physical AI系统的基础都是感知环境的能力。计算机视觉(Computer Vision)是最主要的感知技术,约占Physical AI技术市场的42%~45%。它赋予机器实时观看和解读摄像头视觉数据的能力,包括检测物体、理解空间关系、识别人物和追踪运动。

Physical AI中的计算机视觉远不止是过去十年定义了该领域的物体分类任务。Physical AI系统必须同时理解深度、运动和环境上下文,推理某个场景的含义以及接下来可能发生什么——而不仅仅是给当前存在的东西打上标签。这就是为什么从窄域训练的计算机视觉模型转向大型视觉模型(Large Vision Models, LVMs)如此重要:物理环境真正需要的是一般性视觉理解,而非特定任务的检测。


推理与决策

仅有感知还不够。Physical AI系统必须决定如何应对它所感知到的信息。这就是推理能力发挥作用的地方——这些能力越来越由大语言模型(LLM)、视觉语言模型(Vision Language Models, VLMs)和多模态基础模型提供支撑。系统必须解读当前情境、确定恰当的响应方案、规划一系列行动并按顺序实时执行。

在复杂的物理任务中,这个推理层必须处理不确定性、不完整信息以及开发阶段未曾明确预料到的新场景。这是Physical AI与早期基于规则的自动化系统之间的根本区别之一——后者只能对明确编过程序的情境做出响应。


行动:控制系统与执行

第三层是物理行动。控制系统将推理层的决策转化为物理动作——无论是操控自动驾驶车辆、合拢机械臂的手指、调整人形机器人的步态,还是在运营工作流中触发警报。这些控制系统的设计和精度决定了Physical AI系统能否在人类工人身边可靠且安全地运行。


Physical AI如何工作:在模拟与真实环境中训练

训练Physical AI是该领域技术挑战最大的任务之一。与可以从互联网上抓取文本进行训练的语言模型不同,Physical AI系统必须从物理交互中学习——而物理交互缓慢、昂贵,有时大规模重复还伴随着危险。

主流的Physical AI训练方法包括:

  • 模拟环境中的强化学习:AI系统在模拟物理环境中通过试错学习,成功的动作获得奖励,失败的受到惩罚。在模拟环境中运行数百万次试错,将实际世界中难以实现的时间线大幅压缩。NVIDIA的Cosmos和Isaac Lab平台正是为此而设计,在实际部署前生成合成物理环境用于训练AI系统。
  • 来自人类示范的模仿学习:AI系统通过观察和复制人类行为来学习。人类操作员演示目标任务,系统学习如何复现。这种方法在难以定义奖励函数的复杂操控任务中尤为重要。
  • 基础模型迁移:将具有广泛世界知识的预训练大模型在物理任务数据上进行微调,利用模型中已嵌入的通用推理能力,而非从头开始训练。这大大减少了在特定领域训练Physical AI所需的数据量。

强化学习仍然是Physical AI在规则清晰且可可靠模拟的环境中的主导范式,包括自动驾驶车辆导航、机械臂操控和物流路径规划。强化学习的试错本质意味着系统会开发出人类设计者未曾预料到的策略,往往能得出比人工设计方案更快、更鲁棒或更节能的解法。


Physical AI的实际部署:已落地的应用场景

Physical AI并非未来技术——它已经在多个行业以商业规模部署。

行业

Physical AI应用

实例

汽车

自动驾驶导航、驾驶辅助

Tesla全自动驾驶(Full Self-Driving)、Waymo自动驾驶出租车队

制造

机械臂装配、质量检测、协作机器人

现代汽车工厂的Boston Dynamics Spot、ABB机器人系统

物流

自主移动机器人、仓库导航、分拣

Amazon仓库的Agility Robotics Digit

医疗

手术辅助、患者监护、药房自动化

da Vinci手术系统、自动发药系统

建筑

工地监控、设备自动化、安全合规

无人机巡检、自动驾驶挖掘机

运营/HSE

实时视觉智能、智能体安全监控

VGI驱动的自然语言查询式运营洞察


Physical AI最清晰的公共图示是自动驾驶车辆。自主驾驶同时需要Physical AI栈的每一个要素:计算机视觉感知车道、障碍物和行人;推理解析复杂且模糊的交通场景;控制系统将决策实时转化为转向、加速和制动。

正是这套让AI足够强大到在公开道路上驾驶汽车的架构,同样使其能够操作生产线上的机械臂或仓储物流中的自主移动机器人。

最引人注目的Physical AI系统是那些已经从研究新奇事物走向商业部署的人形机器人。Tesla Optimus Gen 3于2026年1月开始量产。Boston Dynamics的电动Atlas部署在现代汽车工厂。Agility Robotics的Digit在Amazon仓库中运行。

这些人形机器人是Physical AI最可辨识的形态,但并非商业化最成熟的形态。Physical AI部署量最大的领域反而是那些不太显眼的系统:在公共道路上运行的自动驾驶车队、电子和汽车制造中运转生产线的机械臂单元、以及管理物流仓储库存和拣货的自主系统。


Physical AI运营:视觉智能的作用

对于大多数组织而言,Physical AI最触手可及且立竿见影的价值体现并非人形机器人或自动驾驶车辆——而是嵌入在工厂已安装摄像头中的智能。

计算机视觉占据Physical AI市场最大的技术份额,因为它是最广泛可部署的物理世界感知形式。每个装有摄像头的设施都在持续产生物理世界数据。问题始终在于:AI能否让组织实时从这些数据中提取智能,以及这些智能能否驱动行动、而不仅仅是生成报告。

这正是Physical AI与智能体式计算机视觉(Agentic Computer Vision)的汇合点。一个智能体式的Physical AI系统不会仅仅检测到摄像头画面中的事件然后记录日志——它会感知正在发生什么、推理上下文、确定恰当的响应方案、并执行完整的工作流:通知正确的团队、更新相关系统、记录事件并发起纠正措施——而人类甚至还没看完一帧画面。

物理环境产生数据,AI系统处理数据并采取行动。

视觉型Physical AI能够在环境中推理。如果叉车驶入行人专用区,应该怎么办?

视觉通用智能(Visual General Intelligence, VGI)——viso.ai在2025年定义并发布基础白皮书的概念——是将Physical AI原理应用于企业级运营视觉智能的实践。传统计算机视觉针对特定环境中的特定任务训练,而VGI系统能够理解任何物理环境、用自然语言回答关于环境的任何问题,并在无需模型训练或标注的情况下对所见采取行动。这就是Physical AI从实验阶段走向运营阶段的样貌。


Physical AI vs. 生成式AI:理解差异

Physical AI与生成式AI的关系常常被误解。它们并非竞争关系——生成式AI正在越来越多地成为Physical AI系统的一个组成部分。区别在于AI最终做什么。

  • 生成式AI:响应数字输入产生数字内容。输出结果是文本、图像、代码或音频。它在软件环境中运行。
  • Physical AI:响应来自真实世界环境的感知输入产生物理行动。输出结果是运动、决策和运营后果。它在物理世界中运行。
  • 交汇点:现代Physical AI系统越来越多地使用生成式AI模型作为它们的推理层。大语言模型解读情境,视觉语言模型处理视觉输入,控制系统执行动作——生成式AI让Physical AI更强大,而Physical AI给生成式AI装上了身体。

正是这种交汇,使当前这个时刻区别于以往每一波机器人和自动化浪潮。前几代物理系统以固定规则编程,无法适应训练范围之外的场景。而基于基础模型构建的Physical AI系统能够泛化。

在先进制造工厂组装车辆的自主机械臂。经过装配任务训练的机械臂,配合适当的基础模型集成,可以适应从未处理过的新型零件。在一个城市训练过的自动驾驶车辆可以在另一个城市导航。部署在制造工厂的运营视觉智能系统,可以让从未写过一行代码的HSE经理用自然语言查询。

viso.ai的VGI-1引擎专为Physical AI时代构建,让任何团队都能在数分钟内从其运营环境中提取智能,无需模型训练、标注或机器学习专业知识。


常见问题

什么是Physical AI?
Physical AI是指感知、推理并对其所处的物理世界做出行动的AI系统。与传统人工智能处理数字输入并产生数字输出不同,Physical AI系统通过传感器、摄像头和执行器直接与真实世界环境交互。实例包括自动驾驶车辆、人形机器人、机械臂系统和AI驱动的运营视觉平台。

Physical AI是如何工作的?
Physical AI通过三个集成层工作:感知(通常是计算机视觉和传感器融合)、推理(通常是基础模型或强化学习智能体)和行动(将决策转化为物理运动或运营响应的控制系统)。训练Physical AI通常涉及模拟环境中的强化学习、来自人类示范的模仿学习,或在物理任务数据上微调预训练的基础模型。

Physical AI与传统机器人有何不同?
传统机器人以固定规则编程,只能执行它们明确设计好的任务。Physical AI系统能够泛化,适应新场景,从经验中学习,并像人观察和解读环境那样进行上下文推理。Physical AI使机器人比基于规则的自动化系统更加智能和适应性强。

计算机视觉在Physical AI中扮演什么角色?
计算机视觉是大多数Physical AI系统的主要感知层,占据Physical AI技术市场相当大的份额。它赋予机器实时看见和解读物理世界的能力:检测物体、理解空间关系、追踪运动、识别事件。没有计算机视觉,大多数Physical AI系统对其运行的环境将形同瞎子。

VGI与Physical AI有何关系?
视觉通用智能(VGI)将Physical AI的原理应用于企业级的运营视觉智能。VGI系统通过摄像头感知真实世界环境,无需特定任务训练即可理解正在发生的事件,并通过智能体式计算机视觉在运营工作流中采取行动。对于运营物理设施的组织而言,这是Physical AI最实用、最可立即部署的形态之一。

原文链接: What Is Physical AI? The Era of Intelligent Machines

https://viso.ai/deep-learning/physical-ai/

免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。

如有疑问请发送邮件至:bangqikeconnect@gmail.com