脑电波:物理AI的下一把钥匙

脑电波技术革新机器人训练方式
在加利福尼亚州圣利德罗市的一个仓库里,一场关于物理AI前沿的实验正在进行,犹如一场精心搭建的叠木游戏。这个仓库属于Encord公司,一家专注于构建数据工具以训练AI模型的企业。安德鲁·塞哈是公司的”飞行员”——他们这样称呼机器人训练师,他正小心翼翼地从摇摇欲坠的木塔中抽出木块,同时佩戴着一台配有摄像头的头戴设备,记录他所看到的一切。
这种头戴设备并不罕见,它是收集机器人训练数据的常用工具。但与众不同的是,这款设备还配备了能够测量脑电波的传感器,在塞哈仔细拆卸木塔的过程中,实时捕捉他的脑部活动。这项实验由Encord与德国神经科学初创公司Zander Labs合作进行,后者专注于通过测量脑部活动来推断错误、意图和惊讶等心理状态,从而为模型训练创建更有价值的数据集。
脑电波数据的价值
Zander Labs的神经科学家卢卡斯·格尔克监督这项工作,他表示:”在特定任务过程中,任何时刻的脑部活动量,对于需要决定何时部署高资源模型的模型构建者来说,提供了重要线索。”
Encord机器人学习部门负责人维尼思·韦尔穆鲁甘称,这是解决机器人数据瓶颈问题的”前沿领域”。作为一名OpenAI机器人实验室和仓库自动化公司Berkshire Grey的资深人士,韦尔穆鲁甘加入Encord的目的是建立公司的内部数据创建团队。
物理AI的数据困境
Encord最初成立是为了帮助构建机器视觉应用的公司标注数据和评估模型。随着客户——韦尔穆鲁甘表示他们与许多领先的机器人公司合作,但他无权透露具体名称——开始将端到端学习应用于机器人操作任务,高管们意识到他们将不得不自己生产训练数据,而不仅仅是管理现有数据。
“所需的数据根本不存在,”韦尔穆鲁甘坦言。生成式AI能为机器人带来的变革潜力与聊天机器人相比同样令人期待,但同样面临着数据瓶颈的挑战。自动驾驶汽车公司自行收集物理世界数据,但这难以规模化。通过视频进行训练是可行的,但缺乏真实世界数据的保真度。韦尔穆鲁甘估计,需要比YouTube视频库大5倍的数据集才能实现突破,这一规模有助于解释为什么数据生成本身已经变成了一项业务,而不仅仅是一个研究问题。
满足自我中心数据需求
构建机器人大脑的公司现在转向两个主要数据来源:由佩戴摄像头的工人收集的”自我中心”视频,通常配有额外的摄像头角度和其他指标;以及远程操作机器人收集的数据。Encord同时采用这两种方法,从全球多个工厂收集自我中心数据,并利用其在圣利德罗的设施试验新模态,如脑电波,或围绕特定技能收集微调数据集。
当参观者到达时,”飞行员”们正在使用主从装置——一对机械臂,一个由人类操作员直接控制,另一个模仿其动作——创建关于倒咖啡入杯(非常容易洒出)和堆叠扑克筹码等任务的数据。韦尔穆鲁甘表示:”每个人形机器人公司都向我们索要这些数据。”
存储架上摆放着假花花瓶、书籍、塑料蔬菜、猫砂盆和铲子、电线袋和捆,这些都是训练家庭任务操作器的库存材料。在一个工作站,另一位飞行员索菲亚·因凡特操控机械臂插拔服务器背面的以太网线——数据中心运营商渴望这类工作能够自动化,前提是机器人能以所需精度操作它们。亲自操作后,我能理解为何这仍然难以实现:钳子远不如人类手指灵活,缺乏我们手臂所拥有的自由度。
数据标注的价值与挑战
Encord正在开发的另一种新数据模态使用绑在前臂的一组传感器来检测肌肉中的电信号。通常拍摄的人类手部操作物体的视频无法捕捉整个手,但韦尔穆鲁甘希望基于手臂传感器构建手的3D描绘,为模型提供更稳健的理解。
Encord的数据集包含对每个视频内容的物理描述标注,如”右手拧紧螺栓”,以帮助基于LLM的模型理解正在发生的事情。韦尔穆鲁甘估计,这种密集标注对于训练特定任务来说,价值是”劣质自我中心数据”的100倍,而生产成本仅高出20倍,从理论上讲这是一笔好交易。
但”20倍”仍然是真金白银,这就是难点:像LLM制造商通过抓取Stack Overflow和互联网其他内容来构建模型一样,从互联网上抓取文本成本几乎为零。生成物理训练数据则不然,这就是物理AI与LLM比较的局限性所在。
关注微信号:智享开源,及时了解更新信息。
原文链接:https://techcrunch.com/2026/07/26/are-brain-waves-the-next-unlock-for-physical-ai/


公众号:智享开源
还没有任何评论,你来说两句吧!