机械臂不读README:当Agent需要一份新接口标准
8月27日,Anthropic 发布了 Model Hardware Standard(MHS)的研究预览,向首批科研实验室与先进制造商开放。这份标准要做的事情,用一句话概括:让 AI Agent 能安全地操作显微镜、移液工作站和机械臂——用统一的 read/write 原语发现并操控任意带可编程接口的设备,把传统数周至数月的硬件集成压缩到数小时甚至数分钟。 新闻标题读起来平平无奇,但把它放进时间线里,分量立刻不同:五天前,OpenAI 刚联合 Shopify、Chrome、Netlify、Cloudflare 发起 WebMCP 挑战赛,推动网站向 Agent 暴露结构化工具。一周之内,「Agent 可操作的世界」被三层标准完成了分层切割——MCP 管工具调用,WebMCP 管 Web 内容,MHS 管物理设备。 这不是又一次产品发布,而是一场接口战争的开端。本文拆解 MHS 的技术内核、它背后的行业脉络,以及一个更值得琢磨的问题:当 Anthropic 试图成为 Agent 与物理世界之间的「合同模板」时,我们该期待什么、警惕什么。 物理世界没有 API 要理解 MHS 解决的是什么,得先理解实验室自动化如今有多原始。 一个典型的生物实验室里,坐着来自十几家供应商的设备:Tecan 的移液工作站、布鲁克的显微镜、UR 的机械臂、某家小厂的酶标仪。每台设备都有自己的控制软件、自己的文件格式、自己的通信协议。让它们协同完成一个实验流程(比如「系列稀释后读板」),需要集成专家为每对设备写定制的粘合代码。Anthropic 给出的数字是:一个实验室或工厂完成硬件集成,通常需要数周到数月。 这个问题的历史比 LLM 老得多。工业界不是没试过:OPC UA 在制造业摸爬滚打了二十年,LIS2-A2 在临床实验室坚守了三十年。它们都败在了同一个地方——实施成本高到只有大型集成商玩得起,长尾设备永远没人驱动。 为什么老标准推不动,而 MHS 有机会?答案藏在一个反直觉的事实里:以前的自动化是在给机器写说明书,MHS 是在给一个会读说明书的智能体写说明书。 传统标准必须把一切形式化:每种设备类型定义完整的对象模型、操作语义、状态机。工程量巨大,且设备一变就要改标准。MHS 反其道而行,只定义两个原语——read(读温度)和 write(设温度),外加一个标准化的设备发现格式。剩下的语义鸿沟,交给 LLM 自己填。 这是范式级的变化:**接口的复杂度预算,第一次可以由「调用方的智能」来买单。**过去我们说「智能的接口设计弥补笨拙的客户端」,现在客户端不笨了,接口可以退回到接近物理本质的极简形态。 MHS 的三层设计 具体拆开看,MHS 的技术设计有三层,每一层都在解决 Agent 操作物理设备的一个特定断层。 第一层:驱动即翻译。 MHS 的核心是一个标准化驱动,把操作系统的调用翻译成硬件动作,任何带可编程接口的设备都能接入。驱动暴露的原语只有 read/write 一组——这是刻意为之的极简主义:原语越少,覆盖面越广,Agent 的推理负担则是可以接受的成本。 第二层:知识即标签。 这是最有意思的设计。Agent 操作一台没见过的设备,缺的不是控制接口,而是「代码里读不出来的知识」——比如机械臂有多重,这对安全操作至关重要。这些信息过去存在纸质手册里、用户的电脑里,或者干脆是老师的隐性经验。MHS 的做法是允许用户用自然语言把这些信息写进驱动的标签,甚至可以让 Agent 反过来「采访」用户关于硬件配置的问题,自动生成。然后驱动会基于标签自动产出一份参考文件:这台设备能测什么、能调什么、强制执行哪些安全限值。这份文件就是 Agent 的设备说明书。 ...