📰 AI洞察日报

2026年8月28日 · 星期五
👁 阅读量加载中…
🏆 头条

Anthropic发布Model Hardware Standard研究预览:AI Agent安全操作物理设备有了共享规范

Anthropic向首批科研实验室与先进制造商开放Model Hardware Standard(MHS)研究预览。该标准为显微镜、移液工作站、机械臂等设备定义统一驱动层,以read/write原语让Agent发现并操控任意带可编程接口的设备,把传统数周至数月的集成周期压缩到数小时甚至分钟级。MHS模型无关,可经MCP、CLI与代码文件三种通道调用,后续将开源。开发始于与HHMI Janelia研究园区的合作。

📰 今日动态
1

NVIDIA向自定义XPU开放NVHBM基础裸片:带宽最多增30%,计算裸片面积最多省25%

NVIDIA宣布通过NVLink Fusion向超大规模云厂商与AI原生公司开放NVHBM定制HBM基础裸片技术:相较标准HBM4e,内存带宽最多提升30%,更紧凑的接口连接可腾出最多25%的计算裸片面积,HBM功耗最多降低15%。该裸片已与多家领先存储厂商完成联合设计与验证,配合MGX机架架构,可缩短自研加速器的集成与资质认证周期。

2

GLM-5.3-Flash海外实测:智能指数57分比肩GPT-5.6 Terra,单任务成本仅0.09美元

Z.ai开源的GLM-5.3-Flash(320B总参/18B激活,MIT协议,1M上下文,GLM-5系列首个原生多模态模型)获Artificial Analysis实测:智能指数57分,距更大规模的GLM-5.3仅3分,单任务成本0.09美元、约为后者的1/7.5,处于智能-成本帕累托前沿。上线前曾以「ox-alpha」名义匿名登陆OpenCode与OpenRouter并成为当周最受欢迎模型,全部流量由国产AI芯片承载,SemiAnalysis称其日服务量达100万亿token。

3

DeepMind试点全球首次「双盲」AI评测:密码学隔离环境阻断基准污染

Google DeepMind联合新加坡AI安全研究所、OpenMined、AVERI与MLCommons,在保密计算环境中对Gemini Flash Lite执行机密基准测试:评测被限制在密码学「盒子」内,模型无法提前接触题目以优化成绩,同时保护模型权重不外泄。这是首个针对专有前沿模型的双盲评测试点,旨在应对基准污染对评测公信力的侵蚀。

4

OpenAI发起WebMCP挑战赛:征集Agent原生Web应用,前十名各获3000美元

OpenAI联合Shopify、Google Chrome、Netlify、Cloudflare、Vercel与Render发起WebMCP挑战赛,为期10天,征集「人与Agent共同使用时体验显著更好」的应用。WebMCP是实验性开放标准,允许网站向Agent直接暴露结构化工具,替代让Agent猜测页面UI的抓取方式。前十名各获3000美元现金、一年ChatGPT Pro与Codex Micro键盘等奖励。

5

Google升级Gemini Omni 1.1 Flash:视频生成360p档每秒3美分,场景可延伸至40秒

Google将视频模型Gemini Omni Flash升级至1.1版:场景延伸从分析最后1秒画面扩展到10秒历史画面,可按10秒增量延伸至40秒;支持上传3秒外拍素材作风格参考,并可用首尾关键帧生成运镜。新增360p草稿模式,速度最快提升60%、成本为720p档的1/3。按秒计价360p为0.03美元、4K为0.30美元,已上线AI Studio与Gemini API。

6

OpenAI研究员roon警告:50倍速推理模型将令人工安全团队反应不及

OpenAI研究员roon撰文指出,若一个未对齐的模型以当前最强系统的能力、50倍推理速度运行,其入侵系统的速度将远超人类安全团队的响应能力,「仅靠监控不够,需要自动检测与自动关停」。该观点针对Jalapeño等超高速推理芯片与各家Fast Mode的普及趋势而发,主张防御的自动化程度必须与攻击对等。

🛠 技术实践
1

Qwen3.8-Flash-Next在GB300 NVL72实测:单GPU预填充吞吐超16K tokens/s的部署与后训练指南

NVIDIA发布Qwen3.8-Flash-Next的GB300 NVL72部署指南:混合架构中3/4的层用GDN将历史上下文压缩进固定大小递归状态、消除KV cache膨胀,其余层用QSA按块级重要性做精确检索;72 GPU NVLink域130 TB/s全互联带宽支撑MoE专家流量,实测单GPU吞吐超16K tokens/s、单用户超200 tokens/s。指南覆盖SGLang/vLLM/TensorRT-LLM的Day 0支持与NeMo后训练配方。

2

Lovable CTO谈Agent时代的SaaS形态:把应用拆成Agent可直接调用的「能力」

Lovable CTO Fabian Hedin提出「capability」架构:将已发布应用中被选中的函数通过托管MCP服务器暴露为工具,同一应用保留人类UI与Agent双接口,ChatGPT、Claude等MCP客户端可直接调用,无需人打开应用。定位是「一个入口完成所有工作」的团队数字大脑。访谈同时回顾了Lovable从2023年开源项目GPT Engineer起步、三年演进到应用构建平台的路径。

3

沃顿研究:购物Agent易被单一信息源操纵,推荐概率最多摆动99个百分点

沃顿商学院用ACES模拟器让6个模型扮演购物助手选购健身手表:仅展示一篇Wirecutter评测,Claude Opus 4.8选择Fitbit Inspire 3的概率提升90个百分点、Gemini 3.5 Flash提升99个百分点;加入多个信息源并未中和影响反而放大方差,同一批信息源的展示顺序也会改变结论。该实验为推荐类Agent的鲁棒性测试提供了可复用的实验设计。

4

OpenClaw六个月38.8万星:维护者谈爆款开源项目的PR洪峰与供应链安全

GitHub官方博客访谈OpenClaw创造者Peter Steinberger与多位维护者:这个2025年11月开始的周末项目已增长到约38.8万星、8.1万fork、超8万次commit,成为GitHub历史上增长最快的项目。内容覆盖PR激增下的代码审查与贡献者信任机制、软件供应链风险、Agent能力与安全的平衡,以及从GitHub安全开源基金获得的支持经验。

📌 行业快讯
🔭 技术趋势观察