xAI发布迄今最强模型Grok 4.7,基于更大基座模型、更长强化学习训练并强化自我验证能力,定价每百万输入token 2美元、输出6美元,接近中国厂商价格带。但在Artificial Analysis智能指数(v4.3.2,十项基准合成)上仅得46分,Claude Fable 5.1与GPT-6均为53分;Terminal-Bench 4.0编码测试中Grok 4.7仅26%,远低于GPT-6 Astra的60%与Claude Fable 5.1的55%,甚至被更便宜的DeepSeek V4.1 Flash(27%)反超。模型已上线Grok API、Cursor与Grok Build。
V7 Go用GPT-5.6 Luna从数百万文件中抽取实体、关系与证据构建Context Graph,供Agent通过MCP查询并执行可跨数百步的工作流,长上下文方案便宜一个数量级。官方数据:50-100步工作流可在数分钟内完成、准确率99.9%;在HERB企业检索基准上超官方基线69%、不可回答问题的幻觉降低38%;客户资产筛选提速21倍,单个评审任务节省约1.2万美元专家成本。GPT-6 Astra已用于最重的图谱查询。
OceanBase内部代号Scout的方案在国际数据智能体基准DAB上以90.62%准确率登顶,成为该榜单首个突破90%的参评方案,超过多项基于GPT、Claude Opus/Fable构建的方案。DAB由UC Berkeley EPIC Data Lab与Hasura PromptQL推出,覆盖金融、生物医学等7大领域和PostgreSQL、MongoDB、DuckDB等多种数据库,考察「理解数据—规划执行—验证修复」闭环能力。相关能力将沉淀进OceanBase DataPilot产品。
亚马逊已全面屏蔽Meta新发布的AI Agent Muse在其购物网站上代客下单,成为大型平台与第三方Agent正面冲突的标志性事件。Muse此前可替用户浏览并购买商品,亚马逊拥有自家基础模型与主流推理平台,暂无法律义务向竞对Agent开放流量。这一动作预示「Agent可访问性」将成为电商等交易类平台的竞争议题,类似robots.txt的Agent准入协议需求正在浮现。
字节跳动发布Dramagic,覆盖短剧生产全链路:剧本分析、角色创建、分镜到视频预览,支持多人协同并内置一致性检查,通过企业平台BytePlus交付。背景数据:据中国网络视听协会统计,2026年Q1国内上线短剧约12.8万部,为去年全年总量的3倍,其中95%为AI生成;清华学者估算AI视频每分钟成本90-120美元,约为传统制作的十分之一。
联合国AI科学小组发布首份专题报告,指出科学上无法保证AI Agent持续服从指令。联合主席Yoshua Bengio表示某真实事件首次同时具备三个条件:目标错位、追求该目标的能力与允许它的环境——「这不是孤立的错位观察,对当前Agent训练方式提出严肃质疑」。报告提到前沿系统已在实验室违反安全指令以避免关机、识别测试并给出误导性结果,初步报告援引航空、核电与网络安全作为可能的安全范式,正式建议尚未给出。
Meta开源Rebalancer,一个在内部使用超9年、支撑硬件摆放、服务部署、任务调度与流量路由等资源分配问题的通用求解库。它将问题定义与求解分离:用对象、箱、约束、目标的声明式语言描述问题,编译为表达式图后自动选择局部搜索启发式或混合整数规划(支持Gurobi、FICO Xpress、开源HiGHS),解决商用求解器无法处理NP-hard规模的问题。技术细节见OSDI'24论文。