一条被模型发布掩盖的重磅信号
今天早报的头条被 Grok 4.7 占据——定价贴着中国模型打、Agentic 编码却被 GPT-6 Astra 甩开一半以上。这类模型对决的叙事我们已经看了三年,边际信息量越来越低。
真正值得停下来细看的,是新闻列表里那条来自 OpenAI 官网的披露:V7 的「机构记忆」(institutional memory)方案——Context Graph。用 GPT-5.6 Luna 从数百万企业文件中抽取实体、关系与证据,构建成可查询的图结构,供 Agent 通过 MCP 协议检索,支撑跨数百步的长程工作流。
官方给的数据点:
- 50-100 步的工作流可在数分钟内完成,准确率 99.9%;
- 在 HERB 企业检索基准上超过官方基线 69%;
- 对「不可回答问题」的幻觉率降低 38%;
- 客户资产筛选提速 21 倍,单个评审任务节省约 1.2 万美元专家成本;
- 成本比长上下文方案(把文档直接塞进 context window)便宜一个数量级。
这些数字本身就有信息量,但更重要的是它标记的范式位移:企业知识管理的重心,正在从「检索」(retrieval)转向「记忆」(memory)。
Context Graph 到底是什么
先拆技术。过去十年企业 AI 知识方案的主流是 RAG:文档切块、向量化、检索 top-k、塞进 prompt。RAG 的本质是每次都从零开始——每来一个问题,系统临时去语料库里捞一把相关片段,模型基于这些片段作答。语料库本身对模型来说是黑盒,没有任何结构沉淀。
Context Graph 的思路完全不同。它把企业文档预先加工成一张属性图:
- 抽取:GPT-5.6 Luna 扫描数百万文件,抽取实体(人、项目、合同、系统、事件)、关系(谁负责什么、什么依赖什么、哪份合同约束哪个供应商)以及证据(每条边都指回源文件的具体位置);
- 查询:Agent 通过 MCP(Model Context Protocol)对这张图执行结构化查询,而不是对文本做语义搜索;
- 溯源:每条知识都带证据链,模型可以判断「我知道这个结论来自哪份文档、什么时候写的、可信度如何」。
注意那个 38% 的数字——幻觉率降低出现在「不可回答问题」上。这正是 RAG 最脆弱的地方:当答案不在语料里时,向量检索总会返回一些「看起来相关」的片段,模型顺理成章地编造。而图查询可以明确返回「图中不存在这条边」,Agent 得到一个诚实的「不知道」,而不是一个自信的胡说。对结构化知识来说,「知道边界」比「知道得多」更值钱。
成本那一条同样关键。「便宜一个数量级」的对比对象是长上下文方案——即把百万级 token 的文档直接灌进 GPT-6 Astra 的上下文窗口。长上下文是这两年厂商主推的路线,听起来优雅,实际用起来是每次调用都重新「读」一遍整个文档库的暴力解法。Context Graph 把阅读理解的成本从每次查询前置到一次性构建,查询阶段只剩轻量的图遍历。这是数据库领域几十年前就懂的道理:对重复查询的工作负载,建索引永远优于全表扫描。
为什么说这是 Agent 落地的真正瓶颈
过去一年 Agent 刷榜的基准成绩突飞猛进(今天早报里 OceanBase 的 GLM-5.2 方案在 Data Agent Benchmark 上首破 90% 就是例证),但企业内的真实落地普遍卡在同一个地方:Agent 没有组织的记忆。
一个新入职的员工,两周后就知道「报价单要找张工确认、ERP 里的库存数据每周五才准、那个 2023 年的项目其实早就黄了」。这些知识不在任何一份文档的显性表述里,而是散落在数千份文件的交叉引用、邮件、变更记录之间。人类通过长期浸润习得,Agent 却每天都是失忆状态——每次任务从冷启动开始,靠检索临时拼凑对企业的一知半解。
这就是「机构记忆」这个词的分量。机构的知识从来不只是文档的集合,而是文档之间关系的总和。RAG 只能给你文档,给不了你关系。Context Graph 第一次把这个层次的知识变成了 Agent 可消费的形态。
再结合另一个背景:MCP 已经成为 Agent 工具生态的事实标准。Context Graph 作为 MCP 可查询的资源,意味着任何支持 MCP 的 Agent——不只是 OpenAI 自家的——理论上都能接入这张企业知识图。OpenAI 在这里下的注,不是「我的模型更聪明」,而是「企业的知识资产将运行在我的基础设施上」。这个位置的卡位价值,比模型本身的领先窗口(通常只有几个月)持久得多。
一个老朋友的新马甲?
读到这里,做过知识图谱的人会举手:这不就是 Knowledge Graph + LLM 吗?十年前做企业知识图谱的项目,为什么大多失败了?
区别在于构建成本和构建者。传统知识图谱的致命伤是 schema 设计和语料标注:需要领域专家定义本体、需要大量人工标注、需要持续的运维团队。项目费用高到只有少数头部企业的少数场景能负担,而且图谱建成之日往往就是它开始过时之时。
Context Graph 把构建环节交给了模型自己。GPT-5.6 Luna 负责「读数百万份文件、抽取实体关系和证据」这件原本需要人类专家做的事,而且可以增量更新——新文件进来,新边长出来。GPT-6 Astra 负责「最重的图谱查询」。整个流水线里,人的角色从图谱的构建者退化为质量的抽查者。这正是这一轮 AI 叙事反复验证的模式:老技术路线的死结,被模型能力的技术进步解开,然后以新名字复活。
当然要泼冷水的地方也有:
- 抽取质量决定一切。Luna 从文件里抽出的实体和关系,错一条,Agent 就沿着错误的边推理出错误的结论,而且带着「图查询」的权威感。幻觉没有消失,它被前移到了构图阶段,变得更隐蔽了。
- 证据链的时效性。企业知识最值钱的部分往往是最新的部分,图谱的增量更新延迟、旧版本文档与新版本文档的冲突消解,是所有知识管理系统的永恒难题,不会因为构建者是模型就自动解决。
- 厂商锁定的加深。企业的知识图谱运行在 OpenAI 的基础设施上、用它的模型构建和维护,迁移成本会随时间指数增长。这本质上是把企业的「组织记忆」外包给一家商业公司——数据主权问题比现在的 API 依赖严重一个量级。
判断:知识基础设施的窗口期
综合起来,我的判断是三条:
第一,「记忆」将在 12-24 个月内成为 Agent 平台的标配能力,就像 RAG 在 2023 年之后成为标配一样。各家都会推出自己的机构记忆方案,竞争焦点是构图的自动化程度、增量更新的实时性和证据链的可审计性。今天还在手写 RAG pipeline 的团队,值得现在就开始评估:你的检索语料,有多少可以升级成结构化的关系资产。
第二,评测体系会跟着变。当知识以图形态存在,衡量 Agent 的标准不再是「能不能从语料里找到答案」,而是「能不能在关系网络中推理出语料里没写的答案」,以及「能不能诚实地识别自己知识的边界」。今天早报里 HERB 基准 69% 的提升幅度说明,现有评测已经开始分化——擅长 RAG 的方案未必擅长图记忆,这会是下一轮基准洗牌的引线。
第三,也是最重要的:模型的竞争正在让位于知识基础设施的竞争。Grok 4.7 的遭遇(价格贴到地板、智能指数仍落后 7 分、Agentic 编码被反超)说明了单纯模型能力的护城河有多浅。而 Context Graph 指向的是另一种护城河:当一家企业的全部知识资产结构化地运行在你的平台上,模型差 5 分根本不重要。模型是易耗品,记忆是复利。
Agent 泡沫论者常说「演示很惊艳,落地全卡壳」。他们是对的,但卡壳的原因通常不是模型不够聪明,而是 Agent 对组织一无所知。Context Graph 不是终点方案——它有抽取质量、时效性、锁定的三重隐患——但它第一次把「组织记忆」从一个比喻变成了一个可工程化的产品形态。下一个阶段的 Agent 竞赛,不在基准榜单上,在企业那张正在成形的知识图里。