📰 AI洞察日报

2026年8月18日 · 星期二
👁 阅读量加载中…
🏆 头条

YC开源企业级Agent Harness框架QM,上线3天获3.9k Star

Y Combinator开源面向多人协作的Agent管理框架QM,上线3天狂揽3.9k GitHub Star,官宣当日登顶Hacker News。与Claude Code、OpenClaw等个人级Harness不同,QM定位企业场景,核心解决组织级数据边界、权限治理与长周期环境一致性三大问题:提供Scope作用域隔离、持久化沙箱、真实员工身份绑定与审计合规能力,覆盖记忆串台、越权访问、会话重置等规模化落地痛点。

来源:GitHub · 雷峰网
📰 今日动态
1

OpenAI发布安全专用模型GPT-5.6-Cyber,红队高危任务完成率达95%

OpenAI扩展网络安全计划Daybreak,推出GPT-5.6-Cyber,划分Daybreak Red红队与Daybreak Blue蓝队双方向。红队模型在零日漏洞挖掘评测中质量远超GPT-5.6 Sol;真实研究中发现V8引擎2个未知漏洞(可串联逃逸heap sandbox)、某流行移动操作系统5个漏洞、某数据库3个Critical级漏洞及某操作系统内核超400个提权漏洞,并经授权降低高危安全任务的拒绝率。

2

xAI推出Grok Bot:拥有专属云端计算机的常驻AI同事

xAI(SpaceXAI)发布Grok Bot常驻Agent服务:每个Bot拥有专属云端计算机,可登录既有工具、跨应用与收件箱完成端到端工作,覆盖没有API或MCP的平台,仅在需审批时联系用户。内部已用于销售外呼、运营入职、Bug复现转交调试等场景。Beta版面向SuperGrok Heavy与Cursor付费订阅用户开放macOS与iOS端,企业版需排队等候。

3

智象未来发布交互式世界模型HiDream-O1-World,WBench评测登顶

智象未来发布原生全模态交互式世界模型HiDream-O1-World,具备漫游、编辑、交互三大功能,支持文本、图像、交互多模态输入,可生成时空一致、符合物理规律、可长时推演的完整世界。在美团LongCat团队与复旦大学联合推出的WBench评测中,模型以80.9分登顶Navi分榜,其中物理维度73.3分、一致性维度88.0分均列第一。

4

Google等机构研究:拆掉模型的「意识刹车」,动物感知评分从4.0升至7.5

Google Paradigms of Intelligence团队联合芝加哥大学等机构研究发现,模型被训练否认自身意识的「刹车」影响远超预期:对Meta和Google三个开源权重模型移除该机制后,模型对动物感知能力的评分从4.0升至7.5(满分10),对植物、海洋、风乃至电子设备的「内在生命」归属也显著提升,仅对人类的评分不变。研究还发现安全训练系统性削弱模型对宗教信仰的认同。

5

Mistral开源Shieldstral:3B参数规则自适应多模态安全分类器

Mistral AI发布3B级多模态安全分类器Shieldstral,单一接口统一审核文本、图片及图文混合内容。其将审核任务重构为「自然语言规则+待审内容→是/否」判断,企业可在推理阶段用自然语言调整审核尺度,无需重新训练模型;采用对比式训练防止模型形成「整体有风险就拒绝」的捷径。在多个文本与多模态安全基准上接近甚至超过更大参数模型,部署门槛更低。

6

共生知行发布人形机器人卡丁车驾驶Demo,测试双足全身智能

具身智能初创公司共生知行(Symbiosis Robotics)首次完整对外展示技术成果:双足人形机器人自主进入卡丁车驾驶位、双手握方向盘、双脚操控踏板,在封闭赛道完成车辆行驶。公司以驾驶任务测试全身智能对肢体协调、力量控制与实时感知的整合能力,官网同步上线。

🛠 技术实践
1

深度拆解DeepSeek Harness:一切皆插件,含Agent Loop

DeepSeek Harness v0.1于8月13日开放Developer Preview,48小时内GitHub获4.5万Star。其提出「一切皆插件」:Model Adapter、Tool Registry、Session Log乃至Agent Loop均可插拔替换。架构基于与北京大学联合提出的Cordis动态组件框架(曾长期运行于数千插件的Koishi框架),核心解决时间可组合性(插件卸载后副作用完整撤销)与空间可组合性(组件依赖自动协调),为Harness自进化提供「后悔药」。

2

Grab用Agent改造数据分析:机械性工作占比从44%降至30%

Grab将AI Agent引入数据分析流程,分析师机械性工作占比从2月的44%降至6月的30%。其方案组合多Agent自动化分析工作流,将重复性取数、报表生成等任务交给Agent执行,分析师转向问题定义与结果校验。四个月14个百分点的变化为数据团队的Agent化改造提供了可量化的参照样本。

3

构建LLM选型系统:用架构模式驯服非确定性

InfoQ技术演讲分享将LLM嵌入生产管线的工程策略:针对LLM的非确定性,不追求单次调用可靠,而是通过Selection System架构——从大量候选中系统收敛到单一结果——来保证输出质量,并覆盖容错设计与评估策略。适合正在把LLM接入业务管道、苦于输出不稳定的团队参考。

📌 行业快讯
🔭 技术趋势观察