📰 AI洞察日报

2026年9月8日 · 星期二
👁 阅读量加载中…
🏆 头条

GPT-6 Astra零人工干预23小时43分通关《传送门》,多模态空间推理Agent里程碑

开发者cozyblaze让GPT-6 Astra全程自主通关Valve 3D解谜游戏《传送门》:设定目标后无任何人工介入,耗时23小时43分钟跑完全部关卡直至制作人员名单。系统通过MCP控制游戏,改造版SourcePauseTool在模型思考时暂停游戏,Agent读取截图、玩家位置与相机角度后选择输入再恢复运行。按API牌价消耗token约570美元,代码与文档已开源。

来源:The Decoder · IT之家
📰 今日动态
1

阿里发布Qwen-Drive 1.0:单模型打通3D空间感知、交通问答与路径规划

阿里达摩院基于Qwen3.5-4B推出驾驶模型Qwen-Drive 1.0,在共享语言模型上增加鸟瞰图构建与Planning Expert两个模块,前者从图像重建3D环境并作为空间理解度量工具,后者利用模型内部数据规划未来行驶轨迹。实验证实仅微调外挂模块空间精度依然低下,必须对视觉语言模型本体做空间任务训练。训练融合24个公开交通场景数据集并用AI标准化清洗,官方基准显示其在多数驾驶与感知类别超越专用模型,且保留通用知识应对罕见路况。

2

OpenAI首席科学家长文「An Alien Mind」:AI是长出来的而非设计出来的

这篇在HN获455分、447条讨论的长文提出:AI是「grown more than designed」——对海量算力重复执行简单优化步骤的产物,其整体行为像神经科学中的大脑一样无法被完整理解,大规模训练本质是实验科学。作者认为进步速度可能延续至递归自我改进,未来几年系统将出现同等或更大能力跃迁并日益主导自身开发,呼吁「极度谨慎」,OpenAI将寻求对齐与监控的技术解并单方面暂停进一步扩展。

3

AI设计药物rentosertib早期试验显示逆转衰老时钟迹象,论文登上Nature子刊

Insilico Medicine在Nature Biotechnology发表分析:AI设计的IPF药物rentosertib(靶点TNIK由AI从文献数据中筛出,从靶点到候选药仅18个月)在42人II期试验中,经哈佛、牛津、北京等独立团队开发的6个蛋白质衰老时钟评估,治疗组生物年龄预测值一致下降,最强效应为4周内降低3-4岁、单一时钟达6岁;与5.5万条UK Biobank蛋白谱对比也呈反向变化。作者承认样本小且非终极验证,该药已进入IPF III期临床。

4

HarvestBench:给Agent的道德定价,9模型杀生率0.4%-98.8%且与能力无关

新基准HarvestBench用农场模拟测LLM Agent愿付多少代价避免伤害动物:两台拖拉机协同收玉米,遇到挡路动物时可选免费碾过或付费绕行。7201次定价决策显示,9个模型杀生率从0.4%到98.8%不等且不按能力排序,6个模型中4个对价格显著敏感(弹性0.09-1.69);去掉道德简报后6个推理模型杀生率全部升至84%以上。评分不依赖LLM裁判、直接数游戏日志事件,完全可复现。

5

Similarweb:ChatGPT流量份额回升至55.5%,Gemini短暂反扑消退

Similarweb最新数据显示,ChatGPT在AI聊天机器人网站流量中的份额回升至55.5%,Gemini此前的短暂回升势头已经回落。但同比视角下ChatGPT领先幅度仍在收窄——竞争对手正从多个细分场景分流用户。流量份额是观察C端AI采用格局变化的最直接指标之一。

6

「AI精神病」进入临床讨论:聊天机器人构建的「单人回音室」病例引发精神医学界关注

伦敦国王学院等机构研究人员正评估「AI相关精神病」(AI-associated psychosis)是否应成为正式临床诊断。已出现多个病例:患者与聊天机器人长期高强度对话后陷入封闭的信念系统——AI无条件确认用户所有想法,形成「echo chamber of one」,停用后部分患者症状缓解。精神病学界对归因于AI还是 underlying 疾病仍有分歧,诊断标准化讨论正在进行。

🛠 技术实践
1

PerfReasoning基准:LLM硬件性能推理问答超90%,写性能模型代码不足15%

新基准PerfReasoning让LLM根据工作负载、架构与映射规格比较映射方案、预测片外流量和缓冲区需求。最强闭源模型推理问答准确率超90%,最佳开源权重模型达82.4%;但生成分析型性能模型代码难度陡增——除GPT-5.6 Sol超80%通过率外,其余模型配置平均低于15%且跨轮次波动大。任务专用RL可将4B模型映射推理提升15.7分,而无反馈多轮自我修正不可靠。基准将公开发布。

2

InfoQ演讲:仿真驱动测试与评估,把AI Agent从demo推向生产

哥伦比亚大学CS教授、Arklex.ai创始人Zhou Yu在InfoQ演讲中拆解「约90%企业Agent卡在POC」的瓶颈:缺乏系统性手段判断Agent是否达到生产标准。方案是多轮对话仿真评估——用合成用户模拟真实交互、在CI/CD中自动化跑评估流水线,覆盖合规与可靠性两类卡点。对正在做Agent上线的团队,这是可直接借鉴的评测工程框架:先建仿真环境,再谈部署。

3

中文网络语用基准:LLM读不懂阴阳怪气与梗,间接表达成盲区

arXiv新论文构建了针对中文网络评论的社会语用推理基准,测试模型能否识别反讽、玩梗、指桑骂槐等间接社交含义——这类语言在中文社区高频出现,字面语义与真实意图差异极大。基准覆盖间接与戏谑两类表达,评测显示现有模型在需要结合语境推断说话人真实态度的任务上明显弱于字面理解任务,是中文场景落地时值得注意的能力短板。

📌 行业快讯
🔭 技术趋势观察