OpenAI在Hot Chips大会公布自研推理芯片Jalapeño首批基准:在SemiAnalysis InferenceX测试中,跑GPT-OSS 120B、DeepSeek R1、Kimi K2.5 1T三模型时,峰值吞吐下每瓦AI工作量达对比系统1.5-1.9倍,端到端延迟低1.7-3.6倍,高交互负载性能高2.1-4.1倍,对比基线为NVIDIA Blackwell。芯片额定700W、实测持续功耗≤550W,由OpenAI与Broadcom合作、9个月完成tapeout,AI辅助设计算术电路。2026年底小规模部署,2027年放量。
亚马逊开源Kiro Crew,一个跨会话运行多个Kiro编码Agent的系统,支持共享记忆、可复用技能、定时任务与并发Agent,可让事故排查、工单分诊、迁移等任务在无人值守下持续进行。项目内部名为MeshClaw,据报道已被超39000名开发者采用、500人贡献。通过Agent Client Protocol编排,自带OS级沙箱、默认拒绝命令与审计日志,社区反馈token消耗显著高于Kiro CLI是主要争议点。
Sony Music、Warner Chappell等出版商在加州联邦法院起诉Anthropic,CEO Dario Amodei与联合创始人Benjamin Mann被列为个人被告,48页诉状指控其指挥盗版下载。诉状称Anthropic从LibGen/PiLiMi Torrent下载至少700万本书,并从MusixMatch等平台抓取歌词,索赔每侵权作品最高15万美元。诉方还主张「合成数据洗白」不免责:用学过盗版内容的非商用模型生成数据再训练商用Claude仍属侵权。
两位MATS研究者在LessWrong发布研究:让Claude Code与Codex在执行200个ProgramBench任务外加18个自建基准前后估计耗时,两系统均系统性高估——Claude平均偏差3倍,Codex达6-10倍,短任务偏差最大。同一模型在不同harness下行为迥异:Claude Code中位数跑90分钟,Codex约30分钟即停;且模型自评普遍虚高20个百分点。给Agent提供读取时钟的工具后判断几乎全对,作者建议长期任务必须外挂时间感知。
Cloudflare将AI Search扩展为面向Agent的自定义数据搜索引擎:新增discover模式可在无sitemap时自动发现页面,支持多站点/多实例统一检索端点,一条npx wrangler命令即可完成爬取、解析、嵌入与检索全流程,并直接暴露免认证的/search与/mcp端点供Agent调用。Beta期免费,GA后默认模型嵌入与重排序免费、按答案生成计费,可索引结构化与非结构化数据。
博科尼大学1053名新生的随机对照实验:2025年11月13个班随机分为对照组、因果推理课、GPT-4o访问与两者结合。结果GPT-4o组在5分制营销作业上得分高近1分,答案平均多2个点子且更接近专家建议;因果推理课未提高传统分数但显著提升方案多样性与因果解释。更关键的发现:可证伪性与偏离同伴的原创性在现有评分标准下反而与低分相关——评分体系度量的是结构与完整度,而非理解。
雷峰网分析指出,Jalapeño跑分公布后Reddit将其与NVIDIA Rubin直接对比,争议聚焦测试条件与平台形态是否对齐;同期NVIDIA正将Groq 3 LPU拉进自家推理系统,专门处理Token生成负载。文章认为Token成本(吞吐、延迟、单位功耗)正取代峰值算力成为大模型硬件竞争的新坐标,推理专用架构与通用GPU的路线分裂已经开场,Agent多轮调用放大了延迟敏感度。
Anthropic确认9月14日起Pro/Max/Team/Enterprise的Claude Code基线限额永久上调25%,但当前生效的临时50%加成同时到期,实际可用额度较现状缩水17%。此前Anthropic刚宣布与SpaceX合作获得Colossus 1数据中心超300兆瓦、22万张GPU算力,并将5小时限额翻倍、取消高峰限流。额度「先放后收」反映出推理算力供给仍是Agent产品规模化的硬约束,重度用户的token预算需要按官方日历做规划。
Caterpillar CTO Jaime Mineart在Ai4大会接受TechCrunch采访,分享从矿山自动化到工地AI的迁移经验:AI Assistant已供现场技师语音调取维修流程,底座是160万联网设备与超16PB结构化数据。内部用Agent现代化遗留代码、生成测试并提前发现缺陷。她的核心提醒:部署自主机械不等于改造完成,把技术嵌入现场工作流、重新设计人的协作方式才是最难的部分——「物理AI的难点在于融入客户工地与流程」。
雷峰网复盘8月17日GitHub大故障(Web与API错误率一度近20%)与Cursor Origin early beta全量开放的时间巧合:Origin把repository、PR、checks、review、merge和Automations放进同一套为「agent scale」设计的体系。文章观察:代码仓库的主人正从人变成Agent,持续运行的Agent产生的commit/PR压力远超人类节奏,现有协作基础设施按人设计,故障与重构都是这一迁移的先兆。