OpenRouter分析师Peter Walker统计,2026年2月6日可能是人类消耗token量最后一次超过AI Agent。此后Agent的token用量增长14倍至7.3万亿,人类仅增2.8倍;其中约70%为缓存命中,按低价计费。Agent自主拉起子进程、长程工作的模式成为token消耗主体,token经济学的底层假设正在改写。
8月22日国家速滑馆,银河通用人形机器人接住时速超50公里的来球,掌握发球、正反手、网前截击,摔倒后自行爬起继续比赛。核心是大脑-小脑-脑桥一体化的AstraBrain模型与AstraBrain Latent规控算法:从普通人零散动作片段中提炼技能,配合百亿级数据集银河星坊做多智能体仿真对练,实现技能涌现与真机迁移。
据Bloomberg报道,受三星、SK海力士、美光DRAM涨价影响,搭载Vera Rubin与Grace Blackwell芯片的NVIDIA AI服务器价格将上调15%以上,明年年初出货生效,为微软、谷歌、Oracle代工的厂商已通知客户。账单最终落在云巨头与OpenAI、Anthropic头上——它们一边自研芯片求自主,一边仍是NVIDIA的最大买家。
周四起一款名为Ox Alpha的免费推理模型现身OpenRouter,定位编码与持续Agent工作负载,被Stripe CEO Patrick Collison称为「非常惊艳」。开发者身份匿名,OpenRouter仅称其为「选择匿名的第三方供应商」。社区猜测在智谱GLM与微软MAI之间摇摆,分析师Andrew Curran称最初证据指向Z.ai,但「现在没人确定了」。
Google开源HEIR(同态加密中间表示)编译器工具链,可将为明文输入训练的PyTorch模型编译为直接在加密数据上运行,开发者只需在Python中标注需加密的数据类型。Google已将其用于加密内容推荐、信用卡欺诈检测与音频热词识别。HN社区关注性能:FHE加法约100ms、除法可达8秒,但LLM计算以乘加为主,开销前景相对乐观。
Mistral宣布三项举措:区域推理端点正式GA,推理可选在欧美区域执行并满足数据驻留要求;Priority Tier公开预览,提供SLA保障与自定义限流;平台引入第三方开源模型,首发Z.ai的GLM-5.2,与自家模型享受同等区域管控与服务承诺。同时牵头组建欧洲算力联盟,以ECU单位聚合多年期需求,计划2030年前建成1GW容量。
Cloudflare发布Kitesurf:运行于Workers的轻量浏览器引擎,复用Rust渲染引擎Blitz与Firefox的Stylo CSS解析器,支持Chrome DevTools协议,Playwright/Puppeteer可直接驱动。每个页面在独立Dynamic Worker中运行,自带隔离JS环境与DOM,专供截图、HTML提取等Agent任务。不支持视频与WebGL,定位是任务级临时、无状态引擎,资源开销远低于完整Chromium。
Oxford中国政策实验室研究显示,Anthropic对中国的严格封锁(信用卡核验、活体自拍KYC)正被「中转站」系统性绕过:境外服务器代理转发API,微信支付宝人民币结算。供应链高度模块化,封号后数小时即可重建。德國CISPA检测17个API代理发现普遍「掺水」换模型;更深一层,代理可见全部请求日志,可作蒸馏数据变现——token生意或许只是获客,日志才是利润。
DoorDash在QCon分享SafeChat平台:用「小模型+规则先行、LLM兜底」的混合模式替代昂贵的纯LLM审核管线,压缩成本与延迟,支撑实时交易市场的内容风控。平台设计为内容无关(content-agnostic),同一套审核能力覆盖商品、评论、消息等多场景,是AI安全系统按生产基础设施来做的可落地参考样本。