🏆 头条
阿里开源Qwen-Image-2.1:7B参数图像生成模型宣称超越多数闭源模型,消费级3090即可运行
阿里Qwen团队发布开源权重图像生成与编辑模型Qwen-Image-2.1,视觉生成组件仅70亿参数,官方基准显示其超越多数闭源模型(独立基准尚待验证)。模型原生支持RGBA透明图生成与编辑,可同时引用最多10张参考图完成合影、虚拟试穿等任务,通过架构改进与KV cache复用加速多参考图推理,可在RTX 3090等消费级GPU上运行。权重已上线Hugging Face与ModelScope,但采用研究许可证,商用需单独申请授权。
📰 今日动态
1阶跃星辰发布Step 5 Preview:600B稀疏MoE跻身全球开源前三,单任务成本仅Claude Opus 5的1/8
阶跃星辰发布旗舰基座模型Step 5 Preview,采用稀疏MoE架构,总参数600B、激活参数仅27B,支持100万Token上下文与原生视觉输入,面向AI编程、软件工程、金融等Agentic场景。在Artificial Analysis综合智能指数中跻身全球开源前三,单任务成本为Claude Opus 5的1/8。官方称下一阶段Scaling的关键是提升计算转化为智能的效率,模型将于10月15日正式开源。
2腾讯混元发布Gander:全双工语音Agent边说边干活,「小脑+大脑」架构可插拔替换Codex或Claude Code
腾讯混元语音团队联合多所高校发布实时交互Agent模型Gander,同步处理语音、图像与文本,用户可随时打断。架构上「小脑」负责实时对话,「大脑」在后台执行复杂任务且可替换为Codex、Claude Code等Agent系统无需重训。模型以1秒分段决策说话时机,在Full-Duplex-Bench v3全部100个场景中时机判断最佳,打断用户比例仅8%(GPT-Realtime为13.5%),但任务准确率略逊于最弱竞品。训练数据约270万条,团队计划开源权重与训练数据。
3Runway探索实时流式视频生成:基于世界模型GWM-1边生成边播放,用自生成数据抑制误差累积
Runway展示实时视频生成研究:用户不再等待成片,而是像直播一样边描述边流式输出视频,基于其通用世界模型GWM-1逐帧生成,支持镜头运动、机器人指令与音频控制。针对视频模型误差逐帧累积放大的核心难题,Runway在训练中引入模型自身带瑕疵的输出,教会模型自我纠偏而非放大偏差。实时生成将算力开销从训练侧转向推理侧,要求单帧生成速度跟上播放帧率,同时降低单位质量成本使更多应用在经济上可行。
4微软与UIUC发布StudentSim:用会犯真实错误的模拟学生训练AI导师,4B小模型胜过GPT-5.4
微软与伊利诺伊大学香槟分校发布StudentSim,从少量真实学习记录构建个别学生的数字复制品用于训练AI导师。方法分两阶段:先从全体学生汇合数据学习共性错误模式,再用个位数样本个性化适配,基座为Qwen3-4B-Instruct。在国际象棋、英语写作、数学三科60名学生的测试中,StudentSim模拟特定学生的准确率全面超过被提示扮演学生的GPT-5.4,棋类下一步预测准确率约为其两倍;用其训练的国际象棋导师在事实准确性、解释质量与个性化三项评估中均得分最高。
5Google Agent Development Kit for Kotlin 1.0发布:与Python版功能对齐,支持端侧AI Agent
Google发布ADK Kotlin 1.0,成为面向生产环境的AI Agent开发框架,覆盖Kotlin、Android与JVM生态,功能与Python版对齐。开发者可用同一套框架构建服务端与Android端侧Agent,支持在设备本地运行模型,降低延迟与隐私成本。此举将Google的Agent开发栈从Python扩展到移动生态,Android开发者无需跨框架即可接入工具调用、多Agent编排等能力。
6阿里巴巴开源OpenCodeReview:AI代码审查CLI,确定性流水线与LLM审查结合
阿里巴巴开源AI代码审查工具OpenCodeReview,提供CLI形态,将文件选择、变更打包、规则筛选等环节交由确定性流水线处理,LLM专注审查评论生成,兼顾成本可控与结果可复现。工具针对大仓库与高频提交场景优化,规避纯LLM审查不稳定、易遗漏的问题。开源后团队可直接自托管接入现有CI流程,降低对第三方SaaS审查服务的依赖。
📌 行业快讯
- 继OpenAI之后,Anthropic据报将IPO从10月推迟至11月,以展示强劲三季度业绩,投资者预期估值约2万亿美元。 — The Decoder
- Trump宣布组建仿照太空军的「AI Force」并计划任命「AI czar」,声称AI或贡献GDP的25%,推动不受限的AI发展。 — The Decoder
- Epoch AI与Ipsos调查显示,美国成年人几乎每日使用AI的比例六个月内翻倍以上,AI正进入日常生活常态。 — The Decoder
- 剪映举办AI新创作发布会,推出剪映Hub与AI创作助手「小映」,覆盖专业工作台到移动端的一站式AI创作。 — 雷峰网
🔭 技术趋势观察
- 开源小模型在垂直任务上逼近闭源,但「开源」不再等于「可商用」:Qwen-Image-2.1以7B参数宣称超越多数闭源图像模型,Step 5 Preview以1/8成本进入开源前三,开源权重在单项能力上对闭源的追赶速度明显加快。但Qwen-Image-2.1采用研究许可证、商用需单独授权,反映出厂商「开放权重+收紧商用」的新平衡策略。工程师选型时除参数规模外,必须把许可证条款纳入技术决策,开源模型的隐性合规成本正在上升。
- 交互范式从回合制走向全双工与流式,延迟成为交互属性而非交付属性:Gander让Agent边说话边后台干活,Runway让视频边描述边流式生成,共同指向同一转变:用户不再接受「提交-等待-返工」的回合制体验。工程上的通行解法是分层——小模型负责毫秒级时序决策(Gander的小脑、Runway的逐帧生成),大模型或Agent系统负责后台推理,二者解耦且可独立升级。对Agent开发者而言,响应时机的编排能力将成为与推理能力同级的设计维度。
- 模拟用户成为新的训练数据来源,「AI训练AI」方法论开始跨领域迁移:StudentSim用两阶段方法从极少真实数据构建会犯真实错误的学生复制品,替代昂贵的人类陪练来训练AI导师,其「汇合数据学共性+个例数据做个性化」的思路并不局限于教育。在客服、代码评审、销售对话等真实交互数据昂贵的场景,用模拟用户规模化生成带真实偏差的训练信号,可能成为弥补RLHF数据瓶颈的标准做法。前提是模拟体必须复现目标群体的典型错误,而非只模仿表面行为。
- Agent开发工具链加速多语言化与端侧化:Google ADK Kotlin 1.0与Python版功能对齐并支持端侧运行,意味着Agent开发栈正从Python单一生态扩展到移动与JVM生态。端侧Agent将工具调用、多Agent编排能力带入Android本地运行,配合厂商小模型(如StudentSim所用4B级基座)形成低延迟、保护隐私的新部署形态。对团队而言,Agent能力建设的入口语言正在多元化,跨端一致的框架将降低多平台维护成本。