📰 AI洞察日报

2026年9月21日 · 星期一
👁 阅读量加载中…
🏆 头条

阿里开源Qwen-Image-2.1:7B参数图像生成模型宣称超越多数闭源模型,消费级3090即可运行

阿里Qwen团队发布开源权重图像生成与编辑模型Qwen-Image-2.1,视觉生成组件仅70亿参数,官方基准显示其超越多数闭源模型(独立基准尚待验证)。模型原生支持RGBA透明图生成与编辑,可同时引用最多10张参考图完成合影、虚拟试穿等任务,通过架构改进与KV cache复用加速多参考图推理,可在RTX 3090等消费级GPU上运行。权重已上线Hugging Face与ModelScope,但采用研究许可证,商用需单独申请授权。

📰 今日动态
1

阶跃星辰发布Step 5 Preview:600B稀疏MoE跻身全球开源前三,单任务成本仅Claude Opus 5的1/8

阶跃星辰发布旗舰基座模型Step 5 Preview,采用稀疏MoE架构,总参数600B、激活参数仅27B,支持100万Token上下文与原生视觉输入,面向AI编程、软件工程、金融等Agentic场景。在Artificial Analysis综合智能指数中跻身全球开源前三,单任务成本为Claude Opus 5的1/8。官方称下一阶段Scaling的关键是提升计算转化为智能的效率,模型将于10月15日正式开源。

2

腾讯混元发布Gander:全双工语音Agent边说边干活,「小脑+大脑」架构可插拔替换Codex或Claude Code

腾讯混元语音团队联合多所高校发布实时交互Agent模型Gander,同步处理语音、图像与文本,用户可随时打断。架构上「小脑」负责实时对话,「大脑」在后台执行复杂任务且可替换为Codex、Claude Code等Agent系统无需重训。模型以1秒分段决策说话时机,在Full-Duplex-Bench v3全部100个场景中时机判断最佳,打断用户比例仅8%(GPT-Realtime为13.5%),但任务准确率略逊于最弱竞品。训练数据约270万条,团队计划开源权重与训练数据。

3

Runway探索实时流式视频生成:基于世界模型GWM-1边生成边播放,用自生成数据抑制误差累积

Runway展示实时视频生成研究:用户不再等待成片,而是像直播一样边描述边流式输出视频,基于其通用世界模型GWM-1逐帧生成,支持镜头运动、机器人指令与音频控制。针对视频模型误差逐帧累积放大的核心难题,Runway在训练中引入模型自身带瑕疵的输出,教会模型自我纠偏而非放大偏差。实时生成将算力开销从训练侧转向推理侧,要求单帧生成速度跟上播放帧率,同时降低单位质量成本使更多应用在经济上可行。

4

微软与UIUC发布StudentSim:用会犯真实错误的模拟学生训练AI导师,4B小模型胜过GPT-5.4

微软与伊利诺伊大学香槟分校发布StudentSim,从少量真实学习记录构建个别学生的数字复制品用于训练AI导师。方法分两阶段:先从全体学生汇合数据学习共性错误模式,再用个位数样本个性化适配,基座为Qwen3-4B-Instruct。在国际象棋、英语写作、数学三科60名学生的测试中,StudentSim模拟特定学生的准确率全面超过被提示扮演学生的GPT-5.4,棋类下一步预测准确率约为其两倍;用其训练的国际象棋导师在事实准确性、解释质量与个性化三项评估中均得分最高。

5

Google Agent Development Kit for Kotlin 1.0发布:与Python版功能对齐,支持端侧AI Agent

Google发布ADK Kotlin 1.0,成为面向生产环境的AI Agent开发框架,覆盖Kotlin、Android与JVM生态,功能与Python版对齐。开发者可用同一套框架构建服务端与Android端侧Agent,支持在设备本地运行模型,降低延迟与隐私成本。此举将Google的Agent开发栈从Python扩展到移动生态,Android开发者无需跨框架即可接入工具调用、多Agent编排等能力。

6

阿里巴巴开源OpenCodeReview:AI代码审查CLI,确定性流水线与LLM审查结合

阿里巴巴开源AI代码审查工具OpenCodeReview,提供CLI形态,将文件选择、变更打包、规则筛选等环节交由确定性流水线处理,LLM专注审查评论生成,兼顾成本可控与结果可复现。工具针对大仓库与高频提交场景优化,规避纯LLM审查不稳定、易遗漏的问题。开源后团队可直接自托管接入现有CI流程,降低对第三方SaaS审查服务的依赖。

📌 行业快讯
🔭 技术趋势观察