🔴 国内外大模型动态
1. Kimi K2.5独立安全评估:开源权重模型的安全水位摸底⭐⭐⭐⭐
月之暗面的K2.5发布时只带了能力基准、没带安全报告,这支独立团队把坑补上了——看这篇能直接了解国产开源旗舰在安全侧的真实水位,是决定"敢不敢在业务里用开源权重模型"的关键输入
评估聚焦强大开源权重模型会放大的风险面:越狱鲁棒性、有害内容生成、以及agentic场景下的滥用潜力。作者阵容(Zheng-Xin Yong等)是此前Llama系独立评估的同班人马,方法论可横向对比。K2.5在编码/多模态/agentic基准对标闭源模型,其安全结论对开源模型选型有直接参考价值。
📖 精读全文
2. LLM论证挖掘横评:从Llama到DeepSeek到GPT-5.2⭐⭐⭐⭐
论证挖掘(论点识别/分类/关系抽取)任务上的三代模型系统横评——想知道开源与闭源模型在这类细分NLP任务上的真实差距图谱,这篇是现成的一手数据,做文本分析类应用选型时能直接抄作业
👀 持续关注
3. Qwen3.6-27B-Fable-Fusion:DavidAU长青二创系列新作⭐⭐⭐⭐
289万下载+2204赞的社区微调常客DavidAU新作,融合多款底模的GGUF开箱即用——本地跑Qwen3.6-27B的社区热门选择之一,也折射出Qwen底座二创生态的持续活跃
🔧 建议试一下
4. MiniMax-H3:国产视频生成新旗舰⭐⭐⭐
MiniMax官方H3,text-to-video/image-to-video双模式,389万下载+4335赞——做视频内容生成方向的话,这是国产阵营当前的头部门面,值得跟进其效果边界
👀 持续关注
5. DeepSeek-V4-Flash-0731:高吞吐业务部署的性价比之选⭐⭐⭐
V4系的Flash快版,0731版更新,297万下载——成本敏感、追求吞吐的线上业务可以直接评估这款,DeepSeek系的工程稳定性已经过大规模验证
⚡ 工程可参考
🔴 训练与对齐
6. Muse-Glimmer-30B:30B级图文理解新选手⭐⭐⭐
meta-models放出的30B级image-text-to-text模型,51.7万下载+1754赞——多模态对话的中型新选项,介于小模型和旗舰之间的规格卡位
👀 持续关注
7. Ornith-1.5-35B-A3B:MoE小激活的多模态尝鲜款⭐⭐⭐
Qwen3.5-MoE架构,35B总参数仅激活3B,image-text-to-text——MoE带来的低推理成本让它在本地多模态部署里性价比突出,尝鲜候选
🔧 建议试一下