🔴 国内外大模型动态
1An Independent Safety Evaluation of Kimi K2.5⭐8
Kimi K2.5 发布时没带安全评测,这是第三方补上的独立安全评估。看完能了解开源顶级模型在越狱、危险能力上的真实水位——如果你在评估是否把 K2.5 用进生产,这是必读的一份尽职调查材料。
评估聚焦"强开源权重模型会放大的风险":包括越狱鲁棒性、多轮升级攻击、以及模型遵循有害指令的倾向。K2.5 在编码、多模态、Agent 基准上对标闭源模型,意味着这些风险面也随之扩大,论文给出了与闭源模型的横向对照。
📖精读全文
2A comprehensive study of LLM-based argument classification: from Llama through DeepSeek to GPT-5.2⭐7
一篇覆盖 Llama → DeepSeek → GPT-5.2 全谱系的论证挖掘(argument mining)综合实证研究。价值不在结论惊人,而在它给了你一个"同一任务跨代模型到底进步多少"的标尺,做模型选型或写综述时可以直接引用。
👀持续关注
3MiniMaxAI/MiniMax-H3⭐6
MiniMax 新一代视频生成模型,490万下载、5300+ 赞,热度凶猛。如果你在做内容生成类产品或研究视频 diffusion 的工程落地,这个权重值得排队关注其 API 与社区生态。
🔧建议试一下
4ukisai/Swift-Qwen3.8-27B-GGUF⭐6
Qwen3.8-27B 的 GGUF 量化社区版,主打 efficient-thinking。想在自己电脑上跑 27B 级推理又怕显存/内存爆的,这是现成的 llama.cpp 落地方案。
🔧建议试一下
5Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments⭐5
Qwen 家的具身智能大一统尝试:用单一 VLA 模型打通操作、导航、跨机器人本体。就算不做机器人,这种"异构决策数据统一建模"的思路对多任务 Agent 训练也有借鉴意义。
👀持续关注
🔴 训练与对齐
6Beyond Safe Answers: Segment-Aware Listwise Alignment for Reasoning Safety in Large Reasoning Models⭐5
指出推理模型的安全盲区:中间推理链危险、最终答案装乖。提出按段落粒度做 listwise 对齐。这个"看过程不看结论"的评估视角,对任何做 R1 类模型安全护栏的人都是新武器。
📖精读全文
7Forty Shades of Blue: Quality-Diversity Alignment via Mode-Conditioned RL⭐5
对齐训练的副作用——mode collapse(输出越来越同质化)——用 Quality-Diversity + 模式条件 RL 来治。如果你被"模型回答千篇一律、缺乏发散"困扰,这篇是少见正面攻这个问题的方法论文。Yejin Choi 组出品。
👀持续关注
8One Example Is Enough to Pass Fairness Benchmarks⭐5
公平性基准(如 BBQ)太水了——一个示例就能刷过。对做模型评测的人是个警钟:你报告里的 fairness 分数可能毫无区分度,选基准前先看这篇。
👀持续关注
9How Fragile Is Safety Alignment at Frontier Scale? A Single-Direction Attack on a 320B MoE⭐5
在 320B MoE 上验证"拒绝方向消融"攻击:几百条对比 prompt 就能剥离拒绝能力,无需梯度训练。前沿规模的安全对齐比想象更脆。做开源模型部署安全评估的,这个攻击面必须纳入清单。
⚡工程可参考
10TokenRhythm/NeoHorse-1-4B⭐5
4B 参数的 agentic 小模型,2012 赞说明社区口碑不错。适合当轻量 Agent 框架里的工具调用骨干模型测试基准。
🔧建议试一下
🔴 推理优化
11Edge0/Edge0-35B-A3B-preview⭐5
35B 总参、激活仅 3B 的 MoE 边缘推理模型(Qwen3.5-MoE 底座,MLX 格式)。想在 Mac 上本地跑大 MoE 的,Apple Silicon 生态又多一个好选择。
🔧建议试一下