🔴 国内外大模型动态
1. Kimi K2.5 独立安全评估:开源大模型的安全红线在哪?⭐⭐⭐⭐⭐
第三方团队对月之暗面Kimi K2.5进行了独立安全测评,聚焦开源权重模型在高风险场景下的脆弱性——这对评估国产开源大模型安全性很有参考价值
Kimi K2.5在编程、多模态、Agent基准上对标闭源模型,但发布时未附带安全评估。本研究聚焦:越狱攻击成功率、有害内容生成、开源权重带来的可篡改风险。对星竹的启示:平台选型时安全评估不能只看厂商报告,需要独立验证。
📖 精读全文
2. LLM论点分类全景研究:从Llama到DeepSeek到GPT-5.2⭐⭐⭐⭐
跨越Llama→DeepSeek→GPT-5.2三代模型,在论点挖掘任务上做了系统性对比,展示了模型迭代带来的能力跃迁
👀 持续关注
3. SLAI T-Rex:DeepSeek-V4家族在昇腾超算上的全参数后训练⭐⭐⭐
万亿参数MoE模型在华为昇腾SuperPOD上的全参数后训练实践,解决了内存压力、通信开销、算子效率三大工程难题
⚡ 工程可参考
4. Qwen-VLA:通义千问视觉-语言-动作统一模型⭐⭐⭐
阿里Qwen团队推出具身智能模型,跨任务、跨环境、跨机器人本体统一建模,探索通用机器人大脑的可行路径
👀 持续关注
🔴 训练与对齐
5. 无参考后训练:开源LLM多语言翻译的GRPO新路线⭐⭐⭐⭐
用GRPO+无参考质量估计替代传统SFT,实现开源大模型多语言翻译的后训练——不需要人工参考译文,降低RLHF数据成本
核心方法:从SFT模型出发,用Group Relative Policy Optimization优化,奖励函数由两个无参考质量估计模型取均值构成。关键启示:RLHF不一定需要人类标注的参考答案,reference-free reward + GRPO是一条可落地的替代路线。
📖 精读全文
6. RLHF的偏好平均化正在制造系统性不公⭐⭐⭐⭐
RLHF把不同人群的偏好平均化为单一奖励模型,多数群体偏好主导学习,少数群体被系统性忽视——揭示了RLHF的深层公平性问题
论文定义了"程序性公平失败"概念:当偏好异质性存在时,偏好平均化等效于多数暴政。实验在多组人群偏好数据上验证:少数群体满意度下降15-30%。对星竹工作的启示:AI原生应用平台做RLHF时,需要考虑用户群体的偏好异质性,不能简单平均。
🔗 与论文精读#004同一篇
📖 精读全文
7. 多语言工具调用的隐性Bug:参数语言不匹配⭐⭐⭐
LLM在多语言场景下调用API时,选对了工具但参数值语言不对——论文称之为Argument Language Mismatch (ALM),并提出后训练修复方案
⚡ 工程可参考
8. 视觉语言模型测试时对齐:轨迹引导结构化采样⭐⭐⭐
提出测试时(而非训练时)的LVLM对齐方法,通过轨迹引导的结构化采样降低RL对齐的资源消耗,解决训练-推理分布不匹配问题
👀 持续关注