📡 AI技术雷达

👁 阅读量加载中…
🔴 国内外大模型动态
1. Qwen3.8-27B 量化矩阵继续扩容:Ridge/Abliterated/9B 齐上阵⭐⭐⭐
Qwen3.8-27B 的社区量化版继续放量——empero-ai 的 Ridge 版 1.3w 下载、huihui 的 Abliterated 版 5.5w 下载、orcarouter 的 Uncensored 版 1.5w 下载,同尺寸的 9B 版也有 3.8w 下载。27B+9B 两档尺寸的 GGUF 生态已经成型,本地部署这条线的选型基本"闭眼可入"了
huihui-ai 的去审查版下载量反而是最高的(5.5w),社区对"无约束版本"的刚需可见一斑;Ridge 版本名可能对应新的微调变体,标签里同时挂着 qwen3.5/qwen3.8,模型家族命名开始出现交叉兼容的迹象。
👀 持续关注
HuggingFace·下载 1.3w · 赞 169
2. DeepSeek-V4 × J-Space 能力实现报告:新基准视角看 DeepSeek V4⭐⭐
984 星的社区报告,用 J-Space 基准衡量 DeepSeek V4(Flash/Pro)的能力实现损耗——核心命题是"跑分能力"与"实际可用能力"之间的 gap 有多大。做 DeepSeek 选型前值得扫一眼,它试图回答的是比 leaderboard 更贴近实战的问题
👀 持续关注
GitHub·⭐ 984 · 📅 08-16
🔴 训练与对齐
3. MINT:多目标对齐的偏好蒸馏,专治"偏科"的奖励优化⭐⭐⭐⭐
多目标对齐的老大难:目标加权求和后,优化总是塌向"最便宜的"那个目标——客服模型学会嘴甜但解决不了问题就是这个病。MINT 用 min-selection(取最差目标的偏好信号)做蒸馏,逼着模型均衡提升所有目标。如果你在做多维度 RLHF/奖励建模,这篇的方法论可以直接借
技术上是在偏好蒸馏框架内改造选择算子:普通 DPO/蒸馏取平均或加权和,MINT 改为取各目标中"最不利"的那个作为训练信号,类似 max-min 鲁棒优化的思路;实验覆盖多目标 agent 对齐场景(如 helpfulness vs. safety vs. 格式遵循的平衡)。
📖 精读全文
arXiv·📅 08-14
4. Listen, Reason, and Segment:音频大模型的"编辑判断力"对齐⭐⭐⭐
把 LALM(大型音频语言模型)对齐到媒体工作流的真实判断标准——自动章节切分(chapterization):哪里该断章、哪里是内容边界,本质是把专业编辑的判断力蒸馏进模型。思路对做播客/长视频自动化剪辑的人有直接参考价值,也是"benchmark 分数高 ≠ 能干活"这个普遍问题的又一个例证
📖 精读全文
arXiv·📅 08-17
5. Deep Thought Alignment:视频推理的轨迹级隐空间蒸馏⭐⭐
视频 LMM 的推理能力蒸馏:不蒸馏输出文本,而是对齐"思考轨迹"的隐层表征,把大模型处理长视频的推理能力压进小模型。On-Policy Distillation 路线的跟进工作,做多模态小模型训练的可以关注其与标准 logit 蒸馏的对比结论
👀 持续关注
arXiv·📅 08-17
🔴 推理优化
6. Qwen3.8-2.4T-A95B:Qwen 官方旗舰 MoE 开放权重⭐⭐
总参 2.4T、激活 95B 的 Qwen3.8 官方 MoE 旗舰在 HF 开放(1.1w 下载、1064 赞——赞/下载比极高,说明重度用户在密集评估)。激活 95B 意味着单卡消费级硬件无缘,但 MoE 架构让推理成本远低于同总参 dense 模型,是云端部署侧值得跟踪的基线模型
👀 持续关注
HuggingFace·下载 1.1w · 赞 1064
🔴 AI安全与隐私
7. decionis/agent-safe-pipeline:智能体"提议-授权分离"参考架构⭐⭐
532 星的 TypeScript 参考实现:Agent 只能提议动作,无权授权——不可变的 intent 捕获 → 独立策略引擎裁决(ALLOW/ESCALATE/BLOCK)→ 人工审批 → 单次绑定的一次性 grant 执行。这就是给 Agent 加"审批工作流"的完整范式,和 OpenClaw 这类自治助手的权限模型设计直接同构,做 Agent 安全治理的可整体借鉴
⚡ 工程可参考
GitHub·⭐ 532 · TypeScript · 📅 08-13