🔴 国内外大模型动态
1. Qwen3.8-27B Cold-Fusion 社区魔改版:GAIN 训练 + 多技术叠加⭐⭐⭐
DavidAU 又一力作:在 Qwen3.8-27B 底座上叠 GAIN 训练、Cold-Fusion 融合与 MTP 多 token 预测,一周狂揽 8.8 万下载——社区对 Qwen3.8 底座的花式改造是观察开源生态风向的好样本
下载 88,290 / 点赞 109。 tags 含 GAIN Training、COLD-FUSION,GGUF 格式可直接在 llama.cpp/Ollama 跑。 DavidAU 系列的价值在于:不用换底座,靠训练技巧组合就能榨出不同的能力倾向,适合本地部署玩家做低成本实验。
🔧 建议试一下
2. Qwen3.8-9B-Distill GGUF:轻量蒸馏版上线,本地跑 Qwen3.8 的门槛再降⭐⭐⭐
empero-ai 出的 Qwen3.8 9B 蒸馏版已备好 GGUF 全套量化,7.1 万下载说明需求旺盛——想在笔记本/迷你主机上跑 Qwen3.8 的,这是现成的低门槛入口
🔧 建议试一下
3. Qwen3.8-27B Uncensored Aggressive-MTP:131k 下载的去审查多模态版⭐⭐
HauhauCS 的 Aggressive 系列,27B 多模态+去审查+MTP,13.1 万下载居当日 HF 热度榜首——去审查社区微调持续有市场,侧面反映官方对齐策略与部分用户需求的张力
👀 持续关注
4. deepseek-harness-desktop:DeepSeek 桌面工具带,5MB 安装零配置⭐⭐
Tauri 实现的 DeepSeek 工具集桌面版,安装包仅 5MB、预置插件、三平台通吃——小而美的 AI 工具分发思路,Rust+Tauri 技术栈也值得做桌面端的朋友参考
⚡ 工程可参考
5. MiniMax-Music3 开放下载:音乐生成模型走红,1032 赞领跑当日 HF⭐⭐
MiniMax 音乐生成模型 Music3 上线 diffusers 生态,点赞数 1032 远超同日其他模型——国产多模态生成能力外溢,音乐赛道值得关注内容创作者的工具化机会
👀 持续关注
🔴 训练与对齐
6. Qwen3.8-9B-Distill 原版:SFT+DPO+蒸馏三件套的开放权重⭐⭐
上面 GGUF 版的原模型,卡片明确标注 SFT/DPO/distillation 训练配方,image-text-to-text 多模态输入——小模型蒸馏的完整开源范例,做训练路线选型时可直接对照参考
👀 持续关注
7. LiquidAI LFM2.5-VL-3B:端侧 3B 视觉模型,DPO 对齐后上架⭐⭐
LiquidAI 的 LFM2.5 视觉版,3B 参数走端侧路线,用 DPO 做后训练对齐——端侧 VLM 竞争升温,"小模型+视觉"是 AI 手机/AIoT 的关键供给
👀 持续关注
🔴 RAG与知识增强
8. CoAL-RAG:复杂度感知的法律 RAG,简单问题不瞎推理⭐⭐
法律咨询问题复杂度分层明显,单一检索策略要么对简单问题过度推理、要么对复杂问题解释性差。CoAL-RAG 按问题复杂度自适应路由检索策略,兼顾答案质量与效率——对做垂直领域 RAG 的工程实践有直接启发
核心思想:复杂度感知路由(complexity-aware)——简单问题走轻量检索快速出答案,复杂问题才升级到深度推理+知识图谱。 这正是 Agentic RAG 的"按需思考"思路在高风险垂直场景的落地,值得做企业知识库的朋友参考。
📖 精读全文