🔴 国内外大模型动态
Qwen3.8-27B 无审查版 GGUF 量化包,26 万下载、673 赞,是本周社区解锁版模型里的热门。如果你在本地跑需要"少废话、少拒答"的 Qwen 底座,这是现成可用的选择,省掉自己动手 abliterate 的流程。
⚡工程可参考
社区把 GLM-5.3-Flash 转成 DFlash2 格式的版本,1 万下载。DFlash2 是新兴的高压缩部署格式,这条的意义在于看 GLM 生态在格式端的支持速度——智谱官方模型发布不到几天就有社区格式转换版出现。
👀持续关注
huihui-ai 出品的 Qwen3.8-27B 消融版(abliterated),下载量近 200 万,是长期霸榜的社区基础件。和第 1 条同源不同作者,可对比两者的解锁彻底度与模型损伤程度,选一个顺手即可。
⚡工程可参考
DavidAU 一贯风格的"多 LoRA 熔炉"合并模型,叠加了编码增强、MTP、Heretic 解锁等多个方向。这类熔炉模型效果玄学,但适合作为本地实验素材——如果想在 Qwen3.8 底座上试组合微调,可以直接参考它的合并配方。
👀持续关注
🔴 训练与对齐
Meta SAM3 官方权重,209 万下载、2882 赞,支持图片+视频分割(sam3_video)。如果你有图像/视频内容理解、自动化标注类需求,这是多模态工具链里的标配级组件,值得收录进技术储备。
🔧建议试一下
NVIDIA 团队的竞赛编程特化后训练方案:大规模赛题收集 + 合成推理轨迹 + 强化学习,把模型拉到 IOI/ICPC 金牌水准。对做代码模型微调的人有直接参考价值——合成数据配比和课程设计是核心看点。
📖精读全文
回答一个很实际的问题:标注预算固定时,SFT 和 RL 各分多少?论文给出了跨模型规模近似的分配框架,而不是只说"低数据区 SFT 占优"这种模糊结论。做后训练预算规划时可以直接套用其分析框架。
📖精读全文
🔴 推理优化
微软团队提出让模型自己控制注意力分配:面对百万级上下文时不再全量扫描 KV cache,而是学会定位关键 token。对长上下文推理成本敏感的场景(Agent 长对话、大仓库代码理解)是降本新思路。
👀持续关注