📡 AI技术雷达

2026-09-05 星期六
👁 阅读
今日扫描 10 个领域,原始候选 94 条,精选 7 条(3 个领域有内容)。数据源:arXiv · GitHub · HackerNews · HuggingFace
🔴 国内外大模型动态
Tiel-Coder-35B-A3B 的社区 GGUF 量化包(imatrix 校准),20 万下载、215 赞,是本周本地编码模型里的爆款。A3B 意味着 35B 总参数只激活 3B——4-bit 量化后一张消费级显卡就能跑,速度接近小模型、编码能力对标大模型,tags 显示底子是 Qwen3.5-MoE 架构的编码特化版。
⚡工程可参考
Qwen3.8-27B 的"激进无审查"多模态版,带 MTP(多 token 预测)加速,146 万下载、939 赞。和昨天 orcarouter 的无审查版同源不同流派:HauhauCS 路线解锁更彻底、拒答率极低,但推理质量可能受损。适合本地跑长篇创作类任务时选装。
⚡工程可参考
MiniMax-H3 的 ComfyUI 单文件 int8 融合 turbo 版。有意思的是生态位信号:MiniMax 的扩散路线模型被社区打包进 ComfyUI 工作流,说明 dLLM 正在被当作"生成节点"而非"聊天模型"使用——和工作流编排天然契合,这条路线值得留意。
👀持续关注
🔴 训练与对齐
一篇方法论"打假"论文:模型输出随输入变化(item-sensitivity)一直被当作具备任务能力的证据,作者用强制选择信号任务证明这只是必要条件而非充分条件——模型可以"看起来在根据输入做判断",实际策略与随机无异。对做评测的人是重要提醒:单一指标下能力结论不可靠。
📖精读全文
📄 arXiv2026-09-01
扩散语言模型(dLLM)的安全对齐研究:传统对齐只覆盖"token 在序列中的位置",dLLM 多出一个轴——token 在去噪过程中的生成时机。论文系统分析了两轴对安全性的交互影响。随着 dLLM 路线升温(MiniMax、Gemini Diffusion),这类安全研究会越来越吃香。
👀持续关注
📄 arXiv2026-08-31
讲 SFT 幻觉的成因与解法:当微调目标包含基模型没学扎实的知识时,模型被迫"装懂",幻觉由此产生。论文把一类缓解方法统称为 knowledge-aligned SFT——约束训练目标落在模型已有知识边界内。对做领域微调有直接指导意义:先探测模型知识边界再配数据,别硬灌它不懂的东西。
📖精读全文
📄 arXiv2026-08-31
🔴 RAG与知识增强
银行财报 QA 基准数据集:跨司法辖区、超长文档、表格与数字混杂,是检验 RAG 系统在"真·脏数据"上表现的稀缺素材。做金融领域 RAG 可以直接拿来当回归测试集——通用 benchmark 跑分再高,到财报这种数字密集场景照样翻车。
🔧建议试一下
📄 arXiv2026-09-03