📡 AI技术雷达

👁 阅读量加载中…
🔴 国内外大模型动态
1. z-lab Qwen3.8-27B-DFlash2:官方推测解码加速版⭐⭐⭐
z-lab 放出的 Qwen3.8-27B DFlash2 变体,标签直接标明 speculative-decoding——推测解码用轻量草稿模型先行生成、主模型批量验证,是当前最实用的"无损加速"路线之一;9.4 万下载说明社区对官方加速版需求很实在。如果你在本地或私有部署跑 27B 推理,这类变体配合支持的推理引擎能明显压低生成耗时
🔧 建议试一下
HuggingFace·📅 08-29
🔴 训练与对齐
2. Ornith-1.5-35B-A3B GGUF:3B 激活的 MoE 本地甜点档⭐⭐⭐
35B 总参数、A3B 激活的 MoE 模型 GGUF 量化版,MIT 许可商用友好,147 万下载已经过大规模社区验证——MoE 推理时只激活 3B 参数,中端显卡甚至纯 CPU 就能跑出接近 30B 级的输出质量,是"一台机器长期挂着的本地助手"的性价比之选
🔧 建议试一下
HuggingFace·📅 08-29
3. Ornith-1.5-9B GGUF:与 MoE 版组成本地双件套⭐⭐⭐
同系列 9B 常规版,159 万下载比 35B 版还高——9B 是本地部署的"底线尺寸":速度快、显存要求低、日常问答质量够用。和上面的 35B-A3B 搭配就是一套完整方案:轻任务走 9B 省资源,重任务切 MoE,两者都是 MIT 许可,商用无包袱
👀 持续关注
HuggingFace·📅 08-29
🔴 RAG与知识增强
4. SymbolLKG:逻辑知识图谱 + 符号求解器的可验证推理⭐⭐⭐
针对 CoT"说得很顺但没法验证"的痛点,把 LLM 生成的推理过程结构化成逻辑知识图谱,再交给符号求解器逐步校验——生成与验证分离的双轨架构。做企业级 RAG/问答的人值得留意:可验证性正是把 LLM 推理塞进严肃业务流程的最大门槛,这套思路比单纯堆 CoT prompt 靠谱
📖 精读全文
arXiv·📅 08-27