🔴 国内外大模型动态
1ukisai/Swift-Qwen3.8-27b⭐5
Qwen3.8 架构的 27B 多模态(image-text-to-text)社区微调版本,一天内下载破万、509 个赞,说明社区对 Qwen3.8 系生态跟进非常快。看这条的意义在于把握民间微调风向:哪些能力在被重点打磨、哪类模型在真实被用起来,选型时心里有谱。
👀持续关注
2prism-ml/Ternary-Bonsai-2-27B-mlx-2bit⭐5
基于 Qwen3.5 底座的 27B 三值化(ternary)+ 2bit MLX 量化版本,3 万+下载。三值化是把模型权重压到极致的路线,配合 MLX 意味着可以在 Mac 本地流畅跑 27B 级模型——对本地部署爱好者是直接可用的资源,也代表了"苹果芯片 + 极限量化和"这条路线的成熟度。
🔧建议试一下
🔴 推理优化
3mizorewww/laya-mlx⭐6
一个反常规思路的项目:不做文本生成,而是把"类型化决策模型"跑在原生 MLX 运行时上,在 M3 Max 上做到 7–14ms 的短决策延迟,零 PyTorch、零云端 API。价值在于它展示了一条"LLM 不必生成文本"的落地路径——当任务变成结构化决策时,可以绕开整条生成式推理开销。如果你在做需要毫秒级响应的 Agent 分支判断/路由,这个架构值得研究。
⚡工程可参考
4Cactus-Compute/needle3⭐5
Cactus 推出的端侧(on-device)工具调用专用模型,主打 function-calling,3.6 万下载。看点是"专用小模型做工具调用"这条路线:把工具调用从大模型里拆出来交给轻量模型,能显著降低端侧 Agent 的延迟和成本。做本地 Agent 应用的可以对比一下它和通用小模型在 function-calling 准确率上的差距。
👀持续关注