📡 AI技术雷达

👁 阅读量加载中…
🔴 国内外大模型动态
1. Kimi K2.5 独立安全评估:开源旗舰的安全底线由谁来测?⭐⭐⭐⭐⭐
第三方团队对月之暗面开源旗舰做了独立安全测评——厂商自测报告之外的独立视角,是平台选型时判断开源模型风险的关键依据
Kimi K2.5编程、多模态、Agent能力对标闭源模型,但发布时未附带安全评估。本文聚焦开源权重特有的风险放大面:越狱攻击成功率、有害内容生成、权重可被任意微调篡改。启示:接入任何开源模型前,安全评估不能只信官方技术报告,要有独立验证渠道。
🔗 曾收录于8月14日雷达(去重池遗漏重现,未读可回看)
📖 精读全文
arXiv·📅 04-03
2. LLM论点分类横评:从Llama到DeepSeek到GPT-5.2⭐⭐⭐⭐
论点挖掘这种细分推理任务上的三代模型横评,能看出模型代际跃迁在"非热门任务"上的真实增益——比刷榜数字更接近能力本质
🔗 曾收录于8月14日雷达(去重池遗漏重现)
👀 持续关注
arXiv·📅 02-25
3. zai-org/GLM-5.3 开源权重上线⭐⭐⭐
智谱旗舰开源版,HuggingFace一周5万+下载、1334收藏——星竹日常对话的底层模型,权重开放意味着随时可以自托管脱离API依赖
🔧 建议试一下
HuggingFace·📅 08-31
4. MiniMax-H3:视频生成赛道热度顶流⭐⭐⭐
520万+下载、4655收藏,text-to-video/image-to-video双模式——视频生成开源模型里生产侧采用最广的一档,做内容管线可评估
👀 持续关注
HuggingFace·📅 08-31
5. Qwen3.8-Flash-Next-FP8:官方FP8量化先行版⭐⭐⭐
通义Flash系列下一代FP8版提前放出,显存减半推理成本大降——高吞吐在线服务的现实选项,值得工程侧提前适配
⚡ 工程可参考
HuggingFace·📅 08-31
🔴 训练与对齐
6. Ornith-1.5-35B-A3B:小激活MoE新玩家⭐⭐⭐
35B总参/3B激活,基于Qwen3.5-MoE架构二创,14.7万下载说明社区认可——小激活量路线在低成本推理上持续发酵
👀 持续关注
HuggingFace·📅 08-31
7. DeepSeek-V4-Flash-0731:性价比推理的现实选择⭐⭐⭐
457万下载、3823收藏——V4 Flash系列最新版在训练与对齐榜热度第一梯队,兼顾能力和成本的选择
🔧 建议试一下
HuggingFace·📅 08-31
8. unsloth/GLM-5.3-Flash-GGUF:本地跑GLM的最低门槛⭐⭐⭐
unsloth出品的GGUF量化版,llama.cpp/ollama生态直接加载——想本地跑GLM-5.3-Flash的话,这是最省事的入口
🔧 建议试一下
HuggingFace·📅 08-31