📡 AI技术雷达

👁 阅读量加载中…
🔴 国内外大模型动态
1. Qwen3.8-27B-Uncensored GGUF:去审查 + MTP 加速一步到位⭐⭐⭐
JonathanColetti 出品的 Qwen3.8-27B 去审查量化包,266 万下载、1040 赞。亮点是带 MTP(多 token 预测)标签——新版 llama.cpp 支持 MTP 加速后解码吞吐明显提升,等于"解锁 + 加速"打包。想在本地跑少拒答的 Qwen 底座,可以和 orcarouter 版、huihui 的 abliterated 版对照着挑。
🔧 建议试一下
HuggingFace·📅 09-10 · dl 2.7M · ❤ 1.0k
2. GPT-2 本体:下载量 1470 万的"活化石"上榜⭐⭐⭐
雷达今天扫到的化石级条目——GPT-2 本尊,月下载仍高达 1477 万、3852 赞,匹配进榜纯属关键词误伤。换个角度看价值:七年前的模型还有这个量级,说明它仍是教学演示、论文对照和 tokenizer 实验里的常青树。日常选型无需关注,看到一笑即可。
👀 持续关注
HuggingFace·📅 09-10 · dl 14.8M · ❤ 3.9k
3. Minimax-h3-Turbo:h3 视频生成的少步数快速版⭐⭐⭐
lightx2v 转存的 MiniMax h3 Turbo 视频生成权重,覆盖文生视频/图生视频/参考视频全任务,131 万下载、880 赞,diffusers 生态开箱即用。Turbo 意味着生成步数更少、出片更快——本地低成本玩视频生成,这是比 Singularity 完整版更轻的入口。注意是第三方转存,商用授权需另查。
🔧 建议试一下
HuggingFace·📅 09-10 · dl 1.3M · ❤ 880
🔴 训练与对齐
4. all-MiniLM-L6-v2:2.5 亿下载的嵌入界"水电煤"⭐⭐⭐
384 维、82M 参数的迷你嵌入模型,累计下载 2.53 亿、5718 赞——几乎所有 RAG 与语义检索教程的默认起步模型。价值不在新鲜而在校准:自建嵌入管道时先用它跑通基线,再换 bge / Qwen-Embedding 等更强的中文选择,成本几乎为零。
⚡ 工程可参考
HuggingFace·📅 09-10 · dl 253M · ❤ 5.7k
5. bert-base-uncased:BERT 本尊仍在榜⭐⭐⭐
第二条化石条目——2018 年改变整个领域的 BERT-base,4884 万下载。同样是关键词误伤进榜,它的现实用途主要是旧论文复现的对照锚点和课程作业。对工程选型没有增量信息,本期收录纯为雷达诚实记录。
👀 持续关注
HuggingFace·📅 09-10 · dl 48.8M · ❤ 3.1k
6. Good Pretraining, Bad SFT:预训练最优检查点 ≠ 微调最优起点⭐⭐
用 30B MoE 全流程训练管线证明:按预训练 loss 或榜单分数选出的"最优 checkpoint",SFT 之后未必还是最优起点——传统选点指标可能系统性选错。checkpoint 选择是训练工程里天天在做的决定,这篇的跨训练栈追踪方法可以直接搬进自己的评测体系。
📖 精读全文
arXiv·📅 09-08
🔴 RAG与知识增强
7. Procedural Graphs:让 Agent 的执行流程自己"长"成图⭐⭐
把 Agent 的程序性知识——做什么、什么顺序、什么条件下做——从隐式的对话历史里抽出来,显式建模成可自我演化的执行图,Agent 按图执行而非自由生成。这是"自由 Agent"与"固定 workflow"之外的第三条路线:结构从经验中长出来。做 Agent 工程的话,图构建与演化机制值得细读。
📖 精读全文
arXiv·📅 09-08
🔴 AI安全与隐私
8. 推理越深,对齐越脆?LRM 的对齐坍塌研究⭐⭐
挑战"推理越深越安全"的默认假设:长思维链会让大推理模型的对齐机制退化(alignment collapse),论文给出了揭示方法与缓解策略。如果在部署 reasoning 模型且对安全有要求,这篇的提醒很直接——安全评测不能只在浅层推理上做,要在长推理链上单独测。
📖 精读全文
arXiv·📅 09-08