每日论文精读 #038:让AI先生成"视觉思考"再画图——VoT在VLM与扩散模型之间架起离散语义桥

VoT不再把VLM当文本编码器用,而是让它先生成一组离散的视觉计划token(物体、布局),再交给DiT渲染像素,用闭环三重损失训练的VoT tokenizer打通了语言语义与视觉信号之间的可解释接口。

2026年9月18日 · 1 分钟

每日论文精读 #031:在生成图像前先「想一想」——VoT离散视觉思维层让文生图语义对齐大幅提升

字节Seed提出Vision-of-Thought,在VLM与扩散解码器之间插入离散视觉思维层,GenEval达0.91超越Mogao与FLUX。

2026年9月11日 · 1 分钟

每日论文精读 #018:REACH——LLM合成报告对齐呼吸音编码器,零样本AUC超越CLAP与Qwen2-Audio

不配对数据、不从零训练,仅用LLM把元数据翻译成临床报告做对比对齐,就给呼吸音编码器装上零样本诊断能力

2026年9月4日 · 1 分钟

每日论文精读 #018:微调不撤销激活转向——权重编辑机制存续而行为可能回归

EMNLP 2026研究发现:嵌入式激活转向在SFT/RLHF微调后权重编辑几乎不被逆转(ρ=0.004),但行为可能通过替代通路回归,安全相关的拒绝抑制在SFT下平均损失64%效果。

2026年8月28日 · 1 分钟

每日论文精读 #017:ConvergeFlow——首个可证明收敛到token嵌入的流匹配语言模型

用凸组合结构化数据预测器让流轨迹可证明地落在合法token嵌入上,甩掉CE解码器后Gen. PPL反而从60降到33。

2026年8月27日 · 2 分钟

每日论文精读 #011:LoRA微调的7B开源小模型在急诊分诊上反超Claude,本地化医疗部署成为可能

系统对比8个开源SLM在急诊三大决策任务上的微调策略:LoRA微调的Mistral-7B分诊准确率反超Claude Sonnet 4.5,转诊推荐全面领先,仅诊断预测仍有差距——隐私合规驱动的本地化医疗AI正走向实用。

2026年8月21日 · 1 分钟

每日论文精读 #004:RLHF的偏好平均化正在制造系统性不公

标准RLHF将不同用户群体的偏好平均化为单一奖励模型,多数群体主导学习而少数群体被系统性忽视,PA-RLHF通过分离偏好模式将公平差距从15.9pp降至9.6pp

2026年8月14日 · 1 分钟

每日论文精读 #002:长上下文训练反而削弱模型知识

上下文越长不一定越好——信息丰富的训练上下文会让模型变得’依赖上下文’,削弱参数化知识。

2026年8月13日 · 1 分钟