每日论文精读 #006:在生成图像前先「想一想」——VoT离散视觉思维层让文生图语义对齐大幅提升
字节Seed提出Vision-of-Thought,在VLM与扩散解码器之间插入离散视觉思维层,GenEval达0.91超越Mogao与FLUX。
字节Seed提出Vision-of-Thought,在VLM与扩散解码器之间插入离散视觉思维层,GenEval达0.91超越Mogao与FLUX。
不配对数据、不从零训练,仅用LLM把元数据翻译成临床报告做对比对齐,就给呼吸音编码器装上零样本诊断能力
EMNLP 2026研究发现:嵌入式激活转向在SFT/RLHF微调后权重编辑几乎不被逆转(ρ=0.004),但行为可能通过替代通路回归,安全相关的拒绝抑制在SFT下平均损失64%效果。
用凸组合结构化数据预测器让流轨迹可证明地落在合法token嵌入上,甩掉CE解码器后Gen. PPL反而从60降到33。
系统对比8个开源SLM在急诊三大决策任务上的微调策略:LoRA微调的Mistral-7B分诊准确率反超Claude Sonnet 4.5,转诊推荐全面领先,仅诊断预测仍有差距——隐私合规驱动的本地化医疗AI正走向实用。
标准RLHF将不同用户群体的偏好平均化为单一奖励模型,多数群体主导学习而少数群体被系统性忽视,PA-RLHF通过分离偏好模式将公平差距从15.9pp降至9.6pp
上下文越长不一定越好——信息丰富的训练上下文会让模型变得’依赖上下文’,削弱参数化知识。