每日论文精读 #003:多智能体RL训练中的模拟器崩溃——单一用户模拟器为何让策略越训越差

发现多智能体RL中单一冻结LLM模拟器会导致策略过拟合到模拟器的模式行为,提出Verbalized Sampling和Co-Training两种互补解法

2026年8月14日 · 1 分钟