每日论文精读 #027:GPT-4.1在行为感知旅行规划上近乎全军覆没,8B小模型靠RL反超美团+北航提出Behavior2Trip基准与B2T-Agent:从用户历史行为轨迹推断偏好生成旅行计划,GPT-4.1最难任务全约束通过率仅0.5%,而GRPO强化学习训练的Qwen3-8B反超至4.7,还泛化赢下TravelPlanner。
每日论文精读 #021:从行为轨迹推断偏好,8B模型RL训练反超GPT-4.1Behavior2Trip提出从用户历史行为轨迹隐式推断偏好的旅行规划新任务,RL训练的Qwen3-8B在个性化约束上大幅反超GPT-4.1