论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-09-07(论文发布 2026-08-27) |
| 论文 | Behavior2Trip: Towards Personalized Travel Planning via User Behavior Trajectory |
| 作者 | Zihao Cheng, Yingyu Shan, Hongru Wang 等(美团 / 北航 / 北理工 / 爱丁堡大学) |
| 发表 | EMNLP 2026 Findings |
| 链接 | arXiv:2608.26807 |
| 代码 | github.com/BUAA-IRIP-LLM/Behavior2Trip |
一句话总结
不再追问用户"你喜欢什么",而是让Agent从你过去的点击、收藏、订单轨迹里自己推断偏好——美团团队用GRPO强化学习训练Qwen3-8B做这件事,在最难的个性化任务上把GPT-4.1甩在身后。
解决什么问题
现有旅行规划Agent获取用户偏好的方式只有两种:要么等用户明确说出要求,要么多轮追问澄清。两者都忽视了用户历史行为中隐含的丰富偏好信号,既增加交互负担,又限制了个性化上限。论文提出新任务"行为感知旅行规划"(Behavior-Aware Travel Planning):给定行为轨迹 $\mathcal{A}$ 和自然语言请求,Agent需查询POI数据库,生成同时满足常识约束(CC)和用户偏好约束(UPC)的旅行计划。
配套发布了Behavior2Trip基准:来自国内头部在线旅行平台,11,400个实例,平均39.8条历史行为、14个属性、5个偏好维度;沙盒含24个城市的80.6万+真实POI、72.84万条航班/火车/天气记录、9个工具、32项约束,按Easy/Medium/Hard三级控制偏好复杂度与噪声。
核心方法
B2T-Agent将Agent的一次rollout定义为结构化动作序列 $y = (a_1, a_2, \dots, a_k, R)$,每个动作属于三类:外部工具调用(tool_call,兼容MCP协议)、内部记忆管理(以键值对形式读写用户偏好与中间结果,缓解上下文膨胀)、思维链推理(think),最终在answer中输出计划。
奖励设计是关键:
$$R_{total} = P_{action} + R_{format} \cdot (R_{CC} + R_{UPC})$$
- $P_{action}=-1$:任何无效的工具或记忆调用(防止死循环)
- 两级门控:先验格式分 $R_{format}$,过关才计内容分,逼模型先学会"说人话"再优化个性化
- 用GRPO优化策略,并对
<tool_response>、<memory_response>等外部token施加损失掩码——只对模型自己生成的token算梯度
实验结果
- 前沿模型集体翻车:GPT-4.1在Hard任务上Final通过率仅0.5%,瓶颈在UPC(用户偏好约束)——静态模型抓不住千人千面的动态偏好
- 小模型反超:B2T-Agent-14B在Hard上Final PR 5.0、LLM评测74.3,对比GPT-4.1的0.5/28.2;8B版平均Final PR 4.7也超过GPT-4.1的3.2
- 对比SFT:SFT能背下共性约束(CC),但UPC这种每用户都不同的约束上毫无办法(Hard上UPC Macro仅0.3 vs B2T的5.0)——RL的交互式奖励才是个性化的来源
- 消融:去掉损失掩码伤害最大(各项指标降约20%);去掉记忆模块Final PR降11.4%;去掉动作惩罚DR降10.2%(模型陷入重复调用循环)
- 跨基准泛化:在TravelPlanner上,8B的B2T-Agent全约束通过率FPR 9.0,是GPT-4.1(1.5)的6倍
- 轨迹的价值:不给行为轨迹时初版计划几乎全部失败,要靠约2/3/5轮追问才能追平轨迹增强的效果
深层洞察
这篇论文的点睛之处在于揭示了**“偏好推断"正在成为Agent的新核心能力**。行业普遍把个性化做成RAG问题(检索用户画像塞进prompt),而本文证明:让模型在RL环境中学会"从行为轨迹到偏好再到行动"的推理链,比任何静态注入都强。另一个信号是:SFT学得会格式与共性,学不会"因人而异”——凡是答案取决于输入中动态模式而非固定范式的任务,RL都有结构性优势。GPT-4.1的高DR(97%+)低Final PR(0.5%)组合很能说明问题:它不是不会做计划,而是"不认识你"。
局限性
- 计算开销:GRPO训练需每个query采样多条rollout,推理时多轮工具调用也显著增加延迟
- 行为轨迹由LLM角色扮演生成(基于真实日志的偏好schema校准),与真实用户噪声分布仍有差距
- 仅覆盖旅行场景,偏好随时间漂移(今天的偏好≠明年的偏好)未建模
工程实践启示
- 个性化Agent的正确姿势:与其做多轮澄清问卷,不如把用户行为历史喂给一个RL训练过的推理器——一次到位胜过五轮追问
- 损失掩码是Agent RL训练的必修课:工具返回的外部token进梯度会带来约20%的性能损失,工程上必须mask掉
- 奖励门控设计:format→CC→UPC的级联奖励让8B模型学出稳定结构,值得任何多约束Agent训练借鉴
- 键值对内部记忆比把所有中间结果堆在上下文里更抗长轨迹,实现简单收益明确(+11.4%)