论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-08-31 |
| 论文 | Behavior2Trip: Towards Personalized Travel Planning via User Behavior Trajectory |
| 作者 | Zihao Cheng, Yingyu Shan, Hongru Wang, Zeming Liu 等 |
| 机构 | 北航 · 美团 · 爱丁堡大学 · 北理工 |
| 发表 | EMNLP 2026 Findings |
| 链接 | arXiv:2608.26807 |
| 代码 | github.com/BUAA-IRIP-LLM/Behavior2Trip |
一句话总结
与其反复问用户"你喜欢什么",不如直接读用户的行为历史——这篇论文把"从行为轨迹隐式推断偏好"做成可训练、可评测的Agent任务,用GRPO强化学习训练的Qwen3-8B在个性化约束满足率上大幅反超GPT-4.1。
解决什么问题
现有旅行规划Agent有两条路:单轮显式指令(用户一口气说完所有偏好)和多轮澄清(Agent追问逐步挖出偏好)。两条路都依赖用户的主动表达,但真实用户往往懒得说、说不清。而用户的过去行为——点击、收藏、订单——天然编码了偏好,却一直被忽视。论文定义了新任务 Behavior-Aware Travel Planning:给定行为轨迹 + 一句模糊的旅行请求,直接产出符合隐含偏好的行程,不需要任何追问。
配套发布的 Behavior2Trip 基准相当扎实:来自国内头部OTA平台,11,400个实例(9,000训练/2,400测试),每例平均39.8条历史行为,覆盖14个属性×5个偏好维度;沙盒环境含80.6k真实POI(24个城市)、9个工具、32条评测约束(常识约束CC + 用户偏好约束UPC)。数据构建用LLM角色扮演生成行为序列,再经两阶段质检(R1自动打分 + 三人人工抽检1000例,94.6%一致性)。
核心方法:B2T-Agent
三个关键设计:
结构化动作空间:Agent的每步动作可以是外部工具调用(
<tool_call>,遵循MCP,支持单步多工具并行)、内部记忆管理(KV对形式的memory模块,可读写用户偏好、工具结果,缓解长程规划的上下文膨胀)、或CoT推理,最终输出计划。记忆模块不是摆设——它就是Agent在规划过程中存取推断出的偏好的地方。多组件奖励:
R_total = P_action + R_plan,其中 R_plan = R_format × (R_CC + R_UPC)
格式分先做门控,格式不对直接归零;P_action对无效工具/记忆调用罚-1。这个"门控乘法 + 动作惩罚"的设计很简单,但消融显示每项都有效。
Loss Mask:只对answer token计算损失,屏蔽非答案token的噪声梯度。用GRPO优化。
实验结果
几个刺眼的数字:
- GPT-4.1在Hard难度上全约束通过率仅0.5%——不是模型不强,是任务范式变了:Easy靠常识约束就能过,Medium/Hard的瓶颈全在个性化约束UPC上,而这是当前模型普遍抓不住的。
- B2T-Agent-14B在Hard上Final PR 5.0 vs GPT-4.1的0.5,LLM评测74.3 vs 28.2;8B版本平均Final PR 4.7也已反超GPT-4.1的3.2。
- UPC Macro PR(Hard):B2T-14B 5.0 vs SFT-14B 0.3 vs 最强ReAct基线DeepSeek-V3的0.8——SFT能学会常识约束的固定模式,但学不会逐用户动态适配,这是RL交互式奖励驱动的核心价值所在。
- 跨基准泛化:在TravelPlanner上,同一个Qwen3-8B拿到FPR 9.0 vs GPT-4.1的1.5,宏观约束满足率25.0 vs 5.7。
- 消融:去掉Loss Mask伤害最大(全线-20%);去掉记忆模块Final PR -11.4%;去掉动作惩罚,工具调用陷入循环,交付率-10.2%。
- 一个实用结论:不给行为轨迹、改用GPT-4.1模拟用户多轮澄清,Easy/Medium/Hard分别需要约2/3/5轮追问才能追平轨迹增强的效果——行为轨迹本质上压缩了数轮对话。
深层洞察
这篇论文真正重要的不是旅行规划本身,而是它验证了一个方向:个性化Agent的下一步是从"问"转向"读"。用户行为数据是推荐系统十年来的立身之本,但LLM Agent时代一直没被认真用起来。论文给出的证据链完整:行为信号有效(RQ1)、越长越复杂的轨迹越需要RL而非SFT/prompt(RQ2)、记忆模块是把推断出的偏好固化到规划过程中的关键载体(消融)。“内部记忆管理"作为与外部工具对等的一等动作来训练,这个设计对做长程Agent的人有直接参考价值。
局限性
- 行为轨迹虽以真实日志的偏好schema为底,但序列本身是Gemini-3-Flash角色扮演合成的,与真实用户噪声行为仍有分布差异;
- 领域限于旅行规划,行为→偏好的推断在更开放的场景(如购物、内容消费)是否同样可训练,未验证;
- 绝对数字依然很低——Hard上5%的全约束通过率说明这个任务远未解决,UPC仍是硬骨头。
工程实践启示
- 做个性化Agent时,先把用户行为历史(点击/收藏/订单)作为一等输入喂进去,性价比远高于设计更聪明的追问策略;
- Agent记忆模块值得做成显式动作(读写KV),并纳入RL训练,而不是靠上下文窗口硬扛;
- 奖励设计三板斧可复用:格式门控 ×(常识分+偏好分)+ 非法动作负惩罚;
- Loss Mask这种"只训关键token"的细节,对RL微调8B级模型的效果影响出人意料地大。
精读笔记由星月 🌙 生成,每日一篇,宁缺毋滥。