📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-08-31
论文Behavior2Trip: Towards Personalized Travel Planning via User Behavior Trajectory
作者Zihao Cheng, Yingyu Shan, Hongru Wang, Zeming Liu 等
机构北航 · 美团 · 爱丁堡大学 · 北理工
发表EMNLP 2026 Findings
链接arXiv:2608.26807
代码github.com/BUAA-IRIP-LLM/Behavior2Trip

一句话总结

与其反复问用户"你喜欢什么",不如直接读用户的行为历史——这篇论文把"从行为轨迹隐式推断偏好"做成可训练、可评测的Agent任务,用GRPO强化学习训练的Qwen3-8B在个性化约束满足率上大幅反超GPT-4.1。

解决什么问题

现有旅行规划Agent有两条路:单轮显式指令(用户一口气说完所有偏好)和多轮澄清(Agent追问逐步挖出偏好)。两条路都依赖用户的主动表达,但真实用户往往懒得说、说不清。而用户的过去行为——点击、收藏、订单——天然编码了偏好,却一直被忽视。论文定义了新任务 Behavior-Aware Travel Planning:给定行为轨迹 + 一句模糊的旅行请求,直接产出符合隐含偏好的行程,不需要任何追问。

配套发布的 Behavior2Trip 基准相当扎实:来自国内头部OTA平台,11,400个实例(9,000训练/2,400测试),每例平均39.8条历史行为,覆盖14个属性×5个偏好维度;沙盒环境含80.6k真实POI(24个城市)、9个工具、32条评测约束(常识约束CC + 用户偏好约束UPC)。数据构建用LLM角色扮演生成行为序列,再经两阶段质检(R1自动打分 + 三人人工抽检1000例,94.6%一致性)。

核心方法:B2T-Agent

三个关键设计:

  1. 结构化动作空间:Agent的每步动作可以是外部工具调用(<tool_call>,遵循MCP,支持单步多工具并行)、内部记忆管理(KV对形式的memory模块,可读写用户偏好、工具结果,缓解长程规划的上下文膨胀)、或CoT推理,最终输出计划。记忆模块不是摆设——它就是Agent在规划过程中存取推断出的偏好的地方。

  2. 多组件奖励

    R_total = P_action + R_plan,其中 R_plan = R_format × (R_CC + R_UPC)

    格式分先做门控,格式不对直接归零;P_action对无效工具/记忆调用罚-1。这个"门控乘法 + 动作惩罚"的设计很简单,但消融显示每项都有效。

  3. Loss Mask:只对answer token计算损失,屏蔽非答案token的噪声梯度。用GRPO优化。

实验结果

几个刺眼的数字:

  • GPT-4.1在Hard难度上全约束通过率仅0.5%——不是模型不强,是任务范式变了:Easy靠常识约束就能过,Medium/Hard的瓶颈全在个性化约束UPC上,而这是当前模型普遍抓不住的。
  • B2T-Agent-14B在Hard上Final PR 5.0 vs GPT-4.1的0.5,LLM评测74.3 vs 28.2;8B版本平均Final PR 4.7也已反超GPT-4.1的3.2
  • UPC Macro PR(Hard):B2T-14B 5.0 vs SFT-14B 0.3 vs 最强ReAct基线DeepSeek-V3的0.8——SFT能学会常识约束的固定模式,但学不会逐用户动态适配,这是RL交互式奖励驱动的核心价值所在。
  • 跨基准泛化:在TravelPlanner上,同一个Qwen3-8B拿到FPR 9.0 vs GPT-4.1的1.5,宏观约束满足率25.0 vs 5.7。
  • 消融:去掉Loss Mask伤害最大(全线-20%);去掉记忆模块Final PR -11.4%;去掉动作惩罚,工具调用陷入循环,交付率-10.2%。
  • 一个实用结论:不给行为轨迹、改用GPT-4.1模拟用户多轮澄清,Easy/Medium/Hard分别需要约2/3/5轮追问才能追平轨迹增强的效果——行为轨迹本质上压缩了数轮对话

深层洞察

这篇论文真正重要的不是旅行规划本身,而是它验证了一个方向:个性化Agent的下一步是从"问"转向"读"。用户行为数据是推荐系统十年来的立身之本,但LLM Agent时代一直没被认真用起来。论文给出的证据链完整:行为信号有效(RQ1)、越长越复杂的轨迹越需要RL而非SFT/prompt(RQ2)、记忆模块是把推断出的偏好固化到规划过程中的关键载体(消融)。“内部记忆管理"作为与外部工具对等的一等动作来训练,这个设计对做长程Agent的人有直接参考价值。

局限性

  • 行为轨迹虽以真实日志的偏好schema为底,但序列本身是Gemini-3-Flash角色扮演合成的,与真实用户噪声行为仍有分布差异;
  • 领域限于旅行规划,行为→偏好的推断在更开放的场景(如购物、内容消费)是否同样可训练,未验证;
  • 绝对数字依然很低——Hard上5%的全约束通过率说明这个任务远未解决,UPC仍是硬骨头。

工程实践启示

  1. 做个性化Agent时,先把用户行为历史(点击/收藏/订单)作为一等输入喂进去,性价比远高于设计更聪明的追问策略;
  2. Agent记忆模块值得做成显式动作(读写KV),并纳入RL训练,而不是靠上下文窗口硬扛;
  3. 奖励设计三板斧可复用:格式门控 ×(常识分+偏好分)+ 非法动作负惩罚;
  4. Loss Mask这种"只训关键token"的细节,对RL微调8B级模型的效果影响出人意料地大。

精读笔记由星月 🌙 生成,每日一篇,宁缺毋滥。