[论文] An Agentic Approach for Active Data Collection, Travel Behavior Modeli...

研究领域: NLP 作者: Narges Ahmadi, Yubo Jiao, Jonatas Augusto Manzolli, Jiangbo Yu 发布时间: 2026-08-22 arXiv: 2608.20320

论文概要

研究领域: NLP 作者: Narges Ahmadi, Yubo Jiao, Jonatas Augusto Manzolli, Jiangbo Yu 发布时间: 2026-08-22 arXiv: 2608.20320

中文摘要

出行行为研究越来越多地结合数字数据收集和预测建模,但这些阶段通常分开开发和评估。本文提出一个三智能体工作流,集成对话式数据收集、结构化数据处理和行为预测。聊天机器人管理的图像增强陈述偏好调查从学生通勤者收集了五种预设天气情景下的模式选择,产生454个被试-情景观察。天气关联使用多项Logit模型分析,逻辑回归和随机森林提供机器学习基准。评估了9个本地部署的LLM(2B到35B参数),涵盖四种零样本提示条件和扩展的角色、少样本和视觉配置。随机森林达到69.6%五类准确率,最佳纯文本零样本LLM在无任务特定拟合下达到69.9%。习惯出行信息产生最一致的增益,专家框架通常优于角色扮演,视觉配置达到71.5%准确率。


*自动采集于 2026-08-22*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

三智能体出行调查这篇有四条硬细节值得拎出来。

补漏一:「视觉配置 71.5% 准确率」这个数字背后,是 9 个本地部署 LLM(2B-35B)在四种零样本条件 × 多种扩展配置上的最佳成绩。 原文 brief 没展开「扩展角色 + 少样本 + 视觉」三种扩展叠加是不是都触发了增益——这种 ablation 通常 1+1<2,叠加后的真实收益需要看消融表。原 brief 一句话带过有点轻飘,但作为论文深度解读至少应该把「单变量增益」和「叠加增益」分开报。

补漏二:「454 个被试-情景观察」对出行行为建模来说样本量偏小。 一个学生通勤群体的天气情景选择实验,能得到的统计功效有限——5 种预设天气 × 约 90 人 = 450 量级观察,每个格子里只有 18 条左右。随机森林 69.6% 和最佳零样本 LLM 69.9% 的差距几乎可以忽略(0.3 个百分点),但模型间差异在 454 样本下显著性检验很难通过——这种「微弱优势」的可重复性是更大问题。

补漏三:「习惯出行信息产生最一致的增益」值得展开。 原 brief 说「习惯信息」是增益源,但具体怎么注入 prompt、是作为 system 消息还是 user message、是结构化(schema)还是自然语言——这些差异决定了「习惯信息」的可迁移性。Agent 工作流里,结构化 prompt 注入 vs 自然语言注入的效果差距能到 5-10 个百分点。

补漏四:「聊天机器人管理的图像增强陈述偏好调查」这种数据收集方式本身有偏。 愿意参与多模态对话调查的学生本身在「图像解读能力」和「数字工具亲和度」上就是过滤过的——这把采样偏差直接烤进了训练数据。论文若要在工程界推这套三智能体范式,至少要在「无图像增强」对照组上做一份纯文本基线。

收尾钉子:下一步该盯的不是「三智能体工作流能不能在更大样本上跑通」,而是「LLM 在 9 个不同参数规模(2B 到 35B)下的边际收益曲线长什么样」——这种能力-规模曲线才是判断 LLM 适不适合做行为预测的核心指标。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens