← 返回 PaperDaily 大模型与智能体

Citi Bike老年轨迹被学歪了?Qwen3-4B也没救

老年人出行不是“年轻人缩小版”,这篇论文把这个常识用数据钉死了。更关键的是,它还顺手证明:训练集一旦被多数群体主导,连大模型也会把少数群体的轨迹学歪。

Citi Bike老年轨迹被学歪了?Qwen3-4B也没救
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
老年人出行不是“年轻人缩小版”,这篇论文把这个常识用数据钉死了。更关键的是,它还顺手证明:训练集一旦被多数群体主导,连大模型也会把少数群体的轨迹学歪。


原论文信息如下:
论文标题:
Towards Inclusive Mobility Modeling: Characterizing and Evaluating Elderly Trajectory Patterns in Urban Systems
发表日期:
2026年06月
发表单位:
School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics; MOE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics; Center for Data Science, New York University
原文链接:
https://arxiv.org/pdf/2606.31207v1.pdf

城市移动数据中的“隐形人”:老龄化骑手面临系统性偏差

城市交通系统最怕什么?不是车太多,而是看起来数据很多,实际上代表性很差。这篇论文盯上的就是这个老问题:在智能城市里,老年人的出行轨迹常常像“背景板”,数据里有他们,但模型里未必有他们。
论文没有空谈公平,而是拿纽约新泽西 Citi Bike 的带年龄信息历史数据开刀,直接问一个很现实的问题:当训练数据里年轻人占绝对多数时,生成出来的“老年人轨迹”到底像不像老年人?如果不像,后面的设施规划、线路优化、城市模拟,都会在不知不觉中偏航。
封面图
图1:老年骑手与年轻骑手的出行模式对比,论文的核心问题就藏在这里——他们不是同一种“移动生物”。
这篇工作的厉害之处不在于“做了个新模型”,而在于它先把问题讲明白:少数群体的行为分布和多数群体根本不一样,而且这种差异不是噪声,是结构性的。老年人不是年轻人的缩小版,更不是把年轻人的轨迹随机删几条就能冒充的。

咬一口Citi Bike数据:揭示老年人与年轻人的出行“基因”差异

先说人话:论文做的第一件事,不是训练模型,而是给数据“体检”。它把 2016—2020 年 Jersey City 的 Citi Bike 记录清洗后,按年龄切成老年组(65+)和年轻组(18–35),再去看两类人的活动范围、规律性和时间节奏到底有什么不同。
表1:JC Citi Bike 2016—2020 数据集按年龄分组的描述统计(过滤后)
表1:JC Citi Bike 2016—2020 数据集按年龄分组的描述统计(过滤后)。老年组只占很小一部分,年轻组则是绝对主力,这已经为后面的偏差埋好了伏笔。
表1里最扎眼的不是“多少条数据”,而是老年骑手只占全部过滤后轨迹的 0.9%。这不是“少一点”,这是“几乎被淹没”。而年轻骑手占了 51.3%,模型要是只看总量,很容易把年轻人的行为当默认答案。
论文接着定义了几类基础指标,都是轨迹分析里的老朋友。Step Length 是单次出行的起终点距离;Radius of Gyration, RoG 的英文全称是 Radius of Gyration,中文常译为轨迹离散半径,表示一个人的活动范围有多“散”;Mobility Entropy 则是用香农熵衡量站点访问是否规律,越低越“固定套路”。
这些指标放在一起,基本就能看出一个人的出行风格:是“到处跑”,还是“固定几条线来回走”。论文的结论很直接:老年人的活动空间更局部、行为更规律、时间上也更偏离通勤高峰。说白了,老年人的轨迹像社区生活,年轻人的轨迹像上班打卡。
图1:老年与年轻骑手的移动特征对比
图1:老年与年轻骑手的移动特征对比。左边看空间,右边看时间,差异都不是“小打小闹”。
图1里最关键的不是“平均骑多远”这种粗指标,而是空间覆盖和时间节奏。老年骑手的 RoG 更小,熵更低,说明他们不是“骑得少”这么简单,而是活动半径更收缩、习惯更稳定。这类差异如果被模型忽略,后面的生成结果就会天然偏掉。
时间上也很有戏。年轻骑手有明显的早晚高峰,像是被通勤节奏牵着走;老年骑手则更集中在白天,节奏更平缓。这意味着,同一座城市里,不同年龄群体的“出行钟表”并不一致。如果城市系统只按总量建模,老年人的需求就会被平均掉。

实验解码:当AI模型“偏听偏信”,老年人出行模式如何被扭曲?

论文最有意思的地方来了:它不是拿一个模型炫技,而是故意让模型在三种训练人口结构下分别学习——全体人群、只看年轻人、只看老年人。然后统一去生成“老年轨迹”,看谁更像真的老年人。
这种设计很干净:它把“模型能力”与“数据代表性”拆开了。否则一旦把模型做大,最后到底是数据重要,还是模型重要,就会变成一锅粥。论文用这种控制变量的方法,直接证明了一个很扎心的事实:多数群体主导的数据,会把少数群体的行为学歪
图2:不同训练人群下的合成轨迹评估
图2:不同训练人群下的合成轨迹评估。左边看绝对值,右边看相对误差,谁偏得离谱一眼就能看出来。
图2的结论非常明确:训练集如果主要来自年轻人,生成出来的老年轨迹会明显失真,尤其是空间相关指标。比如 Markov 模型在全体人群上训练后,老年人的步长和停留时间仍然有偏差;只看年轻人时,偏差更大。换句话说,“平均得很好”不等于“少数群体也很好”
表3:不同人口结构下 Markov 合成轨迹与真实老年轨迹的对比
表3:不同人口结构下 Markov 合成轨迹与真实老年轨迹的对比。这里已经能看到“训练集是谁,模型就更像谁”的影子。
表3里最值得注意的不是某个单项最优,而是整体趋势。老年专属模型在步长、停留时间和熵这些指标上更接近真实老年轨迹,说明少数群体的行为确实需要少数群体自己的数据来学。全体人群训练虽然能把时间相关误差压下来一些,但空间结构还是被多数群体牵着走。
这其实很符合现实:如果一个群体本来就很少出现在训练集中,模型学到的往往只是“这个群体大概不怎么动”,但学不到他们究竟怎么动、去哪儿动、什么时候动。偏差不是没有,而是被平均值藏起来了。

从Markov到LLM:大模型在老问题面前也“翻车”

接下来轮到更“高级”的模型上场。论文把 Qwen3-4B 通过 QLoRA 微调后拿来做轨迹生成。这里先解释一下:QLoRA 的英文全称是 Quantized Low-Rank Adaptation,中文可理解为量化低秩适配,核心好处是:大模型不用全量微调,成本低很多。
表2:LLM 训练语料统计
表2:LLM 训练语料统计。老年数据依旧很少,年轻数据依旧很多,现实就是这么不给面子。
表2对应的训练设置,本质上还是老问题:老年专属、年轻专属、全体混合。区别只是这次换成了更强的序列模型,看看“大模型是不是天生更会补少数群体的课”。答案并不乐观。
这里就很有意思了。LLM 在空间指标上并没有“碾压”Markov,甚至在某些指标上更离谱。比如老年专属 LLM 的步长、速度、停留时间都偏得很明显,说明模型容量大,不代表自动学得更像。数据稀疏时,强模型也可能只是更会“编”,不是更会“懂”。
表4:LLM 生成轨迹与真实老年轨迹的对比
表4:LLM 生成轨迹与真实老年轨迹的对比。这里能看出,LLM 并没有神奇地修复少数群体偏差。
表4里最扎眼的是速度和停留时间几乎全线失真。原因也不复杂:这个 LLM 只生成站点序列,连续时间属性是后处理“补”出来的,不是模型自己真正学出来的。于是就出现了很典型的现象:序列像了,时间没像;空间稍微像了,行为没像全
这也解释了为什么论文的结论并不“吹大模型”:在少数群体数据很稀疏的场景下,更强的模型不一定带来更高的群体级保真度。如果输入分布本身就偏,模型再大,也可能只是把偏差包装得更精致。

面向包容性交通:算法应当考虑“银发族”的特殊节拍

这篇论文最后给出的启发其实很朴素:公平不是在总指标里“平均一下”,而是在不同人群上都能站得住。对城市交通来说,老年人不是边角料,而是必须单独看待的一类用户。
从工程角度看,这项工作也很实在。它提醒后续做轨迹生成、出行预测、站点规划的人,别只盯着整体分数。真正该补的不是“再堆一个更大的模型”,而是更好的群体覆盖、更细的分层评估、更真实的时间建模。否则模型训练得再漂亮,落到城市治理里还是会偏。
如果把这篇论文翻成一句大白话,那就是:数据不包容,模型就不可能真正包容。老年人的出行节奏、活动半径、时间偏好都和年轻人不一样,城市系统若想“照顾到所有人”,就不能只拿多数人的轨迹当标准答案。
更进一步看,这类研究对未来智能城市的意义不只是“把老年人单独拎出来看”,而是推动一种更成熟的评估习惯:任何面向人群的模型,都该问一句:少数群体是否被真正看见了。这比单纯追求一个漂亮的平均误差更重要。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它研究的是“少数群体被多数数据淹没后,轨迹生成模型会不会学歪”。答案是会,而且老年人的空间行为最容易被扭曲。

RoG 和 Mobility Entropy 分别是什么意思?RoG 是轨迹离散半径,表示活动范围有多分散;Mobility Entropy 是移动熵,表示访问站点是否规律。前者看“跑多远”,后者看“走得有多固定”。

为什么 LLM 没有明显比 Markov 更强?因为这里的关键瓶颈不是“模型会不会说”,而是“少数群体数据够不够”。在数据稀疏、时间属性还要后处理补齐的情况下,LLM 的大容量并不能自动转化成更高的少数群体保真度。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

这篇论文的创新不在“发明了一个新模型”,而在于把少数群体公平性轨迹生成绑在一起做了一个很清楚的实验框架,角度新,但方法本身不算炸裂。

实验合理度:★★★★☆

控制变量做得比较干净,Markov 和 LLM 都在同一套人口划分下比较,结论可信度不错。小遗憾是 LLM 的时间属性主要靠后处理,严格说对“端到端生成能力”的比较不够完整。

学术研究价值:★★★★☆

价值不小。它提醒轨迹生成、城市计算、算法公平这些方向:总体指标好看,不代表弱势群体被照顾到了

稳定性:★★★☆☆

Markov 方案更稳,LLM 在少数据下容易漂。要真上城市系统,至少还得补更多群体数据和更严格的时间建模。

适应性以及泛化能力:★★★☆☆

思路能迁移到其他人群或其他城市,但前提是得有可用的年龄或群体标签。没有标签,很多公平分析就只能靠猜。

硬件需求及成本:★★★☆☆

Markov 成本低,LLM 微调用 QLoRA 已经算省钱了,但对普通团队来说,数据清洗、分层评估和生成后验证才是真成本。

复现难度:★★★☆☆

方法不复杂,难点在数据获取和年龄标签处理。论文给了相对完整的实验设计,但真实复现仍然受数据可得性影响。

产品化成熟度:★★☆☆☆

更适合做研究评估框架,不适合直接上线当生成引擎。若要产品化,必须先解决群体标签缺失、时间生成不一致和跨城泛化问题。

可能的问题:论文抓住了“代表性不足”这个关键点,但实验仍局限在单城单平台;LLM 的时间建模也偏弱,离真正可用的包容性生成还有一段路。


主要参考文献

Zhengxuan Wang, Haohan He, Mengying Zhou. Towards Inclusive Mobility Modeling: Characterizing and Evaluating Elderly Trajectory Patterns in Urban Systems. arXiv:2606.31207v1, 2026.
Motivate International Inc. Citi Bike NYC System Data. https://citibikenyc.com/system-data
Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient Finetuning of Quantized Language Models. NeurIPS 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。老年友好城市、轨迹生成、算法公平这类话题,群里正好能接着聊。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。