← 文章 / AI技术
Google Research 博客 3小时前 · 2026-09-06 19:33:23 · 5 阅读

如何让语言模型通过 Mobility 深化对地点的理解

人工智能在通过文本理解世界方面取得了惊人进展。但要构建真正理解物理世界的 AI 模型,仅靠文字还不够:必须把握建成环境动态的现实功能。每个地点都有两套截然不同的“指纹”:纸面上的身份标识,与实地实际的功能节奏。

传统语言模型主要依赖静态元数据来构建地点(通常称为“兴趣点”或 POI)的表征,无论是商铺,还是公园、地标等公共场所。它们能够成功处理地址、业务类别和文本描述。虽然 Gemini 等世界级语言模型在处理文本数据方面极为娴熟,但其空间表征若能融入城市环境的现实功能动态,将得到显著提升。用移动数据补充语义标签,可让这些模型有效捕捉城市中 POI 独有的时间活动节奏。

为展示这种互补能力,我们提出了 Mobility-Embedded POIs(ME-POIs),这是一种全新的框架,用于提升语言模型基于文本的地点表征。借助公开可用的基准数据集,ME-POIs 融合了聚合且匿名化的移动模式,包括到达时间、停留时长以及周边流动模式。ME-POIs 不把地点视为凝固的文字集合,而是采用自监督方法,将文本描述与来自公共基准的大规模匿名化移动模式相融合(捕捉环境在一整天的聚合空间活动足迹)。由此,模型构建出一种数值向量表征——即数学意义上的“签名”,技术上称为嵌入(embedding)——同时编码地点的身份与其动态功能。将 ME-POIs 与先进文本模型集成,带来了显著的情境优势:在未见过的地点上,预测访问意图相对提升高达 81.9%,价格等级分类改善 75.1%,繁忙度估算准确率提升 24.7%。

ME-POIs 框架的工作原理

通过提供预先富化的地点表示,ME-POIs 框架让 AI 模型能够轻松对营业时间、目标价位、经营状态等多种属性做出准确推断,而不必每次都从零开始计算这些信息。

要让模型更深入地理解地点,必须区分地点的身份(名称和类别)与功能(聚合的到访足迹)。此前的地理空间 AI 研究中,mobility 模式几乎只被用来预测用户下一个会去的 POI。而 ME-POIs 框架则把 mobility 从输出预测任务转变为定义地点本身的输入特征。

但如何把原始的地理位置点转换成数值上有用的、干净的数学签名(即 embedding)呢?我们通过三步流水线来实现:到访对齐、空间多尺度到访传播,以及文本与 mobility 的协同融合。

一张示意图,展示 POI 文本元数据与匿名化的 mobility 模式如何融合为 ME-POIs embedding。

ME-POIs 框架将静态文本元数据(POI 身份)与来自公开基准数据集的动态到访模式(POI 功能)相结合,构建出一个全面的地点表示。

到访对齐

模型把针对特定 POI 的聚合到访视为基础数据点,分析其到访时间窗口、离开趋势和典型停留时长。它并不采用简单的平均计算,而是通过时间编码器把这些时序数据映射到一个稠密向量空间。这一过程会生成一个"功能质心"——一个独特的多维签名,刻画该地点在一年周期及一周内不同日期上的匿名聚合 mobility 模式。

解决数据稀疏的"长尾"问题

地理空间数据科学领域一直面临一个持久难题,即“长尾”问题。知名地标、大型商场和热门市中心连锁品牌能产生海量的访问数据,但绝大多数本地企业——如街角精品店、专业维修铺或新开的咖啡馆——却饱受数据稀疏之苦。过去,当模型遇到记录访问极少或为零的场所时,会错误地假设该地点没有任何活动,从而导致预测失效。

ME-POIs 通过一种新颖的空间多尺度访问传播机制解决了这一难题。其架构认识到,出行行为通常具有区域性约束;一家位于高端商业街的精品店,其系统性行为特征往往与周边邻居相似。该框架会观察多个空间尺度下的相邻地点,涵盖紧邻的街道、街区乃至更广阔的社区。随后,它将繁忙且数据丰富的邻居聚合后的访问模式统计性地迁移到附近数据稀疏的地点。通过从活跃区域学习 regional “节奏”,模型能够将智能的地理先验知识库应用于小型店铺,即便它们在数据中几乎没有出现,也能从中习得相关特征。

文本与出行数据的协同

ME-POIs 框架并未丢弃文本描述,而是对其进行丰富。具体做法是,通过最大化余弦相似度,将来自 Gemini 等先进模型的高层语言嵌入(标准向量表示)与新生成的出行向量对齐。我们将出行信号直接叠加在语言表示之上,从而构建出对该地点或企业业务更为全面的视图。

这种混合方法确保模型在保留结构语义(例如,从文本描述中知晓某地售卖食物)的同时,吸收其运营上下文(例如,根据其出行特征判断其是午餐餐厅还是深夜食堂)。

实验

为了验证 ME-POIs 是否真正实现对物理场所的泛化且与属性无关的理解,我们在洛杉矶和休斯顿这两个文化背景迥异的大型都市区进行了广泛的测试。

我们在五个不同的任务上评估了该框架。关键在于,为了证明模型发展出的是通用智能而非仅仅记忆局部模式,我们在观察到的地点集上训练框架,然后要求它对完全未知的地点进行属性预测。

以下五个下游任务分别是:

  • 营业时间预测:我们的地点嵌入能否帮助推断商家的具体营业时间表?
  • 价格等级分类:仅凭移动性上下文,我们的地点嵌入能否帮助区分高端精品店与二手店?
  • 永久闭店检测:许多商家在实际关门很久之后仍未更新线上资料或提交众包报告,我们的嵌入能否帮助我们识别这类已永久关闭的商家?
  • 访问意图分类:我们的嵌入能否帮助估算某个地点的搜索与导航总体兴趣?此任务可作为衡量地点整体受欢迎程度的代理指标。
  • 忙碌程度预测:预测商家未来的客流密度及高峰时段动态。

为建立基线,我们将 ME-POIs 框架与纯文本嵌入模型(如 Gemini embeddings)、现有的基于轨迹的地理空间模型(如 TrajGPT)以及混合变体进行了对比,以精确衡量移动性模式为结果增添了多大的价值。

结果

实验结果令人印象深刻,证实了将真实世界的移动数据融入现有文本模型能提供显著的「上下文优势」。在评估模型对未见测试地点的表现时,ME-POIs 的整合带来了大幅度的准确性提升,在所有预测任务中持续优于仅基于文本或仅基于移动性的基线模型。

两个柱状图展示 ME-POIs 模型在各种预测任务上均优于基线模型。

添加 ME-POIs 在所有任务上均一致提升了模型性能,显著改善了访问意图和价格等级分类等关键指标,优于基线模型。

除了在性能上超越标准基线,研究还有一个引人注目的发现:仅用移动数据训练的模型与只能访问文本元数据的模型对比时,在价格水平分类等多个任务上,纯移动数据模型反而胜过了纯文本的语言模型。这揭示了一个关于城市动态的有趣且常被忽视的事实:人们在一个地点的集体行为,往往比那些正式的文字标签更能描述这个地点。

结语

通过成功突破静态数字标签的局限,ME-POIs 框架展示了一条让 AI 建模和理解物理世界的新路径。需要强调的是,该框架着眼于对世界的整体性理解——无法对个体用户得出结论,也不能用于个性化场景。也就是说,ME-POIs 框架能提供一个地点或商家的整体性表征,捕捉它在广泛人群和时间跨度上的到访规律,但不能用于针对个人的个性化。它的价值在于为地点生成丰富的聚合数值特征,减轻下游系统在需要对这些地点进行推理时的计算负担。

归根结底,ME-POIs 为真正理解城市节奏的 AI 模型打下了基础。它也是我们更广泛的 Google Earth AI 项目的一部分,该项目致力于构建地理空间模型和数据集,把全球数据转化为可行动的智能。

致谢

感谢本文的合著者:Neha Arora(Google Research),以及南加州大学(USC)的 Cyrus Shahabi 教授和博士研究生 Shang Ling Hsu。

原始来源: Google Research 博客

评论 (0)