开yun体育网GPS信号往往像迷途的鸽子一样四处乱飞-开云官网kaiyun切尔西赞助商 (中国)官方网站 登录入口

开yun体育网
这项由圣路易斯华盛顿大学筹算机科学团队完成的商榷,以预印本局势发布于2026年7月16日,论文编号为arXiv:2607.15491,有风趣深远了解的读者可通过该编号查询完好意思原文。
城市里,高楼林立,GPS信号往往像迷途的鸽子一样四处乱飞,甚而完全隐匿。快递机器东谈主在楼宇间穿梭,自动驾驶汽车需要精确知谈我方在哪条街的哪个位置,行东谈主也可能拿入部属手机向AI说"我走过了一个红绿灯,左边有一栋白色的大楼,然后右转……"——这些场景都指向并吞个核心问题:当GPS不成靠时,机器若何通过不雅察周围环境来判断我方身处何地?
圣路易斯华盛顿大学的商榷团队专门攻克了这谈难题。他们的方法有一个形象的逻辑:把从大地拍到的视频或者东谈主用语言刻画的行步碾儿线,与从卫星拍摄的鸟瞰舆图进行"配对"。一朝配对顺利,机器就知谈了我方的位置。这种想路被称为"跨视角地舆定位"——"跨视角"的风趣等于,一方是站在大地往前看,另一方是从空中往下鸟瞰,两者的视角完全不同,却能彼此印证。
这篇商榷有两项核心孝顺。其一,他们构建了一个全新的数据集,名为SeqGeo-VL,包含近3.9万组"视频+路子笔墨刻画+卫星图像"的三元配对数据,是该领域迄今为止第一个将视频、笔墨和卫星影像三种信息整合在沿途的大限度数据集。其二,他们遐想了一套名为TrajLoc的和谐框架,以及一个名为TrajMod的轻量模块,能让AI在处理视频或笔墨刻画时,自动将"行走轨迹的几何局势"也纳入考量,从而极大进步定位精度。
以下咱们将沿着这项商榷的核心条理,一层一层把这件事阐述晰。
一、为什么单靠"看一眼"不够用——类似的城市景不雅与定位难题
在城市里,很多街谈看起来简直一模一样:交流作风的住户楼,交流神采的街灯,交流陈设的行谈树。若是你只拍一张像片,发给AI问"这是那边",AI很可能渺茫自失——因为全城有一百个地方长得差未几。学术上把这种情状叫作念"感知浑浊",世俗看法等于"撞脸"太严重,单凭一张脸无法认出是谁。
为了破解这个难题,商榷者们早就猜测一个战术:与其看一张像片,不如看一段视频。就像你认东谈主,不单看一张像片,而是看他步碾儿的姿势、转弯的办法、经过了哪些路标——这么信息就丰富多了。往常几年里,学界依然有一些商榷入手用行驶中的视频序列来作念地舆定位,收尾确乎比单张图片好得多。
策划词,这套想路有一个盲点:它只磋议了"视觉"这一条通谈,完全忽略了"语言刻画"这一条通谈。履行中,东谈主们往往不是拿出相机拍视频,而是用语言刻画我方的位置——"我从十字街头启程,往前直走了不详一个街区,然后右转,右边出现了一栋带砖墙的买卖楼……"这种语言刻画在东谈主与东谈主之间、东谈主与机器之间的协调场景中极为常见,但此前简直没少见据集和方法专门处理这种"路子刻画式"的定位需求。
圣路易斯华盛顿大学的团队恰是从这个缺口启程,决定同期拥抱视频和语言刻画两种输入神态,况兼还加入了一个此前恒久被冷漠的信息维度——行走轨迹的几何局势。
二、一套全新的数据集是若何"造"出来的——SeqGeo-VL的出生
造一个好的数据集,就像给一个新菜谱准备好通盘食材,缺了哪一样,临了的菜都分歧味。此前已有一个叫作念SeqGeo的数据集,包含驾车行驶的视频序列和对应的卫星图像,但它阑珊语言刻画这一重要原料。商榷团队决定在这个基础上"加工",为每一段视频生成一段自然语言的路子刻画,最终酿成"视频+笔墨+卫星图"三合一的SeqGeo-VL数据集。
这个"加工"经由分四个要领。第一步叫"语义索要":对每一段视频的每一帧图像,用一个叫作念Qwen3-VL-8B的视觉语言模子去分析画面内容,生成详确的刻画,比如"左侧有一栋带深色百叶窗的砖房,路边停着一辆银色轿车,前线有东谈主行横谈"。第二步叫"通顺交融":把从轨迹数据中索要的举止信息(比如"左转""直行")加入到刻画里,让语言中也包含体魄转移的维度。第三步叫"结构化回来":用另一个更苍劲的语言模子Qwen3-30B,把前边这些零落的逐帧刻画整合成一段连贯的、灵通的路子阐发,既有具体细节,又有完好意思的时刻条理。第四步是"质地限制":三名经过培训的标注员对立时抽取的约400条样本进行打分,从"物体准确性""时空一致性"和"路子完好意思性"三个维度评估,最终通过率达到91.8%,阐述生成的刻画质地至极可靠。
最终,这个数据集包含38,863组三元配对,每段视频平均约7帧,笔墨刻画平均约129个词(英文),对应的卫星图像是缩放级别20的高分辨率鸟瞰影像。在数据鉴别上,按照原始SeqGeo数据集的旧例,80%用于老师,20%用于测试。
对比同类数据集,SeqGeo-VL是咫尺独一同期支撑视频查询、笔墨查询和卫星参考影像的跨视角定位数据集,填补了领域内的一个彰着空缺。此前的数据集要么只好视频(莫得笔墨),要么只好笔墨(莫得序列),要么只好单张图片。SeqGeo-VL的出现,初度让商榷者不错在并吞个平台上同期商榷和比较这两种查询神态。
三、TrajLoc框架:让AI同期听得懂视频和语言刻画
有了数据集,接下来是遐想方法。商榷团队建议的TrajLoc框架,核心想路是"三驾马车拉并吞辆车":用三个颓靡的编码器(不错看法为三个"翻译官"),分别处理视频、笔墨和卫星图像,然后把它们的输出和谐到并吞个"看法空间"里进行比对。
视频编码器认真把一段行驶视频"翻译"成一个数字向量。具体作念法是:对视频中每一帧图像单独编码,然后把通盘帧的收尾作念平均,得到一个代表整段视频内容的概述向量。这个要领听起来通俗,但实质收尾出乎预料地好。商榷者成心指出,他们莫得使用复杂的时序变换器来团聚帧间信息,而是径直取平均——这么作念筹算量更小,且诠释性能改善主要来自老师战术和轨迹调制模块,而非复杂的蚁集结构。
笔墨编码器认真把路子刻画"翻译"成数字向量。这里有个小挑战:路子刻画往往很长,平均接近129个词,而基础的CLIP文本编码器默许只可处理77个词以内的文本。商榷团队摄取了位置镶嵌线性插值的方法,把编码器的"阅读窗口"扩大,使其能够处理更长的阐发文本,同期尽量保留原有的语义看法才略。
卫星图像编码器则认真把每一张鸟瞰卫星图"翻译"成数字向量,动作定位的参考库。由于卫星图像是视频查询和笔墨查询共同的"尽头",这个编码器在通盘框架中上演着核心核心的变装。
三个编码器都基于CLIP ViT-L/14这个预老师模子进走时行化和微调,使用Adam优化器,运行学习率为0.00001。视频-卫星对皆和笔墨-卫星对皆各老师40轮,轨迹调制模块单独老师20轮。
四、两阶段课程式老师:先学走,再学跑
把视频、笔墨、卫星三者对皆并不是一件容易的事。视频和卫星之间自然视角不同,但都是视觉信息,有一定的自然共性;而笔墨刻画和卫星图像之间的范围则更深——一个是抽象的语言,一个是密集的像素,两者各别极大。若是把这两个难度不同的任务放在沿途同期老师,容易彼此侵扰,导致卫星编码器莫衷一是。
商榷团队遐想了一套"先易后难"的课程式老师决策。第一阶段:只老师视频编码器和卫星编码器的对皆。这一步让卫星编码器先学会看法大地视角的视觉内容,诞生一个"大地语义化"的暗示空间。第二阶段:冻结视频编码器(不再更新它的参数),然后老师笔墨编码器与卫星编码器的对皆。为了预扎眼星编码器在第二阶段"忘掉"第一阶段学到的东西,商榷者加入了一个正则化拘谨:让第二阶段的卫星编码器输出与第一阶段的输出保抓高度相似,就像在告诉它"你不错学新东西,但别把老常识全丢了"。
这种分阶段老师的收尾,在后续的消融实验中得到了明确考据:去掉课程式老师后,视频定位的R@1(排行第一射中率)从5.01%下落彰着,阐述这种"先走后跑"的战术确乎灵验。
五、TrajMod:把"往哪走"的信息注入AI的判断
即便有了三个苍劲的编码器和悉心遐想的老师战术,商榷团队仍然发现一个根人道的不及:基于CLIP和大型语言模子的镶嵌暗示,对于空间布局的看法才略至极薄弱。
麻省理工的商榷曾指出,CLIP模子的举止更像"词袋模子"——它能识别一张图里有什么,但对于这些东西的位置关系,以及"向左走"和"向右走"带来的各别,它往往无法区分。这对于地舆定位来说是个致命缺欠,因为语义相似的地方(比如两条都有便利店的街谈)可能位于完全不同的地点,只好通过空间布局智力区分。
商榷团队的责罚决策是引入一个叫作念TrajMod(轨迹条目调制模块)的轻量组件。它的使命道理类似于调音台上的平衡器:笔据行走轨迹的几何局势,对视频或笔墨的镶嵌向量进行"调音"——调高某些频率(放大某些维度),调低另一些频率(压缩另一些维度),使得最终的暗示能够更准确地反应"在哪个办法、以什么局势走过"这一空间信息。
具体终了上,TrajMod使用了两类轨迹几何信息:一是每个旅途点的朝向角度(能捕捉局部转弯形态),二是最先到尽头的地点角(提供自如的全局办法感)。为了更好地编码这些角度信息,商榷者使用了傅里叶特征编码——不错看法为把每个角度革新成一组"音符",使蚁集更容易"听"出不同角度之间的各别。这些特征被拼接后,通过一个多层感知机(MLP,不错看法为一个微型神经蚁集)推敲出"缩放因子"和"平移因子",对编码器输出的镶嵌向量作念乘法和加法变换。视频和笔墨各有颓靡的MLP,因为两种模态的特质不同。
TrajMod的遐想是"即插即用"的:它不变嫌任何已有编码器的参数,仅仅在编码器输出之后、检索比较之前,对向量进行一次几何信息注入。通盘模块参数目极小,老师本钱低,却带来了显耀的性能进步。
为了印证这种几何注入神态的优厚性,商榷团队还作念了一个对比实验:把交流的轨迹几何信息以笔墨教唆的局势(prompt)注入到Qwen3-VL这么的多模态大语言模子中。收尾标明,笔墨教唆神态只带来了1.34个百分点的R@1%进步,而TrajMod带来了19.33个百分点的进步。这阐述,对于跨视角空间推理来说,"告诉模子往哪走"远不如"径直把办法信息镶嵌特征向量"来得灵验。
六、实验收尾:数字背后的简直风趣风趣
商榷团队在SeqGeo-VL上进行了全面的实验评测,使用的主要目的是R@K(调回率@K),也等于"在排行前K的收尾中,正确谜底出现的概率"。R@1代表最严格的按序,即排行第一的收尾等于正确谜底;R@1%则暗示正确谜底出当今前1%的候选收尾中。
在视频地舆定位任务上,TrajLoc获得了12.09%的R@1和80.21%的R@1%,比拟此前最强的基线方法有显耀进步。作念个对比:把SeqGeo方法的主干蚁集从VGG16升级到交流的ViT-L/14后,R@1从1.80%进步到8.14%,但TrajLoc在雷同的主干蚁集下进一步达到12.09%,阐述进步不仅来自更强的主干,更来自老师战术和TrajMod的孝顺。另一个苍劲的竞争敌手——经过LoRA微调的Qwen3-VL-Embedding——也只达到5.44%的R@1,远低于TrajLoc,印证了通用视觉语言模子在跨视角空间推理上的先天局限。
在笔墨地舆定位任务上,TrajLoc雷同大幅非凡。R@1达到2.52%,R@1%达到45.48%。对比同类最强的CrossText2Loc方法(ViT-L/14@336版块),TrajLoc的R@1约为其2.6倍,R@1%约为其1.8倍。更值得存眷的是,商榷者发现,对CLIP模子换用更大的主干(从ViT-B到ViT-L再到SO400M)或更高分辨率(@336、@384)带来的性能进步至极有限。这阐述瓶颈不在模子"有多大眼睛",而在模子"有莫得空间看法才略"——这恰是TrajLoc通过轨迹几何注入所责罚的核心问题。
七、消融实验:远离每个零件,望望各自孝顺了什么
为了弄明晰每个遐想选用的具体孝顺,商榷团队作念了一系列"拆解"实验。
对于视频帧数与TrajMod的交互关系,实验收尾线路,跟着输入帧数从1帧增多到6帧,通盘目的都在抓续进步,印证了"看得越多、定位越准"的直观。更有风趣的是,加入TrajMod之后,帧数越多,性能进步越大——在1帧时,加入TrajMod带来的R@1进步约为2.6个百分点;在6帧时,进步扩大到5.6个百分点。这背后的逻辑是:帧数越多,画面内容越相似,视觉浑浊越严重,而此时轨迹几何信息的"消歧"作用就越隆起。
对于麇集老师与TrajMod的协同效应,实验揭示了一个道理的情状:单纯把视频和笔墨麇集老师(不加TrajMod),对两个任务的性能进步都聊胜于无——视频R@1从6.87%小幅高涨到7.27%,笔墨R@1从0.80%小幅高涨到0.98%。但一朝加入TrajMod,麇集老师的增益被大幅放大:视频R@1因麇集老师从9.69%跳升到12.09%,笔墨R@1从1.90%跳升到2.52%。商榷团队将这一情状归因于TrajMod的几何锚定效应:当视频和笔墨刻画都被锚定到并吞条轨迹的几何坐标系中时,两种模态就有了共同的"空间语言",不错彼此补充、彼此强化。
对于位置先验的影响,商榷还模拟了一种实质场景:当用户或机器东谈主知谈我方不详在哪个区域(比如某个城区)但不知谈精确位置时,不错减弱卫星图库的搜索范围。实验发现,跟着候选图库的减弱,完全定位精度大幅进步,阐述TrajLoc输出的镶嵌向量具有很好的"细巧空间分辨率",一朝有了粗粒度先验,能够相等精确地锁定具体位置。
对于SeqGeo-VL数据集的质地,商榷团队与两个简化版块作念了对比:一是"单帧刻画"(只用临了一个旅途点的图像刻画),R@1%为10.63%;二是"序列物体列表"(把各帧中出现的物体依时期功令陈设,平均仅26.3个词),R@1%为17.41%;完好意思的SeqGeo-VL刻画(平均101.3个词)达到22.29%的R@1%。这一双比诠释,完好意思的时空叙事(不仅仅物体列表,而是包含地点、转弯、泄露的连贯刻画)对定位性能有显耀孝顺,SeqGeo-VL的遐想办法是正确的。
对于多模态麇集查询,当同期使用视频和笔墨两种查询(以0.4:0.6的权重混杂两种镶嵌向量)时,性能比单独使用任何一种都要好,在1帧视频条目下R@10进步幅度最大,达到9.49个百分点。这阐述视频和笔墨刻画佩带的是互补信息,在视频帧数较少、视觉信息不实时,笔墨刻画的补充价值尤为隆起。
说到底,这项商榷的风趣风趣远不啻于本事层面的性能数字。它为一个咱们每天都可能遇到的履行窘境——GPS失灵时若何定位——提供了一条全新的解题旅途。更遍及的是,它诠释了一件直观上合理但此前繁难系统考据的事情:步碾儿的神态(轨迹局势)和步碾儿的刻画(语言阐发),与步碾儿时看到的画面(视频)一样,都是有价值的定位陈迹,而且三者之间存在不错被挖掘的协同效应。
当城市里的快递机器东谈主禁受到"启程,在第二个路口左转,沿着有大树的街谈走约100米"这么的语音指示时,改日基于类似框架的系统,巧合确切能够把这句话精确地对应到卫星舆图上的一个具体坐标。这对于东谈主与机器的自然协调,意味着门槛的大幅裁汰——你不需要输入坐标,不需要掀开舆图,只需要像和一又友语言一样,刻画你所走的路。
自然,咫尺这套系统的R@1仍然有很大的进步空间——笔墨定位的R@1仅为2.52%,意味着绝大无数时候AI的第一个谜底仍然是错的,需要在前5%或前10%的候选中智力找到正确位置。不外,这对于一个全新问题设定的首个基准性方法而言,依然是至极有价值的最先。跟着数据限度扩大、模子才略增强、更多城商场景被障翳,这一数字有望抓续攀升。
若是你对这项商榷的本事细节感到酷爱,或者想了解数据集和代码的具体终了,不错通过arXiv编号2607.15491找到完好意思论文,商榷团队也在论文提供的表情页面上洞开了代码、模子权重和数据集。
Q&A
Q1:SeqGeo-VL数据集和正常的地舆定位数据集有什么区别?
A:正常的地舆定位数据集往往只包含单张图片和对应的卫星图,最多加入视频序列,但莫得语言刻画。SeqGeo-VL是咫尺第一个同期包含"行驶视频+自然语言路子刻画+卫星图像"三种数据的数据集,共有38,863组配对数据,使商榷者不错同期商榷视频定位和语言刻画定位两种任务。
Q2:TrajMod模块为什么比径直用笔墨教唆告诉AI轨迹信息收尾好那么多?
A:实验对比线路,把轨迹信息以笔墨教唆神态输入给Qwen3-VL这类大模子,R@1%只进步了1.34个百分点;而TrajMod通过径直修改镶嵌向量(特征空间中的数字暗示),带来了19.33个百分点的进步。核心原因在于,语言模子对"左转""向北"这类空间指示的里面处理仍然是语义层面的,而TrajMod径直将几何角度信息注入特征向量,让空间办法信息以数学结构的局势参与相似度筹算,更相宜跨视角空间推理。
Q3:跨视角地舆定位本事在日常糊口中有哪些实质哄骗场景?
A:这类本事的主要哄骗包括:在GPS信号被高楼装扮的城市环境中为机器东谈主或自动驾驶车辆提供备用定位;在东谈主机协调场景中让用户用自然语言告诉机器东谈主我方在那边(比如叫车时刻画位置);以及在热切搜救或无基础设施环境下开yun体育网,通过视觉不雅察匹配卫星舆图来笃定位置。

