欧博APP会员官网AI模型测评:视觉推理之王,谁是网络迷踪高手?
在人工智能这个领域当中, 视觉推理能力属于衡量AI智能水平的重要指标里的其中一个。本文借助一场独具特色的游戏, 也就是“网络迷踪”, 针对五大顶级多模态推理模型展开了横向评测工作, 其目的在于确定哪一个是视觉推理AI之王。

Hi,我想先请你只看下面这张照片欧博最新网址,推测它的拍摄城市:

这是一种推理游戏, 名为「网络迷踪」, 它要求仅凭借照片, 去判定拍摄地点所在位置, 而且距离越靠近, 所获得的分数就越高。
太适合测试 AI 的视觉推理能力了。

完美模拟了人类玩家的视觉推理过程:
精确分辨视觉元素, 解读路牌之上的文字, 辨别植被所属的类型, 剖析建筑具备的风格特点。
调用知识储备:判断特定电线杆造型属于哪个国家或地区;
以及多层次线索整合推理。
在这个游戏里要取得优异成绩, AI们得同时将视觉识别的最大潜能发挥出来, 还得把模型知识的最大潜能发挥出来, 并且要把逻辑推理的最大潜能发挥出来。
在AI答题结果被标注于地图之上以后, 它们相互之间的智力差距便清晰可见了。

相较于单一维度的Benchmark跑分情况, 可以更具趣味性、直观性地去看到模型之间存在的差距。
于是, 我把国内以及国外的, 五个处于顶尖水平的, 多模态推理模型给拉上了, 然后共同来开展了这项比赛。
简单介绍「AI 网络迷踪」赛制
本次比赛的参赛选手如下:

注意, DeepSeek - R1实际上并不具备支持多模态的性质, 这里所说的多模态具体指的是视觉识别, 所以它不会参与比赛。
比赛规则很简单:
1.题目一共有5道, 每一道题都会给出处于同一位置的, 从不同拍摄方向拍出来的两张照片, 题目的来源是图寻-每日挑战-全球 04/20!

2.这场地图迷踪比赛AI模型测评,要通过统一的比赛Prompt, 要求AI依照此给出它觉得最有可能的经纬度坐标, 你正参与其中, 且不准联网。
将相关图片内容仔细研究分析之时, 从中推断那被拍摄的地理位置所属的行政区划层级, 此层级需按大洲、国家、行政区、城市、乡镇这样的格式来表述, 还要推断出对应的经纬度, 经纬度格式比如41.40338, 2.17403 , 要尽可能精准。而右下角处的小地图, 其中并不含有任何具备有效性的信息。
3.每一道题目, 都会于地图之上, 将所有AI的猜测点给标注出来, 同时也会标注出实际位置, 距离越是靠近, 那么排名也就会越高。
第一轮:某热带地区


极其典型的热带区域植被, 棕榈树极多, 又有随处可见的阔叶树, 有着现代化风格的住宅楼, 路面状况很不错, 呈现出略微倾斜的态势, 好像是丘陵地带。
第一轮测试中,各模型回答如下:
GPT-o3:

Gemini-2.5-pro:

Claude-3.7-sonnet-thinking:

Doubao-1.5-thinking-pro:

QVQ-Max:

将第一轮答题所得到的结果, 对应到地图之上的坐标位置, 而那个位置与实际答案的距离位置, 就如同图中所呈现的那样。

实际的位置大概是位于, 1.266428 , 以及 103.823641 , 能够在 Google 地图当中去查看街景。
然而首轮所拍照片, 实际上的确依旧缺失具决定性价值之信息。设欲达至全然精确无误, 便务必参照新加坡之卫星以及街景方面之影像, 展开逐一排查之举。
本轮排名

第二轮:有俄文名称的工厂


第二轮的各 AI 的猜测结果欧博APP会员官网AI模型测评:视觉推理之王,谁是网络迷踪高手?,对应地图位置如下:

在其中, GPT展现出了让人意外的准确性, Gemini同样表现出了令人意外的准确性, 它们二者的误差都处于1公里上下左右啊!

首先, 本轮比赛里, AI没办法借助地图服务去确认经纬度的真实位置状况。其次, 尽管不小心定位到海里去了, 可是没啥大问题。

实际所在位置大概是, 44.727172, 37.823414 , 能够于 Google 地图那儿查看街景。
特别的是, GPT-o3 在这次推理进程当中, 针对图像开展了好多回“缩放再识别”, 这跟人类识别图像细节的流程相类似, “在整张图像没办法看出充足的信息之际, 借助放大图像, 以此来强化对某个特征区域的细节识别”。
想来这种视觉推理方式,很快会成为各家的共识。


第三轮:某海边公路


挨着海的公路, 在远处的西方方位处存在雪山山体, 天气状况下的太阳显得很不错, 环绕山岭的公路其指向线索较清晰。
第三轮的各 AI 的猜测结果,对应地图位置如下:

这一实际位置大概处于, 38.658016, 以及23.967011 ,能够于Google地图那儿查看街景。

第四轮:零售园区


事实上, 这一回所给出的信息真的是相当之多, 有着各种各样的建筑招牌名称, 存在各型号的汽车, 并且有着平坦的地貌。
第四轮结果,对应地图位置如下:

实际所处位置大概是在, 44.867243 这个经度数值, 以及 13.868149 这个纬度数值所对应的地方, 能够在 Google 地图上面去查看街景情况。
GPT展现出的样子很有种“本地人”的意味, Gemini呈现出的状态也有着“本地人”的感觉, 只是此次Gemini在表现这件事情上比GPT更具优势, 更突出一些。

需要特别指出的是, 在这次实际测量当中, 仅仅只有QVQ - Max以及GPT - o3辨认并识别出了图二里位于远处的、尺寸非常小的“Decathlon”迪卡侬标志。
(这样来看,QVQ 没做缩放再识别,识别精度也不错)

倘若AI可以调用Google地图, 进而开展建筑名称的布局工作, 再进行距离的真实比对, 如此一来找到位置必然会因精确完全而倍加轻易。

第五轮:干燥丘陵


最后一轮的信息极为有限, 那是干燥的丘陵地形, 其主要是低矮灌木, 这符合地中海气候区的特征, 也符合温带大陆性半干旱气候区的特征。
那条被维护得尚算大致为相对良好状态的土路, 此道路大抵朝着西南方向去, 推测应该是处于乡村或者偏远地区, 那里交通并不便利。这次的推理难度实实在在要比之前那次更为高些。
各家 AI 推测的地图位置如下:


约在实际位置是: 40 . 372043 , 31 . 760780 , 能够于Google地图那儿去查看街景。

比赛结果:o3 第一
统计 5 轮比赛结果欧博手机版会员网,平均名次就是最终成绩:

小结
这次比赛, 没有让AI通过联网去运用地图相关服务或者进行图像搜索行动, 完全是对模型基于其自身所具备的视觉识别能力、知识储备情况、多模态推理这三项核心能力进行考察。
(模拟了真实人类玩「图寻」的情况,没时间用地图查询作弊)
不过, 借助了AI之后, 我还是比今天百分之九十四点八八的玩家都要厉害, 还把我亲自创下的得分纪录给刷新。

而这当然不是当前 AI 的能力边界。
当我们将卫星地图的权限, 通过类MCP协议提供给AI后, 又把街景影像服务的权限, 以同样方式提供给AI, 甚至还把小红书等社交平台的权限也如此提供给AI。
有那么一种人, 能够借助 AI, 又快又准地预先估摸出一张照片所处的大致范围, 接着呢, 凭借卫星影像、社交平台照片里头所呈现的内容, 进行精细无比的比对, 最终得出精度方面堪称恐怖的位置信息。

那样,精准定位一个人的位置不再是难题。
那么, 一个具备看懂全世界能力的AI, 能够调用互联网无尽海量工具的AI, 还拥有多步推理本领的AI, 会在地图导航, 会在生活服务, 甚至会在安防监控等林林总总方方面面引发何等巨大的变化呢?
