地理空间智能体评测

只比较最终文字答案无法判断 GeoAI Agent 是否真正完成了空间分析。一个系统 可能说对了方法名称,却使用了错误坐标系、缓冲距离或输入字段;也可能代码 运行成功,但输出地图与数据不一致。

六层评测

层级核心问题示例证据
任务完成是否交付了要求的分析与产物?成功状态、目标图层、报告
参数正确工具、字段、单位和阈值是否匹配任务?调用记录、参数快照
空间有效CRS、几何、拓扑和空间范围是否正确?几何检查、空间断言
数值有效统计值和中间结果是否满足约束?单元测试、分布与边界
产物质量地图或图层是否真实表达数据?地图检查、样例核验
恢复与协作出错后能否合理修正,何时交还给人?错误轨迹、人工决策点

动态执行为什么重要

静态评测通常只比较答案文本或生成代码,无法观察:

  • 工具是否真的存在;
  • 参数能否被运行时接受;
  • 中间文件是否正确生成;
  • 错误反馈是否改变下一步计划;
  • 地图视觉与空间数据是否一致。

2026 年预印本 GeoAgentBench 提出动态 GIS 执行环境,覆盖 117 个原子工具、53 类任务和 6 个 GIS 领域,并分别检查参数 执行与空间/制图产物。这些数字描述的是该预印本的 benchmark 设计,不应被 解读为领域统一标准。

建议的测试集结构

原子能力

  • 坐标转换;
  • 属性筛选;
  • 缓冲与空间连接;
  • 栅格指数计算;
  • 几何和字段验证。

多步工作流

  • 数据获取、清洗、投影、分析、制图;
  • 中间步骤失败后的重试;
  • 输入信息不足时请求澄清;
  • 两种合理空间单元之间的选择与解释。

对抗性失败

  • 经纬度顺序颠倒;
  • 米与度混用;
  • 无效几何;
  • 时间范围错位;
  • 空图层或缺字段;
  • 看似合理但并不存在的工具;
  • 地图样式正确但底层值错误。

人类生产力不是“完全无人”

GeoAI Agency Primitives 把评测目标扩展到 GIS 实践者的人机协作和产物生产。对真实工作而言,好的 agent 不一定减少 所有人工步骤,而应减少重复操作,同时让关键空间判断更容易检查和修正。

最小验收记录

一次可审计评测至少保存:

  1. 任务和输入数据版本;
  2. 工具、模型和环境版本;
  3. 完整参数与运行轨迹;
  4. 中间和最终空间产物;
  5. 自动检查与人工复核结果;
  6. 失败类型及最终修正。

返回 GeoAI 知识地图

来源状态