地理空间智能体评测
只比较最终文字答案无法判断 GeoAI Agent 是否真正完成了空间分析。一个系统 可能说对了方法名称,却使用了错误坐标系、缓冲距离或输入字段;也可能代码 运行成功,但输出地图与数据不一致。
六层评测
| 层级 | 核心问题 | 示例证据 |
|---|---|---|
| 任务完成 | 是否交付了要求的分析与产物? | 成功状态、目标图层、报告 |
| 参数正确 | 工具、字段、单位和阈值是否匹配任务? | 调用记录、参数快照 |
| 空间有效 | CRS、几何、拓扑和空间范围是否正确? | 几何检查、空间断言 |
| 数值有效 | 统计值和中间结果是否满足约束? | 单元测试、分布与边界 |
| 产物质量 | 地图或图层是否真实表达数据? | 地图检查、样例核验 |
| 恢复与协作 | 出错后能否合理修正,何时交还给人? | 错误轨迹、人工决策点 |
动态执行为什么重要
静态评测通常只比较答案文本或生成代码,无法观察:
- 工具是否真的存在;
- 参数能否被运行时接受;
- 中间文件是否正确生成;
- 错误反馈是否改变下一步计划;
- 地图视觉与空间数据是否一致。
2026 年预印本 GeoAgentBench 提出动态 GIS 执行环境,覆盖 117 个原子工具、53 类任务和 6 个 GIS 领域,并分别检查参数 执行与空间/制图产物。这些数字描述的是该预印本的 benchmark 设计,不应被 解读为领域统一标准。
建议的测试集结构
原子能力
- 坐标转换;
- 属性筛选;
- 缓冲与空间连接;
- 栅格指数计算;
- 几何和字段验证。
多步工作流
- 数据获取、清洗、投影、分析、制图;
- 中间步骤失败后的重试;
- 输入信息不足时请求澄清;
- 两种合理空间单元之间的选择与解释。
对抗性失败
- 经纬度顺序颠倒;
- 米与度混用;
- 无效几何;
- 时间范围错位;
- 空图层或缺字段;
- 看似合理但并不存在的工具;
- 地图样式正确但底层值错误。
人类生产力不是“完全无人”
GeoAI Agency Primitives 把评测目标扩展到 GIS 实践者的人机协作和产物生产。对真实工作而言,好的 agent 不一定减少 所有人工步骤,而应减少重复操作,同时让关键空间判断更容易检查和修正。
最小验收记录
一次可审计评测至少保存:
- 任务和输入数据版本;
- 工具、模型和环境版本;
- 完整参数与运行轨迹;
- 中间和最终空间产物;
- 自动检查与人工复核结果;
- 失败类型及最终修正。
返回 GeoAI 知识地图。
来源状态
- GeoAgentBench:2026 年 arXiv 预印本。
- GeoAI Agency Primitives:2026 年 arXiv 预印本。
- Spatial-Agent:ACL 2026 正式论文,可作为空间概念约束工作流的对照。