GEO监测探针系统 — 全流程架构
文档版本:V1.0
编制日期:2026年8月18日
适用范围:GEO优化服务商垂类监测
一、系统概述
1.1 系统定位
福建艾索GEO监测探针系统是一套面向GEO(Generative Engine Optimization,生成式引擎优化)服务垂类的全自动监测平台。系统以智能体工作台为运行底座,通过自研的提示词工程驱动的技能机制,实现对指定服务商主体的五大GEO核心维度的定时采集、基线校验与异常告警。
1.2 系统核心能力
| 能力项 | 说明 |
|---|---|
| 多源数据采集 | 覆盖AI平台、搜索引擎、本地GEO定位、竞品声量、官网合规五大维度 |
| 自动化调度 | 支持常规(24h)/ 预警(6h)/ 紧急(1h)三级采集频率 |
| 智能基线校验 | 基于动态阈值、移动平均、统计模型的异常自动识别 |
| 标准化输出 | 生成结构化JSON数据包,字段与探针清单严格绑定,可对接下游告警与分析系统 |
| 全链路可溯源 | 每条数据均保留原始来源链接、采集时间戳、主体唯一标识 |
1.3 与其他GEO工具的区别
| 对比维度 | 本系统 | 传统GEO监测工具(如触有数据) |
|---|---|---|
| 定制化能力 | 高,可完全按探针清单字段定制 | 中,使用平台预设维度 |
| 数据私有化 | 支持本地化处理,敏感数据不外传 | 数据托管于SaaS平台 |
| 采集源灵活度 | 可自由配置AI平台、搜索引擎、本地渠道 | 通常仅限固定平台 |
| 输出格式 | 完全可控的JSON结构 | 仅限平台报告格式 |
二、系统架构总览
系统遵循分层解耦、逐级流转的设计原则,整体架构分为五层:

三、输入层(Input Layer)
3.1 输入文件清单
| 文件名 | 格式 | 必填 | 用途说明 |
|---|---|---|---|
probe_list.csv | CSV | ✅ | 探针主体清单,包含公司信息、地址、分类、渠道等,是采集的核心索引 |
keywords.md | Markdown | ✅ | 各品类及主体的核心关键词池,用于搜索排名采集 |
competitors.md | Markdown | ✅ | 各品类的竞品主体名单,用于声量份额比对 |
baseline_config.yaml | YAML | ✅ | 五大维度的基线参数配置(阈值、窗口期、权重等) |
sensitive_words.txt | TXT | ✅ | 敏感词库,用于官网及渠道内容的合规扫描 |
3.2 探针清单字段说明(probe_list.csv)
| 字段 | 说明 |
|---|---|
| 探针 ID | 唯一业务标识,格式 QZ-品类-序号 |
| 公司名称 | 服务商主体全称,与工商注册信息一致 |
| 统一社会信用代码 | 工商主体唯一标识,用于真实性校验 |
| 联系人 / 联系电话 | 商务对接负责人信息,用于异常联动 |
| 公司地址 | 泉州本地经营地址,用于GEO定位校验 |
| 核心业务 | 服务商主营范围,用于内容匹配 |
| 服务分类 | 固定为「消防劳保」/「GEO服务」 |
| 监测标签 | 多维度标签,用于任务精准筛选 |
| 官网 / 核心渠道 | 线上触点,用于内容采集和GEO定位 |
| 备注 | 服务商核心特征说明,用于策略定制 |
3.3 基线配置文件结构(baseline_config.yaml)
yaml
dimensions: brand_mention: # 品牌提及率 window_days: 30 upper_multiplier: 2.0 lower_multiplier: 1.5 keyword_rank: # 关键词排名 target_ranking: 10 drop_threshold: 20 volatility_window: 7 geo_match: # GEO定位匹配度 geo_match_threshold: 80 distance_tolerance_km: 5 competitor_share: # 竞品声量份额 share_shift_threshold: 5.0 share_abs_lower: 5.0 momentum_window: 14 content_compliance: # 内容合规性 critical_deduction: 20 compliance_pass_score: 60
四、采集层(Collector Layer)
4.1 采集架构
采集层采用并行多引擎设计,对五大维度分别调用不同采集通道,以提升效率并规避单一采集源失效风险。
4.2 五大维度采集方案
| 维度 | 采集方式 | 数据源 |
|---|---|---|
| 品牌提及率 | AI平台搜索 + 提及次数统计 | 抖音、小红书、百度、微信搜一搜、知乎 |
| 关键词排名 | REDFOX API批量搜索 + HTTP请求 | 百度搜索、微信搜一搜、小红书站内 |
| GEO定位匹配度 | 地址解析 + GEO编码 + 距离计算 | 地图API(高德/百度)、平台LBS标签 |
| 竞品声量份额 | 声量抓取 + 份额计算 | 同品牌提及率数据源,按竞品池拆分 |
| 内容合规性 | 官网爬取 + OCR(图片)+ 敏感词匹配 | 官网HTML、微信公众号文章、小红书笔记 |
4.3 采集通道说明
REDFOX API批量搜索
批量提交关键词到搜索引擎,获取自然搜索结果及广告位数据,适用于关键词排名维度的规模化采集。
HTTP请求采集
对目标官网、核心渠道页面发起HTTP GET请求,获取HTML全文内容,用于合规扫描与内容变更检测。
豆包 / Kimi / DeepSeek
调用国内主流AI大模型平台,输入品牌/服务关键词,采集模型回复中的品牌提及情况、提及上下文及情感倾向。
官网合规性扫描
对官网首页及核心落地页进行全量内容抓取,包括:
文本内容(标题、正文、产品描述、联系方式)
图片OCR文字识别(广告语、资质证书中的文字)
结构化数据提取(营业执照号、资质编号)
4.4 采集约束
采集范围严格限定在泉州本地GEO服务垂类
每次采集记录必须包含:原始数据源链接、采集时间戳、主体唯一标识(探针ID)
采集失败自动重试3次,仍失败则进入fail_list
不采集任何与GEO监测无关的隐私数据或非公开商业数据
五、校验层(Validator Layer)
5.1 校验流程
text
采集原始数据 → 读取对应维度基线参数 → 执行校验算法 → 输出正常/异常标记 → 附加异常原因
5.2 五大维度校验算法速览
5.2.1 品牌提及率
算法:基于历史30天数据的动态均值±标准差阈值判定
text
正常范围 = [max(0, avg - 1.5×std), avg + 2.0×std] 异常条件 = 当前值 < 下限 OR 当前值 > 上限
5.2.2 关键词排名
算法:绝对值警戒线 + 7日移动平均趋势判定
text
绝对值异常:当前排名 > 20位 趋势异常:当前排名 > 7日均值 × 1.3
5.2.3 GEO定位匹配度
算法:多级地址匹配(省/市/区三级赋权)+ 经纬度距离补偿
text
得分 = 省份匹配(30%) + 城市匹配(50%) + 区级匹配(20%) + 距离奖励(±10) 异常条件 = 得分 < 80分
5.2.4 竞品声量份额
算法:滚动14天窗口份额计算 + 环比变化判定
text
异常条件 = 当前份额 < 5% OR 份额环比变化 > ±5%
5.2.5 内容合规性
算法:敏感词匹配 + 分级扣分制
text
基础分100分,critical违规扣20分/项,warning违规扣5分/项 异常条件 = 存在critical违规 OR 总分 < 60分 OR warning项 > 3条
5.3 异常优先级映射
| 优先级 | 触发条件 | exception_mark输出 |
|---|---|---|
| P0 | 合规性出现critical违规 | "严重违规:{关键词}" |
| P1 | 同一维度连续3次异常 | "持续异常(第{N}次),建议人工复核" |
| P2 | 单维度异常 | "{维度名称}异常:{具体原因}" |
| P3 | 无异常 | "无异常" |
六、输出层(Output Layer)
6.1 输出格式
系统严格输出标准JSON格式,结构如下:
json
{
"task_id": "QZ-GEO-20260819-080001",
"execute_time": "2026-08-19 08:00:00",
"probe_total": 50,
"probe_success": 47,
"probe_fail": 3,
"data_packet": [
{
"probe_id": "QZ-消防劳保-001",
"company_name": "泉州XX消防设备有限公司",
"geo_dimension": "keyword_rank",
"raw_data": "第5位",
"data_source": "https://www.baidu.com/s?wd=泉州消防器材",
"collect_time": "2026-08-19 08:00:32",
"baseline_check_result": "正常",
"exception_mark": "无异常"
}
],
"fail_list": [
{
"probe_id": "QZ-GEO服务-003",
"fail_reason": "官网请求超时",
"retry_count": 3
}
]}6.2 输出文件落盘
| 文件 | 路径 | 说明 |
|---|---|---|
| 主结果文件 | ./output/{YYYYMMDD_HHMMSS}_result.json | 全量采集+校验结果 |
| 失败明细文件 | ./output/{YYYYMMDD_HHMMSS}_fail.json | 仅含失败探针明细 |
6.3 下游对接
输出的JSON数据包可直接对接:
告警系统(企业微信/飞书/邮件自动化通知)
BI看板(GEO健康度仪表盘)
策略生成模块(自动生成优化建议报告)
七、调度层(Scheduler Layer)
7.1 三级调度机制
| 频率等级 | 执行周期 | 触发方式 | 适用场景 |
|---|---|---|---|
| 常规(Normal) | 每24小时 | 定时自动 | 日常监测,基线数据采集 |
| 预警(Warning) | 每6小时 | 手动触发 | 某主体出现异常后,追加高频扫描 |
| 紧急(Emergency) | 每1小时 | 手动触发 | 严重违规或重大舆情事件时紧急追踪 |
7.2 调度状态管理
系统通过读取
./.task_frequency文件确定当前执行频率该文件内容为:
normal/warning/emergency预警及紧急模式下,仅对受影响的特定探针或品类执行高频采集,非全量
7.3 异常驱动的频率升级规则
text
某探针连续2次异常 → 建议手动切换为预警模式(6h) 某探针出现critical违规 → 建议手动切换为紧急模式(1h) 常规模式下连续7天无异常 → 保持常态
八、维护与演进建议
9.1 基线参数动态调整
建议每30天对基线参数进行一次复盘校准:
若某维度持续出现“假阳性”异常,适当放宽对应阈值
若某维度连续未检出任何异常但业务反馈有感知下降,应收紧阈值或增加采集源
9.2 敏感词库更新
建议关联国家市场监管总局违规公告API,每周自动增量更新
新增行业黑话或地方性用语需人工补充
9.3 采集源扩展路线
| 阶段 | 扩展内容 |
|---|---|
| V1.0(当前) | 百度、抖音、小红书、微信搜一搜、知乎、官网 |
| V1.5 | 新增:快手、B站、大众点评(本地生活) |
| V2.0 | 新增:AI对话模型(文心一言、通义千问)的定向Prompt注入测试 |

服务热线















