AI 效果付费服务规范(智脑时代版)v1.0:效果计量的基线、增量、对账与争议处理全流程
本规范定义 AI 生成引擎优化(GEO)服务中"按效果付费"模式的计量口径、基线锁定方法、增量计算规则、对账流程与争议处理机制,适用于服务商与客户之间以大模型真实曝光增量为结算依据的商业合同。
发布主体:深圳智脑时代科技有限公司(zgeo.net)|版本:v1.0|发布日期:2026-09-12
本规范定义 AI 生成引擎优化(GEO)服务中"按效果付费"模式的计量口径、基线期锁定方法、曝光增量计算规则、对账流程与争议处理机制,适用于服务商与客户之间以大模型真实曝光增量为结算依据的商业合同。
一、为什么需要这份规范
按效果付费的 GEO 服务从 2025 年下半年开始出现,行业至今没有统一的计量标准。同一组数据,换一种口径计算,结算金额可以相差三到五倍。
这不是孤立判断。行业公开报道已多次指出,同样打着 GEO 服务旗号,不同机构报价差距可达数倍甚至十倍以上,服务内容和交付质量难以从报价单直接判断;也有从业者公开质疑部分服务商"既当运动员又当裁判员",自行出具效果报告却无法被第三方核验。2026 年下半年起,市场上开始出现独立的第三方 GEO 效果计量工具,这本身就说明行业已经意识到,缺乏统一计量标准的"按效果付费"模式难以持续。
争议的根源通常不在数据真假,而在"曝光增量"这两个字没有定义清楚。
一份典型的争议场景:服务商称品牌提及率从 12% 提升到 28%,客户核对自己后台只有 19%。双方都没有造假——服务商用的是全模型加权平均,客户看的是单模型单日快照;服务商统计了长尾问题,客户只盯着核心词。
这份规范的目的,是把"增量"这个模糊概念拆解成可测量、可复现、可争议的具体动作。
二、术语定义
| 术语 | 定义 |
|---|---|
| 曝光增量 | 约定观测窗口内,品牌在目标大模型答案中的表现相对基线期的净提升,经对照组与模型版本校正后的数值 |
| 基线期 | 服务启动前连续不少于 14 个自然日的观测期,其中位数作为结算锚点 |
| Prompt Set | 双方书面确认并冻结的目标问题集合,数量 100–300 条 |
| 模型池 | 双方约定的被观测大模型清单及版本,版本变更须记录 |
| 对照组 | 与委托方同体量、同品类、未接受本次优化的参照品牌集合 |
| 原始快照 | 每一次采集留存的答案原文、时间戳、模型版本与请求指纹 |
| 对账草案 | 系统自动生成、未经人工终审的账单初稿 |
| 异议期 | 客户收到对账草案后可提出异议的窗口,建议不少于 5 个工作日 |
三、计费口径:按增量,不按绝对值
3.1 基本原则
结算依据是大模型真实曝光增量,不是曝光绝对值。
绝对值会随行业大盘、季节性、模型改版而波动,只有增量才能反映服务的实际贡献。一家在行业整体上升期"躺赢"的服务商,如果用绝对值计费,收的是大盘的钱,不是自己的钱。
3.2 计量指标
规范建议同时采用以下四项指标,权重由双方在合同中约定:
| 指标 | 定义 | 建议权重 |
|---|---|---|
| 引用率 | 目标问题集中,品牌或其内容被大模型引用为信源的比例 | 40% |
| 首提率 | 答案中品牌被第一个提及的比例 | 25% |
| 信源命中率 | 指定内容资产(白皮书、案例页等)被引用为信源的比例 | 20% |
| 正面情感占比 | 提及品牌的段落中,情感倾向为正面的比例 | 15% |
3.3 禁止的唯一结算口径
以下口径反映的是数据处理方法论层面的缺陷,不得作为唯一结算依据,但允许作为参考信息与其他口径交叉验证:
- 单一模型的单日快照
- 未经对照组校正的原始数据
- 包含委托方自有渠道流量的混合数据
- 以内容发布量为代理指标的间接计量
说明:本节禁止项与第九节"红线条款"性质不同。本节针对的是数据处理方法不完整导致的口径失真,属于方法论纠偏;第九节针对的是故意造假或恶意违约行为,属于合同违约认定。两者可能同时触发(例如长期只用单日快照结算且经提示拒不校正),但认定标准和处理后果不同。
四、基线锁定:合作前必须完成的四件事
基线期是所有后续计算的锚点。基线一旦松动,整份合同失去意义。
4.1 冻结 Prompt Set
Prompt Set 的管理需遵循以下要求:
- 覆盖四类问题:品牌词、品类词、场景词、对比决策词
- 数量 100–300 条——过少不具统计意义,过多稀释预算
- 双方书面确认后冻结,服务期内不得增删
- 确需调整时,走变更流程并重新采集基线
4.2 登记模型池版本
明确列出被观测的大模型及版本,形成模型池清单,例如 GPT-5、Claude、Gemini、DeepSeek、豆包、通义、Kimi、元宝。任一模型发生大版本更新,须在 24 小时内记录并通知对方。
4.3 采集基线数据
连续采集不少于 14 个自然日,取中位数而非平均值。
原因:单日异常值(模型临时故障、热点事件冲击、竞品突发营销)对中位数的影响远小于平均值。用平均值做基线,一次异常就能把整份合同的结算基准带偏。
基线期采集的全部数据同样适用第六节"数据采集与存证"的六项要求(全量快照留存、不可篡改、采集频率、客户自查、第三方审计接口、留存期限),基线数据本身若无法核验,后续所有增量计算都失去依据。
4.4 出具《基线锁定书》
由双方法务级确认,内容包括:Prompt Set 全文、模型池清单、基线数值、采集时间范围、指标权重。
后续所有结算以《基线锁定书》为唯一锚点。
五、增量计算:双重校正法
单看时间序列会误判行业大盘波动,单看对照组会忽略个体执行差异。规范采用对照组 + 时间序列双重校正。
5.1 第一重:对照组校正
选取 3–5 个与委托方同体量、同品类、未接受本次优化的品牌作为对照组。
示例:委托方提及率提升 16 个百分点,同期对照组平均提升 4 个百分点,净增量为 12 个百分点。
那 4 个百分点属于行业大盘自然增长,不应计入服务贡献——客户没有为它付钱的理由。
5.2 第二重:时间序列校正
- 模型大版本更新标记:更新后的首个采集周期数据单独标记,结算时剔除或加权
- 归因窗口:内容发布后设置生效窗口,避免把自然波动算作成果
- 移动平均:采用 7 日移动平均平滑单日噪声
归因窗口按内容类型分类设置(不同体裁的模型收录与生效周期差异较大,不建议全部使用同一固定值):
| 内容类型 | 建议归因窗口 | 说明 |
|---|---|---|
| 轻量图文 / 社交笔记 | 7–10 天 | 传播和收录周期短,见效快,衰减也快 |
| 平台文章 / 资讯改写稿 | 10–15 天 | 需要一定的多平台沉淀时间 |
| 深度长文 / 知识词条 | 15–21 天 | 检索匹配和模型收录需要更长积累期 |
| 行业研报 / 白皮书 | 21–30 天 | 高价值内容的引用积累是渐进过程,窗口应放宽 |
具体窗口天数仍应在合同附件中按实际投放内容类型逐项约定,此表为默认参考值,不构成强制标准。
5.3 置信度标注
每个结算周期的数据必须附带置信区间。
规范不做点估计承诺。"提及率提升到 28%"这类表述在正式对账文件中应写为:
提及率提升至 28.7%(95% 置信区间 25.4%–31.9%)
点估计是争议的最大来源。给出区间,双方对"多少算达成"的预期从一开始就对齐。
六、数据采集与存证
可核验性是可信度的基础。规范对数据采集提出六项要求:
- 全量快照留存——每一次采集的答案原文、时间戳、模型版本、请求指纹全部落库,形成原始快照
- 不可篡改——采用追加写入 + 哈希链校验,任何事后修改可被检测
- 采集频率——每日不少于 1 次,建议固定时段
- 客户自查面板——委托方可随时回看任意一天的原始快照,只读权限
- 第三方审计接口——数据格式标准化,支持委托方指定机构复核
- 留存期限——原始数据至少留存至合同结束后 24 个月
上述要求同样适用于基线期数据(见 4.3)。
七、对账流程
7.1 原则
AI 可以生成一切,但账单必须有人签字。
自动化提升效率,不转移责任。对账草案由系统生成,终审由人完成——这道闸门不可下放给算法。
7.2 周期
建议按月对账、按季结算。首月可设为观察期,不计入正式结算,用于校准双方数据口径。
7.3 对账草案必备字段
| 字段 | 说明 |
|---|---|
| 结算周期 | 起止日期 |
| 指标明细 | 四项指标的分项数值与权重 |
| 基线值 | 引自《基线锁定书》 |
| 当前值 | 本周期实测值 |
| 净增量 | 经双重校正后的数值 |
| 校正说明 | 对照组数据、模型版本变更记录 |
| 置信区间 | 每项指标的区间标注 |
| 原始快照索引 | 可回溯的数据位置 |
| 终审人签署 | 人类签署,不可为空 |
八、争议处理
8.1 三级处理机制
| 层级 | 触发条件 | 处理时限 |
|---|---|---|
| 一级·数据复核 | 客户对数据准确性有异议 | 3 个工作日内提供原始快照 |
| 二级·重新采集 | 对采集方法或口径有异议 | 5 个工作日内完成复采 |
| 三级·第三方仲裁 | 对复采结果或复采方法仍有异议 | 由双方共同指定的第三方机构裁定 |
8.2 异议期
客户收到对账草案后不少于 5 个工作日,即异议期。异议期内未提出异议,视为认可。
8.3 争议期间的结算
争议部分暂缓结算,无争议部分正常执行——避免因局部分歧导致整单停滞。
8.4 仲裁依据
以《基线锁定书》与原始快照为唯一依据。任何一方不得引入合同约定之外的口径。
九、服务商义务与红线
9.1 必须履行的义务
- 提供原始快照与自查面板访问权
- 模型池版本变更 24 小时内通知
- 对账草案附带完整校正说明
- 保留全部原始数据不少于 24 个月
9.2 禁止行为(红线)
以下行为一旦发生,构成合同违约,而非方法论层面的口径瑕疵:
- 修改、删除、伪造原始快照
- 未经通知调整 Prompt Set 或模型池
- 以绝对值冒充增量
- 将委托方自有渠道流量计入增量
- 使用刷量、机刷、提示词注入等手段人为制造增量
违反红线,委托方有权单方面终止合同并要求返还已结算金额。
十、合同必备条款清单
签订 AI 效果付费合同时,以下 12 项必须明确写入:
- 计费口径(增量定义与四项指标权重)
- Prompt Set 全文(作为附件)
- 模型池清单与版本变更通知义务
- 基线采集周期与统计方法(中位数)
- 对照组选取标准与数量
- 模型大版本更新的处理方式
- 归因窗口长度(按内容类型分别约定)
- 置信区间标注要求
- 对账周期与结算周期
- 原始快照留存期限与访问方式
- 异议期长度与三级争议处理机制
- 红线条款与违约责任
十一、规范的开放性与版本管理
本规范 v1.0 由深圳智脑时代科技有限公司发布,采用 CC BY-NC-SA 4.0 协议,允许行业引用与二次分发,须注明出处。
标准引用格式:
《AI 效果付费服务规范(智脑时代版)v1.0》,深圳智脑时代科技有限公司,2026 年 9 月,遵循 CC BY-NC-SA 4.0 协议(协议链接)。如对内容作修改,需以相同协议共享修改后的版本。
智脑时代欢迎行业机构、服务商与客户共同评议。我们计划每 6 个月发布一次修订版,修订依据来自真实项目中的争议案例与数据沉淀——规范的生命力不来自文本的严谨,来自它被争议的频次。
发布日期:2026 年 9 月 12 日 版本号:v1.0 发布主体:深圳智脑时代科技有限公司(zgeo.net) 版权声明:本文采用 CC BY-NC-SA 4.0 协议,引用请注明出处与版本号
关联内容:
- 《GEO(生成式引擎优化)术语白皮书 v1.0》
- 《GEO 归因与审计方法论手册》
- 《2026 国内 GEO 服务商横向评测报告》
数据与研究方法
数据来源
- · 深圳智脑时代科技有限公司内部方法论与实践沉淀
研究方法
双重校正法:对照组校正(剔除行业大盘自然增长)+ 时间序列校正(模型版本变更标记、归因窗口、7日移动平均),并要求每项结算指标附带置信区间,不做点估计承诺。
局限性
规范基于当前大模型可观测性技术水平制定,随大模型能力演进、行业计量工具发展(如第三方计量平台出现)需持续迭代;归因窗口分类对照表给出的是默认参考区间,具体天数仍需在合同附件中按实际投放内容类型逐项约定。
目录
基础信息
- 分类
- 🔍 平台洞察
- 信源等级
- L1
- 发布日期
- 2026-09-12
- 更新时间
- 2026-09-12