摆摊AI 产品实战手册

AI 功能的质量、成本与兜底

把模型能力当作不稳定依赖,定义评测样本、预算边界和失败后的用户体验。

AI 功能在演示里成功一次很容易。稳定交付、控制成本、让用户敢采用结果,才是产品工作。

不要用"模型很强"代替质量标准。模型会更新,输入会变化,供应商也会限流。

这一章的核心是一句话:

把模型当成一个会变、会贵、会挂的第三方依赖。

三件事各自都要有应对:会变靠样本集,会贵靠成本核算,会挂靠降级方案。

先建一组真实样本

从目标用户场景中收集一小组有代表性的输入:

  • 常见的正常输入
  • 边界长度和不同格式
  • 信息缺失或互相矛盾的输入
  • 容易产生事实错误的输入
  • 不应接受的敏感或违规输入

每个样本写下"可接受结果"的判断规则,不必追求唯一标准答案。

十个真实样本比一百个想象出来的样本有用。 从用户实际发来的输入里挑,不要自己编。

样本集最大的价值出现在换提示词、换模型、换处理流程的时候。

没有样本集,你的判断只能是"我试了两个例子,感觉还行"。而模型更新之后,恰好是那些边界样本先坏——你不会立刻发现,会由用户发现。

先跑同一组样本再发布,这是唯一能低成本守住质量的做法。

分开看四类质量

  1. 任务完成度:是否交付了用户要的结果
  2. 事实与依据:关键结论能否追溯,是否虚构来源
  3. 稳定性:同类输入的结构和行为是否一致
  4. 可操作性:用户能否继续编辑、确认或采取下一步

只看语言是否流畅,会掩盖最危险的错误。 虚构的来源读起来往往比真实来源更通顺。

第二类是唯一能直接摧毁信任的一类。用户发现一个编造的引用之后,会怀疑之前所有的结果。

为每次结果算成本

一条 AI 请求的真实成本可能包括:

  • 输入与输出用量
  • 搜索、解析、向量化或图像处理
  • 失败重试和超时后的重复执行
  • 文件存储与带宽
  • 人工审核和客服

按"完成一次用户结果"核算,不按单个接口调用核算。

一个用户结果背后可能有五次模型调用、两次搜索和一次重试。只算一次调用的价格,会低估三到十倍。算法见成本与预算。

给每种套餐设置可解释的额度和异常用量保护。"可解释"的意思是用户能理解额度单位是什么,不是一串抽象数字。

设置花费上限,从第一天开始

这条要单独说,因为它是最容易出事的地方。

保护措施防的是什么
供应商侧的账户消费上限死循环调用烧穿预算
单用户的日额度一个人刷爆你的成本
单次请求的最大输入长度有人贴进一本书
未登录用户的严格限制被脚本批量调用

第一条必须在写第一行代码前就设好。 一个循环里的重试逻辑写错,能在一夜之间产生四位数的账单,这类事故在真实项目里并不罕见。

为失败设计状态

AI 服务失败时不要无限旋转,也不要只显示"发生错误"。至少区分:

  • 输入不符合要求
  • 服务繁忙,可以安全重试
  • 已扣额度但任务失败,需要恢复
  • 结果已生成一部分,可以继续或重新开始
  • 结果需要人工确认,不能当成确定事实

第三种最容易被忽略,也最伤用户。 扣了额度没拿到结果,用户会觉得被骗——即使那只是一次超时。

重试必须有唯一任务编号,避免重复扣费和并发生成多份结果。做法见技术方案里的幂等部分。

准备降级方案

第一版可以采用:

  • 降低输出长度或关闭非核心步骤
  • 切换备用模型或供应商
  • 将任务排队,稍后通知用户
  • 返回可编辑草稿,不承诺自动完成
  • 对高风险结果增加人工确认

降级目标不是保持所有功能,而是保护最核心的用户结果和交易信任。

排队这一条常常被低估。用户能接受"十分钟后邮件通知你",很难接受"转了三十秒然后失败"。

说清能力边界

对 AI 产品来说,承认限制通常比"全自动、百分百准确"更可信。

要在产品里明确写出来的:

  • 结果来自哪里,能否查看来源
  • 哪些结果需要人工复核
  • 用户的输入内容会不会发给第三方模型服务商
  • 数据保存多久,能否删除

第三条是合规要求,不是可选项。如果用户的文档内容会被发给模型服务商,这件事必须写在隐私说明里。做法见隐私与安全。

常见错误

用自己编的样本做评测。 从真实用户输入里挑。

换模型后不跑样本集就发布。 边界样本先坏,由用户发现。

只看语言流畅度。 虚构来源读起来更通顺。

按单次接口调用算成本。 一个用户结果背后有五次调用。

没设账户消费上限。 一个循环写错就是四位数账单。

扣了额度但任务失败后不返还。 用户会觉得被骗。

用户输入发给第三方模型商却没写在隐私说明里。 这是合规问题。

宣传"百分百准确"。 出一次错就没有信任了。

验收标准

  • 有至少 10 个从真实输入里挑出的样本,每个写了可接受标准
  • 换提示词、模型或流程前会先跑同一组样本
  • 单次用户结果的成本算过,包含重试和辅助步骤
  • 供应商侧的账户消费上限已经设好
  • 单用户额度、单次输入长度、未登录限制都有
  • 任务失败时额度会返还,或者有明确的补偿路径
  • 重试有唯一任务编号,不会重复扣费
  • 至少一种降级方案是可用的,不只是写在文档里
  • 数据是否发给第三方模型商,已经写进隐私说明

本章动作

准备至少 10 个真实样本,记录当前版本的质量判断、单次成本和失败表现。

以后更换提示词、模型或处理流程时,先跑同一组样本再发布。

下一步

  1. 成本与预算——把单次成本放进整体账里
  2. 定价——从成本倒推额度和套餐
  3. 隐私与安全——数据流向的对外说明

On this page