AI 功能的质量、成本与兜底
把模型能力当作不稳定依赖,定义评测样本、预算边界和失败后的用户体验。
AI 功能在演示里成功一次很容易。稳定交付、控制成本、让用户敢采用结果,才是产品工作。
不要用"模型很强"代替质量标准。模型会更新,输入会变化,供应商也会限流。
这一章的核心是一句话:
把模型当成一个会变、会贵、会挂的第三方依赖。
三件事各自都要有应对:会变靠样本集,会贵靠成本核算,会挂靠降级方案。
先建一组真实样本
从目标用户场景中收集一小组有代表性的输入:
- 常见的正常输入
- 边界长度和不同格式
- 信息缺失或互相矛盾的输入
- 容易产生事实错误的输入
- 不应接受的敏感或违规输入
每个样本写下"可接受结果"的判断规则,不必追求唯一标准答案。
十个真实样本比一百个想象出来的样本有用。 从用户实际发来的输入里挑,不要自己编。
样本集最大的价值出现在换提示词、换模型、换处理流程的时候。
没有样本集,你的判断只能是"我试了两个例子,感觉还行"。而模型更新之后,恰好是那些边界样本先坏——你不会立刻发现,会由用户发现。
先跑同一组样本再发布,这是唯一能低成本守住质量的做法。
分开看四类质量
- 任务完成度:是否交付了用户要的结果
- 事实与依据:关键结论能否追溯,是否虚构来源
- 稳定性:同类输入的结构和行为是否一致
- 可操作性:用户能否继续编辑、确认或采取下一步
只看语言是否流畅,会掩盖最危险的错误。 虚构的来源读起来往往比真实来源更通顺。
第二类是唯一能直接摧毁信任的一类。用户发现一个编造的引用之后,会怀疑之前所有的结果。
为每次结果算成本
一条 AI 请求的真实成本可能包括:
- 输入与输出用量
- 搜索、解析、向量化或图像处理
- 失败重试和超时后的重复执行
- 文件存储与带宽
- 人工审核和客服
按"完成一次用户结果"核算,不按单个接口调用核算。
一个用户结果背后可能有五次模型调用、两次搜索和一次重试。只算一次调用的价格,会低估三到十倍。算法见成本与预算。
给每种套餐设置可解释的额度和异常用量保护。"可解释"的意思是用户能理解额度单位是什么,不是一串抽象数字。
设置花费上限,从第一天开始
这条要单独说,因为它是最容易出事的地方。
| 保护措施 | 防的是什么 |
|---|---|
| 供应商侧的账户消费上限 | 死循环调用烧穿预算 |
| 单用户的日额度 | 一个人刷爆你的成本 |
| 单次请求的最大输入长度 | 有人贴进一本书 |
| 未登录用户的严格限制 | 被脚本批量调用 |
第一条必须在写第一行代码前就设好。 一个循环里的重试逻辑写错,能在一夜之间产生四位数的账单,这类事故在真实项目里并不罕见。
为失败设计状态
AI 服务失败时不要无限旋转,也不要只显示"发生错误"。至少区分:
- 输入不符合要求
- 服务繁忙,可以安全重试
- 已扣额度但任务失败,需要恢复
- 结果已生成一部分,可以继续或重新开始
- 结果需要人工确认,不能当成确定事实
第三种最容易被忽略,也最伤用户。 扣了额度没拿到结果,用户会觉得被骗——即使那只是一次超时。
重试必须有唯一任务编号,避免重复扣费和并发生成多份结果。做法见技术方案里的幂等部分。
准备降级方案
第一版可以采用:
- 降低输出长度或关闭非核心步骤
- 切换备用模型或供应商
- 将任务排队,稍后通知用户
- 返回可编辑草稿,不承诺自动完成
- 对高风险结果增加人工确认
降级目标不是保持所有功能,而是保护最核心的用户结果和交易信任。
排队这一条常常被低估。用户能接受"十分钟后邮件通知你",很难接受"转了三十秒然后失败"。
说清能力边界
对 AI 产品来说,承认限制通常比"全自动、百分百准确"更可信。
要在产品里明确写出来的:
- 结果来自哪里,能否查看来源
- 哪些结果需要人工复核
- 用户的输入内容会不会发给第三方模型服务商
- 数据保存多久,能否删除
第三条是合规要求,不是可选项。如果用户的文档内容会被发给模型服务商,这件事必须写在隐私说明里。做法见隐私与安全。
常见错误
用自己编的样本做评测。 从真实用户输入里挑。
换模型后不跑样本集就发布。 边界样本先坏,由用户发现。
只看语言流畅度。 虚构来源读起来更通顺。
按单次接口调用算成本。 一个用户结果背后有五次调用。
没设账户消费上限。 一个循环写错就是四位数账单。
扣了额度但任务失败后不返还。 用户会觉得被骗。
用户输入发给第三方模型商却没写在隐私说明里。 这是合规问题。
宣传"百分百准确"。 出一次错就没有信任了。
验收标准
- 有至少 10 个从真实输入里挑出的样本,每个写了可接受标准
- 换提示词、模型或流程前会先跑同一组样本
- 单次用户结果的成本算过,包含重试和辅助步骤
- 供应商侧的账户消费上限已经设好
- 单用户额度、单次输入长度、未登录限制都有
- 任务失败时额度会返还,或者有明确的补偿路径
- 重试有唯一任务编号,不会重复扣费
- 至少一种降级方案是可用的,不只是写在文档里
- 数据是否发给第三方模型商,已经写进隐私说明
本章动作
准备至少 10 个真实样本,记录当前版本的质量判断、单次成本和失败表现。
以后更换提示词、模型或处理流程时,先跑同一组样本再发布。