为什么你的 AI 应用总是"差不多对"?聊聊置信度校准
上线一个 AI 功能时,最常见的坑不是模型不聪明,而是它明明 80% 的情况靠谱,你却不知道剩下 20% 什么时候会翻车。今天讲一个被低估的工程概念:置信度校准(calibration)。

为什么你的 AI 应用总是"差不多对"?聊聊置信度校准
上线一个 AI 功能时,最常见的坑不是模型不聪明,而是它明明 80% 的情况靠谱,你却不知道剩下 20% 什么时候会翻车。今天讲一个被低估的工程概念:置信度校准(calibration)。
模型说的"把握很大",到底有多大
大语言模型生成的文字本身不带概率标签,但你可以通过几条路径拿到可信度信号:
1. **logprobs**:让模型返回每个 token 的对数概率。答案一致性高时,关键 token 的概率分布往往集中。
2. **self-consistency**:同一个问题问 5 次,答案一致率本身就是信号。三次以上一致,才值得展示给用户;意见分裂,就该走人工兜底。
3. **验证器交叉检查**:用另一个更便宜的模型,或者规则引擎(数值范围、正则、知识库匹配)去复核主模型的输出。
以一个工单分类功能为例。模型给每张工单打一个类别加自评分。上线后你不需要只看准确率,而是画一张图:横轴是模型说的置信度区间(比如 0.8-0.9),纵轴是该区间里的实际正确率。理想情况是两条线重合——说 0.85 的,就真的对 85%。如果模型在 0.8 区间实际只对 60%,说明它过度自信,你在它最"自信"的地方栽的跟头最多。
三个能直接上手的做法
**第一,设置信度阈值,而不是全局信任。** 阈值 0.8 以上直接入库,0.5-0.8 进人工审核队列,0.5 以下打回重跑或拒答。阈值不用拍脑袋:拿 200 条历史标注数据,把阈值从 0.5 到 0.95 扫一遍,画出"自动化比例 vs 错误率"曲线,选业务能接受的那个拐点。
**第二,高置信也要抽检。** 每周从自动通过的样本里随机抽 3%,人工复核。这一步专门捕捉"系统性自信的错误"——某类新出现的工单让模型全给了 0.9,抽检能在一周内发现,等客诉爆发再发现就晚了。
**第三,把校准数据留档。** 每次评估记三样:模型版本、置信度、最终对错。攒够几千条,你就有了自己的校准曲线,换模型、改 prompt、调温度时,一眼能看出这次改动让模型变得更诚实还是更膨胀。
什么时候该放弃校准,直接换方案
如果某类任务的错误成本极高(医疗判断、资金操作),置信度阈值只是止血带,不是根治。这时正确的做法是收窄任务边界:不追求一个模型覆盖所有场景,而是用规则先分诊,模型只处理其中 60% 能稳定做好的部分,其余明确转人工。承认模型的边界,比调参让"85% 变 88%"回报大得多。
一个具体的落地清单
如果你下周就想动手,按这个顺序做:
1. **先埋点,再优化。** 在生产日志里记下每次请求的模型输出和对应的置信度信号(一致率或验证器结果)。没有这层数据,后面所有调参都是猜。
2. **攒 200 条标注。** 让业务方按"对/错"给最近两周的线上样本打标,成本大约半天。
3. **画第一张校准图。** 分成 10 个置信度桶,各算实际正确率,肉眼就能看出模型是过度自信(曲线偏右)还是过度保守(偏左)。
4. **设阈值、开抽检。** 按业务错误预算定阈值,抽检 3% 进审核队列,周报里只看两个数:自动通过率、抽检错误率。
整套流程不需要 ML 平台,一张表格加几个脚本就够。校准的价值不在算法,在于它把"模型靠不靠谱"从感觉变成了每周能复查的指标。愿意花这一周时间的团队,AI 功能才能从 demo 走向生产。
留言区
欢迎分享你的想法!
加载留言中…