AI 入门
今天大多数 AI 产品都围绕"人和模型对话"来设计。象信押注的是另一件事:大规模自动化的主体将是机器与机器、AI 与软件之间的交互。在那样的世界里,机器接口比聊天界面重要得多。
我们希望 AI 具备软件的那些好品质:有结构、可靠、可观测、可测试、快、稳定、便宜。 这一页解释背后的想法。
做"生产系统",不做"全能神"
象信一号不打算什么都会。它为生产环境而设计:代码需要一个窄的判断,拿到之后可以检查、可以据此行动。
如果未来绝大多数 AI 调用都发生在程序之间,只有很少一部分直接面对人,那么设计目标就应该从"回答读起来舒服"转向"输出在软件里表现得可预测"。一段让人信服的文字,未必可靠到可以无人值守地执行。
预训练模型的三条后续路线
一个预训练好的语言模型,大致可以被引向三个方向:
| 路线 | 训练目标 | 擅长 | 代价 |
|---|---|---|---|
| 基于人类反馈的对齐 | 生成人们更喜欢的回答 | 聊天、写作、助手 | 可能讨好用户、自信地胡说 |
| 基于可验证奖励的推理训练 | 在数学、代码等可验证任务上答对 | 多步推理 | 慢、贵、输出长 |
| 以校准决策为目标(象信) | 在给定选项上给出与真实正确率相符的概率 | 快速、结构化、可路由的判断 | 不生成文字,不做长链推理 |
象信一号走的是第三条路:我们在预训练语言模型的基础上,用大量以校准为目标的决策数据进行训练,让模型直接输出决策与概率,而不是一段文字。
校准意味着什么
象信一号的输出约定是:
- 不生成文字;
- 返回决策和每个候选的概率;
- 概率越高,答案正确的可能性就应该越大。
所谓校准,就是概率说的话要算数。对一个校准良好的模型,在大量预测中:
- 被赋予概率
0.2的结果,大约 20% 的时候真的发生; - 被赋予概率
0.8的结果,大约 80% 的时候真的发生; - 被赋予概率
1.0的结果,应该几乎总是发生。
打个比方:天气预报说"降水概率 70%",如果历史上所有报 70% 的日子里,确实有七成下了雨,这个预报就是校准的。它并不保证今天一定下雨,但你可以放心地根据它决定要不要带伞。
校准是群体性质
校准描述的是"一批预测"的统计规律,不是对某一个答案的保证。一个 0.95 的答案仍然可能是错的,只是这样的错误应该很少。
校准让不确定性对软件变得有用:你的代码可以对 0.97 和 0.55 采取完全不同的行动。见 置信度。
怎样训练出校准的概率
直觉上,想让模型"说真话",就要让它在说假话时吃亏。统计学里有一类叫**严格恰当评分规则(strictly proper scoring rule)**的损失函数,例如对数损失(交叉熵)和 Brier 分数,它们有一个关键性质:只有当模型报告的概率等于它真实相信的概率时,期望损失才最小。 夸大或缩小都会被惩罚。
象信一号的训练直接以这类损失为目标:模型面对的是"给定状态和问题,在这些选项上分配概率",而不是"写出一段让人满意的回答"。训练完成后,我们还会在留出的验证数据上检查校准程度(例如期望校准误差 ECE),并做必要的温度缩放微调。
对比之下,以"人更喜欢哪个回答"为目标的训练,会奖励听起来笃定、讨人喜欢的文字,而不是诚实的不确定性。这对聊天助手来说没问题,但对需要自动执行的系统来说,一个会"自信地说错"的组件是危险的。
模式收窄的问题
以人类偏好为目标的训练还有一个副作用:模型会越来越偏爱某种特定风格的回答,其他可能的回答概率被压低,输出分布变窄。这在生成式模型里叫作"模式丢失",它的极端形式是生成对抗网络中著名的"模式坍塌"——生成器反复产出同一种能骗过判别器的样本。
对需要读取概率分布的应用来说,这意味着模型给出的概率不再反映真实的不确定性。象信一号的训练目标直接作用在选项的概率上,就是为了避免这个问题。
概率与置信度
象信的答案里有两类数字,别混淆:
- 概率(probabilities):每个选项或档位各自的概率,加起来等于 1。Noul 的
noul就是"成立"这一边的概率。 - 置信度(confidence):Choice 和 Score 答案上的一个汇总值,描述概率分布有多"尖"。分布集中在一个选项上,置信度高;分布摊开,置信度低。
计算方式是公开的:Choice 的置信度为 (n·peak − 1)/(n − 1)(n 为选项数,peak 为最高概率),Score 的置信度为最高档位的概率。你也完全可以基于 probabilities 自定义其他不确定性指标。详见 置信度。
小结
- 聊天模型为"人读"优化,象信一号为"程序用"优化。
- 象信一号只在你给的选项上分配概率,以校准为训练目标。
- 校准让你的代码可以根据不确定性决定是执行、复核还是升级。
- 它不做长链推理、不生成文字;需要这些时,把象信和生成式模型组合使用(见 意图路由)。

