是的,GPT 5.6 版本提供的选项可能确实太多了。

不过,从推理模型的角度来看,我觉得这些选择如何映射到训练时间和推理时间扩展上很有意思。如果我们粗略地将这些选项对应到经典的 o1 图表上,Sol、Terra 和 Luna 代表三种模型规模和训练预算,位于训练计算轴;而努力程度设置则位于推理时间计算轴上。

注释对比图:将 GPT 5.6 模型选择映射到训练计算扩展,努力程度映射到推理时间扩展

图 1. 从 OpenAI 经典的 o1 扩展图到 GPT 5.6 选项的粗略映射。三种模型选项代表不同的模型规模和训练预算,而努力程度设置代表推理时间计算量。

完整列表包含三种模型选择和六个推理努力程度级别(轻、中、高、特高、最高和极致)。再加上工作模式与 Codex 模式、标准模式与快速模式,完整的配置矩阵变为:

工作模式/Codex 模式 × Sol/Terra/Luna × 轻/中/高/特高/最高/极致 × 标准/快速

这样算下来,我们有 2 × 3 × 6 × 2 = 72 种可能的配置。

那么,现在什么才是好的默认设置呢?Luna 配上高努力程度?Sol 配上轻努力程度?还是 Terra 配上中努力程度?

当然,性能与成本的对比图可以帮助我们找到性价比高的组合。例如,Luna 配上特高努力程度可能比 Sol 配上中努力程度更好且更便宜。

GPT 5.6 及对比模型的人工分析编码代理指数得分与 API 成本对比图

图 2. 人工分析编码代理指数 v1.1 得分与 API 成本对比图,涵盖 GPT 5.6 及多个对比模型。图表基于 OpenAI 在 X 上发布的 GPT 5.6 版本公告

但没错,72 种可能的配置确实让我们面临太多选择 🤯。