GPT-5.6 今天凌晨发布了。
OAI 现在也学上 Anthropic的起名形式了。三款模型,Sol、Terra、Luna——太阳、地球、月亮。
Sol 是旗舰,Terminal-Bench 上首次超过了 Claude Mythos 5。定价 1M 5美元(输入)/ 30美元(输出),比 Claude Fable 5(50)便宜一半。
听起来是个让人激动的 GPT 版本发布日。(之前我还想 5.6 发了我一定要充个 Pro 20狠狠感受一下)
但可惜咱们现在还用不了。目前只有“少数受邀可信伙伴”能碰这些模型。

太阳、地球、月亮
本次一共发布三款模型:
Sol(太阳):旗舰。复杂推理、长链条编程、网络安全。30 per 1M tokens。 Terra(地球):平衡型。性能约等于 GPT-5.5,价格减半(15)。OpenAI 给它定的角色是「企业日常主力」。 Luna(月亮):高速低成本,6。适合客服、分类、简单路由。 
ChatGPT新模型发布这种重磅新闻相信大家今天会在各种新闻媒体、公众号上都看到。顺着这条新闻,我以一个产品经理视角聊一些自己的观察和思考,不一定都对,但至少不是千篇一律的新闻稿。
这是OpenAI 第一次放弃了一个模型干所有事。以前是一个模型代号分出不同模式,现在改成三个独立的模型产品线。Sol 干 Sol 的活,Luna 干 Luna 的活,Terra 在中间兜底。
这看起来很美,各司其职,还能为用户省钱。
但你真敢在 Luna 上跑一个正经任务吗?
多产品线会存在用户感知偏差
我一直在用 GPT-5.5 的 XHigh 模式,不管多简单的任务。因为如果我用低配模型遇到问题,我无法判断是我提示词写得不好,还是模型本身不行?
我唯一的确定性就是直接拉满。(而且 Codex 自己会提示:对话途中切换模型可能会导致回答质量下降)
我要的只是一个结果,我当然希望这个结果必须是模型能做到最好的——否则我为什么要用?
而且对大多数用户(包括我)来说,用户是没法准确判断“我这个任务应该用哪个模型”。
遇到一个简单的任务,我会想:那用最高级的模型会不会有意外惊喜?
一个中等难度的任务,我会想:我到底应该直接拉满,还是用 5.4 凑合?
当选择太多、判断成本无法评估的时候,用户的最优策略就是选最好的。
所以 Sol/Terra/Luna 这套体系,表面上是「给你更多选择,用更经济的方案」,背后有另一面。

另一面:算力和能源在替你决定
模型分体系当然有好处:精细化管理、节约 token、提高效率,这些是摆在台面上的理由。
但我觉得更多层面是因为算力和能源有限,不得不这样做。
所以这种自由选择的模式也许不是「帮你省钱」,是「帮 AI 省钱」。Luna 存在的意义不是 Luna 有多好用,而是让那些本不该跑旗舰的请求不要跑旗舰。

Sol多了一个Ultra能力
三款模型里,Sol 独有一个能力叫 Ultra 模式。
“「模型可以自行通过子 Agent 加速复杂工作。」Sol 在推理时可以把自己分裂成并行子 Agent,自己当 team lead,分配任务、协调进度、合并结果。
OpenAI 自己公布的参数是在Terminal-Bench 2.1 (斯坦福推出、用来测评 AI 代理在真实 Linux 终端完成运维 、开发任务能力的评测基准)上,Ultra 模式 91.9%,Sol 标准 88.8%,GPT-5.5 只有 83.4%。

Gemini 现在只配坐小孩那桌了。
它把「编排能力」从外围代码(也就是你现在用的 LangChain、CrewAI 这些框架)拉进了 API 产品层。
模型工程是有一个发展历程的:
Prompt Engineer——过去我们要有特定的提示词工程来命令模型才会让模型输出结果有一个较好的预期效果。但现在模型很聪明,已经不需要精心构造的 prompt 来约束模型行为了,我现在命令模型已经不太局限于固定的段落和格式了,因为它已经能理解我说的话了,即便我说的很混乱。
Context Engineer——RAG 火的时候,怎么切 chunk 、怎么压缩都是门手艺。现在随着模型上下文从 4K 到 128K 到 1M+ 之后, 上下文管理越来越不重要。
Harness Engineer——也就是现在大家在做的事:怎么让模型用工具、怎么协调子 Agent。LangChain、CrewAI、LlamaIndex 这些框架吃的就是这碗饭。

能力强一分,工程少一寸
模型能力的边界每往前推一步,外围工程的功能性就会往后缩一寸。
这不意味着 LangChain、CrewAI、LlamaIndex 这类外围框架没用了。 更准确地说,通用 Agent 编排会被模型不断内化。
而外围工程会转向“约束模型能碰什么、怎么留痕、怎么接业务系统、怎么验收结果”。
应用这些外围工程的Agent 壳也会越来越薄,最终变成一个几乎透明的信道——你把目标丢给模型,模型自己规划、自己执行、自己返回结果。壳只做校验和包装。

也许未来的 AI 产品更加要注重有没有把模型能力、成本、安全做成一套可控可观测的产品机制,而不是产品本身接了哪个模型。
最后,我感觉多少有点憋屈的。
大模型厂商已经开始把“智能、成本、安全性”拆成产品层级卖给你了。
你以为你有用户自由,可以自由选择模型,其实你在被迫学习怎么管理算力。
以上就是今天的侦察。
如果对你有用,顺手点个赞 +「♥️」。
想第一时间收到前线情报,关注「硅基斥候S01」。我们,下次侦察见。

